arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-24 至 2026-04-24 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 9 篇

2603.12845 2026-04-24 cs.CV 83%

Multimodal Protein Language Models for Enzyme Kinetic Parameters: From Substrate Recognition to Conformational Adaptation

多模态蛋白质语言模型用于酶动力学参数:从底物识别到构象适应

Fei Wang, Xinye Zheng, Kun Li, Yanyan Wei, Yuxin Liu, Ganpeng Hu, Tong Bao, Jingwen Yang

机构 * School of Computer Science and Information Engineering(计算机科学与信息工程学院) Institute of Artificial Intelligence(人工智能研究院) CVLab, College of Information Technology(CV实验室,信息学院) Intelligent Interconnected Systems Laboratory of Anhui Province(安徽省智能互联系统实验室) School of Food Biological Engineering(食品生物工程学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出多阶段多模态条件建模方法,通过ERBA模块在蛋白质语言模型中注入跨模态信息,提升酶动力学参数预测的准确性与生物合理性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21697 2026-04-24 cs.CR cs.AI cs.MM 81%

Structured Visual Narratives Undermine Safety Alignment in Multimodal Large Language Models

结构化视觉叙事削弱多模态大语言模型的安全对齐

Rui Yang Tan, Yujia Hu, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design(新加坡技术与设计大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI、cs.MM

AI总结 研究发现结构化视觉叙事在多模态大语言模型中导致安全对齐问题,通过漫画模板劫持攻击展示其危害,揭示现有防御方法在处理非有害敏感内容时的不可靠性。

Comments Code released at: https://github.com/Social-AI-Studio/ComicJailbreak

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21585 2026-04-24 eess.SP 78%

Scalable Multimodal Beam Alignment in V2X: An Anti-Imbalance Graph Learning Approach

面向V2X的可扩展多模态波束对齐:一种反不平衡图学习方法

Jiahui Liang, Shuoyao Wang, Shijian Gao

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出一种分布式多模态图波束对齐框架,利用车载多模态传感数据预测隐式反馈,并通过图神经网络协调多用户对齐,提升可扩展性并减少开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07961 2026-04-24 cs.CV 77%

SGG-R$^{\rm 3}$: From Next-Token Prediction to End-to-End Unbiased Scene Graph Generation

SGG-R$^{\rm 3}$: 从单token预测到端到端无偏场景图生成

Jiaye Feng, Qixiang Yin, Yuankun Liu, Tong Mo, Weiping Li

机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) Zhongguancun Academy(中关村学院)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出SGG-R$^{\rm 3}$框架,通过结合任务特定的推理过程和强化学习优化,解决场景图生成中的关系稀疏和长尾问题,提升生成效果和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21573 2026-04-24 cs.CV q-bio.QM 74%

CHRep: Cross-modal Histology Representation and Post-hoc Calibration for Spatial Gene Expression Prediction

CHRep: 跨模态组织切片表示与事后校准用于空间基因表达预测

Changfan Wang, Xinran Wang, Donghai Liu, Fei Su, Lulu Sun, Zhicheng Zhao, Zhu Meng

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Key Laboratory of Network System and Network Culture(北京网络系统与网络文化重点实验室) Peking University Third Hospital(北京大学第三医院)

专题命中 多模态训练与对齐 :cross-modal(title);分类 cs.CV

AI总结 CHRep通过两阶段框架提升组织切片到基因表达的预测鲁棒性,结合结构感知表示学习与事后校准,提升滑片级变化下的稳定性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20769 2026-04-24 cs.CV 70%

Information Bottleneck-Guided Heterogeneous Graph Learning for Interpretable Neurodevelopmental Disorder Diagnosis

信息瓶颈引导的异构图学习用于可解释性神经发育障碍诊断

Yueyang Li, Lei Chen, Wenhao Dong, Shengyu Gong, Zijian Kang, Boyang Wei, Weiming Zeng, Hongjie Yan, Lingbin Bian, Zhiguo Zhang, Wai Ting Siok, Nizhuan Wang

机构 * Department of Language Science and Technology, The Hong Kong Polytechnic University(香港理工大学语言科学与技术系) Laboratory of Digital Image and Intelligent Computation, Shanghai Maritime University(上海 Maritime 大学数字图像与智能计算实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出I2B-HGNN框架,结合信息瓶颈原理指导脑连接建模与跨模态特征融合,实现高分类准确率和可解释性生物标志物识别。

Journal ref Neurocomputing, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21160 2026-04-24 cs.CV 57%

Reinforcing 3D Understanding in Point-VLMs via Geometric Reward Credit Assignment

通过几何奖励信用分配强化点-视觉-语言模型的3D理解

Jingkun Chen, Ruoshi Xu, Mingqi Gao, Shengda Luo, Jungong Han

机构 * Northwestern Polytechnical University(西北工业大学) Southern University of Science and Technology(南方科技大学) The University of Sheffield(谢菲尔德大学) Hengqin Laboratory(横琴实验室) Tsinghua University(清华大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出几何奖励信用分配框架,通过分离整体监督信号并定向反馈,提升点-视觉-语言模型的3D结构对齐能力,同时引入重投影一致性项约束物理可行性,从而提升3D KPA和重投影一致性评分。

Comments 10 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03476 2026-04-24 cs.CV 57%

Anatomy-Aware Text-Visual Fusion with Dual-Perspective Prompts for Fine-Grained Lumbar Spine Segmentation

具有双视角提示的解剖感知文本-视觉融合用于细粒度腰椎分割

Sheng Lian, Jianlong Cai, Dengfeng Pan, Guang-Yong Chen, Hao Xu, Fan Zhang, Guodong Fan, Shuo Li

机构 * College of Computer and Data Science(计算机与数据科学学院) Shandong Technology and Business University(山东科技商务大学) Engineering Research Center of Big Data Intelligence (Fuzhou University)(大数据智能工程研究中心(福州大学)) The Chinese University of Hong Kong(香港中文大学) Case Western Reserve University(凯斯西储大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出ATM-Net框架,通过解剖感知文本引导的多模态融合机制,提升腰椎细粒度分割精度,实验表明其在MRSpineSeg和SPIDER数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21056 2026-04-24 physics.med-ph 50%

Radiomics-Guided Vision Transformers for Survival Analysis

基于放射组学的视觉变换器用于生存分析

Qiyuan Shi, Yi Li

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出一种结合放射组学与视觉变换器的模型,通过多模态Cox框架和对比对齐提升生存分析的预测性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏