arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-27 至 2026-03-27 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 8 篇

2603.25720 2026-03-27 cs.AI cs.CV 84%

R-C2: Cycle-Consistent Reinforcement Learning Improves Multimodal Reasoning

R-C2:循环一致性强化学习提升多模态推理

Zirui Zhang, Haoyu Dong, Kexin Pei, Chengzhi Mao

机构 * Rutgers University(罗格斯大学) Columbia University(哥伦比亚大学) University of Chicago(芝加哥大学)

专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 R-C2通过循环一致性强化学习解决多模态推理中的内部冲突,提升推理准确率7.6个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25203 2026-03-27 cs.CV cs.CL 81%

Probabilistic Concept Graph Reasoning for Multimodal Misinformation Detection

基于概率概念图推理的多模态虚假信息检测

Ruichao Yang, Wei Gao, Xiaobin Zhu, Jing Ma, Hongzhan Lin, Ziyang Luo, Bo-Wen Zhang, Xu-Cheng Yin

机构 * University of Science and Technology Beijing(北京科技大学) Singapore Management University(新加坡管理大学) Hong Kong Baptist University(香港浸会大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出PCGR框架,通过构建概念图进行多模态虚假信息检测,实现可解释且可进化的方法,提升检测准确性和抗新兴操纵能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06663 2026-03-27 cs.CV cs.AI 81%

Graph-of-Mark: Promote Spatial Reasoning in Multimodal Language Models with Graph-Based Visual Prompting

图标记:通过基于图的视觉提示提升多模态语言模型的空间推理能力

Giacomo Frisoni, Lorenzo Molfetta, Mattia Buzzoni, Gianluca Moro

机构 * University of Bologna(博洛尼亚大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出Graph-of-Mark,一种基于图的视觉提示方法,通过在输入图像上叠加场景图来增强多模态语言模型的空间推理能力,实验表明其在视觉问答和定位任务中提升了11个百分点的准确率。

Comments Please cite the definitive, copyrighted, and peer-reviewed version of this article published in AAAI 2026, edited by Sven Koenig et al., AAAI Press, Vol. 40, No. 36, Technical Track, pp. 30726-30734, 2026. DOI: https://doi.org/10.1609/aaai.v40i36.40329

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25088 2026-03-27 cs.CV 79%

Visual Attention Drifts,but Anchors Hold:Mitigating Hallucination in Multimodal Large Language Models via Cross-Layer Visual Anchors

视觉注意力漂移,但锚点仍有效:通过跨层视觉锚点缓解多模态大语言模型的幻觉

Chengxu Yang, Jingling Yuan, Chuang Hu, Jiawei Jiang

机构 * School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出CLVA方法,通过跨层视觉锚点缓解多模态大语言模型的幻觉问题,强调中间层视觉锚点的重要性,无需额外训练,有效抑制深度层注意力漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10611 2026-03-27 physics.app-ph cs.SY eess.SY 78%

Demonstration of a planar multimodal periodic filter at THz frequencies

太赫兹频率下平面多模周期滤波器的演示

Ali Dehghanian, Mohsen Haghighat, Thomas Darcie, Levi Smith

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文提出一种基于共面带状线和有限地面共面波导的平面多模周期滤波器,用于太赫兹频率操作,通过灵活设计和主动控制实现滤波特性。

Comments 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02703 2026-03-27 cs.CV 57%

Structure Causal Models and LLMs Integration in Medical Visual Question Answering

结构因果模型与大语言模型在医学视觉问答中的整合

Zibo Xu, Qiang Li, Weizhi Nie, Weijie Wang, Anan Liu

机构 * School of Microelectronics, Tianjin University(天津大学微电子学院) School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院) Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系)

专题命中 其他多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种因果推理框架,通过消除图像与问题间的混杂效应,提升医学视觉问答的准确性,并引入因果图结构和多变量重采样方法以增强模型对复杂医疗数据的理解能力。

Comments Accepted by IEEE TMI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24785 2026-03-27 eess.SY cs.ET cs.SY 50%

Cyber-Physical System Design Space Exploration for Affordable Precision Agriculture

面向低成本精准农业的网络物理系统设计空间探索

Pawan Kumar, Hokeun Kim

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出一种考虑成本的设计空间探索框架,用于多模态无人机-越野车平台,通过整数线性规划和SAT验证,在预算、覆盖和载荷之间进行权衡,实现高效精准农业应用。

Comments 2026 Design, Automation & Test in Europe Conference (DATE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24715 2026-03-27 astro-ph.IM astro-ph.CO astro-ph.GA stat.AP 50%

A scalable Bayesian framework for galaxy emission line detection and redshift estimation

一种可扩展的贝叶斯框架用于星系发射线检测和红移估计

Alexander Kuhn, Bonnabelle Zabelle, Sara Algeri, Galin L. Jones, Claudia Scarlata

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出一种可扩展的贝叶斯方法,用于同时估计星系红移和检测发射线,该方法在大规模数据处理中保持高效计算。

详情

展开后加载摘要…

URL PDF HTML 收藏