arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-27 至 2026-03-27 共收录 84 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 3 篇

2603.22120 2026-03-27 cs.CV 57%

StreamingClaw Technical Report

流式Claw技术报告

Jiawei Chen, Zhe Chen, Chaoqun Du, Maokui He, Wei He, Hengtao Li, Qizhen Li, Zide Liu, Hao Ma, Xuhao Pan, Chang Ren, Xudong Rao, Xintian Shen, Chenfeng Wang, Tao Wei, Chengjun Yu, Pengfei Yu, Shengyu Yao, Chunpeng Zhou, Kun Zhan, Lihao Zheng, Pan Zhou, Xuhan Zhu, Yufei Zheng

机构 * Li Auto Inc.(理想汽车)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出StreamingClaw框架,解决流式视频理解与具身智能中的实时推理、多模态记忆和闭环控制问题,提升复杂环境下的自主决策能力。

Comments Under Progress

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态训练与对齐 15 篇

2603.25555 2026-03-27 cs.CV 83%

Towards Comprehensive Real-Time Scene Understanding in Ophthalmic Surgery through Multimodal Image Fusion

通过多模态图像融合实现眼科手术中的全面实时场景理解

Nikolo Rohrmoser, Ghazal Ghazaei, Michael Sommersperger, Nassir Navab

机构 * Technical University of Munich(慕尼黑工业大学) Carl Zeiss AG(卡尔蔡司公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 本文提出一种多模态实时网络架构,用于联合仪器检测、关键点定位和工具-组织距离估计,通过多模态图像融合提升手术场景理解的准确性和实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25077 2026-03-27 cs.CV 83%

Bridging Perception and Reasoning: Token Reweighting for RLVR in Multimodal LLMs

弥合感知与推理:用于多模态大语言模型中RLVR的标记重加权

Jinda Lu, Junkang Wu, Jinghan Li, Kexin Huang, Shuo Yang, Guoyin Wang, Jiancan Wu, Xiang Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Independent Researcher(独立研究员)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 本文提出Token-Reweighting策略,通过动态重加权多模态大语言模型中的感知与推理标记,提升RLVR性能,实现视觉 grounding 和推理的协同优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11331 2026-03-27 cs.IT math.IT 82%

AMBER: An Adaptive Multimodal Mask Transformer for Beam Prediction with Missing Modalities

AMBER: 一种自适应多模态掩码变换器用于缺失模态的波束预测

Chenyiming Wen, Binpu Shi, Min Li, Ming-Min Zhao, Min-Jian Zhao, Jiangzhou Wang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 AMBER通过自适应处理多模态数据中的缺失模态问题,提升波束预测的鲁棒性和准确性,实验表明其在真实世界数据集上优于现有多模态学习基线。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23004 2026-03-27 cs.LG 82%

QLIP: A Dynamic Quadtree Vision Prior Enhances MLLM Performance Without Retraining

QLIP:一种动态四叉树视觉先验增强MLLM性能无需重新训练

Kyle R. Chickering, Bangzheng Li, Muhao Chen

专题命中 多模态训练与对齐 :MLLM(title,abstract);multimodal(abstract)

AI总结 QLIP通过动态四叉树视觉先验提升MLLM的粗粒度和细粒度视觉理解能力,无需重新训练,实验显示在LLaVA v1.5系列模型上提升视觉问答准确率,且在V-star基准测试中提升细节理解性能达13.6%。

Comments Accepted as ICLR 2026 poster. 22 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25155 2026-03-27 cs.CV cs.AI 81%

Photon: Speedup Volume Understanding with Efficient Multimodal Large Language Models

Photon:通过高效多模态大语言模型加速体积理解

Chengyu Fang, Heng Guo, Zheng Jiang, Chunming He, Xiu Li, Minfeng Xu

机构 * Tsinghua University(清华大学) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) Hupan Lab(湖畔实验室) Duke University(杜克大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 Photon通过高效多模态大语言模型实现3D医学影像的体积理解,采用自适应令牌调度和梯度传播技术降低计算成本,提升模型可靠性与效率。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25573 2026-03-27 cs.CV cs.LG 79%

Hierarchy-Guided Multimodal Representation Learning for Taxonomic Inference

层级引导的多模态表示学习用于分类推断

Sk Miraj Ahmed, Xi Yu, Yunqi Li, Yuewei Lin, Wei Xu

机构 * Brookhaven National Laboratory(布鲁克海文国家实验室) Rutgers University(罗格斯大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出两种端到端的多模态学习方法,通过编码生物分类层级结构提升分类鲁棒性,在大规模生物多样性基准上实现超过14%的准确率提升。

Comments Accepted at the ICLR 2026 Workshop on Foundation Models for Science (FM4Science)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20749 2026-03-27 cs.LG cs.AI 79%

Stabilizing Multimodal Autoencoders: A Theoretical and Empirical Analysis of Fusion Strategies

稳定多模态自编码器:融合策略的理论和经验分析

Diyar Altinses, Andreas Schwung

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文研究多模态自编码器的稳定性与鲁棒性,提出基于理论分析的正则化注意力融合方法,通过实验验证其在一致性、收敛速度和精度上的优势。

Journal ref Expert Systems with Applications, Volume 310, 10 May 2026, 131270

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16889 2026-03-27 cs.CL 79%

Can GRPO Boost Complex Multimodal Table Understanding?

GRPO能否提升复杂多模态表格理解?

Xiaoqiang Kang, Shengen Wu, Zimu Wang, Yilin Liu, Xiaobo Jin, Kaizhu Huang, Wei Wang, Yutao Yue, Xiaowei Huang, Qiufeng Wang

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进科技学院) Department of Computer Science, University of Liverpool(利物浦大学计算机科学系) Information Hub, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) University of Southern California(南加州大学) Duke Kunshan University(杜克大学昆山分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出Table-R1框架,通过预热、感知对齐GRPO和提示-完成GRPO三阶段提升多模态表格理解性能,优于SFT和GRPO。

Comments EMNLP 2025

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04595 2026-03-27 cs.LG 78%

A Late-Fusion Multimodal AI Framework for Privacy-Preserving Deduplication in National Healthcare Data Environments

一种用于国家医疗数据环境中的隐私保护去重的晚融合多模态AI框架

Mohammed Omer Shakeel Ahmed

机构 * University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出一种多模态AI框架,通过语义嵌入、行为模式和设备元数据的晚融合方法,实现隐私保护下的去重,提升公共健康分析的可靠性。

Comments 6 pages, 1 figure, 1 table. Accepted for publication in the 2025 IEEE International Conference on Future Machine Learning and Data Science (FMLDS)

Journal ref 2025 IEEE International Conference on Future Machine Learning and Data Science (FMLDS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23953 2026-03-27 cs.CV cs.ET 77%

VOLMO: Versatile and Open Large Models for Ophthalmology

VOLMO:面向眼科学的多功能和开放型大模型

Zhenyue Qin, Younjoon Chung, Elijah Lee, Wanyue Feng, Xuguang Ai, Serina Applebaum, Minjie Zou, Yang Liu, Pan Xiao, Mac Singer, Amisha Dave, Aidan Gilson, Tiarnan D. L. Keenan, Emily Y. Chew, Zhiyong Lu, Yih-Chung Tham, Ron Adelman, Luciano V. Del Priore, Qingyu Chen

机构 * Department of Biomedical Informatics & Data Science, Yale University(耶鲁大学生物医学信息学与数据科学系) Ray and Stephanie Lane Computational Biology Department, Carnegie Mellon University(卡内基梅隆大学雷和斯蒂芬妮·兰德计算生物学系) Yong Loo Lin School of Medicine, National University of Singapore(新加坡国立大学杨洛林医学院) Department of Radiology, Washington University in Saint Louis(圣路易斯华盛顿大学放射科) National Eye Institute, National Institutes of Health(国家卫生研究院眼科研究所) National Library of Medicine, National Institutes of Health(国家卫生研究院国家医学图书馆)

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CV

AI总结 VOLMO提出了一种通用框架,用于开发专门的眼科多模态大语言模型,通过预训练、微调和临床推理三个阶段,提升了眼科疾病筛查和诊断的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11770 2026-03-27 cs.CL cs.CY cs.SI 74%

The Value of Nothing: Multimodal Extraction of Human Values Expressed by TikTok Influencers

nothing的价值:通过TikTok影响者表达的人类价值观多模态提取

Alina Starovolsky-Shitrit, Alon Neduva, Naama Appel Doron, Itamar Gafni, Ella Daniel, Oren Tsur

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CL

AI总结 本文研究通过TikTok影响者上传的视频提取隐含价值观,采用两阶段方法优于直接提取,使用少量样本的大语言模型在两个阶段表现更优,首次公开TikTok视频价值观标注数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24857 2026-03-27 cs.CR cs.AI cs.CL cs.CV cs.LG 67%

AI Security in the Foundation Model Era: A Comprehensive Survey from a Unified Perspective

在基础模型时代的人工智能安全:从统一视角的综合调查

Zhenyi Wang, Siyu Luan

机构 * University of Central Florida(中佛罗里达大学) University of Copenhagen(哥本哈根大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文从统一视角出发,系统探讨了基础模型时代AI安全问题,提出统一闭环威胁分类框架,揭示模型与数据之间的双向风险传播,为构建可扩展的安全策略提供理论基础。

Comments Published at Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18840 2026-03-27 cs.CV cs.CL 62%

See the Text: From Tokenization to Visual Reading

查看文本:从分词到视觉阅读

Ling Xing, Rui Yan, Alex Jinpeng Wang, Zechao Li, Jinhui Tang

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) College of Information Science and Technology and Artificial Intelligence, Nanjing Forestry University(南京林业大学信息科学技术与人工智能学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出SeeTok方法,通过将文本渲染为图像并利用预训练多模态大模型实现视觉阅读,相比传统子词分词在资源消耗和跨语言泛化方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14612 2026-03-27 cs.RO 50%

Proprioceptive Image: An Image Representation of Proprioceptive Data from Quadruped Robots for Contact Estimation Learning

本体图像:四足机器人的本体数据图像表示用于接触估计学习

Gabriel Fischer Abati, João Carlos Virgolino Soares, Giulio Turrisi, Victor Barasuol, Claudio Semini

机构 * Dynamic Legged Systems (DLS) lab, Istituto Italiano di Tecnologia (IIT)(动态腿足系统实验室,意大利理工学院) University of Genoa(热那亚大学)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 本文提出将四足机器人本体时间序列数据转换为结构化二维图像的方法,利用卷积神经网络学习运动相关任务。通过编码多信号的时序动态,保留机器人形态结构,提升特征空间丰富性。在接触估计任务中,实验表明图像表示优于传统序列模型,接触状态准确率提升16.8个百分点。

Comments Accepted to the IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11864 2026-03-27 cs.CR 50%

NeuroStrike: Neuron-Level Attacks on Aligned LLMs

NeuroStrike:对对齐大语言模型的神经层面攻击

Lichao Wu, Sasha Behrouzi, Mohamadreza Rostami, Maximilian Thang, Stjepan Picek, Ahmad-Reza Sadeghi

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 NeuroStrike通过利用对齐技术引入的稀疏安全神经元漏洞,提出了一种通用攻击框架,实现了对多种大语言模型的高效攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他多模态 8 篇

2603.25720 2026-03-27 cs.AI cs.CV 84%

R-C2: Cycle-Consistent Reinforcement Learning Improves Multimodal Reasoning

R-C2:循环一致性强化学习提升多模态推理

Zirui Zhang, Haoyu Dong, Kexin Pei, Chengzhi Mao

机构 * Rutgers University(罗格斯大学) Columbia University(哥伦比亚大学) University of Chicago(芝加哥大学)

专题命中 其他多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 R-C2通过循环一致性强化学习解决多模态推理中的内部冲突,提升推理准确率7.6个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25203 2026-03-27 cs.CV cs.CL 81%

Probabilistic Concept Graph Reasoning for Multimodal Misinformation Detection

基于概率概念图推理的多模态虚假信息检测

Ruichao Yang, Wei Gao, Xiaobin Zhu, Jing Ma, Hongzhan Lin, Ziyang Luo, Bo-Wen Zhang, Xu-Cheng Yin

机构 * University of Science and Technology Beijing(北京科技大学) Singapore Management University(新加坡管理大学) Hong Kong Baptist University(香港浸会大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出PCGR框架,通过构建概念图进行多模态虚假信息检测,实现可解释且可进化的方法,提升检测准确性和抗新兴操纵能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06663 2026-03-27 cs.CV cs.AI 81%

Graph-of-Mark: Promote Spatial Reasoning in Multimodal Language Models with Graph-Based Visual Prompting

图标记:通过基于图的视觉提示提升多模态语言模型的空间推理能力

Giacomo Frisoni, Lorenzo Molfetta, Mattia Buzzoni, Gianluca Moro

机构 * University of Bologna(博洛尼亚大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出Graph-of-Mark,一种基于图的视觉提示方法,通过在输入图像上叠加场景图来增强多模态语言模型的空间推理能力,实验表明其在视觉问答和定位任务中提升了11个百分点的准确率。

Comments Please cite the definitive, copyrighted, and peer-reviewed version of this article published in AAAI 2026, edited by Sven Koenig et al., AAAI Press, Vol. 40, No. 36, Technical Track, pp. 30726-30734, 2026. DOI: https://doi.org/10.1609/aaai.v40i36.40329

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25088 2026-03-27 cs.CV 79%

Visual Attention Drifts,but Anchors Hold:Mitigating Hallucination in Multimodal Large Language Models via Cross-Layer Visual Anchors

视觉注意力漂移,但锚点仍有效:通过跨层视觉锚点缓解多模态大语言模型的幻觉

Chengxu Yang, Jingling Yuan, Chuang Hu, Jiawei Jiang

机构 * School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出CLVA方法,通过跨层视觉锚点缓解多模态大语言模型的幻觉问题,强调中间层视觉锚点的重要性,无需额外训练,有效抑制深度层注意力漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10611 2026-03-27 physics.app-ph cs.SY eess.SY 78%

Demonstration of a planar multimodal periodic filter at THz frequencies

太赫兹频率下平面多模周期滤波器的演示

Ali Dehghanian, Mohsen Haghighat, Thomas Darcie, Levi Smith

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文提出一种基于共面带状线和有限地面共面波导的平面多模周期滤波器,用于太赫兹频率操作,通过灵活设计和主动控制实现滤波特性。

Comments 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02703 2026-03-27 cs.CV 57%

Structure Causal Models and LLMs Integration in Medical Visual Question Answering

结构因果模型与大语言模型在医学视觉问答中的整合

Zibo Xu, Qiang Li, Weizhi Nie, Weijie Wang, Anan Liu

机构 * School of Microelectronics, Tianjin University(天津大学微电子学院) School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院) Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系)

专题命中 其他多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种因果推理框架,通过消除图像与问题间的混杂效应,提升医学视觉问答的准确性,并引入因果图结构和多变量重采样方法以增强模型对复杂医疗数据的理解能力。

Comments Accepted by IEEE TMI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24785 2026-03-27 eess.SY cs.ET cs.SY 50%

Cyber-Physical System Design Space Exploration for Affordable Precision Agriculture

面向低成本精准农业的网络物理系统设计空间探索

Pawan Kumar, Hokeun Kim

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出一种考虑成本的设计空间探索框架,用于多模态无人机-越野车平台,通过整数线性规划和SAT验证,在预算、覆盖和载荷之间进行权衡,实现高效精准农业应用。

Comments 2026 Design, Automation & Test in Europe Conference (DATE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24715 2026-03-27 astro-ph.IM astro-ph.CO astro-ph.GA stat.AP 50%

A scalable Bayesian framework for galaxy emission line detection and redshift estimation

一种可扩展的贝叶斯框架用于星系发射线检测和红移估计

Alexander Kuhn, Bonnabelle Zabelle, Sara Algeri, Galin L. Jones, Claudia Scarlata

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出一种可扩展的贝叶斯方法,用于同时估计星系红移和检测发射线,该方法在大规模数据处理中保持高效计算。

详情

展开后加载摘要…

URL PDF HTML 收藏