arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-21 至 2026-04-21 共收录 17 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 17 篇

2502.02871 2026-04-21 cs.CL cs.AI 86%

Position: Multimodal Large Language Models Can Significantly Advance Scientific Reasoning

位置:多模态大语言模型可以显著推动科学推理

Yibo Yan, Shen Wang, Jiahao Huo, Jingheng Ye, Zhendong Chu, Xuming Hu, Philip S. Yu, Carla Gomes, Bart Selman, Qingsong Wen

机构 * Squirrel AI HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) Tsinghua University(清华大学) University of Illinois at Chicago(伊利诺伊大学香槟分校) Cornell University(康奈尔大学)

专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文探讨多模态大语言模型在科学推理中的应用,提出四阶段研究路线,指出当前模型在跨领域推理中的潜力与挑战,为实现通用人工智能提供新视角。

Comments Accepted by The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026, Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08539 2026-04-21 cs.CV cs.AI cs.CL 82%

OpenVLThinkerV2: A Generalist Multimodal Reasoning Model for Multi-domain Visual Tasks

OpenVLThinkerV2: 一个多领域视觉任务的通用多模态推理模型

Wenbo Hu, Xin Chen, Yan Gao-Tian, Yihe Deng, Nanyun Peng, Kai-Wei Chang

机构 * University of California, Los Angeles (UCLA)(加州大学洛杉矶分校)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出G$^2$RPO训练目标,通过非线性分布匹配解决多视觉任务中的奖励拓扑差异和感知与推理平衡问题,构建了鲁棒的OpenVLThinkerV2模型,在18个基准测试中表现优异。

Comments code at: https://github.com/uclanlp/openvlthinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09741 2026-04-21 cs.CV cs.LG 81%

Constructive Distortion: Improving MLLMs with Attention-Guided Image Warping

构造性失真:通过注意力引导的图像扭曲改进MLLMs

Dwip Dalal, Gautam Vashishtha, Utkarsh Mishra, Jeonghwan Kim, Madhav Kanda, Hyeonjeong Ha, Svetlana Lazebnik, Heng Ji, Unnat Jain

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Skan AI Texas A&M University(德克萨斯大学阿姆斯特朗分校) University of California, Irvine(加州大学 Irvine 分校)

专题命中 其他多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出AttWarp方法,通过注意力引导的图像扭曲增强MLLMs对细节和空间关系的感知能力,提升准确性和推理能力。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00065 2026-04-21 cs.CL cs.AI 81%

Using Perspectival Words Is Harder Than Vocabulary Words for Humans and Even More So for Multimodal Language Models

使用视角词比词汇词对人类更困难,甚至对多模态语言模型更为困难

Dota Tianai Dong, Yifan Luo, Po-Ya Angela Wang, Asli Ozyurek, Paula Rubio-Fernandez

机构 * Max Planck Institute for Psycholinguistics(马克斯·普朗克心理学语言学研究所)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 研究比较了人类和多模态语言模型在使用词汇、所有格和指示词时的认知负荷,发现视角词对两者都更难,且多模态模型在所有格和指示词上表现更差,揭示了其在常识和社交认知能力上的不足。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14738 2026-04-21 cs.CL 79%

AutoRubric: Rubric-Based Generative Rewards for Faithful Multimodal Reasoning

AutoRubric: 基于评分标准的生成奖励用于忠实的多模态推理

Mengzhao Jia, Zhihan Zhang, Ignacio Cases, Zheyuan Liu, Meng Jiang, Peng Qi

机构 * University of Notre Dame(内布拉斯加大学) Uniphore

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 AutoRubric通过整合可验证奖励学习与过程级监督,利用自动收集的评分标准生成奖励,实现多模态推理的高保真性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16883 2026-04-21 cs.LG cs.AI 79%

SinkRouter: Sink-Aware Routing for Efficient Long-Context Decoding in Large Language and Multimodal Models

SinkRouter: 为大语言和多模态模型高效长上下文解码的感知路由

Junnan Liu, Xinyan Liu, Peifeng Gao, Zhaobo Qi, Beichen Zhang, Weigang Zhang, Antoni Bert Chen

机构 * Harbin Institute of Technology (Weihai)(哈尔滨工业大学(威海)) University of Hong Kong(香港大学) City University of Hong Kong(城市大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出SinkRouter,通过感知路由机制提升长上下文解码效率,减少计算冗余,实现在512K上下文下的2.03倍加速,保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16806 2026-04-21 cs.CV 79%

Channel Attention-Guided Cross-Modal Knowledge Distillation for Referring Image Segmentation

通道注意力引导的跨模态知识蒸馏用于指代图像分割

Chen Yang

机构 * School of Information Science and Technology, TaiShan University, Taian, China(信息科学与技术学院,泰山大学,泰安,中国)

专题命中 其他多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出通道注意力引导的跨模态知识蒸馏方法,用于指代图像分割,通过迁移教师网络学习的视觉语言高阶细粒度相关性和通道语义相关性,提升学生网络性能,减少计算资源消耗。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18320 2026-04-21 cs.CV cs.AI 79%

EVE: Verifiable Self-Evolution of MLLMs via Executable Visual Transformations

EVE: 通过可执行视觉变换实现多模态大语言模型的可验证自进化

Yongrui Heng, Chaoya Jiang, Han Yang, Shikun Zhang, Wei Ye

机构 * National Engineering Research Center for Software Engineering, Peking University(软件工程国家级工程研究中心,北京大学) School of Control Science and Engineering, Shandong University(控制科学与工程学院,山东大学)

专题命中 其他多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出EVE框架,通过可执行视觉变换实现多模态大语言模型的可验证自进化,解决伪标签方法和模板方法的不足,通过双策略架构和多维奖励系统提升模型自进化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19761 2026-04-21 math.OC q-bio.NC q-bio.QM 78%

Multimodal branched transport infers anatomically aligned brain reaction maps

多模态分支运输推断解剖学对齐的脑反应图谱

Cristian Mendico

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文通过结合血氧水平依赖响应、源重构脑电图和弥散张量成像各向异性,推断出解剖学对齐的脑反应图谱,揭示了各向异性成本对路由结构的重塑作用及几何-动态优化的非平凡排名反转。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17526 2026-04-21 math.PR math.ST stat.TH 78%

Convergence of Langevin AIS for multimodal distributions

兰格文AIS在多模分布中的收敛性

Akshat Agarwal, Gautam Iyer, Aidan Jameson, Seungjae Son, Wyatt Wimmer

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 研究多模吉布斯分布下退火重要性采样算法与兰格文蒙特卡洛结合的收敛速率,证明误差阈值固定时时间复杂度与逆温度平方成正比,并提出控制AIS采样误差的通用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17245 2026-04-21 cs.RO 78%

MM-Hand: A 21-DOF Multi-modal Modular Dexterous Robotic Hand with Remote Actuation

MM-Hand:一种21自由度多模态模块化灵活机械手 with 远程驱动

Zhuoheng Li, Qingquan Lin, Checheng Yu, Qiangyu Chen, Zhiqian Lan, Lutong Zhang, Hongyang Li, Ping Luo

机构 * The University of Hong Kong(香港大学) City University of Hong Kong(香港城市大学) XiFengGu Ltd.(西风谷有限公司)

专题命中 其他多模态 :multi-modal(title);multimodal(abstract)

AI总结 MM-Hand通过远程驱动技术实现21自由度多模态模块化机械手,集成了弹簧回弹腱驱动手指、3D打印模块化手指和手掌结构、快速腱连接器及多模态传感系统,验证了其轻量、传感丰富和可维护性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16587 2026-04-21 cs.CV cs.AI 62%

Real-Time Visual Attribution Streaming in Thinking Model

多模态思维模型中的实时视觉归因流

Seil Kang, Woojung Han, Junhyeok Kim, Jinyeong Kim, Youngeun Kim, Seong Jae Hwang

机构 * Seil Kang Woojung Han Junhyeok Kim Jinyeong Kim Youngeun Kim Seong Jae Hwang

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种用于多模态思维模型实时视觉归因流的近似框架,通过学习从注意力特征中直接估计语义区域的因果效应,实现轻量级学习而非暴力计算的高保真归因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16794 2026-04-21 cs.CV 57%

Improving Radio Interferometry Imaging by Explicitly Modeling Cross-Domain Consistency in Reconstruction

通过显式建模跨域一致性来改进射电干涉成像

Kai Cheng, Ruoqi Wang, Qiong Luo

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出CDCRec方法,通过显式建模跨域一致性提升射电干涉成像质量,采用多任务多阶段框架增强域间交互,实验表明其在干涉域转换中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18441 2026-04-21 math.ST cs.LG stat.ML stat.TH 50%

Conformal Robust Set Estimation

共形鲁棒集估计

Alejandro Cholaquidis, Emilien Joly, Leonardo Moreno

机构 * Centro de Matemática, Facultad de Ciencias, Universidad de la República(数学中心,科学学院,乌拉圭共和国大学) Centro de Investigación en Matemáticas (CIMAT)(数学研究学院(CIMAT)) Departamento de Métodos Cuantitativos, Facultad de Ciencias Económicas y de Administración, Universidad de la República(定量方法系,经济与管理学院,乌拉圭共和国大学)

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文提出基于半质量半径的鲁棒共形方法,通过距离到第(n/2⌋+1)近邻的非共性分数,实现对异常值或重尾分布的鲁棒性,提供概率保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18449 2026-04-21 cs.HC 50%

From Awareness to Intent: Mitigating Silent Driving System Failures through Prospective Situation Awareness Enhancing Interfaces

从意识到意图:通过前瞻性情境意识增强界面缓解静默驾驶系统故障

Jiyao Wang, Song Yan, Xiao Yang, Qihang He, Chenglin Liu, Ange Wang, Chenglin Chen, Zhenyu Wang, Dengbo He

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文研究了前瞻性情境意识增强界面如何通过提升驾驶员情境意识来改善静默故障接管性能,发现感知提示最有效提升意识,而传达系统意图更有效建立信任。

Comments Accepted by CHI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17868 2026-04-21 gr-qc astro-ph.HE 50%

Including higher-order modes in a quadrupolar eccentric numerical relativity surrogate using universal eccentric modulation functions

在四极谐振数值相对论替代模型中包含高阶模式使用通用谐振调制函数

Tousif Islam, Adhrit Ravichandran, Peter James Nee, Scott E. Field, Vijay Varma, Harald P. Pfeiffer, Andrea Ceja, Noora Ghadiri, Lawrence E. Kidder, Prayush Kumar, Marlo Morales, Abhishek Ravishankar, Antoni Ramos-Buades, Katie Rink, Hannes R. Ruter, Mark A. Scheel, Md Arif Shaikh, Daniel Tellez

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文提出一种框架,利用通用谐振调制函数将多模准圆波形转换为偏心波形,结合NR替代模型与四极非自转偏心替代模型,构建多模非自转偏心模型,实现九种模式的高精度模拟。

Comments 20 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13618 2026-04-21 cs.RO 50%

On the Importance of Tactile Sensing for Imitation Learning: A Case Study on Robotic Match Lighting

关于触觉感知在模仿学习中的重要性:机器人点火任务的案例研究

Niklas Funk, Changqi Chen, Tim Schneider, Georgia Chalvatzaki, Roberto Calandra, Jan Peters

机构 * Technical University of Darmstadt(德累斯顿技术大学) LASR Lab, TU Dresden(TU德累斯顿激光实验室)

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出融合视觉和触觉的模仿学习框架,通过模块化Transformer与流基生成模型提升动态任务中的操作性能,证明触觉信息对学习动态操作的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏