arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-26 至 2026-02-26 共收录 49 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 10 篇

2602.21941 2026-02-26 cs.CL 79%

MERRY: Semantically Decoupled Evaluation of Multimodal Emotional and Role Consistencies of Role-Playing Agents

MERRY: 多模态情感与角色一致性评估的语义解耦框架

Zhenyu Wang, Xiaofen Xing, Yirong Chen, Xiangmin Xu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 MERRY提出一种语义解耦的评估框架,用于评估多模态角色扮演代理的情感与角色一致性,通过改进的指标和双向证据寻找任务提升评估效果。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21686 2026-02-26 stat.ML cs.LG 78%

Multimodal Datasets with Controllable Mutual Information

具有可控互信息的多模态数据集

Raheem Karim Hashmani, Garrett W. Merz, Helen Qu, Mariel Pettee, Kyle Cranmer

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Flatiron Institute(Flatiron研究所)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出了一种生成具有可控互信息的多模态数据集的框架,用于评估互信息估计器和多模态自监督学习技术。

Comments 16 pages, 7 figures, 2 tables. Our code is publicly available at https://github.com/RKHashmani/MmMi-Datasets. Datasets generated based on Figure 1 can be found at https://huggingface.co/datasets/RKHashmani/mmmi-dag1-2modalities-cifar10

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22033 2026-02-26 cs.CV 70%

RT-RMOT: A Dataset and Framework for RGB-Thermal Referring Multi-Object Tracking

RT-RMOT:一种用于RGB-热成像参照多目标跟踪的数据集和框架

Yanqiu Yu, Zhifan Jin, Sijia Chen, Tongfei Chu, En Yu, Liman Liu, Wenbing Tao

机构 * Huazhong University of Science and Technology(华中科技大学) South-Central Minzu University(西南民族大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 RT-RMOT提出一种融合RGB和热成像特征的多目标跟踪框架,通过改进的RL策略优化提升全天候跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00043 2026-02-26 cs.CV cs.AI cs.CL 67%

VOILA: Evaluation of MLLMs For Perceptual Understanding and Analogical Reasoning

VOILA:对多模态大语言模型的感知理解与类比推理能力评估

Nilay Yilmaz, Maitreya Patel, Yiran Lawrence Luo, Tejas Gokhale, Chitta Baral, Suren Jayasuriya, Yezhou Yang

机构 * Arizona State University(亚利桑那州立大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 VOILA通过类比映射方法评估多模态大语言模型的感知理解和抽象推理能力,发现其在图像间关系理解上存在不足,但通过多步提示策略可提升性能。

Comments Accepted at ICLR 2025. Code and data: https://github.com/nlylmz/Voila

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17115 2026-02-26 cs.CV cs.AI 62%

Measuring the Measurers: Quality Evaluation of Hallucination Benchmarks for Large Vision-Language Models

测量测量者:大型视觉-语言模型幻觉基准的品质评估

Bei Yan, Jie Zhang, Zheng Yuan, Shiguang Shan, Xilin Chen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, and also with University of Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院,以及中国科学院大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HQM框架评估幻觉基准质量,发现现有基准存在可靠性与有效性不足问题,并提出HQQ基准以提升评估效果,揭示LVLMs在幻觉问题上的严重缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21464 2026-02-26 eess.AS cs.CL 62%

iMiGUE-Speech: A Spontaneous Speech Dataset for Affective Analysis

iMiGUE-Speech:一种用于情感分析的自发语音数据集

Sofoklis Kakouros, Fang Kang, Haoyu Chen

机构 * Center for Machine Vision and Signal Analysis, University of Oulu, Finland(机器视觉与信号分析中心,奥卢大学,芬兰) Center for Machine Vision(机器视觉中心) Signal Analysis, University of Oulu, Finland(信号分析,奥卢大学,芬兰)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 iMiGUE-Speech是一种用于情感分析的自发语音数据集,通过增加语音转录和元数据,提供多模态资源以研究情绪和情感状态。

Comments Accepted to Speech Prosody 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21272 2026-02-26 stat.ML cs.LG stat.CO 50%

Counterdiabatic Hamiltonian Monte Carlo

反 diagonal 霍尔顿采样

Reuben Cohn-Gordon, Uroš Seljak, Dries Sels

机构 * University of California, Berkeley(加州大学伯克利分校) New York University(纽约大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 反 diagonal 霍尔顿采样通过引入学习的反 diagonal 项,提高多模问题的采样效率,适用于复杂分布的高效采样。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 5 篇

2602.21447 2026-02-26 cs.CR cs.AI cs.CL cs.LG 81%

Adversarial Intent is a Latent Variable: Stateful Trust Inference for Securing Multimodal Agentic RAG

对抗意图是潜在变量:用于安全多模态代理RAG的状态信任推断

Inderjeet Singh, Vikas Pahuja, Aishvariya Priya Rathina Sabapathy, Chiara Picardi, Amit Giloni, Roman Vainshtein, Andrés Murillo, Hisashi Kojima, Motoyoshi Sekiya, Yuki Unno, Junichi Suga

机构 * Fujitsu Research of Europe, UK(富士通欧洲研究机构,英国) Fujitsu Limited, Japan(富士通株式会社,日本)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出MMA-RAG^T框架,通过状态化信任推断提升多模态代理RAG的安全性,实验显示攻击成功率显著降低。

Comments 13 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21517 2026-02-26 cs.CV 79%

Which Tool Response Should I Trust? Tool-Expertise-Aware Chest X-ray Agent with Multimodal Agentic Learning

我应该信任哪个工具响应?具有工具-专业知识意识的胸片代理与多模态代理学习

Zheang Huai, Honglong Yang, Xiaomeng Li

机构 * The Hong Kong University of Science(香港科学与技术大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出TEA-CXA,一种具有工具-专业知识意识的胸片代理,通过多模态代理学习解决医疗工具冲突问题,提升多轮工具调用的可靠性。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21087 2026-02-26 cs.CV 79%

MIRA: Multimodal Iterative Reasoning Agent for Image Editing

MIRA: 多模态迭代推理代理用于图像编辑

Ziyun Zeng, Hang Hua, Jiebo Luo

机构 * University of Rochester(罗切斯特大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 MIRA通过多模态迭代推理代理提升图像编辑的语义一致性和感知质量,结合自研数据集和训练流程,实现与专有系统相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21112 2026-02-26 cs.RO cs.AI 57%

EO-1: An Open Unified Embodied Foundation Model for General Robot Control

EO-1:一个通用机器人控制的开放统一具身基础模型

Delin Qu, Haoming Song, Qizhi Chen, Zhaoqing Chen, Xianqiang Gao, Dong Wang, Xinyi Ye, Qi Lv, Modi Shi, Guanghui Ren, Cheng Ruan, Maoqing Yao, Haoran Yang, Jiacheng Bao, Bin Zhao, Xuelong Li

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) AgiBot Northwestern Polytechnical University(西北工业大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 EO-1是一个统一的具身基础模型,通过交错视觉-文本-动作预训练实现了在多模态推理和机器人控制中的卓越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18676 2026-02-26 cs.HC 50%

MagHeart: Exploring Playful Avatar Co-Creation and Shared Heartbeats for Icebreaking in Hybrid Meetings

MagHeart:探索混合会议中的 playful 虚拟角色共创与共享心跳以促进破冰

Black Sun, Haiyang Xu, Ge Kacy Fu, Liyue Da, Eve Hoggan

专题命中 多模态Agent :multimodal(abstract)

AI总结 MagHeart通过playful虚拟角色共创和共享心跳技术,促进混合会议中的对称破冰,探索远程参与者在会议开始时的物质和感知存在,同时揭示隐私和情境适当性等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 6 篇

2602.21589 2026-02-26 cs.CV 85%

SEF-MAP: Subspace-Decomposed Expert Fusion for Robust Multimodal HD Map Prediction

SEF-MAP:子空间分解专家融合用于鲁棒多模态高精度地图预测

Haoxiang Fu, Lingfeng Zhang, Hao Li, Ruibing Hu, Zhengrong Li, Guanjing Liu, Zimu Tan, Long Chen, Hangjun Ye, Xiaoshuai Hao

机构 * National University of Singapore(新加坡国立大学) Xiaomi EV(小米电动车) Chinese University of Hong Kong(香港中文大学) The University of Manchester(曼彻斯特大学) Renmin University of China(中国人民大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 SEF-MAP通过子空间分解和专家融合,提升多模态HD地图预测的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24072 2026-02-26 cs.CV cs.AI 84%

Uncovering Grounding IDs: How External Cues Shape Multimodal Binding

揭示地面ID:外部线索如何塑造多模态绑定

Hosein Hasani, Amirmohammad Izadi, Fatemeh Askari, Mobin Bagherian, Sadegh Mohammadian, Mohammad Izadi, Mahdieh Soleymani Baghshah

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出地面ID概念,揭示外部线索通过增强多模态绑定的注意力机制,提升跨模态定位精度并减少幻觉。

Comments Under review as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21952 2026-02-26 cs.CV 79%

MindDriver: Introducing Progressive Multimodal Reasoning for Autonomous Driving

MindDriver: 引入渐进多模态推理用于自动驾驶

Lingjun Zhang, Yujian Yuan, Changjie Wu, Xinyuan Chang, Xin Cai, Shuang Zeng, Linzhe Shi, Sijin Wang, Hang Zhang, Mu Xu

机构 * Amap, Alibaba Group(阿里集团蚂巴公司) The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学) Xi’an Jiaotong University(西安交通大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 MindDriver通过渐进多模态推理框架提升自动驾驶系统的推理能力,实现语义到物理空间的转化与轨迹规划,展现优异的性能表现。

Comments CVPR2026; Yujian Yuan and Lingjun Zhang contributed equally with random order

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04997 2026-02-26 cs.CV cs.CL 73%

LLM2CLIP: Powerful Language Model Unlocks Richer Cross-Modality Representation

LLM2CLIP: 强大语言模型解锁更丰富的跨模态表示

Weiquan Huang, Aoqi Wu, Yifan Yang, Xufang Luo, Yuqing Yang, Usman Naseem, Chunyu Wang, Chunyu Wang, Qi Dai, Xiyang Dai, Dongdong Chen, Chong Luo, Lili Qiu, Liang Hu

专题命中 多模态训练与对齐 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL

AI总结 LLM2CLIP通过将强大语言模型与CLIP结合,提升跨模态表示能力,实现多种下游任务的性能改进。

Journal ref AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21522 2026-02-26 q-bio.NC cs.AI cs.CL 62%

One Brain, Omni Modalities: Towards Unified Non-Invasive Brain Decoding with Large Language Models

一个大脑,多模态:迈向统一非侵入式脑解码的大型语言模型

Changli Tang, Shurui Li, Junliang Wang, Qinfan Xiao, Zhonghao Zhai, Lei Bai, Yu Qiao, Bowen Zhou, Wen Wu, Yuanning Li, Chao Zhang

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) ShanghaiTech University(上海科技大学)

专题命中 多模态训练与对齐 :omni-modal(abstract);分类 cs.CL、cs.AI

AI总结 NOBEL通过统一EEG/MEG与fMRI信号,利用大型语言模型实现多模态非侵入式脑解码,提升解码准确性和对视觉语义的解读能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21716 2026-02-26 cs.CV 57%

TranX-Adapter: Bridging Artifacts and Semantics within MLLMs for Robust AI-generated Image Detection

TranX-Adapter: 在MLLMs中弥合artifact与语义以实现鲁棒的AI生成图像检测

Wenbin Wang, Yuge Huang, Jianqing Xu, Yue Yu, Jiangtao Yan, Shouhong Ding, Pan Zhou, Yong Luo

机构 * Wuhan University(武汉大学) Tencent YouTu Lab(腾讯YouTu实验室) Singapore Management University(新加坡管理学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 TranX-Adapter通过引入任务感知的最优传输融合和X-Fusion机制,在MLLMs中提升AI生成图像检测的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 1 篇

2602.21648 2026-02-26 cs.LG q-bio.QM 78%

Multimodal Survival Modeling and Fairness-Aware Clinical Machine Learning for 5-Year Breast Cancer Risk Prediction

多模态生存建模与公平性感知的临床机器学习用于5年乳腺癌风险预测

Toktam Khatibi

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本研究提出了一种多模态生存建模框架,结合临床数据和高维生物标志物,通过CoxNet和XGBoost模型预测乳腺癌5年生存率,并强调模型的校准、公平性和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏