arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2766 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2766 篇

2303.03378 2023-03-07 cs.LG cs.AI cs.RO 83%

PaLM-E: An Embodied Multimodal Language Model

Danny Driess, Fei Xia, Mehdi S. M. Sajjadi, Corey Lynch, Aakanksha Chowdhery, Brian Ichter, Ayzaan Wahid, Jonathan Tompson, Quan Vuong, Tianhe Yu, Wenlong Huang, Yevgen Chebotar, Pierre Sermanet, Daniel Duckworth, Sergey Levine, Vincent Vanhoucke, Karol Hausman, Marc Toussaint, Klaus Greff, Andy Zeng, Igor Mordatch, Pete Florence

专题命中 多模态Agent :multimodal(title,abstract);multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.01949 2023-01-06 cs.CL cs.AI cs.CV cs.LG cs.MM 83%

SPRING: Situated Conversation Agent Pretrained with Multimodal Questions from Incremental Layout Graph

Yuxing Long, Binyuan Hui, Fulong Ye, Yanyang Li, Zhuoxin Han, Caixia Yuan, Yongbin Li, Xiaojie Wang

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments AAAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.08836 2022-08-19 cs.CV 83%

A Multi-modal Registration and Visualization Software Tool for Artworks using CraquelureNet

Aline Sindel, Andreas Maier, Vincent Christlein

专题命中 多模态Agent :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

Comments 14 pages, 9 figures, 1 table, accepted to PatReCH 2022 Workshop at ICPR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04514 2026-06-10 cs.AI cs.CE cs.CL cs.CV stat.ME 版本更新 83%

ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering

ChartAgent: 一种用于复杂图表问答中视觉基础推理的多模态智能体

Rachneet Kaur, Nishan Srishankar, Zhen Zeng, Sumitra Ganesh, Manuela Veloso

机构 * J.P. Morgan AI Research(摩根大通人工智能研究)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出ChartAgent框架,通过迭代分解查询为视觉子任务并利用图表专用视觉工具(如绘制注释、裁剪区域)进行空间域推理,在ChartBench和ChartX上取得最先进性能,尤其对无标注图表提升显著。

Comments Accepted at ACL 2026 (Main Conference). Also presented as an oral paper at the NeurIPS 2025 Multimodal Algorithmic Reasoning Workshop (https://marworkshop.github.io/neurips25/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16203 2026-07-21 cs.LG cs.AI cs.CL 新提交 82%

DocOCR-Eval: A Correction-Based Framework for OCR Tool Selection Without Ground Truth

DocOCR-Eval:一种无需真实标签的基于校正的OCR工具选择框架

Zihan Xu, Puzhen Wu, Lawrence Chun Man Lau, Wei Liu, Sirui Li, Yifan Peng, Yihao Ding

专题命中 多模态Agent :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 针对文档解析中OCR工具选择难题,尤其是标签稀缺情况,提出无标注评估框架DocOCR-Eval。它采用三阶段校正和排序策略,通过跨多个MLLM聚合改善与基于标注排名的对齐,能在现实有限标签设置中实现可靠OCR工具选择并提供实用指导。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28374 2026-07-31 cs.LG 新提交 82%

LEDGERMIND: Provenance-Constrained Multimodal Agentic Reasoning with a Structured Evidence Ledger

LEDGERMIND:基于结构化证据账本的溯源约束多模态智能体推理

Enjun Du, Hange Zhou, Chenxu Du, Siyi Liu, Zirong Chen, Ziyu Zheng, Yongqi Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Hong Kong(香港大学) Tsinghua University(清华大学) University of Sussex(萨塞克斯大学)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract_cn)

AI总结 该研究提出LedgerMind,通过结构化证据账本及三层依据协议等组件,解决多模态智能体推理中最终答案准确率无法反映轨迹可信度的问题,在多模态基准上同时提升了答案准确率与轨迹可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17143 2026-07-21 cs.DC 新提交 82%

EdgeCoInfer: Hierarchical Collaborative Inference for On-Device Multimodal Large Models

EdgeCoInfer:用于设备端多模态大模型的分层协作推理

Lin Tan, Songtao Guo, Mingyan Li, David K. Y. Yau

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract)

AI总结 针对边缘环境中多模态大模型面临的挑战,提出EdgeCoInfer框架,通过模型间功能模块共享和模型内细粒度划分实现粒度自适应部署,采用混合进化分层强化学习解决问题,实验表明该框架能提高任务完成率并降低系统成本和内存消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00735 2026-06-25 math.OC 82%

Multimodal urban transportation network equilibrium including intermodality and shared mobility services

多模式城市交通网络均衡包含换乘和共享出行服务

Khadidja Kadem, Mostafa Ameli, Mahdi Zargayouna, Latifa Oukhellou

专题命中 多模态Agent :multimodal(title,abstract);multi-modal(abstract)

AI总结 本文研究多模式交通系统中共享出行服务对交通均衡的影响,提出包含多种出行方式的交通分配模型,通过混合整数双曲线性规划方法分析用户均衡与系统最优之间的差异。

Journal ref European Transport Research Review, 18, 41 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29850 2026-05-29 cs.LG 82%

MIRAGE: Adaptive Multimodal Gating for Whole-Brain fMRI Encoding

MIRAGE:用于全脑fMRI编码的自适应多模态门控

Abdulkadir Gokce, Badr AlKhamissi, Martin Schrimpf

机构 * Qwen3-Omni-30B-A3B-Thinking(通义千问3- Omni-30B-A3B-Thinking)

专题命中 多模态Agent :multimodal(title,abstract);omni-modal(abstract)

AI总结 提出MIRAGE框架,通过原生多模态骨干网络和自适应特征门控,实现全脑fMRI对自然视听刺激的高精度编码,并证明原生多模态特征优于后期融合的单模态特征。

Comments Preprint. First two author contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23655 2026-05-25 cs.CV cs.AI cs.LG cs.MM 82%

CVSearch: Empowering Multimodal LLMs with Cognitive Visual Search for High-Resolution Image Perception

CVSearch:赋予多模态大语言模型认知视觉搜索能力以感知高分辨率图像

Liupeng Li, Haoqian Kang, Zhenyu Lu, Jinpeng Wang, Bin Chen, Ke Chen, Yaowei Wang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China(深圳先进技术研究院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 提出CVSearch,一种无需训练的自适应框架,通过评估-搜索工作流动态调度视觉搜索策略,解决高分辨率图像感知中覆盖与效率的权衡问题。

Comments Accepted by ICML 2026. 22 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08526 2026-05-12 cs.LG 82%

Skill-CMIB: Multimodal Agent Skill for Consistent Action via Conditional Multimodal Information Bottleneck

Skill-CMIB: 多模态代理技能用于通过条件多模态信息瓶颈实现一致行动

Zihan Huang, Junda Wu, Tong Yu, Qianqi Yan, Rohan Surana, Uttaran Bhattacharya, Lina Yao, Xin Eric Wang, Julian McAuley

机构 * UC San Diego(UC圣地亚哥大学) Adobe Research(Adobe研究院) UC Santa Barbara(UC圣芭芭拉大学) University of New South Wales(新南威尔士大学)

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出Skill-CMIB方法,通过条件多模态信息瓶颈构建多模态技能,解决多模态环境下代理执行不一致的问题,提升执行稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23455 2026-05-04 cs.SE 82%

CUJBench: Benchmarking LLM-Agent on Cross-Modal Failure Diagnosis from Browser to Backend

CUJBench:跨模态故障诊断的LLM-代理基准测试

Haoming Meng

专题命中 多模态Agent :cross-modal(title,abstract);multi-modal(abstract)

AI总结 CUJBench是首个结合浏览器可见故障证据与后端可观测性的跨模态故障诊断基准测试,通过LLM辅助生成管道降低标注成本,评估六种前沿模型发现跨模态综合是主要瓶颈。

Comments 10 pages, 1 figure; updated source code url

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15309 2026-04-17 cs.CV cs.AI cs.CL 82%

MM-WebAgent: A Hierarchical Multimodal Web Agent for Webpage Generation

MM-WebAgent:一种用于网页生成的分层多模态网络代理

Yan Li, Zezi Zeng, Yifan Yang, Yuqing Yang, Ning Liao, Weiwei Guo, Lili Qiu, Mingxi Cheng, Qi Dai, Zhendong Wang, Zhengyuan Yang, Xue Yang, Ji Li, Lijuan Wang, Chong Luo

机构 * Shanghai Jiao Tong University(上海交通大学) Xi'an Jiaotong University(西安交通大学) Tongji University(同济大学) Microsoft Corporation(微软公司)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出MM-WebAgent,一种分层多模态网页生成框架,通过分层规划和迭代自反思协调AIGC元素生成,提升网页全局布局与视觉一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07148 2026-04-14 eess.IV 82%

Q-Agent: Quality-Driven Chain-of-Thought Image Restoration Agent through Robust Multimodal Large Language Model

Q-Agent:通过鲁棒多模态大语言模型实现质量驱动的推理图像修复代理

Yingjie Zhou, Jiezhang Cao, Farong Wen, Zicheng Zhang, Yu Zhou, Yue Shi, Xiaohong Liu, Radu Timofte, Luc Van Gool, Guangtao Zhai

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract)

AI总结 本文提出Q-Agent,通过Chain-of-Thought方法提升图像修复性能,结合鲁棒多模态大语言模型和客观图像质量评估,实现更高效的多退化处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00061 2026-04-02 cs.RO cs.SY eess.SP eess.SY 82%

Advancing Multi-Robot Networks via MLLM-Driven Sensing, Communication, and Computation: A Comprehensive Survey

通过MLLM驱动的感知、通信与计算推进多机器人网络:综述

Hyun Jong Yang, Howon Lee, Kyuhong Shim, Jeongho Kwak, Hyunsoo Kim, Donghoon Kim, Khoa Anh Ngo, Sehyun Ryu, Jaehyun Choi, Youbin Kim, Chanjun Moon, Michael Ryoo, Byonghyo Shim

机构 * Seoul National University(首尔大学) Ajou University(亚洲大学) Sungkyunkwan University(成均馆大学) Korea University(高丽大学) POSTECH(浦项科技大学) Stony Brook University(石溪大学)

专题命中 多模态Agent :MLLM(title,abstract);multimodal(abstract)

AI总结 本文综述了MLLM指导下的多机器人协调,探讨了集成设计对多机器人协作的影响,展示了四种端到端演示,强调了系统级指标的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00229 2026-02-09 cs.HC 82%

When and How to Integrate Multimodal Large Language Models in College Psychotherapy: Perspectives from Multi-stakeholders

何时以及如何将多模态大语言模型整合到大学生心理治疗中:来自多利益相关者的视角

Jiyao Wang, Youyu Sheng, Qihang He, Zian Zhang, Haolong Hu, Yumei Jing, Dengbo He

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract)

AI总结 本研究探讨了多模态大语言模型在大学生心理治疗中的整合时机与方式,指出其作为辅助工具的作用,并揭示了用户接受度受社交身份和相对地位影响的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00555 2026-01-27 cs.LG cs.AI cs.CL cs.CV 82%

MMedAgent-RL: Optimizing Multi-Agent Collaboration for Multimodal Medical Reasoning

MMedAgent-RL: 优化多智能体协作以实现多模态医疗推理

Peng Xia, Jinglu Wang, Yibo Peng, Kaide Zeng, Zihan Dong, Xian Wu, Xiangru Tang, Hongtu Zhu, Yun Li, Linjun Zhang, Shujie Liu, Yan Lu, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Microsoft Research(微软研究院) CMU(卡内基梅隆大学) Rutgers University(罗格斯大学) Yale University(耶鲁大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 MMedAgent-RL通过强化学习优化多智能体协作,提升多模态医疗推理性能,实现23.6%的性能提升。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04554 2026-01-09 cs.IR 82%

Exploring Recommender System Evaluation: A Multi-Modal User Agent Framework for A/B Testing

探索推荐系统评估:一种用于A/B测试的多模态用户代理框架

Wenlin Zhang, Xiangyang Li, Qiyuan Ge, Kuicai Dong, Pengyue Jia, Xiaopeng Li, Zijian Zhang, Maolin Wang, Yichao Wang, Huifeng Guo, Ruiming Tang, Xiangyu Zhao

专题命中 多模态Agent :multi-modal(title,abstract);multimodal(abstract)

AI总结 本文提出一种多模态用户代理框架,用于替代传统A/B测试,通过模拟真实用户行为提升推荐系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04833 2026-01-07 cs.CV cs.AI cs.CL 82%

E$^2$AT: Multimodal Jailbreak Defense via Dynamic Joint Optimization for Multimodal Large Language Models

E$^2$AT: 通过动态联合优化实现多模态对抗防御

Liming Lu, Xiang Gu, Shuchao Pang, Siyuan Liang, Haotian Zhu, Xiyu Zeng, Xu Zheng, Yongbin Zhou

机构 * School of Cyber Science and Engineering, Nanjing University of Science and Technology, China(南京理工大学信息科学与工程学院) HKUST(GZ) and INSAIT, Sofia University St. Kliment Ohridski(香港科技大学(广州)及INSAIT,索菲亚大学圣克莱门特·奥赫里迪斯学院) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 E$^2$AT通过动态联合优化提升多模态大语言模型对对抗攻击的鲁棒性,实验显示其在文本和图像模态上性能优于现有方法34%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17335 2025-11-24 cs.RO cs.CL cs.CV cs.SD eess.AS 82%

Robot Confirmation Generation and Action Planning Using Long-context Q-Former Integrated with Multimodal LLM

基于长上下文Q-Former与多模态大语言模型的机器人确认生成与动作规划

Chiori Hori, Yoshiki Masuyama, Siddarth Jain, Radu Corcodel, Devesh Jha, Diego Romeres, Jonathan Le Roux

机构 * Mitsubishi Electric Research Laboratories (MERL), Cambridge, MA, USA(三菱电机研究实验室(MERL),马萨诸塞州剑桥市)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、eess.AS

AI总结 本文提出基于长上下文Q-former与多模态大语言模型的机器人确认生成与动作规划方法,通过整合视频上下文信息提升动作规划性能。

Comments Accepted to ASRU 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11182 2025-11-17 cs.AI cs.CL cs.MA cs.MM 82%

Multi-agent Undercover Gaming: Hallucination Removal via Counterfactual Test for Multimodal Reasoning

Dayong Liang, Xiao-Yong Wei, Changmeng Zheng

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI、cs.MM

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25092 2025-10-30 cs.MA 82%

SeeingEye: Agentic Information Flow Unlocks Multimodal Reasoning In Text-only LLMs

Weijia Zhang, Zijia Liu, Haoru Li, Haoqi Chen, Jiaxuan You

专题命中 多模态Agent :multimodal(title,abstract);multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08567 2025-10-22 cs.CV cs.AI cs.CL 82%

MATRIX: Multimodal Agent Tuning for Robust Tool-Use Reasoning

Tajamul Ashraf, Umair Nawaz, Abdelrahman M. Shaker, Rao Anwer, Philip Torr, Fahad Shahbaz Khan, Salman Khan

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

Comments We have come across a recent approach that has not been properly attributed at the time of submission and compared in a fair setting. Therefore, we would like to withdraw the paper to address these concerns

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13845 2025-10-17 q-bio.NC 82%

Embodiment in multimodal large language models

Akila Kadambi, Lisa Aziz-Zadeh, Antonio Damasio, Marco Iacoboni, Srini Narayanan

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04791 2025-10-07 cs.SE 82%

GUISpector: An MLLM Agent Framework for Automated Verification of Natural Language Requirements in GUI Prototypes

Kristian Kolthoff, Felix Kretzer, Simone Paolo Ponzetto, Alexander Maedche, Christian Bartelt

专题命中 多模态Agent :MLLM(title,abstract);multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21662 2025-09-29 cs.LG 82%

MMPlanner: Zero-Shot Multimodal Procedural Planning with Chain-of-Thought Object State Reasoning

Afrina Tabassum, Bin Guo, Xiyao Ma, Hoda Eldardiry, Ismini Lourentzou

机构 * Amazon(亚马逊公司) Alexa, Amazon(亚马逊Alexa部门) Virginia Tech(弗吉尼亚理工大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract)

Comments 17 pages, 9 figures, 14 tables, Findings of the Association for Computational Linguistics: EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04482 2025-08-07 cs.AI cs.CL cs.CV cs.LG 82%

OS Agents: A Survey on MLLM-based Agents for General Computing Devices Use

Xueyu Hu, Tao Xiong, Biao Yi, Zishu Wei, Ruixuan Xiao, Yurun Chen, Jiasheng Ye, Meiling Tao, Xiangxin Zhou, Ziyu Zhao, Yuhuai Li, Shengze Xu, Shenzhi Wang, Xinchen Xu, Shuofei Qiao, Zhaokai Wang, Kun Kuang, Tieyong Zeng, Liang Wang, Jiwei Li, Yuchen Eleanor Jiang, Wangchunshu Zhou, Guoyin Wang, Keting Yin, Zhou Zhao, Hongxia Yang, Fan Wu, Shengyu Zhang, Fei Wu

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) OPPO AI Center(OPPO AI中心) University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态Agent :MLLM(title);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments ACL 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08575 2025-07-14 cs.AI cs.CL cs.CV 82%

Large Multi-modal Model Cartographic Map Comprehension for Textual Locality Georeferencing

Kalana Wijegunarathna, Kristin Stock, Christopher B. Jones

机构 * School of Mathematical and Computational Sciences, Massey University, Auckland, New Zealand(梅西大学数学与计算科学学院) School of Computer Science and Informatics, Cardiff University, Cardiff, UK(卡迪夫大学计算机科学与信息学院)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07306 2025-07-11 cs.AI cs.CL eess.AS 82%

ViDove: A Translation Agent System with Multimodal Context and Memory-Augmented Reasoning

Yichen Lu, Wei Dai, Jiaen Liu, Ching Wing Kwok, Zongheng Wu, Xudong Xiao, Ao Sun, Sheng Fu, Jianyuan Zhan, Yian Wang, Takatomo Saito, Sicheng Lai

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24382 2025-06-02 cs.RO eess.SP 82%

MagicGripper: A Multimodal Sensor-Integrated Gripper for Contact-Rich Robotic Manipulation

Wen Fan, Haoran Li, Dandan Zhang

机构 * Department of Bioengineering, Imperial College London(帝国理工学院伦敦分校生物工程系) School of Robotics, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学机器人学院)

专题命中 多模态Agent :multimodal(title,abstract);multi-modal(abstract)

Comments 19 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏