arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2759 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2759 篇

2604.08340 2026-08-04 cs.CV cs.AI 版本更新 84%

Mastering PokeGym: Graph-Guided Multimodal Evolution at Test Time

PokeGym: 一种以视觉驱动的长周期基准用于视觉-语言模型

Ruizhi Zhang, Ye Huang, Yuangang Pan, Chuanfu Shen, Zhilin Liu, Ting Xie, Haijun Lei, Lixin Duan

机构 * SIAS, UESTC(电子科技大学深圳高等研究院) CFAR/IHPC A*STAR(新加坡科技研究局高性能计算研究所)

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 PokeGym通过复杂的3D开放世界游戏评估视觉-语言模型在长周期任务中的表现,揭示了物理死锁恢复是当前模型的主要瓶颈,并发现高级模型存在元认知分歧。

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22643 2026-07-28 cs.AI cs.CV 新提交 84%

Reason Before You Retrieve: Agentic Planning for Multi-modal RAG

检索前先思考:多模态检索增强生成的智能体规划

Tianyu Yang, Shir Simon, Zhenzhen Li, Minhao Cheng, Xiangliang Zhang

机构 * Bosch AI Research Center(博世人工智能研究中心) University of Notre Dame(圣母大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 多模态Agent :multi-modal(title);multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 研究多模态检索增强生成问题,提出MM-R2框架,通过建模检索内容和位置在检索前推理,构建意图基础检索状态,在结构化知识图谱检索,还构建相关数据集并采用两阶段后训练策略,实验证明其在答案准确性等方面表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21013 2026-07-28 cs.AI cs.CV 版本更新 84%

EmoAgent-R1: Towards Multimodal Emotion Understanding with Reinforcement Learning-based Dynamic Agent Specialization

EmoAgent-R1:基于强化学习的动态智能体专业化实现多模态情感理解

Lihuang Fang, Yuchen Zou, kebing Jin, Jinghui Qin

机构 * Guangdong University of Technology(广东工业大学) Southern University of Science and Technology(南方科技大学) Xi’an Jiaotong University(西安交通大学) Guizhou Provincial Laboratory of Big Data, State Key Laboratory of Public Big Data, Guizhou University(贵州大学大数据省级重点实验室、公共大数据国家重点实验室)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 研究针对现有多模态情感识别方法忽视情感源动态性和复杂性的问题,提出基于强化学习的动态智能体专业化框架EmoAgent-R1,采用冷启动策略和两步智能体工作流程训练,并用P-GRPO优化,实验证明其在情感推理性能和优化稳定性上更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21005 2026-07-17 cs.AI cs.CL 版本更新 84%

Building Agent Harnesses for Scientific Curation from Multimodal Sources

构建用于多模态来源科学数据提取的智能体框架

Sheng Zhang, Qin Liu, Renqian Luo, Shufang Xie, Reuben Tan, Sean Hayes, Gregory Bryman, Wendong Ge, Ruilian Zhang, Oluwaseun Egbelowo, Kelly Yee, Hoifung Poon

机构 * Microsoft Research(微软研究院) University of California, Davis(加州大学戴维斯分校) Merck & Co., Inc., Rahway, NJ, USA(默克公司(美国新泽西州拉威))

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 提出Beaver框架,通过任务分解、多模态证据工具和可追溯性,将科学文献中的结构化信息提取转化为可审计的工作流,在GRAS指标上比前沿智能体提升23个绝对百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04911 2026-06-04 cs.CV cs.CL 84%

BreastGPT: A Multimodal Large Language Model for the Full Spectrum of Breast Cancer Clinical Routine

BreastGPT: 面向乳腺癌临床全流程的多模态大语言模型

Yang Liu, Jiajin Zhang, Danyang Tu, Yaojun Hu, Jiao Qu, Jiuyu Zhang, Yu Shi, Wei Fang, Shi Gu, Ling Zhang, Yingda Xia

机构 * DAMO Academy, Alibaba Group(阿里巴巴集团 DAMO 院) Zhejiang University(浙江大学) Hupan Lab(华潘实验室) West China Hospital(西京医院) China Medical University(中国医科大学)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 提出BreastGPT多模态大语言模型,通过构建工作流对齐的指令语料库BreastStage和双分支视觉编码器,实现乳腺癌筛查、诊断和治疗规划全流程的多模态推理,在BreastStage-Bench上取得75.66%封闭式准确率和89.92%开放式得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29861 2026-06-04 cs.CL cs.AI 84%

Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report Generation

迈向可验证的多模态深度研究:用于交错报告生成的多智能体框架

Chenghao Zhang, Guanting Dong, Yufan Liu, Tong Zhao, Xiaoxi Li, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 提出多智能体框架Ptah,通过规划、研究和写作阶段生成交错文本与视觉证据的多模态报告,并引入验证器确保事实准确性和跨模态一致性。

Comments In progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08392 2026-04-07 cs.RO cs.AI cs.CV 84%

ST-BiBench: Benchmarking Multi-Stream Multimodal Coordination in Bimanual Embodied Tasks for MLLMs

ST-BiBench:多流多模态协调在双臂具身任务中的基准测试

Xin Wu, Zhixuan Liang, Yue Ma, Mengkang Hu, Zhiyuan Qin, Xiu Li

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学) HKUST(香港科技大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ST-BiBench框架,用于评估多流多模态协调,揭示MLLMs在高阶策略与精细物理执行间的协调悖论。

Comments 42 pages, 9 figures. Project page:https://stbibench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22060 2026-03-25 cs.CV cs.AI 84%

Vision-DeepResearch: Incentivizing DeepResearch Capability in Multimodal Large Language Models

Vision-DeepResearch: 促进多模态大语言模型中的深度研究能力

Wenxuan Huang, Yu Zeng, Qiuchen Wang, Zhen Fang, Shaosheng Cao, Zheng Chu, Qingyu Yin, Shuang Chen, Zhenfei Yin, Lin Chen, Zehui Chen, Xu Tang, Yao Hu, Shaohui Lin, Philip Torr, Feng Zhao, Wanli Ouyang

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Vision-DeepResearch,通过多轮、多实体和多尺度的视觉与文本搜索,提升多模态大语言模型在噪声环境下的深度研究能力,实现更高效的多模态深度研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14599 2026-03-06 cs.CV cs.AI 84%

CCSD: Cross-Modal Compositional Self-Distillation for Robust Brain Tumor Segmentation with Missing Modalities

CCSD:跨模态组合自蒸馏用于缺失模态的鲁棒脑肿瘤分割

Dongqing Xie, Yonghuang Wu, Zisheng Ai, Jun Min, Zhencun Jiang, Shaojin Geng, Lei Wang

机构 * Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(上海智能自主系统研究院,同济大学) College of Biomedical Engineering, Fudan University(生物医学工程学院,复旦大学) School of Medicine, Tongji University(医学院,同济大学) College of Information Engineering, China Jiliang University(信息工程学院,中国嘉兴大学)

专题命中 多模态Agent :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 CCSD通过跨模态组合自蒸馏方法,提升在缺失模态下的脑肿瘤分割鲁棒性与泛化能力。

Comments 29 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01050 2026-03-03 cs.CV cs.AI 84%

MM-DeepResearch: A Simple and Effective Multimodal Agentic Search Baseline

MM-DeepResearch: 一种简单而有效的多模态代理搜索基线

Huanjin Yao, Qixiang Yin, Min Yang, Ziwang Zhao, Yibo Wang, Haotian Luo, Jingyi Zhang, Jiaxing Huang

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 MM-DeepResearch通过Hyper-Search和DR-TTS方法,构建了多模态代理搜索基线,实现了高效多模态研究任务的处理。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18571 2025-12-23 cs.AI cs.CV 84%

ESearch-R1: Learning Cost-Aware MLLM Agents for Interactive Embodied Search via Reinforcement Learning

ESearch-R1: 通过强化学习学习成本感知的多模态大语言模型代理以进行交互式具身搜索

Weijie Zhou, Xuangtang Xiong, Ye Tian, Lijun Yue, Xinyu Wu, Wei Li, Chaoyang Zhao, Honghui Dong, Ming Tang, Jinqiao Wang, Zhengyou Zhang

机构 * School of Traffic and Transportation, Beijing Jiaotong University(交通与运输学院,北京交通大学) Tencent Robotics X & Futian Laboratory(腾讯机器人X与福田实验室) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(基础模型研究中心,中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态Agent :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 ESearch-R1通过强化学习方法,结合交互对话、记忆检索和导航,实现成本感知的多模态大语言模型代理,有效降低任务执行成本并提高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16203 2025-12-12 cs.CV cs.AI 84%

When Alignment Fails: Multimodal Adversarial Attacks on Vision-Language-Action Models

当对齐失败时:针对视觉-语言-动作模型的多模态对抗攻击

Yuping Yan, Yuhan Xie, Yixin Zhang, Lingjuan Lyu, Handing Wang, Yaochu Jin

机构 * TGAI Lab, School of Engineering, Westlake University(西拉库大学工程学院TGAI实验室) Pennsylvania State University(宾夕法尼亚州立大学) Sony Research, Sony(索尼研究实验室,索尼) Xidian University(西安电子科技大学)

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VLA-Fool,针对视觉-语言-动作模型的多模态对抗攻击,揭示其在白盒和黑盒环境下具身多模态对齐的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08629 2025-12-10 cs.AI cs.CV cs.HC 84%

See-Control: A Multimodal Agent Framework for Smartphone Interaction with a Robotic Arm

See-Control: 一种多模态代理框架用于智能手机与机械臂的交互

Haoyu Zhao, Weizhong Ding, Yuhao Yang, Zheng Tian, Linyi Yang, Kun Shao, Jun Wang

机构 * University College London(伦敦大学学院) Imperial College London(伦敦帝国学院) Huawei Noah’s Ark Lab(华为诺亚实验室) ShanghaiTech University(上海科技大学) Southern University of Science(南方科技大学)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 See-Control通过直接与机械臂交互实现智能手机操作,无需ADB或系统后台访问,提供了一个平台无关的多模态代理框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02405 2025-12-03 cs.CV cs.AI cs.LG 84%

WISE: Weighted Iterative Society-of-Experts for Robust Multimodal Multi-Agent Debate

WISE: 加权迭代专家社会用于鲁棒多模态多智能体辩论

Anoop Cherian, River Doyle, Eyal Ben-Dov, Suhas Lohit, Kuan-Chuan Peng

机构 * Mitsubishi Electric Research Labs(三菱电机研究实验室) Cambridge Rindge and Latin School(剑桥林恩和拉丁学校)

专题命中 多模态Agent :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出WISE框架,通过多模态多智能体辩论提升视觉语言推理任务的准确性,实验显示在多个数据集上提升了2-7%的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01223 2025-12-02 cs.CV cs.AI 84%

S$^2$-MLLM: Boosting Spatial Reasoning Capability of MLLMs for 3D Visual Grounding with Structural Guidance

S$^2$-MLLM:通过结构指导提升多模态大语言模型在3D视觉定位中的空间推理能力

Beining Xu, Siting Zhu, Zhao Jin, Junxian Li, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态Agent :MLLM(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 S$^2$-MLLM通过隐式空间推理提升多模态大语言模型在3D视觉定位中的空间推理能力,实现高效且准确的3D场景理解。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16635 2025-11-21 cs.CV cs.CL 84%

SurvAgent: Hierarchical CoT-Enhanced Case Banking and Dichotomy-Based Multi-Agent System for Multimodal Survival Prediction

SurvAgent: 基于层次化CoT增强的案例库与二元多智能体系统用于多模态生存预测

Guolin Huang, Wenting Chen, Jiaqi Yang, Xinheng Lyu, Xiaoling Luo, Sen Yang, Xiaohan Xing, Linlin Shen

机构 * Shenzhen University(深圳大学) Stanford University(斯坦福大学) University of Nottingham Ningbo China(诺丁汉大学宁波分校) Ant Group(蚂蚁集团)

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 SurvAgent通过层次化CoT增强的多智能体系统,整合多模态数据,提升生存预测的可解释性与准确性。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02834 2025-11-06 cs.AI cs.CL cs.LG 84%

Agent-Omni: Test-Time Multimodal Reasoning via Model Coordination for Understanding Anything

Huawei Lin, Yunzhi Shi, Tong Geng, Weijie Zhao, Wei Wang, Ravender Pal Singh

机构 * Amazon(亚马逊公司) Rochester Institute of Technology(罗切斯特理工学院) University of Rochester(罗切斯特大学)

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

Comments 16 pages, 7 figures, 14 tables. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18405 2025-09-24 cs.CV cs.AI 84%

Check Field Detection Agent (CFD-Agent) using Multimodal Large Language and Vision Language Models

Sourav Halder, Jinjun Tong, Xinyu Wu

机构 * U.S. Bank(美国银行)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments 12 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15876 2025-08-25 cs.CL cs.AI cs.MA 84%

DeepMEL: A Multi-Agent Collaboration Framework for Multimodal Entity Linking

Fang Wang, Tianwei Yan, Zonghao Yang, Minghao Hu, Jun Zhang, Zhunchen Luo, Xiaoying Bai

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Information Science and Engineering, Chongqing Jiaotong University(重庆交通大学信息科学与工程学院) China Research and Development Academy of Machinery Equipment(机械电子研究发展院) Center of Information Research, Academy of Military Science(军事科学信息研究中心)

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05330 2025-07-09 cs.CL cs.AI 84%

MindFlow: Revolutionizing E-commerce Customer Support with Multimodal LLM Agents

Ming Gong, Xucheng Huang, Chenghan Yang, Xianhan Peng, Haoxin Wang, Yang Liu, Ling Jiang

机构 * Xiaoduo AI(小多AI) University of Dayton(代顿大学)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07196 2025-06-16 cs.CV cs.CL 84%

SAP-Bench: Benchmarking Multimodal Large Language Models in Surgical Action Planning

Mengya Xu, Zhongzhen Huang, Dillan Imans, Yiru Ye, Xiaofan Zhang, Qi Dou

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

Comments The authors could not reach a consensus on the final version of this paper, necessitating its withdrawal

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16663 2025-05-23 cs.CV cs.MM 84%

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation

Haihong Hao, Mingfei Han, Changlin Li, Zhihui Li, Xiaojun Chang

机构 * University of Science and Technology of China(中国科学技术大学) MBZUAI Stanford University(斯坦福大学)

专题命中 多模态Agent :cross-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13965 2025-05-21 cs.CL cs.AI 84%

CAFES: A Collaborative Multi-Agent Framework for Multi-Granular Multimodal Essay Scoring

Jiamin Su, Yibo Yan, Zhuoran Gao, Han Zhang, Xiang Liu, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Beijing Future Brain Education Technology Co., Ltd.(北京未来脑教育科技有限公司)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);分类 cs.CL、cs.AI

Comments arXiv admin note: substantial text overlap with arXiv:2502.11916

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14917 2025-02-24 cs.CV cs.AI 84%

Sce2DriveX: A Generalized MLLM Framework for Scene-to-Drive Learning

Rui Zhao, Qirui Yuan, Jinyu Li, Haofeng Hu, Yun Li, Chengyuan Zheng, Fei Gao

专题命中 多模态Agent :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04575 2025-01-09 cs.AI cs.CL cs.HC 84%

InfiGUIAgent: A Multimodal Generalist GUI Agent with Native Reasoning and Reflection

Yuhang Liu, Pengxiang Li, Zishu Wei, Congkai Xie, Xueyu Hu, Xinchen Xu, Shengyu Zhang, Xiaotian Han, Hongxia Yang, Fei Wu

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);分类 cs.CL、cs.AI

Comments 14 pages, 7 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04531 2024-12-09 cs.CV cs.AI cs.LG 84%

MageBench: Bridging Large Multimodal Models to Agents

Miaosen Zhang, Qi Dai, Yifan Yang, Jianmin Bao, Dongdong Chen, Kai Qiu, Chong Luo, Xin Geng, Baining Guo

专题命中 多模态Agent :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

Comments 37 pages, 32 figures, github link: https://github.com/microsoft/MageBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11548 2024-11-19 cs.RO cs.AI cs.CV 84%

AIC MLLM: Autonomous Interactive Correction MLLM for Robust Robotic Manipulation

Chuyan Xiong, Chengyu Shen, Xiaoqi Li, Kaichen Zhou, Jeremy Liu, Ruiping Wang, Hao Dong

专题命中 多模态Agent :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15341 2024-07-23 cs.AI cs.CV 84%

V-Zen: Efficient GUI Understanding and Precise Grounding With A Novel Multimodal LLM

Abdur Rahman, Rajat Chawla, Muskaan Kumar, Arkajit Datta, Adarsh Jha, Mukunda NS, Ishaan Bhola

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments 12 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08567 2024-06-04 cs.CL cs.CR cs.CV cs.LG cs.MA 84%

Agent Smith: A Single Image Can Jailbreak One Million Multimodal LLM Agents Exponentially Fast

Xiangming Gu, Xiaosen Zheng, Tianyu Pang, Chao Du, Qian Liu, Ye Wang, Jing Jiang, Min Lin

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

Comments ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11191 2026-08-12 cs.CV cs.AI cs.CL 新提交 83%

Test-Time Self-Evolving GUI Visual Grounding via Reflection-Guided On-Policy Self-Distillation

基于反思引导的在线策略自蒸馏的测试时自演进GUI视觉定位

Shiyu Xuan, Zechao Li

专题命中 多模态Agent :MLLM(summary_cn,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对现有GUI视觉定位模型部署后难适配未见界面且无法反思失败探索的问题,提出测试时自演进框架,结合MLLM反思器、反思引导的在线策略自蒸馏等方法,在六个基准上平均提升7.4%准确率,完善了GUI智能体自演进能力。

详情

展开后加载摘要…

URL PDF HTML 收藏