arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-30 至 2026-06-30 共收录 13 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 13 篇

2606.29648 2026-06-30 cs.CL cs.AI cs.LG cs.MA 81%

Hybrid Retriever Evolution for Multimodal Document Reasoning Agents

混合检索器演化:面向多模态文档推理代理

Bohan Yao, Shruthan Radhakrishna, Vikas Yadav

机构 * ServiceNow University of Washington(华盛顿大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 提出失败驱动的演化框架,让元代理自动学习任务代理如何协调多种检索器进行多步文档问答,实现自适应检索路由,在MMLongBench-Doc和DocBench上提升高达19.6分。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30189 2026-06-30 cs.CL 79%

DAIN: Dynamic Agent-Based Interaction Network for Efficient and Collaborative Multimodal Reasoning

DAIN: 基于动态智能体交互网络的高效协同多模态推理

Xinxin Chen, Yuchen Li, Zihan Wang, Haoyu Zhang, Ruixin Liu, Mingyuan Zhao

机构 * University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL

AI总结 提出动态智能体交互网络(DAIN),通过上下文感知元控制器动态调度专业交互智能体并压缩通信,实现高效协同多模态推理,在五个基准上取得最优性能。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28357 2026-06-30 cs.IR cs.AI 79%

ReasonRec: A Reasoning-Augmented Multimodal Agent for Unified Recommendation

ReasonRec: 一种用于统一推荐的推理增强多模态智能体

Yihua Zhang, Mingfu Liang, Jiyan Yang, Rong Jin, Wen-Yen Chen, Yiping Han, Huayu Li, Buyun Zhang, Liang Luo, Frank Shyu, Luke Simon, Sijia Liu, Tianlong Chen, Xi Liu

机构 * Meta AI Michigan State University(密歇根州立大学) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 提出ReasonRec,一种基于三阶段显式推理管道的多模态推荐智能体,通过推理感知视觉指令调优、证据-视野课程学习和不确定性引导委派机制,在五个数据集上实现排名指标相对提升超30%,推理延迟降低35%。

Comments The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29445 2026-06-30 cs.CV cs.AI 79%

Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction

通过通用关键帧提取桥接VideoQA和视频引导的智能体任务

Sunqi Fan, Qingle Liu, Runqi Yin, Meng-Hao Guo, Shuojin Yang

专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出VG-GUIBench基准和TASKER关键帧提取算法,联合考虑任务相关性和场景动态,在VideoQA和视频引导的GUI任务上提升性能。

Comments Accepted by ECCV 2026. Project Page: https://vg-gui-tasker.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29788 2026-06-30 cs.LG 78%

MemLeak: Diagnosing Information Leaks in Multimodal Agent Memory

MemLeak: 诊断多模态智能体记忆中的信息泄露

Kuan Wang, Chao Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 提出信息溯源图(IPG)分类法,通过MemLeak基准测试发现多模态记忆系统中删除事实后仍可从保留图像中恢复信息,图像泄露率达12.0%,47%的泄露无法通过文本恢复。

Comments 23 pages, 3 figures, includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28971 2026-06-30 cs.CV 77%

Self-Evolving Agentic Image Restoration via Deliberate Planning and Intuitive Execution

自进化智能体图像恢复:通过深思熟虑的规划与直觉执行

Shuang Cui, Fan Ji, Guanglong Sun, Yufei Guo, Xiongxin Tang, Jiangmeng Li, Fanjiang Xu

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) School of Life Sciences, Tsinghua University(清华大学生命科学学院) Intelligent Science & Technology Academy of CASIC(中国科学院 CASIC 智能科学与技术学院)

专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 提出SEAR框架,将图像恢复建模为序列决策问题,采用直觉执行器与深思熟虑规划器,结合剪枝感知蒙特卡洛树搜索和自进化情景记忆,解决贪婪搜索和信息利用不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29399 2026-06-30 cs.AI 74%

LLM-Guided Planning for Multi-hop Reasoning over Multimodal Nuclear Regulatory Documents

LLM引导的规划:多模态核监管文档的多跳推理

Mingyu Jeon, Bokyeong Kim, Suwan Cho, Jae Young Suh, Yonggyun Yu

专题命中 多模态Agent :multimodal(title);分类 cs.AI

AI总结 提出LLM引导的规划方法,通过动态知识图谱状态和文档树工具,在多跳推理任务中实现81.5%准确率,显著优于无状态规划方法。

Comments Accepted at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond @ ICML 2026. 8 pages (main), 3 figures, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30084 2026-06-30 cs.CV 70%

One Forward Beats Two: InnerZoom for Accurate and Efficient GUI Grounding

一次前向胜过两次:InnerZoom 实现准确高效的 GUI 定位

Chen Liu, Ling Chen, Hanzhang Zhou, Liangyu Chen, Chenglin Cai, Xin Yu, Steven Hoi, Yue Wang

机构 * Alibaba Group(阿里巴巴集团) Tongyi Lab(通义实验室) University of Technology Sydney(悉尼大学) Adelaide University(阿德莱德大学)

专题命中 多模态Agent :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出 InnerZoom 框架,通过跨层证据桥接在单次前向传播中实现精确 GUI 元素定位,无需额外裁剪重跑,在六个基准上达到最优性能,同时降低延迟和计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29425 2026-06-30 cs.AI cs.CL cs.MA cs.MM 67%

Mixture of Debaters: Learn to Debate at Architectural Level in Multi-Agent Reasoning

辩论者混合:在多智能体推理中实现架构级别的辩论学习

Dayong Liang, Kaisong Gong, Yi Cai, Changmeng Zheng, Xiao-Yong Wei

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 提出Mixture of Debaters框架,通过混合专家范式在单一模型内实现动态自我辩论,解决静态架构和高计算开销问题,在多项基准上以更低延迟和令牌消耗取得更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29115 2026-06-30 cs.RO cs.AI cs.CV cs.HC 62%

When Stopping Fails: Rethinking Minimal Risk Conditions through Human-Interactive Autonomous Driving for Safe Transportation Systems

当停止失效:通过人机交互自动驾驶重新思考安全交通系统的最小风险条件

Yash Tandon, Giovanni Tapia Lopez, Marcus Blennemann, Mohan Trivedi, Ross Greer

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 分析自动驾驶车辆因停止行为导致的交通阻塞、应急干扰等事故,提出需从被动策略转向人机交互自主性,增强感知、规划与控制能力。

Comments 8 pages, 1 figure, Accepted to IEEE ITSC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30251 2026-06-30 cs.MA 50%

TACO: Tool-Augmented Credit Optimization for Agentic Tool Use

TACO:面向智能体工具使用的工具增强信用优化

Mingkuan Feng, Jinyang Wu, Hao Gu, Fangrui Lv, Ruihan Jin, Chuyuan Zhang, Zhengqi Wen, Jianhua Tao

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出TACO方法,通过差分答案探针奖励和结果门控优势路由,为代码工具智能体提供无监督工具贡献信用分配,提升多模态问答准确性并减少冗余工具调用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23822 2026-06-30 cs.SE 50%

KISS Sorcar: A Stupidly-Simple General-Purpose and Software Engineering AI Assistant

KISS Sorcar:一个简单通用且软件工程友好的AI助手

Koushik Sen

专题命中 多模态Agent :multimodal(abstract)

AI总结 KISS Sorcar基于KISS Agent Framework构建,通过五层代理架构解决传统AI助手的缺陷,实现高质量代码生成与多任务处理,测试显示其在Terminal Bench 2.0上的通过率较高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02097 2026-06-30 cs.IR 50%

The Future is Agentic: Definitions, Perspectives, and Open Challenges of Multi-Agent Recommender Systems

未来是代理的:多代理推荐系统定义、视角和开放挑战

Reza Yousefi Maragheh, Yashar Deldjoo

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文探讨多代理推荐系统从被动生成到主动规划的转变,提出基于状态代理的框架,分析其在提升推荐效果中的作用,并通过实验验证代理系统在不同场景下的有效性。

Comments Added controlled experiments to illustrate the points of the paper. Also edited for more clarity in conveying the concepts

详情

展开后加载摘要…

URL PDF HTML 收藏