arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 252 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 252 篇

2608.14132 2026-08-17 cs.HC cs.AI 新提交 70%

Act2Intention: A Benchmark For Developing Active Mobile Agents Through Inferring User Intention from GUI Actions

Act2Intention:通过从GUI操作推断用户意图开发主动移动智能体的基准

Xiaokai Yan, Jingtao Ding, Yong Li, Zhiwen Yu

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract_cn);分类 cs.AI

AI总结 本文提出Act2Intention框架及基准数据集,构建主动移动智能体,经实验验证该基准可显著提升智能体意图理解、预测与执行性能,为主动智能体研究提供标准化平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12721 2026-08-14 cs.CV 新提交 70%

VOS-Agent: The 1st Place Solution for the 8th LSVOS Challenge (MOSEv2 Track)

VOS-Agent:第8届LSVOS挑战赛(MOSEv2赛道)的第一名解决方案

Canyang Wu, Jinrong Zhang, Xusheng He, Ce Bian, Xianjing Han, Jianlong Wu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Nanyang Technological University(南洋理工大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 多模态Agent :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对复杂视频目标分割中微小目标、语义主导目标的稳健传播难题,本文提出VOS-Agent协作框架,以SAM3为共享密集分割模块,根据目标特征激活专用智能体,在ECCV 2026第8届LSVOS挑战赛MOSEv2赛道获第一名,J&JF指标达69.82%。

Comments 1st Place Solution for the 8th LSVOS MOSEv2 Challenge (ECCV 2026 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10775 2026-08-12 cs.AI 新提交 70%

SkillLens: Visual Skill Cards for Retrieval-Augmented GUI Action Prediction and On-Policy Distillation

SkillLens:用于检索增强型GUI动作预测与在线策略蒸馏的可视化技能卡片

Zhou Liu, Ligang Huang, Zeli Su, Zewei Pan, Zhaoyang Han, Xing Chen, Yuanfeng Song, Wentao Zhang

专题命中 多模态Agent :multimodal(abstract,abstract_cn);分类 cs.AI

AI总结 SkillLens提出可视化技能卡片(VSCs),结合轨迹转卡片方法与检索增强机制,在两个多模态网页基准上提升了冻结GPT-5.4-mini执行器及Qwen3-VL-2B学生模型的GUI动作预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06270 2026-08-07 cs.AI 新提交 70%

The Illusion of Visual Tool-Use: A Causal Audit of Thinking with Images

视觉工具使用的错觉:对图像思考的因果审查

Zhiheng Wang, Bo Peng, Lai Wei, Chaochao Lu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态Agent :multimodal(abstract,abstract_cn);分类 cs.AI

AI总结 本文通过因果审查方法,发现多模态大语言模型的视觉工具使用存在“调用而不查看”“查看而不规划”等错觉,整体准确率增益下大量场景无因果效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29347 2026-08-03 cs.MA cs.AI 新提交 70%

SeekBrain: An Autonomous Multi-Agent System for Accelerating Neuroscience Discovery

SeekBrain:用于加速神经科学发现的自主多智能体系统

Jiamin Wu, Peishan Xiang, Jingyang Chen, Yuqing Zhu, Yuxi Li, Ling Luo, Qihao Zheng, Jialiang Zu, Yongchao Wu, Mindong Liu, Haitao Wu, Chaofan Hu, Yijie Sun, Yuqi Hang, Yu Zhu, Shuo Li, Yue Fan, Shiyang Feng, Wanghan Xu, Tianlei Zhang, Jie Zhang, Wenlong Zhang, Bo Zhang, Kai Wang, Lei Bai, Mianxin Liu, Wanli Ouyang, Jiulin Du, Chunfeng Song

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 SeekBrain是用于加速神经科学发现的自主多智能体框架,通过分层规划与跨模态分析生成分析流程,在BrainArena基准上优于现有智能体,实际研究中成功揭示了斑马鱼与小鼠的神经表征规律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25489 2026-07-29 cs.CV 新提交 70%

Agentic AI in medicine: architectures, applications, evaluation, and challenges for clinical translation

医学中的智能体人工智能:临床转化的架构、应用、评估及挑战

Zheng Tong, Yang Liu, Wanshu Fan, Jing Qin, Zhongbin Han, Haifan Gong, Congyu Liao, Xiaofeng Liu, Cong Wang

机构 * School of Software Engineering, Dalian University(大连大学软件工程学院) Affiliated Zhongshan Hospital of Dalian University(大连大学附属中山医院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of California, San Francisco(加州大学旧金山分校) Yale University(耶鲁大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态Agent :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 研究探讨医学中智能体人工智能的架构、应用等,通过范围审查筛选相关研究,指出其范围未定论且评估与临床需求不符,证据基础有限,临床转化需更清晰定义、可重复评估等。

Comments Review article, 6 figures, 2 tables. 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13558 2026-07-16 cs.AI 新提交 70%

Multi-Agent Collaborative Reasoning with Tool-Augmented Evidence for Urban Region Profiling

基于工具增强证据的多智能体协作推理用于城市区域剖析

Xixuan Hao, Yutian Jiang, Jiabo Liu, Yihang Yang, Guangyin Jin, Song Gao, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Washington(华盛顿大学) Chang’an University(长安大学) University of Wisconsin - Madison(威斯康星大学麦迪逊分校)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 研究针对城市区域剖析问题,提出UrbanAgent框架,通过多智能体协作推理解决跨模态不一致,将指标预测扩展为闭环过程,经实验验证其性能优于现有基线,在未见城市设置中有强泛化性。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25880 2026-06-25 cs.CV 新提交 70%

USS: Unified Spatial-Semantic Prompts for Embodied Visual Tracking with Latent Dynamics Learning

USS: 面向具身视觉跟踪的统一空间-语义提示与潜在动力学学习

Yuchen Xie, Xinyu Zhou, Kuangji Zuo, Yanshuo Lu, Fengrui Huang, Boyu Ma, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学)

专题命中 多模态Agent :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出统一空间-语义提示范式替代纯文本目标指示,设计端到端框架USS支持多种提示类型,通过潜在世界模型提升时序鲁棒性,在真实机器人实验中优于纯文本方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07436 2026-06-12 cs.CV 新提交 70%

Skill-3D: Evolving Scene-Aware Skills for Agentic 3D Spatial Reasoning

Skill-3D:面向智能体3D空间推理的场景感知技能进化

Haoyuan Li, Zhengdong Hu, Jun Wang, Hehe Fan, Yi Yang

机构 * Zhejiang University(浙江大学) University of Technology Sydney(技术悉尼大学) OPPO Research Institute(OPPO研究院)

专题命中 多模态Agent :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出Skill-3D框架,通过场景记忆和技能库的协同进化,使智能体根据场景自适应选择工具,显著提升3D空间推理中工具使用的正确性和充分性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08952 2026-06-09 cs.AI 新提交 70%

AlloSpatial: Agentic Harness Framework for Spatial Reasoning in Foundation Models

AlloSpatial:基础模型中空间推理的智能体框架

Shouwei Ruan, Bin Wang, Zhenyu Wu, Qihui Zhu, Yuxiang Zhang, Jingzhi Li, Yubin Wang, Xingxing Wei

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) University of Science and Technology Beijing(北京科技大学)

专题命中 多模态Agent :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 提出AlloSpatial框架,通过World2Mind认知映射沙箱将自我中心观察转化为异中心空间先验,并利用空间推理工具实现几何语义仲裁,在VSI-Bench和MindCube上提升模型5%-18%的空间推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09104 2026-08-11 cond-mat.mtrl-sci cs.LG physics.ins-det 新提交 67%

Multitask Scanning Probe Microscopy

多任务扫描探针显微镜

Aditya Raghavan, Yu Liu, Ian Mercer, JP Maria, Sergei Kalinin

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract)

AI总结 该研究提出多任务扫描探针显微镜,基于多任务高斯过程的闭环工作流程,实现测量位置与模态的自主选择,在AlScN晶圆上验证了其可扩展主动学习应用的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29600 2026-08-03 cs.RO 新提交 67%

HAM-VLN: Harnessing Hierarchical Agentic Memory for Zero-Shot Vision-and-Language Navigation

HAM-VLN:利用分层智能体记忆实现零样本视觉与语言导航

An Liu, Bingxi Liu, Hongyu Ding, Yixuan Jiang, Yaran Chen, Fulin Tang, Cong Leng, Hong Zhang, Jian Cheng

专题命中 多模态Agent :multimodal(abstract,abstract_cn)

AI总结 本研究提出HAM-VLN零样本VLN方法,通过分层智能体记忆缓解长程导航的记忆与推理瓶颈,提升导航指标并缩短上下文长度,在多个基准数据集上取得优异零样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21522 2026-07-24 cs.RO cs.AI cs.CL cs.CV 新提交 67%

GS-Agent: Creating 4D Physical Worlds With Generative Simulation

GS-Agent:通过生成式模拟创建4D物理世界

Hongxin Zhang, Chunru Lin, Junyan Li, Zhou Xian, Tsun-Hsuan Wang, Chuang Gan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Genesis AI(创世纪人工智能公司)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究旨在从自然语言描述创建4D物理世界。核心方法是提出GS-Agent这一端到端多智能体框架,分解任务并让多智能体与物理引擎协作。主要贡献是能有效转换自然语言为物理合理的4D世界,实现相机和灯光控制,为新范式奠基。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14075 2026-07-16 cs.SE 新提交 67%

VisualRepair: Dynamic Tool Calling and Region Focusing for Visual Software Issue Repair

VisualRepair:用于视觉软件问题修复的动态工具调用和区域聚焦

Jingyu Xiao, Zhongyi Zhang, Haoran Hou, Yuxuan Wan, Yuan Jiang, Yintong Huo, Michael R. Lyu

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract)

AI总结 针对现代软件视觉信息利用难题,提出VisualRepair框架,通过图像类型感知工具调用和动态测试时区域聚焦两模块,在SWE-bench基准测试中性能超现有方法,有效提升自动视觉软件问题修复能力。

Comments The paper was completed in March 2026 and is currently under review. The code will be released upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06559 2026-07-08 cs.RO 新提交 67%

RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation

RynnWorld-4D:用于机器人操作的4D具身世界模型

Haoyu Zhao, Xingyue Zhao, Siteng Huang, Xin Li, Deli Zhao, Zhongyu Li

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hong Kong Embodied AI Lab(香港具身人工智能实验室) CUHK(香港中文大学) Hupan Lab(湖畔实验室)

专题命中 多模态Agent :multi-modal(abstract);cross-modal(abstract)

AI总结 研究针对开放世界机器人操作,提出RynnWorld-4D生成模型,通过RGB-DF捕捉4D动态,其具三分支架构,还整理数据集并提出RynnWorld-4D-Policy,实验证明该模型在时空预测及实际操作任务中表现出色。

Comments Project Page: https://alibaba-damo-academy.github.io/RynnWorld-4D.github.io, Github: https://github.com/alibaba-damo-academy/RynnWorld-4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19926 2026-06-19 cs.HC 新提交 67%

MemGUI-Agent: An End-to-End Long-Horizon Mobile GUI Agent with Proactive Context Management

MemGUI-Agent: 一种具有主动上下文管理的端到端长时移动GUI智能体

Guangyi Liu, Gao Wu, Congxiao Liu, Pengxiang Zhao, Liang Liu, Mading Li, Qi Zhang, Mengyan Wang, Liang Guo, Yong Liu

专题命中 多模态Agent :MLLM(abstract,abstract_cn)

AI总结 提出MemGUI-Agent,通过主动上下文管理机制(ConAct)将上下文管理作为一等动作,解决长时任务中提示膨胀和关键信息稀释问题,在8B模型上达到最佳性能。

Comments 33 pages, 6 figures. Project page: https://memgui-agent.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11078 2026-06-10 cs.AI cs.CL cs.CV 新提交 67%

A History-Aware Visually Grounded Critic for Computer Use Agents

面向计算机使用代理的历史感知视觉基础批评家

Jaewoo Lee, Zaid Khan, Archiki Prasad, Justin Chih-Yao Chen, Supriyo Chakraborty, Kartik Balasubramaniam, Sambit Sahu, Elias Stengel-Eskin, Hyunji Lee, Mohit Bansal

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Capital One University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出HiViG框架,通过历史感知的视觉基础多模态批评家,在测试时评估动作并拦截错误,在多个GUI基准上提升成功率。

Comments Code: https://github.com/G-JWLee/HiViG

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10803 2026-06-10 cs.CL cs.AI cs.CV 新提交 67%

Beyond APIs: Probing the Limits of MLLMs in Physical Tool Use

超越API:探索多模态大语言模型在物理工具使用中的极限

Zhixin Ma, Yutong Zhou, Yongqi Li, Chong-Wah Ngo, Wenjie Li

机构 * Singapore Management University(新加坡管理大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出PhysTool-Bench基准,评估多模态大语言模型在真实场景中识别物理工具并规划使用的能力,发现最强模型仅完成21%任务,揭示感知与规划双重缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08907 2026-08-11 cs.CV cs.AI 新提交 62%

ToolVision: Learning When and How to Use Visual Tools with Capability-Aligned Supervision

ToolVision:通过能力对齐监督学习何时以及如何使用视觉工具

Delin Mao, Chenghao Sun, Jingwei Song, Chishui Chen, Linfeng Zhang

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对多模态模型工具使用监督错位问题,提出ToolVision方法,通过能力对齐的SFT与RL监督优化工具使用学习,在多个视觉基准上实现性能提升并将公开发布相关资源。

Comments 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08219 2026-08-11 cs.CV cs.AI 新提交 62%

VTO: Visual Tool Orchestration for Video Anomaly Detection

VTO:面向视频异常检测的可视化工具编排

Rui Wang, Yeteng Wu, Xianling Zhang, Mengshi Qi

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学) School of Digital Media & Design Art(数字媒体与设计艺术学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对视频异常检测中传统方法泛化差、多模态智能体工具编排难的问题,提出过程监督强化学习框架VTO,结合VAD-Tool工具集,在工具调度上较基线提升10.2%。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08164 2026-08-11 cs.CL cs.AI 新提交 62%

STEMMA: An Adversarial Multi-Agent Framework for Evaluating Self-Identity Consistency in LLMs

STEMMA:用于评估大语言模型(LLM)自我身份一致性的对抗性多智能体框架

Nuthakki Siva Gopala Krishna, Kanishka Jain

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对LLM自我身份一致性评估问题,提出对抗性多智能体框架STEMMA,结合手动设计的对抗性提示开展实验,发现多数LLM存在自我表征不一致的问题。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05013 2026-08-06 cs.CL cs.AI cs.HC cs.LG cs.MA 新提交 62%

OneDayAgent: Towards a Long-Horizon Harness for Autonomous Agents

OneDayAgent:面向自主智能体的长程管控框架

Jingsheng Zheng, Xinyuan Fang, Jintian Zhang, Zhengke Gui, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 OneDayAgent是一种长程管控框架,可将开放式请求分解为子任务,在不同后端LLMs上实现最优性能,解决智能体的多类失效模式。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15868 2026-07-20 cs.CV cs.AI cs.GR cs.HC cs.RO 新提交 62%

EgoExoMoCap: Distributed Ego-Exo Human Motion Capture

EgoExoMoCap:分布式自我-外部人体运动捕捉

Jiaxi Jiang, Bharat Lal Bhatnagar, Nan Yang, Lingni Ma, Sebastian Starke, Robin Kips, Nadine Bertsch, Christian Holz, Federica Bogo

机构 * Meta Reality Labs(元现实实验室) ETH Zürich(苏黎世联邦理工学院)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对头戴式设备人体运动捕捉,提出EgoExoMoCap分布式框架,联合自我与外部中心多模态信号,利用头部等跟踪信号及DINOv3特征,能在复杂场景中稳健重建运动,突破了两种范式孤立的局限。

Comments Accepted by ECCV 2026, Project page and code: https://siplab.org/projects/EgoExoMoCap

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10878 2026-07-14 cs.AI cs.CL 新提交 62%

LOGOS: A Living Logic for AI Agent Teams That Evolve With Humans

LOGOS:一种与人类共同进化的人工智能代理团队的动态逻辑

Yuma Ichikawa, Yamato Arai, Kosaku Kimura, Akira Sakai, Hiromichi Kobashi

机构 * Fujitsu Limited(富士通有限公司) RIKEN Center for AIP(理化学研究所人工智能中心) The University of(某大学(原文未完整给出大学名称))

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 研究人工智能代理团队与人类共同进化的问题,提出LOGOS这一可插拔层,通过编译多模态输入、转换代理活动并应用验证,实现可验证的人机循环工程,为可问责自动化提供动态逻辑。

Comments 58 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08182 2026-07-10 cs.CV cs.AI 新提交 62%

LEEVLA: Seeing What Matters in Latent Environment Evolution for Vision-Language-Action

LEEVLA:在视觉-语言-动作的潜在环境演化中洞察关键要素

Qi Lyu, Baicheng Liu, Xudong Wang, Jiahua Dong, Lianqing Liu, Zhi Han

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对视觉-语言-动作模型难以应对复杂动态场景的问题,提出LEEVLA架构,引入漂移引导动态优先级和结构化特征流生成,构成“何处-如何”训练框架,实验表明该方法优于现有方法,强调了关键要素引导和结构化推理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05465 2026-07-08 cs.CV cs.AI 新提交 62%

CanvasAgent: Enabling Complex Image Creation and Editing via Visual Tool Orchestration

CanvasAgent:通过视觉工具编排实现复杂图像创建和编辑

Hairui Zhu, Yiying Yang, Tengjin Weng, Ziyu Lu, Xiao Yao, Xiaoyang Ye, Lin Ma, Wenhao Jiang

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究复杂图像创建编辑问题,提出CanvasAgent代理,通过多轮交互编排异构视觉工具,先经监督微调学习轨迹,再用广义信赖域策略优化器结合多种信号优化,结合CanvasCraft数据集进行实验,证明其对复杂多工具图像创建工作流程有效。

Comments 18pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16428 2026-07-07 cs.CL cs.AI cs.HC 新提交 62%

LectūraAgents: A Multi-Agent Framework for Adaptive Personalized AI-Assisted Learning and Embodied Teaching

LectūraAgents:面向自适应个性化AI辅助学习与具身教学的多智能体框架

Jaward Sesay, Yue Yu, Siwei Dong, Börje F. Karlsson

机构 * Beijing Institute of Technology(北京理工大学) Peking University(北京大学) Cornell University(康奈尔大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出LectūraAgents多智能体框架,通过层次化架构和自适应具身教学机制(如手势、高亮等)实现端到端个性化学习,并设计教学动作-语音对齐算法提升连贯性,在多个课程级别上优于现有方法。

Comments LecturaAgents TR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00547 2026-07-02 cs.CV cs.AI 新提交 62%

EgoGapBench: Benchmarking Egocentric Action Selection in Multi-Agent Scenes

EgoGapBench:多智能体场景中自我中心动作选择的基准测试

Jihyeok Jung, Jeewu Lee, Sanghyeop Kim, Chanhee Han, Seong Joon Oh

机构 * KAIST AI(韩国科学技术院人工智能研究所) Sogang University(成均馆大学) Ministry of Science and ICT(科学技术信息通信部)

专题命中 多模态Agent :MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出EgoGapBench基准,用于评估多智能体场景中的自我中心动作选择能力,发现多模态大语言模型表现远逊于人类,且现有自我中心数据微调无法弥合差距。

Comments 15 pages, 2 figures, 8 tables. Code and benchmark are available at https://github.com/jhCOR/EgoGapBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22948 2026-06-23 cs.AI cs.CV 新提交 62%

ENVS: Environment-Native Verified Search for Long-Horizon GUI Agents

ENVS:面向长程GUI智能体的环境原生验证搜索

Yincheng Zhou, Athena Zhuoming Zhong, Shijie Zhang, Kevin Zhang, Teresa Xiaotao Shang, Shanghang Zhang

机构 * University of Pennsylvania(宾夕法尼亚大学) Peking University(北京大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出ENVS方法,利用环境在训练时构建验证监督,通过分支搜索和全局平衡训练提升长程GUI任务性能,并引入OSWorld-Noisy基准测试抗干扰能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20643 2026-06-23 cs.AI cs.CV 新提交 62%

SPARC: A Multi-Agent System for Electrical Circuit Question Answering

SPARC:用于电路问答的多智能体系统

Mushtari Sadia, Zhenning Yang, Umme Habiba Lamia, Nishat Shawrin, Ang Chen, Amrita Roy Chowdhury

机构 * University of Michigan(密歇根大学) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出SPARC多智能体系统,通过可执行的物理仿真程序进行推理,在电路问答任务上实现83%准确率,较基线提升高达58%。

详情

展开后加载摘要…

URL PDF HTML 收藏