Vision-and-Dialog Navigation
专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Conference on Robot Learning (CoRL) 2019
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Conference on Robot Learning (CoRL) 2019
机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) ; Hupan Lab(虎盘实验室) ; Zhejiang University(浙江大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI;MLLM(comments)
Comments The technical report of RynnEC, an embodied cognition MLLM
UI-Mate:利用上下文内演示推进开放权重基础图形用户界面智能体
机构 * Tencent Hy Frontier Team(腾讯 Hy 前沿团队)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 UI-Mate是集成环境基训练栈与上下文内演示学习的GUI智能体,在多计算机使用基准上创开放权重SOTA,提升了长周期办公任务的执行可靠性
Comments UI-Mate Technical Report. Project page: https://ui-mate.github.io
OpenVisTool:用于合成具有指导性的视觉工具使用轨迹的开源方案
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 本研究提出OpenVisTool框架,构建含因果监督的视觉工具使用轨迹数据集OpenVisTool-42K,微调后模型视觉工具使用性能提升,大模型接近领先闭源系统。
ToolVision:通过能力对齐监督学习何时以及如何使用视觉工具
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 针对多模态模型工具使用监督错位问题,提出ToolVision方法,通过能力对齐的SFT与RL监督优化工具使用学习,在多个视觉基准上实现性能提升并将公开发布相关资源。
Comments 18 pages, 13 figures
VTO:面向视频异常检测的可视化工具编排
机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; School of Digital Media & Design Art(数字媒体与设计艺术学院)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 针对视频异常检测中传统方法泛化差、多模态智能体工具编排难的问题,提出过程监督强化学习框架VTO,结合VAD-Tool工具集,在工具调度上较基线提升10.2%。
Comments Accepted by ACM MM 2026
STEMMA:用于评估大语言模型(LLM)自我身份一致性的对抗性多智能体框架
专题命中 多模态Agent :multi-modal(abstract);分类 cs.CL、cs.AI
AI总结 本研究针对LLM自我身份一致性评估问题,提出对抗性多智能体框架STEMMA,结合手动设计的对抗性提示开展实验,发现多数LLM存在自我表征不一致的问题。
Comments 15 pages
OpenForgeRL:在任何环境中训练原生利用工具的智能体
机构 * Columbia University(哥伦比亚大学) ; Dartmouth College(达特茅斯学院) ; Microsoft Research(微软研究院)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 研究针对现代AI智能体依赖复杂推理工具难端到端训练的问题,提出OpenForgeRL框架,通过轻量级代理和Kubernetes编排器,在多环境下对基于工具的智能体端到端训练,验证了框架效果并分析了工具选择和RL对智能体行为的影响。
Comments added github link
通过模态差距感知自蒸馏从符号状态学习视觉空间规划
机构 * Tsinghua University(清华大学) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出MGSD两阶段框架,通过冷启动接地和特权教师蒸馏弥合视觉与符号规划之间的模态差距,在视觉规划基准上显著提升性能。
Comments 18 pages, preprint
Kimi K2.5:视觉代理智能
机构 * Kimi Team(Kimi 团队)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 Kimi K2.5通过联合优化文本和视觉模态,提出Agent Swarm框架,实现多模态代理智能的先进性能和高效任务处理。
Comments Kimi K2.5 tech report
OneDayAgent:面向自主智能体的长程管控框架
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 OneDayAgent是一种长程管控框架,可将开放式请求分解为子任务,在不同后端LLMs上实现最优性能,解决智能体的多类失效模式。
Comments Ongoing work
SVRepair: 结构化视觉推理用于自动化程序修复
机构 * Ant Group(蚂蚁集团) ; Zhejiang Key Laboratory of Accessible Perception and Intelligent Systems(浙江可感知智能系统重点实验室)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 SVRepair 通过结构化视觉表示框架,结合多模态信息提升程序修复的准确性与效率。
WebCoach:具有跨会话记忆引导的自我进化网络代理
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Amazon(亚马逊)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 研究针对网页代理跨会话学习不足问题,提出WebCoach框架,通过三个关键组件赋予代理跨会话记忆,可长期规划与自我进化,在WebVoyager基准测试中提升了不同LLM backbone的代理性能。
Comments 18 pages
EgoExoMoCap:分布式自我-外部人体运动捕捉
机构 * Meta Reality Labs(元现实实验室) ; ETH Zürich(苏黎世联邦理工学院)
专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 针对头戴式设备人体运动捕捉,提出EgoExoMoCap分布式框架,联合自我与外部中心多模态信号,利用头部等跟踪信号及DINOv3特征,能在复杂场景中稳健重建运动,突破了两种范式孤立的局限。
Comments Accepted by ECCV 2026, Project page and code: https://siplab.org/projects/EgoExoMoCap
Crayotter: 用于长视频编辑的可追踪多智能体工作流
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 提出Crayotter,一个开源多模态多智能体系统,通过三阶段工作流(材料准备、基于工件的编辑研究、工具驱动的执行)实现长视频编辑的可追踪性和选择性修订,在人类评估中优于基线方法。
Comments 10 pages, 5 figures
LOGOS:一种与人类共同进化的人工智能代理团队的动态逻辑
机构 * Fujitsu Limited(富士通有限公司) ; RIKEN Center for AIP(理化学研究所人工智能中心) ; The University of(某大学(原文未完整给出大学名称))
专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 研究人工智能代理团队与人类共同进化的问题,提出LOGOS这一可插拔层,通过编译多模态输入、转换代理活动并应用验证,实现可验证的人机循环工程,为可问责自动化提供动态逻辑。
Comments 58 pages, 14 figures
LEEVLA:在视觉-语言-动作的潜在环境演化中洞察关键要素
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究针对视觉-语言-动作模型难以应对复杂动态场景的问题,提出LEEVLA架构,引入漂移引导动态优先级和结构化特征流生成,构成“何处-如何”训练框架,实验表明该方法优于现有方法,强调了关键要素引导和结构化推理的重要性。
CanvasAgent:通过视觉工具编排实现复杂图像创建和编辑
机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究复杂图像创建编辑问题,提出CanvasAgent代理,通过多轮交互编排异构视觉工具,先经监督微调学习轨迹,再用广义信赖域策略优化器结合多种信号优化,结合CanvasCraft数据集进行实验,证明其对复杂多工具图像创建工作流程有效。
Comments 18pages, 5 figures
SWITCH:在长时程具身场景中评估和处理具象接口的基准测试
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 SWITCH基准测试通过1170个时间交互视频,评估具象接口在真实第一人称环境中的闭环交互推理,揭示多模态模型在细粒度视觉-时间感知、结果验证和错误恢复方面的不足。
Comments The dataset is available at https://huggingface.co/datasets/BAAI-Agents/SWITCH
LectūraAgents:面向自适应个性化AI辅助学习与具身教学的多智能体框架
机构 * Beijing Institute of Technology(北京理工大学) ; Peking University(北京大学) ; Cornell University(康奈尔大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 提出LectūraAgents多智能体框架,通过层次化架构和自适应具身教学机制(如手势、高亮等)实现端到端个性化学习,并设计教学动作-语音对齐算法提升连贯性,在多个课程级别上优于现有方法。
Comments LecturaAgents TR
EgoGapBench:多智能体场景中自我中心动作选择的基准测试
机构 * KAIST AI(韩国科学技术院人工智能研究所) ; Sogang University(成均馆大学) ; Ministry of Science and ICT(科学技术信息通信部)
专题命中 多模态Agent :MLLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 提出EgoGapBench基准,用于评估多智能体场景中的自我中心动作选择能力,发现多模态大语言模型表现远逊于人类,且现有自我中心数据微调无法弥合差距。
Comments 15 pages, 2 figures, 8 tables. Code and benchmark are available at https://github.com/jhCOR/EgoGapBench
REMSA:通过约束感知代理进行遥感基础模型选择
机构 * Humboldt-Universität zu Berlin(柏林洪堡大学) ; U AI(5U AI) ; Technische Universität Berlin & BIFOLD(柏林工业大学 & BIFOLD)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出REMSA,一种基于结构化数据库RS-FMD的约束感知代理,通过自然语言查询自动选择遥感基础模型,结合元数据检索与上下文学习,在专家评估基准中优于多种基线。
Comments Code and data available at https://github.com/be-chen/REMSA
人机协作的论文到网页制作
机构 * AutoLab, SAI, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab实验室) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 提出AutoPage多智能体系统,通过粗到细的流水线将论文转化为交互式网页,并引入Checker智能体验证和人工检查点,在15分钟内以低于0.1美元的成本生成高质量网页。
Comments Accepted by ACL2026 Findings
当停止失效:通过人机交互自动驾驶重新思考安全交通系统的最小风险条件
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 分析自动驾驶车辆因停止行为导致的交通阻塞、应急干扰等事故,提出需从被动策略转向人机交互自主性,增强感知、规划与控制能力。
Comments 8 pages, 1 figure, Accepted to IEEE ITSC 2026
ENVS:面向长程GUI智能体的环境原生验证搜索
机构 * University of Pennsylvania(宾夕法尼亚大学) ; Peking University(北京大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出ENVS方法,利用环境在训练时构建验证监督,通过分支搜索和全局平衡训练提升长程GUI任务性能,并引入OSWorld-Noisy基准测试抗干扰能力。
SPARC:用于电路问答的多智能体系统
机构 * University of Michigan(密歇根大学) ; Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出SPARC多智能体系统,通过可执行的物理仿真程序进行推理,在电路问答任务上实现83%准确率,较基线提升高达58%。
下一代验证码:利用认知差距实现可扩展且多样化的GUI智能体防御
机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) ; MetaAgentX ; University College London(伦敦大学学院)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 提出Next-Gen CAPTCHAs框架,通过利用人机在交互感知、记忆、决策和行动上的认知差距,设计动态任务以区分生物用户与AI智能体,实现可扩展的防御。
Comments Project page at https://greenoso.github.io/NextGen-CAPTCHAs_webpage/
DeALOG: 去中心化多智能体日志中介推理框架
机构 * Arizona State University(亚利桑那州立大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 提出去中心化多智能体框架DeALOG,通过共享自然语言日志实现多模态问答,各专业智能体协作检测和验证错误,无需中央控制,提升鲁棒性。
MagicSim: 可执行具身交互的统一基础设施
机构 * Northwestern University(西北大学) ; Peking University(北京大学) ; University of California, Berkeley(加州大学伯克利分校) ; ShanghaiTech University(上海科技大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出MagicSim,一个基于确定性批处理运行时和共享MDP的具身交互基础设施,通过YAML规范解耦内容、放置、行为和智能体暴露,统一世界构建、执行、评估和自动生成轨迹。
VisualClaw:面向物理世界的实时个性化智能体
机构 * UC Santa Cruz(加州大学圣克鲁兹分校) ; UNC-Chapel Hill(北卡罗来纳大学教堂山分校) ; Google(谷歌) ; UC Berkeley(加州大学伯克利分校)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 提出VisualClaw,一种自进化多模态智能体,通过混合编码和技能进化机制降低部署成本并提升准确性,在多个视频QA基准上实现平均-98%的API成本削减和最高+15.80%的准确率提升。
Comments H. T. and J. C. contribute to this project equally