Automating the Enterprise with Foundation Models
专题命中 多模态Agent :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态Agent :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI
专题命中 多模态Agent :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.AI
专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV
Comments Tech Report
专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.AI
Comments 33pages, 4pages
专题命中 多模态Agent :multimodal(abstract);image-text(abstract);分类 cs.AI
专题命中 多模态Agent :multimodal(abstract);multi-modal(abstract);分类 cs.CV
Comments 15 pages, 5 figures
专题命中 多模态Agent :multimodal(abstract);multi-modal(abstract);分类 cs.CV
Comments Accepted at CVPR20
多任务扫描探针显微镜
专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract)
AI总结 该研究提出多任务扫描探针显微镜,基于多任务高斯过程的闭环工作流程,实现测量位置与模态的自主选择,在AlScN晶圆上验证了其可扩展主动学习应用的价值。
通过注意力集中进行偏好重定向:对计算机使用代理的一种攻击
机构 * Tübingen AI Center, University of Tübingen(图宾根大学图宾根人工智能中心)
专题命中 多模态Agent :multimodal(abstract);multimodal foundation model(abstract)
AI总结 本文提出PRAC攻击,通过重定向模型注意力操纵CUA选择过程,揭示了视觉模态的漏洞,威胁到基于开放权重模型的CUA安全。
Journal ref Conference on Language Modeling (COLM) 2026
MobileForge:基于分层反馈引导策略优化的移动GUI智能体免标注适配
专题命中 多模态Agent :MLLM(abstract,abstract_cn)
AI总结 提出MobileForge系统,通过MobileGym环境实现任务生成与评估,结合分层反馈引导策略优化(HiFPO)将轨迹结果、步骤反馈和修正提示转化为步骤级GRPO更新,实现移动GUI智能体免标注适配,在AndroidWorld上达到67.2% Pass@3。
Comments Project page: https://mobile-forge.github.io/
HAM-VLN:利用分层智能体记忆实现零样本视觉与语言导航
专题命中 多模态Agent :multimodal(abstract,abstract_cn)
AI总结 本研究提出HAM-VLN零样本VLN方法,通过分层智能体记忆缓解长程导航的记忆与推理瓶颈,提升导航指标并缩短上下文长度,在多个基准数据集上取得优异零样本性能。
GS-Agent:通过生成式模拟创建4D物理世界
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Genesis AI(创世纪人工智能公司)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 研究旨在从自然语言描述创建4D物理世界。核心方法是提出GS-Agent这一端到端多智能体框架,分解任务并让多智能体与物理引擎协作。主要贡献是能有效转换自然语言为物理合理的4D世界,实现相机和灯光控制,为新范式奠基。
VisualRepair:用于视觉软件问题修复的动态工具调用和区域聚焦
专题命中 多模态Agent :multimodal(abstract);MLLM(abstract)
AI总结 针对现代软件视觉信息利用难题,提出VisualRepair框架,通过图像类型感知工具调用和动态测试时区域聚焦两模块,在SWE-bench基准测试中性能超现有方法,有效提升自动视觉软件问题修复能力。
Comments The paper was completed in March 2026 and is currently under review. The code will be released upon acceptance
RynnWorld-4D:用于机器人操作的4D具身世界模型
机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) ; Hong Kong Embodied AI Lab(香港具身人工智能实验室) ; CUHK(香港中文大学) ; Hupan Lab(湖畔实验室)
专题命中 多模态Agent :multi-modal(abstract);cross-modal(abstract)
AI总结 研究针对开放世界机器人操作,提出RynnWorld-4D生成模型,通过RGB-DF捕捉4D动态,其具三分支架构,还整理数据集并提出RynnWorld-4D-Policy,实验证明该模型在时空预测及实际操作任务中表现出色。
Comments Project Page: https://alibaba-damo-academy.github.io/RynnWorld-4D.github.io, Github: https://github.com/alibaba-damo-academy/RynnWorld-4D
辩论者混合:在多智能体推理中实现架构级别的辩论学习
专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI、cs.MM
AI总结 提出Mixture of Debaters框架,通过混合专家范式在单一模型内实现动态自我辩论,解决静态架构和高计算开销问题,在多项基准上以更低延迟和令牌消耗取得更优性能。
MemGUI-Agent: 一种具有主动上下文管理的端到端长时移动GUI智能体
专题命中 多模态Agent :MLLM(abstract,abstract_cn)
AI总结 提出MemGUI-Agent,通过主动上下文管理机制(ConAct)将上下文管理作为一等动作,解决长时任务中提示膨胀和关键信息稀释问题,在8B模型上达到最佳性能。
Comments 33 pages, 6 figures. Project page: https://memgui-agent.github.io/
面向计算机使用代理的历史感知视觉基础批评家
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Capital One ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 提出HiViG框架,通过历史感知的视觉基础多模态批评家,在测试时评估动作并拦截错误,在多个GUI基准上提升成功率。
Comments Code: https://github.com/G-JWLee/HiViG
超越API:探索多模态大语言模型在物理工具使用中的极限
机构 * Singapore Management University(新加坡管理大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 提出PhysTool-Bench基准,评估多模态大语言模型在真实场景中识别物理工具并规划使用的能力,发现最强模型仅完成21%任务,揭示感知与规划双重缺陷。
ESI-Bench: 迈向闭环感知-动作的具身空间智能
机构 * Stanford University(斯坦福大学) ; UCLA(加州大学洛杉矶分校) ; Northwestern University(西北大学)
专题命中 多模态Agent :MLLM(abstract_cn);分类 cs.CV、cs.CL、cs.AI
AI总结 提出ESI-BENCH基准,通过主动探索(感知、移动、操作)在OmniGibson环境中评估具身空间智能,发现主动探索显著优于被动方法,失败主因是动作盲视而非感知弱,且模型存在元认知差距。
Comments https://esi-bench.github.io/
CosFly:矩阵中的计划,世界中的飞行
机构 * Autel Robotics(Autel机器人公司) ; Nanjing University(南京大学) ; Peking University(北京大学) ; Southern University of Science and Technology(南方科技大学) ; University of Hong Kong(香港大学)
专题命中 多模态Agent :multimodal(abstract);multi-modal(abstract)
AI总结 本文提出CosFly,一个用于空中跟踪的盒状结构规划和多模态模拟流程,以及CosFly-Track大规模无人机数据集,用于在多样环境中动态目标跟踪。CosFly通过将复杂的3D世界转换为结构化障碍表示进行规划,然后将轨迹投影到多模态传感器数据中,并支持可配置的固定视角缩放级别。
Video2GUI:合成大规模交互轨迹用于通用GUI代理预训练
机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机科学学院,北京大学) ; The University of Hong Kong(香港大学) ; Renmin University of China(中国人民大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出Video2GUI框架,通过自动提取互联网视频中的GUI交互轨迹,生成大规模数据集WildGUI,提升了GUI代理的泛化能力。
Comments Accepted at ICML 2026
视觉-语言-动作安全性:威胁、挑战、评估与机制
机构 * National University of Singapore(新加坡国立大学) ; Monash University(墨尔本大学) ; Peking University(北京大学)
专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract)
AI总结 本文探讨了视觉-语言-动作模型的安全性问题,分析了其在训练和推理阶段的威胁与防御机制,总结了评估方法及六个部署领域的安全挑战。
门控协调:Minecraft游戏中的高效多智能体协作
专题命中 多模态Agent :MLLM(abstract,abstract_cn)
AI总结 本文提出门控协调机制,通过分离私有状态与公共协调状态,减少通信噪声,提升多智能体在Minecraft中的协作效率与任务完成质量。
UI-Copilot: 通过工具集成策略优化推进长周期GUI自动化
机构 * Zhejiang University(浙江大学) ; Apple(苹果公司) ; Tencent(腾讯)
专题命中 多模态Agent :MLLM(abstract,abstract_cn)
AI总结 本文提出UI-Copilot框架,通过分离持久观察与临时执行上下文实现内存解耦,结合工具集成策略优化提升长周期GUI任务性能,实验显示其在MemGUI-Bench和AndroidWorld上均优于现有模型。
UI-AGILE: 通过有效的强化学习和精确的推理时间接地提升GUI代理
机构 * Sino-Russian Research Center for Digital Economy(中俄数字经济研究中心)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 UI-AGILE通过改进监督微调过程和推理中的分解接地,提升了GUI代理的接地性能和通用能力,在ScreenSpot-Pro和ScreenSpot-v2基准上实现了最佳表现,地面准确率提升23%。
一个不够:人们如何在日常生活中使用多个AI模型
专题命中 多模态Agent :multimodal(abstract);MLLM(abstract)
AI总结 研究探讨了人们如何在日常生活中协调多个多模态大语言模型,揭示用户构建模型层级和切换策略以优化任务效率与输出可信度。
Comments Accepted as a poster at CHI 2026
聚焦本质:通过推断界面元素实现无训练GUI接地
专题命中 多模态Agent :multimodal(abstract);MLLM(abstract)
AI总结 本文提出ZoomUI,通过推断界面元素实现无训练GUI接地,利用推理缩放引导常见MLLM逐步锚定指令元素到更详细的界面元素,提升GUI代理性能。
基于基础模型的具身AI在移动服务机器人中的应用:系统综述
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文系统综述了基础模型在移动服务机器人中的应用,探讨了其在具身AI中的整合、核心挑战及未来研究方向。
Comments v2: Expanded systematic review; resubmitted to Robotics
Journal ref Robotics 2026, 15(3), 55
Pixel2Phys: 从视觉动态中提炼 governing laws
专题命中 多模态Agent :multimodal(abstract);MLLM(abstract)
AI总结 Pixel2Phys通过协作多智能体框架从视觉动态中自动提炼物理定律,实现从高维数据到简洁可解释方程的转化。
Comments CVPR2026 main track