Efficient Bayesian inference for multimodal problems in cosmology
专题命中 多模态Agent :multimodal(title)
Comments 7 pages, 8 figures, changed to match version accepted by MNRAS
Journal ref Mon.Not.Roy.Astron.Soc.378:1365-1370,2007
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态Agent :multimodal(title)
Comments 7 pages, 8 figures, changed to match version accepted by MNRAS
Journal ref Mon.Not.Roy.Astron.Soc.378:1365-1370,2007
Act2Intention:通过从GUI操作推断用户意图开发主动移动智能体的基准
专题命中 多模态Agent :multimodal(abstract);MLLM(abstract_cn);分类 cs.AI
AI总结 本文提出Act2Intention框架及基准数据集,构建主动移动智能体,经实验验证该基准可显著提升智能体意图理解、预测与执行性能,为主动智能体研究提供标准化平台。
ActFER: 通过主动工具增强的视觉推理实现代理面部表情识别
专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 ActFER通过主动视觉证据获取和多模态推理提升面部表情识别,采用UC-GRPO算法优化局部检查和情绪感知,实验显示其在AU预测准确率上显著优于传统方法。
Comments 10 pages, 7 figures
VOS-Agent:第8届LSVOS挑战赛(MOSEv2赛道)的第一名解决方案
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Nanyang Technological University(南洋理工大学) ; Shenzhen Loop Area Institute(深圳河套学院)
专题命中 多模态Agent :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 针对复杂视频目标分割中微小目标、语义主导目标的稳健传播难题,本文提出VOS-Agent协作框架,以SAM3为共享密集分割模块,根据目标特征激活专用智能体,在ECCV 2026第8届LSVOS挑战赛MOSEv2赛道获第一名,J&JF指标达69.82%。
Comments 1st Place Solution for the 8th LSVOS MOSEv2 Challenge (ECCV 2026 Workshop)
SkillLens:用于检索增强型GUI动作预测与在线策略蒸馏的可视化技能卡片
专题命中 多模态Agent :multimodal(abstract,abstract_cn);分类 cs.AI
AI总结 SkillLens提出可视化技能卡片(VSCs),结合轨迹转卡片方法与检索增强机制,在两个多模态网页基准上提升了冻结GPT-5.4-mini执行器及Qwen3-VL-2B学生模型的GUI动作预测性能。
用于具身操纵的数据金字塔
机构 * PKU(北京大学) ; NTU(南洋理工大学) ; HKUST(香港科技大学) ; NUS(新加坡国立大学) ; CUHK(香港中文大学) ; HKU(香港大学) ; Duke(杜克大学) ; UCB(加州大学伯克利分校) ; GBU(未提及具体中文名的机构) ; NJU(南京大学) ; SJTU(上海交通大学)
专题命中 多模态Agent :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV
AI总结 研究围绕具身操纵数据生态系统展开,构建跨越五个互补数据源的“数据金字塔”,通过数据配方分析具身基础模型,将数据组成与多种能力联系起来,并讨论了六个开放挑战,为下一代具身系统设计奠定基础。
Comments Awesome Embodied Data Pyramid; Project Page at https://jasper-aaa.github.io/embodied-data-pyramid/ GitHub Repo at https://github.com/worldbench/awesome-embodied-data-pyramid
NormAct:具身规划中隐藏社会规范遵守的基准
机构 * State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(通用人工智能国家重点实验室,北京通用人工智能研究院) ; China Academy of Information and Communications Technology(中国信息通信研究院) ; ShanghaiTech University(上海科技大学)
专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.AI
AI总结 提出NormAct基准,评估多模态大语言模型在具身规划中遵守隐藏社会规范的能力,发现模型在67.3%情况下达成显式目标,但仅26.4%遵守隐藏规范;提出NormPerceptor方法将任务成功率从24.2%提升至46.7%。
Comments This version revises the paper content and adds substantial details on the benchmark design and experimental setup
视觉工具使用的错觉:对图像思考的因果审查
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 多模态Agent :multimodal(abstract,abstract_cn);分类 cs.AI
AI总结 本文通过因果审查方法,发现多模态大语言模型的视觉工具使用存在“调用而不查看”“查看而不规划”等错觉,整体准确率增益下大量场景无因果效果。
Metis:记忆基础模型
机构 * MemTensor (Shanghai) Technology Co., Ltd.(墨芯(上海)科技有限公司) ; Renmin University of China(中国人民大学) ; National University of Singapore(新加坡国立大学) ; Shanghai Jiao Tong University(上海交通大学) ; Tongji University(同济大学)
专题命中 多模态Agent :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CL
AI总结 该研究提出首个记忆基础模型原型Metis,赋予基础模型原生记忆能力,通过新架构与优化目标实现,经实验验证其具备原生记忆能力并发布相关资源。
Comments 46 pages, 11 figures, 16 tables
SeekBrain:用于加速神经科学发现的自主多智能体系统
专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 SeekBrain是用于加速神经科学发现的自主多智能体框架,通过分层规划与跨模态分析生成分析流程,在BrainArena基准上优于现有智能体,实际研究中成功揭示了斑马鱼与小鼠的神经表征规律。
医学中的智能体人工智能:临床转化的架构、应用、评估及挑战
机构 * School of Software Engineering, Dalian University(大连大学软件工程学院) ; Affiliated Zhongshan Hospital of Dalian University(大连大学附属中山医院) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; University of California, San Francisco(加州大学旧金山分校) ; Yale University(耶鲁大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 多模态Agent :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV
AI总结 研究探讨医学中智能体人工智能的架构、应用等,通过范围审查筛选相关研究,指出其范围未定论且评估与临床需求不符,证据基础有限,临床转化需更清晰定义、可重复评估等。
Comments Review article, 6 figures, 2 tables. 42 pages
不应学习的地方:基于子集归因约束的先验对齐训练以实现可靠的决策制定
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) ; Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) ; Communication University of China(中国传媒大学) ; Imperial College London(伦敦帝国学院) ; School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络科学与技术学院)
专题命中 多模态Agent :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出了一种基于归因的先验对齐方法,通过子集选择归因技术约束模型依赖于人类先验区域,从而提升决策的可靠性。
基于工具增强证据的多智能体协作推理用于城市区域剖析
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; University of Washington(华盛顿大学) ; Chang’an University(长安大学) ; University of Wisconsin - Madison(威斯康星大学麦迪逊分校)
专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 研究针对城市区域剖析问题,提出UrbanAgent框架,通过多智能体协作推理解决跨模态不一致,将指标预测扩展为闭环过程,经实验验证其性能优于现有基线,在未见城市设置中有强泛化性。
Comments Accepted by KDD 2026
一次前向胜过两次:InnerZoom 实现准确高效的 GUI 定位
机构 * Alibaba Group(阿里巴巴集团) ; Tongyi Lab(通义实验室) ; University of Technology Sydney(悉尼大学) ; Adelaide University(阿德莱德大学)
专题命中 多模态Agent :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出 InnerZoom 框架,通过跨层证据桥接在单次前向传播中实现精确 GUI 元素定位,无需额外裁剪重跑,在六个基准上达到最优性能,同时降低延迟和计算量。
USS: 面向具身视觉跟踪的统一空间-语义提示与潜在动力学学习
机构 * Nanyang Technological University(南洋理工大学)
专题命中 多模态Agent :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出统一空间-语义提示范式替代纯文本目标指示,设计端到端框架USS支持多种提示类型,通过潜在世界模型提升时序鲁棒性,在真实机器人实验中优于纯文本方法。
Colon-Bench:一种用于全流程结肠镜视频中可扩展密集病变标注的智能工作流
机构 * King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹科学与技术大学)
专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 提出Colon-Bench,通过多阶段智能工作流实现全流程结肠镜视频的密集病变标注,包含528个视频、14类病变、30万+边界框等,并评估多模态大模型在病变分类、开放词汇视频目标分割和视频视觉问答上的性能。
Comments published at MICCAI 2026
Skill-3D:面向智能体3D空间推理的场景感知技能进化
机构 * Zhejiang University(浙江大学) ; University of Technology Sydney(技术悉尼大学) ; OPPO Research Institute(OPPO研究院)
专题命中 多模态Agent :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出Skill-3D框架,通过场景记忆和技能库的协同进化,使智能体根据场景自适应选择工具,显著提升3D空间推理中工具使用的正确性和充分性。
AlloSpatial:基础模型中空间推理的智能体框架
机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院) ; Huawei Noah’s Ark Lab(华为诺亚方舟实验室) ; University of Science and Technology Beijing(北京科技大学)
专题命中 多模态Agent :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI
AI总结 提出AlloSpatial框架,通过World2Mind认知映射沙箱将自我中心观察转化为异中心空间先验,并利用空间推理工具实现几何语义仲裁,在VSI-Bench和MindCube上提升模型5%-18%的空间推理性能。
Agent规划基准:LLM Agent规划能力的诊断框架
机构 * Tongji University(同济大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Harbin Institute of Technology(哈尔滨工业大学) ; Fudan University(复旦大学) ; Skywork AI ; University of California, Santa Cruz(加州大学圣克鲁兹分校) ; Shanghai Jiao Tong University(上海交通大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 多模态Agent :multimodal(abstract);MLLM(abstract_cn);分类 cs.CL
AI总结 提出Agent规划基准(APB),通过4209个多模态案例和五个设置,诊断LLM Agent在长程规划、工具噪声鲁棒性、校准拒绝和推理时改进方面的系统弱点。
HLL:智能体能否跨越人类最后一道验证防线?
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shandong University(山东大学) ; Tongji University(同济大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 提出HLL基准,通过交互式CAPTCHA验证评估多模态智能体在受保护工作流中替代人类的能力,发现当前智能体在定位、动作校准、状态跟踪和过程一致性方面存在脆弱性。
Comments 27 pages, 14 figures
iVGR: 通过强化学习将视觉基础推理内化到多模态大语言模型中
机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室) ; Independent Researcher(独立研究者) ; University of Science and Technology of China(中国科学技术大学)
专题命中 多模态Agent :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV
AI总结 提出iVGR框架,利用强化学习和双流训练策略将视觉定位能力内化到文本推理中,避免显式视觉基础在推理时的干扰,提升细粒度感知性能。
Comments Accepted by ICML 2026
DGSG-Mind:用于长期场景理解与定位的动态3D高斯场景图
机构 * School of Computer Science, Beijing Institute of Technology, China(北京理工大学计算机科学学院)
专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出DGSG-Mind,一种混合实例感知的3D高斯动态场景图系统,通过概率体素网格与显式3D高斯结合实现鲁棒的跨模态实例融合和增量语义映射,并构建层次化场景图与3D高斯思维进行多模态推理,在零样本3D视觉定位、开放词汇语义分割和场景重建中取得领先性能。
Comments 9 pages, 6 figures
VLA-Trace: 通过表示与行为追踪诊断视觉-语言-动作模型
机构 * University of Science and Technology of China(中国科学技术大学) ; University of Manchester(曼彻斯特大学) ; Beihang University(北航) ; Fudan University(复旦大学) ; University of New South Wales(新南威尔士大学)
专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 提出VLA-Trace诊断框架,通过表示演化、因果控制归因和行为表现分析,揭示VLA模型在多模态知识向具身控制转化中的机制,发现不同模型在微调适应、多模态路由和语义遵循上的差异与局限。
GUITestScape:面向探索性GUI测试的开放集评估
机构 * Beijing Jiaotong University(北京交通大学) ; Independent Researcher(独立研究者)
专题命中 多模态Agent :MLLM(abstract,abstract_cn);分类 cs.AI
AI总结 提出GUITestScape基准和GUIJudge评估器,通过覆盖交互与显示缺陷的508个预设缺陷及过程感知评估方法,解决现有GUI测试评估局限于预定义标注和交互缺陷的问题。
CyberJurors:电商纠纷裁决的多智能体模拟任务
机构 * School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学)
专题命中 多模态Agent :multimodal(abstract);MLLM(abstract_cn);分类 cs.AI
AI总结 针对电商纠纷裁决需要从冗余多轮多模态证据中提取关键线索并依据平台特定惯例决策的问题,提出多智能体框架CyberJurors,通过个体裁决链式思维和集体陪审共识裁决提升裁决质量,在包含6000真实案例的基准上超越现有方法。
Comments ICML 2026
Uni-LaViRA:面向统一具身导航的语言-视觉-机器人动作翻译
机构 * Nanjing University(南京大学) ; Beihang University(北京航空航天大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; BMW (Nanjing) Information Technology Co., Ltd.(宝马(南京)信息技术有限公司) ; University of Rochester(罗切斯特大学)
专题命中 多模态Agent :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV
AI总结 提出Uni-LaViRA统一智能体架构,通过语言-视觉-机器人动作翻译结构,结合待办列表记忆和二次机会回溯机制,在零训练下实现四类导航任务和四种真实机器人的零样本泛化,性能匹配或超越近期训练式导航基础模型。
Comments Project page: https://xetroubadour.github.io/Uni-LaViRA/
面向可靠胎儿超声解读的多智能体协作
机构 * Tsinghua University(清华大学) ; University of California San Diego(加州大学圣地亚哥分校) ; West China Second University Hospital, Sichuan University(四川大学西昌医学院)
专题命中 多模态Agent :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV
AI总结 提出FetUSAgents多智能体系统,通过协作LLM代理和双路径证据仲裁(DPEA)整合视觉工具与临床推理,在胎儿超声VQA、报告生成等任务上超越最强基线25%以上。
WorldArena 2.0: 扩展模态、功能和平台的具身世界模型基准测试
机构 * Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学) ; Stanford University(斯坦福大学) ; The University of Hong Kong(香港大学) ; Princeton University(普林斯顿大学) ; Chinese Academy of Sciences(中国科学院) ; University of Science and Technology of China(中国科学技术大学) ; Peking University(北京大学) ; National University of Singapore(新加坡国立大学)
专题命中 多模态Agent :multimodal(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出WorldArena 2.0,扩展了具身世界模型的评估,涵盖模态、功能和平台三个维度,提供全面的测试平台以评估具身世界模型的进展。
通过观察上下文压缩实现高效终端智能体的自进化框架
机构 * University of Manchester(曼彻斯特大学) ; MAP 4 HKUST(GZ)(香港科技大学(广州)MAP 4) ; HKUST(香港科技大学) ; Beihang University(北京航空航天大学)
专题命中 多模态Agent :multimodal(abstract,abstract_cn);分类 cs.CL
AI总结 本文提出TACO框架,通过自进化压缩规则提升终端智能体的效率与性能,实验表明在多个基准测试中均取得显著提升。
Comments 27 pages
DRS-GUI: 动态区域搜索用于无训练的GUI定位
机构 * Nankai University(南开大学) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
专题命中 多模态Agent :multimodal(abstract);MLLM(abstract_cn);分类 cs.AI
AI总结 DRS-GUI通过动态区域搜索框架提升GUI定位性能,利用轻量级UI感知器和MCTS动作规划器,实现高效区域探索与筛选,提升多模态大语言模型的定位能力。
Comments 11 pages, 8 figures