AtomVLA: Scalable Post-Training for Robotic Manipulation via Predictive Latent World Models
AtomVLA: 通过预测性潜在世界模型实现机器人操作的可扩展后训练
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 AtomVLA通过预测性潜在世界模型实现机器人操作的可扩展后训练,提升长时间任务的鲁棒性与效率。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
AtomVLA: 通过预测性潜在世界模型实现机器人操作的可扩展后训练
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 AtomVLA通过预测性潜在世界模型实现机器人操作的可扩展后训练,提升长时间任务的鲁棒性与效率。
CompanionCast:迈向多智能体系统在共享体验中的社会协作
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Dolby Laboratories, Inc.(杜比实验室)
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 CompanionCast通过多智能体系统提升共享体验中的社会协作,通过多模态检测、上下文缓存和空间音频增强共在感,实验显示其在体育观看中显著提升社会存在感和情感共享。
Comments Accepted at ACM CHI 2026 Workshop on Human-Agent Collaboration
学习何时观察:按需关键点-视频融合用于动物行为分析
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 LookAgain通过按需视觉定位结合关键点与视频数据,实现高效且低计算成本的动物行为分析。
T2Nav 基于代数拓扑的时序图记忆与循环检测用于零样本视觉导航
机构 * International School, Vietnam National University, Hanoi, Vietnam(越南国家大学河内国际学校) ; Hanoi University of Science, Vietnam National University, Hanoi, Vietnam(越南国家大学河内科学大学) ; Hanoi University of Science and Technology, Hanoi, Vietnam(河内科学技术大学) ; Cognitive Robotics Lab, Department of Electrical Engineering and Computer Science, University of Arkansas, Fayetteville, AR, USA(美国阿肯色大学富尔顿分校电气工程与计算机科学系认知机器人实验室) ; University of Arkansas, Fayetteville, AR, USA(美国阿肯色大学富尔顿分校)
专题命中 视觉定位与Grounding :vision language model(abstract)
AI总结 T2Nav通过整合异构数据和基于图的推理,实现零样本视觉导航,具备高效探索和路径规划能力,适用于视觉相似但空间不同的目标实例导航。
Journal ref EEE International Conference on Robotics & Automation 2026 (ICRA)
HybridMimic: 人形机器人运动模仿的混合强化学习-质心控制
机构 * Department of Computer Science, Purdue University(普渡大学计算机科学系) ; School of Mechanical Engineering, Purdue University(普渡大学机械工程学院)
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 HybridMimic通过结合强化学习与质心模型控制,有效提升人形机器人在分布外环境下的运动模仿性能。
文本到自动机图:比较TikZ代码生成与直接图像合成
机构 * Marshall University(马歇尔大学) ; West Virginia State University(西弗吉尼亚州立大学)
专题命中 文档图表理解 :vision-language model(abstract);vision language model(abstract);分类 cs.CV
AI总结 本研究比较了通过视觉-语言模型生成TikZ代码与直接图像合成在生成自动机图描述中的效果,发现人工修正能显著提高生成准确性。
Comments Accepted to ASEE North Central Section 2026
在文档问答场景中,大型语言模型会有多大的幻觉?一项跨温度、上下文长度和硬件平台的1720亿token研究
机构 * Kamiwaza AI
专题命中 文档图表理解 :grounding(abstract);分类 cs.AI
AI总结 研究通过大规模评估揭示了大型语言模型在文档问答中幻觉率与温度、上下文长度及硬件平台的关系,发现模型选择和温度设置显著影响准确性与伪造率。
Comments 18 pages, 12 tables, 2 figures
DocCogito: 对齐布局认知与分步 grounded 推理以实现文档理解
机构 * Fudan University(复旦大学)
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV
AI总结 DocCogito通过整合布局感知与结构化推理,提升文档理解的准确性和推理过程的系统性。
TIQA: 生成图像中的人工对齐文本质量评估
机构 * Lomonosov Moscow State University(洛蒙诺索夫莫斯科国立大学) ; ISP RAS Research Center for Trusted Artificial Intelligence(俄罗斯科学院信息与系统研究所在可信人工智能领域研究中心) ; MSU Institute for Artificial Intelligence(莫斯科大学人工智能研究所)
专题命中 文档图表理解 :VLM(abstract);分类 cs.CV
AI总结 TIQA通过ANTIQA方法提升生成图像中文本质量评估的准确性,有效提高文本生成任务的过滤与重排序性能。
Chart-RL: 通过可验证奖励的强化学习实现通用图表理解
机构 * Oracle AI
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.LG
AI总结 Chart-RL通过可验证奖励的强化学习提升图表理解能力,在多个基准测试中超越监督微调,展现强大的泛化和迁移能力。
NaviTrace: 评估视觉-语言模型的具身导航
机构 * Robotic Systems Lab, ETH Zurich(苏黎世联邦理工学院机器人系统实验室) ; Intuitive Robots Lab, KIT(卡尔斯鲁厄理工学院直观机器人实验室) ; FZI Research Center for Information Technology(弗劳恩霍夫信息技术研究中心)
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);visual question answering(abstract);grounding(abstract)
AI总结 NaviTrace通过语义感知轨迹评分评估视觉-语言模型的具身导航能力,揭示了模型在空间定位和目标定位方面的不足。
Comments 11 pages, 6 figures, with appendix, accepted to ICRA 2026
MoMaStage:基于技能-状态图的规划与闭环执行的长时域室内移动操作
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);grounding(abstract)
AI总结 MoMaStage通过结构化视觉-语言框架和闭环执行机制,实现长时域室内移动操作的高效规划与执行。
Comments 8 pages
CGL: 通过强化微调推进连续GUI学习
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; University College Dublin(都柏林大学) ; Peking University(北京大学)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG
AI总结 CGL通过强化微调与监督微调的协同优化,解决GUI连续学习中遗忘旧任务的问题,提出AndroidControl-CL基准验证方法有效性。
R2F:利用射线前沿进行无需大语言模型的对象导航
机构 * Department of Computer, Automation and Management Engineering, Sapienza University of Rome(罗马萨皮恩扎大学计算机、自动化与管理工程系) ; Department of Electronics and Automation, Mohamed Khider University of Biskra(比斯克拉Mohamed Khider大学电子与自动化系) ; International University of Rome UNINT, Rome(罗马国际大学UNINT)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI
AI总结 R2F通过重新利用射线前沿技术,开发无需大语言模型的室内开放词汇对象导航框架,实现实时高效导航性能。
ViLAM:将视觉-语言推理转化为注意力图用于社交机器人导航
机构 * Dept. of Electrical and Computer Engineering, University of Maryland, College Park, MD, USA(电气与计算机工程系,马里兰大学,College Park, MD, USA) ; Dept. of Computer Science, University of Maryland, College Park, MD, USA(计算机科学系,马里兰大学,College Park, MD, USA) ; James Clark School of Engineering, University of Maryland, College Park, MD, USA(James Clark工程学院,马里兰大学,College Park, MD, USA)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI
AI总结 ViLAM通过蒸馏视觉-语言模型的注意力图,提升社交机器人导航的社会适应性与导航效率。
SysNav:多级系统性合作实现现实世界跨载体物体导航
机构 * Carnegie Mellon University(卡内基梅隆大学) ; New York University(纽约大学) ; Nanyang Technological University(南洋理工大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)
AI总结 SysNav通过多级系统性合作实现现实世界跨载体物体导航,提升复杂环境下的导航效率与成功率。
移动端智能体在线强化学习中的泛化能力
机构 * Mila – Québec AI Institute(魁北克AI研究所) ; Concordia University(康科迪亚大学) ; Université de Montréal(蒙特利尔大学) ; CIFAR AI Chair(CIFAR人工智能主席) ; University of Toronto(多伦多大学) ; McMaster University(麦马斯特大学)
专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV、cs.LG
AI总结 本文提出AndroidWorld-Generalization基准,通过整合GRPO与可扩展回放系统,评估移动端智能体在未见任务实例、模板和应用上的泛化能力,并展示RL在提升性能上的效果。
新颖的语义提示用于零样本动作识别
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出SP-CLIP框架,通过结构化语义提示提升零样本动作识别性能,尤其在细粒度和组合动作上表现优异,同时保持模型效率和泛化能力。
MetricNet: 恢复生成导航策略中的度量尺度
机构 * Artificial Intelligence and Robotics Lab, Department of Computer Science and Artificial Intelligence, University of Technology Nuremberg(技术大学纽伦堡计算机科学与人工智能系人工智能与机器人实验室) ; Inria, Ecole Normale Supérieure, CNRS, PSL Research University(法国国家信息与自动化技术研究院、巴黎高等师范学校、国家科学研究中心、巴黎-萨克勒研究大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
AI总结 MetricNet通过预测航点之间的度量距离,解决生成导航策略中轨迹抽象和控制策略短视的问题,提升导航与探索性能。
Comments Accepted to ICRA'26
PIRA-Bench: 从反应式 GUI 代理到基于 GUI 的主动意图推荐代理的转变
机构 * Nankai University(南开大学) ; Huawei Research(华为研究)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI
AI总结 PIRA-Bench通过引入主动意图推荐代理基准,推动GUI代理从反应式向主动式转变,评估多模态大语言模型在连续弱监督视觉输入中的能力。
HiconAgent: 历史上下文感知的GUI代理策略优化
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Shenzhen Loop Area Institute(深圳河套学院) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
AI总结 HiconAgent通过历史上下文感知策略优化,高效利用历史信息,在GUI导航任务中实现更高的准确率和效率。
GeoAware-VLA: 基于隐式几何的视觉-语言-动作模型
机构 * Department of Robotics, Mohamed bin Zayed University of Artificial Intelligence(机器人系,Mohamed bin Zayed人工智能大学)
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 GeoAware-VLA通过整合几何先验提升视觉-语言-动作模型的视角不变性,显著提高零样本泛化能力,并在现实机器人平台中取得显著效果。
Comments Under Review, Project Page https://alisharey.github.io/GeoAware-VLA/
Green-VLA: 通用机器人中的分阶段视觉-语言-动作模型
专题命中 GUI与屏幕智能体 :grounding(abstract)
AI总结 Green-VLA是一种面向真实环境的分阶段视觉-语言-动作模型,通过多阶段训练和强化学习对齐,提升机器人在多样化形态上的泛化能力和性能。
Comments 22 pages, 14 figures
FuzzingRL: 用于揭示视觉语言模型故障的强化模糊测试
机构 * University of Southern California(南加州大学) ; Toyota Research Institute(丰田研究机构)
专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision language model(abstract);分类 cs.AI、cs.LG
AI总结 FuzzingRL通过强化模糊测试生成挑战性问题,揭示视觉语言模型的故障点并降低其准确性。
Comments 18 pages, 4 figures. † These authors jointly supervised this work: Jiageng Mao and Yue Wang
TS-MLLM:一种基于多模态大语言模型的工业时间序列大数据分析框架
机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院) ; School of Software, Beihang University(北京航空航天大学软件学院) ; Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) ; State Key Laboratory of Intelligent Manufacturing System Technology(智能制造系统技术国家重点实验室) ; School of Computer and Artificial Intelligence, Zhengzhou University(郑州大学计算机与人工智能学院) ; Department of Computer Science, St. Francis Xavier University(圣弗朗西斯科大学计算机科学系)
专题命中 幻觉与鲁棒性 :MLLM(title,abstract);vision-language model(abstract);分类 cs.LG
AI总结 TS-MLLM通过多模态大语言模型联合建模时序信号、频域图像和文本知识,提升工业时间序列预测的鲁棒性、效率和泛化能力。
物理引导的VLM先验条件用于全云去除
专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV
AI总结 本文提出PhyVLM-CR方法,结合VLM语义能力和物理模型,实现高保真全云去除,提升云去除与内容保留的平衡性。
IMPACT: 通过视觉-语言模型实现可接受接触轨迹的智能运动规划
机构 * Thomas Lord Department of Computer Science, Viterbi School of Engineering, University of Southern California(托马斯·劳德计算机科学系,维特里比工程学院,南加州大学)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.AI、cs.LG
AI总结 IMPACT通过视觉-语言模型实现高效的接触丰富运动规划,在杂乱环境中优于其他方法。
FVG-PT:适应性前景视图引导的提示微调用于视觉-语言模型
机构 * University of Technology Sydney(悉尼技术大学) ; Shanghai University(上海大学)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
AI总结 FVG-PT通过引入前景可靠性门、蒸馏补偿模块和先验校准模块,解决提示微调中前景注意力偏移问题,提升视觉-语言模型的适应性和泛化能力。
Comments 27 Pages, 9 Figures, 15 Tables
通过确定性事实账本和对抗性低延迟幻觉检测器实现神经符号金融推理
机构 * FactAI Lab(FactAI实验室)
专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG
AI总结 本文提出VeNRA,通过确定性事实账本和对抗性检测器实现零幻觉金融推理,结合确定性执行和高效检测机制,显著降低幻觉率并提升推理可靠性。
Comments 21 pages, 8 figures, 7 tables
回望与前行:用于多图像幻觉缓解的跨图像注意力校准与关注偏好学习
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Harbin Institute of Technology(哈尔滨工业大学) ; Beijing Institute of Technology(北京理工大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出CAPL框架,通过跨图像注意力校准和偏好学习缓解多图像幻觉问题,提升模型对跨图像关联的建模能力,并在多个任务中取得稳定性能提升。