Native Video-Action Pretraining for Generalizable Robot Control
用于可泛化机器人控制的原生视频动作预训练
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV
AI总结 研究针对机器人控制中视频动作模型应用于物理环境的不足,提出LingBot-VA 2.0,通过语义视觉动作分词器等四个核心设计原则构建基础模型,经真实世界部署验证其在复杂操作任务中的少样本泛化能力。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
用于可泛化机器人控制的原生视频动作预训练
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV
AI总结 研究针对机器人控制中视频动作模型应用于物理环境的不足,提出LingBot-VA 2.0,通过语义视觉动作分词器等四个核心设计原则构建基础模型,经真实世界部署验证其在复杂操作任务中的少样本泛化能力。
Nous:一种用于长期智能体记忆的预测世界模型
机构 * Indian Institute of Technology Ropar(印度理工学院罗巴尔分校)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG
AI总结 提出Nous记忆架构,基于知识即预测而非存储的原则,通过贝叶斯更新维护概率分布,以信息论惊喜度评分并记录信念变化,在LoCoMo基准上取得优于对比方法的F1分数。
Comments Preprint. 10 pages, 1 figure, 6 tables
我们能信任不可靠的体素吗?在标签噪声下的3D语义占用预测探索
机构 * School of Artificial Intelligence and Robotics(人工智能与机器人学院) ; National Engineering Research Center of Robot Visual Perception and Control Technology(机器人视觉感知与控制技术国家工程研究中心) ; Institute for Anthropomatics and Robotics(人机一体化与机器人研究所) ; Karlsruhe Institute of Technology(卡尔斯鲁厄技术大学) ; INSAIT ; College of Electronic and Information Engineering(电子与信息学院) ; Shanghai Institute of Intelligent Science and Technology(智能科学与技术上海研究院) ; Shanghai Research Institute for Intelligent Autonomous Systems(智能自主系统上海研究院) ; Shanghai Key Laboratory of Intelligent Autonomous Systems(智能自主系统上海重点实验室) ; State Key Laboratory of Autonomous Intelligent Unmanned Systems(自主智能无人系统国家重点实验室) ; Frontiers Science Center for Intelligent Autonomous Systems(智能自主系统前沿科学中心)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV
AI总结 本文提出DPR-Occ框架,通过双源部分标签推理解决3D语义占用预测中的标签噪声问题,实验表明其在高噪声环境下仍能保持性能。
Comments Accepted to IROS 2026. The benchmark and source code will be made publicly available at https://github.com/mylwx/OccNL
超越黑盒混淆:白盒监测器的机制分析与防御
机构 * University of Oxford(牛津大学)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG
AI总结 研究针对大语言模型白盒监测器可被规避且缺乏防御措施的问题,通过红队实验揭示几何转移和协方差操纵两种逃避策略,引入SafetyNet集成方法,在多模型家族实验中取得高AUROC分数,为稳健潜在空间监测提供了实证和起点。
TOPO-Bench:一个具有可量化感知混叠的开源拓扑映射评估框架
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV
AI总结 针对拓扑映射缺乏标准评估体系及感知混叠量化不足的问题,提出将拓扑一致性形式化并以定位精度为替代指标,还给出数据集模糊度定量度量,开源相关数据集、基线及工具,推动拓扑映射研究的一致性与可重复性。
Comments Jiaming Wang, Diwen Liu, and Jizhuo Chen contributed equally
BiasBench:用于调整事件相机偏差的可重现基准测试
机构 * Cognitive Systems Group, University of Tübingen(图宾根大学认知系统组)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV
AI总结 研究针对事件相机偏差调整工具少的问题,提出BiasBench这一包含多场景的可重现事件数据集,并展示三个场景及下游应用质量指标,还提出基于强化学习的方法促进在线偏差调整。
Comments Accepted to CVPR 2025 Workshop on Event-based Vision
EgoDyn-Bench:评估面向自动驾驶的视觉中心基础模型中的自我运动理解
机构 * Professorship of Autonomous Vehicle Systems, Technical University of Munich, Munich, Germany(自动驾驶车辆系统教授职位,慕尼黑技术大学,德国慕尼黑) ; Bayerische Motoren Werke AG, Munich, Germany(巴伐利亚发动机有限公司,德国慕尼黑) ; Data Analytics and Machine Learning Group, Technical University of Munich, Munich, Germany(数据分析与机器学习小组,慕尼黑技术大学,德国慕尼黑)
专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO、cs.CV
AI总结 本文提出EgoDyn-Bench基准,用于评估视觉中心基础模型的自我运动理解能力,发现模型在将物理逻辑与视觉感知结合时存在结构性缺陷,通过显式轨迹编码可恢复物理一致性。
Comments 36 Pages, Accepted at ECCV 2026
Clin-JEPA:一种多阶段协同训练框架,用于EHR患者轨迹的联合嵌入预测预训练
机构 * Duke University(杜克大学)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Clin-JEPA框架,通过多阶段预训练稳定协同训练编码器和预测器,解决EHR数据中联合嵌入预测的挑战,实现多任务下游任务的高性能表现。
Comments 18 pages, 4 figures, 8 tables. Code: https://github.com/Kamaleswaran-Lab/Clin-JEPA
AnchorDream:将视频扩散用于具身感知机器人数据合成
机构 * Toyota Research Institute(丰田研究院) ; USC Physical Superintelligence (PSI) Lab(USC物理超智能(PSI)实验室)
专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO、cs.CV
AI总结 针对机器人示范数据收集瓶颈,AnchorDream利用预训练视频扩散模型,通过机器人运动渲染来合成数据,无需环境建模,从少量示范生成多样高质量数据集,提升下游策略学习。
Comments Project page: https://jay-ye.github.io/AnchorDream/
UNDREAM:为端到端对抗攻击弥合可微渲染与逼真模拟的差距
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Technology Innovation Institute(技术创新研究院)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG
AI总结 针对自动驾驶等安全关键应用中深度学习模型对抗攻击测试问题,介绍UNDREAM框架,通过弥合逼真模拟器与可微渲染器差距,实现对3D物体对抗扰动的端到端优化,开启物理对抗攻击研究新途径。
理性逆推理:通过规划推断意图进行少样本模仿
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI
AI总结 研究人类能从少量示范学习新操作任务,而现代机器人模仿学习需大量示范且适应性差的差距。提出理性逆推理,将少样本模仿视为对潜在解释程序的推理,通过视觉语言模型和分层规划器迭代优化候选集,在少样本设置中表现优于基线。
BuilderBench:智能体的构建模块
机构 * Princeton University(普林斯顿大学) ; Mila – Quebec AI Institute(魁北克AI研究院) ; Université de Montréal(蒙特利尔大学)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.LG
AI总结 提出BuilderBench基准,通过开放式探索训练智能体构建结构,实验表明现有前沿语言模型和强化学习算法无法解决任何非平凡任务。
Comments Blogpost: https://rajghugare19.github.io/builderbench and Code: https://github.com/rajghugare19/builderbench
DriveVA: 视频动作模型是零样本驱动器
机构 * University of Twente(特温特大学) ; Xiaomi EV(小米电动汽车) ; University of Cambridge(剑桥大学) ; University of Bath(巴斯大学)
专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO、cs.CV
AI总结 DriveVA提出了一种新的自动驾驶世界模型,通过共享潜在生成过程联合解码未来视觉预测和动作序列,提升跨数据集和传感器配置的泛化能力,减少碰撞率和误差。
Comments Accepted to ECCV 2026. 30 pages, 12 figures, 11 tables
EXPLORE-Bench:具有长视距推理的自我中心场景预测
机构 * University of Science and Technology of China(中国科学技术大学) ; Foundation Model Team, Li Auto Inc.(蔚来汽车基础模型团队) ; Tsinghua University(清华大学)
专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI、cs.CV
AI总结 提出EXPLORE-Bench基准,通过初始场景图像和动作序列预测最终场景,评估多模态大模型在自我中心长视距推理中的能力,发现与人类存在显著差距。
双桥:独占目标与扩展视野的星际争霸II基准测试
机构 * Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.LG
AI总结 为解决星际争霸II全游戏与迷你游戏之间的复杂度鸿沟,提出双桥地图套件作为中间基准,通过禁用经济机制隔离远程导航和微操战术技能,实现低计算成本下的连贯机动与交战行为学习。
ALOE: 面向视觉-语言-动作模型后训练的动作级离策略评估
机构 * AgiBot ; The Hong Kong University of Science and Technology(香港科技大学) ; Fudan University(复旦大学) ; Nanjing University(南京大学) ; Independent Researcher(独立研究者)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI
AI总结 提出ALOE框架,通过离策略评估直接估计当前策略的价值,结合分块时序差分和保守值聚合,改善稀疏奖励下的信用分配,在四项真实世界操作任务中优于现有方法。
语义路由器:通过单一对抗扰动劫持多模态大语言模型的可行性研究
机构 * The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) ; School of Data Science, School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(数据科学学院、人工智能学院、香港中文大学(深圳))
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV
AI总结 提出语义感知通用扰动(SAUP),作为语义路由器同时劫持多个无状态决策,通过理论分析和SORT优化策略实现,在Qwen上对五个目标达到66%攻击成功率。
Comments Accepted to ICML 2026
视觉基础模型能否导航?零样本真实世界评估与经验教训
机构 * Polytechnique Montreal(蒙特利尔理工学院)
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.LG
AI总结 本文对五种视觉导航模型在真实环境中进行零样本评估,发现其存在几何理解不足、感知混淆和分布漂移等系统性问题,并公开评估代码与数据集。
面向视频地点识别的合成新视角系统性评估
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.CV
AI总结 系统评估合成新视角对视频地点识别的影响,发现少量合成视角可提升识别性能,且视角变化幅度不如添加数量和图像类型重要。
Comments Submitted to IEEE IROS 2026
通过语义技能发现实现持续四足机器人协调
机构 * National Key Laboratory of Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家重点实验室,南京大学,南京,中国) ; School of Artificial Intelligence, Nanjing University, Nanjing, China(人工智能学院,南京大学,南京,中国) ; Polixir Technologies, Nanjing, China(南京极智科技有限公司)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI
AI总结 提出Conquer框架,通过语义技能库实现多四足机器人在持续学习任务中的协调,避免灾难性遗忘,最终平均成功率95.6%。
Comments 22 pages, 8 figures, 11 tables. Project page: https://conquer-project.pages.dev/
ObjSplat: 几何感知的高斯面元用于主动物体重建
机构 * School of Optics and Photonics, Beijing Institute of Technology(光学与光子学学院,北京理工大学) ; School of Optoelectronic Engineering, Changchun University of Science and Technology(光电工程学院,长春理工大学)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV
AI总结 提出ObjSplat框架,利用高斯面元统一表示,通过几何感知视点评估和下一最佳路径规划器,实现高效高保真的主动物体重建。
Comments Accepted to IEEE T-ASE. Code: https://github.com/Li-Yuetao/ObjSplat , Project Page: https://li-yuetao.github.io/ObjSplat-page/
Crazyflow: 基于JAX的精确、GPU加速、可微分的无人机模拟器
机构 * Technical University of Munich(慕尼黑技术大学) ; University of Toronto(多伦多大学) ; Simon Fraser University(西蒙弗雷泽大学)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI
AI总结 提出Crazyflow模拟器,通过GPU加速和可微分设计,实现单机超高速仿真、数千架无人机集群模拟,并支持基于解析梯度的策略学习与采样避障,甚至能在0.38秒内从零训练飞行恢复策略。
Comments Fix minor metadata mistakes
上下文能否弥合现实差距?情境感知策略的模拟到现实迁移
机构 * AASS Research Centre, Örebro University(奥雷布罗大学AASS研究中心) ; Technology Transfer Center Kitzingen, Technical University of Applied Sciences Würzburg-Schweinfurt(基廷根技术转移中心,沃尔夫斯堡-施维林应用技术大学)
专题命中 机器人数据与评测 :robotics(abstract,journal_ref);分类 cs.RO
AI总结 研究机器人强化学习中模拟到现实迁移难题,核心方法是将上下文估计模块集成到基于领域随机化的强化学习框架并比较监督策略,主要贡献是情境感知策略在多任务中优于无上下文基线。
Journal ref Robotics and Autonomous Systems, Volume 205, 2026, 105594
视觉场所识别中的运动模糊与去模糊
机构 * School of Electronics and Computer Science, University of Southampton(苏塞克斯大学电子与计算机科学学院) ; MyWay srl(MyWay公司) ; QUT Centre for Robotics, School of Electrical Engineering and Robotics(昆士兰大学机器人中心,电气工程与机器人学院) ; School of Computer Science and Electronic Engineering, University of Essex(埃塞克斯大学计算机科学与电子工程学院)
专题命中 机器人数据与评测 :robotics(abstract,comments);分类 cs.CV
AI总结 研究视觉场所识别中运动模糊及去模糊影响,引入新基准评估,含三个数据集。通过多种方法实验,揭示运动模糊影响与去模糊效果,进而提出VPR自适应去模糊策略,为动态现实场景管理运动模糊提供新途径。
Comments Accepted to IEEE Robotics & Automation Letters
Journal ref Volume: 10, Issue: 5, May 2025, Pages 4746 - 4753
Odyssey:一种面向GNSS拒止场景的汽车激光雷达-惯性里程计数据集
机构 * University of Göttingen(哥廷根大学) ; iMAR Navigation(iMAR导航)
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO;robotics(comments)
AI总结 提出Odyssey数据集,采用导航级环形激光陀螺仪RTK/INS提供高精度真值,包含36个序列和长时间GNSS拒止环境(隧道、室内停车场),用于评估LIO/SLAM系统。
Comments 10 pages, 4 figures, 3 tables, submitted to International Journal of Robotics Research (IJRR)
数据驱动的图像配准与变形建模在图像引导神经外科中的应用:系统综述
机构 * LASIGE, Faculty of Sciences, University of Lisbon(里斯本大学科学学院LASIGE) ; Department of Neurosurgery and Department of Radiology, Brigham and Women's Hospital, Harvard Medical School(哈佛医学院布里洛妇女医院神经外科与放射科) ; Gina Cody School of Engineering and Computer Science, Concordia University(康科迪亚大学工程与计算机科学学院) ; Cancer Research UK Cambridge Centre, University of Cambridge(剑桥大学癌症研究英国中心) ; Department of Oncology, University of Cambridge(剑桥大学肿瘤科) ; Department of Clinical Neurosciences, University of Cambridge(剑桥大学临床神经科学系) ; Computational Health Informatics Program (CHIP) and Department of Radiology, Boston Children's Hospital, Harvard Medical School(哈佛医学院波士顿儿童医院计算健康信息学计划与放射科) ; Sorbonne Université, Institut du Cerveau - Paris Brain Institute - ICM(索邦大学巴黎脑研究所-ICM)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV
AI总结 系统综述2020-2025年间基于学习的脑变形补偿方法,包括深度学习配准、变形场回归、多模态对齐、切除感知架构及混合模型,指出当前方法在鲁棒性、标准化基准、可解释性和临床部署方面的局限,并展望未来研究方向。
Comments 41 pages, 7 figures, 9 tables. Final postprint version available in Medical Image Analysis at this https URL (https://doi.org/10.1016/j.media.2026.104217)
从边界估计动态软体连续体机器人的状态
机构 * The Continuum Robotics Laboratory(连续机器人实验室) ; the Robotics Institute at the University of Toronto(多伦多大学机器人研究所)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO
AI总结 本研究提出一种基于基座力/力矩测量的对偶边界观测器,实现动态无穷维软体连续体机器人状态估计,兼具传感需求低、增益调参高效等优势,经仿真与实验验证了其性能。
CalibAnyView:超越单视角相机校准的野外应用
机构 * Monash University(蒙纳士大学) ; Technical University of Munich(慕尼黑技术大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV
AI总结 CalibAnyView通过多视角几何一致性建模,提升野外多视角相机校准的鲁棒性和精度,适用于复杂场景下的3D重建和机器人感知。
Comments 27 pages, 21 figures
测量模拟到现实的差距:为物联网系统中的强化学习设计一个经济实惠的真实世界基准平台
机构 * The University of Sydney(悉尼大学) ; University of Oxford(牛津大学) ; The University of Western Australia(西澳大利亚大学)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI
AI总结 针对AIoT系统中强化学习模拟到现实的差距问题,开发了成本低于400美元的真实世界平台,通过硬件模拟键盘让边缘设备智能体玩游戏训练,实验显示模拟训练智能体部署后性能大幅下降,直接现实训练有可行性,为强化学习评估提供了基础。
ReMMD: 面向多模态虚假信息检测的现实多语言多图像智能体验证
机构 * Shanghai Jiaotong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Tsinghua University(清华大学) ; Central South University(中南大学) ; China Electronics Technology Group Corporation 15th Research Institute(中国电子科技集团公司第十五研究所)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI
AI总结 提出ReMMD框架,包含多语言多图像基准ReMMDBench和持久记忆验证器ReMMD-Agent,通过原子点分解和可重用证据集实现高效准确的多模态虚假信息检测。
Comments The project is available at https://dang-ai.github.io/ReMMD