Transfer from Simulation to Real World through Learning Deep Inverse Dynamics Model
通过学习深度逆动力学模型实现仿真到现实世界的迁移
专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文提出通过学习深度逆动力学模型,在仿真与现实世界之间实现控制策略的迁移,解决仿真与现实差异导致的性能下降问题。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
通过学习深度逆动力学模型实现仿真到现实世界的迁移
专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文提出通过学习深度逆动力学模型,在仿真与现实世界之间实现控制策略的迁移,解决仿真与现实差异导致的性能下降问题。
自动驾驶的未来之路:KITScenes多模态数据集
机构 * FZI Research Center for Information Technology(弗劳恩霍夫信息技术研究中心) ; Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; University Charles III of Madrid(马德里第三大学) ; Delft University of Technology(代尔夫特理工大学)
专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 本文提出KITScenes多模态数据集,通过高保真传感器和完整HD地图,解决现有数据集在传感器精度、地图完整性和地理多样性上的不足,并引入四个基准推动空间学习。
Comments 28 pages, 21 figures
SCOPE:边缘实时自然语言相机代理
机构 * Armada AI
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 提出SCOPE模块化代理,用于自然语言控制的PTZ相机,在边缘部署实现实时感知、规划与控制,并通过仿真和物理实验评估延迟、准确性和错误模式。
Comments 9 pages, 4 figures, 6 tables. Accepted at HRI '26 (21st ACM/IEEE International Conference on Human-Robot Interaction), Edinburgh, Scotland, March 16--19, 2026. Code: https://github.com/HindsboNikolaj/SCOPE
Journal ref Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction (HRI '26), ACM, 2026
视觉基础模型在面部深度伪造检测中的跨域泛化极限
机构 * Department of Software Engineering, Faculty of Computer and Information Sciences(软件工程系,计算机与信息科学学院)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 本文通过系统评估三种视觉基础模型(RoPE-ViT、DINOv3、NVIDIA C-RADIOv4-H)在DF40基准上的线性探测性能,揭示了它们在面部深度伪造检测中的跨域泛化极限,发现基础模型对全脸合成保持高判别力,但对局部编辑技术存在根本性边界。
理解动作分块行为克隆中的多模态失败
机构 * NCT-Dresden(NCT-德累斯顿)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 研究行为克隆在多模态情况下失败的机制,分析不同多模态参数化在动作分块策略中的不同失效方式,并提出通过调整正则化程度和改进生成策略来提升鲁棒性的方法。
DISC: 通过策略生成解耦指令与状态条件控制
机构 * Zhejiang University(浙江大学) ; The University of Hong Kong(香港大学) ; TranscEngram
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 DISC通过策略生成解耦指令与状态条件控制,解决了任务状态耦合导致的观察泄漏问题,并在多个基准测试中表现出色,证明了语言生成的策略参数驱动行为。
EgoBabyVLM:基于自然主义第一人称视频数据的跨模态学习基准测试
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; Stanford University(斯坦福大学) ; Meta Reality Labs(Meta现实实验室) ; The University of Tokyo(东京大学)
专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 研究探讨了儿童如何从有限的视觉-语言输入中获得语言 grounding 的鲁棒性,提出了 EgoBabyVLM 挑战,推动模型在自然主义数据中实现 grounded language learning。
释放扩散模型在端到端自动驾驶中的潜力
机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文通过大规模实车数据和道路测试,系统研究了扩散模型在端到端自动驾驶中的规划能力,提出Hyper Diffusion Planner框架,实现10倍性能提升。
DenseTRF: 基于纹理的无监督表示适应用于外科场景密集预测
机构 * GRASP Laboratory, University of Pennsylvania(宾夕法尼亚大学GRASP实验室) ; PCASO Laboratory, Department of Surgery, University of Pennsylvania(宾夕法尼亚大学外科PCASO实验室) ; Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 本文提出DenseTRF框架,通过基于纹理的关注机制学习纹理感知的表示,提升外科场景密集预测的跨分布泛化能力。
Comments Accepted to 29th International Conference on Medical Image Computing and Computer Assisted Intervention (MICCAI 2026)
从视觉合成到交互世界:迈向可生产3D资产生成
专题命中 机器人数据与评测 :embodied AI(abstract);world model(abstract)
AI总结 本文探讨了从孤立视觉形状到可部署的结构化资产的3D内容生成进展,分析了游戏开发、AI、世界模拟等对3D资产的需求,提出基于资产生产流程的分类方法,评估现有方法的生成质量和可用性,并指出数据质量、生成可控性等挑战。
Comments Preprint. Jiafeng Wu and Zhuofan Lou contributed equally. Project page: https://christinebobby.github.io/production-ready-3d-survey/
在RT-DETR中评估ResNet主干:环境条件下深度和正则化的影响
机构 * Robotics and Artificial Intelligence Laboratory, Technological University of Uruguay(机器人与人工智能实验室,乌拉圭技术大学) ; Artificial Intelligence Laboratory, Technological University of Uruguay(人工智能实验室,乌拉圭技术大学)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本文评估RT-DETR在环境和超参数变化下的圆物体检测性能,比较了四种ResNet主干在不同丢弃率下的置信度和准确率,发现ResNet50在光照变化中表现最佳,ResNet34在背景变化中表现最佳。
Comments Accepted at the International Conference on Data Science, Technology and Applications (DATA) 2026
描述:一种混合室内外定位多技术数据集(HYMN)
专题命中 机器人数据与评测 :navigation(abstract,abstract_cn)
AI总结 HYMN数据集结合五种定位技术,涵盖室内外过渡场景,支持多传感器融合和无缝定位研究,克服单一技术限制。
资产收割者:从自动驾驶日志中提取3D资产用于模拟
机构 * NVIDIA
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 本文提出Asset Harvester,通过图像到3D模型的端到端流程,将稀疏的现实日志中物体观测转换为完整的模拟资产,结合大规模数据整理、几何感知预处理和鲁棒训练方案,解决自动驾驶数据中的稀疏视角等挑战。
Comments NVIDIA white paper. The project page: https://research.nvidia.com/labs/sil/projects/asset-harvester/
使用大型语言模型进行具身规划引入了系统性的安全风险
机构 * ETH Zurich(苏黎世联邦理工学院) ; University College London(伦敦大学学院) ; Stanford University(斯坦福大学) ; Northwestern University(西北大学) ; National University of Singapore(新加坡国立大学)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 研究评估了大型语言模型在机器人规划中的安全性,发现即使规划能力高,安全风险仍显著存在,揭示了规划能力与安全意识之间的乘法关系。
Comments Project page: https://despite-safety.github.io/
R3D2:通过扩散实现自动驾驶模拟中的真实3D资产插入
机构 * Zenseact ; Linköping University(林哈尔大学) ; Chalmers University(查尔姆斯理工大学) ; UC Berkeley(加州大学伯克利分校)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 R3D2是一种轻量级单步扩散模型,用于在现有场景中实时生成真实3D资产,通过训练学习真实集成,提升自动驾驶模拟的真实性。
StarVLA-$α$:降低视觉-语言-动作系统复杂度
机构 * HKUST(香港科技大学) ; XJTU(西安交通大学) ; CUHK(香港中文大学) ; THU(清华大学) ; Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) ; SmartMore Ltd.(SmartMore有限公司)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本文提出StarVLA-$α$,通过简化架构与流程降低实验干扰,系统分析VLA设计关键因素,在多个基准测试中表现优异,优于现有模型20%。
SPREAD:通过几何感知扩散进行空间-物理推理
专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract)
AI总结 SPREAD通过图Transformer联合学习空间和物理关系,利用场景点云进行几何感知,整合可微指导实现碰撞避免和物理一致性,实验显示在空间关系和物理指标上达到SOTA。
在生成3D世界中扩展机器人视觉语言动作的强化学习
机构 * Horizon Robotics(地平线机器人)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文提出利用生成3D世界模型来提升机器人视觉语言动作模型的泛化能力,通过生成多样化的交互场景,提高模拟到现实的迁移效果,并展示在真实世界中的性能提升。
CUA-Suite:大规模人工标注的视频演示用于计算机使用代理
机构 * ServiceNow ; University of Waterloo(多伦多大学) ; Mila ; Université de Montréal(蒙特利尔大学) ; McGill University(麦吉尔大学) ; University of Oxford(牛津大学) ; National University of Singapore(新加坡国立大学)
专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 CUA-Suite通过提供连续高质量视频演示和密集标注,解决计算机使用代理训练中视频数据不足的问题,包含约55小时的专家视频和600万帧数据,支持多模态研究。
Comments Project Page: https://cua-suite.github.io/
视觉-语言模型在物理动态和意图推理上仍逊于人类表现
机构 * East China Normal University(东华大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Innovation Institute(上海创新研究院) ; University of Agder(阿格德大学)
专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 本文提出Teleo-Spatial Intelligence(TSI)以连接时空变化与目标导向结构,通过EscherVerse大规模开放世界资源评估,发现视觉-语言模型在开放世界中仍无法达到人类水平的意图推理能力。
FORWARD:在崎岖地形中操作的前送机数据集
机构 * Umeå University(乌梅亚大学) ; Swedish University of Agricultural Sciences(瑞典农业科学大学) ; Skogforsk, Swedish Forest Research Institute(森林研究所,瑞典)
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文介绍了FORWARD数据集,包含在瑞典中部两个森林地区崎岖地形中操作的前送机的高分辨率多模态数据,用于开发森林机械的交通性、感知和自主控制算法。
Comments 33 pages, 24 figures
MessyKitchens: 密集接触的物体级3D场景重建
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本文提出MessyKitchens数据集和Multi-Object Decoder方法,提升复杂场景中物体级3D重建的精度与物理合理性。
FEEL(力增强的自我中心学习):一个用于物理动作理解的数据集
机构 * University of Maryland, College Park, USA(马里兰大学 College Park 分校)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 FEEL数据集结合了自定义压阻手套收集的力测量与自我中心视频,通过力驱动物理交互,用于接触理解与动作表征学习,取得最佳分割结果并提升跨任务迁移性能。
Comments 14 pages, 7 figures
超越帧级跟踪:一种基于轨迹的高效点云跟踪范式
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本文提出基于轨迹的跟踪范式TrajTrack,通过隐式学习历史轨迹提升跟踪精度,实现高效且鲁棒的3D单目标跟踪。
Comments Acceptted in ICRA 2026
ESPIRE:一种用于视觉-语言模型具身空间推理的诊断基准
机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 本文提出ESPIRE基准,通过模拟环境评估视觉-语言模型在具身空间推理中的表现,改进了传统评估方法,实现了更细致的推理与行动分析。
SortScrews:一种用于实时螺钉分类的数据集和基线
机构 * University of Toronto(多伦多大学) ; Vector Institute(向量研究所) ; Project Neura ; UTMIST ; Amplimit
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 本文提出SortScrews数据集,用于解决工业自动化中螺钉分类问题,通过标准化采集设置获取6种螺钉类型和背景类图像,采用EfficientNet-B0和ResNet-18进行迁移学习,验证了在小数据集下可控采集条件下的有效学习能力。
MANSION: 多楼层语言到3D场景生成用于长周期任务
机构 * Tsinghua University(清华大学) ; AgiBot ; McGill University, MILA - Quebec AI Institute(麦吉尔大学,魁北克人工智能研究所)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 MANSION是首个多楼层语言驱动的3D场景生成框架,能生成真实可导航的建筑环境,支持跨楼层长周期任务的开发与评估,同时配套发布MansionWorld数据集和任务语义编辑代理,为空间推理和规划提供关键测试平台。
部署时学习机器人策略的可靠性
机构 * STANFORD UNIVERSITY(斯坦福大学)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文研究了如何通过部署时机制提升学习机器人策略的可靠性,提出运行时监控、数据驱动的可解释性框架及长周期任务执行方法,以应对部署中的分布偏移、误差叠加和复杂依赖性问题。
Comments Stanford University PhD dissertation, 2026. 182 pages, 37 figures. Available from Stanford Digital Repository
X-AVDT:用于鲁棒深度伪造检测的音频视觉交叉注意力
机构 * Visual Media Lab, KAIST(韩国科学技术院视觉媒体实验室)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 X-AVDT通过利用生成器内部的音频视觉一致性线索,提出了一种鲁棒且具有通用性的深度伪造检测方法,有效提升了检测性能。
Journal ref CVPR 2026
Pri4R: 通过特权4D表示学习视觉-语言-动作模型的世界动态
机构 * KAIST AI(韩国科学技术院人工智能研究中心) ; LG AI Research(LG人工智能研究) ; Yonsei University(延世大学) ; Seoul National University(首尔国立大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 Pri4R通过特权4D表示学习视觉-语言-动作模型的世界动态,提升操控任务性能