arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-15 至 2026-05-15 共收录 12 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 12 篇

2605.15185 2026-05-15 cs.CV cs.AI 81%

Quantitative Video World Model Evaluation for Geometric-Consistency

几何一致性定量视频世界模型评估

Jiaxin Wu, Yihao Pi, Yinling Zhang, Yuheng Li, Xueyan Zou

机构 * Tsinghua University - IEI Lab(清华大学-IEI实验室) UW-Madison(威斯康星大学麦迪逊分校) Adobe Research(Adobe研究院)

专题命中 机器人数据与评测 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 本文提出PDI-Bench框架,通过分割与点跟踪获取物体中心观测,利用单目重建获取3D坐标,计算投影几何残差以评估生成视频的几何一致性,揭示视频生成器的特定失败模式。

Comments 12 pages, 5 figures. Project page : https://pdi-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14556 2026-05-15 cs.AI 79%

TeachAnything: A Multimodal Crowdsourcing Platform for Training Embodied AI Agents in Symmetrical Reality

教任何事物:一种多模态众包平台,用于在对称现实中的训练具身AI代理

Zidong Liu, Rongkai Liu, Yue Li, Zhenliang Zhang

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) BIGAI

专题命中 机器人数据与评测 :embodied AI(title);embodied agent(abstract);分类 cs.AI

AI总结 本文提出TeachAnything平台,通过多模态示范信号整合三阶段示范范式,实现跨场景、任务和具身的多样化示范数据收集,为对称现实中的具身AI代理开发提供实用基础。

Comments 5 pages, 3 figures. Accepted as an IEEE VR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14911 2026-05-15 cs.RO 77%

Chrono-Gymnasium: An Open-Source, Gymnasium-Compatible Distributed Simulation Framework

Chrono-Gymnasium:一个开源、兼容Gymnasium的分布式模拟框架

Bocheng Zou, Harry Zhang, Khailanii Slaton, Jingquan Wang, Derrick Ruan, Huzaifa Mustafa Unjhawala, Radu Serban, Dan Negrut

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 Chrono-Gymnasium通过分布式计算框架提升高保真多体动力学模拟的效率,支持机器人导航和行星着陆器优化,减少计算时间而不牺牲物理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14300 2026-05-15 eess.SP 71%

Joint Communication and Computation Design for Mobile Embodied AI Network (MEAN)

移动具身人工智能网络(MEAN)的联合通信与计算设计

Chenliang Wu, Zhouxiang Zhao, Jiaxiang Wang, Ruopeng Xu, Chen Zhu, Zhaohui Yang, Zhaoyang Zhang

专题命中 机器人数据与评测 :embodied AI(title)

AI总结 本文研究了移动具身人工智能网络在无线通信中的能量高效协作策略,通过双模式协作框架优化计算、通信和任务执行能耗,提出低复杂度枚举算法降低总能耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14462 2026-05-15 cs.CV 70%

Real2Sim in HOI: Toward Physically Plausible HOI Reconstruction from Monocular Videos

Real2Sim在HOI中的应用:从单目视频中向物理合理性迈进的HOI重建

Yubo Zhao, Yujin Chai, Yunao Dong, Chengfeng Zhao, Zijiao Zeng, Yuan Liu, Chi-Keung Tang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Tencent IEG(腾讯IEG)

专题命中 机器人数据与评测 :embodied AI(abstract);manipulation(abstract);分类 cs.CV

AI总结 本文提出HA-HOI框架,通过单目视频重建物理合理的4D HOI动画,改进了人-物对齐、接触一致性、时间稳定性及模拟准备性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13016 2026-05-15 cs.CV 70%

SVAG-Bench: A Large-Scale Benchmark for Multi-Instance Spatio-temporal Video Action Grounding

SVAG-Bench:多实例时空视频动作定位的大规模基准

Tanveer Hannan, Shuaicong Wu, Mark Weber, Suprosanna Shit, Jindong Gu, Rajat Koner, Aljoša Ošep, Laura Leal-Taixé, Thomas Seidl

机构 * LMU Munich(慕尼黑大学) MCML Technical University of Munich(慕尼黑技术大学) University of Zurich(苏黎世大学) University of Oxford(牛津大学) Amazon(亚马逊) NVIDIA(英伟达)

专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract);分类 cs.CV

AI总结 SVAG-Bench通过多实例整合任务,评估模型在复杂场景中对动作的时空定位能力,包含688个视频和19590个注释,支持细粒度评估多主体歧义消除和动作组合性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15187 2026-05-15 cs.CV cs.GR cs.RO 62%

Articraft: An Agentic System for Scalable Articulated 3D Asset Generation

Articraft: 一种可扩展的拟人化3D资产生成代理系统

Matt Zhou, Ruining Li, Xiaoyang Lyu, Zhaomou Song, Zhening Huang, Chuanxia Zheng, Christian Rupprecht, Andrea Vedaldi, Shangzhe Wu

机构 * University of Cambridge(剑桥大学) University of Oxford(牛津大学) Nanyang Technological University(南洋理工大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Articraft代理系统,利用大语言模型生成大规模拟人化3D资产,构建了包含10000+资产的Articraft-10K数据集,应用于机器人仿真和虚拟现实等下游任务。

Comments Project page: https://articraft3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13609 2026-05-15 cs.CV cs.LG 62%

Do-Undo Bench: Reversibility for Action Understanding in Image Generation

Do-Undo基准:图像生成中动作理解的可逆性

Shweta Mahajan, Shreya Kadambi, Hoang Le, Rajeev Yasarla, Apratim Bhattacharyya, Munawar Hayat, Fatih Porikli

机构 * York University(约克大学) Vector Institute for AI(人工智能向量研究所) Qualcomm AI Research(高通人工智能研究)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV、cs.LG

AI总结 本文提出Do-Undo任务和基准,解决视觉-语言模型在理解并生成由现实动作驱动的场景变换中的关键缺口。通过要求模型模拟现实动作的后果并逆转至原始状态,测试真正的因果理解。实验表明当前模型在动作可逆性上存在困难,凸显评估动作理解的必要性。

Comments Project page: https://s-mahajan.github.io/Do-Undo-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14700 2026-05-15 cs.RO 57%

SR-Platform: An Agentic Pipeline for Natural Language-Driven Robot Simulation Environment Synthesis

SR-Platform:一种基于自然语言的机器人仿真环境合成代理管道

Ben Wei Lim, Minh Duc Le, Thang Truong, Thanh Nguyen Canh

机构 * Strike Robotics

专题命中 机器人数据与评测 :robot learning(abstract);分类 cs.RO

AI总结 SR-Platform通过代理系统将自然语言描述转化为可执行的MuJoCo仿真环境,显著降低手动创建多样机器人训练环境的工作量,实现从普通英文提示在一分钟内生成可执行场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03532 2026-05-15 cs.CV 57%

OpenTrack3D: Towards Accurate and Generalizable Open-Vocabulary 3D Instance Segmentation

OpenTrack3D: 向准确且通用的开放词汇3D实例分割迈进

Zhishan Zhou, Siyuan Wei, Zengran Wang, Chunjie Wang, Xiaosheng Yan, Xiao Liu

机构 * PICO, ByteDance, Beijing(字节跳动北京研究院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出OpenTrack3D框架,通过在线构建跨视角一致的对象提案和多模态大语言模型提升开放词汇3D实例分割的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.11468 2026-05-15 cs.LG stat.ML 57%

Increasing the Scope as You Learn: Adaptive Bayesian Optimization in Nested Subspaces

扩大学习范围:嵌套子空间中的自适应贝叶斯优化

Leonard Papenmeier, Luigi Nardi, Matthias Poloczek

机构 * Lund University(吕勒欧大学) Stanford University(斯坦福大学) DBtune Amazon(亚马逊)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.LG

AI总结 本文提出BAxUS方法,通过嵌套随机子空间自适应优化空间,提升高维贝叶斯优化性能,理论保证其鲁棒性并在多种应用中表现更优。

Comments 28 pages, 8 figures. Accepted to NeurIPS 2022. This is the revised version and includes the appendix

Journal ref Advances in Neural Information Processing Systems 35 (NeurIPS 2022), pp. 11586-11601

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09046 2026-05-15 cs.RO 57%

Terminal Matters: Kinodynamic Planning with a Terminal Cost and Learned Uncertainty in Belief State-Cost Space

终端问题:带有终端成本和学习不确定性的动力学规划

Zhuoyun Zhong, Seyedali Golestaneh, Constantinos Chamzas

机构 * Department of Robotics Engineering, Worcester Polytechnic Institute (WPI)(机器人工程系,沃斯通理工学院(WPI))

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出一种终端成本形式的动力学规划方法,通过优化终端状态质量和累积轨迹成本提升目标可靠性。KiTe规划器结合学习的不确定性模型,提高了在不确定环境下的目标达成成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏