arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-15 至 2026-05-15 共收录 73 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 12 篇

2605.14300 2026-05-15 eess.SP 71%

Joint Communication and Computation Design for Mobile Embodied AI Network (MEAN)

移动具身人工智能网络(MEAN)的联合通信与计算设计

Chenliang Wu, Zhouxiang Zhao, Jiaxiang Wang, Ruopeng Xu, Chen Zhu, Zhaohui Yang, Zhaoyang Zhang

专题命中 机器人数据与评测 :embodied AI(title)

AI总结 本文研究了移动具身人工智能网络在无线通信中的能量高效协作策略,通过双模式协作框架优化计算、通信和任务执行能耗,提出低复杂度枚举算法降低总能耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14462 2026-05-15 cs.CV 70%

Real2Sim in HOI: Toward Physically Plausible HOI Reconstruction from Monocular Videos

Real2Sim在HOI中的应用:从单目视频中向物理合理性迈进的HOI重建

Yubo Zhao, Yujin Chai, Yunao Dong, Chengfeng Zhao, Zijiao Zeng, Yuan Liu, Chi-Keung Tang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Tencent IEG(腾讯IEG)

专题命中 机器人数据与评测 :embodied AI(abstract);manipulation(abstract);分类 cs.CV

AI总结 本文提出HA-HOI框架,通过单目视频重建物理合理的4D HOI动画,改进了人-物对齐、接触一致性、时间稳定性及模拟准备性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13016 2026-05-15 cs.CV 70%

SVAG-Bench: A Large-Scale Benchmark for Multi-Instance Spatio-temporal Video Action Grounding

SVAG-Bench:多实例时空视频动作定位的大规模基准

Tanveer Hannan, Shuaicong Wu, Mark Weber, Suprosanna Shit, Jindong Gu, Rajat Koner, Aljoša Ošep, Laura Leal-Taixé, Thomas Seidl

机构 * LMU Munich(慕尼黑大学) MCML Technical University of Munich(慕尼黑技术大学) University of Zurich(苏黎世大学) University of Oxford(牛津大学) Amazon(亚马逊) NVIDIA(英伟达)

专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract);分类 cs.CV

AI总结 SVAG-Bench通过多实例整合任务,评估模型在复杂场景中对动作的时空定位能力,包含688个视频和19590个注释,支持细粒度评估多主体歧义消除和动作组合性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15187 2026-05-15 cs.CV cs.GR cs.RO 62%

Articraft: An Agentic System for Scalable Articulated 3D Asset Generation

Articraft: 一种可扩展的拟人化3D资产生成代理系统

Matt Zhou, Ruining Li, Xiaoyang Lyu, Zhaomou Song, Zhening Huang, Chuanxia Zheng, Christian Rupprecht, Andrea Vedaldi, Shangzhe Wu

机构 * University of Cambridge(剑桥大学) University of Oxford(牛津大学) Nanyang Technological University(南洋理工大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Articraft代理系统,利用大语言模型生成大规模拟人化3D资产,构建了包含10000+资产的Articraft-10K数据集,应用于机器人仿真和虚拟现实等下游任务。

Comments Project page: https://articraft3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13609 2026-05-15 cs.CV cs.LG 62%

Do-Undo Bench: Reversibility for Action Understanding in Image Generation

Do-Undo基准:图像生成中动作理解的可逆性

Shweta Mahajan, Shreya Kadambi, Hoang Le, Rajeev Yasarla, Apratim Bhattacharyya, Munawar Hayat, Fatih Porikli

机构 * York University(约克大学) Vector Institute for AI(人工智能向量研究所) Qualcomm AI Research(高通人工智能研究)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV、cs.LG

AI总结 本文提出Do-Undo任务和基准,解决视觉-语言模型在理解并生成由现实动作驱动的场景变换中的关键缺口。通过要求模型模拟现实动作的后果并逆转至原始状态,测试真正的因果理解。实验表明当前模型在动作可逆性上存在困难,凸显评估动作理解的必要性。

Comments Project page: https://s-mahajan.github.io/Do-Undo-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14700 2026-05-15 cs.RO 57%

SR-Platform: An Agentic Pipeline for Natural Language-Driven Robot Simulation Environment Synthesis

SR-Platform:一种基于自然语言的机器人仿真环境合成代理管道

Ben Wei Lim, Minh Duc Le, Thang Truong, Thanh Nguyen Canh

机构 * Strike Robotics

专题命中 机器人数据与评测 :robot learning(abstract);分类 cs.RO

AI总结 SR-Platform通过代理系统将自然语言描述转化为可执行的MuJoCo仿真环境,显著降低手动创建多样机器人训练环境的工作量,实现从普通英文提示在一分钟内生成可执行场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03532 2026-05-15 cs.CV 57%

OpenTrack3D: Towards Accurate and Generalizable Open-Vocabulary 3D Instance Segmentation

OpenTrack3D: 向准确且通用的开放词汇3D实例分割迈进

Zhishan Zhou, Siyuan Wei, Zengran Wang, Chunjie Wang, Xiaosheng Yan, Xiao Liu

机构 * PICO, ByteDance, Beijing(字节跳动北京研究院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出OpenTrack3D框架,通过在线构建跨视角一致的对象提案和多模态大语言模型提升开放词汇3D实例分割的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.11468 2026-05-15 cs.LG stat.ML 57%

Increasing the Scope as You Learn: Adaptive Bayesian Optimization in Nested Subspaces

扩大学习范围:嵌套子空间中的自适应贝叶斯优化

Leonard Papenmeier, Luigi Nardi, Matthias Poloczek

机构 * Lund University(吕勒欧大学) Stanford University(斯坦福大学) DBtune Amazon(亚马逊)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.LG

AI总结 本文提出BAxUS方法,通过嵌套随机子空间自适应优化空间,提升高维贝叶斯优化性能,理论保证其鲁棒性并在多种应用中表现更优。

Comments 28 pages, 8 figures. Accepted to NeurIPS 2022. This is the revised version and includes the appendix

Journal ref Advances in Neural Information Processing Systems 35 (NeurIPS 2022), pp. 11586-11601

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09046 2026-05-15 cs.RO 57%

Terminal Matters: Kinodynamic Planning with a Terminal Cost and Learned Uncertainty in Belief State-Cost Space

终端问题:带有终端成本和学习不确定性的动力学规划

Zhuoyun Zhong, Seyedali Golestaneh, Constantinos Chamzas

机构 * Department of Robotics Engineering, Worcester Polytechnic Institute (WPI)(机器人工程系,沃斯通理工学院(WPI))

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出一种终端成本形式的动力学规划方法,通过优化终端状态质量和累积轨迹成本提升目标可靠性。KiTe规划器结合学习的不确定性模型,提高了在不确定环境下的目标达成成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他机器人 4 篇

2605.07594 2026-05-15 cs.RO 79%

MemCompiler: Compile, Don't Inject -- State-Conditioned Memory for Embodied Agents

MemCompiler: 编译,而非注入 -- 用于具身智能体的状态条件化记忆

Xin Ding, Xinrui Wang, Yifan Yang, Hao Wu, Shiqi Jiang, Qianxi Zhang, Liang Mi, Hanxin Zhu, Kun Li, Yunxin Liu, Zhibo Chen, Ting Cao

机构 * University of Science and Technology of China(中国科学技术大学) Huazhong University of Science and Technology(华中科技大学) Microsoft Research(微软研究院) Nanjing University(南京大学) Institute for AI Industry Research (AIR) Tsinghua University(清华大学人工智能产业研究院)

专题命中 其他机器人 :embodied agent(title,abstract);分类 cs.RO

AI总结 MemCompiler通过状态条件化记忆编译提升具身智能体的记忆效率与效果,在多个基准测试中实现性能提升和延迟降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10892 2026-05-15 cs.RO cs.MA 79%

HECTOR: Human-centric Hierarchical Coordination and Supervision of Robotic Fleets under Continual Temporal Tasks

HECTOR:面向人本的机器人舰队层级协调与监督方案

Shen Wang, Yinhang Luo, Jie Li, Meng Guo

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) National University of Defense Technology(国防科技大学)

专题命中 其他机器人 :robotic(title,abstract);分类 cs.RO

AI总结 HECTOR提出一种面向人本的机器人舰队协调与监督方案,通过三级层级结构实现动态任务分配与协调,提升计算效率并减少人工干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03577 2026-05-15 cs.CV cs.RO 66%

From Local Matches to Global Masks: Template-Guided Instance Detection and Segmentation in Open-World Scenes

从局部匹配到全局掩码:在开放世界场景中基于模板的实例检测与分割

Qifan Zhang, Sai Haneesh Allu, Jikai Wang, Yangxiao Lu, Yu Xiang

机构 * IRVLUTD

专题命中 其他机器人 :robotic(abstract);分类 cs.RO、cs.CV;robotics(comments)

AI总结 本文提出L2G-Det框架,通过模板与查询图像的密集补丁匹配实现实例检测与分割,避免显式提议,提升开放世界场景下的鲁棒性。

Comments Accepted to Robotics: Science and Systems (RSS) 2026. Project page: https://irvlutd.github.io/L2G/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14702 2026-05-15 math-ph cond-mat.soft math.MP physics.flu-dyn 50%

Weakly nonlinear analysis of Hopf bifurcations in the elastohydrodynamics of Cosserat rods

Cosserat杆弹性流体动力学中Hopf分岔的弱非线性分析

Mohamed Warda

专题命中 其他机器人 :robotic(abstract)

AI总结 研究了在粘性流体中由终端追随力驱动的平面Cosserat杆的 flutter 不稳定性弱非线性饱和现象,推导了临界振荡模式的Stuart-Landau幅值方程,并预测了超临界Hopf分岔的稳态振幅随阈值距离的平方根变化。

详情

展开后加载摘要…

URL PDF HTML 收藏