arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-11 至 2026-05-11 共收录 18 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 18 篇

2604.26509 2026-05-11 cs.RO cs.CV 90%

3D Generation for Embodied AI and Robotic Simulation: A Survey

用于具身AI和机器人模拟的3D生成:综述

Tianwei Ye, Yifan Mao, Minwen Liao, Jian Liu, Chunchao Guo, Dazhao Du, Quanxin Shou, Fangqi Zhu, Song Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Wuhan University(武汉大学) Harbin Institute of Technology(哈尔滨工业大学) Xinjiang University(新疆大学) Tencent(腾讯)

专题命中 机器人数据与评测 :embodied AI(title,abstract);robotic(title,abstract);robot learning(abstract);分类 cs.RO、cs.CV

AI总结 本文综述了用于具身AI的3D生成,探讨了其在数据生成、模拟环境构建和Sim2Real桥梁中的作用,指出领域正从视觉真实转向交互准备,并识别了物理标注有限、几何质量与物理有效性差距等主要瓶颈。

Comments 27 pages, 11 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07687 2026-05-11 cs.RO 81%

PhySPRING: Structure-Preserving Reduction of Physics-Informed Twins via GNN

PhySPRING: 通过图神经网络实现物理信息双胞胎的结构保持降维

Yixiong Jing, Xingyuan Chen, Guangming Wang, Olaf Wysocki, Haibing Wu, Brian Sheil

机构 * University of Cambridge(剑桥大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人数据与评测 :robotics(abstract);manipulation(abstract);robot policy(abstract);robotic(abstract)

AI总结 PhySPRING通过图神经网络学习层次化简化图拓扑及其机械参数,实现弹簧-质量双胞胎的结构保持降维,提升重建和预测精度并提高计算效率。

Comments 16 pages and 6 pages, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06863 2026-05-11 cs.RO cs.HC 79%

Bi3: A Biplatform, Bicultural, Biperson Dataset for Social Robot Navigation

Bi3:一个双平台、双文化、双人数据集用于社交机器人导航

Andrew Stratton, Phani Teja Singamaneni, Pranav Goyal, Rachid Alami, Christoforos Mavrogiannis

机构 * Department of Robotics, University of Michigan(机器人系,密歇根大学) LAAS-CNRS, University of Toulouse(LAAS-CNRS,图卢兹大学) INRIA, University of Lorraine(INRIA,洛林大学)

专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.RO

AI总结 Bi3数据集通过双平台、双文化、双人交互,为社交机器人导航提供多样性模型复杂性的基准,用于研究人类与机器人在受限环境中的协同活动。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07325 2026-05-11 cs.RO cs.AI 73%

CSR: Infinite-Horizon Real-Time Policies with Massive Cached State Representations

CSR:具有大规模缓存状态表示的无限时间 horizon 实时策略

Robin Karlsson, Go Suzui

机构 * GODOT Inc(GODOT公司) Graduate School of Informatics, Nagoya University(名古屋大学信息研究生院)

专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract);分类 cs.RO、cs.AI

AI总结 本文提出CSR框架,通过优化KV缓存重用和异步状态协调算法,实现大规模LLM在机器人中的实时应用,显著降低延迟并提升性能。

Comments Extended Technical Report for Paper Accepted to IEEE RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07943 2026-05-11 cs.RO cs.AI cs.CV cs.LG 70%

TAVIS: A Benchmark for Egocentric Active Vision and Anticipatory Gaze in Imitation Learning

TAVIS:一种用于第一人称主动视觉和预见性注视的模仿学习基准

Giacomo Spigler

机构 * Department of Intelligent Systems(智能系统系)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 TAVIS提出了一种评估主动视觉模仿学习的基础设施,包含两个任务集和两个仿人躯干机器人,通过实验发现主动视觉对任务类型和条件具有任务依赖性,且多任务策略在分布偏移下表现下降,模仿学习能产生与人类参考相当的预见性注视。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02881 2026-05-11 cs.RO 70%

MolmoAct2: Action Reasoning Models for Real-world Deployment

MolmoAct2:面向现实部署的动作推理模型

Haoquan Fang, Jiafei Duan, Donovan Clay, Sam Wang, Shuo Liu, Weikai Huang, Xiang Fan, Wei-Chuan Tsai, Shirui Chen, Yi Ru Wang, Shanli Xing, Jaemin Cho, Jae Sung Park, Ainaz Eftekhar, Peter Sushko, Karen Farley, Angad Wadhwa, Cole Harrison, Winson Han, Ying-Chun Lee, Eli VanderBilt, Rose Hendrix, Suveen Ellawela, Lucas Ngoo, Joyce Chai, Zhongzheng Ren, Ali Farhadi, Dieter Fox, Ranjay Krishna

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学) National University of Singapore(新加坡国立大学) University of Pennsylvania(宾夕法尼亚大学) Johns Hopkins University(约翰霍普金斯大学) Amazon(亚马逊公司) University of Michigan(密歇根大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 机器人数据与评测 :robotics(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出MolmoAct2,一个完全开放的动作推理模型,通过改进架构和引入新数据集,在五个方面提升性能,展示了在多个基准测试中优于现有模型的成果。

Comments 31 pages, project page: https://allenai.org/blog/molmoact2

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08084 2026-05-11 cs.RO cs.CV 62%

123D: Unifying Multi-Modal Autonomous Driving Data at Scale

123D:规模化统一多模态自动驾驶数据

Daniel Dauner, Valentin Charraut, Bastian Berle, Tianyu Li, Long Nguyen, Jiabao Wang, Changhui Jing, Maximilian Igl, Holger Caesar, Boris Ivanovic, Yiyi Liao, Andreas Geiger, Kashyap Chitta

机构 * KE:SAI University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) NVIDIA Research(NVIDIA研究) Valeo Brain(法雷奥大脑) OpenDriveLab at Shanghai Innovation Institute(上海创新研究院自动驾驶实验室) Zhejiang University(浙江大学) Delft University of Technology(代尔夫特理工大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 123D通过单一API统一多模态自动驾驶数据,解决数据碎片化、同步难题,并提供分析工具,支持跨数据集3D目标检测和强化学习规划应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07675 2026-05-11 cs.AI cs.LG 62%

FactoryBench: Evaluating Industrial Machine Understanding

FactoryBench:评估工业机器理解的基准测试

Yanis Merzouki, Coral Izquierdo, Matei Ignuta-Ciuncanu, Marcos Gomez-Bracamonte, Riccardo Maggioni, Alessandro Lombardi, Camilla Mazzoleni, Federico Martelli, Balazs Gunther, Jonas Petersen, Philipp Petersen

机构 * ETH Zurich(苏黎世联邦理工学院) Forgis UC3M Imperial College London(帝国理工学院伦敦分校) University of Berkeley(伯克利大学) KTH Royal Institute of Technology(皇家理工学院) University of Vienna(维也纳大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FactoryBench基准测试,用于评估时间序列模型和LLM在工业机器人 telemetry 中的机器理解能力,通过四个因果层次和五种答案格式评估,包含70k问题-答案对,揭示当前模型与实际操作理解之间的差距。

Comments 9 pages, 4 figures, 14 tables; appendix with 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06815 2026-05-11 cs.AI cs.CV 62%

Uneven Evolution of Cognition Across Generations of Generative AI Models

不同世代生成式AI模型认知能力的不均衡发展

Isaac Galatzer-Levy, Daniel McDuff, Xin Liu, Jed McGiffin

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究) University of Washington(华盛顿大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 本文通过心理测量框架评估生成式AI的认知特征,发现其在语言抽象推理方面发展迅速,而视觉感知组织能力停滞,表明架构偏倚影响认知平衡发展。

Comments 25 pages, 5 Figures, 3 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07550 2026-05-11 cs.CV 57%

Mind the Gap: Geometrically Accurate Generative Reconstruction from Disjoint Views

注意间隙:从不重叠视角进行几何准确的生成重建

Grzegorz Wilczynski, Mikołaj Zielinski, Bartosz Świrta, Dominik Belter, Przemysław Spurek

机构 * Jagiellonian University(雅盖隆大学) IDEAS Research Institute(IDEAS研究机构) Poznań University of Technology(波兹南技术大学) Warsaw University of Technology(华沙技术大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出了一种新的生成重建范式,针对不重叠视角下的几何重建问题,提出GLADOS框架,通过生成桥梁、鲁棒粗重建和迭代上下文扩展优化,解决传统方法在零重叠场景下的失败问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02357 2026-05-11 cs.CV 57%

Channel-Level Relation to Attentive Aggregation with Neighborhood-Homogeneity Constraint for Point Cloud Analysis

通道级关系与具有邻域同质性约束的注意聚合在点云分析中的应用

Jiaqi Shi, Jin Xiao, Xiaoguang Hu, Wenxuan Ji, Zichong Jia, Zifan Long, Tianyou Chen, Baochang Zhang

机构 * 1School of Automation Science Electrical Engineering, Beihang University, Beijing, China 2Wuhan Leaddo Measuring \& Control Technology, Wuhan, China 3School of Artificial Intelligence, Beihang University, Beijing, China Emails

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 本文提出PointCRA网络,通过引入时间趋势变化作为新评估维度,解决现有空间和通道注意机制中权重维度坍缩导致的信息丢失问题,提升点云分析的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04939 2026-05-11 cs.CV 57%

SynthForensics: Benchmarking and Evaluating People-Centric Synthetic Video Deepfakes

SynthForensics:以人为中心的合成视频深度伪造基准测试与评估

Roberto Leotta, Salvatore Alfio Sambataro, Claudio Vittorio Ragaglia, Mirko Casu, Yuri Petralia, Francesco Guarnera, Luca Guarnera, Sebastiano Battiato

机构 * iCTLab s.r.l.(iCTLab公司) University of Catania(卡塔尼亚大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出SynthForensics基准测试,评估合成视频深度伪造的可检测性,通过20445个视频数据集验证了人类和算法在识别合成视频中的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01105 2026-05-11 cs.LG 57%

Geometric Analysis of Neural Regression Collapse via Intrinsic Dimension

神经回归崩溃的几何分析:通过内在维度

George Andriopoulos, Zixuan Dong, Bimarsha Adhikari, Keith Ross

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) SFSC of AI and DL, NYU Shanghai(纽约大学上海人工智能与深度学习学院) New York University(纽约大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.LG

AI总结 研究通过内在维度分析揭示神经回归崩溃的几何机制,发现过度压缩导致泛化能力下降,提出扩展或减少特征维度的策略以提升性能。

Comments 36 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09209 2026-05-11 cs.CV 57%

Surgical Visual Understanding (SurgVU) Dataset

外科视觉理解(SurgVU)数据集

Aneeq Zia, Max Berniker, Rogerio Nespolo, Xiaorui Zhang, Conor Perreault, Ziheng Wang, Benjamin Mueller, Ryan Schmidt, Kiran Bhattacharyya, Xi Liu, Anthony Jarc

机构 * Intuitive Surgical

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文介绍了用于外科数据科学的基础研究的大型外科视频数据集,包含视频及标注,展示了数据收集方法和独特属性,并提出了多个示例问题,旨在推动机器学习领域在手术数据科学中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18149 2026-05-11 cs.RO cs.SY eess.SY math.OC 57%

Code Generation and Conic Constraints for Model-Predictive Control on Microcontrollers with Conic-TinyMPC

基于锥约束的模型预测控制与代码生成:适用于微控制器的Conic-TinyMPC

Ishaan Mahajan, Khai Nguyen, Sam Schoedel, Elakhya Nedumaran, Moises Mata, Brian Plancher, Zachary Manchester

机构 * School of Engineering and Applied Science, Columbia University(哥伦比亚大学工程与应用科学学院) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) Barnard College, Columbia University and Dartmouth College(哥伦比亚大学巴纳德学院和达特茅斯学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出一种适用于微控制器的模型预测控制方法,通过支持二次锥约束和自动生成C++代码,显著提升了嵌入式系统的求解速度和问题规模。

Comments Accepted to ICRA 2026. 4 Figures. 2 Tables. First three authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07388 2026-05-11 cs.CV 57%

A Marine Debris Detection Framework for Ocean Robots via Self-Attention Enhancement and Feature Interaction Optimization

面向海洋机器人的海洋垃圾检测框架:通过自注意力增强与特征交互优化

Yuyang Li, Jiashu Han, Yinyi Lai, Wenbin Kang, Zenghui Liu

机构 * Hefei Institutes of Physical Science, Chinese Academy of Sciences(中国科学院合肥物质科学研究院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文提出YOLO-MD框架,通过自注意力增强模块和轻量级位移操作提升海洋垃圾检测性能,实验表明在UODM数据集上取得优异精度和F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24136 2026-05-11 cs.CV eess.IV 57%

Bridging Restoration and Generation Manifolds in One-Step Diffusion for Real-World Super-Resolution

连接恢复与生成流形的单步扩散在现实世界超分辨率中的应用

Shyang-En Weng, Yi-Cheng Liao, Yu-Syuan Xu, Wei-Chen Chiu, Ching-Chun Huang

机构 * National Yang Ming Chiao Tung University, Hsinchu, Taiwan MediaTek Inc., Taiwan

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 本文提出IDaS-SR框架,通过Manifold Inversion Noise Estimator和CHARIOT机制,解决单步扩散中恢复与生成流形的匹配问题,提升现实世界超分辨率的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24091 2026-05-11 cs.DC 50%

Unfolding an Atomistic World: Atomistic Simulation of Reactor Pressure Vessel Steel Across Year-and-Meter Scales

揭示原子世界:反应堆压力容器钢的原子模拟跨越年和米尺度

Haozhi Han, Ruge Zhang, Haoquan Chen, Yifeng Chen, Haipeng Jia, Liang Yuan, Yunquan Zhang, Ting Cao, Yunxin Liu, Ya-Qin Zhang, Kun Li

专题命中 机器人数据与评测 :world model(abstract)

AI总结 本文提出AtomWorld框架,通过算法、HPC和应用三层协同,实现反应堆压力容器钢在年和米尺度的原子模拟,首次达到十夸脱原子系统的模拟规模,时间效率达1.71天/服务年。

详情

展开后加载摘要…

URL PDF HTML 收藏