arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-04-01 至 2026-04-01 共收录 12 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 12 篇

2512.01946 2026-04-01 cs.RO cs.CV 88%

Scaling Cross-Environment Failure Reasoning Data for Vision-Language Robotic Manipulation

为视觉-语言机器人操控扩展跨环境故障推理数据

Paul Pacaud, Ricardo Garcia, Shizhe Chen, Cordelia Schmid

机构 * Inria, École normale supérieure, CNRS, PSL Research University(法国国家信息与自动化研究所、巴黎高等师范学院、法国国家科学研究中心、巴黎文理研究大学)

专题命中 机器人数据与评测 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出自动框架生成多样化的机器人规划与执行故障数据,构建FailCoT数据集,训练Guardian模型提升故障检测泛化能力。

Comments Code, Data, and Models available at https://www.di.ens.fr/willow/research/guardian/. The paper contains 8 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28887 2026-04-01 cs.CV cs.AI cs.RO 82%

OccSim: Multi-kilometer Simulation with Long-horizon Occupancy World Models

OccSim:基于长期占用世界模型的多公里模拟

Tianran Liu, Shengwen Zhao, Mozhgan Pourkeshavarz, Weican Li, Nicholas Rhinehart

机构 * Learning, Embodied Autonomy, and Forecasting (LEAF) Lab, University of Toronto(多伦多大学学习、具身自主与预测(LEAF)实验室)

专题命中 机器人数据与评测 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 OccSim通过无需连续日志或HD地图,仅依赖初始帧和未来动作序列生成超过3000帧的3D占用地图,实现多公里规模的稳定生成,提升占用世界模型的生成长度达80倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05955 2026-04-01 cs.RO cs.CV 79%

SIMPACT: Simulation-Enabled Action Planning using Vision-Language Models

SIMPACT:基于视觉-语言模型的仿真增强动作规划

Haowen Liu, Shaoxiong Yao, Haonan Chen, Jiawei Gao, Jiayuan Mao, Jia-Bin Huang, Yilun Du

机构 * UMD(马里兰大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Harvard(哈佛大学) Amazon FAR(亚马逊FAR) UPenn(宾夕法尼亚大学)

专题命中 机器人数据与评测 :manipulation(abstract);world model(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 SIMPACT通过仿真循环世界建模赋予视觉-语言模型物理推理能力,实现高效动作规划,优于现有通用机器人操作模型,在五个复杂真实世界任务中表现优异。

Comments Accepted to CVPR 2026; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01142 2026-04-01 cs.CV 70%

ArtLLM: Generating Articulated Assets via 3D LLM

ArtLLM: 通过3D语言模型生成拟合资产

Penghao Wang, Siyuan Xie, Hongyu Yan, Xianghui Yang, Jingwei Huang, Chunchao Guo, Jiayuan Gu

机构 * ShanghaiTech University(上海科技大学) Tencent Hunyuan(腾讯混元) HKUST(香港科技大学)

专题命中 机器人数据与评测 :robotics(abstract);robot learning(abstract);分类 cs.CV

AI总结 ArtLLM通过3D语言模型直接从完整3D网格生成高质量拟合资产,解决了传统方法在关节拟合和部分检索中的局限,提升了部分布局和关节预测的准确性。

Comments CVPR 2026. Project page: https://authoritywang.github.io/artllm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03736 2026-04-01 cs.RO cs.LG cs.SY eess.SY 66%

Crossing the Sim2Real Gap Between Simulation and Ground Testing to Space Deployment of Autonomous Free-flyer Control

跨越仿真与地面测试到空间部署的自主自由飞行器控制的模拟与现实差距

Kenneth Stewart, Samantha Chapin, Roxana Leontie, Carl Glen Henshaw

机构 * U.S. Naval Research Laboratory Naval Center for Space Technology(美国海军研究实验室海军空间技术中心)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.LG;robotics(journal_ref)

AI总结 本文通过NASA Astrobee在国际空间站的实测,展示了基于强化学习的自主控制方法,验证了仿真到现实的训练管道,为未来在轨服务、组装和制造等任务提供可行性证明。

Comments published at iSpaRo 2025

Journal ref 2025 International Conference on Space Robotics (iSpaRo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09833 2026-04-01 cs.RO 65%

Bridging the Basilisk Astrodynamics Framework with ROS 2 for Modular Spacecraft Simulation and Hardware Integration

将Basilisk轨道动力学框架与ROS 2连接起来以实现模块化航天器仿真与硬件集成

Elias Krantz, Ngai Nam Chan, Gunnar Tibert, Huina Mao, Christer Fuglesang

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 机器人数据与评测 :robotics(abstract,comments);分类 cs.RO

AI总结 本文提出一种轻量级开源通信桥接Basilisk轨道动力学模拟器与ROS 2,实现航天器控制的实时双向数据交换,支持快速开发、回路测试及仿真到硬件的无缝过渡。

Comments Presented at the International Conference on Space Robotics (iSpaRo) 2025

Journal ref 2025 International Conference on Space Robotics (iSpaRo), Sendai, Japan, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15695 2026-04-01 cs.CV cs.LG 62%

ORIC: Benchmarking Object Recognition under Contextual Incongruity in Large Vision-Language Models

ORIC:在大视觉-语言模型中基于情境不一致性的物体识别基准测试

Zhaoyang Li, Zhan Ling, Yuchen Zhou, Litian Gong, Erdem Bıyık, Hao Su

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校) University of California, Riverside(加利福尼亚大学河滨分校) University of Southern California(南加利福尼亚大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV、cs.LG

AI总结 研究探讨了大视觉-语言模型在非典型场景中识别物体的困难,提出ORIC框架通过两种策略生成不一致的物体-情境对,并验证了情境不一致是不确定性的重要来源。

Comments We request withdrawal of this paper because one of the listed institutional affiliations was included without proper authorization. This issue cannot be resolved through a simple revision, and we therefore request withdrawal to prevent dissemination of incorrect or unauthorized affiliation information

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29697 2026-04-01 cs.CV 57%

FED-Bench: A Cross-Granular Benchmark for Disentangled Evaluation of Facial Expression Editing

FED-Bench:一种跨粒度的面部表情编辑评估基准

Fengjian Xue, Xuecheng Wu, Heli Sun, Yunyun Shi, Shi Chen, Liangyu Fu, Jinheng Xie, Dingkang Yang, Hao Wang, Junxiao Xue, Liang He

机构 * Xi’an Jiaotong University(西安交通大学) Northwestern Polytechnical University(西北工业大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Zhejiang Lab(之江实验室)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出FED-Bench,通过构建747个三元组基准,引入FED-Score评估协议,评估面部表情编辑的对齐、保真度和相对表达增益,揭示当前方法在高保真与准确表达操控间的困境,并提供20k+真实世界面部训练集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29666 2026-04-01 cs.CV 57%

CoRe-DA: Contrastive Regression for Unsupervised Domain Adaptation in Surgical Skill Assessment

CoRe-DA:基于对比学习的无监督领域适应在手术技能评估中的应用

Dimitrios Anastasiou, Razvan Caramalau, Jialang Xu, Runlong He, Freweini Tesfai, Matthew Boal, Nader Francis, Danail Stoyanov, Evangelos B. Mazomenos

机构 * UCL Hawkes Institute, University College London(伦敦大学学院霍克斯研究所) Dept of Computer Science, University College London(伦敦大学学院计算机科学系) The Griffin Institute(格里芬研究所)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文提出CoRe-DA,一种基于对比学习的无监督领域适应方法,用于手术技能评估,通过相对评分监督和目标域自训练,提升跨领域泛化能力,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29651 2026-04-01 cs.HC cs.AI cs.CL cs.IR 57%

Semantic Interaction for Narrative Map Sensemaking: An Insight-based Evaluation

语义交互用于叙事地图认知:基于洞察的评估

Brian Felipe Keith-Norambuena, Fausto German, Eric Krokos, Sarah Joseph, Chris North

机构 * Universidad Católica del Norte(智利天主教大学) Virginia Tech(弗吉尼亚理工大学) U.S. Government(美国政府)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 本文通过实验评估语义交互在叙事地图认知中的有效性,发现基于地图的原型比时间线基线更具洞察力,语义交互条件在统计上显著优于基本地图条件,提供了叙事认知中地图表示优于时间线的实证证据。

Comments Text2Story Workshop 2026 at ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08533 2026-04-01 cs.CV 57%

SecAgent: Efficient Mobile GUI Agent with Semantic Context

SecAgent:基于语义上下文的高效移动GUI代理

Yiping Xie, Song Chen, Jingxuan Xing, Wei Jiang, Zekun Zhu, Yingyao Wang, Pi Bu, Jun Song, Yuning Jiang, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘天集团)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 SecAgent通过构建中文移动GUI数据集和语义上下文机制,提升移动GUI代理的效率与性能,实现高效任务处理与多语言支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20155 2026-04-01 cs.CV 57%

PartNeXt: A Next-Generation Dataset for Fine-Grained and Hierarchical 3D Part Understanding

PartNeXt:面向细粒度和层次化3D部件理解的下一代数据集

Penghao Wang, Yiyang He, Xin Lv, Yukai Zhou, Lan Xu, Jingyi Yu, Jiayuan Gu

机构 * ShanghaiTech University(上海科技大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 PartNeXt通过23000个高质量纹理3D模型,解决传统数据集在可扩展性和实用性上的不足,提升细粒度部件分割和3D部件问答任务的性能。

Comments NeurIPS 2025 DB Track. Project page: https://authoritywang.github.io/partnext

详情

展开后加载摘要…

URL PDF HTML 收藏