arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-18 至 2026-05-18 共收录 76 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 13 篇

2601.09512 2026-05-18 cs.RO cs.LG 74%

CLARE: Continual Learning for Vision-Language-Action Models via Autonomous Adapter Routing and Expansion

CLARE:通过自主适配器路由和扩展实现视觉-语言-动作模型的持续学习

Ralf Römer, Yi Zhang, Yuming Li, Angela P. Schoellig

机构 * Technical University of Munich(慕尼黑技术大学) TUM School of Computation, Information and Technology(TUM计算、信息与技术学院) Department of Computer Engineering, Learning Systems and Robotics Lab(计算机工程系、学习系统与机器人实验室) Munich Institute of Robotics and Machine Intelligence (MIRMI)(慕尼黑机器人与机器智能研究所(MIRMI)) Robotics Institute Germany(德国机器人研究所) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 机器人数据与评测 :robotics(abstract,comments);manipulation(abstract);分类 cs.RO、cs.LG

AI总结 CLARE提出一种参数高效、无需示例的持续学习框架,通过自主扩展模型模块,实现机器人在新任务中保持旧知识,优于基于示例的方法。

Comments Accepted to IEEE Robotics and Automation Letters 2026. Project page: https://tum-lsy.github.io/clare. 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14092 2026-05-18 eess.SY cs.RO cs.SY 74%

Simultaneous State Estimation and Online Model Learning in a Soft Robotic System

在软机器人系统中同时进行状态估计和在线模型学习

Jan-Hendrik Ewering, Max Bartholdt, Simon F. G. Ehlers, Niklas Wahlström, Thomas B. Schön, Thomas Seel

机构 * Department of Information Technology, Uppsala University(信息科技系,乌普萨拉大学) Vascular Surgery, Hannover Medical School(血管外科,汉诺威医学院)

专题命中 机器人数据与评测 :robotic(title);分类 cs.RO

AI总结 本文提出一种方法,利用灰盒系统识别工具,在线学习软机器人的弯曲刚度模型并准确估计其姿态。

Comments 8 pages, 3 figures, 2 tables, contribution to the International Conference on Information Fusion 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18361 2026-05-18 cs.CV cs.AI 62%

COCO-Inpaint: A Benchmark for Detecting and Localizing Inpainting-Based Image Manipulations

COCO-Inpaint:用于检测和定位基于修补的图像篡改的基准

Haozhen Yan, Yan Hong, Jiahui Zhan, Suning Lang, Yikun Ji, Huijia Zhu, Jun Lan, Jianfu Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出COCO-Inpaint基准,用于检测和定位基于修补的图像篡改,通过高质样本、多样场景和大规模覆盖,揭示修补与真实区域的内在不一致。

Comments 6 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15342 2026-05-18 cs.CV cs.LG 62%

Minerva-Ego: Spatiotemporal Hints for Egocentric Video Understanding

Minerva-Ego:眼动视频理解的空间时间提示

Arsha Nagrani, Jasper Uijilings, Shyamal Buch, Tobias Weyand, Sudheendra Vijayanarasimhan, Bo Hu, Ramin Mehran, David A Ross, Cordelia Schmid

机构 * Google(谷歌) DeepMind(深度Mind)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.CV、cs.LG

AI总结 本文提出Minerva-Ego基准,通过多步骤多模态问题和密集标注的时空推理轨迹评估眼动视频理解模型,发现提示'何时何地'显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16116 2026-05-18 cs.AI 57%

ShopGym: An Integrated Framework for Realistic Simulation and Scalable Benchmarking of E-Commerce Web Agents

ShopGym: 一个集成框架,用于电子商务网络代理的现实模拟和可扩展基准测试

Chinmay Savadikar, Mingyu Zhao, Yuanzheng Zhu, Han Li, Shuang Xie, Alberto Castelo, Tianfu Wu, Lingyun Wang

机构 * North Carolina State University(北卡罗来纳州立大学) Shopify

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 本文提出ShopGym框架,通过模拟层ShopArena和基准层ShopGuru,实现电子商务网络代理的现实模拟与可扩展基准测试,验证了合成商店在结构属性和代理性能上的有效性。

Comments 32 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15923 2026-05-18 cs.CV 57%

Invaria: Learning Scale and Density Invariance in Point Clouds via Next-Resolution Prediction

Invaria:通过下一分辨率预测实现点云中的尺度和密度不变性

Chun-Peng Chang, Shaoxiang Wang, Alain Pagani, Dariu Gavrila, Holger Caesar

机构 * TU Delft(代尔夫特理工大学) DFKI(德累斯顿德国研究院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出Invaria,一种通过下一分辨率预测和感受野校准实现点云尺度和密度不变性的编码器,提升了模型在不同分辨率下的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02812 2026-05-18 cs.RO 57%

Learning Structured Robot Policies from Vision-Language Models via Synthetic Neuro-Symbolic Supervision

通过合成神经符号监督学习结构化机器人策略

Alessandro Adami, Tommaso Tubaldo, Marco Todescato, Ruggero Carli, Pietro Falco

机构 * University of Padova, Dept. of Information Engineering(帕多瓦大学信息工程系) Fraunhofer Italia Research(弗劳恩霍夫意大利研究所) Polytechnic of Bari Dept. of Electrical and Information Engineering(巴里理工学院电气与信息工程系)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出通过合成神经符号监督方法,利用视觉语言模型生成结构化机器人策略,结合多模态感知与符号控制,实现高维学习与符号控制的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15650 2026-05-18 cs.RO 57%

MyoChallenge 2025: A New Benchmark for Human Athletic Intelligence

MyoChallenge 2025: 人类运动智能的新基准

Cheryl Wang, Chun Kwang Tan, Balint K. Hodossy, Eric Lyu, Jun Guo, Wentao Zhao, Huaping Liu, Chengkun Li, Merkourios Simos, Bianca Ziliotto, Alexander Mathis, Siyuan Liu, Jiahao Chen, Shanlin Zhong, Bo Jiang, Ci Song, Yaoye Zhu, Chenhui Zuo, Yanan Sui, Mohamed Irfan Refai, Massimo Sartori, Guillaume Durandau, Vikash Kumar, Vittorio Caggiano

机构 * McGill University(麦吉尔大学) National University of Singapore(国立新加坡大学) Imperial College London(伦敦帝国理工学院) King’s College London(伦敦国王学院) Tsinghua University(清华大学) EPFL(苏黎世联邦理工学院) CASIA(中国科学院自动化所) University of Twente(代尔夫特理工大学) MyoLab

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文提出MyoChallenge 2025基准,通过高保真骨骼肌模型与机器学习算法结合,推动运动控制智能研究,包含乒乓球和足球点球两个任务,促进多学科交叉研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15535 2026-05-18 cs.CV 57%

Learning Dynamic Structural Specialization for Underwater Salient Object Detection

学习动态结构专业化用于水下显著目标检测

Lin Hong, Chenhui Wang, Linan Deng, Yuning Cui, Yu Zhang, Xin Wang, Bojian Zhang, Wenqi Ren, Xingchen Yang, Fumin Zhang

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学) School of Robotics and Advanced Manufacture, Harbin Institute of Technology(机器人与先进制造学院,哈尔滨工业大学) School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学) College of Computer Science & Visual Computing and Intelligent Perception Lab, Nankai University(计算机科学与视觉计算学院及智能感知实验室,南开大学) School of Cyber Science and Technology, Sun Yat-sen University(网络科学与技术学院,中山大学) School of Automation, Southeast University(自动化学院,东南大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文提出DSS-USOD方法,通过动态结构专业化解决水下图像退化导致的定位不准确、区域碎片化和边界预测粗的问题,提升边界精度与区域一致性。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15226 2026-05-18 cs.AR cs.AI cs.SE 57%

Is Agentic AI Ready for Real-World Hardware Engineering? A Deep Dive with Phoenix-bench

代理AI是否准备好进行现实世界硬件工程?通过Phoenix-bench的深入探讨

Qingyun Zou, Feng Yu, Hongshi Tan, Bingsheng He, WengFai Wong

机构 * National University of Singapore(新加坡国立大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 本文通过Phoenix-bench评估代理AI在硬件工程中的表现,发现软件与硬件工程本质不同,且故障集中于设计控制流、验证测试用例等,定位精度比定位本身更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14572 2026-05-18 cs.IR cs.AI cs.CL cs.MA 57%

Don't Retrieve, Navigate: Distilling Enterprise Knowledge into Navigable Agent Skills for QA and RAG

不要检索,导航:将企业知识转化为可导航的代理技能用于问答和RAG

Yiqun Sun, Pengfei Wei, Lawrence B. Hsieh

机构 * Magellan Technology Research Institute(马格纳技术研究 institute)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI

AI总结 本文提出Corpus2Skill,通过将文档库转化为层次化技能目录,使LLM代理在服务时能导航该目录,提升问答质量和 grounding,但指出导航并非所有场景下的最佳替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他机器人 5 篇

2605.15661 2026-05-18 cs.CV cs.AI 73%

VAGS: Velocity Adaptive Guidance Scale for Image Editing and Generation

VAGS:图像编辑与生成的速率自适应引导尺度

Yan Luo, Ahmadou Aidara, Jingyi Lu, Jeremy Moebel, Kai Han, Mengyu Wang

机构 * Harvard AI and Robotics Lab(哈佛人工智能与机器人实验室) Harvard University(哈佛大学) School of Computing and Data Science(计算与数据科学学院) The University of Hong Kong(香港大学) Kempner Institute for the Study of Natural and Artificial Intelligence(自然与人工智能研究学院)

专题命中 其他机器人 :robotics(abstract,abstract_cn);分类 cs.AI、cs.CV

AI总结 VAGS通过自适应引导尺度提升图像编辑和生成的结构保真度和生成质量,无需微调或额外计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16065 2026-05-18 cs.CV cs.AI 62%

Robust Prior-Guided Segmentation for Editable 3D Gaussian Splatting

鲁棒的先验引导分割用于可编辑的3D高斯散射

Raushan Joshi, Jean-Yves Guillemaut

机构 * University of Surrey(萨里大学)

专题命中 其他机器人 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 本文提出利用SAM-HQ生成准确2D掩码,通过先验引导标签重新分配实现鲁棒的3D分割,提升编辑任务的精度和效率。

Comments Accepted at IEEE International Conference on Image Processing 2026, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12894 2026-05-18 cs.RO cs.CV 62%

Sparse ActionGen: Accelerating Diffusion Policy with Real-time Pruning

稀疏动作生成:通过实时剪枝加速扩散策略

Kangye Ji, Jianbo Zhou, Yuan Meng, Ye Li, Hanyun Cui, Zhi Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Department of Computer Science(计算机科学系)

专题命中 其他机器人 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出SAG方法,通过自适应剪枝和重用机制实现稀疏动作生成,提升实时视觉运动控制效率,实验显示生成速度提升4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17572 2026-05-18 cs.RO 57%

Sampling-Based Global Optimal Control and Estimation via Semidefinite Programming

基于采样的全局最优控制与估计通过半正定规划

Antoine Groudiev, Fabian Schramm, Éloïse Berthier, Justin Carpentier, Frederike Dümbgen

机构 * École Normale Supérieure, PSL Research University(巴黎高等师范大学,PSL研究大学) Inria, Département d’informatique de l’ENS, CNRS, PSL Research University(法国国家科学研究中心,ENS计算机系,PSL研究大学) U2IS, ENSTA, Institut Polytechnique de Paris(巴黎高等理工学院,U2IS)

专题命中 其他机器人 :robotics(abstract);分类 cs.RO

AI总结 本文将KernelSOS理论应用于控制和机器人领域,解决实际应用中的重启策略、超参数校准等关键问题,并展示其在高维非参数轨迹优化中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12281 2026-05-18 eess.SP 50%

Ambient IoT: Communications Enabling Precision Agriculture

环境物联网:赋能精准农业的通信技术

Ashwin Natraj Arun, Byunghyun Lee, Fabio A. Castiblanco, Dennis R. Buckmaster, Chih-Chun Wang, David J. Love, James V. Krogmeier, M. Majid Butt, Amitava Ghosh

专题命中 其他机器人 :robotics(abstract)

AI总结 本文探讨了环境物联网在精准农业中的应用,分析其优势及与其他环境能源技术的对比,提出未来研究方向。

Comments 7 pages, 4 figures and 2 tables

Journal ref IEEE Communications Magazine, Vol. 63, No. 4, pp. 137-143, April 2025

详情

展开后加载摘要…

URL PDF HTML 收藏