arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-29 至 2026-06-29 共收录 20 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 8 篇

2410.18647 2026-06-29 cs.RO 版本更新 89%

Data Scaling Laws in Imitation Learning for Robotic Manipulation

机器人操作模仿学习中的数据缩放定律

Fanqi Lin, Yingdong Hu, Pingyue Sheng, Chuan Wen, Jiacheng You, Yang Gao

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海期智研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);robotics(abstract);分类 cs.RO

AI总结 通过收集超过4万次演示和1.5万次真实机器人 rollout,发现策略泛化性能与环境和物体数量呈幂律关系,环境和物体多样性比演示数量更重要,据此提出高效数据收集策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05233 2026-06-29 cs.RO 版本更新 83%

MobileManiBench: Simplifying Model Verification for Mobile Manipulation

MobileManiBench:简化移动操作模型验证

Wenbo Wang, Fangyun Wei, QiXiu Li, Xi Chen, Yaobo Liang, Chang Xu, Jiaolong Yang, Baining Guo

机构 * Microsoft Research Asia(微软亚洲研究院) University of Sydney(悉尼大学) Tsinghua University(清华大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 提出仿真优先框架MobileManiBench,基于NVIDIA Isaac Sim和强化学习自动生成多样化移动操作轨迹,包含300K条轨迹,用于验证VLA模型在真实部署前的性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10271 2026-06-29 cs.CR cs.AI 版本更新 74%

MetaBreak: Jailbreaking Online LLM Services via Special Token Manipulation

MetaBreak: 通过特殊标记操纵越狱在线LLM服务

Wentian Zhu, Zhen Xiang, Wei Niu, Le Guan

专题命中 机器人操作 :manipulation(title);分类 cs.AI

AI总结 提出利用特殊标记构造攻击原语,绕过LLM安全对齐和内容审核,并发现防御困难,实验显示MetaBreak在内容审核下优于现有方法。

Comments Accepted version. Revised to match the version accepted to the 2026 IEEE Symposium on Security and Privacy (SP); added publication information and DOI

Journal ref Proceedings of the 2026 IEEE Symposium on Security and Privacy (SP), pp. 98-117, IEEE Computer Society, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15097 2026-06-29 cs.RO 版本更新 57%

AeroGrab: A Unified Framework for Aerial Grasping in Cluttered Environments

AeroGrab:杂乱环境下的空中抓取统一框架

Shivansh Pratap Singh, Naveen Sudheer Nair, Samaksh Ujjawal, Sarthak Mishra, Soham Patil, Rishabh Dev Yadav, Spandan Roy

机构 * Robotics Research Center (RRC)(机器人研究中心) IIIT Hyderabad(IIIT海得拉巴) Department of Computer Science(计算机科学系) The University of Manchester(曼彻斯特大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 提出一个集成主动探索、语言指令和碰撞感知抓取选择的端到端空中抓取框架,在杂乱环境中实现可靠抓取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16150 2026-06-29 cs.CR cs.AI cs.CL 版本更新 57%

PRISON: Unmasking the Criminal Potential of Large Language Models

PRISON:揭示大型语言模型的犯罪潜力

Xinyi Wu, Geng Hong, Pei Chen, Yueyue Chen, Xudong Pan, Min Yang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 提出PRISON框架,通过五个特质量化LLMs的犯罪潜力,发现最先进模型常表现出犯罪倾向,且检测欺骗行为准确率仅44%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20802 2026-06-29 stat.ML cs.LG stat.CO stat.ME 版本更新 57%

Towards Reliable Recommender Systems for Rating Data

面向评分数据的可靠推荐系统

Aurore Archimbaud, Andreas Alfons, Ines Wilms

机构 * TBS Business School(图卢兹商学院) Erasmus University Rotterdam(鹿特丹伊拉斯姆斯大学) Maastricht University(马斯特里赫特大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.LG

AI总结 针对评分数据中的离散性、恶意操纵、非随机缺失等挑战,提出鲁棒离散矩阵补全方法(RDMC),通过案例和仿真实验验证其可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04598 2026-06-29 quant-ph physics.optics 版本更新 50%

Arbitrary state preparation in quantum harmonic oscillators using neural networks

利用神经网络在量子谐振子中制备任意态

Nicolas Parra-A, Vladimir Vargas-Calderón, Herbert Vinck-Posada

专题命中 机器人操作 :manipulation(abstract)

AI总结 提出一种基于神经网络的方法,通过驱动与辅助量子比特耦合的量子谐振子,直接生成控制参数以制备任意量子态,无需逐实例优化,实现了高保真度制备。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04480 2026-06-29 quant-ph 版本更新 50%

Optimal control of open-quantum-system dynamics predicted by long short-term memory

长短期记忆预测的开量子系统动力学最优控制

Jun-Dong Zhong, Zhao-Ming Wang

专题命中 机器人操作 :manipulation(abstract)

AI总结 提出基于LSTM预测的开量子系统动力学的最优控制框架,通过两能级系统绝热加速和自旋链量子态转移示例验证了保真度提升。

Comments 13 pages, 8 figures, Published in Physical Review A

Journal ref Phys. Rev. A 113, 062442 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 3 篇

2603.09241 2026-06-29 cs.CV cs.RO 版本更新 88%

RAE-NWM: Navigation World Model in Dense Visual Representation Space

RAE-NWM:密集视觉表示空间中的导航世界模型

Mingkun Zhang, Wangtian Shen, Fan Zhang, Haijian Qin, Zihao Pei, Ziyang Meng

机构 * Department of Precision Instrument, Tsinghua University(清华大学精密仪器系) University of Rochester(罗切斯特大学) Beijing Information Science and Technology University(北京信息科技大学)

专题命中 具身导航 :navigation(title,abstract);world model(title,abstract);分类 cs.RO、cs.CV

AI总结 提出RAE-NWM,在密集视觉表示空间中使用条件扩散Transformer建模导航动态,提升结构稳定性和动作精度,从而改善下游规划与导航。

Comments Code is available at: https://github.com/20robo/raenwm

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16947 2026-06-29 cs.CV cs.RO 版本更新 87%

Image-based Geo-localization for Robotics: Are Black-box Vision-Language Models there yet?

基于图像的机器人地理定位:黑盒视觉语言模型是否已经足够?

Sania Waheed, Bruno Ferrarini, Michael Milford, Sarvapali D. Ramchurn, Shoaib Ehsan

机构 * University of Southampton(南安普顿大学) MyWay srl Queensland University of Technology(昆士兰科技大学) University of Essex(埃塞克斯大学)

专题命中 具身导航 :robotics(title,abstract);navigation(abstract,comments);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文首次系统研究黑盒生成式视觉语言模型作为独立零样本地理定位系统的潜力,发现其在粗粒度定位上表现良好,但在细粒度定位上因现实变化而显著退化。

Comments Accepted to the ICRA 2026 Workshop on Multi-Modal Spatial AI for Robust Navigation and Open-World Understanding (MM-SpatialAI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17455 2026-06-29 cs.CV cs.RO 版本更新 62%

VLM-Guided Visual Place Recognition for Planet-Scale Geo-Localization

VLM引导的视觉地点识别用于行星级地理定位

Sania Waheed, Na Min An, Michael Milford, Sarvapali D. Ramchurn, Shoaib Ehsan

机构 * Univ. of Southampton, UK(英国南安普顿大学) KAIST, South Korea(韩国科学技术院) QUT, Australia(昆士兰科技大学) Univ. of Essex, UK(英国埃塞克斯大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 提出VLM与检索式VPR结合的混合框架,利用VLM生成先验约束搜索空间,再通过检索和重排序实现行星级地理定位,在街道和城市级别分别提升4.51%和13.52%。

Journal ref Proceedings of the Australasian Conference on Robotics and Automation (ACRA 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 2 篇

2510.16732 2026-06-29 cs.CV 版本更新 89%

A Comprehensive Survey on World Models for Embodied AI

具身AI世界模型综述

Xinqing Li, Xin He, Le Zhang, Min Wu, Xiaoli Li, Yun Liu

机构 * College of Computer Science and the Academy for Advanced Interdisciplinary Studies, Nankai University(南开大学计算机科学学院与前沿交叉学科研究院) School of Computer Science and Engineering, Tianjin University of Technology(天津理工大学计算机科学与工程学院) School of Information and Communication Engineering, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院) Institute for Infocomm Research (I2R), Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局资讯通信研究院) Information Systems Technology and Design (ISTD) Pillar, Singapore University of Technology and Design (SUTD)(新加坡科技设计大学信息系统科技与设计系)

专题命中 具身推理 :embodied AI(title,abstract);world model(title,abstract);robotics(abstract);分类 cs.CV

AI总结 本文系统综述了具身AI中的世界模型,提出了功能、时间建模和空间表示的三轴分类法,并总结了数据资源、评估指标及开放挑战。

Comments https://github.com/Li-Zn-H/AwesomeWorldModels

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05092 2026-06-29 cs.RO cs.AI cs.CV 版本更新 82%

Driver-WM: A Driver-Centric Traffic-Conditioned Latent World Model for In-Cabin Dynamics Rollout

Driver-WM:以驾驶员为中心的交通条件潜在世界模型用于车内动态展开

Haozhuang Chi, Daosheng Qiu, Hao Su, Haochen Liu, Zirui Li, Haoruo Zhang, Chen Lv

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Hubei University, Wuhan, China(湖北大学,武汉,中国) Osaka University, Osaka, Japan(大阪大学,大阪,日本)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出Driver-WM,一种以驾驶员为中心的潜在世界模型,通过门控因果注入机制在紧凑潜在空间中联合预测驾驶员物理运动、行为和情感,实现外部交通到内部动态的因果展开。

Comments Accepted to the 19th European Conference on Computer Vision (ECCV 2026). This version includes the supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人基础模型 1 篇

2512.21970 2026-06-29 cs.RO 版本更新 57%

StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision

StereoVLA:利用立体视觉增强视觉-语言-动作模型

Shengliang Deng, Mi Yan, Yixin Zheng, Jiayi Su, Wenhao Zhang, Yitao Zeng, Xiaoguang Zhao, Heming Cui, Zhizheng Zhang, He Wang

机构 * Galbot CFCS, School of CS, Peking University(北京大学计算机学院CFCS) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) The University of Hong Kong(香港大学) Xiamen University Malaysia(厦门大学马来西亚分校) Southern University of Science and Technology(南方科技大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 提出StereoVLA,首个利用大规模合成立体数据引入丰富几何线索的VLA模型,通过几何与语义联合编码和协同训练目标,在真实实验中成功率绝对提升33.4%,并展现出对近半球视角的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 模仿学习与强化学习 3 篇

2605.03065 2026-06-29 cs.LG cs.RO 版本更新 73%

OGPO: Sample Efficient Full-Finetuning of Generative Control Policies

OGPO:生成控制策略的样本高效全微调

Sarvesh Patil, Mitsuhiko Nakamoto, Manan Agarwal, Shashwat Saxena, Jesse Zhang, Giri Anantharaman, Cleah Winston, Chaoyi Pan, Douglas Chen, Nai-Chieh Huang, Zeynep Temel, Oliver Kroemer, Sergey Levine, Abhishek Gupta, Hongkai Dai, Paarth Shah, Max Simchowitz

机构 * University of California, Berkeley(加州大学伯克利分校) UC Berkeley(加州大学伯克利分校)

专题命中 模仿学习与强化学习 :robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.LG

AI总结 提出OGPO算法,通过离策略评论网络和修改的PPO目标,实现生成控制策略的样本高效微调,在多种操作任务上达到最优性能,并能在无专家数据下微调不良初始化的行为克隆策略。

Comments Website: https://simchowitzlabpublic.github.io/ogpo-site/ Code: https://github.com/simchowitzlabpublic/OGPO_public

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11103 2026-06-29 cs.RO cs.AI 版本更新 73%

A Primer on SO(3) Action Representations in Deep Reinforcement Learning

深度强化学习中SO(3)动作表示入门

Martin Schuck, Sherif Samy, Angela P. Schoellig

专题命中 模仿学习与强化学习 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对SO(3)动作表示在强化学习中的选择问题,系统评估了多种表示在PPO、SAC、TD3算法下的效果,发现切向量表示最可靠。

Comments Published at The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30719 2026-06-29 cs.LG cs.AI 版本更新 62%

When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?

何时LLMs足以作为序列RL任务的策略优化器?

Stephane Hatgis-Kessell, Emma Brunskill

机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 提出PromptPO方法,利用LLM通过Python描述状态空间、动作空间和奖励函数,基于rollout反馈迭代生成和优化可执行策略,在多种环境中匹配或超越标准RL基线,但在细粒度连续控制任务中表现不足。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 机器人数据与评测 3 篇

2603.09731 2026-06-29 cs.CV cs.AI cs.CL 版本更新 62%

EXPLORE-Bench: Egocentric Scene Prediction with Long-Horizon Reasoning

EXPLORE-Bench:具有长视距推理的自我中心场景预测

Chengjun Yu, Xuhan Zhu, Chaoqun Du, Pengfei Yu, Wei Zhai, Yang Cao, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Foundation Model Team, Li Auto Inc.(蔚来汽车基础模型团队) Tsinghua University(清华大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI、cs.CV

AI总结 提出EXPLORE-Bench基准,通过初始场景图像和动作序列预测最终场景,评估多模态大模型在自我中心长视距推理中的能力,发现与人类存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06205 2026-06-29 cs.RO 版本更新 57%

KISS-IMU: Self-supervised Inertial Odometry with Motion-balanced Learning and Uncertainty-aware Inference

KISS-IMU:基于运动平衡学习与不确定性感知推理的自监督惯性里程计

Jiwon Choi, Hogyun Kim, Geonmo Yang, Juhui Lee, Younggun Cho

机构 * Electrical and Computer Engineering, Inha University(信息电子工程学院,印斯大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 提出KISS-IMU自监督框架,通过运动平衡训练和不确定性加权推理消除对真值依赖,仅用LiDAR作为轻量监督信号,实现鲁棒惯性里程计。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10764 2026-06-29 cs.CV 版本更新 57%

SurgXBench: Explainable Vision-Language Model Benchmark for Surgery

SurgXBench: 可解释的视觉-语言模型手术基准

Jiajun Cheng, Xianwu Zhao, Sainan Liu, Xiaofan Yu, Ravi Prakash, Patrick J. Codd, Jonathan Elliott Katz, Shan Lin

机构 * Arizona State University(亚利桑那州立大学) Intel Labs(英特尔实验室) Duke University(杜克大学) University of Miami(迈阿密大学) University of California, Merced(加州大学默塞德分校)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 针对手术视觉-语言模型(VLM)泛化能力不足的问题,提出SurgXBench基准,在零样本设置下评估多个先进VLM在器械与动作分类任务上的表现,并集成可解释AI分析模型注意力与因果解释,揭示模型依赖弱上下文线索而非临床相关证据的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏