arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-24 至 2026-06-24 共收录 66 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 14 篇

2602.23324 2026-06-24 physics.bio-ph cond-mat.stat-mech q-bio.QM 版本更新 78%

Discrete turn strategies emerge in information-limited navigation

离散转向策略在信息受限导航中的涌现

Jose M. Betancourt, Matthew P. Leighton, Thierry Emonet, Benjamin B. Machta, Michael C. Abbott

专题命中 具身导航 :navigation(title,abstract)

AI总结 通过信息速率最大化框架,发现无方向信息时离散动作策略优于连续转向,并揭示了最优策略随信息量增加的系列相变。

Comments 7 pages, 4 figures, plus appendices. v2 has extended introduction, new figures, minor corrections

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08766 2026-06-24 physics.flu-dyn 版本更新 78%

Optimal navigation in two-dimensional flows: Control theory and reinforcement learning

二维流动中的最优导航:控制理论与强化学习

Vladimir Parfenyev

专题命中 具身导航 :navigation(title,abstract)

AI总结 研究在二维流动中,受平流和自推进的智能体(如漂浮无人机)的最小时间路径问题,利用最优控制理论求解,并应用强化学习(Q学习和演员-评论家算法)设计鲁棒导航策略,在规则流中接近最优解,在湍流中偏差增大,且粗粒化训练可泛化至全流场。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24180 2026-06-24 cs.CV cs.AI 新提交 73%

Deep Learning Approaches for 3D Medical Scene Completion: From Geometric Modeling to Generative Paradigms

三维医学场景补全的深度学习方法:从几何建模到生成范式

Afifa Khaled, Said Jadid Abdulkadir, Majdy Mohamed Eltayeb Eltahir

机构 * Universiti Teknologi PETRONAS(马来西亚国油科技大学) King Khalid University(哈立德国王大学)

专题命中 具身导航 :robotics(abstract);navigation(abstract);分类 cs.AI、cs.CV

AI总结 本文系统综述了2016-2026年间三维场景补全技术的演进,从SSCNet的体素语义补全到结合扩散先验与高斯泼溅的实时渲染新范式,讨论了多种表示范式并提出了分类法,最后给出了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22346 2026-06-24 cs.RO 版本更新 70%

A Pairwise Human-Human Interaction Detection and Recognition Framework for Mobile Service Robots

面向移动服务机器人的成对人-人交互检测与识别框架

Mengyu Liang, Iolanda Leite, Sarah Gillet

机构 * Wallenberg AI, Autonomous Systems and Software Program – Humanity and Society(瓦伦贝格人工智能、自主系统和软件计划—人类与社会)

专题命中 具身导航 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出两阶段框架,先利用轻量几何和运动线索识别交互对,再通过关系网络分类交互类型,在JRDB数据集上以较低计算成本取得竞争性能,并在CAD和零样本数据集上验证泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24712 2026-06-24 cs.RO cs.AI 新提交 62%

TACTFUL: Tactile-Driven Exploration For Object Localization and Identification in Confined Environments

TACTFUL: 受限环境中的触觉驱动探索用于物体定位与识别

Shivani Kamtikar, Chung Hee Kim, Camilla Tabasso, Tye Brady, Joshua Migdal, Taskin Padir

机构 * Amazon Fulfillment Technologies & Robotics(亚马逊履约技术与机器人) Siebel School of Computing and Data Science, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校西贝尔计算与数据科学学院) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 具身导航 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出无视觉触觉探索框架TACTFUL,使多指机器人通过动态奖励策略平衡全局探索与局部表面细化,实现物体自主发现与识别,平均重建误差0.015米,成功率77%。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24350 2026-06-24 cs.RO 新提交 57%

SlipSense: Multimodal Sensing for Online Slip Detection in Legged Robots

SlipSense: 用于足式机器人在线滑移检测的多模态传感

Iris Szu-Yao Liu, Chien Chern Cheah, Meng Yee Michael Chuah

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) Institute for Infocomm Research, Agency for Science Technology and Research(资讯通信研究院,科技研究局)

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 提出SlipSense框架,通过定制轻量化传感器足和LSTM模型,实现四足机器人基于力的在线滑移检测,早期滑移检测精度达24.1mm,准确率85.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19257 2026-06-24 cs.RO 版本更新 57%

PRISM-SLAM: Probabilistic Ray-Grounded Inference for Scale-aware Metric SLAM

PRISM-SLAM: 面向尺度感知度量SLAM的概率射线基础推理

Eunsoo Im, Gyeonggwan Lee, Seunghwan Hong, Junghun Suh

机构 * KakaoMobility, South Korea(韩国 KakaoMobility)

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 提出PRISM-SLAM框架,通过将视觉基础模型先验集成到贝叶斯因子图中,利用Plücker射线距离因子和动态场景不确定性门控机制,实现无尺度漂移的实时单目度量SLAM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23925 2026-06-24 eess.SP cs.SY eess.SY 新提交 50%

A Kalman Filter-Based Tracking Loop Design for Real-Time Aerospace GNSS Applications with Minimum Pull-Out Probability

基于卡尔曼滤波的跟踪环路设计,用于实时航空航天GNSS应用,具有最小拉出概率

J. Fermín Llorente, Javier A. Smidt, Pedro A. Roncagliolo, Ramón López La Valle

专题命中 具身导航 :navigation(abstract)

AI总结 针对硬件相关器处理延迟导致传统卡尔曼滤波次优的问题,提出修正卡尔曼滤波(mKF),通过重测量更新保持最优性,并基于拉出概率解析表达式系统化调谐参数,在同等噪声带宽下实现更低高阶状态误差和更高动态锁定能力。

Comments This is a revised version of the manuscript. V1 was previously posted on TechRxiv with DOI: 10.36227/techrxiv.176344172.21345819/v1 This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23866 2026-06-24 cs.LO 新提交 50%

Complex Autonomous UAV Task Execution and Decision-Making With s(CASP)

基于s(CASP)的复杂自主无人机任务执行与决策

Keegan Kimbrell, Alexis R. Tudor, Peter Van, Trevor Bihl, Doug Slattery, Gopal Gupta

专题命中 具身导航 :navigation(abstract)

AI总结 提出使用s(CASP)回答集编程系统构建符号状态中心的无人机代理,在虚幻引擎5环境中实现基于约束的常识推理,支持多步骤自主行为并动态调整计划,确保决策正确可解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24547 2026-06-24 physics.bio-ph cond-mat.soft 新提交 50%

Emergent Self-Organisation of Intelligent Active Particles

智能活性粒子的涌现自组织

Priyanka Iyer, Segun Goh, Gerhard Gompper

专题命中 具身导航 :navigation(abstract)

AI总结 研究智能活性粒子通过非互易相互作用和信息传播形成涌现自组织,包括群体形成、捕食行为和复杂环境导航。

Comments "perspective" article, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23921 2026-06-24 cond-mat.soft 新提交 50%

Flexibility Controls Active-Filament Transport in Crowded Landscapes

柔性控制拥挤环境中的活性细丝输运

Qingyi Di, Mohammad Fazelzadeh, Sara Jabbari-Farouji

专题命中 具身导航 :navigation(abstract)

AI总结 通过布朗动力学模拟,研究活性聚合物在有序和无序障碍物阵列中的输运,发现柔性在中等时优化无序环境中的扩散,而半柔性细丝在密集有序阵列中因定向运动增强迁移率,并识别出三种输运机制。

Comments 15 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21922 2026-06-24 math.DG 新提交 50%

Sub-Randers metrics

子Randers度量

Layth M. Alabdulsada

专题命中 具身导航 :navigation(abstract)

AI总结 提出子Randers度量,通过添加单形式到子黎曼度量定义,利用庞特里亚金最大值原理导出正规测地线方程,证明Zermelo导航生成正规测地线,并推广Hopf-Rinow定理。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 8 篇

2606.11129 2026-06-24 cs.CV 新提交 85%

WorldOlympiad: Can Your World Model Survive a Triathlon?

WorldOlympiad:你的世界模型能经受铁人三项考验吗?

Yuke Zhao, Wangbo Zhao, Weijie Wang, Zeyu Zhang, Dakai An, Akide Liu, Yinghao Yu, Jiasheng Tang, Fan Wang, Wei Wang, Bohan Zhuang

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) The Hong Kong University of Science and Technology(香港科技大学) Monash University(莫纳什大学) TRE, Alibaba Group(阿里巴巴TRE)

专题命中 具身推理 :world model(title,abstract);robotics(abstract);manipulation(abstract);分类 cs.CV

AI总结 提出WorldOlympiad基准,从物理忠实性、几何一致性和交互保真度三个维度诊断视频世界模型,揭示现有模型在物理推理、3D一致性和长程交互方面的显著不足。

Comments Project Page: https://alibaba-damo-academy.github.io/WorldOlympiad/, Code: https://github.com/alibaba-damo-academy/WorldOlympiad

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02800 2026-06-24 cs.CV cs.AI cs.LG cs.MM cs.RO 版本更新 85%

Cosmos 3: Omnimodal World Models for Physical AI

Cosmos 3:面向物理AI的全模态世界模型

NVIDIA, :, Aditi, Niket Agarwal, Arslan Ali, Jon Allen, Martin Antolini, Adeline Aubame, Alisson Azzolini, Junjie Bai, Maciej Bala, Yogesh Balaji, Josh Bapst, Aarti Basant, Mukesh Beladiya, Mohammad Qazim Bhat, Zaid Pervaiz Bhat, Dan Blick, Vanni Brighella, Han Cai, Tiffany Cai, Eric Cameracci, Jiaxin Cao, Yulong Cao, Mark Carlson, Carlos Casanova, Ting-Yun Chang, Yan Chang, Yu-Wei Chao, Prithvijit Chattopadhyay, Roshan Chaudhari, Chieh-Yun Chen, Junyu Chen, Ke Chen, Qizhi Chen, Wenkai Chen, Xiaotong Chen, Yu Chen, An-Chieh Cheng, Click Cheng, Xiu Chia, Jeana Choi, Chaeyeon Chung, Wenyan Cong, Yin Cui, Magdalena Dadela, Nalin Dadhich, Wenliang Dai, Joyjit Daw, Alperen Degirmenci, Rodrigo Vieira Del Monte, Robert Denomme, Sameer Dharur, Marco Di Lucca, Ke Ding, Wenhao Ding, Yifan Ding, Yuzhu Dong, Nicole Drumheller, Yilun Du, Aigul Dzhumamuratova, Aleksandr Efitorov, Hamid Eghbalzadeh, Naomi Eigbe, Imad El Hanafi, Hassan Eslami, Benedikt Falk, Jiaojiao Fan, Jim Fan, Amol Fasale, Sergiy Fefilatyev, Liang Feng, Francesco Ferroni, Sanja Fidler, Xiao Fu, Vikram Fugro, Prashant Gaikwad, TJ Galda, Katelyn Gao, Yihuai Gao, Wenhang Ge, Sreyan Ghosh, Arushi Goel, Vivek Goel, Akash Gokul, Rama Govindaraju, Jinwei Gu, Miguel Guerrero, Elfie Guo, Aryaman Gupta, Siddharth Gururani, Hugo Hadfield, Song Han, Ankur Handa, Zekun Hao, Mohammad Harrim, Ali Hassani, Nathan Hayes-Roth, Yufan He, Chris Helvig, Cyrus Hogg, Madison Huang, Michael Huang, Sophia Huang, Yufan Huang, Jacob Huffman, DeLesley Hutchins, Suneel Indupuru, Boris Ivanovic, Arihant Jain, Joel Jang, Ryan Ji, Yanan Jian, Dongfu Jiang, Jingyi Jin, Atharva Joshi, Nikhilesh Joshi, Pranjali Joshi, Andy Ju, Jaehun Jung, Weiwei Kang, Scott Kassekert, Jan Kautz, Ashna Khetan, Julia Kiczka, Slawek Kierat, Gwanghyun Kim, Kuno Kim, Sunny Kim, Kezhi Kong, Xin Kong, Zhifeng Kong, Tomasz Kornuta, Egor Krivov, Hui Kuang, Saurav Kumar, Chia-Wen Kuo, George Kurian, Wojciech Kutak, JF Lafleche, Himangshu Lahkar, Omar Laymoun, Jayjun Lee, Sanggil Lee, Gabriele Leone, Boyi Li, Freya Li, Jiajun Li, Jinfeng Li, Ling Li, Pengcheng Li, Shangru Li, Tingle Li, Xiaolong Li, Xuan Li, Zhaoshuo Li, Zhiqi Li, Hao Liang, Maosheng Liao, Chen-Hsuan Lin, Tsung-Yi Lin, Ming-Yu Liu, Sifei Liu, Zihan Liu, Hai Loc Lu, Xiangyu Lu, Alice Luo, Ruipu Luo, Wenjie Luo, Jiangran Lyu, Martin Ding Ma, Nic Ma, Qianli Ma, Dawid Majchrowski, Louis Marcoux, Miguel Martin, Qing Miao, Ashkan Mirzaei, Shreyas Misra, Kaichun Mo, Durra Mohsin, Hyejin Moon, Pawel Morkisz, Saeid Motiian, Kirill Motkov, Seungjun Nah, Yashraj Narang, Deepak Narayanan, Thabang Ngazimbi, Julian Ouyang, Shubham Pachori, David Page, Yatian Pang, Sehwi Park, Mahesh Patekar, Mostofa Patwary, Marco Pavone, Trung Pham, Wei Ping, Soha Pouya, Shrimai Prabhumoye, Varun Praveen, Delin Qu, Hesam Rabeti, Morteza Ramezanali, Marilyn Reeb, Xuanchi Ren, Kristen Rumley, Wojciech Rymer, Jun Saito, Yeongho Seol, John Shao, Piyush Shekdar, Tianwei Shen, Humphrey Shi, Min Shi, Stella Shi, Kevin Shih, Mohammad Shoeybi, Mateusz Sieniawski, Shuran Song, Alexander Sotelo, Amir Sotoodeh, Sunil Srinivasa, Vignesh Srinivasakumar, Bartosz Stefaniak, Rahul Heinrich Steiger, Shangkun Sun, Jiaxiang Tang, Shitao Tang, Yangyang Tang, Yue Tang, Tolou Tavakkoli, Kayley Ting, Krzysztof Tomala, Wei-Cheng Tseng, Jibin Varghese, Sergei Vasilev, Thomas Volk, Raju Wagwani, Roger Waleffe, Andrew Z. Wang, Boxiang Wang, Haoxiang Wang, Qiao Wang, Shihao Wang, Shijie Wang, Ting-Chun Wang, Yan Wang, Yu Wang, Rohit Watve, David Wehr, Fangyin Wei, Xinshuo Weng, Jay Zhangjie Wu, Kedi Wu, Hongchi Xia, Summer Xiao, Tianjun Xiao, Kevin Xie, Daguang Xu, Jiashu Xu, Mengyao Xu, Ruqing Xu, Xingqian Xu, Yao Xu, Dinghao Yang, Dong Yang, Hans Yang, Xiaodong Yang, Xuning Yang, Yichu Yang, Yurong You, Zhiding Yu, Hao Yuan, Simon Yuen, Xiaohui Zeng, Pengcuo Zeren, Cindy Zha, Haotian Zhang, Jenny Zhang, Jing Zhang, Liangkai Zhang, Paris Zhang, Shun Zhang, Xuanmeng Zhang, Zhizheng Zhang, Ann Zhao, Yilin Zhao, Yuliya Zhautouskaya, Charles Zhou, Fengzhe Zhou, Shilin Zhu, Yuke Zhu, Dima Zhylko, Artur Zolkowski

机构 * NVIDIA

专题命中 具身推理 :world model(title,abstract);embodied agent(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出基于统一混合Transformer架构的全模态世界模型Cosmos 3,联合处理语言、图像、视频、音频和动作序列,在理解和生成任务上达到新最优,为具身智能体提供可扩展的通用骨干。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24089 2026-06-24 cs.RO cs.AI 新提交 81%

DynaWM: Dynamics-Aware Distillation with World Model and Momentum Targets for Smooth Locomotion over Continuous Stairs

DynaWM: 基于世界模型和动量目标的动力学感知蒸馏实现连续楼梯上的平滑运动

Haidong Hou, Zhangguo Yu, Hengbo Qi, Jianlin Zhang

机构 * School of Mechatronical Engineering, Beijing Institute of Technology(北京理工大学机电学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI

AI总结 提出DynaWM框架,通过世界模型正则化增强地形编码,并利用动量目标编码器稳定知识蒸馏,使双足轮式机器人在连续楼梯上实现高适应性和平滑运动。

Comments Comments: 8 pages, 7 figures, accepted by IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

Journal ref IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS),2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24842 2026-06-24 cs.AI 新提交 79%

World Models in Pieces: Structural Certification for General Agents

分片世界模型:通用智能体的结构化认证

Yikai Lu, Yifei Wu, Xinyu Lu, Tongxin Li

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen, Shenzhen, China(香港中文大学(深圳)数据科学学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 针对通用智能体在大世界场景下无法普遍胜任的问题,提出结构化认证框架,通过深度组合目标过滤特定转移,证明世界模型具有O(1/n)+O(δ)误差界,实现可认证部署。

Comments 30 pages, camera-ready version in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24338 2026-06-24 cs.RO 新提交 79%

RoBoSR: Structured Scene Representations for Embodied Robotic Reasoning

RoBoSR:面向具身机器人推理的结构化场景表示

Kewei Hu, Wanchan Yu, Fangwen Chen, Jing Jiajian, Zimeng Li, Ying Wei, Tianhao Liu, Michael Zhang, Hanwen Kang

专题命中 具身推理 :robotic(title);manipulation(abstract);分类 cs.RO

AI总结 提出RoBoSR,一种基于语义对象中心场景图的中间结构表示,将操作建模为逐步状态转换,实现因果推理和长期任务规划,并在零样本泛化中优于提示方法和经典TAMP基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23690 2026-06-24 cs.SE cs.AI 新提交 79%

Beyond the Autoregressive Horizon: A Comprehensive Survey of Diffusion Models, World Modelling, and State Space Models for Code

超越自回归视野:扩散模型、世界模型和状态空间模型在代码领域的综合综述

Kishan Maharaj, Ashita Saxena, Srikanth Tamilselvam

机构 * IBM

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 综述扩散模型、代码世界模型和状态空间模型在代码生成中的潜力,以克服自回归模型在全局规划、长程依赖和执行语义方面的局限,并展望“系统2”代码生成智能体。

Comments 14 Pages, 1 Table, 1 Figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23991 2026-06-24 cs.AI cs.LG cs.MA cs.RO 新提交 67%

Critique of Agent Model

智能体模型批判

Eric Xing, Mingkai Deng, Jinyu Hou

机构 * Institute of Foundation Models, Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学基础模型研究所) School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)

专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文区分了自动化与智能体,提出真正智能体需内化目标、身份、决策、自我调节和学习等结构,并设计了GIC通用智能体架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24767 2026-06-24 cs.CV cs.RO 新提交 62%

Compact Object-Level Representations with Open-Vocabulary Understanding for Indoor Visual Relocalization

具有开放词汇理解的紧凑对象级表示用于室内视觉重定位

Zhaopeng Cui, Jiarui Hu, Jingbo Liu, Boming Zhao, Xiyue Guo, Boyin Feng, Haocheng Peng, Yujun Shen, Hujun Bao, Guofeng Zhang

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Ant Group(蚂蚁集团)

专题命中 具身推理 :embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 提出OpenReLoc系统,利用基础模型实现多模态开放词汇语义匹配、基于DIOU的参考帧选择和双路径2D ICP损失,仅用对象单元实现室内视觉重定位,提升可解释性和准确性。

Comments Accepted by RA-L 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 2 篇

2606.24884 2026-06-24 cs.RO cs.AI cs.LG 新提交 67%

InSight: Self-Guided Skill Acquisition via Steerable VLAs

InSight: 通过可引导的VLA实现自主技能获取

Maggie Wang, Lars Osterberg, Stephen Tian, Ola Shorinwa, Jiajun Wu, Mac Schwager

机构 * Stanford University(斯坦福大学) Princeton University(普林斯顿大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出InSight框架,通过将VLA模型在基本动作层面变得可引导,实现自主技能获取,包括自动分割演示为基本动作和VLM引导的数据飞轮,无需人类演示即可学习新技能。

Comments Project website: https://insight-vla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24472 2026-06-24 cs.RO cs.AI 新提交 62%

G$^3$VLA: Geometric inductive bias for Vision-Language-Action Models

G$^3$VLA:视觉-语言-动作模型的几何归纳偏置

Yue Peng, Yongzhe Zhao, Artur Habuda, Khuyen Pham, Yanheng Zhu, Tran Nguyen Le, Fares Abu-Dakka, Li Guo

机构 * New York University Shanghai(上海纽约大学) Technical University of Denmark(丹麦技术大学) MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) New York University Abu Dhabi(纽约大学阿布扎比分校)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出G$^3$VLA模块,通过射线嵌入、投影位置编码和跨视图融合为VLA模型注入相机几何先验,无需深度传感器,在多个基准和真实机器人上提升空间敏感任务性能。

Comments Submitted to CoRL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模仿学习与强化学习 3 篇

2509.21543 2026-06-24 cs.RO 版本更新 79%

Self-CriTeach: LLM Self-Teaching and Self-Critiquing for Improving Robotic Planning via Automated Domain Generation

Self-CriTeach: LLM 自我教学与自我批评用于通过自动领域生成提升机器人规划

Jinbang Huang, Zhiyuan Li, Yuanzhao Hu, Zhanguang Zhang, Mark Coates, Xingyue Quan, Yingxue Zhang

机构 * Huawei Noah's Ark Lab(华为诺亚实验室) University of Toronto(多伦多大学) University of British Columbia(不列颠哥伦比亚大学) McGill University(麦吉尔大学)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出Self-CriTeach框架,通过LLM自动生成符号规划领域,用于自我教学生成规划问题-计划对及自我批评生成结构化奖励信号,提升机器人规划性能与泛化能力。

Comments International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24597 2026-06-24 cs.CL 新提交 78%

Qwen-AgentWorld: Language World Models for General Agents

Qwen-AgentWorld: 通用智能体的语言世界模型

Yuxin Zuo, Zikai Xiao, Li Sheng, Fei Huang, Jianhong Tu, Yuxuan Liu, Tianyi Tang, Xiaomeng Hu, Yang Su, Qingfeng Lan, Yantao Liu, Qin Zhu, Yinger Zhang, Bowen Yu, Haiquan Zhao, Haiyang Xu, Jianxin Yang, Jiayang Cheng, Junyang Wang, Lianghao Deng, Mingfeng Xue, Tianyi Bai, Yang Fan, Yubo Ma, Yucheng Li, Zeyu Cui, Zhihai Wang, Zhihui Xie, Zhuorui Ye, An Yang, Dayiheng Liu, Jingren Zhou, Ning Ding

机构 * Qwen Team(Qwen团队)

专题命中 模仿学习与强化学习 :world model(title,abstract)

AI总结 提出基于语言模型的世界模型Qwen-AgentWorld,通过三阶段训练(CPT、SFT、RL)模拟7个领域的智能体环境,并构建AgentWorldBench基准,实验表明其显著优于现有模型,且能作为环境模拟器和智能体基础模型提升下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24078 2026-06-24 cs.RO 新提交 57%

MinInter: Minimizing Trajectory Interpolation During Data Augmentation for Imitation Learning

MinInter:在模仿学习的数据增强中最小化轨迹插值

Qingyang Wang, Xingang Liu, Changwei Yao, Zikai Ouyang, Junwei Liu, Haibo Lu, Wei Zhang

机构 * School of Automation and Intelligent Manufacturing, Southern University of Science and Technology(南方科技大学自动化与智能制造学院) Pengcheng Laboratory(鹏城实验室) Carnegie Mellon University(卡内基梅隆大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 提出MinInter方法,通过选择需要最少插值的源演示来生成高质量合成轨迹,在MimicGen基准的12个操作任务中显著提升数据生成成功率和策略成功率。

Comments Accepted by IEEE CASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 人机交互与遥操作 3 篇

2606.24629 2026-06-24 eess.SY cs.SY 新提交 67%

Human-Robot Shared Control for Humanized End-Effector Teleoperation

人机共享控制实现拟人化末端执行器遥操作

Batool Ibrahim, Imad H. Elhajj, Daniel Asmar, Rawan El Hakim

专题命中 人机交互与遥操作 :robotics(abstract);robotic(abstract)

AI总结 提出实时框架,基于三分之二幂律生成拟人末端轨迹,在保留操作者意图的同时提升运动类人性与平滑度,实验验证显著改善。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24870 2026-06-24 cs.HC 新提交 50%

"Zooming In" on Agentic Web Browsers as Assistive Technologies: A Case Study with a Low-Vision Technology Expert

“放大”代理型网络浏览器作为辅助技术:一项低视力技术专家的案例研究

Laura Colazzo, Giuseppe Anzillotti

专题命中 人机交互与遥操作 :navigation(abstract)

AI总结 通过低视力专家案例研究,探讨基于大语言模型的代理型网络浏览器如何以对话方式辅助视障用户导航网页,发现其虽有限制但体验流畅灵活,有望提升无障碍性并减少交互障碍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24612 2026-06-24 physics.atom-ph 新提交 50%

Field validation of GNSS-independent positioning enhancement using a wearable ultra-stable quantum magnetometer

使用可穿戴超稳定量子磁力计进行独立于GNSS的定位增强的现场验证

Stirling Scholes, Dominic Hunter, Courtney Dyer, Marcin Mrozowski, Allan McWilliam, Phoebe Utting, David Burt, Paul F. Griffin, James McGilligan, Erling Riis, Stuart J. Ingleby

专题命中 人机交互与遥操作 :navigation(abstract)

AI总结 通过可穿戴量子磁力计测量地磁异常,结合航位推算,实现500米以上路径径向定位误差2.24米,验证了GNSS独立定位增强的可行性。

Comments 11 content pages, 5 figures, accompanied by 1 supplementary document

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 机器人数据与评测 6 篇

2606.23444 2026-06-24 cs.RO cs.LG 新提交 84%

SkyJEPA: Learning Long-Horizon World Models for Zero-Shot Sim-to-Real Control of Quadrotors

SkyJEPA:用于四旋翼飞行器零样本仿真到现实控制的长时域世界模型学习

Pratyaksh Rao, Wancong Zhang, Randall Balestriero, Yann LeCun, Giuseppe Loianno

专题命中 机器人数据与评测 :world model(title);navigation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 提出基于JEPA的潜空间动力学模型,结合物理启发探测器实现长时域预测,并集成采样最优控制实现实时控制,通过自动化数据生成实现零样本仿真到现实迁移。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24256 2026-06-24 cs.CV 新提交 79%

Trimming the Long-Tail of Visual World Modeling Evaluation

修剪视觉世界建模评估的长尾

Bingxuan Li, Yining Hong, Cheng Qian, Hyeonjeong Ha, Jiateng Liu, Zhenhailong Wang, Yue Guo, Yunzhu Li, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学) Columbia University(哥伦比亚大学)

专题命中 机器人数据与评测 :world model(title,abstract);分类 cs.CV

AI总结 针对视觉世界模型在罕见物理交互上泛化不足的问题,提出Tailor-Bench基准,通过常规、非常规和不可能三种场景模式系统评估模型推理能力,揭示长尾性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏