arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-21 至 2026-08-21 共收录 42 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 3 篇

2608.19613 2026-08-21 cs.RO cs.CV 新提交 86%

What Matters for Latent Actions in Robot Learning

机器人学习中隐式动作的关键影响因素

Xizhou Bu, Qingda Hu, Lei Zhou, Lingfeng Zhang, Yingbo Tang, Zihao Liu, Xinyi Tao, Zhiqiang Ma, Qingqiu Huang, Chufeng Tang, Hongbo Wang, Jing Zhang, Jiayi Ma, Hangjun Ye, Wei Li, Xiaoshuai Hao

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Guangdong Provincial Key Laboratory of Computility Microelectronics, Faculty of Computility Microelectronics, Shenzhen University of Advanced Technology(深圳先进技术研究院计算机微科学与技术学院、广东省计算微电子重点实验室) School of Aeronautics and Astronautics, Sichuan University(四川大学航空航天学院) Suzhou Evans Intelligent Technology Co., Ltd.(苏州伊文斯智能科技有限公司) Morphi Intelligence Technology Co., Ltd.(墨飞智能科技有限公司) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Xiaomi EV(小米汽车)

专题命中 机器人学习 :robot learning(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本研究通过统一框架整合代表性隐式动作模型,系统探究41种设计选择,发现用隐式动作微调视觉语言模型主干可为下游机器人操纵策略学习提供更强初始化。

Comments Project page: this https URL (https://carldegio.github.io/latent_action.github.io)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19375 2026-08-21 cs.RO 新提交 77%

Learning the Right Abstraction: Neural Reduced Dynamics for Complex Robot Control

学习正确的抽象:用于复杂机器人控制的神经简化动力学

Harry Zhang, Dan Negrut

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 机器人学习 :robot learning(abstract);embodied AI(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出神经简化动力学(NRD)框架,学习保留控制相关物理特性的简化状态,训练的策略可迁移至高保真模拟器,在三项控制任务中实现高精度且速度大幅提升的机器人控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19589 2026-08-21 cs.RO cs.CV 新提交 62%

OrthoSkillVLA: Continual Skill Learning via Gradient-Informed Skill Subspace Adaptation

OrthoSkillVLA:通过梯度感知技能子空间自适应实现持续技能学习

Jiaqi Wang, Zhou Fang, Qiongfeng Shi, Yi Zhou

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) School of Electronic Science and Engineering, Southeast University(东南大学电子科学与工程学院)

专题命中 机器人学习 :robot learning(abstract);分类 cs.RO、cs.CV

AI总结 OrthoSkillVLA是一种参数高效的持续技能学习框架,通过对VLM和ActionHead施加独立子空间约束、引入特征感知MoE解码器,实现预训练VLA模型的技能学习,可缓解灾难性遗忘。

Comments Accepted by PRCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 15 篇

2608.19759 2026-08-21 cs.RO cs.AI 新提交 91%

GOAG: Generative and Object-Agnostic Grasp Planner for Dexterous Robotic Manipulation

GOAG:用于灵巧机器人操作的生成式与物体无关的抓取规划器

Julien Merand, Boris Meden, Mathieu Grossard, Liming Chen

机构 * Université Paris-Saclay(巴黎萨克雷大学) CEA(法国原子能和替代能源委员会) Ecole Centrale de Lyon(里昂中央理工学院) CNRS(法国国家科学研究中心) Institut Universitaire de France (IUF)(法国大学研究院)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 本研究提出GOAG模型,通过学习夹爪接触表面分布的紧凑潜在表示,无需物体特定训练数据即可高效生成有效抓取配置,在MultiDex数据集上平均成功率达86.93%,实现了出色的泛化性能。

Comments Project website: this https URL (https://cea-list.github.io/goagweb/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20208 2026-08-21 cs.CV 新提交 90%

RoMAN-Flow: Taming Autoregressive Normalizing Flows for Offline Reinforcement Learning in Robotic Manipulation

RoMAN-Flow:驯服自回归归一化流用于机器人操作中的离线强化学习

Shaoxuan Wang, Guangting Zheng, Rui Huang, Zhipeng Tang, Sha Zhang, Jiajun Deng, Yanyong Zhang

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.CV

AI总结 该研究针对机器人操作离线强化学习中AR-NFs采样开销大的问题,提出RoMAN-Flow框架,通过无采样的优势加权似然目标和策略蒸馏方法,在保证性能的同时大幅降低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19280 2026-08-21 cond-mat.mtrl-sci cs.RO 新提交 88%

Multi-Tool Robotics Enables In-Situ Sample Manipulation for Time-Resolved Synchrotron Measurements

多工具机器人技术为同步辐射时间分辨测量实现原位样品操纵

Aditya Bondada, Elizabeth M. Wall, Eric Yuan Xiao, Quinn C. Burlingame, Yueh-Lin Loo, Esther H. R. Tsai, Ruipeng Li

专题命中 机器人操作 :manipulation(title,abstract);robotics(title);robotic(abstract);分类 cs.RO

AI总结 该研究开发了一种X射线散射光束线的模块化多工具机器人平台,突破辐射安全限制实现原位样品操纵,为同步辐射自动化实验奠定基础,还揭示了钙钛矿薄膜的瞬态原位动力学。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19968 2026-08-21 cs.RO cs.CV 新提交 84%

PVRA: A Pointwise Key-point Voting Framework for Robotic Assembly

PVRA:用于机器人装配的逐点关键点投票框架

Kulunu Samarawickrama, Roel Pieters

机构 * Tampere University(坦佩雷大学)

专题命中 机器人操作 :robotic(title,abstract);manipulation(abstract);分类 cs.RO、cs.CV;robotics(comments)

AI总结 本研究针对机器人自主渐进式装配的感知需求,提出基于3D关键点的模块化学习框架PVRA,在装配位姿估计数据集上训练后,与以物体为中心的基线及增强指标对比验证了其有效性。

Comments 14 pages, 3 figures. Accepted for presentation at the European Conference on Robotics (ECoR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20114 2026-08-21 cs.AI cs.RO 新提交 82%

DECOWAM: Decoupled Whole-Body World-Action Model for Legged Mobile Manipulation

DECOWAM:用于腿式移动操作的解耦全身世界-动作模型

Siyuan Ma, Boshi Zhang, Yutian Zhang, Qinglian Wu, Jiaqi Zhai, Dong Wei, Qiaojun Yu

机构 * Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Hangzhou Yunshenchu Technology Co., Ltd. (DEEP Robotics)(杭州云神初科技有限公司(深智机器人))

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 本研究提出DECOWAM模型,通过解耦全身动作因素提升移动操作的视觉与动作预测性能,在真实机器人数据集ARMDOG上验证了其在协调性和鲁棒性上的优势。

Comments 8 pages, 5 figures. Introduces DECOWAM, a decoupled whole-body world-action model for legged mobile manipulation, and the ARMDOG real-robot dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19574 2026-08-21 cs.RO 新提交 74%

HiTac-WAM: A Hierarchical Tactile World Action Model for Contact-Rich Robot Manipulation

HiTac-WAM:一种用于接触丰富型机器人操作的分层触觉世界动作模型

Chao Xue, Chaofan Zhang, Wenxuan Ma, Guocai Yao, Shaowei Cui, Shuo Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ImprintX Robotics(ImprintX机器人公司) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 机器人操作 :manipulation(title);分类 cs.RO

AI总结 本文提出HiTac-WAM这一分层触觉世界动作模型,通过分层结构建模触觉状态的物理依赖关系,在机器人接触操作任务中提升了预测精度与操作成功率。

Comments 8 pages, 7 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20308 2026-08-21 cs.CV 新提交 70%

DreamHand: Repurposing Video Diffusion Models for Occlusion-Robust Egocentric 3D Hand Motion Recovery

DreamHand:复用视频扩散模型实现遮挡鲁棒的第一人称视角3D手部运动恢复

Yufei Liu, Xixi Wang, Hao Li, Ganlong Zhao, Kaitong Cai, Chengkai Jin, Chunxiao Liu, Jianbo Liu, Siyuan Huang, Xingang Pan, Hongsheng Li

机构 * ACE Robotics(ACE机器人公司) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人操作 :embodied AI(abstract);manipulation(abstract);分类 cs.CV

AI总结 DreamHand是复用视频扩散模型的离线片段级框架,通过确定性干净潜在编码器与双向时空解码器恢复带度量位置的连续双手轨迹,在五个第一人称视角基准测试中实现最佳性能,为机器人操作数据提供可扩展路径。

Comments Project Page: this https URL (https://ggxxii.github.io/dreamhand/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19443 2026-08-21 cs.RO eess.SY 新提交 70%

Hybrid Feedback Sampling for Sample-Efficient Model Predictive Control

用于样本高效模型预测控制的混合反馈采样

Chaoyi Pan, Zeji Yi, John Zhang, Zachary Manchester, Guannan Qu, Guanya Shi

机构 * Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出混合反馈采样MPC(FS-MPC)算法,平衡局部与全局搜索,解决采样MPC在高维开环不稳定系统中的样本效率与数值不稳定问题,在真实机器人控制任务中表现优于现有方法。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20084 2026-08-21 cs.RO cs.AI 新提交 62%

Evidence-Gated Task and Motion Planning with Vision-Language Models

基于视觉语言模型的证据门控任务与运动规划

Tsunehiko Tanaka, Matthew Stephenson, Alistair Macvicar, Edgar Simo-Serra

机构 * Waseda University(早稻田大学) Flinders University(弗林德斯大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 针对机器人执行自然语言指令长时操纵任务时的部分可观测问题,提出 EAFG 框架,通过视觉证据获取与可行性门控提升食谱完成率并减少无效操纵尝试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20251 2026-08-21 cs.RO 新提交 57%

Video2DoorTraversal: Push Door Traversal via Simulated Door Twins

Video2DoorTraversal:通过模拟门孪生体实现推门穿越

Xincheng Tang, Yiji Chen, Youhan Xie, Wanyu Li, Zhengjie Shu, Lai Jiang, Wenkang Hu, Yitong Li, Jinchuang Zhang, Xibin Song, Ruigang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) NeoWa Robotics(NeoWa机器人公司) Shandong University(山东大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 本文提出Video2DoorTraversal框架,通过DoorTwin重构门孪生体,训练ArticuACT策略,实现轮腿式移动机械手开门穿越,在真实门与未见门上分别达到96.57%和80.95%的成功率。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19919 2026-08-21 cs.SD 新提交 50%

Unified Music Identification for Tracks and Versions

曲目与版本的统一音乐识别

R. Oguz Araz, Joan Serrà, Yuki Mitsufuji, Xavier Serra, Dmitry Bogdanov

专题命中 机器人操作 :manipulation(abstract)

AI总结 该研究针对曲目与版本识别分开处理的问题,提出统一基准评估7种模型的准确性与鲁棒性,训练出10秒TI查询的基线模型,验证了音乐识别可统一的可行性。

Comments Accepted to ISMIR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19551 2026-08-21 cs.HC 新提交 50%

Delegating or Doing? Understanding User Behavior in Hybrid Human-Agent Interfaces

委托还是自行操作?理解混合人机界面中的用户行为

Gavin Raine Dizon, Tyrone Justin Sta Maria, Jordan Aiko Deja, Yasuyuki Sumi

专题命中 机器人操作 :manipulation(abstract)

AI总结 该研究通过被试间实验对比三种交互模式,发现混合人机界面可降低交互成本,委托行为更多反映用户个体特征而非任务需求。

Comments 9 pages, In Proceedings of the 14th International Conference on Human-Agent Interaction at Osaka, Japan on November 16-19, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20063 2026-08-21 quant-ph 新提交 50%

PPT Entanglement with Correlated Catalysis: Monotones and Irreversibility

带关联催化的PPT纠缠:单调量与不可逆性

Jingsong Ao, Aby Philip, Alexander Streltsov

专题命中 机器人操作 :manipulation(abstract)

AI总结 该研究在PPT资源理论中,利用正则化PPT相对熵构造单调量,证明其完全可加且强超加性,发现关联催化无法消除混态纠缠操纵的基本限制,最优蒸馏率仍小于纠缠成本。

Comments 6+7 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19694 2026-08-21 quant-ph cond-mat.dis-nn 新提交 50%

Dissipation-tunable extended and localized steady states in a non-disordered lattice

非无序晶格中耗散可调的扩展与局域稳态

Ming-Jie Tao, Yi-Ting Wang, Jing Li, Hongsheng Hou, Xiang-Ping Jiang, Lei Pan

专题命中 机器人操作 :manipulation(abstract)

AI总结 该研究在非无序一维晶格中,利用相位可调的非局域键耗散,无需改变哈密顿量即可选择局域或扩展稳态,为非无序晶格的态制备与输运调控提供了新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20197 2026-08-21 cond-mat.mes-hall cond-mat.stat-mech physics.class-ph physics.optics 新提交 50%

Floquet Theory for Light-Driven Rotation of Dipolar and Multipolar Particles

偶极与多极粒子的光驱动旋转的Floquet理论

Amane Takano, Minoru Kanega, Masahiro Sato

专题命中 机器人操作 :manipulation(abstract)

AI总结 该研究针对光驱动粒子旋转的微观分析不足问题,用Floquet理论等方法建模,确定了激光驱动旋转的非平衡相图,其过阻尼朗之万方程结果与实验定性一致。

Comments 6+15 pages, 5+6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身导航 3 篇

2608.19661 2026-08-21 cs.RO 新提交 79%

World-Model-Grounded LLM Planning for AUV and ASV Navigation Near Offshore Wind Farms

面向近海风电场区域自主水下航行器(AUV)与自主水面航行器(ASV)导航的世界模型赋能大语言模型规划

Markus Buchholz, Ignacio Carlucho, Yvan R. Petillot

机构 * Norwegian Defence Research Establishment (FFI)(挪威国防研究机构(FFI)) School of Engineering & Physical Sciences, Heriot-Watt University(赫瑞瓦特大学工程与物理科学学院)

专题命中 具身导航 :navigation(title);world model(abstract);分类 cs.RO

AI总结 本研究提出世界模型赋能大语言模型规划方法,结合MPC闭环重规划器等组件,在近海风电场区域的AUV和ASV导航任务中,大幅降低目标距离误差,验证了其有效性。

Comments This work has been accepted to the IEEE IROS 2026 AQ2UASIM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20218 2026-08-21 cs.AI 新提交 57%

Electronic Navigational Chart Change Classification

电子航海图变化分类

Jacob Arndt, Abhishek Potnis, Alexandre Sorokine

机构 * Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 针对电子航海图(ENC)变化分类的人工审核效率低、一致性差的问题,提出结合空间上下文编码器与ENC属性编码器的编码方案,用调优梯度提升树在1308张海图对数据集上取得90%、94%的准确率,提升了海事安全相关的ENC维护效率。

Comments Accepted at 34th ACM SIGSPATIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19927 2026-08-21 eess.SP 新提交 50%

Some Practical Issues of the Tracking Process in GNSS Receivers

GNSS接收机跟踪过程的若干实际问题

S.V. Shafran, I.A. Kudryavtsev, A.A. Kumarin

专题命中 具身导航 :navigation(abstract)

AI总结 该研究分析GNSS接收机跟踪模块的积分间隔、早迟相关器延迟、跟踪环路滤波器参数等实际问题,在实验导航接收机上开展研究,获得改进瞬态过程参数的方法。

Comments 8 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 具身推理 6 篇

2608.19779 2026-08-21 quant-ph cs.AI cs.LG 新提交 81%

An Irreducible Quantum Advantage in Aligning World Models with Reality

世界模型与现实对齐的不可约量子优势

Josep Lumbreras, Hailan Ma, Jayne Thompson, Mile Gu

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究证明经典世界模型无法通过增加记忆实现与真实世界的完美策略对齐,而量子世界模型仅用单个qutrit即可做到,揭示了世界模型对齐现实的不可约量子优势。

Comments 31 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20065 2026-08-21 cs.LG 新提交 79%

Orthogonal JEPA: Factorized Predictive States for Latent World Models

正交JEPA:用于潜在世界模型的分解预测状态

Taoyong Cui, Pheng Ann Heng, Wanli Ouyang

机构 * The Chinese University of Hong Kong (CUHK)(香港中文大学(CUHK))

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 该研究提出正交JEPA框架,通过正交预测分解改进潜在世界模型,在多类任务实验中评估了其表示质量、预测、规划及长时程稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19804 2026-08-21 cs.AI 新提交 79%

ADAPT: Physics-Aware Diffusion-based World Models for Adaptive Predictive Transferable HVAC Control

ADAPT:面向自适应可迁移HVAC控制的物理感知扩散式世界模型

Xu Yang, Kailai Sun, Dianyu Zhong, Qianchuan Zhao

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 本文针对现有HVAC控制方法泛化性差的问题,提出物理感知扩散世界模型ADAPT,在IID控制下可降HVAC能耗7.3%、不适度30.2%,OOD场景下迁移鲁棒性显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19709 2026-08-21 cs.NI 新提交 78%

RFWM: Physics-Guided World Model for Dynamic Wireless Radiance Field Generation

RFWM:用于生成动态无线辐射场的物理引导世界模型

Zijiu Yang, Qianqian Yang

专题命中 具身推理 :world model(title,abstract)

AI总结 本研究针对动态未知环境下RF场建模泛化难的问题,提出物理引导的RF世界模型RFWM,采用两阶段训练策略,在新构建的基准上实现了优于现有最优方法的RF场生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20126 2026-08-21 cs.IT 新提交 78%

RMWorld: Task-Aware Radio World Models with Value-of-Information Guided Multi-Trial Learning for Multi-UAV Communication Control

RMWorld:面向多无人机通信控制的、具备信息价值引导多试学习的任务感知无线电世界模型

Xiucheng Wang, Nan Cheng, Junxi Huan

专题命中 具身推理 :world model(title,abstract)

AI总结 提出任务感知无线电世界模型 RMWorld,结合信息价值校准与多试选择,在多无人机通信控制任务中,于 100 次 3GPP 试次和 30 次 DeepMIMO 试次上取得了更优的速率误差与积压控制效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19492 2026-08-21 cs.LG cs.RO 新提交 62%

Beyond Multimodal Alignment: Certifying Physical Language through Response Substitution and Ordered Execution

超越多模态对齐:通过响应替换与有序执行验证物理语言

Kaizhen Tan, Xin Xu, Siru Tao, Yixiao Li, Hanzhe Hong, Yang Feng, Heqing Du

机构 * New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学) Columbia University(哥伦比亚大学)

专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.LG

AI总结 本文提出DBOSC方法,在Cluster Haptic数据集与弹塑性系统中验证了多模态物理表示的可执行含义,明确了执行器、图表等因素对动作组合的影响,区分了多项可测试的操作能力成就。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人基础模型 2 篇

2608.19490 2026-08-21 cs.RO cs.CV cs.LG 新提交 78%

Fine-Tuning VLAs with Self-Demonstrated Generative Control for Multi-Task Manipulation

通过自演示生成控制对视觉-语言动作(VLA)模型进行微调以实现多任务操作

Prachi Garg, Steve Xing, Prahit Yaugand, Saurabh Gupta, Derek Hoiem

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 机器人基础模型 :manipulation(title);分类 cs.RO、cs.CV、cs.LG

AI总结 本文针对VLA模型部署到新机器人时因硬件不匹配导致性能下降的问题,提出自监督方法生成在线交互rollout数据微调VLA模型,使模型在目标机器人上同时具备先验任务能力、指令遵循能力与高效学习新技能的能力。

Comments Project Page: this https URL (https://self-supervised-control.pages.dev/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19891 2026-08-21 cs.AI 新提交 70%

EXIMO: VLM Guided Exploration of VLA Policies

EXIMO:基于视觉语言模型引导的视觉语言动作策略探索

Bhavya Sukhija, Oliver Groth, Mohit Shridhar, Tim Hertweck, Michael Bloesch, Markus Wulfmeier, Abbas Abdolmaleki, Martin Riedmiller

机构 * Google DeepMind(谷歌DeepMind)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.AI

AI总结 本研究提出EXIMO算法,通过VLM引导的探索、模仿、优化三阶段微调VLA策略,解决了VLA策略微调样本效率低的问题,性能显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 模仿学习与强化学习 1 篇

2608.19684 2026-08-21 cs.AI cs.LG cs.RO 新提交 67%

Learning Hierarchical Skill Policies with Offline Quality-Diversity Reinforcement Learning

利用离线质量多样性强化学习学习分层技能策略

Tanachai Anakewat, Takayuki Osa, Tatsuya Harada

机构 * The University of Tokyo(东京大学) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 该研究提出QDOS算法,通过优势加权质量多样性预训练与双数据集复用策略,在分层技能学习框架下,于稀疏奖励任务中显著提升性能,优于强基线算法。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏