arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4115 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4115 篇

2607.02490 2026-07-03 cs.CL cs.CV 新提交 57%

Visually Grounded Self-Reflection for Vision-Language Models via Reinforcement Learning

基于强化学习的视觉语言模型视觉接地自反思

Liyan Tang, Fangcong Yin, Greg Durrett

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) New York University(纽约大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.CV

AI总结 提出VRRL框架,通过随机掩码轨迹前缀和缓冲回滚机制,增强视觉语言模型在分布外场景下的视觉接地自反思能力,显著提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00483 2026-07-03 cs.RO 新提交 57%

VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning

VLM-AR3L:用于强化学习中绝对和相对奖励的视觉-语言模型

Kuan-Chen Chen, Winston Chen, Wei-Fang Sun, Min-Chun Hu

机构 * National Tsing Hua University(国立清华大学) NVIDIA AI Technology Center (NVAITC)(英伟达AI技术中心)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 提出VLM-AR3L框架,利用视觉-语言模型从偏好标签中学习绝对和相对奖励,结合状态评估与比较监督,在多种基准任务中优于先前方法。

Comments Accepted at IJCAI 2026. Project website: https://vlm-ar3l.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01029 2026-07-02 cs.RO 新提交 57%

AMBUSH: Collaborative Capture in Complex Environments with Neural Acceleration

AMBUSH:复杂环境下的协作捕获与神经加速

Junfeng Chen, YinHang Luo, Xinyi Wang, Junrui Li, Meng Guo

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) Distributed Autonomous Systems and Control Lab, University of Michigan(密歇根大学分布式自主系统与控制实验室)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 提出基于“伏击”策略的参数化方法,结合混合蒙特卡洛树搜索与神经加速,实现多个慢速追捕者在复杂环境中高效捕获快速逃逸者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00160 2026-07-02 cs.RO 新提交 57%

Distributed Multi Robot Lunar Cargo Transportation via Phase Decomposed Reinforcement Learning

基于相位分解强化学习的分布式多机器人月球货物运输

Ashutosh Mishra, Elian Neppel, Shreya Santra, Antoine Jonquières, Muhammad Athallah Naufal, Kentaro Uno, Kazuya Yoshida

机构 * Tohoku University(东北大学) École Centrale de Lille(里尔中央理工学院) Institut Teknologi Bandung(万隆理工学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 提出相位分解强化学习框架,将月球货物运输分解为提升、运输和放置三个阶段,分别优化联合状态策略,实现分布式机器人协同运输,仿真和硬件实验验证了可靠性。

Comments 8 pages, 9 Figures, Accepted at IROS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29032 2026-06-30 cs.LG stat.ML 57%

Theoretical Foundations and Effective Algorithms for Policy-Aware Simulator Learning

策略感知模拟器学习的理论基础与有效算法

Christoph Dann, Yishay Mansour, Mehryar Mohri

机构 * Google Research(谷歌研究) Tel Aviv University(特拉维夫大学) Courant Institute of Mathematical Sciences(数学科学学院)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 针对模型强化学习中模拟器利用问题,提出以策略鲁棒性为目标,通过零和极小极大博弈学习模拟器,并给出理论保证与有效算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27603 2026-06-29 cs.RO 新提交 57%

Learning to Throw: Agile and Accurate Cable-Suspended Payload Delivery with a Quadrotor

学习投掷:四旋翼飞行器实现灵活精确的缆绳悬挂载荷投送

Yifan Zhai, Elia Raimondi, Yunfan Ren, Ismail Geles, Yannick Armati, Jiaxu Xing, Davide Scaramuzza

机构 * Robotics and Perception Group, Department of Informatics, University of Zurich(苏黎世大学信息学系机器人感知组)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 提出一种混合仿真框架,结合高保真四旋翼模型和物理求解器模拟缆绳-载荷系统,通过深度强化学习训练策略,实现零样本部署下投掷误差降低50%、时间缩短30%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27504 2026-06-29 cs.CV 新提交 57%

ReWorld: Learning Better Representations for World Action Models

ReWorld:为世界动作模型学习更好的表示

Tianze Xia, Lijun Zhou, Kaixin Xiong, Jingfeng Yao, Yu Zhu, Zhenxin Zhu, Bing Wang, Guang Chen, Hangjun Ye, Wenyu Liu, Haiyang Sun, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米汽车)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.CV

AI总结 提出ReWorld框架,通过优化中间表示(未来预测监督、跨模态对齐、难负样本监督)提升自动驾驶世界动作模型的规划性能,在nuScenes和NAVSIM上取得显著提升。

Comments 19 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26574 2026-06-26 cs.LG 新提交 57%

Revisiting Action Factorization for Complex Action Spaces

重新审视复杂动作空间的动作分解

Timothy Flavin, Sandip Sen

机构 * The University of Tulsa(塔尔萨大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 本文对多种动作分解方法在PPO、SAC、DQN算法和离散、混合、连续动作空间上进行了横截面研究,提出了VDN-PPO和PPO-MIX,并发现分支决斗架构在计算和性能之间取得了最佳平衡。

Comments 53 Pages, 37 Figures, 6 Tables, Target Journal/Venue: ACM Transactions on Autonomous and Adaptive Systems TAAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25527 2026-06-25 cs.LG 新提交 57%

Beyond One-Size-Fits-All: Diagnosis-Driven Online Reinforcement Learning with Offline Priors

超越一刀切:基于诊断的在线强化学习与离线先验知识

Guozheng Ma, Lu Li, Zilin Wang, Pierre-Luc Bacon, Dacheng Tao

机构 * Nanyang Technical University(南洋理工大学) University of Oxford(牛津大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 本文提出诊断驱动的张力管理框架,通过三种功能角色表征离线先验知识如何重塑在线优化,并展示跨领域证据,解决先验知识有效性随部署变化的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24962 2026-06-25 cs.LG 新提交 57%

Towards Scalable Multi-Task Reinforcement Learning with Large Decision Models

迈向可扩展的多任务强化学习与大决策模型

Thibaut Kulak

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 提出LDM-v0,一个在大规模异构强化学习环境上离线预训练的Transformer策略,通过监督下一动作预测实现多任务学习,在约1000个环境中达到与独立训练策略相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24991 2026-06-25 eess.SY cs.LG cs.SY math.OC 新提交 57%

Solving Markov Decision Processes with Future Information via MPC

通过MPC求解具有未来信息的马尔可夫决策过程

Shambhuraj Sawant, Akhil S Anand, Dirk Reinhardt, Sebastien Gros

机构 * Norwegian University of Science and Technology(挪威科学技术大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 本文提出一种参数化模型预测控制(MPC)方法,可精确表示具有未来信息的MDP的最优价值函数和策略,并通过强化学习学习参数,在点质量赛车任务中验证有效性。

Comments 6 pages, accepted to IFAC World Congress 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05933 2026-06-25 cs.CL cs.AI 版本更新 57%

Reinforcement Learning Improves Traversal of Parametric Knowledge in LLMs

强化学习改善LLM中参数化知识的遍历

Renfei Zhang, Manasa Kaniselvan, Rylan Schaeffer abd Niloofar Mireshghallah

机构 * Carnegie Mellon University(卡内基梅隆大学) MIT(麻省理工学院) Stanford University(斯坦福大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 本文发现强化学习提升LLM知识回忆能力,原因在于改进了模型对参数化知识层次结构的遍历技能,而非获取新知识。

Comments `

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24078 2026-06-24 cs.RO 新提交 57%

MinInter: Minimizing Trajectory Interpolation During Data Augmentation for Imitation Learning

MinInter:在模仿学习的数据增强中最小化轨迹插值

Qingyang Wang, Xingang Liu, Changwei Yao, Zikai Ouyang, Junwei Liu, Haibo Lu, Wei Zhang

机构 * School of Automation and Intelligent Manufacturing, Southern University of Science and Technology(南方科技大学自动化与智能制造学院) Pengcheng Laboratory(鹏城实验室) Carnegie Mellon University(卡内基梅隆大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 提出MinInter方法,通过选择需要最少插值的源演示来生成高质量合成轨迹,在MimicGen基准的12个操作任务中显著提升数据生成成功率和策略成功率。

Comments Accepted by IEEE CASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21350 2026-06-23 cs.LG 新提交 57%

A Reward-Petri-Net Interpretation of Temporal Behavior Trees

时间行为树的奖励-佩特里网解释

Till Schmeil, Günther Waxenegger-Wilfing, Sebastian Schirmer

机构 * University of Würzburg(维尔茨堡大学) German Aerospace Center (DLR)(德国航空航天中心)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 提出将时间行为树(TBT)转换为奖励-佩特里网(RPN)的方法,自动生成奖励函数,解决复杂长时域机器人任务中强化学习奖励设计难题,提高样本效率和学习可控性。

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20871 2026-06-23 cs.RO 新提交 57%

Geometric Entropy: When Trajectory Diversity Helps and Hurts in Imitation Learning

几何熵:轨迹多样性在模仿学习中的利弊

Qian Luo, Ruizhe Liu, Pei Zhou, Xunzhe Zhou, Yanchao Yang

机构 * InfoBodied AI Lab, The University of Hong Kong(香港大学信息体人工智能实验室) Transcengram

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 提出几何熵(H_G)量化演示轨迹的几何多样性,发现成功率与H_G呈倒U型关系,且最优熵随任务掌握度增加而降低,可用于数据集审计与校准。

Comments Accepted to IROS 2026. Project page: https://geometric-entropy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21816 2026-06-23 cs.RO 版本更新 57%

Self-Curriculum Model-based Reinforcement Learning for Shape Control of Deformable Linear Objects

基于自课程模型的可变形线性物体形状控制强化学习

Zhaowei Liang, Song Wang, Zhao Jin, Shirui Wu, Dan Wu

机构 * Department of Mechanical Engineering, Tsinghua University(清华大学机械工程系)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 提出两阶段框架,结合基于模型强化学习与在线视觉伺服,通过自课程目标生成机制实现可变形线性物体高效精确的形状控制,在仿真和真实任务中优于主流方法。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19690 2026-06-19 cs.LG 新提交 57%

Multi-Granular Attention-Driven Reinforcement Learning Framework for Web Intelligent Enhancement Systems

多粒度注意力驱动的强化学习框架用于Web智能增强系统

Navin Chhibber, Deepak Singh, Anokh Kishore, Nikita Chawla, K. Anguraj

机构 * Infinity Tech Group Gainwell Technologies Capital One Sunnyvale, CA, USA(美国硅谷) Department of Electronics and Communication Engineering(电子与通信工程系) Sona College of Technology(Sona科技学院) Independent Researcher(独立研究员) Salem, India(印度塞拉姆)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 提出MGAR-WIES框架,通过语义图建模、注意力机制和自适应强化学习,解决Web环境中异构动态数据的语义理解与可扩展性问题,在准确率上达到80%。

Comments 2026 3rd International Conference on Integrated Intelligence and Communication Systems (ICIICS), 6 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18328 2026-06-18 cs.RO 新提交 57%

Recover, Discover, Plan: Learning Skills and Concepts from Robot Failures

恢复、发现、规划:从机器人失败中学习技能与概念

Bowen Li, Mayank Mishra, Y. Isabel Liu, Stone Tao, Nishanth Kumar, Alexander G. Gray, Ruwan Wickramarachchi, Jonathan Francis, Sebastian Scherer, Tom Silver

机构 * CMU(卡内基梅隆大学) Princeton(普林斯顿大学) AI2(艾伦人工智能研究所) MIT(麻省理工学院) Centaur AI Bosch Center for AI(博世人工智能中心)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 提出ReSYNC方法,通过技能学习与概念发现的交替过程,从失败恢复经验中逐步构建抽象谓词,实现全局失败避免和长期规划,性能提升超50%。

Comments 9 pages, 6 figures. Website: https://jaraxxus-me.github.io/ReSYNC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00802 2026-06-18 cs.SE cs.CL cs.LG 版本更新 57%

GrowthHacker: Automated Off-Policy Evaluation Optimization Using Code-Modifying LLM Agents

GrowthHacker: 使用代码修改型LLM代理的自动离线策略评估优化

Jie JW Wu, Ayanda Patrick Herlihy, Ahmad Saleem Mirza, Ali Afoud, Fatemeh Fard

机构 * Michigan Technological University, Houghton(密歇根技术大学) Birmingham City University(伯明翰城市大学) University of British Columbia, Kelowna(不列颠哥伦比亚大学, 肯洛纳)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 提出GrowthHacker基准,利用LLM代理自动迭代修改代码以优化离线策略评估(OPE)实现,在Open Bandit Pipeline和Scope-RL上评估多种框架,证明基于LLM的代理可作为自动增长黑客持续改进OPE系统。

Comments Accepted for publication in ACM Transactions on Software Engineering and Methodology (TOSEM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00611 2026-06-17 cs.RO 版本更新 57%

Physical Imitation Learning: Distilling Control Policies into Passive Elasticity

物理模仿学习:将控制策略蒸馏到被动弹性中

Huyue Ma, Yurui Jin, Helmut Hauser, Rui Wu

机构 * School of Engineering Mathematics and Technology, University of Bristol, and the Bristol Robotics Laboratory(布里斯托大学工程数学与技术学院及布里斯托机器人实验室)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 提出物理模仿学习(PIL)方法,将强化学习控制策略分解为主动与被动部分,被动部分卸载到并联弹性关节,显著降低能耗,在模拟四足机器人上实现高达95%的机械功率卸载。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06500 2026-06-17 cs.RO 57%

Cross-Platform Learnable Fuzzy Gain-Scheduled Proportional-Integral-Derivative Controller Tuning via Physics-Constrained Meta-Learning and Reinforcement Learning Adaptation

跨平台可学习模糊增益调度比例-积分-微分控制器调优:通过物理约束元学习和强化学习适应

JiaHao Wu, ShengWen Yu

机构 * The University of Hong Kong(香港大学) Guangzhou College of Commerce(广州商学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出一种分层框架,用于跨平台调优可学习模糊增益调度PID控制器。通过物理约束虚拟机器人合成,结合元学习和轻量强化学习,实现跨平台初始化和部署特定优化,提升跟踪性能和鲁棒性。

Comments 24 pages,15 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16870 2026-06-16 cs.CV cs.GR 新提交 57%

Latent Space Reinforcement Learning for Inverse Material Estimation in Food Fracture Simulation

潜空间强化学习用于食品断裂模拟中的逆材料估计

Adrian Ramlal, Yuhao Chen, John S. Zelek

机构 * University of Waterloo(滑铁卢大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV

AI总结 针对食品断裂模拟中材料参数难以直接测量的问题,提出基于潜空间强化学习的目标条件策略,实现从断裂行为描述到材料参数的单次前向估计,精度提升23%。

Comments Accepted in IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026 MetaFood Workshop

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 9573-9581

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27450 2026-06-16 cs.LG 版本更新 57%

FlowRL: A Taxonomy and Modular Framework for Reinforcement Learning with Diffusion Policies

FlowRL:基于扩散策略的强化学习分类与模块化框架

Chenxiao Gao, Edward Chen, Tianyi Chen, Bo Dai

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 提出扩散/流策略强化学习算法的统一分类法,构建模块化JAX框架,在多个基准上提供系统比较,为算法设计与应用提供指导。

Comments accepted by RLC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14415 2026-06-15 cs.AI 新提交 57%

CSPO: Constraint-Sensitive Policy Optimization for Safe Reinforcement Learning

CSPO: 面向安全强化学习的约束敏感策略优化

Ayoub Belouadah, Sylvain Kubler, Yves Le Traon

机构 * University of Luxembourg(卢森堡大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 提出约束敏感策略优化(CSPO),通过引入局部约束敏感性修正原目标,加速安全恢复并减少振荡,在导航与运动基准上取得更高约束回报。

Comments Accepted as a Spotlight paper at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13679 2026-06-15 cs.CV 新提交 57%

InterleaveThinker: Reinforcing Agentic Interleaved Generation

InterleaveThinker: 强化智能体交错生成

Dian Zheng, Harry Lee, Manyuan Zhang, Kaituo Feng, Zoey Guo, Ray Zhang, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) Meituan(美团) CUHK IMIXR(香港中文大学IMIXR实验室)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV

AI总结 提出首个多智能体管线InterleaveThinker,通过规划器和评论家智能体使现有图像生成器具备交错生成能力,并利用GRPO强化单步指令修正,显著提升生成性能。

Comments Project Page: https://zhengdian1.github.io/InterleaveThinker-proj/ Code: https://github.com/zhengdian1/InterleaveThinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13040 2026-06-15 cs.LG 57%

TCRL: Temporal-Coupled Adversarial Training for Robust Constrained Reinforcement Learning in Worst-Case Scenarios

TCRL: 时序耦合对抗训练用于最坏情况下的鲁棒约束强化学习

Wentao Xu, Zhongming Yao, Weihao Li, Zhenghang Song, Yumeng Song, Tianyi Li, Yushuai Li

机构 * Northeastern University(东北大学) Zhejiang University(浙江大学) Aalborg University(奥胡斯大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 TCRL通过引入时序耦合对抗训练框架,解决传统方法在处理时序耦合扰动时的不足,提升约束强化学习在最坏情况下的鲁棒性。

Journal ref Proc. of the 25th International Conference on Autonomous Agents and Multiagent Systems, 3489 - 3491, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12942 2026-06-11 cs.AI 版本更新 57%

Offline Diffusion Policy for Multi-User Delay-Constrained Scheduling

面向多用户延迟约束调度的离线扩散策略

Zhuoran Li, Ruishuo Chen, Hai Zhong, Longbo Huang

机构 * Institute for Interdisciplinary Information Sciences (IIIS), Tsinghua University(交叉信息学院(IIIS),清华大学)

专题命中 模仿学习与强化学习 :embodied AI(abstract);分类 cs.AI

AI总结 提出基于离线强化学习的SOCD算法,利用扩散策略和批评网络指导,从离线数据中学习高效调度策略,避免在线交互,在部分可观测和大规模环境中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09009 2026-06-09 cs.CV 新提交 57%

Scaling by Diversified Experience for Vision-Language-Action Models

通过多样化经验扩展视觉-语言-动作模型

Leiyu Wang, Zhaofengnian Wang, Xueqi Li, Luoyi Fan, Cewu Lu, Nanyang Ye

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.CV

AI总结 提出SyVLA模型,通过意图解耦算法和相似样本引导的强化学习管道,解决视觉-语言-动作模型在推理与控制耦合及策略优化不稳定问题,在真实机器人任务中取得更高成功率和泛化能力。

Comments ICML 2026, SyVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08312 2026-06-09 cs.AI cs.FL 新提交 57%

Neuro-Symbolic Injection of LTLf Constraints in Autoregressive Reinforcement Learning Policies

自回归强化学习策略中LTLf约束的神经符号注入

Ashkan Ansarifard, Matteo Mancanelli, Elena Umili, Fabio Patrizi

机构 * Sapienza University of Rome(罗马大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 提出神经符号框架,将LTLf约束编译为DFA并通过可微损失注入Transformer策略,在导航任务中提升约束满足且保持回报竞争力。

Comments Accepted at the Joint Workshop on Statistics and Knowledge Integration for Logic, Learning, Ethical Decisions, and LLMs (SKILLED-LLMs 2026), co-located with KR 2026 and FLoC 2026, Lisbon, Portugal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08154 2026-06-09 cs.RO 新提交 57%

SynthICL: Scalable In-context Imitation Learning with Synthetic Data

SynthICL: 基于合成数据的可扩展上下文模仿学习

Cheng Qian, Ruomeng Fan, Yifei Ren, Yilong Wang, Edward Johns

机构 * The Robot Learning Lab(机器人学习实验室) Imperial College London(伦敦帝国理工学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 提出SynthICL框架,利用纯RGB合成数据训练上下文模仿学习策略,避免深度传感和真实数据,通过子目标预测提升控制精度,在16个真实操作任务中平均成功率79%。

详情

展开后加载摘要…

URL PDF HTML 收藏