Distributional value gradients for stochastic environments
分布价值梯度用于随机环境
机构 * PSI KU Leuven(KU莱顿心理学研究所)
专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG
AI总结 本文提出分布式Sobolev训练方法,通过建模价值函数及其梯度的分布,提升在随机环境中的样本效率和稳定性。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
分布价值梯度用于随机环境
机构 * PSI KU Leuven(KU莱顿心理学研究所)
专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG
AI总结 本文提出分布式Sobolev训练方法,通过建模价值函数及其梯度的分布,提升在随机环境中的样本效率和稳定性。
组合上升老虎机
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG
AI总结 本文提出组合上升老虎机框架和CRUCB算法,解决组合老虎机中因基础臂增强传播导致的依赖问题,通过理论分析和实验验证其高效性和有效性。
利用离散函数分解进行科学设计
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG
AI总结 本文提出DADO算法,通过利用设计变量的分解结构,提升离散空间优化效率,用于科学设计问题。
大规模人机协作分拣中心中的多目标强化学习用于托盘分配
机构 * Department of Computer and Information Science, University of Pennsylvania, Philadelphia, PA, USA(计算机与信息科学系,宾夕法尼亚大学,费城,PA,USA) ; Amazon(亚马逊)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG
AI总结 本文提出了一种多目标强化学习方法,用于解决大规模人机协作分拣中心中的托盘分配问题,通过权衡处理速度、资源使用和空间利用等目标,实现了高效且满足约束的策略学习。
想象一座城市:CityGenAgent用于程序化3D城市生成
机构 * Lingnan University, Hong Kong SAR, China(岭南大学) ; Zhejiang University, Hangzhou, China(浙江大学) ; The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学) ; Autodesk AI Lab, Canada(Autodesk AI实验室) ; The University of Hong Kong, Hong Kong SAR, China(香港大学)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV
AI总结 CityGenAgent通过自然语言驱动的分层程序化生成方法,实现了高质量3D城市生成,提升了语义对齐、视觉质量和可控性。
PanoEnv:探索基于强化学习的全景环境中3D空间智能
机构 * University of Glasgow(格拉斯哥大学) ; HKUST(GZ)(香港科技大学(广州))
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.CV
AI总结 PanoEnv通过强化学习框架提升VLMs在全景环境中3D空间推理能力,实现更高准确率和语义评分。
Gauss-Newton加速的MPPI控制
机构 * Institute of System Dynamics, HTWG Konstanz - University of Applied Sciences(系统动力学研究所,霍特廷根应用科学大学) ; Department of Microsystems Engineering (IMTEK), University of Freiburg(微系统工程系(IMTEK),弗赖堡大学) ; Department of Microsystems Engineering (IMTEK)(微系统工程系(IMTEK)) ; Department of Mathematics, University of Freiburg(数学系,弗赖堡大学)
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO
AI总结 本文提出Gauss-Newton加速的MPPI方法,通过结合雅可比重构和二次广义高斯-牛顿方法,提升MPPI在高维问题中的可扩展性和计算效率。
Comments 6 pages, 3 figures, submitted to the IFAC World Congress 2026, parts of this preprint are directly taken from Chapter 3 of the main author's PhD thesis with title "Optimal Control for Efficient Vessel Operation: From Theory to Real-World Applications"
通过保守的软演员-评论家实现有效的强化学习控制
机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)数据科学学院) ; Graduate School of Engineering Science, Osaka University, Japan(大阪大学工学研究科) ; Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences, China(中国科学院深圳先进技术研究院) ; Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学电子与电气工程系) ; School of Transportation, Southeast University, China(东南大学交通运输学院)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO
AI总结 本文提出保守的软演员-评论家算法,通过熵和相对熵正则化提升强化学习控制的稳定性与效率。
Comments 8 pages, 9 figures
迈向大规模预训练与高效微调之间的人形机器人控制的桥梁
机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) ; School of Artificial Intelligence, Xidian University(人工智能学院,西安电子科技大学)
专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO
AI总结 本文提出了一种结合大规模预训练与高效微调的方法,利用SAC实现人形机器人零样本部署,并通过基于模型的方法提升适应效率。
Comments ICLR 2026
在线约束马尔可夫决策过程的近最优样本复杂度
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG
AI总结 本文提出了一种基于模型的对偶算法,解决了在线约束马尔可夫决策过程的安全性问题,证明了在允许小规模违规的情况下,算法能以近最优样本复杂度生成安全策略。
Journal ref NeurIPS 2025
MoRL: 用于统一运动理解与生成的强化推理
机构 * The University of Sydney(悉尼大学) ; Peking University(北京大学) ; Nanyang Technological University(南洋理工大学)
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.CV
AI总结 MoRL通过结合监督微调和强化学习,提升运动理解与生成的推理能力和现实感,并引入链式运动方法和大规模CoT数据集以增强推理效果。
群集行为的差异:集体行为比较中的挑战
机构 * Department of Computer and Information Science(计算机与信息科学系) ; Centre for the Advanced Study of Collective Behaviour(集体行为高级研究中心) ; Zukunftskolleg(未来学院)
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO
AI总结 本文研究了群集行为比较中的挑战,提出了一种基于自组织映射的方法来识别特征空间中难以区分行为的区域。
Comments Accepted for publication in the proceeding of ANTS 2026 - 15th International Conference on Swarm Intelligence
通过生成基础模型扩展单人示范用于模仿学习
机构 * Computer Science, University of Freiburg(弗赖堡大学计算机科学系) ; Zuse School ELIZA(泽乌斯学校ELIZA)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO
AI总结 通过生成基础模型扩展单人示范用于模仿学习,实现从单人示范到机器人任务的高效训练与泛化
Comments ICRA 2026, 8 pages, 6 figures, 4 tables
基于联合状态-动作学习嵌入的多智能体模型驱动强化学习
机构 * McGill University(麦吉尔大学)
专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG
AI总结 本文提出了一种基于联合状态-动作学习嵌入的多智能体模型驱动强化学习框架,通过统一表示学习与想象式回放,提升智能体在动态环境中协调能力与长期规划效率。
Comments 22 pages
EasyMimic: 一种低成本的机器人模仿学习框架
机构 * AIM3 Lab, Renmin University of China(中国人民大学人工智能实验室)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO
AI总结 EasyMimic通过低成本框架实现机器人从人类视频快速学习操控策略,减少对昂贵数据的依赖,推动家庭机器人发展。
Comments icra 2026
迈向动态四足步态:基于对称性的强化学习层级实现自由步态转换以适应不同速度
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO
AI总结 本文提出基于对称性的强化学习方法,实现四足机器人在不同速度下的自由步态转换,提升运动适应性。
Comments This work is build on reusing the main novel concept from arXiv:2403.10723. Based on the reviews we accept while submitting this work, we decided to resubmit this work as a replacement of the linked work
超越CVaR:利用静态谱风险度量提升分布式强化学习中的决策质量
机构 * Department of Mathematics and Statistics, York University, Toronto, Canada(数学与统计学系,约克大学,多伦多,加拿大)
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG
AI总结 本文提出了一种具有收敛保证的DRL算法,优化更广泛的静态谱风险度量,提升决策质量并优于现有方法。
Comments Accepted at ICML 2025
Journal ref Proceedings of the 42nd International Conference on Machine Learning, PMLR 267:44571-44593, 2025
ReSPEC:动态环境中在线多光谱传感器重新配置框架
机构 * Department of Electrical Engineering, Columbia University(电气工程系,哥伦比亚大学)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO
AI总结 ReSPEC框架通过强化学习实现动态多光谱传感器重新配置,提升机器人在复杂环境下的感知效率与资源利用率。
Comments 8 pages, 4 figures. This work has been submitted to the IEEE for possible publication
HypeRL: 基于超网络的强化学习用于参数化动力系统控制
机构 * MOX - Department of Mathematics Politecnico di Milano(米兰理工数学系MOX部门) ; Department of Mechanical Engineering University of Washington(华盛顿大学机械工程系) ; Centre for Mathematical Sciences Lund University(卢德大学数学科学中心)
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG
AI总结 HypeRL通过超网络强化学习方法,解决参数化动力系统控制问题,实现高效泛化和优化。
THOR:通过强化学习进行工具集成的分层优化以实现数学推理
机构 * University of Science and Technology of China(中国科学技术大学) ; iFLYTEK Research(iFLYTEK研究院)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI
AI总结 THOR通过强化学习实现工具集成的分层优化,提升数学推理和代码生成能力。
Comments 22 pages, 13 figures, ICLR 2026
Optimus-3: 具有双粒度推理感知策略优化的双路由对齐专家混合代理
机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen Campus)(计算机科学与技术学院,哈尔滨工业大学(深圳校区)) ; Pengcheng Laboratory(鹏城实验室) ; School of Information Science and Technology, Harbin Institute of Technology (Shenzhen Campus)(信息科学与技术学院,哈尔滨工业大学(深圳校区)) ; Shenzhen Loop Area Institute(深圳河套学院)
专题命中 模仿学习与强化学习 :embodied AI(abstract);分类 cs.AI
AI总结 Optimus-3通过双路由对齐专家混合架构和双粒度推理感知策略优化,实现了系统1与系统2的协同,提升了开放性任务的解决能力。
Comments 16 pages, 12 figures
在线自适应强化学习与回声状态网络用于非平稳动态
机构 * Department of Computer Science, Nagoya Institute of Technology(名古屋技术大学计算机科学系) ; Nagoya Institute of Technology(名古屋技术大学) ; International Research Center for Neurointelligence, The University of Tokyo(神经智能国际研究中心,东京大学)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG
AI总结 本文提出基于回声状态网络的在线自适应强化学习框架,通过共振计算实现快速适应,适用于非平稳动态环境中的实时机器人控制。
Comments Submitted to IJCNN 2026
StepScorer: 通过分步评分与心理遗憾建模加速强化学习
机构 * INDEPENDENT RESEARCHER(独立研究者)
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG
AI总结 StepScorer通过分步评分与心理遗憾建模,加速强化学习收敛,适用于连续控制任务和延迟反馈环境。
Comments 10 pages, 5 figures, 1 table
基于自适应线性路径模型的扩散
机构 * Department of Mechanical Engineering, University of California, Berkeley(加州大学伯克利分校机械工程系)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO
AI总结 本文提出LP-MBD和ALP-MBD,通过线性概率路径和强化学习提升扩散模型在机器人控制中的适应性和鲁棒性。
Comments ICRA 2026
基于选择模型的Q学习用于延迟反馈收益管理
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG
AI总结 本文提出基于选择模型的Q学习方法,用于解决延迟反馈下的收益管理问题,通过部分世界模型提升决策鲁棒性并减少偏差。
学习适应性跨主体视觉运动策略与对比提示协调
机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院) ; College of Automation Engineering, Nanjing University of Aeronautics and Astronautics(南京航空航天大学自动化工程学院)
专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.RO
AI总结 CAPO通过对比提示学习和自适应提示协调,提升跨主体视觉运动策略的适应性和样本效率。
通过轨迹级生成嵌入进行观察模仿学习
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG
AI总结 TGE通过轨迹级生成嵌入解决离线模仿学习中专家数据稀缺的问题,利用时序扩散模型构建平滑奖励,提升离线数据与专家行为间的学习信号。
Comments 25 pages, 6 figures, 7 tables
分布鲁棒平均奖励强化学习的样本复杂度
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG
AI总结 本文提出两种算法,实现了分布鲁棒平均奖励强化学习的近最优样本复杂度,通过锚定状态稳定转移核并保证收敛性。
Comments Accepted at NeurIPS 2025. Updated with minor corrections and additional experiments
离线目标条件强化学习与投影拟度规划
机构 * Ubisoft la Forge ; University of Angers(昂热大学) ; Inria(法国国家科学研究中心)
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG
AI总结 本文提出ProQ框架,通过学习非对称距离和结合拉格朗日检测器,实现目标条件强化学习中子目标生成与长期目标达成的稳健控制。
通过在线强化学习将大语言模型接地于交互环境
机构 * Inria (Flowers)(Inria(Flowers)) ; University of Bordeaux(波尔多大学) ; Hugging Face ; Univ Angers, LERIA, SFR MATHSTIC(昂热大学,LERIA,SFR MATHSTIC) ; Sorbonne Université(索邦大学)
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG
AI总结 本文提出GLAM方法,通过在线强化学习将大语言模型接地于交互环境,以提升样本效率和泛化能力,并探讨在线学习的影响。
Comments The associated code can be found at https://github.com/flowersteam/Grounding_LLMs_with_online_RL. This is an extended version of the paper published at ICML 2023: https://proceedings.mlr.press/v202/carta23a
Journal ref PMLR 202 (2023):3676-3713