arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-29 至 2026-05-29 共收录 6 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 6 篇

2603.16673 2026-05-29 cs.RO cs.AI cs.LG 85%

When Should a Robot Think? Resource-Aware Reasoning via Reinforcement Learning for Embodied Robotic Decision-Making

机器人何时应该思考?基于强化学习的资源感知推理在具身机器人决策中的应用

Jun Liu, Pu Zhao, Zhenglun Kong, Xuan Shen, Peiyan Dong, Fan Yang, Lin Cui, Hao Tang, Geng Yuan, Wei Niu, Wenbin Zhang, Xue Lin, Gaowen Liu, Yanzhi Wang, Dong Huang

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Northeastern University(东北大学) Harvard University(哈佛大学) Cornell University(康奈尔大学) MIT(麻省理工学院) Fujitsu Research of America(美国富士通研究) Tsinghua University(清华大学) Peking University(北京大学) University of Georgia(佐治亚大学) Florida International University(佛罗里达国际大学) EmbodyX Inc(EmbodyX公司) Cisco Systems(思科系统)

专题命中 模仿学习与强化学习 :robotic(title,abstract);embodied agent(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出RARRL框架,通过强化学习学习高层编排策略,使具身代理能自适应决定是否调用LLM推理、选择推理角色及分配计算预算,以平衡推理开销与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01663 2026-05-29 cs.LG cs.RO 73%

Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning

基于流锚定噪声条件Q学习的离线强化学习:高效且表达力强的方法

Sungyoung Lee, Dohyeong Kim, Eshan Balachandar, Zelal Su Mustafaoglu, Keshav Pingali

机构 * The University of Texas at Austin, Austin, TX, USA(德克萨斯大学奥斯汀分校) Independent Researcher, Seoul, South Korea(首尔独立研究者)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 提出FAN算法,通过单次流策略迭代和单高斯噪声样本实现高效离线强化学习,在保持高性能的同时显著降低计算成本。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29042 2026-05-29 cs.AI cs.LG 62%

Differentiable Belief-based Opponent Shaping

基于可微信念的对手塑造

Aarav G Sane, Karthik Sivachandran, Rohan Paleja

机构 * Department of Computer Science(计算机科学系)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 提出D-BOS方法,通过可微的信念更新和梯度传播,在隐藏角色游戏中实现对手信念的塑造,从而自然涌现最优策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12815 2026-05-29 cs.LG 57%

TrojanTO: Action-Level Backdoor Attacks against Trajectory Optimization Models

TrojanTO:针对轨迹优化模型的行动级后门攻击

Yang Dai, Oubo Ma, Longfei Zhang, Xingxing Liang, Xiaochun Cao, Shouling Ji, Jiaheng Zhang, Jincai Huang, Li Shen

机构 * Laboratory for Big Data and Decision, National University of Defense Technology(大数据与决策实验室,国防科技大学) Zhejiang University(浙江大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) National University of Singapore(新加坡国立大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 提出TrojanTO,首个针对轨迹优化模型的行动级后门攻击方法,通过交替训练增强触发与目标动作关联,并利用轨迹过滤和批量投毒实现高隐蔽性,在低攻击预算下有效植入后门。

Comments 23 pages, 6 figures

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29324 2026-05-29 cs.CL cs.CV 57%

STAMP: Training Explicit Memory for Mobile GUI Agents in Controllable and Scalable Virtual Environments

STAMP:在可控且可扩展的虚拟环境中训练移动GUI代理的显式记忆

Junyang Wang, Haiyang Xu, Xi Zhang, Zhaoqing Zhu, Ming Yan, Jieping Ye, Jitao Sang

机构 * Tongyi AI Lab, Alibaba Group(通义实验室,阿里巴巴集团) Beijing Jiaotong University(北京交通大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.CV

AI总结 提出STAMP框架,通过可控虚拟环境注入确定性记忆变量,生成可验证监督数据并支持在线强化学习,解决移动GUI代理在长时任务中因上下文窗口限制和缺乏显式记忆导致的失败问题。

Comments 24 pages, 4figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13238 2026-05-29 cs.NI cs.LG 57%

Securing SIM-Assisted Wireless Networks via Quantum Reinforcement Learning

通过量子强化学习保护SIM辅助无线网络

Le-Hung Hoang, Quang-Trung Luu, Dinh Thai Hoang, Diep N. Nguyen, Van-Dinh Nguyen

机构 * Smart Green Transformation Center, VinUniversity(Vin大学智能绿色转型中心) Université Paris-Saclay - CNRS - CentraleSupélec - L2S(巴黎萨克雷大学 - CNRS - 中央超导实验室 - L2S) School of Electrical and Data Engineering, University of Technology Sydney(悉尼技术大学电气与数据工程学院) School of Computer Science and Statistics, Trinity College Dublin, The University of Dublin(都柏林大学三一学院计算机科学与统计学学院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 针对SIM辅助无线网络中高维优化和动态环境挑战,提出混合量子近端策略优化框架,联合优化功率分配和SIM相位,实现约15%保密率提升和30%收敛加速。

Comments Submitted to IEEE TCOM: 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏