arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-07 至 2026-08-07 共收录 5 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 5 篇

2510.06277 2026-08-07 cs.CV cs.LG 版本更新 82%

Dynamic Object Masks as Goal Representations for Visual Goal-Conditioned Reinforcement Learning

动态目标掩码作为视觉目标条件强化学习的目标表示

Fahim Shahriar, Cheryl Wang, Alireza Azimi, Gautham Vasan, Hany Hamed, Abhishek Naik, A. Rupam Mahmood, Colin Bellinger

机构 * University of Alberta(阿尔伯塔大学) McGill University(麦吉尔大学) University of Ottawa(渥太华大学) AMII CIFAR Canada AI Chair(CIFAR加拿大人工智能主席) Vector Institute(向量研究所)

专题命中 模仿学习与强化学习 :robotics(abstract);manipulation(abstract);navigation(abstract);robotic(abstract)

AI总结 该研究针对视觉目标条件强化学习,提出动态目标掩码作为目标表示,结合Detic等预训练检测器生成掩码,在机械臂和仿真导航任务中实现高成功率与高效学习,支持仿真到现实迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04568 2026-08-07 cs.LG cs.AI cs.RO 版本更新 67%

Dream-MPC: Gradient-Based Model Predictive Control with Latent Imagination

Dream-MPC:基于梯度与潜在想象的模型预测控制

Jonathan Spieler, Sven Behnke

机构 * Autonomous Intelligent Systems, Computer Science Institute VI - Intelligent Systems(自主智能系统,计算机科学研究所VI - 智能系统) Robotics, Center for Robotics(机器人学,机器人中心) the Lamarr Institute for Machine Learning(拉马尔机器学习研究所) Artificial Intelligence, University of Bonn, Germany(人工智能,波恩大学,德国)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出Dream-MPC方法,通过从展开策略生成少量候选轨迹,并利用学习的世界模型进行梯度上升优化,结合不确定性正则化和时间上的优化迭代摊销,显著提升了底层策略性能,在24个连续控制任务上优于无梯度MPC和现有基线。

Comments Accepted for International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06105 2026-08-07 cs.LG cs.AI cs.MA 新提交 62%

Does Latent Context Help? A Controlled Evaluation of Inverse Reinforcement Learning in Arctic Shipping

潜在上下文是否有帮助?北极航运中逆强化学习的受控评估

Vaishnav Vaidheeswaran, Dilith Jayakody, Biruk Ambaw, Jaswanth Kumar, Md Mahbub Alam, Gabriel Spadon

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过对北极航运航次的受控评估,发现非线性共享奖励模型优于线性基线,添加船舶特定潜在上下文反而降低性能,表明可观测特征已能解释行为差异,为安全关键领域的AI部署提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04949 2026-08-07 cs.CV cs.AI 版本更新 62%

DeepForgeSeal: Latent Space-Driven Semi-Fragile Watermarking for Deepfake Detection Using Adversarial Reinforcement Learning

DeepForgeSeal:基于对抗强化学习的隐空间驱动半脆弱深度伪造检测水印技术

Tharindu Fernando, Clinton Fookes, Sridha Sridharan

机构 * The Signal Processing, Artificial Intelligence and Vision Technologies (SAIVT), Queensland University of Technology, Australia(信号处理、人工智能与视觉技术研究所(SAIVT),昆士兰理工大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 该研究针对深度伪造检测中现有水印方法鲁棒性与脆弱性难以平衡的问题,提出基于对抗强化学习的隐空间驱动半脆弱水印框架,在CelebA和CelebA-HQ数据集上性能优于现有最优方法

Comments Accepted for Publication in IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06197 2026-08-07 cs.AI 新提交 57%

EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning

EnvACE:通过世界预演内化环境动态以实现智能体强化学习

Zishan Xu, Zhiyuan Yao, Yuxin Chen, Yifu Guo, Zhengxi Lu, Yuquan Lu, Jinyang Huang, Yan Xu, Yasheng Wang, Weinan Zhang, Xingshan Zeng, Weiwen Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Sun Yat-sen University(中山大学) Central South University(中南大学) The Chinese University of Hong Kong(香港中文大学) Tencent Inc.(腾讯公司)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI

AI总结 本文提出 EnvACE 方法,以世界预演替代外部环境交互训练 LLM 智能体,在多基准测试中性能优于基线,可突破外部环境约束扩展 LLM 智能体训练。

详情

展开后加载摘要…

URL PDF HTML 收藏