arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-27 至 2026-05-27 共收录 82 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 23 篇

2507.01766 2026-05-27 cs.IT eess.SP math.IT 78%

Reconfigurable Intelligent Surface aided Integrated-Navigation-and-Communication in Urban Canyons: A Satellite Selection Approach

城市峡谷中可重构智能表面辅助的集成导航与通信:一种卫星选择方法

Tianwei Hou, Da Guan, Xin Sun, Anna Li, Wenqiang Yi, Yuanwei Liu, Arumugam Nallanathan

专题命中 具身导航 :navigation(title,abstract)

AI总结 本研究提出利用同时发射和反射可重构智能表面(STAR-RIS)辅助的中地球轨道(MEO)卫星网络,在城市峡谷中提供全球定位和通信服务,并通过卫星选择算法优化导航或通信性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27314 2026-05-27 cs.RO cs.SY eess.SY 70%

Riding the Shifting Potential: When Reactive Control Suffices for Multi-Goal Behavior

驾驭变化势场:何时反应控制足以实现多目标行为

Vito Mengers, Oliver Brock

机构 * Robotics and Biology Laboratory, Technische Universität Berlin(技术大学柏林机器人与生物学实验室) Science of Intelligence (SCIoI), Cluster of Excellence, Berlin, Germany(智能科学(SCIoI),卓越中心,柏林,德国) Robotics Institute Germany(德国机器人研究所)

专题命中 具身导航 :navigation(abstract);world model(abstract);分类 cs.RO

AI总结 本文提出通过零空间投影扩展图基世界模型中的交互结构,动态调整优先级以解决多目标冲突,在非凸障碍导航和非凸物体推拉任务中实现100%成功率,无需演示或重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26637 2026-05-27 cs.RO 70%

Enabling Extensible Embodied Capabilities with Tools

利用工具实现可扩展的具身能力

Xueyang Zhou, Zijia Wang, Qianjiang Li, Yibo Hu, Guiyao Tie, Li Wan, Yidan Liu, Pan Zhou, Lichao Sun, Yongchao Chen

机构 * Huazhong University of Science and Technology(华中科技大学) Hebei University of Technology(河北工业大学) Tianjin University(天津大学) Lehigh University(莱特大学) College of AI, Tsinghua University(清华大学人工智能学院)

专题命中 具身导航 :navigation(abstract,abstract_cn);分类 cs.RO

AI总结 提出一种通过外部化能力为工具、并借助标准化协议ETP动态调用工具的方法,在仿真和真实平台上平均提升具身性能31%-36%,但揭示了工具使用在认知和感知方面增益显著而在执行方面有限。

Comments 51 pages, 20 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26524 2026-05-27 cs.CV cs.AI 62%

CmIVTP: Cross-modal Interaction-based Vessel Trajectory Prediction for Maritime Intelligence

CmIVTP:面向海事智能的基于跨模态交互的船舶轨迹预测

Yuxu Lu, Dong Yang, Xiaoyu Li, Mengwei Bao, Congcong Zhao

机构 * Department of Logistics and Maritime Studies, the Hong Kong Polytechnic University(物流及海运研究系,香港理工大学) Research Centre for ESG Advancement (RCESGA), the Hong Kong Polytechnic University(ESG进步研究中心(RCESGA),香港理工大学) School of Navigation, Wuhan University of Technology(航海学院,武汉理工大学)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 针对单一数据源局限导致船舶轨迹预测不准的问题,提出跨模态交互框架CmIVTP,融合AIS和CCTV数据,利用目标感知场景编码器和跨模态交互Transformer实现高精度预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26167 2026-05-27 cs.LG cs.AI math.DS math.RA 62%

Planning Neural Dynamics with Lie Group Embedding through Supervised Projective Manifold Learning

通过监督投影流形学习进行李群嵌入的神经动力学规划

Tianwei Wang, Bryan Chen, Qian Zuo, Qiyue Xia, Xin Li, Wei Pang

机构 * School of Informatics(信息学院) School of Mathematics(数学学院) University of Edinburgh(爱丁堡大学) School of Computer Science(计算机科学学院) School of MACS(MACS学院) Beijing Institute of Technology(北京理工大学) Heriot-Watt University(赫瑞-瓦特大学)

专题命中 具身导航 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 提出李群嵌入动力神经网络(LieEDNN),通过梯度下降和流形上的度量投影实现可学习且稳定的动力学,解决李群与神经网络加法不兼容及非线性表示空间中的演化问题,并在SE(3)伸缩机械臂上验证。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08999 2026-05-27 cs.CL cs.AI cs.LG 62%

ASTRA: Adaptive Semantic Tree Reasoning Architecture for Complex Table Question Answering

ASTRA: 面向复杂表格问答的自适应语义树推理架构

Xiaoke Guo, Songze Li, Zhiqiang Liu, Zhaoyan Gong, Yuanxiang Liu, Huajun Chen, Wen Zhang

机构 * Zhejiang University(浙江大学)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 提出ASTRA架构,通过AdaSTR将表格重构为逻辑语义树,并利用DuTR双模式推理框架结合树搜索文本导航与符号代码执行,在复杂表格问答中达到最优性能。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26936 2026-05-27 cs.RO 57%

A Bioinspired Underwater Robot with a Latch-Mediated Soft Bistable Mechanism

一种具有闩锁介导的软体双稳态机构的仿生水下机器人

Chongze Bi, Wenjie Wu, Zonghao Zuo, Li Wen

专题命中 具身导航 :robotics(abstract);分类 cs.RO

AI总结 本文提出一种受生物启发的软体双稳态执行器,通过集成闩锁机构实现单电机驱动的非对称能量输入与释放,结合鳍结构实现高效水下推进与机动,实验验证了稳定拍动、精确转向及多模式运动能力。

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26782 2026-05-27 cs.RO cs.HC 57%

Manipulating Tangible Virtual Object Dynamics to Promote Learning of Precision Force Generation

操控有形虚拟物体动力学以促进精确力生成的学习

Alberto Garzás-Villar, Alba Riera-Cardona, Alexis Derumigny, J. Micah Prendergast, Jane Murray Cramm, Laura Marchal-Crespo

机构 * Department of Cognitive Robotics, Delft University of Technology, Delft, 2628 CD, The Netherlands Department of Socio-medical Sciences, Erasmus School of Health Policy \& Management, Erasmus University Rotterdam, Rotterdam, 3062PA, The Netherlands. Department of Applied Mathematics, Delft University of Technology, Delft, 2628 CD, The Netherlands Department of Rehabilitation Medicine, Erasmus Medical Center, Rotterdam, 3015 GD, The Netherlands

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 本研究提出通过操控有形虚拟物体的动力学(线性、高斯或反对称高斯弹簧模型)来训练精确力控制,实验表明反对称高斯组在训练中力精度最高,但长期保留无显著差异,且参与者主要依赖学习到的目标伸长而非目标力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01327 2026-05-27 cs.SE cs.CL cs.LG 57%

SWE-Adept: An LLM-Based Agentic Framework for Deep Codebase Analysis and Structured Issue Resolution

SWE-Adept:基于LLM的深度代码库分析与结构化问题解决代理框架

Kang He, Kaushik Roy

机构 * Electrical and Computer Engineering, Purdue University(电子工程与计算机工程系,普渡大学)

专题命中 具身导航 :navigation(abstract);分类 cs.LG

AI总结 提出SWE-Adept双代理框架,通过代理引导的深度优先搜索进行代码定位,结合自适应规划和结构化问题解决,在SWE-Bench上提升端到端解决率最多4.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27270 2026-05-27 stat.AP stat.ML 50%

Inverse Control Constrained Optimization of Vessel Speed Decisions Under Environmental Risk: Evidence from Arctic Shipping

环境风险下船舶速度决策的逆控制约束优化:来自北极航运的证据

Mauli Pant, Linda Fernandez, Indranil Sahoo

专题命中 具身导航 :navigation(abstract)

AI总结 通过逆控制约束优化框架,利用超过1400万条AIS观测数据估计船舶速度决策中的风险参数,揭示了不同船型和航行状态在运营效率、冰风险与鲸鱼生态风险之间的权衡模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26545 2026-05-27 eess.SP 50%

Receiver-Centric TDOA Localization Framework for DAB Signals under Synchronization Impairments

面向同步损伤下DAB信号的接收端中心TDOA定位框架

Mustafa Furkan Beker, Abdullah Tan, Khaled Walid Elgammal, Mehmet Kemal Ozdemir

专题命中 具身导航 :navigation(abstract)

AI总结 针对GNSS拒止环境中的同步损伤问题,提出基于DAB信号的接收端中心多通道TDOA定位框架,利用空符号和相位参考符号实现同步,通过双差分、峰值旁瓣比加权和偏差校正提高鲁棒性,并采用CT-EKF滤波提升精度。

Comments Accepted for presentation at SIU 2026. 4 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26531 2026-05-27 eess.SP 50%

Multi-/Uni-Cast Non-Orthogonal Multiple Access-Based INAC

基于多播/单播非正交多址的集成导航与通信

Yaoyu Zhang, Xin Sun, Tianwei Hou, Anna Li, Sofie Pollin, Yuanwei Liu, Arumugam Nallanathan

专题命中 具身导航 :navigation(abstract)

AI总结 提出一种基于多播/单播非正交多址(MUC-NOMA)的集成导航与通信(INAC)信号结构,通过共享伪噪声序列和功率分配策略实现信号级融合,并推导了误码率和定位精度的闭式表达式。

Comments 14 pages,10 figures,journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26125 2026-05-27 eess.SY astro-ph.EP astro-ph.IM cs.SY 50%

Inflatable devices for planetary aerocapture and aerobraking manoeuvres

用于行星大气捕获和大气刹车机动中的充气装置

Philippe Reynier

专题命中 具身导航 :navigation(abstract)

AI总结 本文综述了用于行星到达时轨道机动的充气装置(包括气球、帆或充气热盾舱)的现有技术,评估了其在减少燃料消耗和应对热力学挑战方面的潜力。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09845 2026-05-27 cond-mat.mtrl-sci 50%

Materials Acceleration Platform for Electrochemistry: a Platform for Autonomous Electrochemistry

电化学材料加速平台:自主电化学平台

Daniel Persaud, Mike Werezak, Mark Xu, Melyne Zhou, Frank Benkel, Xin Pang, Vahid Attari, Brian DeCost, Ashley Dale, Nicholas Senior, Gabriel Birsan, Jason Hattrick-Simpers

专题命中 具身导航 :robotic(abstract)

AI总结 提出电化学材料加速平台(MAP-E),集成机器人液体处理、样品传输和多通道恒电位控制,实现自主高通量腐蚀测试,并通过不确定性驱动的采样策略加速构建环境稳定性图。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 5 篇

2605.26379 2026-05-27 stat.ML cs.LG 83%

When Does LeJEPA Learn a World Model?

LeJEPA 何时学习世界模型?

David Klindt, Yann LeCun, Randall Balestriero

机构 * Cold Spring Harbor Laboratory(冷泉港实验室) New York University(纽约大学) Brown University(布朗大学)

专题命中 具身推理 :world model(title,abstract);robotic(abstract);分类 cs.LG

AI总结 本文证明 LeJEPA(对齐加高斯正则化)在潜变量服从平稳加性噪声演化的世界中能够线性恢复潜变量(线性可识别性),并指出高斯分布是唯一保证该性质的潜分布,同时验证了近似可识别性和最优规划能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16457 2026-05-27 cs.LG cs.AI cs.CV 82%

Identifiable Token Correspondence for World Models

可辨识的令牌对应关系用于世界模型

Youngin Kim, Ray Sun, Inho Kim, Bumsoo Park, Hyun Oh Song

机构 * Interdisciplinary Program in Artificial Intelligence, Seoul National University(人工智能交叉学科项目,首尔国立大学) Department of Computer Science(计算机科学系) Engineering, Seoul National University(工程系,首尔国立大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 提出可辨识的令牌对应关系(ITC)方法,通过将下一帧预测建模为结构化分配问题,解决基于令牌的Transformer世界模型在长程推演中的时间不一致性,在四个基准上达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10104 2026-05-27 cs.CV cs.AI cs.LG 82%

Olaf-World: Orienting Latent Actions for Video World Modeling

Olaf-World: 面向视频世界模型的潜在动作定向

Yuxin Jiang, Yuchao Gu, Ivor W. Tsang, Mike Zheng Shou

机构 * Show Lab, National University of Singapore Research (A STAR), Singapore

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 提出SeqΔ-REPA对齐目标,通过冻结自监督视频编码器的时序特征差异锚定潜在动作,实现无标签视频中可迁移的动作控制世界模型预训练。

Comments ICML 2026. Project page: https://showlab.github.io/Olaf-World/ Code: https://github.com/showlab/Olaf-World

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15477 2026-05-27 cs.CV 79%

EgoExo-WM: Unlocking Exo Video for Ego World Models

EgoExo-WM: 利用外部视频解锁自我世界模型

Danny Tran, Roberto Martín-Martín, Kristen Grauman

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出通过从外部视频提取结构化身体姿态并利用人体运动学先验将其转换为自我视频,从而利用丰富的野外外部数据训练自我世界模型,显著提升预测质量和下游规划性能。

Comments Project Page: https://vision.cs.utexas.edu/projects/EgoExo-WM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26239 2026-05-27 cs.CV cs.MA 70%

Sentinel: Embodied Cooperative Spatial Reasoning and Planning

Sentinel:具身协同空间推理与规划

Xiangye Lin, Hongxin Zhang, Ruxi Deng, Qinhong Zhou, Chuang Gan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 具身推理 :embodied agent(abstract);navigation(abstract);分类 cs.CV

AI总结 提出Sentinel挑战和CoSaR框架,通过自然语言通信与空间导航算法结合,解决多智能体在城市规模户外环境中的协同空间推理与规划问题。

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 2 篇

2603.04639 2026-05-27 cs.RO cs.AI 84%

RoboMME: Benchmarking and Understanding Memory for Robotic Generalist Policies

RoboMME:机器人通用策略的记忆基准与理解

Yinpei Dai, Hongze Fu, Jayjun Lee, Yuejiang Liu, Haoran Zhang, Jianing Yang, Chelsea Finn, Nima Fazeli, Joyce Chai

机构 * University of Michigan(密歇根大学) Stanford University(斯坦福大学) Figure AI

专题命中 机器人基础模型 :robotic(title,abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出RoboMME基准,通过16个操作任务评估VLA模型在长时程和历史依赖场景中的记忆能力,并基于π0.5骨干网络探索14种记忆增强变体,发现记忆表示的有效性高度依赖于任务。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16449 2026-05-27 cs.CV cs.AI 73%

Bridging the Semantic-Action Gap in Visual Token Pruning for Efficient VLA Inference

弥合视觉令牌剪枝中的语义-动作鸿沟以实现高效VLA推理

Ziyan Liu, Yeqiu Chen, Hongyi Cai, Tao Lin, Shuo Yang, Zheng Liu, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) BAAI(北京人工智能研究院)

专题命中 机器人基础模型 :embodied AI(abstract);manipulation(abstract);分类 cs.AI、cs.CV

AI总结 提出VLA-Pruner方法,通过结合语义预填充和时序平滑的动作相关性估计视觉令牌重要性,并采用Combine-then-Filter策略,在保持操作质量的同时实现高达1.99倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模仿学习与强化学习 10 篇

2605.26478 2026-05-27 cs.RO cs.AI cs.CV cs.LG cs.SY eess.SY 77%

Efficient On-policy Visual-RL via Stochastic Decoupled Policy Gradient

基于随机解耦策略梯度的高效在策略视觉强化学习

Haoxiang You, Yilang Liu, Davis Zong, Qian Wang, Teeratham Vitchutripop, Qi Wang, Daniel Rakita, Ian Abraham

机构 * Yale University(耶鲁大学) Shanghai Jiao Tong University(上海交通大学) University of Sydney(悉尼大学)

专题命中 模仿学习与强化学习 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出随机解耦策略梯度(SDPG)方法,通过轨迹滚动的随机扰动估计策略梯度,在单GPU上数小时内端到端训练多样化的视觉运动控制策略,显著降低计算和内存开销,并在视觉MuJoCo基准测试中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28730 2026-05-27 cs.RO cs.CL cs.CV 73%

SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning

SOLE-R1:视频语言推理作为机器人强化学习的唯一奖励

Philip Schroeder, Thomas Weng, Karl Schmeckpeper, Eric Rosen, Stephen Hart, Ondrej Biza

机构 * MIT(麻省理工学院) RAI Institute(机器人智能研究所)

专题命中 模仿学习与强化学习 :robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 提出SOLE-R1模型,通过视频语言时空推理生成密集任务进度估计作为唯一奖励信号,实现在无真实奖励、演示或任务特定调优下的零样本在线强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26784 2026-05-27 cs.LG cs.AI 62%

Ratio-Variance Regularized Policy Optimization

比率方差正则化策略优化

Yu Luo, Shuo Han, Yihan Hu, Lei Lv, Huaping Liu, Fuchun Sun, Jianye Hao, Dong Li

机构 * Department of Foundation Model, 2012 Labs, Huawei(华为基础模型部门,2012实验室) Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(上海智能自主系统研究院,同济大学) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI、cs.LG

AI总结 提出R²VPO方法,通过约束策略比率方差作为信任区域的局部近似,替代启发式裁剪,在LLM和机器人控制任务中提升性能与样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22190 2026-05-27 cs.LG cs.AI cs.CL 62%

GUI-Libra: Training Native GUI Agents to Reason and Act with Action-aware Supervision and Partially Verifiable RL

GUI-Libra:训练原生GUI代理进行推理与行动——基于动作感知监督和部分可验证强化学习

Rui Yang, Qianhui Wu, Zhaoyang Wang, Hanyang Chen, Ke Yang, Hao Cheng, Huaxiu Yao, Baolin Peng, Huan Zhang, Jianfeng Gao, Tong Zhang

机构 * UIUC(伊利诺伊大学香槟分校) Microsoft(微软) UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 提出GUI-Libra训练方案,通过动作感知SFT和部分可验证RL中的KL正则化,解决GUI代理在长程导航任务中推理与定位冲突及部分可验证性问题,显著提升步骤准确率和任务完成率。

Comments 57 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26282 2026-05-27 cs.LG 57%

Scaling World-Model Reinforcement Learning Through Diffusion Policy Optimization

通过扩散策略优化扩展世界模型强化学习

Xiaoyuan Cheng, Wenxuan Yuan, Zhancun Mu, Yuanzhao Zhang, Yiming Yang, Hai Wang, Zhuo Sun, Che Liu

机构 * Dynamic Systems Lab, University College London(伦敦大学学院动态系统实验室) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Santa Fe Institute(圣塔菲研究所) School of Statistics and Data Science, Shanghai University of Finance and Economics(上海财经大学统计与数据科学学院) Department of Computing, Imperial College London(伦敦帝国理工学院计算系)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 针对世界模型强化学习中搜索与价值学习之间的结构错位问题,提出基于扩散策略优化的模型基方法MBDPO,统一搜索与策略优化,实现可扩展的策略学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24152 2026-05-27 cs.AI 57%

Neuro-Inspired Inverse Learning for Planning and Control

神经启发式逆向学习用于规划与控制

Maryna Kapitonova, Tonio Ball

机构 * NeuroMentum AI IMBIT, University of Freiburg, Germany(NeuroMentum AI IMBIT,弗赖堡大学,德国)

专题命中 模仿学习与强化学习 :embodied AI(abstract);分类 cs.AI

AI总结 提出一种神经启发式框架Inverter,通过逆向学习(IL)结合前向/逆向内部模型、开环多步运动指令和层次化动作组织,在规划与控制任务中实现高效推理,平均性能提升24.2%且计算时间降低一到两个数量级。

Comments Version 2, minor fix in online version of the abstract, pdf unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03785 2026-05-27 cs.AI cs.MA 57%

Communication Gain and Delay Cost Under Cross-Timestep Delays in Cooperative Multi-Agent Reinforcement Learning

跨时间步延迟下合作多智能体强化学习中的通信增益与延迟代价

Zihong Gao, Hongjian Liang, Lei Hao, Liangjun Ke

机构 * The State Key Laboratory for Manufacturing Systems Engineering(制造系统工程国家重点实验室) School of Automation Science and Engineering, Xi’an Jiaotong University(西安交通大学自动化科学与工程学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 针对部分可观测环境中跨时间步通信延迟导致的信息错位问题,提出通信增益与延迟代价(CGDC)度量,并基于此设计演员-评论家框架CDCMA,通过预测未来观测和注意力融合延迟消息来提升合作多智能体强化学习的性能、鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21845 2026-05-27 cs.LG 57%

Constrained Meta Reinforcement Learning with Provable Test-Time Safety

具有可证明测试时安全性的约束元强化学习

Tingting Ni, Maryam Kamgarpour

机构 * Sycamore Lab, EPFL, Lausanne, Switzerland(苏黎世联邦理工学院萨克森实验室,瑞士拉瓦尔)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 提出一种约束元强化学习算法,在测试任务上以可证明的安全性和样本复杂度保证学习近似最优策略,并证明样本复杂度下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20957 2026-05-27 cs.SE cs.AI 57%

One Tool Is Enough: Reinforcement Learning for Repository-Level LLM Agents

一个工具就够了:面向仓库级LLM智能体的强化学习

Zhaoxi Zhang, Yitong Duan, Yanzhi Zhang, Yiming Xu, Zhixiang Wang, Kun Liang, Weikang Li, Jiahui Liang, Deguo Xia, Jizhou Huang, Jiyan He, Yunfang Wu

机构 * National Key Laboratory for Multimedia Information Processing, Peking University(信息处理国家级重点实验室,北京大学) School of Computer Science, Peking University(北京大学计算机科学学院) Zhongguancun Institute of Artificial Intelligence (ZGCI)(中关村人工智能研究院(ZGCI)) Baidu Inc(百度公司)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI

AI总结 提出RepoNavigator,一个仅配备单一执行感知工具(跳转到调用符号定义)的LLM智能体,通过强化学习端到端训练,在仓库级问题定位中达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏