Workspace Optimization: How to Train Your Agent
工作区优化:如何训练你的智能体
机构 * NVIDIA
专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出通过优化智能体的工作区结构来提升其在多轮任务中的表现,通过模拟权重空间训练方法,利用人工制品、证据、反例和文本反馈来改进智能体的执行能力。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
工作区优化:如何训练你的智能体
机构 * NVIDIA
专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出通过优化智能体的工作区结构来提升其在多轮任务中的表现,通过模拟权重空间训练方法,利用人工制品、证据、反例和文本反馈来改进智能体的执行能力。
SpatiaLab: 视觉-语言模型能否在真实环境中进行空间推理?
机构 * Computational Intelligence and Operations Laboratory(计算智能与运筹实验室) ; Shahjalal University of Science and Technology(沙赫jalal科技大学) ; BRAC University(BRAC大学) ; North South University(北南大学) ; Monash University(墨尔本大学) ; Qatar Computing Research Institute(卡塔尔计算研究院)
专题命中 具身推理 :navigation(abstract);分类 cs.CV、cs.LG
AI总结 SpatiaLab通过真实场景下的空间推理任务评估视觉-语言模型的能力,揭示其在复杂空间关系、深度感知和3D几何方面的不足。
Comments Accepted to ICLR 2026 (https://openreview.net/forum?id=fWWUPOb0CT). 92 Pages. 42 Figures and 29 Tables
Journal ref ICLR 2026
位置:生命记录视频流使隐私与效用的权衡不可避免
机构 * Institute for AI Industry Research, Tsinghua University, Beijing, China(清华大学人工智能产业研究院) ; RayNeo.AI, Shenzhen, China(深圳RayNeo.AI) ; Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)
专题命中 具身推理 :world model(abstract);分类 cs.CV
AI总结 生命记录视频流虽提升AI系统效用,但暴露敏感信息引发隐私风险,现有保护措施无法兼顾效用与隐私,需进一步研究权衡设计与标准化评估。
Comments 19 pages, 7 figures
FLAME:适应性专家混合用于连续多模态多任务学习
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 具身推理 :world model(abstract);分类 cs.LG
AI总结 FLAME提出了一种可扩展的专家混合框架,支持多任务预训练和连续学习,通过模态特定路由器处理不同模态的任务,同时利用低秩内存子空间压缩专家知识,提升参数效率和减少灾难性遗忘。
Comments 37 pages, 25 figures, 6 tables
代理式AI科学家并非为自主科学发现而建
机构 * Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(印度理工学院德里人工智能学院) ; Department of Computer Science and Engineering, Indian Institute of Technology Delhi(印度理工学院德里计算机科学与工程系) ; Department of Civil and Environmental Engineering, Indian Institute of Technology Delhi(印度理工学院德里土木与环境工程系) ; Laboratory of Organic and Macromolecular Chemistry (IOMC), Friedrich Schiller University Jena(耶拿弗里德里希·席勒大学有机与大分子化学实验室) ; Center for Energy and Environmental Chemistry Jena, Friedrich Schiller University Jena(耶拿弗里德里希·席勒大学能源与环境化学中心) ; Helmholtz Institute for Polymers in Energy Applications Jena (HIPOLE Jena)(耶拿海德堡聚合物能源应用研究所(HIPOLE耶拿))
专题命中 具身推理 :world model(abstract);分类 cs.AI
AI总结 本文指出,尽管代理式AI科学家能作为合作者,但其设计并非为自主科学发现。挑战包括问题选择偏差、实验室知识缺失、输出多样性压缩及缺乏实验反馈,需重新审视基础设计。
语言模型输出分布采样引入的误差与内部状态的几何关系
机构 * Department of Mathematics, King's College London, United Kingdom(伦敦国王学院数学系)
专题命中 具身推理 :world model(abstract);分类 cs.LG
AI总结 研究揭示语言模型输出分布采样误差与内部状态几何结构的关系,通过几何方法分析token嵌入空间,发现其曲率在棋类任务中反映模型对问题的内部表示。
Comments 12 Pages, 10 Figures, 2 Appendices. To appear in Proceedings of ICML 2026
漂移是一种采样误差:面向长时间 horizon 的机器人规划的 SNR 意识功率分布
机构 * Chongqing Institute of Green and Intelligent Technology, Chinese Academy of Sciences(中国科学院重庆绿色智能技术研究院) ; Chongqing School, University of Chinese Academy of Sciences(中国科学院大学重庆学院)
专题命中 机器人基础模型 :robotic(title,abstract);分类 cs.RO
AI总结 本文提出 CAPS 框架,通过功率分布增强全局轨迹概率,结合 SNR 机制实现动态切换,提升长horizon 机器人规划的鲁棒性。
Comments Accepted at ICML 2026
AR-VLA:面向视觉-语言-动作模型的真自回归动作专家
机构 * KU Leuven, Dept. Mechanical Engineering, Research unit Robotics, Automation and Mechatronics(库勒恩大学,机械工程系,机器人、自动化与机电一体化研究单位) ; KU Leuven, Dept. Electrical Engineering, Research unit Processing Speech and Images(库勒恩大学,电气工程系,语音和图像处理研究单位)
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI
AI总结 AR-VLA提出了一种自回归动作专家,通过长时记忆保持上下文,解决快控与慢思的频率不匹配问题,实现高效预训练和模块化集成,提升动作生成的时空一致性。
Comments RSS 2026 accepted
Octopus Protocol:通过基础设施即提示实现AI代理的一次性硬件发现与控制
机构 * MIT(麻省理工学院)
专题命中 机器人基础模型 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI
AI总结 Octopus Protocol通过五阶段流程实现硬件发现与控制,利用语言模型API生成MCP协议服务器,使AI代理能自主完成硬件集成与闭环视觉-运动控制。
理解面向视觉-语言-动作模型的异步推理方法
机构 * École polytechnique Systems Group, ETH Zürich(瑞士联邦理工学院系统组,苏黎世联邦理工学院)
专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文系统比较了四种异步推理方法,评估了其在不同延迟下的性能,发现A2C2在Kinetix上表现最佳,TT-RTC在LIBERO上最稳健,IT-RTC在低延迟下表现良好但高延迟下下降,VLASH在低延迟与高延迟之间存在权衡。
RePO-VLA:面向视觉-语言-动作模型的恢复驱动策略优化
机构 * Sun Yat-sen University(中山大学) ; South China University of Technology(华南理工大学) ; Peng Cheng Laboratory(鹏城实验室) ; Harbin Institute of Technology(哈尔滨工业大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI
AI总结 本文提出RePO-VLA框架,通过恢复驱动策略优化提升视觉-语言-动作模型在长时程接触丰富操作中的鲁棒性,通过恢复意识初始化、进度感知语义价值函数和价值条件细化等方法,提高对抗成功率。
面向视觉-语言-动作模型的后门基于所有权验证
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) ; A*STAR Institute of High Performance Computing (A*STAR IHPC)(新加坡A*STAR高性能计算研究所) ; A*STAR Centre for Frontier AI Research (A*STAR CFAR)(新加坡A*STAR前沿人工智能研究中心) ; College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) ; College of Design and Engineering, Nanyang Technological University(南洋理工大学设计与工程学院) ; Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) ; State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS), Wuhan University(武汉大学测绘遥感信息工程国家重点实验室(LIESMARS))
专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.AI
AI总结 本文提出GuardVLA,首个针对视觉-语言-动作模型的后门基于所有权验证框架,通过在训练中嵌入隐蔽无害的后门水印,实现可靠的模型所有权验证并保持正常任务性能。
小米OneVL:基于视觉-语言解释的一步潜在推理与规划
机构 * Xiaomi Embodied Intelligence Team(小米具身智能团队)
专题命中 机器人基础模型 :world model(abstract);分类 cs.RO、cs.CV
AI总结 OneVL通过双重辅助解码器监督的紧凑潜在标记,实现了视觉-语言解释的一步潜在推理与规划,首次在延迟条件下超越了显式推理方法。
Comments Technical Report; 49 pages, 22 figures, 10 tables; Project Page at https://xiaomi-embodied-intelligence.github.io/OneVL GitHub at https://github.com/xiaomi-research/onevl
数据不对称潜在想象与重排序在3D机器人模仿学习中的应用
专题命中 模仿学习与强化学习 :robotic(title,abstract);world model(abstract);分类 cs.RO
AI总结 本文提出DALI-R框架,通过潜在世界模型和任务完成评分器,利用混合质量轨迹提升3D机器人模仿学习的决策能力,无需额外高质量示范。
ROS-LLM:一个用于具身AI的ROS框架,具有任务反馈和结构化推理
机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) ; University of Leeds(利兹大学) ; Technical University of Darmstadt(达姆施塔特技术大学) ; East China Normal University(华东师范大学) ; Huawei Technologies(华为技术有限公司) ; ETH Zurich(苏黎世联邦理工学院) ; University College London(伦敦大学学院)
专题命中 模仿学习与强化学习 :embodied AI(title);分类 cs.RO、cs.AI
AI总结 本文提出一种基于ROS的框架,允许非专家通过自然语言提示和上下文信息编程机器人,结合大语言模型实现任务描述和行为模式控制,实验验证了其在多样化场景中的鲁棒性和扩展性。
Comments This document contains 26 pages and 13 figures
Journal ref Nature Machine Intelligence 8, 313-325 (2026)
基于动作分块的强化学习
机构 * UC Berkeley(伯克利大学)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文提出Q-chunking方法,通过动作分块技术提升长周期稀疏奖励任务的强化学习效率,实现离线到在线学习的样本效率优化。
Comments The Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025); 29 pages, 17 figures
当机器人比人类更强大时:从受限演示中学习
机构 * Thomas Lord Department of Computer Science, University of Southern California(汤姆·劳德计算机科学系,南加州大学) ; Meta AI ; Department of Computer Science & Engineering, University of California San Diego(计算机科学与工程系,加州大学圣地亚哥分校)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文探讨机器人能否超越受限专家的演示学习,通过探索更高效轨迹和自定义奖励信号,提升学习效率和任务完成速度。
Apple:通过强化学习实现通用主动感知
机构 * Department of Computer Science, TU Darmstadt, Germany(德国图林根大学计算机科学系) ; LIRIS, CNRS UMR5205, École Centrale de Lyon, France(法国里里萨大学LIRIS实验室) ; LASR Lab & CeTI, TU Dresden, Germany(德国德累斯顿技术大学LASR实验室) ; DFKI, Hessian.AI, RIG, and Centre for Cognitive Science, TU Darmstadt, Germany(德国图林根大学DFKI、海德堡人工智能、RIG及认知科学中心)
专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG
AI总结 本文提出Apple框架,通过强化学习解决多种主动感知问题,展示了其在触觉探索任务中的有效性,证明了其在机器人领域中的通用性。
Comments 27 pages; 21 figures; accepted at the Fourteenth International Conference on Learning Representations (ICLR 2026)
知识不足:注入强化学习技能以实现持续适应
机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) ; Yuanpei College, Peking University(北京大学元培学院)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.AI、cs.LG
AI总结 本文提出PaST框架,通过提取领域无关的Skill Vector,实现高效知识适应。实验表明PaST在知识问答和工具使用任务中优于现有方法,展现出良好的可扩展性和跨领域迁移能力。
COSAC:在顺序合作团队中的反事实信用分配
机构 * Adobe Research(Adobe研究)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI、cs.LG
AI总结 COSAC提出一种无批评者策略梯度方法,通过单个岭回归分解团队奖励,计算每个代理的反事实优势,实现低方差和可控的信用分配,适用于顺序合作团队。
分位数几何正则化用于分布性强化学习
机构 * Information Hub, AI Thrust(信息中心,人工智能方向)
专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG
AI总结 本文提出RQIQN方法,通过分位数估计视角改进分布性强化学习,解决分位数估计退化问题,提升风险敏感导航和Atari游戏性能。
从扩散策略中恢复隐藏奖励
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO
AI总结 本文提出EnergyFlow框架,通过参数化标量能量函数的梯度作为去噪场,统一生成动作建模与逆强化学习,证明在最大熵最优性下,去噪分数匹配学习的分数函数能恢复专家的软Q函数梯度,无需对抗训练即可提取奖励。
Comments Accepted by ICML 2026
通过Cramér距离进行分布式强化学习
机构 * HAW Hamburg(汉堡应用技术大学) ; Universidad de Málaga(马拉加大学)
专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG
AI总结 本文提出C-DSAC算法,通过最小化Cramér距离改进分布式强化学习,实验表明其在高复杂度环境中优于基线SAC和现有分布式方法。
农业田间自动化湿度监测
机构 * Coimbatore Institute of Technology(科伊巴特尔理工学院)
专题命中 人机交互与遥操作 :robotic(title,abstract);分类 cs.RO、cs.CV
AI总结 本文提出利用机器人与土壤湿度传感器结合,通过Dijkstra算法规划路径,实现大范围农田湿度的高效监测。
Comments 2018 International Seminar on Intelligent Technology and Its Applications (ISITIA)
Journal ref 2018 International Seminar on Intelligent Technology and Its Applications (ISITIA)
CAGS:基于动态3D高斯点云的色彩自适应体视频流媒体
机构 * Simon Fraser University(西蒙弗雷泽大学) ; Jiangxing Intelligence Inc.(江行智能有限公司) ; McGill University(麦吉尔大学) ; Nankai University(南开大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Fuzhou University(福州大学) ; Southeast University(东南大学)
专题命中 人机交互与遥操作 :robotic(abstract);分类 cs.CV
AI总结 本文提出CAGS系统,通过向量量化建立LOD并利用低分辨率参考图像校正颜色失真,提升体视频流媒体在带宽波动下的PSNR性能和渲染效率。
Comments SIGGRAPH 2026 Conference Paper. Code is available at https://github.com/yindaheng98/ColorAdaptiveGaussianSplatting
Journal ref ACM SIGGRAPH 2026
具身人工智能在行动:来自2026年SAE世界大会关于安全、信任、机器人和现实世界部署的洞察
专题命中 机器人数据与评测 :robotics(title,abstract);embodied AI(title,abstract);分类 cs.RO
AI总结 本文探讨了具身人工智能在现实系统中的应用挑战,强调需通过系统工程、生命周期管理与标准制定来确保安全可靠部署。
超越孤立:一个通用导航的统一基准
机构 * AutoLab, SAI, Shanghai Jiao Tong University(自动化实验室、上海交通大学) ; Research Lab, Anyverse Dynamics(Anyverse Dynamics 研究实验室)
专题命中 机器人数据与评测 :navigation(title,abstract);embodied agent(abstract);分类 cs.RO
AI总结 本文提出OmniNavBench基准,通过复合复杂性、形态通用性和演示质量三大变革,解决通用导航中跨技能协调与跨形态泛化的问题,揭示现有方法在复杂导航任务中的不足。
Comments Accepted at RSS 2026
SABER:一种可扩展的动作基于具身数据集用于真实世界VLA适应
机构 * DreamVu
专题命中 机器人数据与评测 :robotics(abstract);manipulation(abstract);robot foundation model(abstract);robotic(abstract)
AI总结 SABER通过高保真零售机器人动作数据集提升真实世界零售任务的机器人性能,采用多流动作表示方法,实现29.3%的成功率,优于微调基线。
RoboMemArena:一个全面且具有挑战性的机器人记忆基准
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; Tsinghua University(清华大学) ; Zhejiang University of Technology(浙江工业大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO
AI总结 本文提出RoboMemArena,一个包含26个任务的大型基准,通过多模态注释和真实世界评估,改进了现有机器人记忆基准的不足。PrediMem在基准测试中表现优异,为复杂记忆系统提供了新的见解。
Comments Project website: https://robomemarena.github.io
REI-Bench: 体感代理能否在任务规划中理解模糊的人类指令?
机构 * MARS Lab, School of Mechanical and Aerospace Engineering(MARS实验室,机械与航空航天工程学院)
专题命中 机器人数据与评测 :embodied agent(title);分类 cs.RO、cs.AI
AI总结 本文研究模糊参照表达对LLM任务规划的影响,提出REI-Bench基准,发现模糊性会显著降低机器人规划性能,提出任务导向上下文认知方法提升表现。
Comments Accepted at ICLR 2026