arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 4115 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 模仿学习与强化学习 4115 篇

2608.15707 2026-08-18 cs.RO 新提交 57%

GAINS: Leveraging Inconsistent Human Intervention Signals in Reinforcement Learning

GAINS:在强化学习中利用不一致的人类干预信号

Xinyi Zhang, Yinuo Zhao, Pei Ren, Lechun Jiang, Huiqian Jin, Lei Sun, Dapeng Wu, Zhengping Che, Chi Harold Liu, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 本研究提出GAINS框架,采用带分位数Q网络的分布强化学习建模人类干预引发的回报变异性,结合悲观探索策略,在模拟与现实场景中使任务成功率较RLIF高22%,故障恢复成功率最高提升43%,凸显该建模对现实部署的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14498 2026-08-17 cs.LG cs.DC 新提交 57%

Rollplex: Cross-Phase GPU Spatial Sharing for Vision Language Model Post-Training

Rollplex:面向视觉语言模型后训练的跨阶段GPU空间共享

Hanfeng Lu, Tianyu Feng, Suyi Li, Yuheng Zhao, Wei Gao, Shaopan Xiong, Ju Huang, Siran Yang, Jiamang Wang, Lin Qu, Wei Wang

机构 * HKUST(香港科技大学) Alibaba Inc(阿里巴巴公司)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.LG

AI总结 Rollplex是一种跨阶段GPU空间共享运行时,通过解耦RL后训练的参考与训练阶段、优化内存与并行度,提升VLMs后训练的GPU利用率与训练速度。

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14082 2026-08-17 cs.RO 新提交 57%

PILOT: Privileged Imitation Learning for End-to-End Motion Planning of Autonomous UAVs under Partial Observability

PILOT:部分可观测条件下自主无人机端到端运动规划的特权模仿学习方法

Qingrui Zhang, Feng Xue, Xiang Zhou, Chenghao Yu

机构 * School of Aeronautics and Astronautics, Sun Yat-sen University(中山大学航空航天学院) Sun Yat-sen University(中山大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.RO

AI总结 本文提出PILOT框架,通过特权模仿学习结合TCN时空感知融合模块,实现部分可观测下无人机端到端运动规划,性能接近最优控制专家且计算开销降超80%,零样本部署验证其可行性与泛化性。

Comments 13 Pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12995 2026-08-14 cs.AI cs.MA 新提交 57%

OGR-MARL: Option-Guided Residual Multi-Agent Reinforcement Learning for Heterogeneous USV Cooperative Pursuit in Constrained Port Waterways

OGR-MARL:面向受限港口水道中异构无人水面艇协同追踪的选项引导式残差多智能体强化学习

Jiayang Mao, Lanfeng Wang, Zhao-Han Peng

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI

AI总结 本文提出OGR-MARL框架,将其实例化为多款连续控制MARL算法,经厦门港水道实验验证,OGR-MASAC捕获率达75.0%,规则依从性与异构协同表现最优,且具备良好泛化潜力。

Comments 6 pages,5 figures, accepted by ICUS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06161 2026-08-14 cs.AI 版本更新 57%

iARCS: Iterative Agentic RL for Controllable 3D Scene Generation

iARCS:用于可控3D场景生成的迭代智能体强化学习

Saugat Adhikari, Ashok Prasad Neupane, Pramish Paudel, Ajad Chhatkuli, Danda Pani Paudel

机构 * Tribhuvan University(特里布文大学) Pulchowk Campus, IOE, Tribhuvan University(特里布文大学工程学院普尔乔克校区) NAAMII(尼泊尔先进数学与信息学研究所) INSAIT, Sofia University “St. Kliment Ohridski”(索菲亚大学圣克莱门特奥赫里德斯基分校INSAIT)

专题命中 模仿学习与强化学习 :embodied AI(abstract);分类 cs.AI

AI总结 研究针对现有3D场景生成器无法满足任务约束的问题,提出iARCS迭代智能体强化学习框架,通过两阶段策略优化约束保真度,生成的数据可改进基础生成器,具实用价值。

Comments 15 pages, 9 figures, 4 tables. Includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01891 2026-08-14 cs.LG 版本更新 57%

SEAR: Sample Efficient Action Chunking Reinforcement Learning

SEAR:样本高效的动作分块强化学习

C. F. Maximilian Nagy, Onur Celik, Emiliyan Gospodinov, Florian Seligmann, Weiran Liao, Aryan Kaushik, Gerhard Neumann

机构 * Autonomous Learning Robots, Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院自主学习机器人实验室)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 SEAR 是一种样本高效的在线强化学习算法,通过利用动作分块的时间结构和滚动时间 horizon,有效结合小和大分块大小的优势,在 Metaworld 上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10204 2026-08-12 cs.LG 新提交 57%

Boundary-Seeking Policy Gradient for Safe Reinforcement Learning

面向安全强化学习的边界搜寻策略梯度算法

Chenhua Fan, Jiahui Zhu, Yuhang Zhang, Honghao Wei

机构 * School of EECS, Washington State University(华盛顿州立大学电子工程与计算机科学学院)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本文提出BSPG算法,针对安全强化学习中标准梯度法易收敛到可行域内部的问题,结合切向与法向分量,在Safety-Gymnasium导航任务中实现更高奖励与更紧密的边界跟踪。

Comments CDC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09258 2026-08-11 cs.RO 新提交 57%

Task-Oriented Formation Decision via Reinforcement Learning: Herding an Attacking Swarm

面向任务的编队决策:通过强化学习实现对攻击型集群的驱赶

Zhaozong Wang, Guibin Sun, Jinyong Chen, Rui Zhou

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文针对攻击型集群驱赶任务,提出基于强化学习的编队决策方法,通过参数化编队形状缓解防御者机动性劣势,在仿真与物理平台上验证了方法的可行性与扩展性。

Comments Accepted for publication in IEEE Transactions on Automation Science and Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07725 2026-08-11 cs.LG 新提交 57%

Finite Constant Frontiers and Auditable Regret Certificates for Average-Reward Reinforcement Learning

平均奖励强化学习的有限常数前沿与可审计后悔证书

Ibne Farabi Shihab, Abu Sa-Adat Mohamed Moon-Im Al Ahsan, Md Najmus Swaqeeb

机构 * Iowa State University(爱荷华州立大学) BRAC University(BRAC大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本文针对平均奖励强化学习,提出感知常数的比较协议,推导通信MDP的有限下界证书,改进已发表系数,给出跨度约束乐观学习者的可审计组合规则,完成相关形式化与诊断测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01151 2026-08-11 cs.LG 版本更新 57%

Lagrangian Perturbation Diffusion Steering: Latent Reinforcement Learning for Generative Policies

拉格朗日扰动扩散引导:用于生成策略的潜在强化学习

Hikmet Simsir, Ozgur S. Oguz

机构 * University of Michigan(密歇根大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 提出拉格朗日扰动扩散引导(LP-DS),通过学习紧凑的噪声空间扰动来微调冻结的生成策略,利用拉格朗日信任区域目标优化,在保持潜在先验约束的同时提升下游价值,在多个基准上实现样本效率和回报提升。

Comments Accepted as a regular paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01476 2026-08-11 cs.LG cs.CL 版本更新 57%

From Rebound to Remedy: Understanding and Mitigating Reward Hacking via Representation Engineering

当奖励黑客反弹时:通过表征层面信号理解与缓解它

Rui Wu, Ruixiang Tang

机构 * Rutgers University(罗格斯大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 本文研究了大型语言模型强化学习中奖励黑客现象,通过环境操控设置分析其三阶段反弹模式,并提出基于表征工程的Advantage Modification方法以更有效抑制黑客行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06907 2026-08-10 cs.RO 新提交 57%

Spatiotemporal Agility: Time-Constrained Reinforcement Learning for Vision-Guided Dynamic Quadrupedal Interception

时空敏捷性:面向视觉引导的动态四足机器人拦截的时间约束强化学习

Yidong Zhu, Zibo Dai, Tongning Zhang, Leixin Chang, Hua Chen

机构 * Zhejiang University(浙江大学) LimX Dynamics Technology Co., Ltd.(灵蜥动力科技有限公司)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文针对四足机器人动态接球任务,提出结合视觉模块与直接目标条件RL策略的集成框架,构建实时闭环拦截系统,提升了接球成功率并减小了sim-to-real性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06197 2026-08-07 cs.AI 新提交 57%

EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning

EnvACE:通过世界预演内化环境动态以实现智能体强化学习

Zishan Xu, Zhiyuan Yao, Yuxin Chen, Yifu Guo, Zhengxi Lu, Yuquan Lu, Jinyang Huang, Yan Xu, Yasheng Wang, Weinan Zhang, Xingshan Zeng, Weiwen Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Sun Yat-sen University(中山大学) Central South University(中南大学) The Chinese University of Hong Kong(香港中文大学) Tencent Inc.(腾讯公司)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI

AI总结 本文提出 EnvACE 方法,以世界预演替代外部环境交互训练 LLM 智能体,在多基准测试中性能优于基线,可突破外部环境约束扩展 LLM 智能体训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04934 2026-08-06 cs.CL cs.LG 新提交 57%

State2State: Environment-Derived Mid-Training for LLM Agents

State2State:面向大语言模型智能体的环境衍生式中间训练

Xuanyu Lei, Yiqi Zhu, Chenliang Li, Kaiming Liu, Peng Li, Ming Yan, Jieping Ye, Ya-Qin Zhang, Yang Liu

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Institute for AI, Tsinghua University(清华大学人工智能研究院) Institute of Intelligent Computing, Alibaba Group(阿里巴巴集团智能计算研究院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.LG

AI总结 该研究提出State2State环境衍生式中间训练方法,无需外部任务与监督,可提升LLM智能体性能及学习效率,具备跨环境泛化潜力。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20985 2026-08-06 cs.LG 版本更新 57%

Distributional Active Inference

分布式主动推断

Abdullah Akgül, Gulcin Baykal, Manuel Haußmann, Mustafa Mert Çelikok, Melih Kandemir

机构 * University of Southern Denmark(丹麦南部大学)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.LG

AI总结 本文提出了一种将主动推断整合到分布式强化学习框架中的形式抽象,以提升复杂环境机器人系统最优控制的样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03872 2026-08-05 cs.RO 新提交 57%

EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning

EvoHIL:用于鲁棒交互式强化学习的自演化奖励与流匹配策略优化

Shuoqin Zhang, Tongtong Cheng, Xiru Gao, Jinzhuo Peng, Bin Zheng, Jiahao Tu, Ke Wang, Jia Pan, Zhe Hu, Kai Liu

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 EvoHIL是适配奖励模型、动作生成器和视觉域的统一交互式学习框架,在六类机械臂操纵任务中提升了成功率、运动平滑度等性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27703 2026-08-05 cs.AI 版本更新 57%

SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them

SpatialCLI:先借助空间工具进行推理,再脱离工具进行推理

Yang Zhou, Zixuan Huang, Sunzhu Li, Zhuo Yang, Chen Zhang, Shunian Chen, Caijun Yan, Jianyao Xu, Shunyu Liu, Weijie Fu, Peiliang Li, Xiaozhi Chen, Yuxiang Cai

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.AI

AI总结 本研究提出SpatialCLI框架,通过三个阶段让视觉语言模型先借助专用空间工具推理,再内化感知能力,在MindCube上大幅提升了Qwen3-VL-8B-Instruct的性能,表现优于对比模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20880 2026-08-05 stat.ML cs.LG stat.ME 版本更新 57%

Adversarial observations in probabilistic State-Space Models for robust Reinforcement Learning

概率状态空间模型中的对抗观测用于鲁棒强化学习

M. Santos-Pascual, D. Ríos Insua

机构 * Inst. Math. Sciences, Spanish Nat. Research Council, Madrid, Spain(西班牙国家研究委员会数学科学研究所,马德里)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 分析线性概率状态空间模型中受似然约束的对抗观测对潜在状态和策略决策的影响,为构建鲁棒强化学习系统提供理论基础,适用于机器人等安全关键领域。

Comments 42 pages, 10 figures, PREPRINT ONGOING: Revised version with additional theoretical results and experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28663 2026-08-03 cs.NE cs.LG 新提交 57%

NeuroSynth: A Biologically Inspired Continual Reinforcement Learning Architecture for Mitigating Catastrophic Forgetting

NeuroSynth:一种受生物启发的持续强化学习架构,用于缓解灾难性遗忘

Yash Kini

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 本研究提出受生物启发的持续强化学习架构NeuroSynth,通过双路径巩固机制缓解灾难性遗忘,实验显示其在多个顺序导航任务中相比PPO、EWC保留更多早期任务知识,改善了持续学习的稳定性-可塑性平衡。

Comments Disclaimer. This manuscript is provided as an arXiv preprint to establish a public record of the NeuroSynth continual reinforcement learning architecture and its evaluation on the NeuroMaze-CL benchmark. This full manuscript has been submitted to the Journal of High School Science for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00610 2026-08-03 cs.RO 版本更新 57%

Vision-based Goal-Reaching Control for Mobile Robots Using a Hierarchical Learning Framework

基于视觉的目标到达控制的移动机器人Hierarchical Learning框架

Mehdi Heydari Shahna, Pauli Mustalahti, Jouni Mattila

机构 * Faculty of Engineering and Natural Sciences, Tampere University(工程与自然科学学院,塔尔皮莱大学)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 本文提出一种基于视觉的目标到达控制框架,通过分层学习方法提高移动机器人在复杂地形中的安全性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28464 2026-07-31 cs.CV 新提交 57%

Can Vision-Language Models Reason about AI Edits in Images?

视觉-语言模型能否对图像中的AI编辑进行推理?

Darsha Udayanga, Pin-Yu Chen, Payel Das, Qiang Ji

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) IBM Research(IBM研究院)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV

AI总结 本研究探究能否用强化学习而非显式推理监督训练视觉-语言模型推理AI图像编辑,提出基于GRPO的框架,引入eff-IoU指标,在多数据集上实现与SOTA相当的检测定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28225 2026-07-31 cs.CV 新提交 57%

FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image Verification

FaithEyes:通过多智能体过程图像验证实现可信的工具使用

Haoqing Wang, Xingrun Xing, Wei Xia, Ziheng Li, Yehui Tang

机构 * Samsung Research(三星研究院) Peking University(北京大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.CV

AI总结 本研究提出多智能体框架FaithEyes,通过子智能体判断主智能体的工具调用以提升工具使用可信性,在视觉感知与推理基准上实现了更优准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27967 2026-07-31 cs.AI 新提交 57%

MARS-RA: Rank Aggregation for Credit Assignment via Multimodal Comparisons in Embodied Multi-Agent Cooperation

MARS-RA:基于具身多智能体协作中多模态比较的信用分配排序聚合

Dawei Wang, Di Zhao, Xinyuan Liu, Marci Chi Ma, Xiaoyang Liu, Chengming Zhou, Gary Ushaw, Richard Davison

机构 * Newcastle University(纽卡斯尔大学) University of Auckland(奥克兰大学)

专题命中 模仿学习与强化学习 :embodied AI(abstract);分类 cs.AI

AI总结 本研究针对具身多智能体协作的信用分配难题,提出MARS-RA框架,将其转化为多模态模型生成的成对比较排序聚合问题,经理论与实验验证可引导智能体有效协作。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01110 2026-07-31 cs.RO 版本更新 57%

Compact Task-Aligned Imitation Learning for Laboratory Automation

紧凑的任务对齐模仿学习用于实验室自动化

Kanata Suzuki, Hanon Nakamura, Kana Miyamoto, Tetsuya Ogata

机构 * Spatial Robotics Research Center, Fujitsu Limited.(富士通株式会社空间机器人研究中心) Faculty of Science and Engineering, Waseda University(早稻田大学理工学部) National Institute of Advanced Industrial Science and Technology(国家工业科学与技术研究院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出了一种紧凑的模仿学习框架,通过小基础模型和扩散变换器专家实现高效实验室自动化,实验显示其在三个任务中的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24672 2026-07-28 cs.LG 新提交 57%

Explainable Reinforcement Learning via Physics-Aware Policy Distillation

通过物理感知策略蒸馏实现可解释强化学习

Shaker Al-Tamari, Waled Kadour

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 研究针对安全关键领域中深度强化学习的黑箱问题,利用策略蒸馏框架,以高性能TD3为教师模型,基于浅层决策树生成可解释学生代理,通过特定方法生成数据集,实现性能与教师相当并保持系统稳定性和可解释性。

Comments 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24577 2026-07-28 cs.LG cs.SE 新提交 57%

Evaluating Fuzz Testing for Reinforcement Learning Agents

评估强化学习智能体的模糊测试

Zhibin Kang, Hanmo You, Dong Wang, Haiming Zheng, Junjie Chen

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.LG

AI总结 研究针对强化学习智能体模糊测试评估差异问题,通过在三种环境下统一配置对五种方法及随机测试进行基准测试,从多角度评估,揭示不同方法特点,表明模糊测试能提升智能体鲁棒性等,还给出可操作指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24320 2026-07-28 cs.RO cs.SY eess.SY 新提交 57%

Continual-RL for Generalization in Autonomous Racing on the RoboRacer Platform

用于RoboRacer平台自主赛车中泛化的持续强化学习

Joel Siegert, Edoardo Ghignone, Michele Magno

机构 * Center for Project-Based Learning, D-ITET, ETH Zurich(基于项目的学习中心,分布式信息技术与电气工程学院,苏黎世联邦理工学院)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 针对现代机器人适应变化环境的挑战,提出基于持续反向传播的持续强化学习框架,仅用现实世界数据训练通用策略并微调超越经典控制器,还提出离线强化学习比较方法并进行模拟分析。

Comments 8 pages, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24057 2026-07-28 cs.LG 新提交 57%

Constrained Reinforcement Learning Using Successor Representations

使用后继表示的约束强化学习

Michael Girstl, Alexander Mattick, Christopher Mutschler

机构 * Technical University of Darmstadt (TU Darmstadt)(达姆施塔特工业大学) Hessian Center for Artificial Intelligence (hessian.AI)(黑森州人工智能中心) Fraunhofer Institute for Integrated Circuits IIS, Fraunhofer IIS(弗劳恩霍夫集成电路研究所IIS) University of Technology Nuremberg (UTN)(纽伦堡工业大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 研究针对现实世界强化学习中策略难适应成本函数变化的问题,提出SafeDSR方法,通过引入可学习权重矩阵扩展深度后继表示到约束强化学习,能快速重训策略,在二维导航环境展示竞争力与灵活性。

Comments published in Transactions for Machine Learning Research 2026

Journal ref Michael Girstl, Alexander Mattick, & Christopher Mutschler (2026). Constrained Reinforcement Learning Using Successor Representations. Transactions on Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21302 2026-07-28 cs.AI 版本更新 57%

Expert Behavior Prior Reinforcement Learning

专家行为先验强化学习

Gong Gao, Weidong Zhao, Xianhui Liu, Ning Jia

机构 * School of Computer Science, Tongji University(同济大学计算机科学与技术学院)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.AI

AI总结 研究针对行为先验强化学习依赖静态离线数据集的问题,提出专家行为先验算法,通过Q引导的条件变分自编码器生成专家策略先验,并结合专家策略引导和策略梯度校正模块,提升样本效率与收敛稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18985 2026-07-28 cs.AI 版本更新 57%

Athena-Brain Technical Report: An Efficient Robot Brain for General Intelligence and Embodied Interaction

雅典娜大脑技术报告:用于通用智能和具身交互的高效机器人大脑

Jialian Li, Junhong Liu, Yuchen Cao, Weiran Guo, Jiaming Song, Xutao Wang, Yi Zhao, Jiangpin Liu, Jie Chen

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.AI

AI总结 研究针对具身智能体对设备端紧凑模型需求,提出雅典娜大脑8B模型,经多阶段训练流程,使其兼具通用与具身交互能力,实验证明该模型在通用和具身评估中有效,能在保持性能同时生成更简洁回复。

详情

展开后加载摘要…

URL PDF HTML 收藏