arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-23 至 2026-06-23 共收录 428 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 125 篇

2606.23138 2026-06-23 cs.CR 新提交 78%

Rising From the Ashes: How Agentic AI is Unblocking Challenges in Cybersecurity

浴火重生:自主AI如何解锁网络安全挑战

Gabriela F. Ciocarlie, Kathrin Grosse, Somesh Jha, Daryna Oliynyk, Andrew Paverd, Christian Wressnegger

专题命中 规划决策 :agentic(title,abstract)

AI总结 本文探讨自主AI通过直接处理自然语言或代码来缓解安全防御中劳动密集型瓶颈的潜力,并通过16个案例研究(包括供应链分析)展示其对防御者的益处。

Comments two tables, under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22838 2026-06-23 cs.RO 新提交 78%

FPAS: Frontier-Based Path Planning with Adaptive Sampling for Large-Scale Unknown Environments

FPAS:基于前沿的自适应采样路径规划用于大规模未知环境

Jinwoo Choi, Yeonkyu Lee, Jung-Taak Kim, Jisung Bae, Seung-Woo Seo

机构 * Seoul National University(首尔大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 提出FPAS框架,通过前沿概念引导目标导向任务,并基于前沿开放度自适应采样,在保持高目标到达性能的同时显著提升计算效率。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22142 2026-06-23 cs.RO 新提交 78%

RoboLineage: Agent-Native Data Lifecycle Governance Across Robot Policy Iterations

RoboLineage:跨机器人策略迭代的智能体原生数据生命周期治理

Qian Luo, Wentao Guo, Zhennan Qin, Nanchun Guo, Yunhan Zhao, Yi Ma, Yanchao Yang

机构 * Transcengram The University of Hong Kong(香港大学) Beijing Institute of Technology(北京理工大学)

专题命中 规划决策 :agent(title,abstract)

AI总结 提出RoboLineage系统,通过将数据收集、审查、训练、评估等步骤表示为类型化谱系工件,实现机器人策略迭代的显式生命周期管理,提升迭代速度与可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21646 2026-06-23 cs.RO 新提交 78%

Energy-based Compositional Diffusion Planning

基于能量的组合扩散规划

Tao Sun, Utkarsh Aashu Mishra, Jiaxin Lu, Danfei Xu, Iro Armeni

机构 * Stanford University(斯坦福大学) Georgia Institute of Technology(佐治亚理工学院) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 规划决策 :planning(title,abstract)

AI总结 提出能量基组合扩散器(ECD),将全局轨迹建模为局部桥势之和的最小化,通过保守修正场和边界反应项改进启发式拼接,实现线性时间复杂度的马尔可夫分数近似,在OGBench任务中达到最优成功率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21438 2026-06-23 cs.RO 新提交 78%

Temporal logics and formal synthesis for robot planning and control

机器人规划与控制的时间逻辑与形式化综合

Jana Tumova, Joris Verhagen, Matti Vahs

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文介绍线性时间逻辑和信号时间逻辑作为机器人行为的规范语言,并讨论从离散图/游戏到采样运动规划、轨迹优化和控制证书的形式化综合方法,最后指出实际部署中的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23045 2026-06-23 quant-ph 新提交 78%

Satellite Mission Planning with Rydberg Atoms

基于里德伯原子的卫星任务规划

Michel Nowak, Benjamin Marchand, Yassine Naghmouchi, Serge Rainjonneau, Wesley Coelho, Louis Vignoli, Louis-Paul Henry

专题命中 规划决策 :planning(title,abstract)

AI总结 将卫星任务规划问题转化为最大独立集问题,利用基于里德伯原子的量子处理单元通过QUBO框架求解,实验表明QUBO方法更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30998 2026-06-23 cs.CR cs.CE 78%

Free-Riding the Agentic Web: A Systematic Security Analysis of x402 Payments

AI经济中的搭便车:x402支付系统中逻辑缺陷的解密

Shengchen Ling, Yihang Huang, Yuefeng Du, Yuan Chen, Yajin Zhou, Lei Wu, Cong Wang

专题命中 规划决策 :agentic(title,abstract)

AI总结 本文首次对x402协议生态进行安全分析,通过形式化五个安全不变量,揭示了同步HTTP请求与异步区块链最终性之间的状态同步漏洞,并提出了请求绑定签名和悲观状态锁定等缓解措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16689 2026-06-23 eess.SP cs.NI 版本更新 78%

Against the Monolithic Wireless World Model: Why NextG Needs Composable and Agentic Intelligence

反对单一无线世界模型:为什么NextG需要可组合和代理智能

Aladin Djuhera, Farhan Ahmed, Vlad C. Andrei, Swanand Ravindra Kadhe, Alecio Binotto, Haris Gacanin, Holger Boche

专题命中 规划决策 :agentic(title,abstract)

AI总结 本文指出无线领域缺乏等同于LLM的数据基础,主张采用可组合和代理智能架构以实现可部署的AI原生网络。

Journal ref ICML 2026 Workshop on AI and ML for NextG

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08334 2026-06-23 cs.RO 版本更新 78%

Vec-QMDP: Vectorized POMDP Planning on CPUs for Real-Time Autonomous Driving

Vec-QMDP:面向实时自动驾驶的CPU矢量化POMDP规划

Xuanjin Jin, Yanxin Dong, Bin Sun, Huan Xu, Zhihui Hao, XianPeng Lang, Panpan Cai

机构 * Shanghai Innovation Institute(上海创新研究院)

专题命中 规划决策 :planning(title,abstract)

AI总结 提出Vec-QMDP,一种CPU原生并行规划器,通过数据导向设计、层次化并行和矢量化碰撞检测,实现比最先进串行规划器快227-1073倍的速度,在毫秒级延迟下完成大规模自动驾驶规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04687 2026-06-23 cs.CV 版本更新 78%

WebCryptoAgent: Agentic Crypto Trading with Web Informatics

WebCryptoAgent: 基于网络信息学的智能加密货币交易

Ali Kurban, Wei Luo, Liangyu Zuo, Zeyu Zhang, Renda Han, Zhaolu Kang, Hao Tang, Yang Zhao

机构 * AI Geeks CUHK Peking University(北京大学) TJU(天津大学) La Trobe(拉特罗布大学)

专题命中 规划决策 :agentic(title,abstract)

AI总结 提出WebCryptoAgent框架,通过模态专用代理整合异构网络信息与市场信号,并采用解耦控制架构实现快速风险响应,提升交易稳定性与尾部风险处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23348 2026-06-23 cs.LG 新提交 77%

Superhuman AI for Generals.io Using Self-Play Reinforcement Learning

基于自我对弈强化学习的Generals.io超人类AI

Matej Straka, Viliam Lisý, Martin Schmid

机构 * Department of Applied Mathematics, Charles University(查尔斯大学应用数学系) Department of Computer Science, Faculty of Electrical Engineering, Czech Technical University in Prague(捷克理工大学电气工程学院计算机科学系) EquiLibre Technologies, Inc.(EquiLibre Technologies公司)

专题命中 规划决策 :agent(abstract);AI agent(abstract);planning(abstract);分类 cs.LG

AI总结 通过自研JAX模拟器(单GPU每秒千万帧,提速万倍)和自对弈策略梯度训练视觉Transformer,在实时策略游戏Generals.io中达到超人类水平,1v1排行榜第一,对顶级人类玩家胜率199-70。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21151 2026-06-23 cs.SE cs.AI cs.NI 新提交 73%

Context-Aware Generative AI for Automated Telecom Test Script Generation

上下文感知的生成式AI用于自动化电信测试脚本生成

Gautam Prasad, Chandramohan T. N., Joy Bose

机构 * Ericsson R&D Bangalore(爱立信印度班加罗尔研发中心)

专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 提出一种上下文感知的生成式AI框架,通过实时知识图谱和增量引擎检测变化,仅更新受影响的测试,减少人工并加速测试周期。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20761 2026-06-23 cs.SE cs.AI cs.ET cs.MA cs.SY eess.SY 新提交 73%

Integrating Large Language Model Agents with Digital Twins for Industrial Autonomous Systems

将大语言模型代理与数字孪生集成用于工业自主系统

Yuchen Xia

机构 * Institut für Automatisierungs- und Softwaresysteme (IAS) der Universität Stuttgart(自动化与软件系统研究所(IAS)的斯图加特大学)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI、cs.SE

AI总结 提出三层框架集成大语言模型、数字孪生与自动化系统,通过TPSR模型和四种LLM角色实现自适应任务规划与执行,提升工业自动化适应性。

Comments Doctoral Dissertation, University of Stuttgart. Doctoral Exam Video Recording: https://youtu.be/Mhd9LiV5TKE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09893 2026-06-23 cs.CL cs.AI 版本更新 73%

Pseudo-Deliberation in Language Models: When Reasoning Fails to Align Values and Actions

语言模型中的伪 deliberation:当推理无法使价值观与行动一致时

Sushrita Rakshit, Hanwen Zhang, Hua Shen

机构 * New York University(纽约大学)

专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文研究了语言模型中价值观与行动不一致的问题,提出伪 deliberation 概念,并通过 VALDI 框架评估对齐程度,发现不同模型在生成对话中存在一致的偏差。

Comments 9 pages, 5 main figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22354 2026-06-23 cs.RO 版本更新 71%

LLM-Based Generalizable Hierarchical Task Planning and Execution for Heterogeneous Robot Teams with Event-Driven Replanning

基于LLM的异构机器人团队通用分层任务规划与执行及事件驱动重规划

Suraj Borate, Bhavish Rai B, Vipul Pardeshi, Madhu Vadali

机构 * Department of Mechanical Engineering, IIT Gandhinagar(印度加尔各直辖区理工学院机械工程系) Sahyadri College of Engineering and Management(萨哈亚德里工程与管理学院) Vishwakarma Institute of Information Technology(维什瓦克arma信息技术学院)

专题命中 规划决策 :planning(title)

AI总结 提出CoMuRoS架构,结合集中式规划与分布式执行,通过LLM解释自然语言目标、分配子任务,并支持事件驱动重规划,在硬件实验中实现自主恢复和协调运输。

Comments full version of this short paper is accepted at Frontiers in Robotics and AI Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21623 2026-06-23 cs.CV cs.AI 新提交 70%

A DVDrive Approach for doScenes Instructed Driving Challenge

一种面向 doScenes 指令驾驶挑战的 DVDrive 方法

Zijian Fu, Xiangyang Chu, Mengshi Qi, Huadong Ma, Guanghao Zhang, Wei Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Xiaomi EV(小米汽车)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 提出基于 OmniDrive 的指令条件轨迹预测方法,引入 DVPE 分视角感知模块减少跨视角干扰,提升多视角视觉定位与语言指令对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22319 2026-06-23 cs.RO cs.CV 新提交 67%

EmbodiedUS-FS: Fast Slow Intelligence for Ultrasound Robotics

EmbodiedUS-FS:用于超声机器人的快速慢速智能

Fangzhuo Zhang, Xinyu Wang, Xiao Yang, Jinchang Zhang

机构 * independent researcher(独立研究员) Shanghai World Foreign Language Academy(上海世界外国语中学) University of Wyoming(怀俄明大学) SUNY Binghamton(纽约州立大学宾汉姆顿分校)

专题命中 规划决策 :planning(abstract);workflow(abstract)

AI总结 提出一种分层快慢思考的具身超声系统,通过慢脑进行意图解析和任务规划,快脑融合多模态反馈优化局部动作,并集成安全防护机制,在动态临床环境中提高任务成功率并减少安全违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13830 2026-06-23 cs.IR 67%

A Tale of Two Graphs: Separating Knowledge Exploration from Outline Structure for Open-Ended Deep Research

双图之 tale:分离知识探索与大纲结构以实现开放性深度研究

Zhuofan Shi, Ming Ma, Zekun Yao, Fangkai Yang, Jue Zhang, Dongge Han, Victor Rühle, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

专题命中 规划决策 :agent(abstract);planning(abstract)

AI总结 本文提出DualGraph架构,通过分离知识与写作结构,提升开放性深度研究的效率和深度,实验表明其在报告深度、广度和事实准确性上优于现有方法。

Comments 26 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23946 2026-06-23 cs.LG cs.AI cs.CL stat.ML 版本更新 67%

Explore-Execute Chain: Towards an Efficient Structured Reasoning Paradigm

探索-执行链:迈向高效的结构化推理范式

Kaisen Yang, Tinghe Zhang, Rushi Shah, Kaicheng Yang, Qinwei Ma, Dianbo Liu, Alex Lamb

机构 * Qizhi Institute(启智研究院) Dept. of Computer Science, Tsinghua University(清华大学计算机科学系) College of AI, Tsinghua University(清华大学人工智能学院) Engineering Department, National University of Singapore(新加坡国立大学工程系) Dept. of Automation, Shanghai Jiao Tong University(上海交通大学自动化系) IIIS, Tsinghua University(清华大学人工智能研究院) College of Software, Northeastern University(东北大学软件学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出探索-执行链(E²C),将推理分为随机探索阶段(生成简洁高层计划)和确定性执行阶段(忠实执行计划),通过因果SFT和RL训练分离,在AIME'2024上以更少token超越思维树,并支持轻量领域适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23537 2026-06-23 cs.DB cs.AI cs.LG 新提交 62%

SQLConductor: Search-to-Policy Learning for Step-wise Text-to-SQL Orchestration

SQLConductor:面向逐步文本到SQL编排的搜索到策略学习

Yizhang Zhu, Zhangyang Peng, Boyan Li, Yuyu Luo

机构 * HKUST(GZ)(香港科技大学(广州))

专题命中 规划决策 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 提出SQLConductor框架,通过搜索到策略学习将文本到SQL任务分解为动作序列,用蒙特卡洛树搜索探索工作流并训练策略模型逐步编排,在BIRD-Dev上达73.2%执行准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23404 2026-06-23 cs.CL cs.AI 新提交 62%

ReasoningLens: Hierarchical Visualization and Diagnostic Auditing for Large Reasoning Models

ReasoningLens:大型推理模型的分层可视化与诊断审计

Jun Zhang, Jiasheng Zheng, Boxi Cao, Yaojie Lu, Hongyu Lin, Jia Zheng, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory(中国信息处理实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出ReasoningLens框架,通过分层结构、智能审计和系统分析,将长思维链转化为可操作洞察,用于解释、调试和优化大型推理模型。

Comments Our project is available at https://github.com/icip-cas/ReasoningLens

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22350 2026-06-23 cs.LG cs.AI 新提交 62%

Select-to-Act: Hierarchical Reinforcement Learning via Adaptive Language Guidance

Select-to-Act: 通过自适应语言指导的分层强化学习

Hanping Zhang, Adam Koziak, Yuhong Guo

机构 * School of Computer Science, Carleton University(卡尔顿大学计算机科学学院) Canada CIFAR AI Chair, Amii(加拿大CIFAR人工智能主席,阿米(人工智能研究所))

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出分层强化学习框架HRLLI,将自然语言指令分解为可动态选择的语义指导,通过高层策略选择当前最相关的指令片段指导低层决策,显著提升样本效率和任务性能。

Comments ECML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22277 2026-06-23 eess.SY cs.AI cs.LG cs.SY 新提交 62%

Active Sensing and Deferred-Decision Trajectory Optimization for Robust Target Identification

主动感知与延迟决策轨迹优化用于鲁棒目标识别

Farbod Siahkali, Mengxue Hou, Vijay Gupta

机构 * Department of Electrical and Computer Engineering, Purdue University(普渡大学电气与计算机工程系) Department of Electrical Engineering, University of Notre Dame(诺丁汉大学电气工程系)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出主动感知延迟决策轨迹优化(AS-DDTO)框架,通过引入轨迹依赖的信息获取项,在保持可达性的同时偏向早期识别区域,实现资源约束下的目标识别。

Comments Published in IEEE Control Systems Letters (L-CSS), 2026. 6 pages

Journal ref IEEE Control Systems Letters, vol. 10, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21777 2026-06-23 cs.CL cs.AI 新提交 62%

CalVerT: Augmenting Agents with Calibrated Verifier Telemetry Improves Action and Learning in Knowledge-Intensive Tasks

CalVerT: 通过校准验证器遥测增强智能体在知识密集型任务中的行动与学习

Ashwin Vinod, Ying Ding, Elias Stengel-Eskin

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出CalVerT方法,通过向智能体状态添加校准的自信心分数和基础验证器分数,减少过度依赖参数知识或冗余检索,提升知识密集型问答的准确性和效率。

Comments Code: https://github.com/ashwinn-v/CalVerT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21173 2026-06-23 cs.LG cs.AI 新提交 62%

Inverting the Bellman Equation: From $Q$-Values to World Models

逆推贝尔曼方程:从 $Q$ 值到世界模型

Alistair Letcher, Mattie Fellows, Alexander D. Goldie, Jonathan Richens, Jakob N. Foerster, Oliver Richardson

机构 * FLAIR, University of Oxford(FLAIR,牛津大学) Google DeepMind(谷歌DeepMind) Mila, University of Montreal(Mila,蒙特利尔大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文证明基于值的智能体在丰富奖励函数上训练时隐式编码世界模型,提出 $P$-learning 从 $Q$ 值提取模型,并给出编码真实转移核的充分条件,实验验证了隐式模型的准确性和泛化能力。

Comments 48 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21144 2026-06-23 cs.CL cs.AI 新提交 62%

AdaMem: Learning What to Remember for Personalized Long-Horizon LLM Agents

AdaMem: 学习为个性化长时程LLM代理记住什么

Xingyu Chen, Rui Wang, Zhaopeng Tu, Liefeng Bo

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL

AI总结 针对长时程LLM代理中记忆膨胀导致QA准确率下降的问题,提出AdaMem方法,通过角色特定的记忆策略和基于反馈的轻量级自反思步骤,学习为每个用户记住重要信息,在减少9%记忆量的同时提升QA准确率最高9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20650 2026-06-23 cs.CL cs.AI cs.SD eess.AS 新提交 62%

EmoInstruct-TTS: Dual-Path Instruction-Guided Emotional Speech Synthesis

EmoInstruct-TTS:双路径指令引导的情感语音合成

Minghui Wu, Ganjun Liu, Zikun Fang, Ting Meng, Hongchuan Wu, Bingao Xu, Yonglong Cai, Jiasheng Chen, Jun Du

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(科大讯飞研究院) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 提出EmoInstruct-TTS双路径框架,通过情感嵌入和指令条件情感流模型实现细粒度情感控制,提升语音情感可控性和自然度。

Comments 5 pages, 3 figures, 4 tables. Submitted to Interspeech 2026. Audio demos: https://huanyu-lab.github.io/EMOINSTRUCT-TTS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22536 2026-06-23 cs.LG cs.AI cs.SY eess.SY math.OC 新提交 62%

Generative Robust Optimisation

生成式鲁棒优化

Yuhui Yin, Vassilis M. Charitopoulos

机构 * Department of Chemical Engineering, Sargent Centre for Process Systems Engineering, UCL (University College London)(伦敦大学学院化学工程系,萨金特过程系统工程中心)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出生成式鲁棒优化(GRO)框架,用深度生成模型定义不确定性集,通过五点评分标准评估,结合Wasserstein对抗自编码器实现,在规划问题中验证其表达力与可解性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04815 2026-06-23 cs.LG cs.AI 版本更新 62%

Learning While Acting: A Skill-Enhanced Test-Time Co-Evolution Framework for Online Lifelong Learning Agents

边行动边学习:面向在线终身学习智能体的技能增强测试时协同进化框架

Bo Mao, Jie Zhou, Yutao Yang, Xin Li, Xian Wei, Qin Chen, Xingjiao Wu, Liang He

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室) Software Engineering Institute, East China Normal University(东华大学软件工程学院)

专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出LifeSkill框架,通过验证器引导的技能学习和在线技能内化,使LLM智能体在测试时持续内化反馈,提升终身学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01501 2026-06-23 cs.LG cs.AI 版本更新 62%

GAC: Stabilizing Asynchronous RL Training for LLMs via Gradient Alignment Control

GAC: 通过梯度对齐控制稳定大语言模型的异步RL训练

Haofeng Xu, Junwei Su, Yukun Tian, Lansong Diao, Zhengping Qian, Chuan Wu

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) Alibaba Group(阿里巴巴集团) Southeast University(东南大学)

专题命中 规划决策 :AI agent(abstract);分类 cs.AI、cs.LG

AI总结 针对异步策略梯度训练中梯度高余弦相似性导致的训练不稳定问题,提出梯度对齐控制(GAC)方法,通过梯度投影调节陈旧对齐方向,恢复稳定训练并匹配同步基线。

详情

展开后加载摘要…

URL PDF HTML 收藏