The Landscape of Agentic Reinforcement Learning for LLMs: A Survey
代理强化学习用于大语言模型的景观:综述
Guibin Zhang, Hejia Geng, Xiaohang Yu, Zhenfei Yin, Zaibin Zhang, Zelin Tan, Heng Zhou, Zhongzhi Li, Xiangyuan Xue, Yijiang Li, Yifan Zhou, Yang Chen, Chen Zhang, Yutao Fan, Zihu Wang, Songtao Huang, Francisco Piedrahita-Velez, Yue Liao, Hongru Wang, Mengyue Yang, Heng Ji, Jun Wang, Shuicheng Yan, Philip Torr, Lei Bai
机构
*
University of Oxford(牛津大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
National University of Singapore(新加坡国立大学)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Brown University(布朗大学)
;
University College London(伦敦大学学院)
;
University of Science and Technology of China(中国科学技术大学)
;
Imperial College London(伦敦帝国学院)
;
Dalian University of Technology(大连理工大学)
;
Chinese Academy of Sciences(中国科学院)
;
The Chinese University of Hong Kong(香港中文大学)
;
University of Georgia(佐治亚大学)
;
University of California, San Diego(加州大学圣地亚哥分校)
;
University of California, Santa Barbara(加州大学圣塔芭芭拉分校)
;
University of Bristol(布里斯托大学)
CI-CBM: Class-Incremental Concept Bottleneck Model for Interpretable Continual Learning
CI-CBM:用于可解释持续学习的类增量概念瓶颈模型
Amirhosein Javadi, Tuomas Oikarinen, Tara Javidi, Tsui-Wei Weng
机构
*
Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系)
;
Department of Computer Science and Engineering, University of California San Diego(加州大学圣地亚哥分校计算机科学与工程系)
;
Halıcıoğlu Data Science Institute, University of California San Diego(加州大学圣地亚哥分校Halıcıoğlu数据科学研究所)
deCIFer: Crystal Structure Prediction from Powder Diffraction Data using Autoregressive Language Models
deCIFer:基于粉末衍射数据的晶体结构预测方法
Frederik Lizak Johansen, Ulrik Friis-Jensen, Erik Bjørnager Dam, Kirsten Marie Ørnsbjerg Jensen, Rocío Mercado, Raghavendra Selvan
机构
*
Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系)
;
Department of Chemistry & Nano-Science Center, University of Copenhagen(哥本哈根大学化学系与纳米科学中心)
;
Department of Computer Science & Engineering, Chalmers University of Technology(查尔姆斯理工大学计算机科学与工程系)
CommentsTMLR 2025 (J2C-Certification: Presented @ ICLR 2026). A preliminary version appeared at the Differentiable Almost Everything Workshop at ICML 2024. Code available at https://github.com/isefos/gt_robustness
LoDAdaC: a unified local training-based decentralized framework with adaptive gradients and compressed communication
LoDAdaC: 一种基于局部训练的统一去中心化框架,具有自适应梯度和压缩通信
Wei Liu, Anweshit Panda, Ujwal Pandey, Haven Cook, George M. Slota, Naigang Wang, Jie Chen, Yangyang Xu
机构
*
Rensselaer Polytechnic Institute(伦斯勒理工学院)
;
IBM T. J. Watson Research Center(IBM T. J. Watson 研究中心)
;
MIT-IBM Watson AI Lab, IBM Research(MIT-IBM Watson AI 实验室,IBM 研究院)
D-Garment: Physically Grounded Latent Diffusion for Dynamic Garment Deformations
D-Garment:基于物理的潜在扩散模型用于动态服装变形
Antoine Dumoulin, Adnane Boukhayma, Laurence Boissieux, Bharath Bhushan Damodaran, Pierre Hellier, Stefanie Wuhrer
机构
*
Inria Centre at the University Grenoble Alpes(格勒诺布尔阿尔卑斯大学Inria研究中心)
;
Inria, University of Rennes, CNRS, IRISA-UMR 6074(雷恩大学Inria、CNRS、IRISA-UMR 6074)
;
InterDigital Inc.(InterDigital公司)
机构
*
Technical University of Darmstadt(达姆施塔特工业大学)
;
Ubiquitous Knowledge Processing Lab (UKP Lab)(泛在知识处理实验室 (UKP Lab))
;
National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心 ATHENE)
;
Zuse School ELIZA, Technical University of Darmstadt(Zuse School ELIZA, 达姆施塔特工业大学)
机构
*
Carnegie Mellon University(卡内基梅隆大学)
;
National Taiwan University(国立台湾大学)
;
Toyota Technological Institute at Chicago(丰田芝加哥技术研究所)
;
Hebrew University of Jerusalem(耶路撒冷希伯来大学)
;
ENS - PSL, EHESS, CNRS(巴黎高等师范学院 - 巴黎文理研究大学、社会科学高等研究院、法国国家科学研究中心)
AI总结
本文综述了语音语言模型的发展,分析了其架构、训练和评估方法,探讨了关键挑战与未来方向。
CommentsPublished in Transactions on Machine Learning Research
机构
*
Ruhr University Bochum(波鸿鲁尔大学)
;
Eindhoven University of Technology(埃因霍温理工大学)
;
Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
;
University of Liverpool(利物浦大学)
机构
*
Purdue University(普渡大学)
;
University of Maryland(马里兰大学)
;
Indian Institute of Technology Bombay(印度理工学院孟买分校)
;
University of Central Florida(中佛罗里达大学)
Comments47 pages, 14 figures, 23 tables. Substantially revised from v1: added immigration domain extension (14,183 cells), adversarial narrative pilot (2,054 cells), reasoning-trace analysis, scaffolding decomposition. Total: 84,245 valid responses across 13 experiments. Under review at TMLR. Code and data will be released upon publication