CommentsPlease cite the definitive, peer-reviewed version of this article published in the Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, edited by Christos Christodoulopoulos et al., Association for Computational Linguistics, pp. 10007-10030, 2025. DOI: https://doi.org/10.18653/v1/2025.emnlp-main.507
Journal refProceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, Association for Computational Linguistics, pp. 10007-10030, 2025
When Lower Privileges Suffice: Investigating Over-Privileged Tool Selection in LLM Agents
当较低权限足够时:探究LLM代理中的过度权限工具选择
Kaiyue Yang, Yuyan Bu, Jingwei Yi, Yuchi Wang, Biyu Zhou, Juntao Dai, Songlin Hu, Yaodong Yang
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
;
The Chinese University of Hong Kong(香港中文大学)
;
Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)
;
School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
RolloutPipe: Overlapping Pipelined Rollout and Training in Disaggregated On-Policy LLM Reinforcement Learning
RolloutPipe: 分离式在线策略LLM强化学习中的流水线化Rollout与训练重叠
Rongjian Chen, Jianmin Hu, Kejiang Ye, Minxian Xu
机构
*
Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Southern University of Science and Technology(南方科技大学)
专题命中
后训练与偏好优化
:LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)
Learning at the Right Pace: Adaptive Data Scheduling Improves LLM Reinforcement Learning
以合适的速度学习:自适应数据调度改进大语言模型强化学习
Zicheng Xu, Ruixuan Zhang, Yu-Neng Chuang, Xiuyi Lou, Hoang Anh Duy Le, Oren Gal, Alexander S. Szalay, Zhaozhuo Xu, Guanchu Wang, Vladimir Braverman
机构
*
Johns Hopkins University(约翰霍普金斯大学)
;
Rice University(莱斯大学)
;
University of Haifa(海法大学)
;
Workato
;
University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)
专题命中
后训练与偏好优化
:LLM(title,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)
BayLing-Duplex: Native Full-Duplex Speech Dialogue with a Single Autoregressive LLM
BayLing-Duplex: 单一自回归LLM的原生全双工语音对话
Qingkai Fang, Shoutao Guo, Yang Feng
机构
*
Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences (ICT/CAS)(中国科学院计算技术研究所智能信息处理重点实验室)
;
Key Laboratory of AI Safety, Chinese Academy of Sciences(中国科学院人工智能安全重点实验室)
;
University of Chinese Academy of Sciences(中国科学院大学)
Distilled Reinforcement Learning for LLM Post-training
用于大语言模型训练后处理的蒸馏强化学习
Chen Wang, Zhaochun Li, Jionghao Bai, Yining Zhang, Hexuan Deng, Ge Lan, Yue Wang
机构
*
College of Elite Engineers, Nankai University(南开大学精英工程师学院)
;
Zhongguancun Academy(中关村学院)
;
Beijing Institute of Technology(北京理工大学)
;
Zhejiang University(浙江大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
College of Software, Nankai University(南开大学软件学院)
专题命中
后训练与偏好优化
:LLM(title,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)
机构
*
University of Chicago(芝加哥大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Stanford University(斯坦福大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Meituan(美团)