Evolving LLMs' Self-Refinement Capability via Synergistic Training-Inference Optimization
Yongcheng Zeng, Xinyu Cui, Xuanfa Jin, Qirui Mi, Guoqing Liu, Zexu Sun, Mengyue Yang, Dong Li, Weiyu Ma, Ning Yang, Jian Zhao, Jianye Hao, Haifeng Zhang, Jun Wang
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
University of Science and Technology of China(中国科学技术大学)
;
Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学耿家庄人工智能学院)
;
University of Bristo, UK(英国布里斯托大学)
;
Zhongguancun Academy, China(中关村学院)
;
Huawei Noah’s Ark Lab, China(华为诺亚实验室)
;
University College London, UK(伦敦大学学院)
Electronic Circuit Principles of Large Language Models
Qiguang Chen, Libo Qin, Jinhao Liu, Dengyun Peng, Jiaqi Wang, Mengkang Hu, Zhi Chen, Wanxiang Che, Ting Liu
机构
*
Harbin Institute of Technology(哈尔滨工业大学)
;
Central South University(中南大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
The University of Hong Kong(香港大学)
;
ByteDance Seed (China)(字节跳动种子(中国))
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Alibaba Inc.(阿里巴巴公司)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
Shenzhen International Center for Industrial and Applied Mathematics(深圳国际工业与应用数学中心)
;
Shenzhen Research Institute of Big Data(深圳大数据研究院)
Market-Driven Subset Selection for Budgeted Training
Ashish Jha, Valentin Leplat, AH Phan
机构
*
Skolkovo Institute of Science and Technology(斯克洛夫诺科学与技术研究所)
;
Innopolis University(因诺波利斯大学)
专题命中
数学推理
:reasoning(abstract);分类 cs.AI、cs.LG
CommentsRetitled major revision of the same work (formerly "Market-Based Data Subset Selection -- Principled Aggregation of Multi-Criteria Example Utility"). Abstract and exposition revised; ablations added; theory clarified. Core results unchanged. Supersedes v1; please process as a replacement
VerlTool: Towards Holistic Agentic Reinforcement Learning with Tool Use
Dongfu Jiang, Yi Lu, Zhuofeng Li, Zhiheng Lyu, Ping Nie, Haozhe Wang, Alex Su, Hui Chen, Kai Zou, Chao Du, Tianyu Pang, Wenhu Chen
机构
*
University of Waterloo(滑铁卢大学)
;
Sea AI Lab(Sea AI 实验室)
;
University of Toronto(多伦多大学)
;
Shanghai University(上海大学)
;
HKUST(香港科技大学)
;
M-A-P
;
National University of Singapore(新加坡国立大学)
Chenxing Wei, Yao Shu, Mingwen Ou, Ying Tiffany He, Fei Richard Yu
机构
*
College of Computer Science and Software Engineering, Shenzhen University, China(深圳大学计算机科学与软件工程学院)
;
Tsinghua Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院)
;
Guangdong Lab of AI and Digital Economy (SZ), China(广东人工智能与数字经济实验室(深圳))
;
Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州))
;
School of Information Technology, Carleton University, Canada(卡尔顿大学信息科技学院)
QeRL: Beyond Efficiency -- Quantization-enhanced Reinforcement Learning for LLMs
Wei Huang, Yi Ge, Shuai Yang, Yicheng Xiao, Huizi Mao, Yujun Lin, Hanrong Ye, Sifei Liu, Ka Chun Cheung, Hongxu Yin, Yao Lu, Xiaojuan Qi, Song Han, Yukang Chen
Training Long-Context, Multi-Turn Software Engineering Agents with Reinforcement Learning
Alexander Golubev, Maria Trofimova, Sergei Polezhaev, Ibragim Badertdinov, Maksim Nekrashevich, Anton Shevtsov, Simon Karasik, Sergey Abramov, Andrei Andriushchenko, Filipp Fisin, Sergei Skvortsov, Boris Yangel
机构
*
Nanjing University of Science and Technology(南京理工大学)
;
C 2 \text{C}^{2} DL, Institute of Automation, Chinese Academy of Sciences(C2 DL,自动化研究所,中国科学院)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
School of Computer Science, University of Sydney(悉尼大学计算机学院)