When Denser Credit Is Not Enough: Evidence-Calibrated Policy Optimization for Long-Horizon LLM Agent Training
当更密集的信用不足时:面向长周期LLM智能体训练的基于证据校准的策略优化
Yuanfan Li, Qi Zhou, Wenjing Duan, Lu Chen
机构
*
X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(X-LANCE实验室,计算机科学学院,上海交通大学,上海,中国)
;
Faculty of Electronic and Information Engineering, Xi’an Jiaotong University(电子与信息工程学院,西安交通大学)
机构
*
Technische Universität Berlin(柏林技术大学)
;
German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)
;
University of Duisburg-Essen(杜伊斯堡- Essen大学)
;
LMU Munich(慕尼黑大学)
;
Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
;
Saarland Informatics Campus(萨尔兰州信息学校区)
;
BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究院)
;
Centre for European Research in Trusted AI (CERTAIN)(可信人工智能欧洲研究中心)
专题命中
后训练与偏好优化
:preference optimization(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
机构
*
Graduate School of Artificial Intelligence and Science, Rikkyo University(立命馆大学人工智能与科学研究生院)
;
AI Technical Sector, Mamezo Co., Ltd.(Mamezo公司人工智能技术部门)
;
AI Consulting Division, Mamezo Co., Ltd.(Mamezo公司人工智能咨询部门)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI
Rollout-Level Advantage-Prioritized Experience Replay for GRPO
基于轨迹级别优势优先经验回放的GRPO
Gyeongtae Yoo, Sanghyeok Park, Soohyuk Jang, Ik-hwan Kim, Sungroh Yoon
机构
*
Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电子与计算机工程系)
;
Interdisciplinary Program in AI, Seoul National University(首尔国立大学人工智能跨学科项目)
;
AIIS, ASRI, INMC, and ISRC, Seoul National University(首尔国立大学人工智能研究所、人工智能研究机构、智能网络与计算中心及人工智能科学研究中心)
Rui Li, Junfeng Liu, Xiangwen Kong, Linhai Xu, Zhifang Sui
机构
*
State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,计算机学院,北京大学)
;
StepFun
;
Xi’an Jiaotong University(西安交通大学)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);分类 cs.CL
Reward-Decomposed Reinforcement Learning for Immersive Video Role-Playing
面向沉浸式视频角色扮演的奖励分解强化学习
Miao Wang, Yuling Shi, Yijiang Li, Yeheng Chen, Xiaodong Gu, Bin Li, Bo Gao, Jun Wang, Zengxin Han, Jingtong Wu, Yaduan Ruan
机构
*
Nanjing University(南京大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
University of California, San Diego(加州大学圣地亚哥分校)
;
Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)
;
School of Information Engineering, Beijing Institute of Graphic Communication(北京印刷学院信息工程学院)
;
Ant International, Ant Group(蚂蚁集团国际部)
;
Independent Researcher(独立研究者)
Dense Contexts Are Hard Contexts: Lexical Density Limits Effective Context in LLMs
密集上下文是困难上下文:词汇密度限制LLM的有效上下文
Giovanni Dettori, Matteo Boffa, Danilo Giordano, Idilio Drago, Marco Mellia
机构
*
Department of Computer Science Politecnico di Torino(计算机科学系politecnico di torino大学)
;
Department of Computer Science University of Turin(计算机科学系都灵大学)