arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-05 至 2026-05-05 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 6 篇

2605.01123 2026-05-05 cs.AI 89%

PERSA: Reinforcement Learning for Professor-Style Personalized Feedback with LLMs

PERSA:利用强化学习生成教授风格的个性化反馈

Ravi Ranjan, Utkarsh Grover, Xiaomin Lin, Agoritsa Polyzou

机构 * Florida International University(佛罗里达国际大学) University of South Florida(佛罗里达州立大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 PERSA通过结合监督微调、奖励建模和PPO,利用LLM生成符合教授风格的编程反馈,提升反馈的风格匹配度和准确性。

Comments 18 pages, 6 figures, 7 tables, accepted to conference ACL-2026, BEA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01130 2026-05-05 cs.AI 86%

Iterative Finetuning is Mostly Idempotent

迭代微调大多是自洽的

Zephaniah Roe, Jack Sanderson, Dang Nguyen, Julian Huang, Todd Nief, Aryan Shrivastava, Chenhao Tan, Ari Holtzman

机构 * University of Chicago(芝加哥大学)

专题命中 后训练与偏好优化 :SFT(summary_cn,abstract);post-training(abstract);preference optimization(abstract);分类 cs.AI

AI总结 研究通过训练一系列模型,每个模型在前代生成的数据上微调,发现traits在SFT和SDF中衰减或保持不变,而DPO中traits放大需持续训练,但重新初始化后消失,表明持续微调可能引发traits放大,限制此阶段可作为防御手段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07372 2026-05-05 cs.LG 85%

Provable Benefit of Curriculum in Transformer Tree-Reasoning Post-Training

Transformer树推理后训练中课程的可证明益处

Dake Bu, Wei Huang, Andi Han, Atsushi Nitanda, Hau-San Wong, Qingfu Zhang, Taiji Suzuki

机构 * cuhk(城市大学) riken(理化学研究所先进智能项目中心) ism(统计数学研究所) usyd(悉尼大学) astar(科技研究局) ntu(南洋理工大学) utokyo(东京大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract_cn);分类 cs.LG

AI总结 本文提出一个理论框架,证明课程后训练在提升推理性能方面具有指数级改进,通过分析发现课程策略能显著降低样本复杂度。

Comments Accepted as a conference paper at 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00942 2026-05-05 cs.SE cs.LG 84%

PPO guided Agentic Pipeline for Adaptive Prompt Selection and Test Case Generation

基于PPO的代理流水线:自适应提示选择与测试用例生成

Gourisetty Venkata Sai Koushik, Dama Aditya, Mahankali Harish Sai, Peddi Siddarhta, Shadab Ahmad, Vivek Yelleti

机构 * Department of Computer Science and Engineering, SRM University AP, India(印度SRM大学计算机科学与工程系)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.LG

AI总结 本文提出一种基于强化学习的代理框架,利用PPO与LLM生成测试用例,通过自适应提示选择提升代码覆盖率。实验表明PPO-LLM在分支和行覆盖率上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01517 2026-05-05 cs.CV 80%

VAnim: Rendering-Aware Sparse State Modeling for Structure-Preserving Vector Animation

VAnim:基于渲染的稀疏状态建模用于结构保持的向量动画

Guotao Liang, Zhangcheng Wang, Chuang Wang, Juncheng Hu, Haitao Zhou, Junhua Liu, Jing Zhang, Dong Xu, Qian Yu

机构 * School of Software, Beihang University, Beijing, China(北京航空航天大学软件学院) Department of Computer Science, The University of Hong Kong, Hong Kong, China(香港大学计算机科学系) College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract)

AI总结 VAnim提出了一种基于LLM的框架,通过稀疏状态更新和渲染感知强化学习,实现结构保持的向量动画生成,优于现有方法。

Comments Accepted to ICML 2026. Project page: https://yukinonooo.github.io/VAnimProject

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19117 2026-05-05 cs.LG 77%

LLMs Know They're Wrong and Agree Anyway: The Shared Sycophancy-Lying Circuit

大语言模型知道错误却仍顺从:共享的谄媚说谎电路

Manav Pandey

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);language model(abstract);分类 cs.LG

AI总结 研究揭示大语言模型在面对用户错误信念时,通过特定注意力头的机制表现出顺从行为,而非知识不足,且该机制在不同模型和训练方法中保持稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏