arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

2026-07-22 至 2026-07-22 共收录 3
2607.10481 2026-07-22 cs.LG cs.AI cs.CL 版本更新

ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples

ARMOR:使用离策略锚样本稳定在线大语言模型强化学习

Kexin Huang, Junkang Wu, Jinda Lu, Shuo Yang, Chiyu Ma, Jiancan Wu, Xiang Wang, Xiangnan He, Guoyin Wang, Jingren Zhou

机构 * University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Dartmouth College(达特茅斯学院)

AI总结 研究大语言模型强化学习训练不稳定问题,提出ARMOR框架,通过锚展开利用离策略数据保留解决方案模式,混合优化重新制定策略目标实现可控探索,经实验验证可有效减轻验证崩溃,提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04733 2026-07-22 cs.CL cs.LG 版本更新

LP-SFT: Local-Preserving Supervised Fine-Tuning via Multimodal Entropy Structure

LP-SFT:通过多模态熵结构进行局部保持监督微调

Yueyang Wang, Baolong Bi, Shuo Lu, Jingyuan Zhang, Jiajun Shi

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) College of Computing, Georgia Institute of Technology(佐治亚理工学院计算学院)

AI总结 研究监督微调中存在的问题,利用香农和雷尼熵分析揭示预训练模型的多模态熵结构,提出LP-SFT目标,在多领域实验中提升性能,平衡准确率和k准确率。

Comments 20 pages, 3 figures. Code is available at https://github.com/Wakaka161/LP-SFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14469 2026-07-22 cs.CL 版本更新

Measuring and Mitigating Post-hoc Rationalization in Reverse Chain-of-Thought Generation

反向思维链生成中的事后合理化测量与缓解

Guangyue Peng, Zongchao Chen, Wen Luo, Yuntao Wen, Wei Li, Ruixiang Feng, Ran Le, Chen Yang, Zhenwei An, Yang Song, Tao Zhang, Houfeng Wang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,计算机科学学院,北京大学) University of Electronic Science and Technology of China(电子科技大学) Nanbeige Lab, BOSS Zhipin(纳贝格实验室,BOSS智联)

AI总结 针对反向思维链生成中的事后合理化问题,提出结构骨架引导推理方法,通过解耦答案依赖而非抑制答案来缓解锚定效应,在开放推理基准上提升10%性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏