arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-06 至 2026-04-06 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 9 篇

2604.03098 2026-04-06 cs.LG cs.AI cs.CL 88%

Co-Evolution of Policy and Internal Reward for Language Agents

语言代理中策略与内部奖励的共演化

Xinyu Wang, Hanwei Wu, Jingwei Song, Shuyuan Zhang, Jiayi Zhang, Fanqi Kong, Tung Sum Thomas Kwok, Xiao-Wen Chang, Yuyu Luo, Chenglin Wu, Bang Liu

机构 * McGill University(麦吉尔大学) McMaster University(麦克马斯特大学) The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Peking University(北京大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) DeepWisdom(深度智慧) Université de Montréal(蒙特利尔大学) Mila(米拉研究所)

专题命中 后训练与偏好优化 :language agent(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出Self-Guide方法,通过自动生成内部奖励实现推理和训练时的协同优化,提升语言代理性能。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03179 2026-04-06 cs.LG cs.AI cs.CV 86%

Understanding the Role of Hallucination in Reinforcement Post-Training of Multimodal Reasoning Models

理解强化学习在多模态推理模型后训练中幻觉的作用

Gengwei Zhang, Jie Peng, Zhen Tan, Mufan Qiu, Hossein Nourkhiz Mahjoub, Vaishnav Tadiparthi, Kwonjoon Lee, Yanyong Zhang, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Science and Technology of China(中国科学技术大学) Arizona State University(亚利桑那州立大学) Honda Research Institute, USA(本田美国研究所)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Hallucination-as-Cue框架,通过引入模态特异性扰动分析强化学习对多模态推理模型的影响,揭示幻觉在训练中的关键作用,挑战现有假设。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02372 2026-04-06 cs.CR cs.LG 85%

Backdoor Attacks on Decentralised Post-Training

在去中心化后训练中的后门攻击

Oğuzhan Ersoy, Nikolay Blagoev, Jona te Lintelo, Stefanos Koffas, Marina Krček, Stjepan Picek

机构 * University of Neuchâtel(纳沙泰尔大学) Radboud University(拉德堡德大学) Delft University of Technology(代尔夫特理工大学) SecureML University of Zagreb(萨格勒布大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出首个针对流水线并行的后门攻击,通过控制中间阶段实现模型对齐偏差,实验显示触发词可使对齐率从80%降至6%,且在安全对齐训练下仍成功60%。

Comments Accepted to ICLR 2026 Workshop 'Principled Design for Trustworthy AI - Interpretability, Robustness, and Safety across Modalities'

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02507 2026-04-06 stat.ML cs.LG 84%

Reinforcement Learning from Human Feedback: A Statistical Perspective

基于人类反馈的强化学习:统计学视角

Pangpang Liu, Chengchun Shi, Will Wei Sun

机构 * Department of Biostatistics, Yale University(耶鲁大学生物统计学系) Department of Statistics, London School of Economics and Political Science(伦敦政治经济学院统计学系) Mitch Daniels School of Business, Purdue University(普渡大学米奇·丹尼尔斯商学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本文从统计学角度探讨了基于人类反馈的强化学习,分析了其在大语言模型对齐中的核心方法与挑战,包括奖励模型学习和策略优化,并讨论了相关统计模型和最新研究进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02766 2026-04-06 cs.LG cs.AI 82%

Random Is Hard to Beat: Active Selection in online DPO with Modern LLMs

随机难以超越:在线DPO中的主动选择

Giyeong Oh, Junghyun Lee, Jaehyun Park, Youngjae Yu, Wonho Bae, Junhyug Noh

机构 * Seoul National University(首尔大学) Ewha Womans University(梨花女子大学) KAIST(韩国科学技术院) UBC(不列颠哥伦比亚大学)

专题命中 后训练与偏好优化 :LLM(abstract);pretraining(abstract);post-training(abstract);preference optimization(abstract)

AI总结 本文研究了在线DPO中主动选择策略的有效性,发现即使在强先验基础上,主动选择的计算开销难以抵消简单随机采样带来的多样性优势。

Comments first commit

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02986 2026-04-06 cs.LG cs.AI cs.CL 82%

Mitigating Reward Hacking in RLHF via Advantage Sign Robustness

通过优势符号鲁棒性缓解RLHF中的奖励黑客

Shinnosuke Ono, Johannes Ackermann, Soichiro Nishimori, Takashi Ishida, Masashi Sugiyama

机构 * The University of Tokyo(东京大学) RIKEN AIP(日本理化学研究所革新智能研究中心)

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SignCert-PO方法,通过在策略优化阶段降低非鲁棒完成的权重,缓解RLHF中的奖励黑客问题,在摘要和AlpacaFarm基准测试中表现优于基线。

Comments 27 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02652 2026-04-06 cs.LG cs.AI 79%

Generalization Limits of Reinforcement Learning Alignment

强化学习对齐的泛化极限

Haruhi Shida, Koo Imai, Keigo Kansa

机构 * Aladdin Security Inc(阿拉丁安全公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了强化学习对齐技术的泛化能力限制,提出复合越狱方法,通过结合多种攻击技术提高攻击成功率,验证了安全训练无法广泛泛化 hypothesis。

Comments 7 pages, 2 figures, 2 tables, accepted at JSAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02686 2026-04-06 cs.LG cs.AI 62%

Beyond Semantic Manipulation: Token-Space Attacks on Reward Models

超越语义操控:奖励模型中的标记空间攻击

Yuheng Zhang, Mingyue Huo, Minghao Zhu, Mengxue Zhang, Nan Jiang

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) Independent Researcher(独立研究员) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Token Mapping Perturbation Attack(TOMPA)框架,通过在标记空间中进行对抗优化,发现非语言标记模式以提升奖励模型性能,揭示了当前RLHF流程的关键漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02869 2026-04-06 cs.AI 57%

Multi-Turn Reinforcement Learning for Tool-Calling Agents with Iterative Reward Calibration

多轮强化学习用于工具调用代理的迭代奖励校准

Wachiravit Modecrua, Krittanon Kaewtawee, Krittin Pachtrachai, Touchapon Kraisingkorn

机构 * Amity Research and Application Center (ARAC)(Amity研究与应用中心(ARAC))

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.AI

AI总结 本文提出MT-GRPO与GTPO结合的方法,通过迭代奖励校准提升工具调用代理性能,在真实客服任务中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏