arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-30 至 2026-03-30 共收录 2 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 2 篇

2512.08777 2026-03-30 cs.CL cs.AI 86%

Fluent Alignment with Disfluent Judges: Post-training for Lower-resource Languages

流畅对齐与不流畅评判:低资源语言的后训练方法

David Samuel, Lilja Øvrelid, Erik Velldal, Andrey Kutuzov

机构 * Language Technology Group, University of Oslo(奥斯陆大学语言技术组)

专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种低资源语言的后训练方法,通过不流畅评判模型保持语言模型的流畅性,通过挪威语案例研究验证了基于策略的训练方法在无需额外数据时的有效性。

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25861 2026-03-30 cs.LG cs.AI cs.CR 62%

Why Safety Probes Catch Liars But Miss Fanatics

为何安全探针会识破骗子却无法识别狂热分子

Kristiyan Haralambiev

机构 * Independent Research(独立研究)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文研究安全探针在检测欺骗性对齐AI系统时的局限性,发现当模型相信有害行为是正当的而非隐藏时,探针无法检测到这种一致性偏差,揭示了探针逃避现象的形成机制。

Comments 18 pages, 4 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏