Hybrid Alignment Training for Large Language Models
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL
Comments accepted by ACL (Findings) 2024
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL
Comments accepted by ACL (Findings) 2024
专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.CL
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG
Comments 22 pages, 14 figures, 5 tables
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG
专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.LG
Comments Shorter version accepted to ICML 2024
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL
Comments 19 pages
专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.AI
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL
Comments EMNLP2023 Findings
专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.CL
专题命中 偏好对齐 :safety(title,abstract);分类 cs.LG
Comments To appear in proceedings of International Conference on Machine Learning Technologies (ICMLT) 2022
专题命中 偏好对齐 :trustworthy(title,abstract);分类 cs.AI
多玩家纳什偏好优化
机构 * Stanford University(斯坦福大学) ; Georgia Institute of Technology(佐治亚理工学院) ; The University of Tokyo(东京大学) ; RIKEN AIP(日本理化学研究所智能系统研究中心) ; Pennsylvania State University(宾夕法尼亚州立大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Harvard University(哈佛大学) ; UNC–Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出多玩家纳什偏好优化框架,扩展了传统的两玩家纳什对齐方法,通过引入多玩家博弈机制,提升对复杂非传递性人类偏好的对齐能力,并在多个基准测试中表现更优。
Journal ref ICLR 2026 Oral
MARS:面向奖励建模的边界与语义感知数据增强
机构 * University of Arizona(亚利桑那大学) ; Northeastern University London(伦敦东北大学)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出MARS框架,通过优先增强低边界偏好对并利用语义距离细化,提升奖励模型质量和对齐性能。
困在“A”上:诊断与修复0.6B语言模型的KDA线性化注意力中的接口损伤
专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.LG
AI总结 本研究将Qwen3-0.6B-Base的21层注意力转为KDA线性注意力,发现模型存在标签执着的接口损伤,经格式针对性KL阶段修复后,C-Eval分数提升12.48分,相关成果已开源。
Comments Code and models: https://github.com/Sisyphbaous-DT-Project/open-qingyi ; https://huggingface.co/shiershuihesaixiliya/qingyi-kda-0.6b . A version of this preprint is archived on Zenodo (DOI: 10.5281/zenodo.21722356)
TLA-Prover: 通过偏好优化低秩适配实现可验证的 TLA+ 规范合成
机构 * Department of Computer Science, Loyola University Chicago(洛约拉芝加哥大学计算机科学系)
专题命中 偏好对齐 :DPO(abstract,abstract_cn);safety(abstract);分类 cs.AI、cs.LG
AI总结 提出 TLA-Prover 模型,结合监督微调和基于修复的组相对策略优化,在 TLC 模型检查器上实现 TLA+ 规范合成,Gold/Diamond 级别通过率达 30%,约为未调优基线的 3.5 倍。
Comments 12 pages, 5 tables, 3 figures. In Proceedings at the 21st International Conference on Software Technologies (ICSOFT 2026)
Journal ref ICSOFT 2026, pp. 627-636, 2026
STAIF:一种用于复杂指令跟随的逐阶段优化方法
机构 * University of Science and Technology of China(中国科学技术大学) ; iFLYTEK Research Group(科大讯飞研究院)
专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型遵循复杂指令的挑战,提出STAIF逐阶段优化框架,先通过偏好优化提高软约束敏感度,再用可验证奖励强化学习确保硬约束遵守,构建相关数据集,验证了该方法的设计并展现出领先性能和泛化能力。
Comments 16 pages, 6 figures
数字万神殿:使用大语言模型智能体模拟和审计联盟形成
机构 * Ghent University(根特大学)
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对政治联盟形成谈判,提出结合多种技术的多智能体框架,在弗拉芒选举中实施,通过引入相关拓扑、分数和检验使其可解释,模拟产生稳定结果,能可靠预测现实,提供了探索政党兼容性等的测试平台。
Comments 11 pages, 2 figures, 5 tables, To be published in the AIDEM Workshop proceedings of the ECML PKDD 2026 Conference
深度偏差:对大型视觉语言模型中社会偏差的自适应深度探测
专题命中 偏好对齐 :DPO(abstract,abstract_cn);safety(abstract);分类 cs.AI、cs.CY
AI总结 研究大型视觉语言模型中社会偏差问题,提出DeepBias自适应框架,通过“生成-演化-探测”循环及智能体深度探测偏差,构建DeepBiasBench基准,实验证明其有效性,为LVLM安全评估建立进化范式。
大语言模型中言语 tic 的兴起:前沿模型的系统分析
机构 * Lead Researcher(研究员) ; Research Assistant(研究助理) ; Academic Advisor(学术顾问) ; Research Consultant(研究顾问)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文系统分析了八个前沿大语言模型中言语 tic 的现象,通过定制评估框架评估10,000个提示,发现 Gemini 3.1 Pro tic 值最高,DeepSeek V3.2 最低,并揭示了 tic 在多轮对话中的累积效应及跨语言差异。
Comments 17 figures, 8 tables
通过在线自我博弈强化学习追踪移动目标以实现更安全的语言模型
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.LG
AI总结 研究传统大语言模型安全对齐问题,引入Self-RedTeam算法,通过在线自我博弈多智能体强化学习持续共同进化攻防策略,有理论安全保障,实证效果好,推动从被动修补到主动协同进化转变。
Comments ICML 2026 Poster
示播列效应:审计大型语言模型的跨语言分布偏斜
机构 * Kellogg Institute for International Studies, University of Notre Dame(凯洛格国际研究学院,圣约翰大学) ; Marmara University(马尔马拉大学)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.CY
AI总结 本研究通过多智能体地缘政治兵棋推演,发现前沿LLM在跨语言条件下存在行为偏斜,且该效应依赖于模型架构与训练机制,而非西方起源模型的普遍属性。
Comments 25 pages, 2 figures, 6 tables, Research Article
VideoGPA: 通过几何先验知识蒸馏实现3D一致的视频生成
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.AI、cs.LG
AI总结 VideoGPA通过几何先验知识蒸馏提升视频生成的3D一致性,利用数据高效的自监督框架引导视频扩散模型,显著增强时间稳定性、几何合理性与运动一致性。
Comments 8 pages, 5 figures, ICML 2026
基于不确定性感知效用锚点的自适应偏好优化
机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) ; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(人工智能研究院,合肥综合性国家科学中心) ; State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)
专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.LG
AI总结 提出一种通用离线偏好优化框架UAPO,通过引入锚点函数估计偏好数据标注的不确定性,支持非配对数据训练,提升数据利用效率和训练鲁棒性。
Comments Accepted by EMNLP 2025 Findings
面向目标的监督学习用于大语言模型微调
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Intuit AI Research(Intuit人工智能研究)
专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出目标条件监督学习(GCSL)框架,通过将反馈信号作为显式目标,利用监督学习生成高质量响应,改进了传统监督微调和直接偏好优化的局限性。
从分歧中学习:临床医生的覆盖作为价值医疗中临床AI的隐含偏好信号
机构 * Altitude
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种框架,将临床医生对AI建议的覆盖视为隐含偏好数据,通过引入五类覆盖分类法和双学习架构,解决抑制偏差问题,以提升价值医疗中AI的决策能力。
Comments 22 pages, 2 tables, 1 figure
LLM采样中的种子劫持与量子随机数防御
机构 * School of Electronic, Electrical and Physics, Fujian University of Technology(福建工程学院电子、电气与物理系) ; School of Humanities, Fujian University of Technology(福建工程学院人文学院) ; Department of Investigation, Fujian Police College(福建警察学院调查系) ; Institute of Applied Physics and Materials Engineering, University of Macau(澳门大学应用物理与材料工程研究院)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出SeedHijack攻击,通过操控PRNG输出实现指定token注入,提出基于量子随机数生成器的防御方案,解决LLM采样层的关键漏洞。
超越成对:你的语言模型其实是在优化一个偏好图
机构 * Amazon(亚马逊)
专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出GraphDPO,通过构建偏好图结构优化语言模型,解决传统成对优化在处理多轮次数据时的局限性,提升模型在推理和编程任务中的性能。