Best-of-Venom: Attacking RLHF by Injecting Poisoned Preference Data
专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Work in progress
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 偏好对齐 :safety(title,abstract);分类 cs.CL、cs.CY、cs.LG
Comments 9 pages, 4 figures. Accepted to Findings of the Association for Computational Linguistics: ACL 2024
专题命中 偏好对齐 :RLHF(title);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 偏好对齐 :alignment(title);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 偏好对齐 :alignment(title);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Website: https://sites.google.com/view/llm-vas
专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 偏好对齐 :safety(title,abstract);分类 cs.CL、cs.AI、cs.CY
Comments Preprint. Under review
专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Code available here: https://github.com/facebookresearch/rlfh-gen-div
专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments 14 pages, 7 figures
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG
关于通过成对比较进行离线RLHF的指数收敛性
专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.AI、cs.LG;alignment(comments)
AI总结 本文提出了一种在离线RLHF中通过成对比较实现指数收敛的算法RL-LOW,并推导了实例依赖的下界。
Comments Accepted as an oral presentation at AAAI 2026 (AI Alignment Track)
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG
Comments Accepted for the Pluralistic Alignment workshop at NeurIPS 2024
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.LG
Comments 26+19 pages; v2 typos fixed, refs added, figure scale / colors fixed; v3 correct very non-standard TruthfulQA formatting and metric, alignment implications slightly improved
TrustRoboReward:面向多范式机器人奖励模型的偏好有序保序分数编辑方法
机构 * Peking University(北京大学) ; Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) ; University of Science and Technology of China(中国科学技术大学) ; Southeast University(东南大学) ; Southern University of Science and Technology(南方科技大学) ; Beijing University of Aeronautics and Astronautics(北京航空航天大学) ; Beijing Language and Culture University(北京语言大学) ; Sichuan University(四川大学) ; Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);分类 cs.AI
AI总结 针对现有机器人奖励模型的跨范式偏好与分数不一致问题,本文提出 TrustRoboReward 框架,通过 POISE 方法解决反转冲突,训练的 Qwen3-VL-4B 性能接近 GPT-5-mini,优于 RoboReward 基线。
GRASP:用组相对策略优化增强语言模型匿名化器
机构 * UC Santa Barbara(加州大学圣巴巴拉分校) ; UC Los Angeles(加州大学洛杉矶分校)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL
AI总结 该研究提出GRASP方法,用组相对策略优化增强设备端小型语言模型匿名化器,在隐私-效用权衡、对抗匿名化防御及运行成本上均优于DPO蒸馏基线。
面向胸部X射线报告生成的正例-无标签偏好优化
机构 * Columbia University(哥伦比亚大学) ; Stanford University(斯坦福大学) ; Emory University(埃默里大学)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.LG
AI总结 该研究针对放射报告生成VLM的遗漏噪声问题,提出PU-DPO框架,将未提及项视为无标签,通过对比对优化,提升病理检测率与隐藏正例恢复能力,增强对遗漏噪声的鲁棒性。
TeaRAG:一种令牌高效的智能检索增强生成框架
机构 * University of Science and Technology of China(中国科学技术大学) ; City University of Hong Kong(香港城市大学) ; Xiaohongshu Inc.(小红书公司)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI
AI总结 研究提出TeaRAG框架解决智能RAG令牌开销大问题,通过基于简洁三元组的图检索压缩检索内容,用IP-DPO减少推理步骤,在多个数据集上实验,提高了平均精确匹配,减少了输出令牌。
Comments 34 pages
SciForma:科学图表的结构忠实生成
机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所) ; State Key Lab of CAD & CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.LG
AI总结 研究针对科学图表结构保真度问题,提出SciForma框架,分解图表质量为三个结构轴,用M-DPO优化,策划训练和评估数据,实现迭代编辑,使SciForma-9B超越开源基线和GPT-Image-1.5,提升科学图表生成的结构保真度。
Comments 30 pages, 21 figures
大语言模型强化学习技术的技术综述
机构 * University of Georgia(佐治亚大学) ; Purdue University(普渡大学)
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);safety(abstract)
AI总结 综述强化学习与语言模型整合,介绍如近端策略优化等算法,分析其在各领域应用,对失败模式算法分析,给出分类法,评估趋势并探讨挑战与新兴方向,为研究提供路线图。
Comments Accepted to ACM Transactions on Intelligent Systems and Technology, June 2026
FairJudge: 一种自适应、去偏且一致的LLM作为评判者
机构 * School of Software Technology, Zhejiang University(浙江大学软件学院)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL
AI总结 针对LLM评判系统在适应性、偏见和一致性上的局限,提出FairJudge,通过可学习正则化策略和课程式SFT-DPO-GRPO训练范式,实现自适应、去偏和一致评估。
PASTA: 一种用于大语言模型知识更新的释义与自训练方法
机构 * Waseda University(早稻田大学)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL
AI总结 提出PASTA框架,通过数据增强、问答生成和自学习DPO过程,将新闻事实知识集成到LLM中,实现知识覆盖与幻觉抑制,准确率从0.02提升至0.82。
Comments 9 pages, 3 figures
序列学习的几何:李括号预测迁移顺序
机构 * Sideplane AI
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.LG
AI总结 提出李括号对偶性分数预测序列学习中的源域顺序,通过李括号锦标赛实现O(N log N)排序,在指令微调和DPO中达到高准确率。
Comments Accepted to ICML 2026. 20 pages, including appendices
LLM后训练中应比较哪些对?
机构 * Columbia University(哥伦比亚大学)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI
AI总结 研究偏好后训练中如何选择最具信息量的比较对,提出基于采样设计的比较策展方法,通过DPO训练的理论分析给出优化准则,实验证明能提升样本效率。
做自己的老师:通过无监督奖励优化引导蛋白质语言模型
机构 * The Chinese University of Hong Kong(香港中文大学) ; MBZUAI ; Hong Kong University of Science and Technology(香港科学理工大学)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);分类 cs.LG
AI总结 提出无监督奖励优化框架,结合模型不确定性和语义一致性作为代理奖励,通过SRO和BRO算法优化PLMs,在无标签数据下实现可控蛋白质生成,性能接近有监督方法。
Comments 24 pages, 2 figures, 13 tables