Improving alignment of dialogue agents via targeted human judgements
专题命中 偏好对齐 :alignment(title);分类 cs.CL、cs.LG
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 偏好对齐 :alignment(title);分类 cs.CL、cs.LG
专题命中 偏好对齐 :alignment(title,comments);分类 cs.CL
Comments Presented at AAAI 2025, special track on AI Alignment
训练后能否将大语言模型转变为因果推理者?
机构 * Shanghai Artificial Intelligence Library(上海人工智能图书馆) ; Fudan University(复旦大学) ; Tongji University(同济大学)
专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过CauGym数据集评估了训练后方法对LLM因果推理能力的提升,发现适当训练可使小型模型在因果推理任务中超越大模型。
释放大语言模型的潜力:面向实时、企业级部署的蓝图
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 针对实时受监管场景中大语言模型的问题,提出基于模式的LLMOps架构,整合多模块并实现四项模式化贡献,优化权衡同时支持高风险领域的可审计与回滚部署。
Comments 6 pages, 1 figure. Authors' accepted version of an article published in IEEE Computer. The version of record is available at the DOI below
Journal ref Computer, vol. 59, no. 4, pp. 195-199, April 2026
迈向用于小规模语言模型智能体的稳健强化学习
机构 * University of Waterloo(滑铁卢大学) ; Khulna University of Engineering & Technology(库尔纳工程技术大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究小规模语言模型强化学习不稳定问题,识别出三种失败模式,提出容量余量假设,采用合并并重新初始化适配器技术等方法,所提系统稳定收敛,提升偏好胜率,优于指令调整基线且减少训练数据。
Comments Proceedings of the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC), Bellevue, WA, USA
冲突感知融合:通过结构化认知先验缓解大语言模型中的逻辑惯性
机构 * Xtracta & Strong AI Lab, University of Auckland(Xtracta与强人工智能实验室,奥克兰大学) ; School of Humanities, China University of Political Science and Law(人文学院,中国政法大学) ; Strong AI Lab, University of Auckland(强人工智能实验室,奥克兰大学)
专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 针对大语言模型在规则系统结构扰动下表现脆弱的问题,提出冲突感知融合训练流程,通过验证-演绎结构先验和符号推理奖励,在多个压力测试中实现鲁棒性饱和。
主权企业语言模型的本体增强蒸馏与上下文审查:机制验证与负面结果的组合方法研究
机构 * AgenticOS(智能操作系统)
专题命中 偏好对齐 :DPO(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对受数据驻留规则约束的金融机构需求,结合本体增强蒸馏机制验证与上下文审查方法,对Qwen3.6 - 27B学生模型进行训练及测试,结果不支持模型在多方面的优势,为企业语言模型应用提供参考。
Comments 15 pages, 2 figures. Combined proof-of-mechanism and negative-results method article consolidating ontology-amplified distillation with contextuality-audit routing for enterprise agents
梯度正则化减轻基于人类反馈和可验证奖励的强化学习中的奖励作弊
机构 * The University of Tokyo(东京大学) ; RIKEN AIP(理化学研究所AIP) ; Mila(蒙特利尔大学Mila)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 研究基于人类反馈或可验证奖励的强化学习中奖励作弊问题,提出用梯度正则化使训练偏向奖励更准确区域,理论推导并实证验证,还改进方法,结果显示其比KL惩罚表现更好。
Comments Accepted at ICML 2026, 25 pages, 15 figures
具有人类反馈的分布鲁棒强化学习
专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出一种分布鲁棒的强化学习方法,通过改进奖励基强化学习和直接偏好优化,提升模型在分布变化时的鲁棒性,实验显示在非分布任务中性能显著提升。
Comments Accepted at ICML 2026
校准的惊喜:一种信息论视角下的创造性质量
机构 * Bo Zou(邹波) ; Chao Xu(徐超)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出了一种信息论框架,用于评估创造性写作的质量,通过校准的惊喜概念,结合香农互信息理论,量化了高质量文本与降质文本之间的差异。
Comments 28 pages, 3 figures
稀疏混合专家奖励模型学习可解释且专业化的专家用于个性化偏好建模
机构 * Saarland University(萨尔兰大学) ; Independent Researcher(独立研究者) ; Bielefeld University(比勒菲尔德大学) ; Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) ; Max Planck Institute for Informatics(马克斯·普朗克信息研究所)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 提出稀疏混合专家奖励模型,通过稀疏路由和专家多样性训练,从二元偏好数据中学习可解释的专家模式,提升个性化偏好建模的测试时适应性和可解释性。
“我知道这会如何发展”:通过渐进条件惊奇度刻画多样性
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Cambridge(剑桥大学) ; Stanford University(斯坦福大学)
专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 提出一种基于上下文学习的多样性度量方法 Decan(D_{Ca_n}),通过单次前向传递计算每个字节的得分,无需嵌入模型、参考语料或人工标注,在多个基准上验证了其有效性。
Comments 28 pages, 18 figures, 9 tables. Accepted to the Workshop on Generative AI, Creativity, and Human-AI Co-Creation @ ICML 2026 (non-archival). Code and data: https://github.com/AMindToThink/icl-diversity
POVQA: 基于偏好的视频问答与数据效率的推理
机构 * University of Southern Mississippi(密西根州立大学)
专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract)
AI总结 提出POVQA方法,通过时间池化压缩视频帧、监督微调加偏好优化,在长视频问答中实现数据高效推理。
Comments Accepted in MAR at CVPR Workshop (Proceedings Track)
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 11533-11542
ActiveUltraFeedback:使用主动学习的高效偏好数据生成
机构 * University of Freiburg(弗赖堡大学)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 提出ActiveUltraFeedback主动学习流水线,通过不确定性估计和两种新采样方法(DRTS和DeltaUCB)动态选择最具信息量的响应对,以最少六分之一的标注数据实现与静态基线相当或更优的下游性能。
Comments 40 pages, 9 figures, 26 tables
LLUMI: 利用在线社区反馈改进心理健康支持中的LLM写作辅助
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)
专题命中 偏好对齐 :DPO(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 提出LLUMI框架,通过在线社区反馈(如Reddit投票)构建偏好对,结合监督微调和直接偏好优化训练开源小模型,在隐私保护下实现与GPT相当的心理健康支持性能。
BC协议:结构化双专家对话用于生成高质量思维链后训练数据
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 针对大语言模型后训练中高质量专家思维链数据生产瓶颈,提出BC协议——一种结构化双专家引出方法,通过配对领域专家与知识工程师,系统外化专家隐性判断为自然语言推理链,实验证明其在推理过程自然性上具有压倒性优势。
在指令微调的LLM中构建组合文学原语:跨架构SAE特征用于自我、风格和情感
机构 * Federal University of Goias(戈亚斯联邦大学)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过稀疏自编码器研究了指令微调的LLM中组合文学原语的架构,发现四种特征类别,并通过跨架构SAE特征验证了自我、风格和情感的表达能力。
Comments 36 pages, 6 figures
融合你的方式:通过直接偏好优化对齐图像融合与异质需求
机构 * School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院) ; Key Laboratory of Social Computing and Cognitive Intelligence (Dalian University of Technology), Ministry of Education(社会计算与认知智能重点实验室(大连理工大学),教育部) ; Institute of Image Processing and Understanding, North Minzu University(北华大学图像处理与理解研究所)
专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract)
AI总结 本文提出DPOFusion框架,通过整合PALDM和PCLDM实现任务引导和偏好适应的图像融合,解决人类和机器视觉的异质需求问题,提升融合质量和任务导向的迁移能力。
Comments Accepted by CVPR 2026
语言模型中的认知可观察性
机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现语言模型在制造内容时自信度最高,证明这是观察问题而非能力问题,提出通过计算副产品提升检测准确性。
构建具有人机监督的精确视频语言
专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出CHAI框架,通过专家与AI协作提升视频描述精度,改进开源模型并实现专业级视频生成。
Comments CVPR 2026 Highlight. Project page: https://linzhiqiu.github.io/papers/chai/
通过定向偏好优化减少长上下文监管理解中的细节幻觉
专题命中 偏好对齐 :DPO(abstract,abstract_cn);safety(abstract)
AI总结 本文提出DetailDPO框架,通过定向偏好优化减少长上下文监管文档中的细节幻觉,实验显示在不同模型和上下文长度下,DetailDPO有效降低细节错误率,跨领域迁移表现良好。
Comments 16 pages, 4 figures
从噪声到信号到自我目的:在NLP后训练时代的重新框架化人类标签变异
机构 * Department of Computer Science, University of Copenhagen, Denmark(丹麦哥本哈根大学计算机科学系) ; Faculty of Law, University of Copenhagen, Denmark(丹麦哥本哈根大学法学院) ; Amazon(亚马逊) ; LMU Munich & Munich Center for Machine Learning (MCML)(慕尼黑大学及慕尼黑机器学习中心(MCML))
专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 本文探讨人类标签变异在NLP后训练时代的重要性,提出将其作为内在价值自我目的进行保护,以提升模型鲁棒性和社会技术安全。
在微调后输出多样性为何会崩溃?
机构 * School of Computer Science University of Sheffield(计算机科学学院 伦敦大学谢菲尔德分校)
专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 研究探讨了微调后输出多样性的崩溃原因,发现数据组成和训练方法共同影响多样性,揭示多样性崩溃发生在训练阶段而非推理阶段。
一个模型解决所有问题:多目标可控语言模型
机构 * Ruhr University Bochum(波鸿鲁尔大学) ; Eindhoven University of Technology(埃因霍温理工大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; University of Liverpool(利物浦大学)
专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出多目标控制(MOC),通过引入多目标优化原理训练单个语言模型,使其能根据用户偏好在帕累托前沿生成个性化输出,提升模型可控性、输出质量和泛化能力。
Comments Published in Transactions on Machine Learning Research (03/2026): https://openreview.net/forum?id=qAM5PmvFYY
Nemotron-Cascade:基于级联强化学习的通用推理模型规模化
机构 * NVIDIA(英伟达)
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出级联域强化学习(Cascade RL)方法,开发出Nemotron-Cascade模型,可在指令和深度思考模式间切换,性能不逊于纯思考模型,同时提升推理能力并保持跨领域基准性能。
Comments We publicly release the Nemotron-Cascade models and the full collection of training data at: https://huggingface.co/collections/nvidia/nemotron-cascade
从LLM中的道德安装到道德作为系统中的LLM
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);safety(abstract)
AI总结 本文提出道德作为系统框架,重新定义道德行为的动态性与系统耦合问题,探讨道德属性在生命周期中的监测与跨组件一致性。
Comments 22pages, 1 figure, 1 table
对齐结构:将大型语言模型与结构信息对齐
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过整合语言学话语框架到强化学习中,结构对齐方法提升LLMs在长文本生成和摘要任务中的连贯性和结构组织能力。
Comments Accepted to AAAI 2026 AIA
通过递归自我批评实现超人类AI的可扩展监督
机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出通过递归自我批评实现超人类AI的可扩展监督,探索批评的批评比直接批评更容易,并验证递归批评在AI监督中的有效性。
关于领域转移下偏好微调泛化性和多样性的实证研究
机构 * School of Computer Science University of Sheffield, UK(计算机科学学院 谢菲尔德大学)
专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究通过比较不同对齐目标和适应策略,探讨领域转移下偏好微调的泛化性和多样性,发现伪标签法能有效缓解领域转移带来的性能下降。
LLaDA2.0:将扩散语言模型扩展到100B参数
机构 * Ant Group(蚂蚁集团) ; Renmin University of China(中国人民大学) ; Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; HongKong University of Science and Technology(香港科学与技术大学)
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 LLaDA2.0通过三阶段块级训练方案将扩散语言模型扩展至100B参数,实现高效前沿规模部署。
Comments 19 pages