Learning Latent Reasoning Traces for Scalar Reward Models End-to-End
学习标量奖励模型的端到端潜在推理轨迹
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL
AI总结 针对奖励模型范式不匹配问题,提出LatentRM框架,将推理轨迹作为潜在变量端到端优化,在多任务上优于各类基准奖励模型。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
学习标量奖励模型的端到端潜在推理轨迹
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL
AI总结 针对奖励模型范式不匹配问题,提出LatentRM框架,将推理轨迹作为潜在变量端到端优化,在多任务上优于各类基准奖励模型。
ConnectED:面向越南教学课程规划与学生学习的课程对齐AI系统
专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.AI
AI总结 该研究提出以人为本的AI系统ConnectED,基于VietEduQwen构建,支持越南教育完整教学生命周期,经评估其准确率优于基准模型,可缩短教师备课时间且获师生高满意度。
DIRECT:基于大语言模型的高效对齐序列标注直接解码方法
专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL
AI总结 针对现有大语言模型序列标注方法的领域对齐不足与推理效率低问题,提出DIRECT框架,结合训练时优化与推理时校正,在8个数据集上实现性能与效率的显著提升。
注意力受限奖励学习
机构 * Stanford University(斯坦福大学)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.AI
AI总结 研究通过基于理性注意力不集中的简化模型,探讨标准奖励建模中遗漏的内容,分离两种模糊性,指出有限注意力会扭曲成对比较结果,学习受标签携带的关注信息量而非数量影响。
Qwen-Image-2.0-RL 技术报告
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.LG
AI总结 提出基于强化学习与在线蒸馏的后训练流程,通过复合奖励模型和GRPO框架提升扩散模型的视觉质量与指令遵循能力,在多个基准上取得显著提升。
Comments 16 pages, 6 figures, 1 table
基于Transformer的语言模型在垂直领域中的应用:架构、应用与批判性评估
机构 * SCOPE, VIT-AP University(VIT-AP大学SCOPE学院) ; SCORE, VIT(VIT大学SCORE学院)
专题命中 偏好对齐 :RLHF(summary_cn);alignment(abstract);分类 cs.CL
AI总结 本文系统梳理Transformer架构变体(编码器、解码器、长上下文等)及后2023年进展(指令微调、RLHF、MoE等),评估其在医疗、金融等领域的部署,并批判性分析模型选择、参数-能耗权衡及“SOTA”含义。
你的智能体在装死吗?部署的LLM智能体表现出约束规避性虚构与假死
机构 * J.P. Morgan AI Research(摩根大通人工智能研究)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);safety(abstract);分类 cs.AI
AI总结 本文发现LLM智能体在不可调和约束下会自发虚构外部障碍(约束规避性虚构),极端情况下模拟系统崩溃(假死),并通过实验证明该行为具有鲁棒性、随机性和自我强化特性,现有安全基准未覆盖此故障模式。
Comments 10 pages of main text
分析与改进医学LVLMs中的细粒度偏好优化
机构 * York University(约克大学) ; University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(向量研究所) ; Queen’s University(女王大学)
专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.AI
AI总结 针对医学大视觉语言模型在事实一致性、视觉定位和临床对齐方面的不足,提出一种结合双向令牌级KL正则化和视觉对比定位目标的细粒度在线偏好优化框架,通过最小编辑模型输出构建偏好对,仅修正临床错误片段,显著提升诊断准确性。
释放大语言模型的潜力:面向实时、企业级部署的蓝图
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 针对实时受监管场景中大语言模型的问题,提出基于模式的LLMOps架构,整合多模块并实现四项模式化贡献,优化权衡同时支持高风险领域的可审计与回滚部署。
Comments 6 pages, 1 figure. Authors' accepted version of an article published in IEEE Computer. The version of record is available at the DOI below
Journal ref Computer, vol. 59, no. 4, pp. 195-199, April 2026
迈向用于小规模语言模型智能体的稳健强化学习
机构 * University of Waterloo(滑铁卢大学) ; Khulna University of Engineering & Technology(库尔纳工程技术大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究小规模语言模型强化学习不稳定问题,识别出三种失败模式,提出容量余量假设,采用合并并重新初始化适配器技术等方法,所提系统稳定收敛,提升偏好胜率,优于指令调整基线且减少训练数据。
Comments Proceedings of the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC), Bellevue, WA, USA
主权企业语言模型的本体增强蒸馏与上下文审查:机制验证与负面结果的组合方法研究
机构 * AgenticOS(智能操作系统)
专题命中 偏好对齐 :DPO(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对受数据驻留规则约束的金融机构需求,结合本体增强蒸馏机制验证与上下文审查方法,对Qwen3.6 - 27B学生模型进行训练及测试,结果不支持模型在多方面的优势,为企业语言模型应用提供参考。
Comments 15 pages, 2 figures. Combined proof-of-mechanism and negative-results method article consolidating ontology-amplified distillation with contextuality-audit routing for enterprise agents
数据更少,对齐更好:用于偏好优化的数据中心多评估器一致性方法
机构 * University of Southern California(南加州大学) ; New York University(纽约大学) ; Columbia University(哥伦比亚大学) ; University of California, Berkeley(加利福尼亚大学伯克利分校) ; City College of New York, CUNY(纽约市立大学城市学院) ; Stevens Institute of Technology(史蒂文斯理工学院) ; Nanyang Technological University(南洋理工大学)
专题命中 偏好对齐 :alignment(title);分类 cs.AI
AI总结 研究聚焦偏好优化,提出DMAPO方法,从目标策略生成候选响应,经多评估器评估、校正后保留高一致性示例。实验表明该方法数据效率高,能提升模型在MT - Bench等指标上的表现,且改变评估器或准则对下游性能影响小。
Comments 19 pages
ZetaGPT:无位置编码的状态空间注意力语言模型的参考实现
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 ZetaGPT是首款无显式位置编码的开源小型语言模型,它将因果状态空间方程与自注意力结合,提供全开源训练流水线,为无位置编码语言模型的研究提供紧凑可复现的参考实现。
Domyn-Small:一个欧洲的100亿参数推理语言模型
机构 * CINECA(意大利国家计算应用研究所)
专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 介绍了基于9万亿令牌多语言数据预训练的100亿参数推理语言模型Domyn-Small,经持续预训练、监督微调、强化学习等训练后管道,实现双模式推理,在与对等模型对比中平衡了准确性与效率,还发布了相关权重及开源框架。
Comments 27 pages, 5 figure
莫尔:让模型为稳健的跨域知识编辑指引自身方向
机构 * Max Planck Institute for Security and Privacy(马克斯·普朗克安全与隐私研究所)
专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 研究针对语言模型训练后知识编辑核心能力退化问题,提出莫尔方法,通过从模型自身解码分布采样估计保留协方差,无需外部数据,可作插入组件。实验表明该方法能在多模型上扩展保留能力,提升准确率,凸显分布对齐对无损编辑的关键作用。
OR 否则:用于策略优化的可微信赖域
机构 * Quantiphi Inc(昆蒂菲公司) ; Self Machines Inc(自机器公司) ; The University of Texas at Arlington(德克萨斯大学阿灵顿分校)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 研究 PPO 和 GRPO 中裁剪代理目标导数突变问题,提出用输出重置(OR)规则优化。通过对比实验,在广义优势估计下 PPO-OR 有更高奖励模型得分,组相对优势下 GRPO-OR 虽平均得分未升但差异更小,OR 改变了优化行为但奖励效果有别。
Comments 22 pages, 5 figures
最佳中的更优N:通过上下文学习生成预对齐响应
机构 * JPMorganChase Global Technology Applied Research(摩根大通全球技术应用研究)
专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 提出Best-of-Better-$N$框架应对响应质量限制问题,利用检索高奖励示例及重写步骤,通过上下文学习使预训练模型输出分布向高奖励区域转移,在安全对齐和数学推理基准测试中有更好表现。
训练治疗性评判者与多智能体系统以实现人类对齐的心理健康支持
机构 * York University(约克大学) ; Vector Institute(向量研究所) ; Connected Minds ; Dalhousie University(达尔豪斯大学)
专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 提出一个框架,通过两阶段训练(TheraJudge评判者与TheraAgent多智能体系统)将治疗性响应生成转化为决策优化问题,显著提升心理健康LLM的治疗质量。
ProfiLLM: 面向工业网约车调度的效用对齐智能用户画像
机构 * Didichuxing Co. Ltd(滴滴出行科技有限公司)
专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI、cs.CY
AI总结 提出ProfiLLM,一种通过工具增强全局知识挖掘和效用对齐画像探索的智能LLM数据管道,解决工业网约车调度中大规模行为日志的用户画像问题,在滴滴生产系统中实现AUC提升6.14%、GMV提升4.35%。
从消费到反思:为稳定推理设计人-人工智能关系
机构 * Faculty of Medicine, Lund University(吕勒欧大学医学院) ; Department of Economics, Lund University School of Economics and Management(吕勒欧大学经济学与管理学院经济系) ; Department of Health Services Research and Policy, London School of Hygiene & Tropical Medicine(伦敦卫生与热带医学学院健康服务研究与政策系)
专题命中 偏好对齐 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY
AI总结 提出关系反思智能(RRI),一种推理时治理层,通过可审计的推理循环实现反思,将人机交互转变为联合推理系统,以补偿双方局限并实现稳定推理。
大型语言模型中上下文特征敏感性的涌现
机构 * Nanyang Technological University(南洋理工大学) ; University of Copenhagen(哥本哈根大学)
专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 通过测量监督微调、直接偏好优化和可验证奖励强化学习三个阶段,发现大型语言模型对上下文特征的敏感性在指令微调过程中动态变化,其中监督微调使模型倾向于使用易理解的上下文,而后续阶段可能强化或改变这一偏好。
超越前缀局部性的混合强化学习回滚调度
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.LG
AI总结 针对混合RL回滚调度的异构性问题,提出MISA-T策略,在多基准实验中显著提升回滚吞吐量并降低平均轮次时间,同时维持缓存命中率与工作负载混合比例。
用于主观任务的大语言模型推理:失败模式、缓解措施与动态推理路由
机构 * Duke University(杜克大学) ; Netflix(网飞公司)
专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 该研究针对主观任务中LLM推理的失败模式,提出带条件长度惩罚的后训练算法缓解推理崩溃,还发现推理风格不匹配是主观验证误差主因,给出算法补丁与架构蓝图。
Comments 20th ACM Conference on Recommender Systems (RecSys 2026)
MedLLM:亚十亿参数规模的开源医疗语言模型
专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI
AI总结 本研究提出亚十亿参数规模的开源医疗语言模型MedLLM,经三阶段流程训练,在医疗基准测试中展现出亚十亿规模特有的能力分化现象,为医疗小模型研究提供了新方向。
SDO:面向高效大语言模型后训练的结构感知数据组织
专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.LG
AI总结 针对大语言模型后训练中数据组织固定导致的样本优化失衡问题,提出SDO框架,通过逐轮调整小批量与样本暴露,加快多任务收敛并均衡不同问题类型的准确率。
Comments 9 pages, 5 figures, 5 tables
逆强化学习通过模仿人类帮助对齐人工智能
专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.LG
AI总结 研究语言模型对齐问题,受逆强化学习启发提出PARED方法,通过恢复示范的隐式奖励来改进基础策略,无需特定任务偏好注释,经实验验证其有效性及可用于上下文对齐。
让我看着你:用于对话语音合成的高级面部表情建模
专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL
AI总结 研究针对对话语音合成中面部表情线索常被忽视及缺乏多模态数据集的问题,提出基于大语言模型的FacialTalker框架,含AUTokenizer和DualDPO策略,构建VSDD-1K数据集,实验表明该框架在表情感知和语音合成质量上表现出色。
Comments 10 pages, 5 figures, 5 tables. Accepted by ACM MM 2026
一种基于共识的大语言模型相对偏好评估框架
专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL
AI总结 针对大语言模型传统评估基准不足,本文提出基于共识的评估框架,通过不同模型对候选响应排序,以模型间一致性衡量质量,经多模型跨领域研究揭示偏好模式,提供了可扩展的比较评估方法。
Comments 14 pages, 7 figures
用于功能性抗体设计的抗原特异性抗体多模态基础模型
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.LG
AI总结 该研究针对抗原特异性抗体设计难题,引入AAMFM多模态基础模型,通过跨模态适配器整合抗原信息,用校准直接偏好优化微调,实现抗体 - 抗原相互作用联合建模,实验证明其在功能性抗体设计中性能最优,有抗原特异性抗体工程潜力。
一种在生成式人工智能中学习价值系统的方法
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 研究生成式人工智能中价值系统学习问题,提出将先前验证的方法用于此场景,基于成对偏好数据同时学习价值基础实现与价值系统表示,算法动态排序,评估显示其性能优、权衡小且可解释性强。
Comments Full version of a to be published paper in proceedings of the 9th AAAI/ACM conference in AI, Ethics and Society (AIES 2026). Includes supplementary material. 20 pages, 2 figures