Agent Safety Should Be a Runtime Contract
智能体安全应成为运行时契约
专题命中 偏好对齐 :safety(title,abstract);RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);AI safety(abstract)
AI总结 该研究指出将AI安全仅在训练阶段植入的范式不足,提出智能体安全应是兼具预防与证据层面的运行时契约,通过四类公开证据支撑该立场并给出研究议程。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
智能体安全应成为运行时契约
专题命中 偏好对齐 :safety(title,abstract);RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);AI safety(abstract)
AI总结 该研究指出将AI安全仅在训练阶段植入的范式不足,提出智能体安全应是兼具预防与证据层面的运行时契约,通过四类公开证据支撑该立场并给出研究议程。
DPO中的上下文盲区:通过上下文校准的偏好优化缓解多模态大语言模型(MLLMs)中的物体幻觉
机构 * Korea University(高丽大学) ; KAIST(韩国科学技术院)
专题命中 偏好对齐 :DPO(title,title_cn)
AI总结 本研究针对MLLMs的物体幻觉问题,提出C²-DPO方法,通过最大化上下文偏好增益降低幻觉率,使Qwen2-VL-Instruct-2B的幻觉率相对降低36%且不损害通用推理能力。
Comments Accepted at ECCV2026
注意间隙:在偏好学习中的结构感知一致性
机构 * Google Research(谷歌研究) ; Courant Institute of Mathematical Sciences(数学科学学院)
专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract);分类 cs.LG
AI总结 本文提出结构感知H一致性框架,通过引入SA-DPO目标函数,改进偏好学习中的一致性问题,证明重尾 surrogate 在容量受限模型中具有更好的一致性保证。
Comments ICML 2026
如何使用你的专家预算:蛋白质结构预测模型的实用指南
机构 * InstaDeep Ltd(InstaDeep公司) ; University of Oxford(牛津大学) ; Lancaster University(兰卡斯特大学)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI、cs.LG
AI总结 本研究针对蛋白质结构预测模型的专家预算约束,通过基准测试FK-steering、DPO、Best K-of-N采样及O3方法,明确不同预算下的最优方法并给出实用选择建议。
Comments Proceedings of the ICML 2026 Workshop on Structured Probabilistic Inference & Generative Modeling (SPIGM)
偏好树优化:通过前瞻模拟增强面向目标的对话
机构 * Reichman University(赖希曼大学) ; School of Computer Science(计算机科学学院) ; School of Communications(传播学院)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 本研究提出偏好树优化(PTO)框架,结合带前瞻的偏好树与直接偏好优化(DPO),在动机访谈领域通过虚拟患者等模拟对话生成偏好数据,训练的对话智能体在关键指标上优于基线。
Comments 13 pages, 4 figures. Accepted at an ICLR 2025 workshop
强化步骤级推理以实现大语言模型的有效自校正
机构 * Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学) ; VinUniversity ; Institute for Infocomm Research (IR), A*STAR(新加坡科技研究局信息通信研究院)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型自校正的核心挑战,提出SFS-DPO及教师辅助变体SFS-DPO-R框架,经多模型多域评估,其性能优于现有步骤级训练基线,可提升自校正频率与有效性。
从在线用户反馈中学习购物智能体
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
AI总结 提出LOFA框架,结合强化学习与反馈感知的策略内蒸馏,利用真实在线用户反馈改进购物智能体,在电商日志实验中提升了推荐质量、回复有用性及用户满意度对齐效果。
用于内容推荐的反向心智理论建模:从网页浏览到动态智能界面
机构 * JPMorganChase(摩根大通)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
AI总结 本研究提出反向心智理论(IToM)流程,从用户交互反向推理推断信念与偏好,在OPeRA数据集上验证其画像推断效果,并通过VisionOS应用展示跨模态迁移能力,提升内容推荐的用户理解精度。
Comments Preprint for conference full paper at 20th ACM Conference on Recommender Systems (RecSys '26), Minneapolis, MN, USA