arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-25 至 2026-06-25 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 8 篇

2505.12843 2026-06-25 cs.LG cs.AI 版本更新 92%

Bias Fitting to Mitigate Length Bias of Reward Model in RLHF

偏差拟合以缓解RLHF中奖励模型的长度偏差

Kangwen Zhao, Jianfeng Cai, Jinhua Zhu, Ruopei Sun, Dongyun Xue, Wengang Zhou, Li Li, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 偏好对齐 :RLHF(title,title_cn);DPO(abstract,abstract_cn);alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出FiMi-RM框架,通过自学习长度与奖励的非线性关系并解耦,有效缓解RLHF中奖励模型因长度偏差导致的奖励破解问题。

Comments 16 pages, 12 figures. Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26057 2026-06-25 cs.AI cs.CR cs.LG 新提交 91%

The Unfireable Safety Kernel: Execution-Time AI Alignment for AI Agents and Other Escapable AI Systems

不可解雇的安全内核:面向AI代理及其他可逃逸AI系统的执行时AI对齐

Seth Dobrin, Łukasz Chmiel

机构 * ARYA Labs PBC

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出一种架构性控制机制“不可解雇的安全内核”,通过进程隔离、前置强制、故障关闭和外部验证四个属性实现执行时AI对齐,在可逃逸AI系统中阻止逃逸尝试。

Comments Pre-print submitted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24993 2026-06-25 cs.LG 新提交 81%

The Geometry of Sequential Learning: Lie-Bracket Prediction of Transfer Order

序列学习的几何:李括号预测迁移顺序

John Sweeney

机构 * Sideplane AI

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.LG

AI总结 提出李括号对偶性分数预测序列学习中的源域顺序,通过李括号锦标赛实现O(N log N)排序,在指令微调和DPO中达到高准确率。

Comments Accepted to ICML 2026. 20 pages, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25127 2026-06-25 cs.LG cs.AI math.OC 新提交 62%

Reward-Conditioned Attention: How Reward Design Shapes What Autonomous Driving Agents See

奖励条件注意力:奖励设计如何塑造自动驾驶代理的感知

Mohamed Benabdelouahad, Ahmed Djalal Hacini, Nadir Farhi, Aissa Boulmerka

机构 * National School of Artificial Intelligence (ENSIA)(国家人工智能学院) Cosys-Grettia, Univ Gustave Eiffel(古斯塔夫·埃菲尔大学Cosys-Grettia实验室)

专题命中 偏好对齐 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究奖励设计如何影响自动驾驶强化学习代理的内部注意力模式,发现奖励内容直接决定编码器优先关注的场景元素,且连续碰撞时间惩罚会形成学习性警觉先验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04773 2026-06-25 cs.LG cs.AI 版本更新 62%

Distribution Preference Optimization: A Fine-grained Perspective for LLM Unlearning

分布偏好优化:大语言模型遗忘的细粒度视角

Kai Qin, Jiaqi Wu, Jianxiang He, Haoyuan Sun, Yifei Zhao, Xu Wang, Bin Liang, Yongzhe Chang, Cheng Li, Tiantian Zhang, Houde Liu

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学) Jianghuai Advanced Technology Center(江淮先进技术中心) University of Technology Sydney(悉尼大学)

专题命中 偏好对齐 :safety(abstract);分类 cs.AI、cs.LG

AI总结 针对大语言模型遗忘中负偏好优化缺乏显式正信号的问题,提出分布偏好优化(DiPO),通过选择性放大或抑制模型高置信度输出logits构建偏好分布对,实现细粒度遗忘,在TOFU和MUSE基准上取得最优遗忘质量与模型效用的平衡。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25757 2026-06-25 cs.CL 新提交 57%

OPERA: Aligning Open-Ended Reasoning via Objective Perplexity-based Reinforcement Learning

OPERA: 通过基于客观困惑度的强化学习对齐开放式推理

Wenxuan Jiang, Zining Fan, Zijian Zhang, Xuecheng Wu, Hongming Tan, Haoyang Dai, Xiaoyu Li, Xuezhi Cao, Ninghao Liu

机构 * The Hong Kong Polytechnic University(香港理工大学) Meituan Longcat Team(美团龙猫团队) Peking University(北京大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 提出OPERA方法,利用困惑度动态作为内在奖励信号,结合冷启动数据合成和困惑度优先的推理轨迹选择,实现开放式任务中对齐,在Qwen3-8B上达到开源模型最优。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00327 2026-06-25 cs.IR cs.AI 版本更新 57%

DynamicPO: Dynamic Preference Optimization for Recommendation

DynamicPO:基于推荐的动态偏好优化

Xingyu Hu, Kai Zhang, Jiancan Wu, Shuli Wang, Chi Wang, Wenshuai Chen, Yinhua Zhu, Haitao Wang, Xingxing Wang, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Meituan(美团)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

AI总结 本文提出DynamicPO框架,通过动态边界负样本选择和双边距动态beta调整,解决偏好优化崩溃问题,提升推荐准确性。

Comments DASFAA 2026 Best Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25661 2026-06-25 cs.CV 版本更新 50%

DRM: Diffusion-based Reward Model With Step-wise Guidance

DRM: 基于扩散的奖励模型与逐步引导

Jaxon Zhang, Binxin Yang, Hubery Yin, Chen Li, Jing Lyu

机构 * Peking University(北京大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)

专题命中 偏好对齐 :alignment(abstract)

AI总结 提出基于扩散的奖励模型(DRM),利用预训练扩散模型作为评估骨干,通过逐步评估能力改进强化学习对齐和推理采样,提升图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏