arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-12 至 2026-08-12 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 6 篇

2608.10126 2026-08-12 cs.LG cs.AI cs.CL 新提交 91%

Procedural Fairness Failures in RLHF from Preference Averaging

来自偏好平均的RLHF中的程序公平性失败

M P V S Gopinadh, Karthik Kamuju, Kummari Avinash, John Joshua, Srinivasa Raju Rudraraju

机构 * Vishnu Institute of Technology(维什努理工学院)

专题命中 偏好对齐 :RLHF(title,title_cn);alignment(abstract,comments);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究指出标准RLHF因偏好平均引发程序公平性失败,提出PA-RLHF分开优化不同偏好模式,提升了对齐准确率并缩小了群体公平差距,对大模型和智能体系统有重要意义。

Comments 4 pages, Accepted at the ICLR 2026 Workshop on Algorithmic Fairness Across Alignment Procedures and Agentic Systems (AFAA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23102 2026-08-12 cs.AI cs.CL 版本更新 79%

Multiplayer Nash Preference Optimization

多玩家纳什偏好优化

Fang Wu, Xu Huang, Weihao Xuan, Zhiwei Zhang, Yijia Xiao, Guancheng Wan, Xiaomin Li, Bing Hu, Peng Xia, Jure Leskovec, Yejin Choi

机构 * Stanford University(斯坦福大学) Georgia Institute of Technology(佐治亚理工学院) The University of Tokyo(东京大学) RIKEN AIP(日本理化学研究所智能系统研究中心) Pennsylvania State University(宾夕法尼亚州立大学) University of California, Los Angeles(加州大学洛杉矶分校) Harvard University(哈佛大学) UNC–Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出多玩家纳什偏好优化框架,扩展了传统的两玩家纳什对齐方法,通过引入多玩家博弈机制,提升对复杂非传递性人类偏好的对齐能力,并在多个基准测试中表现更优。

Journal ref ICLR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11152 2026-08-12 cs.DC cs.LG 新提交 70%

Scheduling Mixed RL Rollouts Beyond Prefix Locality

超越前缀局部性的混合强化学习回滚调度

Zetao Hong, Song Yuan, Yuanhao Ding, Yibo Zhu, Daxin Jiang, Zhibin Wang, Chen Tian

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 针对混合RL回滚调度的异构性问题,提出MISA-T策略,在多基准实验中显著提升回滚吞吐量并降低平均轮次时间,同时维持缓存命中率与工作负载混合比例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09887 2026-08-12 cs.CL 版本更新 70%

Overconfident and Blind to Details: Fixing Prompt Insensitivity with Abductive Preference Learning

过度自信且忽视细节:通过归纳偏好学习修复提示不敏感

Yijin Ni, Simon Yu, Peng Qi

机构 * Georgia Institute of Technology(佐治亚理工学院) Northeastern University(东北大学) Uniphore(Uniphore公司)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出归纳偏好学习方法,通过优化归纳策略提升模型对罕见提示的敏感度,显著提高在VLMBias和Inverse-IFEval基准测试中的性能。

Comments 26 pages, 15 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19436 2026-08-12 cs.CV cs.AI cs.LG cs.MM 版本更新 62%

VDC-Agent: When Video Detailed Captioners Evolve Themselves via Agentic Self-Reflection

VDC-Agent:当视频详细描述器通过代理自我反思而自我进化

Qiang Wang, Xinyuan Gao, Yuhang He, Jizhou Han, Jiangyang Li, SongLin Dong, Zhiheng Ma, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学) Kuaishou Technology(快手科技) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG

AI总结 VDC-Agent通过自我反思机制实现视频详细描述的自我进化,利用自动生成的(描述,评分)对提升描述准确性与评分表现。

Comments Accepted to ECCV 2026. Project Page: https://vdcagent.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08326 2026-08-12 cs.AI 版本更新 57%

StructReward: Efficient Structured Process Rewards for Self-Correcting Multimodal Reasoning

StructReward:用于自修正多模态推理的高效结构化过程奖励

Yifan Li, Ruxin Sun, Tongzhou Zhao

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本研究提出StructReward框架,通过结构化步骤级奖励对齐结合GRPO目标等方式,在无额外验证器的情况下降低多模态强化学习开销,实现自修正多模态推理。

Comments 9 pages, 3 figures. Yifan Li and Ruxin Sun contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏