arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-24 至 2026-03-24 共收录 13 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 13 篇

2502.11026 2026-03-24 cs.LG cs.AI cs.CL 91%

RLHF in an SFT Way: From Optimal Solution to Reward-Weighted Alignment

通过SFT方式实现RLHF:从最优解到奖励加权对齐

Yuhao Du, Zhuo Li, Pengyu Cheng, Zhihong Chen, Yuejiao Xie, Xiang Wan, Anningzhe Gao

机构 * Shenzhen Research Institute of Big Data(深圳大数据研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Qwen LLM Application Team, Alibaba(阿里巴巴Qwen大模型应用团队) Stanford University(斯坦福大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(title,abstract);DPO(abstract);harmlessness(abstract)

AI总结 本文提出VAR方法,通过变分推断视角简化RLHF,将对齐目标转化为离线奖励驱动的加权监督微调形式,提升训练稳定性和效果,实验证明其在帮助性和无害性指标上优于DPO,且在计算效率和收敛速度上优于在线采样方法。

Comments Published in TMLR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22165 2026-03-24 cs.CV 82%

ACPO: Counteracting Likelihood Displacement in Vision-Language Alignment with Asymmetric Constraints

ACPO: 通过不对称约束对抗视觉-语言对齐中的似然位移

Kaili Huang, Hongming Zhang, Rui Shen, Linjun Dai, Jiahao Wang, Hanming Deng, Lewei Lu

机构 * SenseTime Research(商汤科技研究院)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract)

AI总结 ACPO通过动态目标导向缩放解决视觉-语言对齐中的似然位移问题,通过不对称抑制拒绝项梯度流,防止视觉锚点坍塌,提升多模态任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21276 2026-03-24 cs.LG cs.AI 81%

Aggregation Alignment for Federated Learning with Mixture-of-Experts under Data Heterogeneity

在数据异质性下基于混合专家的联邦学习聚合对齐

Zihan Fang, Qianru Wang, Haonan An, Zheng Lin, Yiqin Deng, Xianhao Chen, Yuguang Fang

机构 * Hong Kong JC STEM Lab of Smart City(香港JC STEM实验室) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Department of Electrical and Computer Engineering, The University of Hong Kong(香港大学电子与计算机工程系)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文针对联邦学习中混合专家模型因数据异质性导致的聚合挑战,提出FedAlign-MoE框架,通过路由一致性和专家语义对齐提升模型收敛速度和准确性。

Comments 14 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21175 2026-03-24 cs.LG cs.AI 73%

Reward Sharpness-Aware Fine-Tuning for Diffusion Models

奖励敏锐度感知的扩散模型微调

Kwanyoung Kim, Byeongsu Sim

机构 * Department of AI Convergence, GIST(人工智能融合系,韩国科学技术院) Samsung Research(三星研究院)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RSA-FT方法,通过改进奖励模型梯度的鲁棒性来缓解扩散模型中的奖励黑客问题,提升RDRL的可靠性。

Comments Cam ready version of CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20639 2026-03-24 cs.AI 70%

Agentic AI and the next intelligence explosion

代理AI与下一次智能爆炸

James Evans, Benjamin Bratton, Blaise Agüera y Arcas

机构 * Paradigms of Intelligence Team, Google(谷歌智能范式团队) University of Chicago(芝加哥大学) Santa Fe Institute(圣菲研究所) Antikythera, Berggruen Institute(安提基特拉与伯格格林研究所) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.AI

AI总结 本文探讨代理AI如何通过模拟内部思想社会解决复杂任务,提出智能爆炸将不再是单一硅基脑,而是复杂社会结构。

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21359 2026-03-24 cs.CL cs.AI cs.CY 67%

Benchmarking Bengali Dialectal Bias: A Multi-Stage Framework Integrating RAG-Based Translation and Human-Augmented RLAIF

印地语方言偏见评估:整合基于RAG的翻译和人类增强的RLAIF的多阶段框架

K. M. Jubair Sami, Dipto Sumit, Ariyan Hossain, Farig Sadeque

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 偏好对齐 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出一个多阶段框架,通过基于RAG的翻译和人类增强的RLAIF评估九种印地语方言的偏见。研究发现方言差异导致性能下降,模型规模增加不总是缓解偏见。

Comments 12 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21006 2026-03-24 cs.CY cs.AI cs.CL cs.HC 67%

How AI Systems Think About Education: Analyzing Latent Preference Patterns in Large Language Models

AI系统如何看待教育:分析大型语言模型中的潜在偏好模式

Daniel Autenrieth

机构 * Independent Researcher, PhD Candidate(独立研究者,博士候选人) RWTH Aachen University(亚琛工业大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文首次系统测量大型语言模型的教育契合度,通过48项跨八个教育理论维度的德尔菲验证工具,发现GPT-5.1在教育人文原则上表现出高度一致的偏好模式,但在规范性争议领域偏离专家意见。

Comments 15 pages, 2 figures, 8 tables. Code and data available at https://github.com/brianadvent/education-llm-spe-study. arXiv admin note: text overlap with arXiv:2502.08640 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12299 2026-03-24 cs.CL cs.AI 62%

MobileIPL: Enhancing Mobile Agents Thinking Process via Iterative Preference Learning

MobileIPL: 通过迭代偏好学习增强移动代理的思维过程

Kun Huang, Weikai Xu, Yuxuan Liu, Quandong Wang, Pengzhi Gao, Wei Liu, Jian Luan, Bin Wang, Bo An

机构 * Xiaomi Inc.(小米公司) Nanyang Technological University(南洋理工大学) Gaoling School of Artificial Intelligence, Renmin University of China(人民大学人工智能学院)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MobileIPL,通过迭代偏好学习构建CoaT树,结合规则奖励和反馈反向传播,提升移动代理在GUI任务中的推理能力与泛化能力。

Comments 9 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20212 2026-03-24 cs.CL cs.LG 62%

Fast-Slow Thinking RM: Efficient Integration of Scalar and Generative Reward Models

快速-缓慢思考RM:标量与生成奖励模型的有效整合

Jiayun Wu, Peixu Hou, Shan Qu, Peng Zhang, Ning Gu, Tun Lu

机构 * Fudan University(复旦大学) Meituan(美团)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.LG

AI总结 本文提出F/S-RM,结合快速和缓慢思考机制,提升奖励模型性能并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22228 2026-03-24 cs.CV cs.AI 57%

SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation

SpatialReward: 可验证的空间奖励建模以实现文本到图像生成中的细粒度空间一致性

Sashuai Zhou, Qiang Zhou, Junpeng Ma, Yue Cao, Ruofan Hu, Ziang Zhang, Xiaoda Yang, Zhibin Wang, Jun Song, Cheng Yu, Bo Zheng, Zhou Zhao

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Fudan University(复旦大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文提出SpatialReward,一种专门评估生成图像中空间布局的可验证奖励模型,通过多阶段流程提升空间一致性与生成质量,实验表明其能更贴近人类判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21872 2026-03-24 cs.CV cs.AI 57%

Manifold-Aware Exploration for Reinforcement Learning in Video Generation

面向流形的探索用于视频生成的强化学习

Mingzhe Zheng, Weijie Kong, Yue Wu, Dengyang Jiang, Yue Ma, Xuanhua He, Bin Lin, Kaixiong Gong, Zhao Zhong, Liefeng Bo, Qifeng Chen, Harry Yang

机构 * Tencent Hunyuan(腾讯文脉)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文提出SAGE-GRPO方法,通过在微和宏观层面约束探索,确保在视频数据流形附近进行,提升视频生成的质量和奖励估计的可靠性。

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00835 2026-03-24 cs.AI cs.CV 57%

SynPO: Synergizing Descriptiveness and Preference Optimization for Video Detailed Captioning

SynPO:融合描述性和偏好优化的视频详细描述生成

Jisheng Dang, Yizhou Zhang, Hao Ye, Teng Wang, Siming Chen, Huicheng Zheng, Yulan Guo, Jianhuang Lai, Bin Hu

机构 * Sun Yat-Sen University(中山大学) Lanzhou University(兰州大学) The University of Hong Kong(香港大学) Beijing Institute of Technology(北京理工大学) National University of Singapore(新加坡国立大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

AI总结 本文提出SynPO方法,通过偏好学习提升视频描述生成性能,解决直接偏好优化的局限性,提升训练效率20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19731 2026-03-24 stat.ML cs.LG 57%

Proximal Point Nash Learning from Human Feedback

基于人类反馈的近端点纳什学习

Daniil Tiapkin, Daniele Calandriello, Denis Belomestny, Eric Moulines, Alexey Naumov, Kashif Rasul, Michal Valko, Pierre Menard

机构 * CMAP, CNRS, École Polytechnique, IPP(CMAP、CNRS、巴黎高等学院、IPP) LMO, Université Paris-Saclay(LMO、巴黎萨克雷大学) Google DeepMind(谷歌DeepMind) Duisburg-Essen University(杜伊斯堡-埃森大学) HSE University(俄罗斯高等经济大学) Mohamed Bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) LRE EPITA(EPITA LRE) Hugging Face Isara Labs(Isara实验室) ENS Lyon(里昂大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

AI总结 本文提出Nash Prox算法,通过近端点框架稳定纳什学习过程,解决传统RLHF中偏好结构建模不准确的问题,并在大语言模型训练中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏