arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3235 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3235 篇

2410.05451 2025-07-04 cs.CR cs.LG 80%

SecAlign: Defending Against Prompt Injection with Preference Optimization

Sizhe Chen, Arman Zharmagambetov, Saeed Mahloujifar, Kamalika Chaudhuri, David Wagner, Chuan Guo

机构 * UC Berkeley / Meta(伯克利大学/Meta) Meta

专题命中 偏好对齐 :prompt injection(title,abstract);分类 cs.LG

Comments ACM CCS 2025. Key words: prompt injection defense, LLM security, LLM-integrated applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.04833 2024-06-05 cs.CL 80%

Long Is More for Alignment: A Simple but Tough-to-Beat Baseline for Instruction Fine-Tuning

Hao Zhao, Maksym Andriushchenko, Francesco Croce, Nicolas Flammarion

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

Comments Accepted at ICML 2024. This camera-ready version adds MT-Bench evaluations, a human study, more thorough analysis of length bias. Code at https://github.com/tml-epfl/long-is-more-for-alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08768 2026-08-11 cs.IR 新提交 80%

BOUND: Brief-Guided Corrective Preference Distillation at Search-Control Boundaries

BOUND:在搜索-控制边界处的摘要引导式校正偏好蒸馏

Qingying Niu, Ruiyang Ren, Wayne Xin Zhao, Yaliang Li

专题命中 偏好对齐 :DPO(summary_cn,abstract)

AI总结 针对大语言模型深度搜索智能体的持续漂移问题,提出BOUND框架,通过摘要引导构建偏好对,用DPO蒸馏偏好,在7个基准上多数数据集和指标优于基线。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26583 2026-06-26 cs.CE 新提交 80%

Preference Optimization Drives Monoculture in LLM Prediction Markets

偏好优化导致LLM预测市场中的单一文化

James Begin, Brendan Gho, Suman Muppavarapu, Tyson Tsay, Atharva Mohan, Afnan Shaik, Ruizhe Li, Vasu Sharma, Archana Vaidheeswaran

专题命中 偏好对齐 :DPO(summary_cn,abstract)

AI总结 研究发现,使用直接偏好优化(DPO)微调的LLM代理在预测市场中产生高度相关的错误,导致集体预测能力远低于独立代理数量,且该现象由偏好优化驱动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06343 2026-06-10 cs.LG cs.AI cs.CL 版本更新 80%

When Distance Distracts: Representation Distance Bias in BT-Loss for Reward Models

当距离干扰:BT损失中表示距离偏差对奖励模型的影响

Tong Xie, Andrew Bai, Yuanhao Ban, Yunqi Hong, Haoyu Li, Cho-Jui Hsieh

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 分析BT损失中表示距离导致的梯度偏差,提出NormBT自适应归一化方案,提升奖励模型在细粒度区分上的性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26486 2026-05-27 cs.CV 80%

LongCat-Video-Avatar 1.5 Technical Report

LongCat-Video-Avatar 1.5 技术报告

Meituan LongCat Team, Xunliang Cai, Meng Cheng, Feng Gao, Zhe Kong, Jiamu Li, Le Li, Weiheng Li, Hongyu Liu, Shuai Tan, Xiaoming Wei, Tianyu Yang, Yong Zhang

机构 * Meituan LongCat Team(美团LongCat团队)

专题命中 偏好对齐 :RLHF(summary_cn,abstract)

AI总结 本文提出 LongCat-Video-Avatar 1.5,一个通过升级音频编码器、优化训练策略、数据筛选和RLHF训练实现高精度唇同步、全身时间稳定性和长视频生成的开放框架,在多个基准测试中达到或超越商业系统性能。

Comments Homepage: https://meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/ Github: https://github.com/meituan-longcat/LongCat-Video

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08011 2026-05-26 cs.CV 80%

It's Time to Get It Right: Improving Analog Clock Reading and Clock-Hand Spatial Reasoning in Vision-Language Models

是时候正确了:提升视觉语言模型中的模拟时钟读取和指针空间推理能力

Jaeha Choi, Jin Won Lee, Siwoo You, Jangho Lee

机构 * Incheon National University(延世国立大学) McGill University(麦吉尔大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract)

AI总结 针对视觉语言模型在真实环境中读取模拟时钟的挑战,提出TickTockVQA数据集和Swap-DPO微调框架,显著提升时钟读取准确性和鲁棒性。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21319 2026-05-19 cs.CL cs.AI cs.LG 80%

RLBFF: Binary Flexible Feedback to bridge between Human Feedback & Verifiable Rewards

RLBFF:二进制灵活反馈用于连接人类反馈与可验证奖励

Zhilin Wang, Jiaqi Zeng, Olivier Delalleau, Ellie Evans, Daniel Egert, Hoo-Chang Shin, Felipe Soares, Yi Dong, Oleksii Kuchaiev

机构 * NVIDIA

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RLBFF结合人类偏好与规则验证,提升奖励模型对响应质量的精准捕捉,优于Bradley-Terry模型,在RM-Bench和JudgeBench上取得优异成绩,且支持用户自定义反馈原则。

Comments Published at ICLR 2026, 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23575 2026-04-30 cs.CY cs.CL cs.LG 80%

The Collapse of Heterogeneity in Silicon Philosophers

硅哲学家中的异质性崩溃

Yuanming Shi, Andreas Haupt

机构 * Adobe Inc.(Adobe公司) Stanford University(斯坦福大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.CY、cs.LG

AI总结 研究发现硅样本在哲学领域系统性地压缩了异质性,语言模型过度相关哲学判断,产生人工共识,影响对齐、评估和硅样本替代人类判断的使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23542 2026-04-21 cs.CL cs.AI cs.LG 80%

On the Shelf Life of Fine-Tuned LLM-Judges: Future-Proofing, Backward-Compatibility, and Question Generalization

大语言模型判官的保质期:未来证明、向后兼容性和问题泛化

Janvijay Singh, Austin Xu, Yilun Zhou, Yefan Zhou, Dilek Hakkani-Tur, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI研究院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Dartmouth College(达特茅斯学院)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了细调判官模型在现实部署中的挑战,探讨了未来证明、向后兼容性和问题泛化三个核心问题,并通过实验发现持续学习在适应响应分布变化方面表现更优。

Comments Updated after ICLR 2026 Acceptance; 29 pages;

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01352 2026-03-04 cs.CL cs.AI cs.LG 80%

Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy

Skywork-Reward-V2: 通过人机协同扩大偏好数据整理

Chris Yuhao Liu, Liang Zeng, Yuzhen Xiao, Jujie He, Jiacai Liu, Chaojie Wang, Rui Yan, Wei Shen, Fuxiang Zhang, Jiacheng Xu, Yang Liu, Yahui Zhou

机构 * Research, Skywork AI(2050研究, Skywork AI)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Skywork-Reward-V2通过人机协同扩大偏好数据整理,提出SynPref-40M数据集和两阶段流程,训练出八种参数不同的奖励模型,在多个基准中取得最佳性能。

Comments ICLR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04224 2026-02-05 cs.LG cs.AI cs.CL cs.CR math.OC 80%

RAPO: Risk-Aware Preference Optimization for Generalizable Safe Reasoning

RAPO:面向通用安全推理的风险感知优化

Zeming Wei, Qiaosheng Zhang, Xia Hu, Xingcheng Xu

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RAPO 提出了一种风险感知优化框架,通过提升安全推理的泛化能力,增强大型推理模型在复杂攻击下的安全性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17096 2026-01-27 cs.CY cs.AI cs.CL 80%

Beyond Instrumental and Substitutive Paradigms: Introducing Machine Culture as an Emergent Phenomenon in Large Language Models

超越工具性和替代性范式:引入机器文化作为大型语言模型中的涌现现象

Yueqing Hu, Xinyang Peng, Yukun Zhao, Lin Qiu, Ka-lai Hung, Kaiping Peng

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本研究提出机器文化作为大型语言模型中的一种新兴现象,挑战传统工具性和替代性范式,揭示模型在文化表现上的独特特性。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07835 2026-01-13 cs.CR cs.CV 80%

SecureCAI: Injection-Resilient LLM Assistants for Cybersecurity Operations

SecureCAI: 面向网络安全操作的抗注入大语言模型助手

Mohammed Himayath Ali, Mohammed Aqib Abdullah, Mohammed Mudassir Uddin, Shahnawaz Alam

机构 * Computer Science Department, Cybersecurity and Artificial Intelligence Division(计算机科学系、网络安全与人工智能 division)

专题命中 偏好对齐 :safety(abstract);prompt injection(abstract);trustworthy(abstract);AI safety(abstract)

AI总结 SecureCAI通过引入安全意识护栏和偏好优化,有效提升网络安全操作中对抗攻击的防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16531 2025-09-23 cs.CL cs.AI cs.FL cs.LG 80%

Bayesian scaling laws for in-context learning

Aryaman Arora, Dan Jurafsky, Christopher Potts, Noah D. Goodman

机构 * Stanford University(斯坦福大学)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments COLM 2025 camera-ready version; 9 pages main text, 39 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17828 2025-07-04 cs.LG cs.AI cs.CL 80%

Aligning Frozen LLMs by Reinforcement Learning: An Iterative Reweight-then-Optimize Approach

Xinnan Zhang, Chenliang Li, Siliang Zeng, Jiaxiang Li, Zhongruo Wang, Kaixiang Lin, Songtao Lu, Alfredo Garcia, Mingyi Hong

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09401 2025-02-12 cs.LG cs.AI cs.CL math.OC stat.ML 80%

Reinforcement Learning from Human Feedback with Active Queries

Kaixuan Ji, Jiafan He, Quanquan Gu

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 28 pages, 1 figure, 4 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01253 2025-01-23 cs.CL cs.AI cs.LG 80%

Yi-Lightning Technical Report

Alan Wake, Bei Chen, C. X. Lv, Chao Li, Chengen Huang, Chenglin Cai, Chujie Zheng, Daniel Cooper, Fan Zhou, Feng Hu, Ge Zhang, Guoyin Wang, Heng Ji, Howard Qiu, Jiangcheng Zhu, Jun Tian, Katherine Su, Lihuan Zhang, Liying Li, Ming Song, Mou Li, Peng Liu, Qicheng Hu, Shawn Wang, Shijun Zhou, Shiming Yang, Shiyong Li, Tianhang Zhu, Wen Xie, Wenhao Huang, Xiang He, Xiaobo Chen, Xiaohui Hu, Xiaoyi Ren, Xinyao Niu, Yanpeng Li, Yongke Zhao, Yongzhen Luo, Yuchi Xu, Yuxuan Sha, Zhaodong Yan, Zhiyuan Liu, Zirui Zhang, Zonghong Dai

专题命中 偏好对齐 :RLHF(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05857 2025-01-07 cs.CL cs.AI cs.LG 80%

Improving Summarization with Human Edits

Zonghai Yao, Benjamin J Schloss, Sai P. Selvaraj

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Proceedings of the Main Conference on Empirical Methods in Natural Language Processing (EMNLP) 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19534 2024-11-01 cs.LG cs.AI cs.CL 80%

Preference Learning Algorithms Do Not Learn Preference Rankings

Angelica Chen, Sadhika Malladi, Lily H. Zhang, Xinyi Chen, Qiuyi Zhang, Rajesh Ranganath, Kyunghyun Cho

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2024 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13542 2024-07-19 cs.CL cs.AI cs.LG 80%

Self-play with Execution Feedback: Improving Instruction-following Capabilities of Large Language Models

Guanting Dong, Keming Lu, Chengpeng Li, Tingyu Xia, Bowen Yu, Chang Zhou, Jingren Zhou

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02479 2024-06-11 cs.LG cs.AI cs.CL cs.HC 80%

BRAIn: Bayesian Reward-conditioned Amortized Inference for natural language generation from feedback

Gaurav Pandey, Yatin Nandwani, Tahira Naseem, Mayank Mishra, Guangxuan Xu, Dinesh Raghu, Sachindra Joshi, Asim Munawar, Ramón Fernandez Astudillo

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at ICML 2024 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17546 2024-05-01 cs.LG cs.AI cs.CL stat.ML 80%

Probabilistic Inference in Language Models via Twisted Sequential Monte Carlo

Stephen Zhao, Rob Brekelmans, Alireza Makhzani, Roger Grosse

专题命中 偏好对齐 :RLHF(abstract);safety(abstract);harmlessness(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10683 2024-02-20 cs.CL cs.AI cs.LG 80%

Large Language Model Unlearning

Yuanshun Yao, Xiaojun Xu, Yang Liu

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);red teaming(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16763 2023-10-26 cs.CL cs.AI cs.LG 80%

SuperHF: Supervised Iterative Learning from Human Feedback

Gabriel Mukobi, Peter Chatain, Su Fong, Robert Windesheim, Gitta Kutyniok, Kush Bhatia, Silas Alberti

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to the Socially Responsible Language Modelling Research (SoLaR) workshop at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12845 2024-06-19 cs.LG cs.CL 80%

Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts

Haoxiang Wang, Wei Xiong, Tengyang Xie, Han Zhao, Tong Zhang

专题命中 偏好对齐 :RLHF(abstract,comments);alignment(abstract);safety(abstract);分类 cs.CL、cs.LG

Comments Technical report v1. Code and model are released at https://github.com/RLHFlow/RLHF-Reward-Modeling/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27366 2026-08-18 cs.CL 版本更新 79%

BridgeAlign: Bridging Preference Alignment for Humanities and Social Sciences

BridgeAlign:面向人文社科的偏好对齐框架

Ru Peng, Haokai Xu, Xijun Gu, Tianyu Zhao, Zhiting Fan, Yawen Zeng, Yihong Zhuang, Jinyang Zhang, Kexin Yang, Jian Wu, Hao Chen, Junyang Lin, Dayiheng Liu, Junbo Zhao

机构 * Alibaba Group(阿里巴巴集团) Ant Group(蚂蚁集团)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 该研究针对人文社科领域的偏好对齐需求,提出BridgeAlign框架,经21万+合成偏好样本对齐后,使Qwen3-8B在17个基准测试中优于11个强基线,且人工偏好与知识能力无权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09164 2026-08-14 cs.AI 版本更新 79%

CIDER: A Dataset of Contextual Disclosure Boundaries for Privacy Preference Alignment

CIDER:用于隐私偏好对齐的上下文披露边界数据集

Bingcan Guo, Eryue Xu, Jijie Zhou, Zhiping Zhang, Tianshi Li

机构 * University of Washington(华盛顿大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Northeastern University(东北大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文推出包含169名用户标注的CIDER数据集,用于评估LLM隐私偏好对齐,发现上下文个性化可提升预测准确率,GPT-5.4和Claude Sonnet 4.6表现更优。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06792 2026-08-10 cs.IR cs.AI 新提交 79%

Progressive Alignment of Recommender Foundation Model through Multi-Phase Post-Training

通过多阶段后训练实现推荐系统基础模型的渐进式对齐

Oseong Choi, Hoeinn Kim, Jihoon Lee, Byungsoo Kang, Taeyeong Jang

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出LP-FFT-RFT三阶段渐进式后训练框架,将推荐系统基础模型的下游适配与业务指标对齐分离,实验证实其能提升推荐质量。

Comments 9 pages, 3 figures. Accepted to the 20th ACM Conference on Recommender Systems (RecSys '26), Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13227 2026-08-07 cs.CL 版本更新 79%

PolyAlign: Conditional Human-Distribution Alignment

PolyAlign: 条件性人类分布对齐

L. D. M. S. Sai Teja, Ufaq Khan, Sathira Silva, Xiao Wu, Muhammad Haris Khan

机构 * NIT Silchar(印度国立理工学院锡尔恰尔分校) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 提出PolyAlign框架,通过桶感知SFT和人类分布偏好优化,实现语言模型在不同交互上下文中的条件性人类分布对齐,提升自然性和分布忠实度。

Comments 23 pages, 5 Figures, 13 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏