arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 30608 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3243 篇

2506.15706 2025-06-23 cs.LG cs.AI 62%

MDPO: Multi-Granularity Direct Preference Optimization for Mathematical Reasoning

Yunze Lin

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21349 2025-06-23 cs.LG cs.AI cs.PF 62%

FALCON: Feedback-driven Adaptive Long/short-term memory reinforced Coding Optimization system

Zeyuan Li, Yangfan He, Lewei He, Jianhui Wang, Tianyu Shi, Bin Lei, Yuchen Li, Qiuwu Chen

机构 * School of Software, South China Normal University(南方科技大学软件学院) University of Minnesota - Twin Cities(明尼苏达大学双城分校) University of Electronic Science and Technology of China(电子科技大学) University of Toronto(多伦多大学) University of Connecticut(康涅狄格大学) AI center, AIGCode Inc.(AIGCode公司人工智能中心)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11098 2025-06-16 cs.LG cs.AI 62%

Debiasing Online Preference Learning via Preference Feature Preservation

Dongyoung Kim, Jinsung Yoon, Jinwoo Shin, Jaehyung Kim

机构 * KAIST(韩国科学技术院) Google Cloud AI Research(谷歌云人工智能研究) Yonsei University(延世大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

Comments 20 page, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07091 2025-06-13 cs.AI cs.LG 62%

AssistanceZero: Scalably Solving Assistance Games

Cassidy Laidlaw, Eli Bronstein, Timothy Guo, Dylan Feng, Lukas Berglund, Justin Svegliato, Stuart Russell, Anca Dragan

机构 * ucb(加州大学伯克利分校)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

Comments Presented at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04793 2025-06-12 cs.CL cs.LG 62%

Sentence-level Reward Model can Generalize Better for Aligning LLM from Human Preference

Wenjie Qiu, Yi-Chen Li, Xuqin Zhang, Tianyi Zhang, Yihang Zhang, Zongzhang Zhang, Yang Yu

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07165 2025-06-10 cs.LG cs.AI 62%

AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models

Qi Liu, Jingqing Ruan, Hao Li, Haodong Zhao, Desheng Wang, Jiansong Chen, Wan Guanglu, Xunliang Cai, Zhi Zheng, Tong Xu

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

Comments Accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01903 2025-06-10 cs.LG cs.AI 62%

LookAlike: Consistent Distractor Generation in Math MCQs

Nisarg Parikh, Nigel Fernandez, Alexander Scarlatos, Simon Woodhead, Andrew Lan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Eedi

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11716 2025-06-10 cs.CL cs.AI cs.HC cs.MA 62%

LLMs Can Simulate Standardized Patients via Agent Coevolution

Zhuoyun Du, Lujie Zheng, Renjun Hu, Yuyang Xu, Xiawei Li, Ying Sun, Wei Chen, Jian Wu, Haolei Cai, Haohao Ying

机构 * State Key Lab of CAD & CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Zhejiang Polytechnic Institute, Polytechnic Institute, Zhejiang University(浙江工业大学之江学院) College of Computer Science & Technology, Zhejiang University(浙江大学计算机科学与技术学院) East China Normal University(华东师范大学) Sun Yat-sen University Cancer Center(中山大学肿瘤中心) School of Public Health, Zhejiang University(浙江大学公共卫生学院) Second Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院第二附属医院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted to ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05598 2025-06-09 cs.CL cs.AI 62%

SynthesizeMe! Inducing Persona-Guided Prompts for Personalized Reward Models in LLMs

Michael J Ryan, Omar Shaikh, Aditri Bhagirath, Daniel Frees, William Held, Diyi Yang

机构 * Stanford University(斯坦福大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

Comments ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03541 2025-06-05 cs.CL cs.AI 62%

Debate, Reflect, and Distill: Multi-Agent Feedback with Tree-Structured Preference Optimization for Efficient Language Model Enhancement

Xiaofeng Zhou, Heyan Huang, Lizi Liao

机构 * Beijing Institute of Technology(北京理工大学) Singapore Management University(新加坡国立大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

Comments 16 pages, 10 figures. The camera-ready paper for Findings of ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03077 2025-06-04 cs.LG cs.AI 62%

StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs

Qijun Luo, Mengqi Li, Lei Zhao, Xiao Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Jiao Tong University(上海交通大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02481 2025-06-04 cs.CL cs.AI 62%

Do Language Models Think Consistently? A Study of Value Preferences Across Varying Response Lengths

Inderjeet Nair, Lu Wang

机构 * University of Michigan(密歇根大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00418 2025-06-04 cs.CL cs.AI 62%

Self-Evolved Reward Learning for LLMs

Chenghua Huang, Zhizhen Fan, Lu Wang, Fangkai Yang, Pu Zhao, Zeqi Lin, Qingwei Lin, Dongmei Zhang, Saravan Rajmohan, Qi Zhang

机构 * School of Computer Science, Fudan University(复旦大学计算机学院) School of Computer Science, Peking University(北京大学计算机学院) Microsoft(微软公司)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

Comments 23 pages,6 figures,Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00930 2025-06-03 cs.AI cs.CL 62%

Aligning VLM Assistants with Personalized Situated Cognition

Yongqi Li, Shen Zhou, Xiaohu Li, Xin Miao, Jintao Wen, Mayi Xu, Jianhao Chen, Birong Pan, Hankun Kang, Yuanyuan Zhu, Ming Zhong, Tieyun Qian

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Academy(中关村学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted to ACL 2025 (main), camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00577 2025-06-03 cs.AI cs.CL cs.GT cs.MA 62%

Reasoning Like an Economist: Post-Training on Economic Problems Induces Strategic Generalization in LLMs

Yufa Zhou, Shaobo Wang, Xingyu Dong, Xiangqi Jin, Yifang Chen, Yue Min, Kexin Yang, Xingzhang Ren, Dayiheng Liu, Linfeng Zhang

机构 * Duke University(杜克大学) EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Qwen Team, Alibaba Group(阿里集团Qwen团队) University of Pennsylvania(宾夕法尼亚大学) The University of Chicago(芝加哥大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18744 2025-06-03 cs.AI cs.CL 62%

ZEBRA: Leveraging Model-Behavioral Knowledge for Zero-Annotation Preference Dataset Construction

Jeesu Jung, Chanjun Park, Sangkeun Jung

机构 * Chungnam National University(Chungnam 国立大学) Korea University(韩国大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

Comments 16 pages,7 figures,5 tables,4 graphs

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04945 2025-06-03 cs.CL cs.AI 62%

Step-by-Step Mastery: Enhancing Soft Constraint Following Ability of Large Language Models

Qingyu Ren, Jie Zeng, Qianyu He, Jiaqing Liang, Yanghua Xiao, Weikang Zhou, Zeye Sun, Fei Yu

机构 * Shanghai Key Laboratory of Data Science, College of Computer Science and Artificial Intelligence, Fudan University(上海数据科学 key laboratory,计算机科学与人工智能学院,复旦大学) School of Data Science, Fudan University(数据科学学院,复旦大学) Ant Group(蚂蚁集团)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24709 2025-06-02 cs.LG cs.AI 62%

On Symmetric Losses for Robust Policy Optimization with Noisy Preferences

Soichiro Nishimori, Yu-Jie Zhang, Thanawat Lodkaew, Masashi Sugiyama

机构 * The University of Tokyo, Japan(东京大学) RIKEN AIP, Japan(日本理化学研究所AIP)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11541 2025-06-02 cs.CL cs.AI 62%

MuSC: Improving Complex Instruction Following with Multi-granularity Self-Contrastive Training

Hui Huang, Jiaheng Liu, Yancheng He, Shilong Li, Bing Xu, Conghui Zhu, Muyun Yang, Tiejun Zhao

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Nanjing University(南京大学) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted to ACL2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23815 2025-06-02 cs.CL cs.LG 62%

Aligning LLMs by Predicting Preferences from User Writing Samples

Stéphane Aroca-Ouellette, Natalie Mackraz, Barry-John Theobald, Katherine Metcalf

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.LG

Comments Accepted to ICML 2025. 32 pages total: 9 main, 2 references, 21 appendix. arXiv admin note: substantial text overlap with arXiv:2410.06273

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02229 2025-05-30 cs.AI cs.CL 62%

CodePMP: Scalable Preference Model Pretraining for Large Language Model Reasoning

Huimu Yu, Xing Wu, Haotian Xu, Debing Zhang, Songlin Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Xiaohongshu Inc(小红书公司)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22613 2025-05-29 cs.CV cs.AI cs.CL 62%

RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction

Yuchi Wang, Yishuo Cai, Shuhuai Ren, Sihan Yang, Linli Yao, Yuanxin Liu, Yuanxing Zhang, Pengfei Wan, Xu Sun

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

Comments code: https://github.com/wangyuchi369/RICO

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00602 2025-05-29 cs.CL cs.LG 62%

Mitigating Heterogeneous Token Overfitting in LLM Knowledge Editing

Tianci Liu, Ruirui Li, Zihan Dong, Hui Liu, Xianfeng Tang, Qingyu Yin, Linjun Zhang, Haoyu Wang, Jing Gao

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.LG

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21074 2025-05-28 cs.LG cs.AI cs.CR cs.CV stat.ML 62%

Red-Teaming Text-to-Image Systems by Rule-based Preference Modeling

Yichuan Cao, Yibo Miao, Xiao-Shan Gao, Yinpeng Dong

机构 * KLMM, UCAS, Academy of Mathematics and Systems Science, Chinese Academy of Sciences(UCAS信息科学学院、数学与系统科学研究院、中国科学院) College of AI, Tsinghua University(清华大学人工智能学院)

专题命中 偏好对齐 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20336 2025-05-28 cs.CL cs.AI 62%

MOSLIM:Align with diverse preferences in prompts through reward classification

Yu Zhang, Wanli Jiang, Zhengyu Yang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06638 2025-05-28 cs.CL cs.AI 62%

Subtle Errors in Reasoning: Preference Learning via Error-injected Self-editing

Kaishuai Xu, Tiezheng Yu, Wenjun Hou, Yi Cheng, Chak Tou Leong, Liangyou Li, Xin Jiang, Lifeng Shang, Qun Liu, Wenjie Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

Comments accepted as ACL 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12323 2025-05-27 cs.CL cs.AI 62%

Reversal of Thought: Enhancing Large Language Models with Preference-Guided Reverse Reasoning Warm-up

Jiahao Yuan, Dehui Du, Hao Zhang, Zixiang Di, Usman Naseem

机构 * East China Normal University(东华大学) Macquarie University(麦考瑞大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

Comments Accepted by ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18830 2025-05-27 cs.LG cs.CL 62%

On the Effect of Negative Gradient in Group Relative Deep Reinforcement Optimization

Wenlong Deng, Yi Ren, Muchen Li, Danica J. Sutherland, Xiaoxiao Li, Christos Thrampoulidis

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16529 2025-05-26 cs.CL cs.AI 62%

Retrieval-Augmented Fine-Tuning With Preference Optimization For Visual Program Generation

Deokhyung Kang, Jeonghun Cho, Yejin Jeon, Sunbin Jang, Minsub Lee, Jawoon Cho, Gary Geunbae Lee

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

Comments Accepted at ACL 2025 (Main, long paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18511 2025-05-26 cs.LG cs.CL 62%

WILDCHAT-50M: A Deep Dive Into the Role of Synthetic Data in Post-Training

Benjamin Feuer, Chinmay Hegde

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.LG

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏