arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3235 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3235 篇

2407.08639 2024-10-15 cs.AI cs.LG 81%

$β$-DPO: Direct Preference Optimization with Dynamic $β$

Junkang Wu, Yuexiang Xie, Zhengyi Yang, Jiancan Wu, Jinyang Gao, Bolin Ding, Xiang Wang, Xiangnan He

专题命中 偏好对齐 :DPO(title,abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08464 2024-10-08 cs.CL cs.AI 81%

Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing

Zhangchen Xu, Fengqing Jiang, Luyao Niu, Yuntian Deng, Radha Poovendran, Yejin Choi, Bill Yuchen Lin

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments Link: https://magpie-align.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01789 2024-10-03 cs.LG cs.AI 81%

Investigating on RLHF methodology

Alexey Kutalev, Sergei Markoff

专题命中 偏好对齐 :RLHF(title);alignment(abstract);分类 cs.AI、cs.LG

Comments 23 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18995 2024-10-01 cs.CL cs.AI 81%

Systematic Characterization of the Effectiveness of Alignment in Large Language Models for Categorical Decisions

Isaac Kohane

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments 19 pages (without Appendix) Appendix 7 pages. 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10392 2024-08-21 cs.CL cs.LG 81%

Value Alignment from Unstructured Text

Inkit Padhi, Karthikeyan Natesan Ramamurthy, Prasanna Sattigeri, Manish Nagireddy, Pierre Dognin, Kush R. Varshney

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04655 2024-08-13 cs.CL cs.AI 81%

Strong and weak alignment of large language models with human values

Mehdi Khamassi, Marceau Nahon, Raja Chatila

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments Accepted for publication in Scientific Reports, special issue on AI aligment

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18742 2024-08-08 cs.LG cs.AI 81%

Understanding the Learning Dynamics of Alignment with Human Feedback

Shawn Im, Yixuan Li

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03716 2024-07-12 cs.CL cs.LG 81%

A Long Way to Go: Investigating Length Correlations in RLHF

Prasann Singhal, Tanya Goyal, Jiacheng Xu, Greg Durrett

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.CL、cs.LG

Comments 21 pages, 13 figures, Accepted to COLM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06606 2024-07-09 cs.CL cs.AI 81%

Prototypical Reward Network for Data-Efficient RLHF

Jinghan Zhang, Xiting Wang, Yiqiao Jin, Changyu Chen, Xinhao Zhang, Kunpeng Liu

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02833 2024-07-04 cs.IR cs.CL cs.LG 81%

LANE: Logic Alignment of Non-tuning Large Language Models and Online Recommendation Systems for Explainable Reason Generation

Hongke Zhao, Songming Zheng, Likang Wu, Bowen Yu, Jing Wang

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06503 2024-06-11 cs.CL cs.AI 81%

Knowledgeable Preference Alignment for LLMs in Domain-specific Question Answering

Yichi Zhang, Zhuo Chen, Yin Fang, Yanxi Lu, Fangming Li, Wen Zhang, Huajun Chen

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by ACL 2024 (Findings). Code is available at https://github.com/zjukg/KnowPAT

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20304 2024-05-31 cs.CL cs.LG 81%

Group Robust Preference Optimization in Reward-free RLHF

Shyam Sundhar Ramesh, Yifan Hu, Iason Chaimalas, Viraj Mehta, Pier Giuseppe Sessa, Haitham Bou Ammar, Ilija Bogunovic

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.CL、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19107 2024-05-30 cs.LG cs.AI 81%

Offline Regularised Reinforcement Learning for Large Language Models Alignment

Pierre Harvey Richemond, Yunhao Tang, Daniel Guo, Daniele Calandriello, Mohammad Gheshlaghi Azar, Rafael Rafailov, Bernardo Avila Pires, Eugene Tarassov, Lucas Spangher, Will Ellsworth, Aliaksei Severyn, Jonathan Mallinson, Lior Shani, Gil Shamir, Rishabh Joshi, Tianqi Liu, Remi Munos, Bilal Piot

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17713 2024-05-29 cs.AI cs.LG 81%

AI Alignment with Changing and Influenceable Reward Functions

Micah Carroll, Davis Foote, Anand Siththaranjan, Stuart Russell, Anca Dragan

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

Comments Accepted to ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00254 2024-05-28 cs.AI cs.LG 81%

RLHF from Heterogeneous Feedback via Personalization and Preference Aggregation

Chanwoo Park, Mingyang Liu, Dingwen Kong, Kaiqing Zhang, Asuman Ozdaglar

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.AI、cs.LG

Comments Added experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12900 2024-05-22 cs.CL cs.AI 81%

Adversarial DPO: Harnessing Harmful Data for Reducing Toxicity with Minimal Impact on Coherence and Evasiveness in Dialogue Agents

San Kim, Gary Geunbae Lee

专题命中 偏好对齐 :DPO(title,abstract);分类 cs.CL、cs.AI

Comments 15 pages, 7 figures, accepted to NAACL findings 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00409 2024-04-15 cs.LG cs.CL 81%

Provably Robust DPO: Aligning Language Models with Noisy Feedback

Sayak Ray Chowdhury, Anush Kini, Nagarajan Natarajan

专题命中 偏好对齐 :DPO(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04626 2024-04-09 cs.CL cs.AI 81%

Towards Analyzing and Understanding the Limitations of DPO: A Theoretical Perspective

Duanyu Feng, Bowen Qin, Chen Huang, Zheng Zhang, Wenqiang Lei

专题命中 偏好对齐 :DPO(title,abstract);分类 cs.CL、cs.AI

Comments Draft version

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05553 2024-04-09 cs.CL cs.AI 81%

Removing RLHF Protections in GPT-4 via Fine-Tuning

Qiusi Zhan, Richard Fang, Rohan Bindu, Akul Gupta, Tatsunori Hashimoto, Daniel Kang

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to NAACL 2024. (7 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11124 2024-04-02 cs.CL cs.AI 81%

Scaling Data Diversity for Fine-Tuning Language Models in Human Alignment

Feifan Song, Bowen Yu, Hao Lang, Haiyang Yu, Fei Huang, Houfeng Wang, Yongbin Li

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by LREC-COLING 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.11971 2023-12-27 cs.LG cs.AI 81%

Improving Generalization of Alignment with Human Preferences through Group Invariant Learning

Rui Zheng, Wei Shen, Yuan Hua, Wenbin Lai, Shihan Dou, Yuhao Zhou, Zhiheng Xi, Xiao Wang, Haoran Huang, Tao Gui, Qi Zhang, Xuanjing Huang

专题命中 偏好对齐 :alignment(title);RLHF(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.20033 2023-11-06 cs.CL cs.AI 81%

Synthetic Imitation Edit Feedback for Factual Alignment in Clinical Summarization

Prakamya Mishra, Zonghai Yao, Shuwei Chen, Beining Wang, Rohan Mittal, Hong Yu

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments To appear in NeurIPS 2023 Workshop SyntheticData4ML

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06450 2023-10-12 cs.CL cs.AI 81%

Constructive Large Language Models Alignment with Diverse Feedback

Tianshu Yu, Ting-En Lin, Yuchuan Wu, Min Yang, Fei Huang, Yongbin Li

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06147 2023-10-11 cs.LG cs.AI 81%

Reinforcement Learning in the Era of LLMs: What is Essential? What is needed? An RL Perspective on RLHF, Prompting, and Beyond

Hao Sun

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05871 2023-10-10 cs.AI cs.LG cs.SY eess.SY 81%

Dynamic value alignment through preference aggregation of multiple objectives

Marcin Korecki, Damian Dailisan, Cesare Carissimo

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10202 2023-09-20 cs.CL cs.AI 81%

Stabilizing RLHF through Advantage Model and Selective Rehearsal

Baolin Peng, Linfeng Song, Ye Tian, Lifeng Jin, Haitao Mi, Dong Yu

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.CL、cs.AI

Comments 9 pages, working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.07871 2018-11-20 cs.LG cs.AI cs.NE stat.ML 81%

Scalable agent alignment via reward modeling: a research direction

Jan Leike, David Krueger, Tom Everitt, Miljan Martic, Vishal Maini, Shane Legg

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07253 2026-02-06 cs.LG cs.CV 80%

Alignment of Diffusion Models: Fundamentals, Challenges, and Future

扩散模型对齐:基础、挑战与未来

Buhua Liu, Shitong Shao, Bao Li, Lichen Bai, Zhiqiang Xu, Haoyi Xiong, James Kwok, Sumi Helal, Zeke Xie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Baidu Inc.(百度公司) The University of Bologna(博洛尼亚大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 本文综述了扩散模型对齐的基础、挑战及未来方向,探讨了对齐技术、评估方法及当前挑战的解决方案。

Comments Accepted at ACM Computing Surveys. 35 pages, 5 figures, 4 tables. Paper List: github.com/xie-lab-ml/awesome-alignment-of-diffusion-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01616 2025-10-03 cs.CL 80%

Efficient Training of Robust Traditional Chinese LLaMA-1B on a Single Consumer GPU: Continual Pre-training, SFT, and DPO

Yu-Cheng Chih, Ming-Tao Duan, Yong-Hao Hou

专题命中 偏好对齐 :DPO(title,abstract);分类 cs.CL

Comments 17 pages, 1 figures, 2 tables. Technical report. Introduces PureTC-1B, an adapter-based pipeline for stabilizing Small Language Models in Traditional Chinese using CPT, SFT, and DPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14477 2025-07-15 cs.LG 80%

Data-Centric Human Preference with Rationales for Direct Preference Alignment

Hoang Anh Just, Ming Jin, Anit Sahu, Huy Phan, Ruoxi Jia

机构 * Virginia Tech(弗吉尼亚理工大学) Amazon(亚马逊公司)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

Comments Data-Centric Human Preference with Rationales for Direct Preference Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏