arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3243 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3243 篇

2312.01957 2024-04-15 cs.CL cs.LG 62%

Distilled Self-Critique of LLMs with Synthetic Data: a Bayesian Perspective

Victor Gallego

专题命中 偏好对齐 :safety(abstract);分类 cs.CL、cs.LG

Comments Accepted to ICLR 2024 (TinyPapers track)

Journal ref The Second Tiny Papers Track at ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04932 2024-04-09 cs.CL cs.AI 62%

Towards Understanding the Influence of Reward Margin on Preference Model Performance

Bowen Qin, Duanyu Feng, Xi Yang

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17297 2024-03-27 cs.CL cs.AI 62%

InternLM2 Technical Report

Zheng Cai, Maosong Cao, Haojiong Chen, Kai Chen, Keyu Chen, Xin Chen, Xun Chen, Zehui Chen, Zhi Chen, Pei Chu, Xiaoyi Dong, Haodong Duan, Qi Fan, Zhaoye Fei, Yang Gao, Jiaye Ge, Chenya Gu, Yuzhe Gu, Tao Gui, Aijia Guo, Qipeng Guo, Conghui He, Yingfan Hu, Ting Huang, Tao Jiang, Penglong Jiao, Zhenjiang Jin, Zhikai Lei, Jiaxing Li, Jingwen Li, Linyang Li, Shuaibin Li, Wei Li, Yining Li, Hongwei Liu, Jiangning Liu, Jiawei Hong, Kaiwen Liu, Kuikun Liu, Xiaoran Liu, Chengqi Lv, Haijun Lv, Kai Lv, Li Ma, Runyuan Ma, Zerun Ma, Wenchang Ning, Linke Ouyang, Jiantao Qiu, Yuan Qu, Fukai Shang, Yunfan Shao, Demin Song, Zifan Song, Zhihao Sui, Peng Sun, Yu Sun, Huanze Tang, Bin Wang, Guoteng Wang, Jiaqi Wang, Jiayu Wang, Rui Wang, Yudong Wang, Ziyi Wang, Xingjian Wei, Qizhen Weng, Fan Wu, Yingtong Xiong, Chao Xu, Ruiliang Xu, Hang Yan, Yirong Yan, Xiaogui Yang, Haochen Ye, Huaiyuan Ying, Jia Yu, Jing Yu, Yuhang Zang, Chuyu Zhang, Li Zhang, Pan Zhang, Peng Zhang, Ruijie Zhang, Shuo Zhang, Songyang Zhang, Wenjian Zhang, Wenwei Zhang, Xingcheng Zhang, Xinyue Zhang, Hui Zhao, Qian Zhao, Xiaomeng Zhao, Fengzhe Zhou, Zaida Zhou, Jingming Zhuo, Yicheng Zou, Xipeng Qiu, Yu Qiao, Dahua Lin

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15694 2024-03-27 cs.LG cs.CL 62%

COPR: Continual Learning Human Preference through Optimal Policy Regularization

Han Zhang, Lin Gui, Yuanzhao Zhai, Hui Wang, Yu Lei, Ruifeng Xu

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10314 2024-03-20 cs.CL cs.AI cs.SE 62%

LeTI: Learning to Generate from Textual Interactions

Xingyao Wang, Hao Peng, Reyhaneh Jabbarvand, Heng Ji

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

Comments NAACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09720 2024-03-18 cs.CL cs.AI 62%

Fine-tuning vs Prompting, Can Language Models Understand Human Values?

Pingwei Sun

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07708 2024-03-15 cs.CL cs.AI 62%

Improving Reinforcement Learning from Human Feedback Using Contrastive Rewards

Wei Shen, Xiaoying Zhang, Yuanshun Yao, Rui Zheng, Hongyi Guo, Yang Liu

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07691 2024-03-15 cs.CL cs.AI 62%

ORPO: Monolithic Preference Optimization without Reference Model

Jiwoo Hong, Noah Lee, James Thorne

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04132 2024-03-08 cs.AI cs.CL 62%

Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference

Wei-Lin Chiang, Lianmin Zheng, Ying Sheng, Anastasios Nikolas Angelopoulos, Tianle Li, Dacheng Li, Hao Zhang, Banghua Zhu, Michael Jordan, Joseph E. Gonzalez, Ion Stoica

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00830 2024-03-05 cs.AI cs.CL 62%

MedAide: Leveraging Large Language Models for On-Premise Medical Assistance on Edge Devices

Abdul Basit, Khizar Hussain, Muhammad Abdullah Hanif, Muhammad Shafique

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

Comments 7 pages, 11 figures, ACM conference paper, 33 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.00131 2024-02-23 cs.CL cs.AI 62%

Underspecification in Language Modeling Tasks: A Causality-Informed Study of Gendered Pronoun Resolution

Emily McMilin

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

Comments 24 pages, 41 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08078 2024-02-14 cs.CL cs.LG 62%

Large Language Models as Agents in Two-Player Games

Yang Liu, Peng Sun, Hang Li

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12292 2024-02-01 cs.CL cs.AI 62%

GRATH: Gradual Self-Truthifying for Large Language Models

Weixin Chen, Dawn Song, Bo Li

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10882 2024-01-22 cs.CL cs.AI cs.HC 62%

Reinforcement learning for question answering in programming domain using public community scoring as a human feedback

Alexey Gorbatovski, Sergey Kovalchuk

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02870 2024-01-08 cs.MA cs.AI cs.CL 62%

AFSPP: Agent Framework for Shaping Preference and Personality with Large Language Models

Zihong He, Changwang Zhang

专题命中 偏好对齐 :trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13301 2024-01-08 cs.LG cs.AI cs.CV 62%

Training Diffusion Models with Reinforcement Learning

Kevin Black, Michael Janner, Yilun Du, Ilya Kostrikov, Sergey Levine

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

Comments 23 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12050 2023-12-12 cs.CL cs.AI 62%

Aligning Language Models with Offline Learning from Human Feedback

Jian Hu, Li Tao, June Yang, Chandler Zhou

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02206 2023-12-06 cs.AI cs.CL 62%

Axiomatic Preference Modeling for Longform Question Answering

Corby Rosset, Guoqing Zheng, Victor Dibia, Ahmed Awadallah, Paul Bennett

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00416 2023-11-02 cs.LG cs.CL 62%

Efficient Human-AI Coordination via Preparatory Language-based Convention

Cong Guan, Lichao Zhang, Chunpeng Fan, Yichen Li, Feng Chen, Lihe Li, Yunjia Tian, Lei Yuan, Yang Yu

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07123 2023-10-17 cs.LG cs.AI 62%

Off-Policy Evaluation for Human Feedback

Qitong Gao, Ge Gao, Juncheng Dong, Vahid Tarokh, Min Chi, Miroslav Pajic

专题命中 偏好对齐 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted to NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05914 2023-10-11 cs.CL cs.LG 62%

NEFTune: Noisy Embeddings Improve Instruction Finetuning

Neel Jain, Ping-yeh Chiang, Yuxin Wen, John Kirchenbauer, Hong-Min Chu, Gowthami Somepalli, Brian R. Bartoldson, Bhavya Kailkhura, Avi Schwarzschild, Aniruddha Saha, Micah Goldblum, Jonas Geiping, Tom Goldstein

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.LG

Comments 25 pages, Code is available on Github: https://github.com/neelsjain/NEFTune

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02456 2023-10-05 cs.LG cs.AI 62%

Learning Optimal Advantage from Preferences and Mistaking it for Reward

W. Bradley Knox, Stephane Hatgis-Kessell, Sigurdur Orn Adalgeirsson, Serena Booth, Anca Dragan, Peter Stone, Scott Niekum

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

Comments 8 pages (16 pages with references and appendix), 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.11166 2023-09-28 cs.CL cs.AI 62%

Are Large Language Models Really Robust to Word-Level Perturbations?

Haoyu Wang, Guozheng Ma, Cong Yu, Ning Gui, Linrui Zhang, Zhiqi Huang, Suwei Ma, Yongzhe Chang, Sen Zhang, Li Shen, Xueqian Wang, Peilin Zhao, Dacheng Tao

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.03224 2023-09-13 cs.AI cs.LG 62%

No Train Still Gain. Unleash Mathematical Reasoning of Large Language Models with Monte Carlo Tree Search Guided by Energy Function

Haotian Xu

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

Comments still in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.08998 2023-08-22 cs.CL cs.LG 62%

Reinforced Self-Training (ReST) for Language Modeling

Caglar Gulcehre, Tom Le Paine, Srivatsan Srinivasan, Ksenia Konyushkova, Lotte Weerts, Abhishek Sharma, Aditya Siddhant, Alex Ahern, Miaosen Wang, Chenjie Gu, Wolfgang Macherey, Arnaud Doucet, Orhan Firat, Nando de Freitas

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.LG

Comments 23 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.16039 2023-08-03 cs.CL cs.LG 62%

Okapi: Instruction-tuned Large Language Models in Multiple Languages with Reinforcement Learning from Human Feedback

Viet Dac Lai, Chien Van Nguyen, Nghia Trung Ngo, Thuat Nguyen, Franck Dernoncourt, Ryan A. Rossi, Thien Huu Nguyen

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.10512 2023-07-21 cs.CL cs.AI 62%

IvyGPT: InteractiVe Chinese pathwaY language model in medical domain

Rongsheng Wang, Yaofei Duan, ChanTong Lam, Jiexi Chen, Jiangsheng Xu, Haoming Chen, Xiaohong Liu, Patrick Cheong-Iao Pang, Tao Tan

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.08582 2023-06-16 cs.CL cs.LG 62%

Pretraining Language Models with Human Preferences

Tomasz Korbak, Kejian Shi, Angelica Chen, Rasika Bhalerao, Christopher L. Buckley, Jason Phang, Samuel R. Bowman, Ethan Perez

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.LG

Comments ICML 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.09363 2023-06-06 cs.CL cs.AI cs.IR 62%

Towards Unified Conversational Recommender Systems via Knowledge-Enhanced Prompt Learning

Xiaolei Wang, Kun Zhou, Ji-Rong Wen, Wayne Xin Zhao

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted by KDD 2022. Code: https://github.com/RUCAIBox/UniCRS

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15541 2023-05-26 cs.CL cs.AI 62%

Harnessing the Power of Large Language Models for Natural Language to First-Order Logic Translation

Yuan Yang, Siheng Xiong, Ali Payani, Ehsan Shareghi, Faramarz Fekri

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏