arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3243 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3243 篇

2403.01197 2024-04-30 cs.CL 57%

DMoERM: Recipes of Mixture-of-Experts for Effective Reward Modeling

Shanghaoran Quan

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments 23 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09089 2024-04-18 cs.CL 57%

Qilin-Med: Multi-stage Knowledge Injection Advanced Medical Large Language Model

Qichen Ye, Junling Liu, Dading Chong, Peilin Zhou, Yining Hua, Fenglin Liu, Meng Cao, Ziming Wang, Xuxin Cheng, Zhu Lei, Zhenhua Guo

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09990 2024-04-16 cs.CV cs.AI 57%

HQ-Edit: A High-Quality Dataset for Instruction-based Image Editing

Mude Hui, Siwei Yang, Bingchen Zhao, Yichun Shi, Heng Wang, Peng Wang, Yuyin Zhou, Cihang Xie

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

Comments Project Page: https://thefllood.github.io/HQEdit_web

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08380 2024-04-15 cs.CL 57%

Direct Preference Optimization for Neural Machine Translation with Minimum Bayes Risk Decoding

Guangyu Yang, Jinghong Chen, Weizhe Lin, Bill Byrne

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments To appear at NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02893 2024-04-04 cs.CL 57%

ChatGLM-Math: Improving Math Problem-Solving in Large Language Models with a Self-Critique Pipeline

Yifan Xu, Xiao Liu, Xinghan Liu, Zhenyu Hou, Yueyan Li, Xiaohan Zhang, Zihan Wang, Aohan Zeng, Zhengxiao Du, Wenyi Zhao, Jie Tang, Yuxiao Dong

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09798 2024-03-18 cs.CY 57%

Comparing Rationality Between Large Language Models and Humans: Insights and Open Questions

Dana Alsagheer, Rabimba Karanjai, Nour Diallo, Weidong Shi, Yang Lu, Suha Beydoun, Qiaoning Zhang

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06735 2024-03-12 cs.CV cs.AI 57%

Enhancing Image Caption Generation Using Reinforcement Learning with Human Feedback

Adarsh N L, Arun P, Aravindh N L

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI

Comments 6 Pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02743 2024-03-12 cs.LG 57%

Reward Model Ensembles Help Mitigate Overoptimization

Thomas Coste, Usman Anwar, Robert Kirk, David Krueger

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

Comments Accepted at ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04642 2024-03-08 cs.LG 57%

Teaching Large Language Models to Reason with Reinforcement Learning

Alex Havrilla, Yuqing Du, Sharath Chandra Raparthy, Christoforos Nalmpantis, Jane Dwivedi-Yu, Maksym Zhuravinskyi, Eric Hambro, Sainbayar Sukhbaatar, Roberta Raileanu

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15754 2024-02-27 cs.CL 57%

HD-Eval: Aligning Large Language Model Evaluators Through Hierarchical Criteria Decomposition

Yuxuan Liu, Tianchi Yang, Shaohan Huang, Zihan Zhang, Haizhen Huang, Furu Wei, Weiwei Deng, Feng Sun, Qi Zhang

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.13113 2024-02-27 cs.AI cs.IT cs.MA math.IT q-bio.NC 57%

Interactive inference: a multi-agent model of cooperative joint actions

Domenico Maisto, Francesco Donnarumma, Giovanni Pezzulo

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

Comments 32 pages, 16 figures

Journal ref IEEE Transactions on Systems, Man, and Cybernetics: Systems Volume: 54, Issue: 2, February 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14791 2024-02-26 cs.CL 57%

Prompting Large Language Models for Counterfactual Generation: An Empirical Study

Yongqi Li, Mayi Xu, Xin Miao, Shen Zhou, Tieyun Qian

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments Accepted to LREC-COLING 2024, camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01045 2024-02-13 cs.CL 57%

Tool-Augmented Reward Modeling

Lei Li, Yekun Chai, Shuohuan Wang, Yu Sun, Hao Tian, Ningyu Zhang, Hua Wu

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

Comments ICLR 2024 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04076 2024-02-07 cs.CL 57%

Do LLMs exhibit human-like response biases? A case study in survey design

Lindia Tjuatja, Valerie Chen, Sherry Tongshuang Wu, Ameet Talwalkar, Graham Neubig

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02054 2024-02-06 cs.AI 57%

AlignDiff: Aligning Diverse Human Preferences via Behavior-Customisable Diffusion Model

Zibin Dong, Yifu Yuan, Jianye Hao, Fei Ni, Yao Mu, Yan Zheng, Yujing Hu, Tangjie Lv, Changjie Fan, Zhipeng Hu

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00782 2024-02-02 cs.LG 57%

Dense Reward for Free in Reinforcement Learning from Human Feedback

Alex J. Chan, Hao Sun, Samuel Holt, Mihaela van der Schaar

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00744 2024-02-02 cs.SD cs.CL eess.AS 57%

BATON: Aligning Text-to-Audio Model with Human Preference Feedback

Huan Liao, Haonan Han, Kai Yang, Tianjiao Du, Rui Yang, Zunnan Xu, Qinmei Xu, Jingquan Liu, Jiasheng Lu, Xiu Li

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.14422 2024-02-02 cs.CL 57%

Large Language Models are biased to overestimate profoundness

Eugenio Herrera-Berg, Tomás Vergara Browne, Pablo León-Villagrá, Marc-Lluís Vives, Cristian Buc Calderon

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

Comments 5 pages, 3 figures

Journal ref https://aclanthology.org/2023.emnlp-main.599

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05782 2024-01-17 cs.CL 57%

Aligning Language Models with Human Preferences via a Bayesian Approach

Jiashuo Wang, Haozhao Wang, Shichao Sun, Wenjie Li

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02072 2024-01-05 cs.CL 57%

ICE-GRT: Instruction Context Enhancement by Generative Reinforcement based Transformers

Chen Zheng, Ke Sun, Da Tang, Yukun Ma, Yuyu Zhang, Chenguang Xi, Xun Zhou

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00243 2024-01-02 cs.LG 57%

Uncertainty-Penalized Reinforcement Learning from Human Feedback with Diverse Reward LoRA Ensembles

Yuanzhao Zhai, Han Zhang, Yu Lei, Yue Yu, Kele Xu, Dawei Feng, Bo Ding, Huaimin Wang

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

Comments 10 pages, 5 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.14550 2024-01-02 cs.AI 57%

ReMAV: Reward Modeling of Autonomous Vehicles for Finding Likely Failure Events

Aizaz Sharif, Dusica Marijan

专题命中 偏好对齐 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15907 2023-12-27 cs.CL 57%

Align on the Fly: Adapting Chatbot Behavior to Established Norms

Chunpu Xu, Steffi Chern, Ethan Chern, Ge Zhang, Zekun Wang, Ruibo Liu, Jing Li, Jie Fu, Pengfei Liu

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.10420 2023-12-27 cs.CL 57%

A Comprehensive Capability Analysis of GPT-3 and GPT-3.5 Series Models

Junjie Ye, Xuanting Chen, Nuo Xu, Can Zu, Zekai Shao, Shichun Liu, Yuhan Cui, Zeyang Zhou, Chao Gong, Yang Shen, Jie Zhou, Siming Chen, Tao Gui, Qi Zhang, Xuanjing Huang

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10665 2023-12-19 cs.CV cs.CL 57%

Silkie: Preference Distillation for Large Visual Language Models

Lei Li, Zhihui Xie, Mukai Li, Shunian Chen, Peiyi Wang, Liang Chen, Yazheng Yang, Benyou Wang, Lingpeng Kong

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments Project page: https://vlf-silkie.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.01003 2023-12-19 cs.CV cs.CL 57%

Visual Instruction Tuning with Polite Flamingo

Delong Chen, Jianfeng Liu, Wenliang Dai, Baoyuan Wang

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments In AAAI-24

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13595 2023-11-29 cs.CY 57%

The History and Risks of Reinforcement Learning and Human Feedback

Nathan Lambert, Thomas Krendl Gilbert, Tom Zick

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CY

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.10702 2023-11-21 cs.CL 57%

Camels in a Changing Climate: Enhancing LM Adaptation with Tulu 2

Hamish Ivison, Yizhong Wang, Valentina Pyatkin, Nathan Lambert, Matthew Peters, Pradeep Dasigi, Joel Jang, David Wadden, Noah A. Smith, Iz Beltagy, Hannaneh Hajishirzi

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments technical report; fixed zephyr numbers

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05821 2023-11-13 cs.CL 57%

Let's Reinforce Step by Step

Sarah Pan, Vladislav Lialin, Sherin Muckatira, Anna Rumshisky

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

Comments NeurIPS 2023 Workshop on Instruction Tuning and Instruction Following

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00953 2023-11-03 cs.CL 57%

Blending Reward Functions via Few Expert Demonstrations for Faithful and Accurate Knowledge-Grounded Dialogue Generation

Wanyu Du, Yangfeng Ji

专题命中 偏好对齐 :trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏