arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3243 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3243 篇

2409.06903 2024-09-12 cs.LG 57%

Semi-Supervised Reward Modeling via Iterative Self-Training

Yifei He, Haoxiang Wang, Ziyan Jiang, Alexandros Papangelis, Han Zhao

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.17026 2024-09-02 cs.CL 57%

From Text to Emotion: Unveiling the Emotion Annotation Capabilities of LLMs

Minxue Niu, Mimansa Jaiswal, Emily Mower Provost

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments to be published in Interspeech 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15565 2024-08-29 cs.CL 57%

SIaM: Self-Improving Code-Assisted Mathematical Reasoning of Large Language Models

Dian Yu, Baolin Peng, Ye Tian, Linfeng Song, Haitao Mi, Dong Yu

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11791 2024-08-22 cs.LG 57%

Critique-out-Loud Reward Models

Zachary Ankner, Mansheej Paul, Brandon Cui, Jonathan D. Chang, Prithviraj Ammanabrolu

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09244 2024-08-20 cs.LG 57%

Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking

Jacob Eisenstein, Chirag Nagpal, Alekh Agarwal, Ahmad Beirami, Alex D'Amour, DJ Dvijotham, Adam Fisch, Katherine Heller, Stephen Pfohl, Deepak Ramachandran, Peter Shaw, Jonathan Berant

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

Comments Published at the 2024 Conference on Language Modeling (CoLM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18349 2024-08-09 cs.CL 57%

Rejection Improves Reliability: Training LLMs to Refuse Unknown Questions Using RL from Knowledge Feedback

Hongshen Xu, Zichen Zhu, Situo Zhang, Da Ma, Shuai Fan, Lu Chen, Kai Yu

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02923 2024-08-07 cs.CL 57%

Intermediate direct preference optimization

Atsushi Kojima

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02919 2024-08-07 cs.CL 57%

Data Checklist: On Unit-Testing Datasets with Usable Information

Heidi C. Zhang, Shabnam Behzad, Kawin Ethayarajh, Dan Jurafsky

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments 17 pages, 4 figures. COLM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02302 2024-08-06 cs.CL 57%

SNFinLLM: Systematic and Nuanced Financial Domain Adaptation of Chinese Large Language Models

Shujuan Zhao, Lingfeng Qiao, Kangyang Luo, Qian-Wen Zhang, Junru Lu, Di Yin

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05695 2024-08-06 cs.CL 57%

Integrating Physician Diagnostic Logic into Large Language Models: Preference Learning from Process Feedback

Chengfeng Dou, Zhi Jin, Wenpin Jiao, Haiyan Zhao, Yongqiang Zhao, Zhenwei Tao

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments Accepted by ACL2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21032 2024-08-01 cs.CV cs.AI 57%

Safeguard Text-to-Image Diffusion Models with Human Feedback Inversion

Sanghyun Kim, Seohyeon Jung, Balhae Kim, Moonseok Choi, Jinwoo Shin, Juho Lee

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

Comments ECCV 2024. 56 pages, 24 figures. Caution: This paper contains discussions and examples related to harmful content, including text and images. Reader discretion is advised. Code is available at https://github.com/nannullna/safeguard-hfi

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12793 2024-07-31 cs.CL 57%

ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools

Team GLM, :, Aohan Zeng, Bin Xu, Bowen Wang, Chenhui Zhang, Da Yin, Dan Zhang, Diego Rojas, Guanyu Feng, Hanlin Zhao, Hanyu Lai, Hao Yu, Hongning Wang, Jiadai Sun, Jiajie Zhang, Jiale Cheng, Jiayi Gui, Jie Tang, Jing Zhang, Jingyu Sun, Juanzi Li, Lei Zhao, Lindong Wu, Lucen Zhong, Mingdao Liu, Minlie Huang, Peng Zhang, Qinkai Zheng, Rui Lu, Shuaiqi Duan, Shudan Zhang, Shulin Cao, Shuxun Yang, Weng Lam Tam, Wenyi Zhao, Xiao Liu, Xiao Xia, Xiaohan Zhang, Xiaotao Gu, Xin Lv, Xinghan Liu, Xinyi Liu, Xinyue Yang, Xixuan Song, Xunkai Zhang, Yifan An, Yifan Xu, Yilin Niu, Yuantao Yang, Yueyan Li, Yushi Bai, Yuxiao Dong, Zehan Qi, Zhaoyu Wang, Zhen Yang, Zhengxiao Du, Zhenyu Hou, Zihan Wang

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13928 2024-07-22 cs.CL 57%

BiasDPO: Mitigating Bias in Language Models through Direct Preference Optimization

Ahmed Allam

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19833 2024-07-10 cs.NI cs.AI 57%

ChatTracer: Large Language Model Powered Real-time Bluetooth Device Tracking System

Qijun Wang, Shichen Zhang, Kunzhe Song, Huacheng Zeng

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09132 2024-07-08 cs.CL 57%

Aligning Neural Machine Translation Models: Human Feedback in Training and Inference

Miguel Moura Ramos, Patrick Fernandes, António Farinhas, André F. T. Martins

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

Comments EAMT 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16029 2024-07-04 cs.CL 57%

GraphWiz: An Instruction-Following Language Model for Graph Problems

Nuo Chen, Yuhan Li, Jianheng Tang, Jia Li

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments 27pages, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00215 2024-07-02 cs.SE cs.LG 57%

LLM Critics Help Catch LLM Bugs

Nat McAleese, Rai Michael Pokorny, Juan Felipe Ceron Uribe, Evgenia Nitishinskaya, Maja Trebacz, Jan Leike

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.20060 2024-07-01 cs.CL 57%

Applying RLAIF for Code Generation with API-usage in Lightweight LLMs

Sujan Dutta, Sayantan Mahinder, Raviteja Anantha, Bortik Bandyopadhyay

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14981 2024-06-24 cs.AI cs.HC 57%

Human-AI collectives produce the most accurate differential diagnoses

N. Zöller, J. Berger, I. Lin, N. Fu, J. Komarneni, G. Barabucci, K. Laskowski, V. Shia, B. Harack, E. A. Chu, V. Trianni, R. H. J. M. Kurvers, S. M. Herzog

专题命中 偏好对齐 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11191 2024-06-19 cs.CL 57%

A Survey on Human Preference Learning for Large Language Models

Ruili Jiang, Kehai Chen, Xuefeng Bai, Zhixuan He, Juntao Li, Muyun Yang, Tiejun Zhao, Liqiang Nie, Min Zhang

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments IEEE copyright statement added (also applied to the former version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10991 2024-06-18 cs.CL 57%

Adaptive Query Rewriting: Aligning Rewriters through Marginal Probability of Conversational Answers

Tianhua Zhang, Kun Li, Hongyin Luo, Xixin Wu, James Glass, Helen Meng

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07295 2024-06-13 cs.LG 57%

Multi-objective Reinforcement learning from AI Feedback

Marcus Williams

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04583 2024-06-10 cs.CL 57%

Extroversion or Introversion? Controlling The Personality of Your Large Language Models

Yanquan Chen, Zhen Wu, Junjie Guo, Shujian Huang, Xinyu Dai

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01771 2024-06-05 cs.CL 57%

LLMs Beyond English: Scaling the Multilingual Capability of LLMs with Cross-Lingual Feedback

Wen Lai, Mohsen Mesgar, Alexander Fraser

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments Accepted to Findings of ACL 2024. The code, datasets, and models are publicly available at https://github.com/boschresearch/ACL24-MLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20253 2024-05-31 cs.CL 57%

Evaluating Large Language Model Biases in Persona-Steered Generation

Andy Liu, Mona Diab, Daniel Fried

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

Comments Accepted to Findings of ACL 2024. Code and data available at https://github.com/andyjliu/persona-steered-generation-bias

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09764 2024-05-31 cs.AI 57%

Aligning Crowd Feedback via Distributional Preference Reward Modeling

Dexun Li, Cong Zhang, Kuicai Dong, Derrick Goh Xin Deik, Ruiming Tang, Yong Liu

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12174 2024-05-31 cs.CL 57%

BIDER: Bridging Knowledge Inconsistency for Efficient Retrieval-Augmented LLMs via Key Supporting Evidence

Jiajie Jin, Yutao Zhu, Yujia Zhou, Zhicheng Dou

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments Accepted by ACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02054 2024-05-30 cs.CL 57%

Deconstructing In-Context Learning: Understanding Prompts via Corruption

Namrata Shivagunde, Vladislav Lialin, Sherin Muckatira, Anna Rumshisky

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments Accepted to LREC-COLING 2024 main conference. The code is available at https://github.com/text-machine-lab/Understanding_prompts_via_corruption

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10505 2024-05-17 cs.LG 57%

ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models

Ziniu Li, Tian Xu, Yushun Zhang, Zhihang Lin, Yang Yu, Ruoyu Sun, Zhi-Quan Luo

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00394 2024-05-02 cs.GT cs.LG 57%

Enhancing Mutual Trustworthiness in Federated Learning for Data-Rich Smart Cities

Osama Wehbi, Sarhad Arisdakessian, Mohsen Guizani, Omar Abdel Wahab, Azzam Mourad, Hadi Otrok, Hoda Al khzaimi, Bassem Ouni

专题命中 偏好对齐 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏