arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 30608 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3243 篇

2408.15266 2024-08-29 cs.HC cs.AI cs.CY 62%

People over trust AI-generated medical responses and view them to be as valid as doctors, despite low accuracy

Shruthi Shekar, Pat Pataranutaporn, Chethan Sarabu, Guillermo A. Cecchi, Pattie Maes

专题命中 偏好对齐 :trustworthy(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13709 2024-08-23 cs.CL cs.LG 62%

Understanding Reference Policies in Direct Preference Optimization

Yixin Liu, Pengfei Liu, Arman Cohan

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.LG

Comments GitHub Repo: https://github.com/yale-nlp/refdpo

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07199 2024-08-15 cs.AI cs.LG 62%

Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents

Pranav Putta, Edmund Mills, Naman Garg, Sumeet Motwani, Chelsea Finn, Divyansh Garg, Rafael Rafailov

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06142 2024-08-13 cs.CL cs.AI 62%

Med42-v2: A Suite of Clinical LLMs

Clément Christophe, Praveen K Kanithi, Tathagata Raha, Shadab Khan, Marco AF Pimentel

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06836 2024-08-08 cs.CL cs.AI 62%

Enhancing Emotional Generation Capability of Large Language Models via Emotional Chain-of-Thought

Zaijing Li, Gongwei Chen, Rui Shao, Yuquan Xie, Dongmei Jiang, Liqiang Nie

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02861 2024-08-07 cs.CL cs.LG 62%

A Framework for Fine-Tuning LLMs using Heterogeneous Feedback

Ryan Aponte, Ryan A. Rossi, Shunan Guo, Franck Dernoncourt, Tong Yu, Xiang Chen, Subrata Mitra, Nedim Lipka

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.LG

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00804 2024-08-05 cs.AR cs.AI cs.LG 62%

ChipExpert: The Open-Source Integrated-Circuit-Design-Specific Large Language Model

Ning Xu, Zhaoyang Zhang, Lei Qi, Wensuo Wang, Chao Zhang, Zihao Ren, Huaiyuan Zhang, Xin Cheng, Yanqi Zhang, Zhichao Liu, Qingwen Wei, Shiyang Wu, Lanlan Yang, Qianfeng Lu, Yiqun Ma, Mengyao Zhao, Junbo Liu, Yufan Song, Xin Geng, Jun Yang

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00045 2024-07-31 cs.CL cs.LG 62%

Personalized Steering of Large Language Models: Versatile Steering Vectors Through Bi-directional Preference Optimization

Yuanpu Cao, Tianrong Zhang, Bochuan Cao, Ziyi Yin, Lu Lin, Fenglong Ma, Jinghui Chen

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12810 2024-07-26 cs.LG cs.AI 62%

Enhancing Counterfactual Explanation Search with Diffusion Distance and Directional Coherence

Marharyta Domnich, Raul Vicente

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

Comments This work has been accepted to be presented to The 2nd World Conference on eXplainable Artificial Intelligence (xAI 2024), July 17-19, 2024 - Valletta, Malta

Journal ref In: Longo, L., Lapuschkin, S., Seifert, C. (eds) Explainable Artificial Intelligence. xAI 2024. Communications in Computer and Information Science, vol 2155. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14268 2024-07-22 cs.HC cs.AI cs.CY 62%

Urban Visual Appeal According to ChatGPT: Contrasting AI and Human Insights

Milad Malekzadeh, Elias Willberg, Jussi Torkko, Tuuli Toivonen

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.CY

Comments 42 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10759 2024-07-16 eess.AS cs.CL cs.LG 62%

Qwen2-Audio Technical Report

Yunfei Chu, Jin Xu, Qian Yang, Haojie Wei, Xipin Wei, Zhifang Guo, Yichong Leng, Yuanjun Lv, Jinzheng He, Junyang Lin, Chang Zhou, Jingren Zhou

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.LG

Comments https://github.com/QwenLM/Qwen2-Audio. Checkpoints, codes and scripts will be opensoursed soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05171 2024-07-10 cs.LG cs.AI 62%

Overcoming Reward Overoptimization via Adversarial Policy Optimization with Lightweight Uncertainty Estimation

Xiaoying Zhang, Jean-Francois Ton, Wei Shen, Hongning Wang, Yang Liu

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15474 2024-06-25 cs.AI cs.CL cs.HC 62%

WundtGPT: Shaping Large Language Models To Be An Empathetic, Proactive Psychologist

Chenyu Ren, Yazhou Zhang, Daihai He, Jing Qin

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00451 2024-06-19 cs.AI cs.LG 62%

Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning

Yuxi Xie, Anirudh Goyal, Wenyue Zheng, Min-Yen Kan, Timothy P. Lillicrap, Kenji Kawaguchi, Michael Shieh

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG

Comments 10 pages, 4 figures, 4 tables (24 pages, 9 figures, 9 tables including references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06496 2024-06-18 cs.LG cs.CL cs.CV 62%

Direct Preference Optimization for Suppressing Hallucinated Prior Exams in Radiology Report Generation

Oishi Banerjee, Hong-Yu Zhou, Subathra Adithan, Stephen Kwak, Kay Wu, Pranav Rajpurkar

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.LG

Comments Added acknowledgemnts

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10986 2024-06-17 cs.CL cs.AI 62%

FinTral: A Family of GPT-4 Level Multimodal Financial Large Language Models

Gagan Bhatia, El Moatez Billah Nagoudi, Hasan Cavusoglu, Muhammad Abdul-Mageed

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05074 2024-06-17 cs.CL cs.AI 62%

GRASP: A Disagreement Analysis Framework to Assess Group Associations in Perspectives

Vinodkumar Prabhakaran, Christopher Homan, Lora Aroyo, Aida Mostafazadeh Davani, Alicia Parrish, Alex Taylor, Mark Díaz, Ding Wang, Gregory Serapio-García

专题命中 偏好对齐 :safety(abstract);分类 cs.CL、cs.AI

Comments Presented as a long paper at NAACL 2024 main conference

Journal ref 2024 Annual Conference of the North American Chapter of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00886 2024-06-12 stat.ML cs.AI cs.GT cs.LG cs.MA 62%

Nash Learning from Human Feedback

Rémi Munos, Michal Valko, Daniele Calandriello, Mohammad Gheshlaghi Azar, Mark Rowland, Zhaohan Daniel Guo, Yunhao Tang, Matthieu Geist, Thomas Mesnard, Andrea Michi, Marco Selvi, Sertan Girgin, Nikola Momchev, Olivier Bachem, Daniel J. Mankowitz, Doina Precup, Bilal Piot

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04913 2024-06-12 cs.CL cs.AI cs.IR 62%

LLaMA-E: Empowering E-commerce Authoring with Object-Interleaved Instruction Following

Kaize Shi, Xueyao Sun, Dingxian Wang, Yinlin Fu, Guandong Xu, Qing Li

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14760 2024-06-11 cs.LG cs.CL 62%

Generalizing Reward Modeling for Out-of-Distribution Preference Learning

Chen Jia

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.LG

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06395 2024-06-04 cs.CL cs.LG 62%

MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies

Shengding Hu, Yuge Tu, Xu Han, Chaoqun He, Ganqu Cui, Xiang Long, Zhi Zheng, Yewei Fang, Yuxiang Huang, Weilin Zhao, Xinrong Zhang, Zheng Leng Thai, Kaihuo Zhang, Chongyi Wang, Yuan Yao, Chenyang Zhao, Jie Zhou, Jie Cai, Zhongwu Zhai, Ning Ding, Chao Jia, Guoyang Zeng, Dahai Li, Zhiyuan Liu, Maosong Sun

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.LG

Comments revise according to peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16388 2024-05-28 cs.CL cs.LG 62%

Multi-Reference Preference Optimization for Large Language Models

Hung Le, Quan Tran, Dung Nguyen, Kien Do, Saloni Mittal, Kelechi Ogueji, Svetha Venkatesh

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.LG

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07101 2024-05-14 cs.CL cs.AI 62%

Advanced Natural-based interaction for the ITAlian language: LLaMAntino-3-ANITA

Marco Polignano, Pierpaolo Basile, Giovanni Semeraro

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00578 2024-05-02 cs.CL cs.AI 62%

The Real, the Better: Aligning Large Language Models with Online Human Behaviors

Guanying Jiang, Lingyong Yan, Haibo Shi, Dawei Yin

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13639 2024-05-01 cs.LG cs.AI 62%

Contrastive Preference Learning: Learning from Human Feedback without RL

Joey Hejna, Rafael Rafailov, Harshit Sikchi, Chelsea Finn, Scott Niekum, W. Bradley Knox, Dorsa Sadigh

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

Comments ICLR 2024. Code released at https://github.com/jhejna/cpl

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16954 2024-04-29 cs.LG cs.AI stat.ML 62%

Taming False Positives in Out-of-Distribution Detection with Human Feedback

Harit Vishwakarma, Heguang Lin, Ramya Korlakai Vinayak

专题命中 偏好对齐 :safety(abstract);分类 cs.AI、cs.LG

Comments Appeared in the 27th International Conference on Artificial Intelligence and Statistics (AISTATS 2024)

Journal ref PMLR 238:1486-1494, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.16682 2024-04-24 cs.CL cs.AI 62%

Some things are more CRINGE than others: Iterative Preference Optimization with the Pairwise Cringe Loss

Jing Xu, Andrew Lee, Sainbayar Sukhbaatar, Jason Weston

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13521 2024-04-23 cs.HC cs.AI cs.CV cs.LG 62%

Graph4GUI: Graph Neural Networks for Representing Graphical User Interfaces

Yue Jiang, Changkong Zhou, Vikas Garg, Antti Oulasvirta

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10105 2024-04-16 cs.CL cs.LG 62%

Understanding Catastrophic Forgetting in Language Models via Implicit Inference

Suhas Kotha, Jacob Mitchell Springer, Aditi Raghunathan

专题命中 偏好对齐 :safety(abstract);分类 cs.CL、cs.LG

Comments ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.03751 2024-04-16 cs.LG cs.AI 62%

Zeroth-Order Optimization Meets Human Feedback: Provable Learning via Ranking Oracles

Zhiwei Tang, Dmitry Rybin, Tsung-Hui Chang

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

Comments ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏