arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3238 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3238 篇

2405.07667 2024-12-17 cs.CR cs.CL 70%

Simulate and Eliminate: Revoke Backdoors for Generative Large Language Models

Haoran Li, Yulin Chen, Zihao Zheng, Qi Hu, Chunkit Chan, Heshan Liu, Yangqiu Song

专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.CL

Comments To appear at AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01304 2024-12-13 cs.CL 70%

Improving the Validity of Automatically Generated Feedback via Reinforcement Learning

Alexander Scarlatos, Digory Smith, Simon Woodhead, Andrew Lan

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL

Comments Best student paper award, Published in AIED 2024: The 25th International Conference on Artificial Intelligence in Education

Journal ref In International Conference on Artificial Intelligence in Education (pp. 280-294). Cham: Springer Nature Switzerland (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09215 2024-11-08 cs.IR cs.AI 70%

On Softmax Direct Preference Optimization for Recommendation

Yuxin Chen, Junfei Tan, An Zhang, Zhengyi Yang, Leheng Sheng, Enzhi Zhang, Xiang Wang, Tat-Seng Chua

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.AI

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17977 2024-11-06 cs.CL 70%

Aligning to Thousands of Preferences via System Message Generalization

Seongyun Lee, Sue Hyun Park, Seungone Kim, Minjoon Seo

专题命中 偏好对齐 :alignment(abstract);harmlessness(abstract);分类 cs.CL

Comments Accepted to NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20290 2024-11-04 cs.CL 70%

Fast Best-of-N Decoding via Speculative Rejection

Hanshi Sun, Momin Haider, Ruiqi Zhang, Huitao Yang, Jiahao Qiu, Ming Yin, Mengdi Wang, Peter Bartlett, Andrea Zanette

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09024 2024-10-31 cs.LG 70%

Aligning Diffusion Behaviors with Q-functions for Efficient Continuous Control

Huayu Chen, Kaiwen Zheng, Hang Su, Jun Zhu

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.LG

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06273 2024-10-29 cs.CL 70%

FuxiTranyu: A Multilingual Large Language Model Trained with Balanced Data

Haoran Sun, Renren Jin, Shaoyang Xu, Leiyu Pan, Supryadi, Menglong Cui, Jiangcun Du, Yikun Lei, Lei Yang, Ling Shi, Juesi Xiao, Shaolin Zhu, Deyi Xiong

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL

Comments Accepted to EMNLP 2024 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18890 2024-10-25 cs.AI 70%

Improving Small-Scale Large Language Models Function Calling for Reasoning Tasks

Graziano A. Manduzio, Federico A. Galatolo, Mario G. C. A. Cimino, Enzo Pasquale Scilingo, Lorenzo Cominelli

专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13887 2024-10-25 cs.CL 70%

Learning Goal-Conditioned Representations for Language Reward Models

Vaskar Nath, Dylan Slack, Jeff Da, Yuntao Ma, Hugh Zhang, Spencer Whitehead, Sean Hendryx

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05008 2024-10-25 cs.CL 70%

ADELIE: Aligning Large Language Models on Information Extraction

Yunjia Qi, Hao Peng, Xiaozhi Wang, Bin Xu, Lei Hou, Juanzi Li

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL

Comments Accepted at EMNLP 2024. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16184 2024-10-22 cs.CL 70%

RM-Bench: Benchmarking Reward Models of Language Models with Subtlety and Style

Yantao Liu, Zijun Yao, Rui Min, Yixin Cao, Lei Hou, Juanzi Li

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17534 2024-10-15 cs.AI 70%

Just Say What You Want: Only-prompting Self-rewarding Online Preference Optimization

Ruijie Xu, Zhihan Liu, Yongfei Liu, Shipeng Yan, Zhaoran Wang, Zhi Zhang, Xuming He

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11370 2024-10-15 cs.CL cs.AI cs.CY cs.LG 70%

Fairer Preferences Elicit Improved Human-Aligned Large Language Model Judgments

Han Zhou, Xingchen Wan, Yinhong Liu, Nigel Collier, Ivan Vulić, Anna Korhonen

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05495 2024-10-10 cs.CL 70%

Self-rationalization improves LLM as a fine-grained judge

Prapti Trivedi, Aditya Gulati, Oliver Molenschot, Meghana Arakkal Rajeev, Rajkumar Ramamurthy, Keith Stevens, Tanveesh Singh Chaudhery, Jahnavi Jambholkar, James Zou, Nazneen Rajani

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08411 2024-10-08 cs.CL 70%

Rater Cohesion and Quality from a Vicarious Perspective

Deepak Pandita, Tharindu Cyril Weerasooriya, Sujan Dutta, Sarah K. Luger, Tharindu Ranasinghe, Ashiqur R. KhudaBukhsh, Marcos Zampieri, Christopher M. Homan

专题命中 偏好对齐 :safety(abstract);AI safety(abstract);分类 cs.CL

Comments Accepted at EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01470 2024-10-08 cs.CL 70%

DogeRM: Equipping Reward Models with Domain Knowledge through Model Merging

Tzu-Han Lin, Chen-An Li, Hung-yi Lee, Yun-Nung Chen

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL

Comments In the 2024 Conference on Empirical Methods in Natural Language Processing (EMNLP 2024). The code for our work is available at: https://github.com/MiuLab/DogeRM

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06542 2024-10-04 cs.CL 70%

LIONs: An Empirically Optimized Approach to Align Language Models

Xiao Yu, Qingyang Wu, Yu Li, Zhou Yu

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19371 2024-10-03 cs.CL 70%

Suri: Multi-constraint Instruction Following for Long-form Text Generation

Chau Minh Pham, Simeng Sun, Mohit Iyyer

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL

Comments Accepted to EMNLP'24 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14874 2024-08-30 cs.CL 70%

Inverse-Q*: Token Level Reinforcement Learning for Aligning Large Language Models Without Preference Data

Han Xia, Songyang Gao, Qiming Ge, Zhiheng Xi, Qi Zhang, Xuanjing Huang

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09072 2024-07-15 cs.CL 70%

New Desiderata for Direct Preference Optimization

Xiangkun Hu, Tong He, David Wipf

专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15568 2024-07-10 cs.LG 70%

Robust Reinforcement Learning from Corrupted Human Feedback

Alexander Bukharin, Ilgee Hong, Haoming Jiang, Zichong Li, Qingru Zhang, Zixuan Zhang, Tuo Zhao

专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.LG

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06138 2024-07-09 cs.CL 70%

Cendol: Open Instruction-tuned Generative Large Language Models for Indonesian Languages

Samuel Cahyawijaya, Holy Lovenia, Fajri Koto, Rifki Afina Putri, Emmanuel Dave, Jhonson Lee, Nuur Shadieq, Wawan Cenggoro, Salsabil Maulana Akbar, Muhammad Ihza Mahendra, Dea Annisayanti Putri, Bryan Wilie, Genta Indra Winata, Alham Fikri Aji, Ayu Purwarianti, Pascale Fung

专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.CL

Comments Cendol models are released under Apache 2.0 license and will be made publicly available soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17923 2024-06-27 cs.CL 70%

PAFT: A Parallel Training Paradigm for Effective LLM Fine-Tuning

Shiva Kumar Pentyala, Zhichao Wang, Bin Bi, Kiran Ramnath, Xiang-Bo Mao, Regunathan Radhakrishnan, Sitaram Asur, Na, Cheng

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16486 2024-06-25 cs.AI 70%

Towards Comprehensive Preference Data Collection for Reward Modeling

Yulan Hu, Qingyang Li, Sheng Ouyang, Ge Chen, Kaihui Chen, Lijun Mei, Xucheng Ye, Fuzheng Zhang, Yong Liu

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04155 2024-06-24 cs.CL 70%

Black-Box Prompt Optimization: Aligning Large Language Models without Model Training

Jiale Cheng, Xiao Liu, Kehan Zheng, Pei Ke, Hongning Wang, Yuxiao Dong, Jie Tang, Minlie Huang

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL

Comments Accepted to ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12999 2024-06-04 cs.CL 70%

Machine Mindset: An MBTI Exploration of Large Language Models

Jiaxi Cui, Liuzhenghao Lv, Jing Wen, Rongsheng Wang, Jing Tang, YongHong Tian, Li Yuan

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19763 2024-05-31 cs.CL 70%

Enhancing Reinforcement Learning with Label-Sensitive Reward for Natural Language Understanding

Kuo Liao, Shuang Li, Meng Zhao, Liqun Liu, Mengge Xue, Zhenyu Hu, Honglin Han, Chengguo Yin

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL

Comments Accept at ACL2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14490 2024-05-24 cs.CL 70%

Impact of Non-Standard Unicode Characters on Security and Comprehension in Large Language Models

Johan S Daniel, Anand Pal

专题命中 偏好对齐 :RLHF(abstract);prompt injection(abstract);分类 cs.CL

Comments 46 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14103 2024-05-24 cs.LG 70%

Online Self-Preferring Language Models

Yuanzhao Zhai, Zhuo Zhang, Kele Xu, Hanyang Peng, Yue Yu, Dawei Feng, Cheng Yang, Bo Ding, Huaimin Wang

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.LG

Comments 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.09747 2024-05-17 q-fin.CP cs.LG 70%

NIFTY Financial News Headlines Dataset

Raeid Saqur, Ken Kato, Nicholas Vinden, Frank Rudzicz

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏