arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3238 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3238 篇

2411.15203 2024-11-26 cs.LG cs.AI cs.CL 67%

Multimodal large language model for wheat breeding: a new exploration of smart breeding

Guofeng Yang, Yu Li, Yong He, Zhenjiang Zhou, Lingzhen Ye, Hui Fang, Yiqi Luo, Xuping Feng

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15269 2024-11-26 cs.CL cs.AI cs.IR cs.LG 67%

Aligning LLM Agents by Learning Latent Preference from User Edits

Ge Gao, Alexey Taymanov, Eduardo Salinas, Paul Mineiro, Dipendra Misra

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12843 2024-11-21 cs.LG cs.AI cs.CL stat.ML 67%

Reward Modeling with Ordinal Feedback: Wisdom of the Crowd

Shang Liu, Yu Pan, Guanting Chen, Xiaocheng Li

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15043 2024-11-12 cs.CL cs.AI cs.LG 67%

Health Text Simplification: An Annotated Corpus for Digestive Cancer Education and Novel Strategies for Reinforcement Learning

Md Mushfiqur Rahman, Mohammad Sabik Irbaz, Kai North, Michelle S. Williams, Marcos Zampieri, Kevin Lybarger

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published in Journal of Biomedical Informatics, Volume 158, October 2024, 104727

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08739 2024-11-05 cs.CV 67%

MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data Engine

Renrui Zhang, Xinyu Wei, Dongzhi Jiang, Ziyu Guo, Shicheng Li, Yichi Zhang, Chengzhuo Tong, Jiaming Liu, Aojun Zhou, Bin Wei, Shanghang Zhang, Peng Gao, Chunyuan Li, Hongsheng Li

专题命中 偏好对齐 :alignment(abstract);DPO(abstract)

Comments WData and Models will be released at https://github.com/ZrrSkywalker/MAVIS

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17126 2024-10-23 cs.CL cs.AI cs.LG 67%

Exploring RL-based LLM Training for Formal Language Tasks with Programmed Rewards

Alexander G. Padula, Dennis J. N. J. Soemers

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at BNAIC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14208 2024-10-21 cs.CL cs.AI cs.LG 67%

Montessori-Instruct: Generate Influential Training Data Tailored for Student Learning

Xiaochuan Li, Zichun Yu, Chenyan Xiong

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Codes and data are open-sourced at https://github.com/cxcscmu/Montessori-Instruct

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05868 2024-10-14 cs.LG cs.AI cs.CL stat.ML 67%

Negative Preference Optimization: From Catastrophic Collapse to Effective Unlearning

Ruiqi Zhang, Licong Lin, Yu Bai, Song Mei

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02966 2024-10-10 cs.CL cs.AI cs.LG 67%

Evidence-Focused Fact Summarization for Knowledge-Augmented Zero-Shot Question Answering

Sungho Ko, Hyunjin Cho, Hyungjoo Chae, Jinyoung Yeo, Dongha Lee

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00087 2024-10-07 cs.AI cs.CL cs.LG 67%

ARES: Alternating Reinforcement Learning and Supervised Fine-Tuning for Enhanced Multi-Modal Chain-of-Thought Reasoning Through Diverse AI Feedback

Ju-Seung Byun, Jiyun Chun, Jihyung Kil, Andrew Perrault

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19993 2024-10-01 cs.CR cs.AI cs.CL cs.LG cs.SY eess.SY 67%

Mitigating Backdoor Threats to Large Language Models: Advancement and Challenges

Qin Liu, Wenjie Mo, Terry Tong, Jiashu Xu, Fei Wang, Chaowei Xiao, Muhao Chen

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

Comments The 60th Annual Allerton Conference (Invited Paper). The arXiv version is a pre-IEEE Press publication version

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19817 2024-10-01 cs.LG cs.AI cs.CL 67%

Calibrating Language Models with Adaptive Temperature Scaling

Johnathan Xie, Annie S. Chen, Yoonho Lee, Eric Mitchell, Chelsea Finn

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00693 2024-10-01 cs.AI cs.CL cs.LG 67%

BAPO: Base-Anchored Preference Optimization for Overcoming Forgetting in Large Language Models Personalization

Gihun Lee, Minchan Jeong, Yujin Kim, Hojung Jung, Jaehoon Oh, Sangmook Kim, Se-Young Yun

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments The 2024 Conference on Empirical Methods in Natural Language Processing (EMNLP 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00787 2024-09-04 cs.CL cs.AI cs.CR cs.LG 67%

The Dark Side of Human Feedback: Poisoning Large Language Models via User Inputs

Bocheng Chen, Hanqing Guo, Guangjing Wang, Yuanda Wang, Qiben Yan

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00096 2024-09-04 cs.CL cs.AI cs.LG 67%

Non-instructional Fine-tuning: Enabling Instruction-Following Capabilities in Pre-trained Language Models without Instruction-Following Data

Juncheng Xie, Shensian Syu, Hung-yi Lee

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 16 pages, 2 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06457 2024-08-15 cs.LG cs.AI cs.CL 67%

V-STaR: Training Verifiers for Self-Taught Reasoners

Arian Hosseini, Xingdi Yuan, Nikolay Malkin, Aaron Courville, Alessandro Sordoni, Rishabh Agarwal

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05829 2024-07-19 cs.CL cs.AI cs.LG 67%

SambaLingo: Teaching Large Language Models New Languages

Zoltan Csaki, Bo Li, Jonathan Li, Qiantong Xu, Pian Pawakapan, Leon Zhang, Yun Du, Hengyu Zhao, Changran Hu, Urmish Thakker

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01462 2024-07-17 cs.LG cs.AI cs.CL 67%

The Importance of Online Data: Understanding Preference Fine-tuning via Coverage

Yuda Song, Gokul Swamy, Aarti Singh, J. Andrew Bagnell, Wen Sun

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01377 2024-07-17 cs.CL cs.AI cs.LG 67%

UltraFeedback: Boosting Language Models with Scaled AI Feedback

Ganqu Cui, Lifan Yuan, Ning Ding, Guanming Yao, Bingxiang He, Wei Zhu, Yuan Ni, Guotong Xie, Ruobing Xie, Yankai Lin, Zhiyuan Liu, Maosong Sun

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICML 2024 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01648 2024-07-12 cs.AI cs.CL cs.LG 67%

Characterizing Large Language Model Geometry Helps Solve Toxicity Detection and Generation

Randall Balestriero, Romain Cosentino, Sarath Shekkizhar

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02502 2024-07-11 cs.CL cs.AI cs.LG 67%

Trial and Error: Exploration-Based Trajectory Optimization for LLM Agents

Yifan Song, Da Yin, Xiang Yue, Jie Huang, Sujian Li, Bill Yuchen Lin

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to ACL 2024 Main Conference; Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.03341 2024-06-27 cs.LG cs.AI cs.CL 67%

Inference-Time Intervention: Eliciting Truthful Answers from a Language Model

Kenneth Li, Oam Patel, Fernanda Viégas, Hanspeter Pfister, Martin Wattenberg

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2023 spotlight; code: https://github.com/likenneth/honest_llama

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11817 2024-06-18 cs.CL cs.AI cs.LG 67%

Iterative Length-Regularized Direct Preference Optimization: A Case Study on Improving 7B Language Models to GPT-4 Level

Jie Liu, Zhanhui Zhou, Jiaheng Liu, Xingyuan Bu, Chao Yang, Han-Sen Zhong, Wanli Ouyang

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01335 2024-06-18 cs.LG cs.AI cs.CL stat.ML 67%

Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models

Zixiang Chen, Yihe Deng, Huizhuo Yuan, Kaixuan Ji, Quanquan Gu

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 22 pages, 6 figures, 7 tables. In ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04300 2024-06-07 cs.RO 67%

Text-to-Drive: Diverse Driving Behavior Synthesis via Large Language Models

Phat Nguyen, Tsun-Hsuan Wang, Zhang-Wei Hong, Sertac Karaman, Daniela Rus

专题命中 偏好对齐 :alignment(abstract);safety(abstract)

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10571 2024-06-07 cs.CL cs.AI cs.LG 67%

Direct Preference Optimization with an Offset

Afra Amini, Tim Vieira, Ryan Cotterell

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04102 2024-05-29 cs.LG cs.AI cs.CL 67%

ROPO: Robust Preference Optimization for Large Language Models

Xize Liang, Chao Chen, Shuang Qiu, Jie Wang, Yue Wu, Zhihang Fu, Zhihao Shi, Feng Wu, Jieping Ye

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08447 2024-05-15 cs.HC 67%

AI-Resilient Interfaces

Elena L. Glassman, Ziwei Gu, Jonathan K. Kummerfeld

专题命中 偏好对齐 :safety(abstract);AI safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08265 2024-05-14 cs.CV 67%

A Dense Reward View on Aligning Text-to-Image Diffusion with Preference

Shentao Yang, Tianqi Chen, Mingyuan Zhou

专题命中 偏好对齐 :alignment(abstract);DPO(abstract)

Comments 41st International Conference on Machine Learning (ICML 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15100 2024-04-24 cs.CV cs.MM 67%

Multimodal Large Language Model is a Human-Aligned Annotator for Text-to-Image Generation

Xun Wu, Shaohan Huang, Furu Wei

专题命中 偏好对齐 :alignment(abstract);harmlessness(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏