arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3243 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3243 篇

2407.16574 2024-12-10 cs.CL 57%

TLCR: Token-Level Continuous Reward for Fine-grained Reinforcement Learning from Human Feedback

Eunseop Yoon, Hee Suk Yoon, SooHwan Eom, Gunsoo Han, Daniel Wontae Nam, Daejin Jo, Kyoung-Woon On, Mark A. Hasegawa-Johnson, Sungwoong Kim, Chang D. Yoo

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

Comments ACL2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05210 2024-12-09 cs.CL 57%

Evaluating and Aligning CodeLLMs on Human Preference

Jian Yang, Jiaxi Yang, Ke Jin, Yibo Miao, Lei Zhang, Liqun Yang, Zeyu Cui, Yichang Zhang, Binyuan Hui, Junyang Lin

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04922 2024-12-09 cs.CL 57%

Large Language Models for Ingredient Substitution in Food Recipes using Supervised Fine-tuning and Direct Preference Optimization

Thevin Senath, Kumuthu Athukorala, Ransika Costa, Surangika Ranathunga, Rishemjit Kaur

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04092 2024-12-06 cs.CL 57%

GEITje 7B Ultra: A Conversational Model for Dutch

Bram Vanroy

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02802 2024-12-05 cs.AI 57%

Flattering to Deceive: The Impact of Sycophantic Behavior on User Trust in Large Language Model

María Victoria Carro

专题命中 偏好对齐 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00967 2024-12-03 cs.AI 57%

Linear Probe Penalties Reduce LLM Sycophancy

Henry Papadatos, Rachel Freedman

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI

Comments 20 pages, 15 figures, NeurIPS 2024 Workshop Socially Responsible Language Modelling Research (SoLaR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14655 2024-12-03 cs.LG 57%

Multi-turn Reinforcement Learning from Preference Human Feedback

Lior Shani, Aviv Rosenberg, Asaf Cassel, Oran Lang, Daniele Calandriello, Avital Zipori, Hila Noga, Orgad Keller, Bilal Piot, Idan Szpektor, Avinatan Hassidim, Yossi Matias, Rémi Munos

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19039 2024-12-02 cs.AI 57%

Mars-PO: Multi-Agent Reasoning System Preference Optimization

Xiaoxuan Lou, Chaojie Wang, Bo An

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13211 2024-11-22 cs.CV cs.LG 57%

ViSTa Dataset: Do vision-language models understand sequential tasks?

Evžen Wybitul, Evan Ryan Gunter, Mikhail Seleznyov, David Lindner

专题命中 偏好对齐 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12036 2024-11-13 cs.CL cs.CV 57%

Exploring Advanced Large Language Models with LLMsuite

Giorgio Roffo

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

Comments Keywords: Language Model Benchmarking, Pre-Trained LLM Comparison, LLM Performance Analysis, NLP Model Evaluation Tools, Public Dataset Inference for LLMs, BLEU and ROUGE Metrics for LLM, Open Source LLM Testing Tools, Large Language Model Evaluation Software, NLP Benchmarking Suite, Comprehensive LLM Evaluation Toolkit

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02795 2024-11-01 cs.CL 57%

Towards a Unified View of Preference Learning for Large Language Models: A Survey

Bofei Gao, Feifan Song, Yibo Miao, Zefan Cai, Zhe Yang, Liang Chen, Helan Hu, Runxin Xu, Qingxiu Dong, Ce Zheng, Shanghaoran Quan, Wen Xiao, Ge Zhang, Daoguang Zan, Keming Lu, Bowen Yu, Dayiheng Liu, Zeyu Cui, Jian Yang, Lei Sha, Houfeng Wang, Zhifang Sui, Peiyi Wang, Tianyu Liu, Baobao Chang

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10203 2024-10-29 cs.CL 57%

A Probability--Quality Trade-off in Aligned Language Models and its Relation to Sampling Adaptors

Naaman Tan, Josef Valvoda, Tianyu Liu, Anej Svete, Yanxia Qin, Kan Min-Yen, Ryan Cotterell

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20869 2024-10-29 cs.CL 57%

Reward Modeling with Weak Supervision for Language Models

Ben Hauptvogel, Malte Ostendorff, Georg Rehm, Sebastian Möller

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19134 2024-10-28 cs.CL cs.SD eess.AS 57%

AlignCap: Aligning Speech Emotion Captioning to Human Preferences

Ziqi Liang, Haoxiang Shi, Hanhui Chen

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments Accepted to EMNLP2024 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19973 2024-10-28 cs.CV cs.LG 57%

STLLaVA-Med: Self-Training Large Language and Vision Assistant for Medical Question-Answering

Guohao Sun, Can Qin, Huazhu Fu, Linwei Wang, Zhiqiang Tao

专题命中 偏好对齐 :DPO(abstract);分类 cs.LG

Comments EMNLP 2024 Main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.13577 2024-10-24 cs.AI 57%

Physical Reasoning and Object Planning for Household Embodied Agents

Ayush Agrawal, Raghav Prabhakar, Anirudh Goyal, Dianbo Liu

专题命中 偏好对齐 :safety(abstract);分类 cs.AI

Comments Journal: TMLR(May/2024) Total: 39 pages (17 pages main content, 15 Figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17453 2024-10-18 cs.CL 57%

Learning to Ask Informative Questions: Enhancing LLMs with Preference Optimization and Expected Information Gain

Davide Mazzaccara, Alberto Testoni, Raffaella Bernardi

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments Accepted to EMNLP 2024 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12896 2024-10-18 cs.CL 57%

A Survey on Data Synthesis and Augmentation for Large Language Models

Ke Wang, Jiahui Zhu, Minjie Ren, Zeming Liu, Shiwei Li, Zongye Zhang, Chenkai Zhang, Xiaoyu Wu, Qiqi Zhan, Qingjie Liu, Yunhong Wang

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12832 2024-10-18 cs.LG 57%

Generative Reward Models

Dakota Mahan, Duy Van Phung, Rafael Rafailov, Chase Blagden, Nathan Lile, Louis Castricato, Jan-Philipp Fränken, Chelsea Finn, Alon Albalak

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06682 2024-10-14 cs.CV cs.CL eess.IV 57%

Enhancing Multimodal LLM for Detailed and Accurate Video Captioning using Multi-Round Preference Optimization

Changli Tang, Yixuan Li, Yudong Yang, Jimin Zhuang, Guangzhi Sun, Wei Li, Zujun Ma, Chao Zhang

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07779 2024-10-11 cs.CL 57%

Modeling User Preferences with Automatic Metrics: Creating a High-Quality Preference Dataset for Machine Translation

Sweta Agrawal, José G. C. de Souza, Ricardo Rei, António Farinhas, Gonçalo Faria, Patrick Fernandes, Nuno M Guerreiro, Andre Martins

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments Accepted at EMNLP Main 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05782 2024-10-10 cs.LG 57%

Reinforcement Learning From Imperfect Corrective Actions And Proxy Rewards

Zhaohui Jiang, Xuening Feng, Paul Weng, Yifei Zhu, Yan Song, Tianze Zhou, Yujing Hu, Tangjie Lv, Changjie Fan

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15352 2024-10-07 cs.CL 57%

A SMART Mnemonic Sounds like "Glue Tonic": Mixing LLMs with Student Feedback to Make Mnemonic Learning Stick

Nishant Balepur, Matthew Shu, Alexander Hoyle, Alison Robey, Shi Feng, Seraphina Goldfarb-Tarrant, Jordan Boyd-Graber

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00409 2024-10-02 cs.CL 57%

AlignSum: Data Pyramid Hierarchical Fine-tuning for Aligning with Human Summarization Preference

Yang Han, Yiming Wang, Rui Wang, Lu Chen, Kai Yu

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments EMNLP2024 Findings, code at: https://github.com/csyanghan/AlignSum

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00033 2024-10-02 cs.AI 57%

The Phenomenology of Machine: A Comprehensive Analysis of the Sentience of the OpenAI-o1 Model Integrating Functionalism, Consciousness Theories, Active Inference, and AI Architectures

Victoria Violet Hoyle

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20215 2024-10-01 cs.CL 57%

TS-Align: A Teacher-Student Collaborative Framework for Scalable Iterative Finetuning of Large Language Models

Chen Zhang, Chengguang Tang, Dading Chong, Ke Shi, Guohua Tang, Feng Jiang, Haizhou Li

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments EMNLP-2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00978 2024-09-19 cs.CL 57%

Prior Constraints-based Reward Model Training for Aligning Large Language Models

Hang Zhou, Chenglong Wang, Yimin Hu, Tong Xiao, Chunliang Zhang, Jingbo Zhu

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments Accepted by CCL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09345 2024-09-17 cs.AI 57%

Enhancing Decision-Making for LLM Agents via Step-Level Q-Value Models

Yuanzhao Zhai, Tingkai Yang, Kele Xu, Feng Dawei, Cheng Yang, Bo Ding, Huaimin Wang

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01256 2024-09-17 cs.CV cs.CL 57%

VideoStudio: Generating Consistent-Content and Multi-Scene Videos

Fuchen Long, Zhaofan Qiu, Ting Yao, Tao Mei

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments ECCV 2024. Source code is available at https://github.com/FuchenUSTC/VideoStudio

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00898 2024-09-16 cs.CL 57%

Enabling Language Models to Implicitly Learn Self-Improvement

Ziqi Wang, Le Hou, Tianjian Lu, Yuexin Wu, Yunxuan Li, Hongkun Yu, Heng Ji

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

Comments Accepted at ICLR 2024. 28 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏