arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3238 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3238 篇

2402.00742 2024-07-22 cs.CL cs.AI 73%

Transforming and Combining Rewards for Aligning Large Language Models

Zihao Wang, Chirag Nagpal, Jonathan Berant, Jacob Eisenstein, Alex D'Amour, Sanmi Koyejo, Victor Veitch

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04842 2024-07-09 cs.CV cs.CL cs.LG 73%

MJ-Bench: Is Your Multimodal Reward Model Really a Good Judge for Text-to-Image Generation?

Zhaorun Chen, Yichao Du, Zichen Wen, Yiyang Zhou, Chenhang Cui, Zhenzhen Weng, Haoqin Tu, Chaoqi Wang, Zhengwei Tong, Qinglan Huang, Canyu Chen, Qinghao Ye, Zhihong Zhu, Yuqing Zhang, Jiawei Zhou, Zhuokai Zhao, Rafael Rafailov, Chelsea Finn, Huaxiu Yao

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.LG

Comments 42 pages, 13 figures, 33 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02446 2024-07-03 cs.CL cs.AI 73%

Predicting vs. Acting: A Trade-off Between World Modeling & Agent Modeling

Margaret Li, Weijia Shi, Artidoro Pagnoni, Peter West, Ari Holtzman

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16768 2024-06-25 cs.LG cs.AI 73%

WARP: On the Benefits of Weight Averaged Rewarded Policies

Alexandre Ramé, Johan Ferret, Nino Vieillard, Robert Dadashi, Léonard Hussenot, Pierre-Louis Cedoz, Pier Giuseppe Sessa, Sertan Girgin, Arthur Douillard, Olivier Bachem

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.AI、cs.LG

Comments 11 main pages (34 pages with Appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01013 2024-06-21 cs.LG cs.CL 73%

Scalable Ensembling For Mitigating Reward Overoptimisation

Ahmed M. Ahmed, Rafael Rafailov, Stepan Sharkov, Xuechen Li, Sanmi Koyejo

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06382 2024-06-11 cs.CV cs.CL cs.LG 73%

Diffusion-RPO: Aligning Diffusion Models through Relative Preference Optimization

Yi Gu, Zhendong Wang, Yueqin Yin, Yujia Xie, Mingyuan Zhou

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05587 2024-06-11 cs.CL cs.AI 73%

Creativity Has Left the Chat: The Price of Debiasing Language Models

Behnam Mohammadi

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02764 2024-06-06 cs.LG cs.AI 73%

Adaptive Preference Scaling for Reinforcement Learning with Human Feedback

Ilgee Hong, Zichong Li, Alexander Bukharin, Yixiao Li, Haoming Jiang, Tianbao Yang, Tuo Zhao

专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00037 2024-06-04 cs.CL cs.AI 73%

Aligning LLMs through Multi-perspective User Preference Ranking-based Feedback for Programming Question Answering

Hongyu Yang, Liyang He, Min Hou, Shuanghong Shen, Rui Li, Jiahui Hou, Jianhui Ma, Junda Zhao

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20175 2024-05-31 cs.CL cs.AI 73%

InstructionCP: A fast approach to transfer Large Language Models into target language

Kuang-Ming Chen, Hung-yi Lee

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12931 2024-05-02 cs.RO cs.AI cs.LG 73%

Eureka: Human-Level Reward Design via Coding Large Language Models

Yecheng Jason Ma, William Liang, Guanzhi Wang, De-An Huang, Osbert Bastani, Dinesh Jayaraman, Yuke Zhu, Linxi Fan, Anima Anandkumar

专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.AI、cs.LG

Comments ICLR 2024. Project website and open-source code: https://eureka-research.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13076 2024-04-23 cs.CL cs.AI 73%

LLM Evaluators Recognize and Favor Their Own Generations

Arjun Panickssery, Samuel R. Bowman, Shi Feng

专题命中 偏好对齐 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12195 2024-04-19 cs.CL cs.LG 73%

OpenBezoar: Small, Cost-Effective and Open Models Trained on Mixes of Instruction Data

Chandeepa Dissanayake, Lahiru Lowe, Sachith Gunasekara, Yasiru Ratnayake

专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.CL、cs.LG

Comments 25 pages, 27 Figures, 8 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12150 2024-04-19 cs.LG cs.CL 73%

Aligning language models with human preferences

Tomasz Korbak

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.LG

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07439 2024-04-12 cs.AI cs.CL 73%

Behavior Trees Enable Structured Programming of Language Model Agents

Richard Kelley

专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.16430 2024-03-26 cs.LG cs.AI 73%

Preference as Reward, Maximum Preference Optimization with Importance Sampling

Zaifan Jiang, Xing Huang, Chao Wei

专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.13231 2024-03-26 cs.LG cs.AI cs.CV 73%

Using Human Feedback to Fine-tune Diffusion Models without Any Reward Model

Kai Yang, Jian Tao, Jiafei Lyu, Chunjiang Ge, Jiaxin Chen, Qimai Li, Weihan Shen, Xiaolong Zhu, Xiu Li

专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG

Comments CVPR 2024 accepted; huggingface daily paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14238 2024-03-22 cs.CL cs.AI 73%

Reinforcement Learning from Reflective Feedback (RLRF): Aligning and Improving LLMs via Fine-Grained Self-Reflection

Kyungjae Lee, Dasol Hwang, Sunghyun Park, Youngsoo Jang, Moontae Lee

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI

Comments 22 pages, 5 figures, Submitted to ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11411 2024-02-20 cs.LG cs.CL cs.CV 73%

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning

Yiyang Zhou, Chenhang Cui, Rafael Rafailov, Chelsea Finn, Huaxiu Yao

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14743 2024-01-25 cs.CL cs.LG 73%

A Baseline Analysis of Reward Models' Ability To Accurately Analyze Foundation Models Under Distribution Shift

Will LeVine, Benjamin Pikus, Anthony Chen, Sean Hendryx

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10076 2023-10-17 cs.CL cs.AI 73%

Verbosity Bias in Preference Labeling by Large Language Models

Keita Saito, Akifumi Wachi, Koki Wataoka, Youhei Akimoto

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02527 2023-10-05 cs.CL cs.AI 73%

CITING: Large Language Models Create Curriculum for Instruction Tuning

Tao Feng, Zifeng Wang, Jimeng Sun

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.08215 2023-06-07 cs.CL cs.LG stat.ML 73%

Aligning Language Models with Preferences through f-divergence Minimization

Dongyoung Go, Tomasz Korbak, Germán Kruszewski, Jos Rozen, Nahyeon Ryu, Marc Dymetman

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.05206 2023-02-13 cs.CL cs.AI 73%

The Wisdom of Hindsight Makes Language Models Better Instruction Followers

Tianjun Zhang, Fangchen Liu, Justin Wong, Pieter Abbeel, Joseph E. Gonzalez

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13948 2025-02-25 cs.CL 72%

Aligning Language Models Using Follow-up Likelihood as Reward Signal

Chen Zhang, Dading Chong, Feng Jiang, Chengguang Tang, Anningzhe Gao, Guohua Tang, Haizhou Li

专题命中 偏好对齐 :alignment(abstract,comments);DPO(abstract);分类 cs.CL

Comments Accepted by AAAI-2025, 16 pages, reward model, LLM Alignment, code repository at (https://github.com/e0397123/FLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19665 2026-03-23 cs.IR 71%

GenFacet: End-to-End Generative Faceted Search via Multi-Task Preference Alignment in E-Commerce

GenFacet:通过多任务偏好对齐的端到端生成方法实现电商多维搜索

Zhouwei Zhai, Min Yang, Jin Li

专题命中 偏好对齐 :alignment(title)

AI总结 本文提出GenFacet,一种端到端生成框架,通过多任务偏好对齐提升电商多维搜索效果,实验证明显著提升点击率和转化率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19632 2025-12-23 cs.CV 71%

Generative diffusion models for agricultural AI: plant image generation, indoor-to-outdoor translation, and expert preference alignment

生成扩散模型在农业AI中的应用:植物图像生成、室内外转换以及专家偏好对齐

Da Tan, Michael Beck, Christopher P. Bidinosti, Robert H. Gulden, Christopher J. Henry

机构 * University of Manitoba(曼尼托巴大学) University of Winnipeg(温哥华大学)

专题命中 偏好对齐 :alignment(title)

AI总结 本文提出基于扩散模型的生成方法,通过合成植物图像、室内外转换和专家偏好对齐,提升农业AI的数据效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13444 2025-11-07 econ.GN q-fin.EC 71%

Balancing Engagement and Polarization: Multi-Objective Alignment of News Content Using LLMs

Mengjie Cheng, Elie Ofek, Hema Yoganarasimhan

专题命中 偏好对齐 :alignment(title)

Comments 73 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12750 2025-09-17 cs.CV 71%

What Makes a Good Generated Image? Investigating Human and Multimodal LLM Image Preference Alignment

Rishab Parthasarathy, Jasmine Collins, Cory Stephenson

专题命中 偏好对齐 :alignment(title)

Comments 7 pages, 9 figures, 3 tables; appendix 16 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06036 2025-08-11 cs.CV 71%

More Is Better: A MoE-Based Emotion Recognition Framework with Human Preference Alignment

Jun Xie, Yingjian Zhu, Feng Chen, Zhenghao Zhang, Xiaohui Fan, Hongzhu Yi, Xinming Wang, Chen Yu, Yue Bi, Zhaoran Zhao, Xiongjun Guan, Zhepeng Wang

机构 * Lenovo Research(联想研究) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Beijing Jiaotong University(北京交通大学) Shandong University(山东大学)

专题命中 偏好对齐 :alignment(title)

详情

展开后加载摘要…

URL PDF HTML 收藏