arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 30608 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3243 篇

2503.07996 2025-05-22 cs.AI cs.CL 62%

SQLCritic: Correcting Text-to-SQL Generation via Clause-wise Critic

Jikai Chen, Leilei Gan, Ziyu Zhao, Zechuan Wang, Dong Wang, Chenyi Zhuang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07558 2025-05-21 cs.LG cs.CL stat.ML 62%

Direct Density Ratio Optimization: A Statistically Consistent Approach to Aligning Large Language Models

Rei Higuchi, Taiji Suzuki

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11861 2025-05-20 cs.AI cs.CL 62%

Fair-PP: A Synthetic Dataset for Aligning LLM with Personalized Preferences of Social Equity

Qi Zhou, Jie Zhang, Dongxia Wang, Qiang Liu, Tianlin Li, Jin Song Dong, Wenhai Wang, Qing Guo

机构 * Zhejiang University(浙江大学) IHPC and CFAR, A*STAR(IHPC和CFAR,A*STAR) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11849 2025-05-20 cs.AI cs.AR cs.LG cs.PL 62%

VeriReason: Reinforcement Learning with Testbench Feedback for Reasoning-Enhanced Verilog Generation

Yiting Wang, Guoheng Sun, Wanghao Ye, Gang Qu, Ang Li

机构 * Department of Electrical Engineering, University of Maryland(电气工程系,马里兰大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10775 2025-05-19 cs.CL cs.AI 62%

A Systematic Analysis of Base Model Choice for Reward Modeling

Kian Ahrabian, Pegah Jandaghi, Negar Mokhberian, Sai Praneeth Karimireddy, Jay Pujara

机构 * University of Southern California(南加州大学) Information Sciences Institute(信息科学研究所)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

Comments 19 pages, 13 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07886 2025-05-14 cs.CL cs.AI 62%

PLHF: Prompt Optimization with Few-Shot Human Feedback

Chun-Pai Yang, Kan Zheng, Shou-De Lin

机构 * ZRT Technology(ZRT技术) National Taiwan University(国立台湾大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07858 2025-05-14 cs.CL cs.AI 62%

Scaling Laws for Speculative Decoding

Siyuan Yan, Mo Zhu, Guo-qing Jiang, Jianfei Wang, Jiaxing Chen, Wentai Zhang, Xiang Liao, Xiao Cui, Chen Zhang, Zhuoran Song, Ran Zhu

机构 * Red Note Hi-Lab(红笔记高研实验室) Shanghai Jiaotong University(上海交通大学) Nanjing University(南京大学) Zhejiang University(浙江大学) Chinese University of Hong Kong(香港中文大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05704 2025-05-12 cs.CL cs.AI 62%

Assessing Robustness to Spurious Correlations in Post-Training Language Models

Julia Shuieh, Prasann Singhal, Apaar Shanker, John Heyer, George Pu, Samuel Denton

机构 * Scale AI

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

Comments ICLR '25 Workshop on Spurious Correlation and Shortcut Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04284 2025-05-08 cs.CL cs.AI 62%

GASCADE: Grouped Summarization of Adverse Drug Event for Enhanced Cancer Pharmacovigilance

Sofia Jamil, Aryan Dabad, Bollampalli Areen Reddy, Sriparna Saha, Rajiv Misra, Adil A. Shakur

机构 * Department of Computer Science & Engineering, Indian Institute of Technology Patna(印度理工学院帕纳布分校计算机科学与工程系) Indira Gandhi Institute of Medical Sciences, Patna(英伽丁医学科学学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01435 2025-05-06 cs.IR cs.CL cs.DC cs.LG 62%

AdaParse: An Adaptive Parallel PDF Parsing and Resource Scaling Engine

Carlo Siebenschuh, Kyle Hippe, Ozan Gokdemir, Alexander Brace, Arham Khan, Khalid Hossain, Yadu Babuji, Nicholas Chia, Venkatram Vishwanath, Rick Stevens, Arvind Ramanathan, Ian Foster, Robert Underwood

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.LG

Comments This paper has been accepted at the The Eighth Annual Conference on Machine Learning and Systems (MLSys 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02894 2025-04-24 cs.CL cs.AI 62%

OnRL-RAG: Real-Time Personalized Mental Health Dialogue System

Ahsan Bilal, Beiyu Lin

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

Comments It needs more revisions. I am currently working on it with my co-author

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07640 2025-04-22 cs.LG cs.AI 62%

Goedel-Prover: A Frontier Model for Open-Source Automated Theorem Proving

Yong Lin, Shange Tang, Bohan Lyu, Jiayun Wu, Hongzhou Lin, Kaiyu Yang, Jia Li, Mengzhou Xia, Danqi Chen, Sanjeev Arora, Chi Jin

机构 * Princeton Language and Intelligence, Princeton University(普林斯顿语言与智能,普林斯顿大学) Tsinghua University(清华大学) Amazon(亚马逊) Meta FAIR Numina

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08772 2025-04-15 cs.LG cs.AI 62%

Reward Generation via Large Vision-Language Model in Offline Reinforcement Learning

Younghwan Lee, Tung M. Luu, Donghoon Lee, Chang D. Yoo

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

Comments 5 pages, ICASSP 2025. First two authors are equally contributed

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.21037 2025-04-11 cs.SD cs.AI cs.CL eess.AS 62%

TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization

Chia-Yu Hung, Navonil Majumder, Zhifeng Kong, Ambuj Mehrish, Amir Ali Bagherzadeh, Chuan Li, Rafael Valle, Bryan Catanzaro, Soujanya Poria

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

Comments https://tangoflux.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16615 2025-04-10 cs.IR cs.CL cs.LG 62%

Large Language Model Can Be a Foundation for Hidden Rationale-Based Retrieval

Luo Ji, Feixiang Guo, Teng Chen, Qingqing Gu, Xiaoyu Wang, Ningyuan Xi, Yihong Wang, Peng Yu, Yue Zhao, Hongyang Lei, Zhonglin Jiang, Yong Chen

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.LG

Comments 10 pages, 3 figures, ECIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00092 2025-04-09 cs.CL cs.AI 62%

Large Language Model for Patent Concept Generation

Runtao Ren, Jian Ma, Jianxi Luo

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

Comments Accepted for publication in Advanced Engineering Informatics, Link: https://doi.org/10.1016/j.aei.2025.103301

Journal ref Advanced Engineering Informatics 65 (2025): 103301

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23371 2025-04-01 cs.CL cs.AI 62%

FeRG-LLM : Feature Engineering by Reason Generation Large Language Models

Jeonghyun Ko, Gyeongyun Park, Donghoon Lee, Kyunam Lee

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

Comments Accepted to NAACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10020 2025-03-31 cs.CL cs.AI 62%

Self-Rewarding Language Models

Weizhe Yuan, Richard Yuanzhe Pang, Kyunghyun Cho, Xian Li, Sainbayar Sukhbaatar, Jing Xu, Jason Weston

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

Comments ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19988 2025-03-27 cs.LG cs.AI cs.DB 62%

ExCoT: Optimizing Reasoning for Text-to-SQL with Execution Feedback

Bohan Zhai, Canwen Xu, Yuxiong He, Zhewei Yao

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17236 2025-03-25 cs.CL cs.AI cs.IR 62%

Large Language Models Empowered Personalized Web Agents

Hongru Cai, Yongqi Li, Wenjie Wang, Fengbin Zhu, Xiaoyu Shen, Wenjie Li, Tat-Seng Chua

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted to WWW 2025. The code and data are available on the project website https://hongrucai.github.io/PersonalWAB/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17126 2025-03-24 cs.CL cs.LG 62%

Modifying Large Language Model Post-Training for Diverse Creative Writing

John Joon Young Chung, Vishakh Padmakumar, Melissa Roemmele, Yuqian Sun, Max Kreminski

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12556 2025-03-18 cs.CL cs.AI 62%

From Guessing to Asking: An Approach to Resolving the Persona Knowledge Gap in LLMs during Multi-Turn Conversations

Sarvesh Baskar, Tanmay Tulsidas Verelakar, Srinivasan Parthasarathy, Manas Gaur

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

Comments 12 pages, 1 Figure, Oral Presentation at NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06810 2025-03-11 cs.LG cs.AI 62%

Mitigating Preference Hacking in Policy Optimization with Pessimism

Dhawal Gupta, Adam Fisch, Christoph Dann, Alekh Agarwal

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03796 2025-03-10 cs.MA cs.AI cs.LG cs.RO 62%

Human Implicit Preference-Based Policy Fine-tuning for Multi-Agent Reinforcement Learning in USV Swarm

Hyeonjun Kim, Kanghoon Lee, Junho Park, Jiachen Li, Jinkyoo Park

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02989 2025-03-06 cs.CL cs.AI 62%

Effectively Steer LLM To Follow Preference via Building Confident Directions

Bingqing Song, Boran Han, Shuai Zhang, Hao Wang, Haoyang Fang, Bonan Min, Yuyang Wang, Mingyi Hong

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20468 2025-03-06 cs.AI cs.CY 62%

A Comprehensive Framework for Reliable Legal AI: Combining Specialized Expert Systems and Adaptive Refinement

Sidra Nasir, Qamar Abbas, Samita Bai, Rizwan Ahmed Khan

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.CY

Comments 16 pages and 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09230 2025-03-05 cs.CL cs.AI 62%

Improving Semantic Understanding in Speech Language Models via Brain-tuning

Omer Moussa, Dietrich Klakow, Mariya Toneva

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

Comments Published as a conference paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00018 2025-03-04 cs.CL cs.AI 62%

Eeyore: Realistic Depression Simulation via Supervised and Preference Optimization

Siyang Liu, Bianca Brie, Wenda Li, Laura Biester, Andrew Lee, James Pennebaker, Rada Mihalcea

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19328 2025-02-27 cs.CL cs.AI 62%

Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward Systems

Hao Peng, Yunjia Qi, Xiaozhi Wang, Zijun Yao, Bin Xu, Lei Hou, Juanzi Li

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08964 2025-02-27 cs.CL cs.AI 62%

Language Imbalance Driven Rewarding for Multilingual Self-improving

Wen Yang, Junhong Wu, Chen Wang, Chengqing Zong, Jiajun Zhang

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

Comments Camera ready version for ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏