arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3243 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3243 篇

2505.19484 2025-05-28 cs.CL 57%

CulFiT: A Fine-grained Cultural-aware LLM Training Paradigm via Multilingual Critique Data Synthesis

Ruixiang Feng, Shen Gao, Xiuying Chen, Lisi Chen, Shuo Shang

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18952 2025-05-27 cs.LG 57%

Online Knowledge Distillation with Reward Guidance

Chen Jia

机构 * SI-TECH Information Technology(SI-TECH信息技术)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17540 2025-05-26 cs.CV cs.AI 57%

RePrompt: Reasoning-Augmented Reprompting for Text-to-Image Generation via Reinforcement Learning

Mingrui Wu, Lu Wang, Pu Zhao, Fangkai Yang, Jianjin Zhang, Jianfeng Liu, Yuefeng Zhan, Weihao Han, Hao Sun, Jiayi Ji, Xiaoshuai Sun, Qingwei Lin, Weiwei Deng, Dongmei Zhang, Feng Sun, Qi Zhang, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,教育部,厦门大学) Microsoft(微软)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

Comments Code is available at: https://github.com/microsoft/DKI_LLM/tree/main/RePrompt

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16475 2025-05-23 cs.AI 57%

ReflectEvo: Improving Meta Introspection of Small LLMs by Learning Self-Reflection

Jiaqi Li, Xinyi Dong, Yang Liu, Zhizhuo Yang, Quansen Wang, Xiaobo Wang, SongChun Zhu, Zixia Jia, Zilong Zheng

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16265 2025-05-23 cs.LG 57%

Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models

Ilgee Hong, Changlong Yu, Liang Qiu, Weixiang Yan, Zhenghao Xu, Haoming Jiang, Qingru Zhang, Qin Lu, Xin Liu, Chao Zhang, Tuo Zhao

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18101 2025-05-23 cs.CL 57%

Diverse Preference Optimization

Jack Lanchantin, Angelica Chen, Shehzaad Dhuliawala, Ping Yu, Jason Weston, Sainbayar Sukhbaatar, Ilia Kulikov

机构 * Meta

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15779 2025-05-22 cs.CV cs.AI 57%

IA-T2I: Internet-Augmented Text-to-Image Generation

Chuanhao Li, Jianwen Sun, Yukang Feng, Mingliang Zhai, Yifan Chang, Kaipeng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Nankai University(南开大学) Beijing Institute of Technology(北京理工大学) University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

Comments 12 pages, 7 figures, a framework that integrates reference images from the Internet into T2I/TI2I models

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02095 2025-05-21 cs.CL 57%

LongDPO: Unlock Better Long-form Generation Abilities for LLMs via Critique-augmented Stepwise Information

Bowen Ping, Jiali Zeng, Fandong Meng, Shuo Wang, Jie Zhou, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Pattern Recongnition Center, WechatAI, Tencent Inc(图案识别中心,微信AI,腾讯公司) Dept. of Comp. Sci. & Tech., Tsinghua University(计算机科学与技术系,清华大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13403 2025-05-20 cs.CL 57%

MR. Judge: Multimodal Reasoner as a Judge

Renjie Pi, Felix Bai, Qibin Chen, Simon Wang, Jiulong Shan, Kieran Liu, Meng Cao

机构 * HKUST(香港科技大学) Apple(苹果公司)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13081 2025-05-20 cs.LG cs.CV 57%

Walking the Tightrope: Disentangling Beneficial and Detrimental Drifts in Non-Stationary Custom-Tuning

Xiaoyu Yang, Jie Lu, En Yu

机构 * Australian Artificial Intelligence Institute (AAII)(澳大利亚人工智能研究所) Faulty of Engineering and Information Technology(工程与信息技术学院) University of Technology Sydney(悉尼技术大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

Comments 17 pages, 5figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17061 2025-05-20 cs.CL 57%

Multi-Agent Sampling: Scaling Inference Compute for Data Synthesis with Tree Search-Based Agentic Collaboration

Hai Ye, Mingbao Lin, Hwee Tou Ng, Shuicheng Yan

机构 * National University of Singapore(国立新加坡大学) Skywork AI

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02718 2025-05-20 cs.CR cs.CL 57%

"Yes, My LoRD." Guiding Language Model Extraction with Locality Reinforced Distillation

Zi Liang, Qingqing Ye, Yanyun Wang, Sen Zhang, Yaxin Xiao, Ronghua Li, Jianliang Xu, Haibo Hu

机构 * The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong Baptist University(香港 Baptist大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments To appear at ACL 25 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12348 2025-05-20 cs.AI 57%

Reasoning-CV: Fine-tuning Powerful Reasoning LLMs for Knowledge-Assisted Claim Verification

Zhi Zheng, Wee Sun Lee

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10527 2025-05-20 cs.CL 57%

WorldPM: Scaling Human Preference Modeling

Binghai Wang, Runji Lin, Keming Lu, Le Yu, Zhenru Zhang, Fei Huang, Chujie Zheng, Kai Dang, Yang Fan, Xingzhang Ren, An Yang, Binyuan Hui, Dayiheng Liu, Tao Gui, Qi Zhang, Xuanjing Huang, Yu-Gang Jiang, Bowen Yu, Jingren Zhou, Junyang Lin

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20157 2025-05-20 cs.CL 57%

Toward Evaluative Thinking: Meta Policy Optimization with Evolving Reward Models

Zae Myung Kim, Chanwoo Park, Vipul Raheja, Suin Kim, Dongyeop Kang

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments Code and data: https://github.com/minnesotanlp/mpo

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22480 2025-05-19 cs.LG 57%

Probabilistic Uncertain Reward Model

Wangtao Sun, Xiang Cheng, Xing Yu, Haotian Xu, Zhao Yang, Shizhu He, Jun Zhao, Kang Liu

机构 * The Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China(认知与复杂系统决策智能实验室,自动化研究所,中国科学院,北京,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(人工智能学院,中国科学院大学,北京,中国) Xiaohongshu Inc(小红书公司) Meituan Inc(美团公司) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08143 2025-05-14 cs.HC cs.AI 57%

Communication Styles and Reader Preferences of LLM and Human Experts in Explaining Health Information

Jiawei Zhou, Kritika Venkatachalam, Minje Choi, Koustuv Saha, Munmun De Choudhury

机构 * School of Interactive Computing, Georgia Institute of Technology(交互计算学院,佐治亚理工学院) Amazon(亚马逊) Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(Siebel计算与数据科学学院,伊利诺伊大学厄巴纳-香槟分校)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14289 2025-05-09 cs.CL 57%

Drift: Decoding-time Personalized Alignments with Implicit User Preferences

Minbeom Kim, Kang-il Lee, Seongho Joo, Hwaran Lee, Thibaut Thonet, Kyomin Jung

机构 * Seoul National University(首尔国立大学) Sogang University(ソガン大学) NAVER AI Lab(NAVER AI实验室) NAVER Labs Europe(NAVER欧洲实验室)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02142 2025-05-06 cs.CL 57%

Exploring the Potential of Offline RL for Reasoning in LLMs: A Preliminary Study

Xiaoyu Tian, Sitong Zhao, Haotian Wang, Shuaiting Chen, Yiping Peng, Yunjie Ji, Han Zhao, Xiangang Li

机构 * a-m-team(a-m团队)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21233 2025-05-01 cs.CL 57%

Phi-4-Mini-Reasoning: Exploring the Limits of Small Reasoning Language Models in Math

Haoran Xu, Baolin Peng, Hany Awadalla, Dongdong Chen, Yen-Chun Chen, Mei Gao, Young Jin Kim, Yunsheng Li, Liliang Ren, Yelong Shen, Shuohang Wang, Weijian Xu, Jianfeng Gao, Weizhu Chen

机构 * Microsoft(微软)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18580 2025-04-29 cs.LG 57%

Parameter-Efficient Checkpoint Merging via Metrics-Weighted Averaging

Shi Jie Yu, Sehyun Choi

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18203 2025-04-24 cs.CV cs.CL 57%

Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning

Di Zhang, Junxian Li, Jingdi Lei, Xunzhi Wang, Yujie Liu, Zonglin Yang, Jiatong Li, Weida Wang, Suorong Yang, Jianbo Wu, Peng Ye, Wanli Ouyang, Dongzhan Zhou

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) Nankai University(南开大学) Shanghai University(上海大学) Nanyang Technological University(南洋理工大学) Hong Kong Polytechnic University(香港理工大学) Tongji University(同济大学) Nanjing University(南京大学) University of California, Merced(加州大学梅德福分校) Chinese University of Hong Kong(香港中文大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15804 2025-04-23 cs.AR cs.AI 57%

Insights from Verification: Training a Verilog Generation LLM with Reinforcement Learning with Testbench Feedback

Ning Wang, Bingkun Yao, Jie Zhou, Yuchen Hu, Xi Wang, Nan Guan, Zhe Jiang

机构 * City University of Hong Kong(香港城市大学) Southeast University(东南大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14838 2025-04-22 cs.AI 57%

Establishing Reliability Metrics for Reward Models in Large Language Models

Yizhou Chen, Yawen Liu, Xuesi Wang, Qingtao Yu, Guangda Huzhang, Anxiang Zeng, Han Yu, Zhiming Zhou

机构 * Nanyang Technological University(新加坡国立大学) Shanghai University of Finance and Economics(上海金融学院)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13122 2025-04-18 cs.CV cs.LG 57%

VistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video Models

Haojian Huang, Haodong Chen, Shengqiong Wu, Meng Luo, Jinlan Fu, Xinya Du, Hanwang Zhang, Hao Fei

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

Comments Code and Data: https://github.com/HaroldChen19/VistaDPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15124 2025-04-16 cs.CL 57%

Tulu 3: Pushing Frontiers in Open Language Model Post-Training

Nathan Lambert, Jacob Morrison, Valentina Pyatkin, Shengyi Huang, Hamish Ivison, Faeze Brahman, Lester James V. Miranda, Alisa Liu, Nouha Dziri, Shane Lyu, Yuling Gu, Saumya Malik, Victoria Graf, Jena D. Hwang, Jiangjiang Yang, Ronan Le Bras, Oyvind Tafjord, Chris Wilhelm, Luca Soldaini, Noah A. Smith, Yizhong Wang, Pradeep Dasigi, Hannaneh Hajishirzi

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments Added Tulu 3 405B results and additional analyses

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09643 2025-04-15 cs.CL cs.IR cs.SE 57%

Iterative Self-Training for Code Generation via Reinforced Re-Ranking

Nikita Sorokin, Ivan Sedykh, Valentin Malykh

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments Published at ECIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00689 2025-04-08 cs.CL 57%

PrefRAG: Preference-Driven Multi-Source Retrieval Augmented Generation

Qingfei Zhao, Ruobing Wang, Yukuo Cen, Daren Zha, Shicheng Tan, Jie Tang

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments 33 pages, 5 figures, 28 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08821 2025-04-08 cs.CL 57%

DeepNote: Note-Centric Deep Retrieval-Augmented Generation

Ruobing Wang, Qingfei Zhao, Yukun Yan, Daren Zha, Yuxuan Chen, Shi Yu, Zhenghao Liu, Yixuan Wang, Shuo Wang, Xu Han, Zhiyuan Liu, Maosong Sun

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments 28 pages, 6 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04040 2025-04-08 cs.AI cs.RO 57%

ADAPT: Actively Discovering and Adapting to Preferences for any Task

Maithili Patel, Xavier Puig, Ruta Desai, Roozbeh Mottaghi, Sonia Chernova, Joanne Truong, Akshara Rai

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏