arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3243 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3243 篇

2506.21497 2025-06-27 cs.CL 57%

Enhancing User Engagement in Socially-Driven Dialogue through Interactive LLM Alignments

Jiashuo Wang, Kaitao Song, Chunpu Xu, Changhe Song, Yang Xiao, Dongsheng Li, Lili Qiu, Wenjie Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Microsoft Research Asia(微软亚洲研究院)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14501 2025-06-27 cs.CL 57%

Do Large Language Models Advocate for Inferentialism?

Yuzuki Arai, Sho Tsugawa

机构 * College of Media Arts, Science and Technology, School of Informatics, University of Tsukuba(筑波大学媒体艺术、科学与技术学院,信息学院) Institute of Systems and Information Engineering, University of Tsukuba(筑波大学系统与信息工程研究所)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18309 2025-06-24 cs.IR cs.AI 57%

LettinGo: Explore User Profile Generation for Recommendation System

Lu Wang, Di Zhang, Fangkai Yang, Pu Zhao, Jianfeng Liu, Yuefeng Zhan, Hao Sun, Qingwei Lin, Weiwei Deng, Dongmei Zhang, Feng Sun, Qi Zhang

机构 * Microsoft Corporation(微软公司) Peking University(北京大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15911 2025-06-24 cs.CL 57%

From RAG to Agentic: Validating Islamic-Medicine Responses with LLM Agents

Mohammad Amaan Sayeed, Mohammed Talha Alam, Raza Imam, Shahab Saquib Sohail, Amir Hussain

机构 * Mohamed bin Zayed University of Artificial Intelligence, UAE(阿布扎克穆罕默德·本·扎耶德人工智能大学) Edinburgh Napier University, UK(爱丁堡纳皮尔大学) VIT Bhopal University, India(比哈尔大学)

专题命中 偏好对齐 :safety(abstract);分类 cs.CL

Comments Published at the 4th Muslims in Machine Learning (MusIML) Workshop (ICML-25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16507 2025-06-23 cs.LG 57%

Robust Reward Modeling via Causal Rubrics

Pragya Srivastava, Harman Singh, Rahul Madhavan, Gandharv Patil, Sravanti Addepalli, Arun Suggala, Rengarajan Aravamudhan, Soumya Sharma, Anirban Laha, Aravindan Raghuveer, Karthikeyan Shanmugam, Doina Precup

专题命中 偏好对齐 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14142 2025-06-18 cs.CV cs.CL 57%

RadFabric: Agentic AI System with Reasoning Capability for Radiology

Wenting Chen, Yi Dong, Zhaojun Ding, Yucheng Shi, Yifan Zhou, Fang Zeng, Yijun Luo, Tianyu Lin, Yihang Su, Yichen Wu, Kai Zhang, Zhen Xiang, Tianming Liu, Ninghao Liu, Lichao Sun, Yixuan Yuan, Xiang Li

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13888 2025-06-18 cs.CL cs.CV 57%

VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training

Jipeng Zhang, Kehao Miao, Renjie Pi, Zhaowei Wang, Runtao Liu, Rui Pan, Tong Zhang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Nanyang Technological University(南洋理工大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13102 2025-06-17 cs.CL 57%

REPA: Russian Error Types Annotation for Evaluating Text Generation and Judgment Capabilities

Alexander Pugachev, Alena Fenogenova, Vladislav Mikhailov, Ekaterina Artemova

机构 * HSE University(俄罗斯高等经济学院) SaluteDevices University of Oslo(奥斯陆大学) Toloka AI

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments To appear at SIGSLAV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08127 2025-06-17 cs.CL 57%

Fino1: On the Transferability of Reasoning-Enhanced LLMs and Reinforcement Learning to Finance

Lingfei Qian, Weipeng Zhou, Yan Wang, Xueqing Peng, Han Yi, Yilun Zhao, Jimin Huang, Qianqian Xie, Jian-yun Nie

机构 * The FinAI(FinAI) Georgia Institute of Technology(佐治亚理工学院) Yale University(耶鲁大学) University of Montreal(蒙特利尔大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments 13 pages, 2 figures, 3 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08967 2025-06-16 cs.SD cs.CL eess.AS 57%

Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model

Ailin Huang, Bingxin Li, Bruce Wang, Boyong Wu, Chao Yan, Chengli Feng, Heng Wang, Hongyu Zhou, Hongyuan Wang, Jingbei Li, Jianjian Sun, Joanna Wang, Mingrui Chen, Peng Liu, Ruihang Miao, Shilei Jiang, Tian Fei, Wang You, Xi Chen, Xuerui Yang, Yechang Huang, Yuxiang Zhang, Zheng Ge, Zheng Gong, Zhewei Huang, Zixin Zhang, Bin Wang, Bo Li, Buyun Ma, Changxin Miao, Changyi Wan, Chen Xu, Dapeng Shi, Dingyuan Hu, Enle Liu, Guanzhe Huang, Gulin Yan, Hanpeng Hu, Haonan Jia, Jiahao Gong, Jiaoren Wu, Jie Wu, Jie Yang, Junzhe Lin, Kaixiang Li, Lei Xia, Longlong Gu, Ming Li, Nie Hao, Ranchen Ming, Shaoliang Pang, Siqi Liu, Song Yuan, Tiancheng Cao, Wen Li, Wenqing He, Xu Zhao, Xuelin Zhang, Yanbo Yu, Yinmin Zhong, Yu Zhou, Yuanwei Liang, Yuanwei Lu, Yuxiang Yang, Zidong Yang, Zili Zhang, Binxing Jiao, Heung-Yeung Shum, Jiansheng Chen, Jing Li, Xiangyu Zhang, Xinhao Zhang, Yibo Zhu, Daxin Jiang, Shuchang Zhou, Chen Hu

机构 * Step-Audio Team(Step-Audio团队)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10389 2025-06-13 cs.LG 57%

EQA-RM: A Generative Embodied Reward Model with Test-time Scaling

Yuhang Chen, Zhen Tan, Tianlong Chen

机构 * The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Arizona State University(亚利桑那州立大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17131 2025-06-12 cs.CL 57%

Self-Steering Optimization: Autonomous Preference Optimization for Large Language Models

Hao Xiang, Bowen Yu, Hongyu Lin, Keming Lu, Yaojie Lu, Xianpei Han, Ben He, Le Sun, Jingren Zhou, Junyang Lin

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08643 2025-06-11 cs.CL 57%

MEMETRON: Metaheuristic Mechanisms for Test-time Response Optimization of Large Language Models

Son The Nguyen, Theja Tulabandhula

机构 * Department of Information and Decision Sciences University of Illinois Chicago(信息与决策科学系伊利诺伊大学香槟分校)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07235 2025-06-10 cs.CV cs.CL 57%

Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification

Tianyi Bai, Zengjie Hu, Fupeng Sun, Jiantao Qiu, Yizhen Jiang, Guangxin He, Bohan Zeng, Conghui He, Binhang Yuan, Wentao Zhang

机构 * HKUST(香港科技大学) Peking University(北京大学) Shanghai AI Lab(上海人工智能实验室) Imperial College London(伦敦帝国理工学院)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07066 2025-06-10 econ.TH cs.AI q-fin.CP 57%

From Axioms to Algorithms: Mechanized Proofs of the vNM Utility Theorem

Li Jingyuan

机构 * Department of Operations and Risk Management, Lingnan University(岭南大学运营与风险管理系)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17387 2025-06-06 cs.CL 57%

WiNGPT-3.0 Technical Report

Boqin Zhuang, Chenxiao Song, Huitong Lu, Jiacheng Qiao, Mingqian Liu, Mingxing Yu, Ping Hong, Rui Li, Xiaoxia Song, Xiangjun Xu, Xu Chen, Yaoyao Ma, Yujie Gao

机构 * WiNGPT Team(WiNGPT团队)

专题命中 偏好对齐 :trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04055 2025-06-06 cs.CL 57%

Self-Correction is More than Refinement: A Learning Framework for Visual and Language Reasoning Tasks

Jiayi He, Hehai Lin, Qingyun Wang, Yi Fung, Heng Ji

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Georgia Institute of Technology(佐治亚理工学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments Accepted by ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04180 2025-06-05 cs.CL 57%

SuperWriter: Reflection-Driven Long-Form Generation with Large Language Models

Yuhao Wu, Yushi Bai, Zhiqiang Hu, Juanzi Li, Roy Ka-Wei Lee

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03557 2025-06-05 cs.CL 57%

BPO: Revisiting Preference Modeling in Direct Preference Optimization

Lin Sun, Chuang Liu, Peng Liu, Bingyang Li, Weijia Lu, Ning Wu

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18282 2025-06-05 cs.LG 57%

Leveraging Sparsity for Sample-Efficient Preference Learning: A Theoretical Perspective

Yunzhen Yao, Lie He, Michael Gastpar

机构 * LINX, EPFL, Lausanne, Switzerland(日内瓦EPFL实验室) School of Computing and Artificial Intelligence, Shanghai University of Finance and Economics, Shanghai, China(上海金融学院计算机与人工智能学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02708 2025-06-04 cs.CV cs.CL 57%

Iterative Self-Improvement of Vision Language Models for Image Scoring and Self-Explanation

Naoto Tanji, Toshihiko Yamasaki

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments Accepted to ICIP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23387 2025-06-04 cs.SE cs.AI 57%

Afterburner: Reinforcement Learning Facilitates Self-Improving Code Efficiency Optimization

Mingzhe Du, Luu Anh Tuan, Yue Liu, Yuhao Qing, Dong Huang, Xinyi He, Qian Liu, Zejun Ma, See-kiong Ng

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17018 2025-06-04 cs.AI 57%

GAS: Generative Auto-bidding with Post-training Search

Yewen Li, Shuai Mao, Jingtong Gao, Nan Jiang, Yunjian Xu, Qingpeng Cai, Fei Pan, Peng Jiang, Bo An

机构 * Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) Kuaishou Technology(快手科技)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01104 2025-06-03 cs.CL 57%

Contextual Candor: Enhancing LLM Trustworthiness Through Hierarchical Unanswerability Detection

Steven Robinson, Antonio Carlos Rivera

机构 * EDP University of Puerto Rico: San Sebastian(EDP巴尔的摩大学:圣塞巴斯蒂安)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00805 2025-06-03 cs.CV cs.CL 57%

HSCR: Hierarchical Self-Contrastive Rewarding for Aligning Medical Vision Language Models

Songtao Jiang, Yan Zhang, Yeying Jin, Zhihang Tang, Yangyang Wu, Yang Feng, Jian Wu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Byte Dance(字节跳动) National University of Singapore(新加坡国立大学) Angelalign Inc China(Angelalign中国公司) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江省医学影像人工智能重点实验室)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23108 2025-05-30 cs.CL 57%

Generating Diverse Training Samples for Relation Extraction with Large Language Models

Zexuan Li, Hongliang Dai, Piji Li

机构 * College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(人工智能学院,南京航空航天大学) MIIT Key Laboratory of Pattern Analysis and Machine Intelligence(信息产业部模式分析与机器智能重点实验室) The Key Laboratory of Brain-Machine Intelligence Technology, Ministry of Education(脑机智能技术重点实验室,教育部)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments ACL2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23037 2025-05-30 cs.CL 57%

Improving Multilingual Social Media Insights: Aspect-based Comment Analysis

Longyin Zhang, Bowei Zou, Ai Ti Aw

机构 * Institute for Infocomm Research, A*STAR, Singapore(信息与通信研究所)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments The paper was peer-reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22517 2025-05-29 cs.CL cs.MM 57%

Multi-MLLM Knowledge Distillation for Out-of-Context News Detection

Yimeng Gu, Zhao Tong, Ignacio Castro, Shu Wu, Gareth Tyson

机构 * Queen Mary University of London(伦敦玛丽女王大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22172 2025-05-29 cs.CL 57%

Reverse Preference Optimization for Complex Instruction Following

Xiang Huang, Ting-En Lin, Feiteng Fang, Yuchuan Wu, Hangyu Li, Yuzhong Qu, Fei Huang, Yongbin Li

机构 * Tongyi Lab(通义实验室) State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) Nanjing University(南京大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01834 2025-05-28 cs.CL eess.AS 57%

Align-SLM: Textless Spoken Language Models with Reinforcement Learning from AI Feedback

Guan-Ting Lin, Prashanth Gurunath Shivakumar, Aditya Gourav, Yile Gu, Ankur Gandhe, Hung-yi Lee, Ivan Bulyko

机构 * Amazon AGI(亚马逊人工智能实验室) Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments Accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏