arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3243 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3243 篇

2508.18569 2025-08-27 cs.CL cs.CV 57%

The Mind's Eye: A Multi-Faceted Reward Framework for Guiding Visual Metaphor Generation

Girish A. Koushik, Fatemeh Nazarieh, Katherine Birch, Shenbin Qian, Diptesh Kanojia

机构 * NICE Research Group(NICE研究组) Centre for Translation Studies(翻译研究中心) Institute for People-Centred AI(以人为本的人工智能研究所) School of Computer Science & Electronic Engineering, University of Surrey, UK(Surrey大学计算机科学与电子工程学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17703 2025-08-26 cs.CL 57%

EMPOWER: Evolutionary Medical Prompt Optimization With Reinforcement Learning

Yinda Chen, Yangfan He, Jing Yang, Dapeng Zhang, Zhenlong Yuan, Muhammad Attique Khan, Jamel Baili, Por Lip Yee

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知国家重点实验室,中国科学技术大学) Department of Computer Science, University of Minnesota-Twin Cities(计算机科学系,明尼苏达大学双城分校) Center of Research for Cyber Security and Network (CSNET), Faculty of Computer Science and Information Technology, Universiti Malaya(网络安全与网络研究中心(CSNET),马来亚大学计算机科学与信息技术学院) DSLAB, School of Information Science & Engineering, Lanzhou University(信息科学与工程学院,兰州大学) Institute of Computing Technology, Chinese Academy of Sciences(计算技术研究所,中国科学院) Department of AI, Prince Mohammad bin Fahd University(人工智能系,普林姆·法赫德大学) Department of Computer Engineering, College of Computer Science, King Khalid University(计算机工程系,国王·卡利德大学)

专题命中 偏好对齐 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15548 2025-08-22 cs.AI 57%

DeepThink3D: Enhancing Large Language Models with Programmatic Reasoning in Complex 3D Situated Reasoning Tasks

Jiayi Song, Rui Wan, Lipeng Ma, Weidong Yang, Qingyuan Zhou, Yixuan Li, Ben Fei

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14951 2025-08-22 cs.CL 57%

Improving LLMs for Machine Translation Using Synthetic Preference Data

Dario Vajda, Domen Vreš, Marko Robnik-Šikonja

机构 * University of Ljubljana, Faculty of Computer and Information Science(卢布尔雅那大学计算机与信息科学系)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments Paper with individual presentation at LUHME workshop at ECAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12165 2025-08-19 cs.AI 57%

RLNVR: Reinforcement Learning from Non-Verified Real-World Rewards

Rohit Krishnan, Jon Evans

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15714 2025-08-19 cs.CL 57%

Chinchunmei at SemEval-2025 Task 11: Boosting the Large Language Model's Capability of Emotion Perception using Contrastive Learning

Tian Li, Yujian Sun, Huizhi Liang

机构 * School of Computing, Newcastle University(计算学院,新卡斯尔大学) Shumei AI Research Institute(舒美人工智能研究院)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Journal ref Association for Computational Linguistics, Proceedings of the 19th International Workshop on Semantic Evaluation (SemEval-2025), 319-330

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08101 2025-08-12 cs.HC cs.AI cs.SE 57%

ChatGPT on the Road: Leveraging Large Language Model-Powered In-vehicle Conversational Agents for Safer and More Enjoyable Driving Experience

Yeana Lee Bond, Mungyeong Choe, Baker Kasim Hasan, Arsh Siddiqui, Myounghoon Jeon

机构 * Computer Science, Virginia Tech, Blacksburg, Virginia, USA(计算机科学,弗吉尼亚理工学院,弗吉尼亚州黑斯堡,美国;弗吉尼亚理工学院黑斯堡弗吉尼亚美国) Virginia Tech Blacksburg Virginia USA

专题命中 偏好对齐 :safety(abstract);分类 cs.AI

Comments Submitted to International Journal of Human-Computer Studies. Bond and Choe: Drafting, Review, Editing, Validation, Software, Methodology, Investigation, Data Analysis, Conceptualization, Experiment training. Hasan and Siddiqui: Experimental and Data Analysis Support. Jeon: Supervision, Review, Resources, Project Admin, Methodology, Conceptualization. Total 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14860 2025-08-12 cs.CL 57%

ALFA: Aligning LLMs to Ask Good Questions A Case Study in Clinical Reasoning

Shuyue Stella Li, Jimin Mun, Faeze Brahman, Pedram Hosseini, Bryceton G. Thomas, Jessica M. Sin, Bing Ren, Jonathan S. Ilgen, Yulia Tsvetkov, Maarten Sap

机构 * University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) Allen Institute for AI(人工智能研究院) Lavita AI(Lavita人工智能) Dartmouth Medicine(达特茅斯医学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments 29 pages, 8 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05434 2025-08-11 cs.LG 57%

Sample-Efficient Reinforcement Learning from Human Feedback via Information-Directed Sampling

Han Qi, Haochen Yang, Qiaosheng Zhang, Zhuoran Yang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Xi’an Jiaotong University(西安交通大学) Peking University(北京大学) Yale University(耶鲁大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05660 2025-08-11 cs.IR cs.AI 57%

Open-Source Agentic Hybrid RAG Framework for Scientific Literature Review

Aditya Nagori, Ricardo Accorsi Casonatto, Ayush Gautam, Abhinav Manikantha Sai Cheruvu, Rishikesan Kamaleswaran

机构 * Department of Surgery, Department of Anesthesiology, Duke University School of Medicine Durham North Carolina United States Faculty of Technology, University of Brasilia Brasilia Federal District Brazil Indian Institute of Technology Goa Goa India Birla Institute of Technology \& Science Pilani Hyderabad India Department of Electrical Computer Engineering, Duke University Pratt School of Engineering Department of Surgery, Department of Anesthesiology, Duke University School of Medicine Durham North Carolina United States Department of Surgery, Department of Anesthesiology, Duke University School of Medicine Faculty of Technology, University of Brasilia Indian Institute of Technology Goa Birla Institute of Technology \& Science Pilani Computer Engineering, Duke University Pratt School of Engineering

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04088 2025-08-08 cs.CL 57%

GM-PRM: A Generative Multimodal Process Reward Model for Multimodal Mathematical Reasoning

Jianghangfan Zhang, Yibo Yan, Kening Zheng, Xin Zou, Song Dai, Xuming Hu

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05070 2025-08-06 cs.CL 57%

RIVAL: Reinforcement Learning with Iterative and Adversarial Optimization for Machine Translation

Tianjiao Li, Mengran Yu, Chenyu Shi, Yanjun Zhao, Xiaojing Liu, Qiang Zhang, Qi Zhang, Xuanjing Huang, Jiayin Wang

机构 * Bilibili Inc.(哔哩哔哩公司) Xi’an Jiaotong University(西安交通大学) School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23391 2025-08-01 cs.LG cs.RO 57%

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling

Tung M. Luu, Donghoon Lee, Younghwan Lee, Chang D. Yoo

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院)

专题命中 偏好对齐 :safety(abstract);分类 cs.LG

Comments Accepted to IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09213 2025-07-31 cs.CL 57%

FineMedLM-o1: Enhancing Medical Knowledge Reasoning Ability of LLM from Supervised Fine-Tuning to Test-Time Training

Hongzhou Yu, Tianhao Cheng, Yingwen Wang, Wen He, Qing Wang, Ying Cheng, Yuejie Zhang, Rui Feng, Xiaobo Zhang

机构 * Fudan University(复旦大学) Children’s Hospital of Fudan University(复旦大学附属儿童医院)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18013 2025-07-30 cs.CL 57%

Technical Report of TeleChat2, TeleChat2.5 and T1

Zihan Wang, Xinzhang Liu, Yitong Yao, Chao Wang, Yu Zhao, Zhihao Yang, Wenmin Deng, Kaipeng Jia, Jiaxin Peng, Yuyao Huang, Sishi Xiong, Zhuo Jiang, Kaidong Yu, Xiaohui Hu, Fubei Yao, Ruiyu Fang, Zhuoru Jiang, Ruiting Song, Qiyi Xie, Rui Xue, Xuewei He, Yanlei Xue, Zhu Yuan, Zhaoxi Zhang, Zilu Huang, Shiquan Wang, Xin Wang, Hanming Wu, Mingyuan Wang, Xufeng Zhan, Yuhan Sun, Zhaohu Xing, Yuhao Jiang, Bingkai Yang, Shuangyong Song, Yongxiang Li, Zhongjiang He, Xuelong Li

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

Comments 32 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20000 2025-07-29 cs.AI cs.DL 57%

Matching Game Preferences Through Dialogical Large Language Models: A Perspective

Renaud Fabre, Daniel Egret, Patrice Bellot

专题命中 偏好对齐 :trustworthy(abstract);分类 cs.AI

Comments 28 pages, 1 figure. Published in Applied Sciences

Journal ref Applied Sciences, 2025, 15(15), 8307

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19679 2025-07-29 cs.CV cs.AI 57%

Efficient Learning for Product Attributes with Compact Multimodal Models

Mandar Kulkarni

机构 * Flipkart Data Science(Flipkart数据科学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13574 2025-07-24 cs.IR cs.AI 57%

Enhancing Sequential Recommender with Large Language Models for Joint Video and Comment Recommendation

Bowen Zheng, Zihan Lin, Enze Liu, Chen Yang, Enyang Bai, Cheng Ling, Wayne Xin Zhao, Ji-Rong Wen

机构 * Renmin University of China(中国人民大学) Kuaishou Technology Co., Ltd.(快手科技有限公司)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

Comments Accepted by RecSys2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15275 2025-07-22 cs.CL 57%

ChiMed 2.0: Advancing Chinese Medical Dataset in Facilitating Large Language Modeling

Yuanhe Tian, Junjie Liu, Zhizhou Kou, Yuxiang Li, Yan Song

机构 * University of Washington(华盛顿大学) University of Science and Technology of China(中国科学技术大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02065 2025-07-22 cs.CR cs.AI cs.IR 57%

Too Much to Trust? Measuring the Security and Cognitive Impacts of Explainability in AI-Driven SOCs

Nidhi Rastogi, Shirid Pant, Devang Dhanuka, Amulya Saxena, Pranjal Mairal

机构 * Rochester Institute of Technology(罗切斯特技术学院) Independent Researcher(独立研究者)

专题命中 偏好对齐 :trustworthy(abstract);分类 cs.AI

Comments 13 pages, ACM Conference on Computer and Communications Security (CCS), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04695 2025-07-22 cs.LG 57%

Interpretable Reward Modeling with Active Concept Bottlenecks

Sonia Laguna, Katarzyna Kobalczyk, Julia E. Vogt, Mihaela Van der Schaar

机构 * Department of Computer Science, ETH Zurich, Zurich, Switzerland(苏黎世联邦理工学院计算机科学系) Department of Applied Mathematics and Theoretical Physics, University of Cambridge, United Kingdom(剑桥大学应用数学与理论物理系)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

Journal ref ICML 2025 Workshop on Programmatic Representations for Agent Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04617 2025-07-21 cs.CL 57%

Sparse Rewards Can Self-Train Dialogue Agents

Barrett Martin Lattimer, Varun Gangal, Ryan McDonald, Yi Yang

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments Accepted to ACL 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13541 2025-07-21 cs.AI 57%

PrefPalette: Personalized Preference Modeling with Latent Attributes

Shuyue Stella Li, Melanie Sclar, Hunter Lang, Ansong Ni, Jacqueline He, Puxin Xu, Andrew Cohen, Chan Young Park, Yulia Tsvetkov, Asli Celikyilmaz

机构 * Meta FAIR University of Washington(华盛顿大学) Meta GenAI

专题命中 偏好对齐 :trustworthy(abstract);分类 cs.AI

Comments 17 pages, 6 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12016 2025-07-18 cs.LG 57%

Active Human Feedback Collection via Neural Contextual Dueling Bandits

Arun Verma, Xiaoqiang Lin, Zhongxiang Dai, Daniela Rus, Bryan Kian Hsiang Low

机构 * Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联合研究技术联盟) Department of Computer Science, National University of Singapore(国立新加坡大学计算机科学系) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) CSAIL, MIT, USA(MIT计算机科学与人工智能实验室)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09502 2025-07-18 cs.LG cs.CV 57%

Golden Noise for Diffusion Models: A Learning Framework

Zikai Zhou, Shitong Shao, Lichen Bai, Shufei Zhang, Zhiqiang Xu, Bo Han, Zeke Xie

机构 * HKUST-GZ(香港科技大学-广州) Shanghai AI Lab(上海人工智能实验室) MBZUAI(穆罕默德·本·拉希德人工智能学院) HKBU(香港都会大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21536 2025-07-17 cs.AI cs.HC 57%

PsyLite Technical Report

Fangjun Ding, Renyu Zhang, Xinyu Feng, Chengye Xie, Zheng Zhang, Yanting Zhang

机构 * Donghua University(东华大学)

专题命中 偏好对齐 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10923 2025-07-16 cs.AI 57%

Enhancing Safe and Controllable Protein Generation via Knowledge Preference Optimization

Yuhao Wang, Keyan Ding, Kehua Feng, Zeyuan Wang, Ming Qin, Xiaotong Li, Qiang Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) ZJU-Hangzhou Global Scientific and Technological Innovation Center(浙大杭州国际科创中心)

专题命中 偏好对齐 :safety(abstract);分类 cs.AI

Comments Accepted at ACL 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05913 2025-07-09 stat.ML cs.LG 57%

Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis

Gholamali Aminian, Idan Shenfeld, Amir R. Asadi, Ahmad Beirami, Youssef Mroueh

机构 * The Alan Turing Institute, London, UK(艾伦·图灵研究所) Statistical Laboratory, University of Cambridge, Cambridge, UK(剑桥大学统计实验室) Massachusetts Institute of Technology, USA(麻省理工学院) IBM Research, USA(IBM研究院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

Comments Workshop on Efficient Systems for Foundation Models at iCML

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05911 2025-07-09 cs.SD cs.AI eess.AS 57%

Differentiable Reward Optimization for LLM based TTS system

Changfeng Gao, Zhihao Du, Shiliang Zhang

机构 * Speech Team, Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23235 2025-07-01 cs.CL 57%

Generalist Reward Models: Found Inside Large Language Models

Yi-Chen Li, Tian Xu, Yang Yu, Xuqin Zhang, Xiong-Hui Chen, Zhongxiang Ling, Ningjing Chao, Lei Yuan, Zhi-Hua Zhou

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(国家新型软件技术重点实验室,南京大学,中国) School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学,中国)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏