arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 30405 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3229 篇

2603.07023 2026-03-10 cs.CL cs.AI 81%

Hit-RAG: Learning to Reason with Long Contexts via Preference Alignment

通过偏好对齐学习长上下文的推理

Junming Liu, Yuqi Li, Shiping Wen, Zhigang Zeng, Tingwen Huang

机构 * Tongji University(同济大学) The City University of New York(纽约城市大学) University of Technology Sydney(悉尼大学) Huazhong University of Science and Technology(华中科技大学) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 Hit-RAG通过多阶段偏好对齐框架解决长上下文推理中的注意力稀释和幻觉问题,提升模型在长上下文场景下的推理能力。

Comments 21 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06797 2026-03-10 cs.AI cs.LG 81%

Best-of-Tails: Bridging Optimism and Pessimism in Inference-Time Alignment

最佳尾部:在推理时间对齐中弥合乐观与悲观

Hsiang Hsu, Eric Lei, Chun-Fu Chen

机构 * JPMorganChase Global Technology Applied Research(摩根大通全球技术应用研究)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出BoT框架,通过Tsallis分歧作为正则化器,在推理时间对齐中平衡乐观与悲观,提升对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05739 2026-03-09 cs.LG cs.AI 81%

Revisiting the (Sub)Optimality of Best-of-N for Inference-Time Alignment

重新审视最佳-N在推理时间对齐中的(次)最优性

Ved Sriraman, Adam Block

机构 * Columbia University(哥伦比亚大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文重新审视了最佳-N在推理时间对齐中的次优性,证明在特定条件下BoN在胜率上最优,并提出消除奖励黑客攻击的改进方法。

Comments 52 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03242 2026-03-04 cs.AI cs.CL 81%

Density-Guided Response Optimization: Community-Grounded Alignment via Implicit Acceptance Signals

密度引导的响应优化:通过隐含接受信号实现社区导向的对齐

Patrick Gerard, Svitlana Volkova

机构 * Information Sciences Institute, University of Southern California(信息科学研究所,南加州大学) Aptima Inc.(Aptima公司)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 通过隐含接受信号实现社区导向的对齐,无需显式偏好标签,提升语言模型在多样社区中的适应性与表现。

Comments 27 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13575 2026-03-03 cs.CL cs.AI 81%

Elo-Evolve: A Co-evolutionary Framework for Language Model Alignment

Elo-Evolve:一种用于语言模型对齐的共进化框架

Jing Zhao, Ting Zhen, Junwei Bao, Hongfei Jiang, Yang Song

机构 * Zuoyebang, Beijing, China(北京中关村)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 Elo-Evolve通过动态多代理竞争和自适应对手选择,提升大型语言模型对齐的稳定性与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03003 2026-02-24 cs.AI cs.LG 81%

Open Problems in Differentiable Social Choice: Learning Mechanisms, Decisions, and Alignment

可微社会选择中的开放问题:学习机制、决策与对齐

Zhiyu An, Wan Du

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了可微社会选择中的18个开放问题,研究如何将投票规则、机制和聚合过程作为可学习模型进行优化,揭示了经典公理在机器学习中的新应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05164 2026-02-06 cs.LG cs.AI 81%

Position: Capability Control Should be a Separate Goal From Alignment

位置:能力控制应是与对齐分开的目标

Shoaib Ahmed Siddiqui, Eleni Triantafillou, David Krueger, Adrian Weller

机构 * University of Cambridge(剑桥大学) Google DeepMind(谷歌DeepMind) University of Montreal(蒙特利尔大学) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文主张将能力控制视为与对齐不同的目标,提出分层的控制机制以应对模型的潜在滥用和失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18760 2026-01-27 cs.LG cs.CL 81%

Beyond Preferences: Learning Alignment Principles Grounded in Human Reasons and Values

超越偏好:基于人类理由和价值观的学习对齐原则

Henry Bell, Lara Neubauer da Costa Schertel, Bochu Ding, Brandon Fain

机构 * Duke University(杜克大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出GCAI框架,通过结合人类理由和价值观生成AI对齐原则,提升AI治理的道德基础和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11344 2026-01-19 cs.CL cs.AI 81%

How Much Would a Clinician Edit This Draft? Evaluating LLM Alignment for Patient Message Response Drafting

临床医生会修改这个草稿多少?评估LLM对患者信息回复草稿的对齐情况

Parker Seegmiller, Joseph Gatto, Sarah E. Greer, Ganza Belise Isingizwe, Rohan Ray, Timothy E. Burdick, Sarah Masud Preum

机构 * Department of Computer Science, Dartmouth College(计算机科学系,达特茅斯学院) Department of Community and Family Medicine, Dartmouth Health(社区与家庭医学系,达特茅斯健康) The Dartmouth Institute, Dartmouth College(达特茅斯研究所,达特茅斯学院)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了LLM在患者信息回复起草任务中的对齐情况,提出了一种新的评估框架,并发现需要根据临床医生的偏好进行适应以提高可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08848 2026-01-15 cs.CL cs.AI 81%

PediaMind-R1: A Temperament-Aware Language Model for Personalized Early Childhood Care Reasoning via Cognitive Modeling and Preference Alignment

PediaMind-R1: 一种基于气质的个性化婴幼儿护理推理语言模型:通过认知建模与偏好对齐

Zihe Zhang, Can Zhang, Yanheng Xu, Xin Hu, Jichao Leng

机构 * School of Future Information and Innovation, Fudan University(未来信息与创新学院,复旦大学) Corporate Research, Bosch (China) Investment Ltd.(博世(中国)投资有限公司研发部)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 PediaMind-R1通过整合认知建模与偏好对齐,实现基于婴幼儿气质的个性化护理推理。

Comments Accepted at EMNLP 2025 PALS Workshop (PALS: EXPLORING ACTIVE AND PASSIVE LLM PERSONALIZATION)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16628 2026-01-01 cs.LG cs.CL 81%

ParetoHqD: Fast Offline Multiobjective Alignment of Large Language Models using Pareto High-quality Data

ParetoHqD: 利用帕累托高质量数据快速实现大语言模型的多目标对齐

Haoran Gu, Handing Wang, Yi Mei, Mengjie Zhang, Yaochu Jin

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.LG

AI总结 ParetoHqD通过利用帕累托高质量数据实现大语言模型的多目标对齐,提升对齐效果和效率。

Comments Accepted as a main conference paper at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15811 2025-12-16 cs.CL cs.AI 81%

From Clicks to Preference: A Multi-stage Alignment Framework for Generative Query Suggestion in Conversational System

从点击到偏好:一种多阶段对齐框架用于对话系统中的生成查询建议

Junhao Yin, Haolin Wang, Peng Bao, Ju Xu, Yongliang Wang

机构 * Bytedance Shanghai China(字节跳动上海中国) Bytedance Beijing China(字节跳动北京中国)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种多阶段对齐框架,通过提示工程、知识蒸馏和高斯奖励模型,提升生成式查询建议的用户偏好对齐效果,实验显示在自动和人工评估中均优于基线,并提高用户参与度34%

Comments Accepted by SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13426 2025-12-16 cs.CL cs.AI 81%

ALIGN: Word Association Learning for Cultural Alignment in Large Language Models

ALIGN: 用于大语言模型中文化对齐的词关联学习

Chunhua Liu, Kabir Manandhar Shrestha, Sukai Huang

机构 * School of Computing and Information Systems, The University of Melbourne(计算与信息系统学院,墨尔本大学) Melbourne Data Analytics Platform, The University of Melbourne(墨尔本数据分析平台,墨尔本大学) Faculty of Information Technology, Monash University(信息技术学院,墨尔本大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 ALIGN通过微调大语言模型以学习母语使用者的词关联规范,显著提升文化对齐效果,无需昂贵重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19700 2025-12-16 cs.CL cs.AI 81%

Leveraging Importance Sampling to Detach Alignment Modules from Large Language Models

利用重要性采样将对齐模块从大语言模型中分离出来

Yi Liu, Dianqing Liu, Mingye Zhu, Junbo Guo, Yongdong Zhang, Zhendong Mao

机构 * State Key Laboratory of Communication Content Cognition, People’s Daily Online(通信内容认知国家重点实验室,人民在线) University of Science and Technology of China(中国科学技术大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出残差对齐模型(RAM),通过重要性采样将对齐模块与大语言模型分离,提升灵活性和可扩展性,并在多种任务上优于基线模型。

Comments Accepted by NeurIPS 2025, 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21101 2025-12-10 cs.CL cs.LG 81%

Mortgage Language Model: Domain-Adaptive Pretraining with Residual Instruction, Alignment Tuning, and Task-Specific Routing

抵押贷款语言模型:带有残差指令、对齐微调和任务特定路由的领域自适应预训练

Manish Jain, Satheesh Kumar Ponnambalam, Salman Faroz, Chandrakanth Lns, Vinay Sharma

机构 * Firstsource

专题命中 偏好对齐 :alignment(title);DPO(abstract);分类 cs.CL、cs.LG

AI总结 MortgageLLM通过双专家架构和残差指令技术,在抵押贷款领域实现领域自适应预训练,提升对话问答和结构化任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06196 2025-12-09 cs.AI cs.CL 81%

ARCANE: A Multi-Agent Framework for Interpretable and Configurable Alignment

ARCANE:一种多智能体框架,用于可解释和可配置的对齐

Charlie Masters, Marta Grześkiewicz, Stefano V. Albrecht

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 ARCANE是一种多智能体框架,通过动态规则生成实现可解释和可配置的对齐,适用于复杂长期任务。

Comments Accepted to the AAAI 2026 LLAMAS Workshop (Large Language Model Agents for Multi-Agent Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19023 2025-11-25 cs.LG cs.AI 81%

OrdMoE: Preference Alignment via Hierarchical Expert Group Ranking in Multimodal Mixture-of-Experts LLMs

OrdMoE:通过多模态混合专家模型中的层次专家小组排名实现偏好对齐

Yuting Gao, Weihao Chen, Lan Wang, Ruihan Xu, Qingpei Guo

机构 * AntGroup(蚂蚁集团) Peking University(北京大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 OrdMoE通过利用混合专家架构中的内在信号,实现多模态混合专家语言模型的零成本偏好对齐,无需人工标注数据即可提升模型对齐和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13007 2025-11-18 cs.AI cs.LG 81%

GEM: Generative Entropy-Guided Preference Modeling for Few-shot Alignment of LLMs

Yiyang Zhao, Huiyu Bai, Xuejiao Zhao

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

Comments This paper has been accepted by AAAI 2026-AIA and designated as an oral presentation paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12573 2025-11-18 cs.CL cs.AI 81%

Mitigating Length Bias in RLHF through a Causal Lens

Hyeonji Kim, Sujeong Oh, Sanghack Lee

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06965 2025-11-18 cs.CL cs.AI 81%

Uncovering Factor Level Preferences to Improve Human-Model Alignment

Juhyun Oh, Eunsu Kim, Jiseon Kim, Wenda Xu, Inha Cha, William Yang Wang, Alice Oh

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10656 2025-11-17 cs.CL cs.AI 81%

Preference Orchestrator: Prompt-Aware Multi-Objective Alignment for Large Language Models

Biao Liu, Ning Xu, Junming Yang, Xin Geng

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications(新一代人工智能技术及其交叉应用关键实验室) Ministry of Education(教育部)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05359 2025-11-10 cs.CR cs.CL cs.CY 81%

ConVerse: Benchmarking Contextual Safety in Agent-to-Agent Conversations

Amr Gomaa, Ahmed Salem, Sahar Abdelnabi

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Microsoft(微软) ELLIS Institute Tübingen and MPI for Intelligent Systems(图宾根ELLIS研究所和智能系统研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 偏好对齐 :safety(title,abstract);分类 cs.CL、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01183 2025-10-30 cs.LG cs.AI stat.ML 81%

Doubly Robust Alignment for Large Language Models

Erhan Xu, Kai Ye, Hongyi Zhou, Luhan Zhu, Francesco Quinzan, Chengchun Shi

机构 * Department of Statistics(统计系) LSE London, UK(伦敦大学学院) Department of Mathematics(数学系) Tsinghua University(清华大学) School of Design LCC, UAL London, UK(伦敦艺术大学设计学院) Department of Engineering Science(工程科学系) University of Oxford(牛津大学)

专题命中 偏好对齐 :alignment(title);RLHF(abstract);分类 cs.AI、cs.LG

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24700 2025-10-29 cs.LG cs.AI cs.IT math.IT stat.ML 81%

Greedy Sampling Is Provably Efficient for RLHF

Di Wu, Chengshuai Shi, Jing Yang, Cong Shen

机构 * Electrical and Computer Engineering University of Virginia(电气与计算机工程大学弗吉尼亚大学) Princeton Language and Intelligence Princeton University(普林斯顿语言与智能普林斯顿大学)

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21798 2025-10-27 cs.CL cs.AI 81%

Evaluating and Improving Cultural Awareness of Reward Models for LLM Alignment

Hongbin Zhang, Kehai Chen, Xuefeng Bai, Yang Xiang, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(计算与智能研究所,哈尔滨工业大学,深圳,中国) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments Under review;Work in progress;

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17041 2025-10-21 cs.CV cs.AI cs.LG 81%

Free$^2$Guide: Training-Free Text-to-Video Alignment using Image LVLM

Jaemin Kim, Bryan Sangwoo Kim, Jong Chul Ye

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

Comments ICCV 2025 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23564 2025-10-15 cs.AI cs.CL 81%

Clean First, Align Later: Benchmarking Preference Data Cleaning for Reliable LLM Alignment

Samuel Yeh, Sharon Li

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01700 2025-10-03 cs.AI cs.CV cs.LG 81%

VaPR -- Vision-language Preference alignment for Reasoning

Rohan Wadhawan, Fabrice Y Harel-Canada, Zi-Yi Dou, Suhaila Shakiah, Robinson Piramuthu, Nanyun Peng

机构 * Department of Computer Science, University of California Los Angeles(加州大学洛杉矶分校计算机科学系) Amazon.com, Inc.(亚马逊公司)

专题命中 偏好对齐 :alignment(title);DPO(abstract);分类 cs.AI、cs.LG

Journal ref COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24713 2025-09-30 cs.LG cs.AI 81%

Circuit-Aware Reward Training: A Mechanistic Framework for Longtail Robustness in RLHF

Jing Liu

机构 * ENS, Université PSL, EHESS, CNRS(高等科学研究所、巴黎国立大学、EHESS、国家科学研究中心)

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05381 2025-09-16 cs.AI cs.LG 81%

Murphys Laws of AI Alignment: Why the Gap Always Wins

Madhava Gaikwad

机构 * Microsoft(微软)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

Comments Provides a formal impossibility theorem (Murphys Gap) and welcomes collaboration on large-scale experiments and benchmark design

详情

展开后加载摘要…

URL PDF HTML 收藏