arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3238 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3238 篇

2602.24082 2026-03-02 cs.CL cs.AI 62%

Preference Packing: Efficient Preference Optimization for Large Language Models

偏好打包:大型语言模型高效偏好优化

Jaekyung Cho

机构 * AWS GenAI Innovation Center(AWS生成人工智能创新中心)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

AI总结 偏好打包通过减少重复输入提示的注意力操作和KV缓存内存使用,提升大型语言模型的训练效率,实验显示训练时间减少37%并实现3.22倍速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21745 2026-02-26 cs.AI cs.CY 62%

The ASIR Courage Model: A Phase-Dynamic Framework for Truth Transitions in Human and AI Systems

ASIR勇气模型:人类和人工智能系统中真相过渡的相动态框架

Hyo Jin Kim

机构 * Jinple Studio(jinple工作室)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 ASIR勇气模型通过相动态框架,将真相披露视为状态转换过程,适用于人类和AI系统在压力下的行为分析与建模。

Comments 13 pages, 5 figures. Version 1. Includes recursive feedback extension and simulation results. Data available via DOI: 10.5281/zenodo.18754266

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19519 2026-02-24 cs.AI cs.LG 62%

Ada-RS: Adaptive Rejection Sampling for Selective Thinking

Ada-RS: 选择性思维的自适应拒绝采样

Yirou Ge, Yixi Li, Alec Chiu, Shivani Shekhar, Zijie Pan, Avinash Thangali, Yun-Shiuan Chuang, Chaitanya Kulkarni, Uma Kona, Linsey Pang, Prakhar Mehrotra

机构 * PayPal AI

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG

AI总结 Ada-RS通过自适应拒绝采样提升LLMs在延迟敏感场景下的推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17695 2026-02-23 cs.LG cs.AI cs.IR 62%

EXACT: Explicit Attribute-Guided Decoding-Time Personalization

EXACT: 显式属性引导的解码时个性化

Xin Yu, Hanwen Xing, Lingzhou Xue

机构 * Department of Statistics, the Pennsylvania State University, PA, USA(统计系,宾夕法尼亚州立大学) University of Southern California, CA, USA(南加州大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 EXACT通过显式属性引导解码时个性化,利用预定义可解释属性提升生成质量,有效缓解上下文偏好变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13957 2026-02-20 cs.AI cs.LG cs.RO 62%

Goal Inference from Open-Ended Dialog

从开放式对话中推断目标

Rachel Ma, Jingyi Qu, Andreea Bobu, Dylan Hadfield-Menell

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出了一种在线方法,通过自然语言提取目标并利用贝叶斯推断,使具身代理在开放式对话中高效学习和完成多样化用户目标。

Comments This version has been updated to reflect a copy of Master's thesis submitted Jan 24, 2025 for degree date Feb 2025 (https://hdl.handle.net/1721.1/158960). We recommend readers to read revised version incorporating a different agent pipeline and methodological approach which is available at: arXiv:2508.15119

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00040 2026-02-20 cs.LG cs.AI 62%

Semi-Supervised Preference Optimization with Limited Feedback

半监督偏好优化与有限反馈

Seonggyun Lee, Sungjun Lim, Seojin Park, Soeun Cheon, Kyungwoo Song

机构 * Yonsei University(延世大学) Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出半监督偏好优化方法,通过结合少量标注数据和大量未标注数据,有效提升模型对齐人类偏好的效率,减少数据获取成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13367 2026-02-17 cs.AI cs.CL 62%

Nanbeige4.1-3B: A Small General Model that Reasons, Aligns, and Acts

纳贝格4.1-3B:一个小型通用模型,能够推理、对齐和行动

Chen Yang, Guangyue Peng, Jiaying Zhu, Ran Le, Ruixiang Feng, Tao Zhang, Xiyun Xu, Yang Song, Yiming Jia, Yuntao Wen, Yunzhi Xu, Zekai Wang, Zhenwei An, Zhicong Sun, Zongchao Chen

机构 * Nanbeige LLM Lab(纳贝geist 语言模型实验室)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 Nanbeige4.1-3B是一款小型通用模型,通过结合奖励建模和复杂性感知奖励,实现了强大的推理、代码生成和代理行为,展示了3B参数模型的广泛能力与专业性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01511 2026-02-13 cs.CL cs.LG 62%

Alternating Reinforcement Learning for Rubric-Based Reward Modeling in Non-Verifiable LLM Post-Training

交替强化学习用于非可验证大语言模型后训练的评分标准建模

Ran Xu, Tianci Liu, Zihan Dong, Tony Yu, Ilgee Hong, Carl Yang, Linjun Zhang, Tao Zhao, Haoyu Wang

机构 * Emory University(埃默里大学) Purdue University(普渡大学) Rutgers University(罗格斯大学) Georgia Institute of Technology(佐治亚理工学院) University at Albany(阿尔巴尼大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 Rubric-ARM通过交替强化学习优化评分标准生成与评判,提升非可验证领域大语言模型后训练的响应质量评估与策略对齐性能。

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03784 2026-02-11 stat.ML cs.AI cs.LG 62%

Robust Reinforcement Learning from Human Feedback for Large Language Models Fine-Tuning

从人类反馈中鲁棒强化学习用于大语言模型微调

Kai Ye, Hongyi Zhou, Jin Zhu, Francesco Quinzan, Chengchun Shi

机构 * Department of Statistics, LSE(统计系,伦敦经济学院) Department of Mathematics, Tsinghua University(数学系,清华大学) School of Mathematics, University of Birmingham(数学学院,伯明翰大学) Department of Engineering Science, University of Oxford(工程科学系,牛津大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种鲁棒的强化学习算法,用于改进大语言模型微调中从人类反馈学习奖励函数的性能,通过减少方差和改进后悔界,实验证明其在基准数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08829 2026-02-10 cs.CL cs.AI 62%

WildReward: Learning Reward Models from In-the-Wild Human Interactions

WildReward: 从真实世界的人类交互中学习奖励模型

Hao Peng, Yunjia Qi, Xiaozhi Wang, Zijun Yao, Lei Hou, Juanzi Li

机构 * Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

AI总结 本文提出WildReward,通过真实世界用户交互直接学习奖励模型,无需偏好对,实现更优的校准和一致性,并在多种任务中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12844 2026-02-10 cs.AI cs.LG 62%

Towards Reinforcement Learning from Neural Feedback: Mapping fNIRS Signals to Agent Performance

迈向基于神经反馈的强化学习:将fNIRS信号映射到智能体表现

Julia Santaniello, Matthew Russell, Benson Jiang, Donatello Sassaroli, Robert Jacob, Jivko Sinapov

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过fNIRS信号预测智能体表现,利用分类器和回归器提升RLHF性能,并验证了跨受试者泛化能力。

Comments Accepted to the Association for the Advancement of Artificial Intelligence (AAAI) 2026. To appear in the AAAI 2026 Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05205 2026-02-06 cs.CL cs.AI 62%

Aligning Large Language Model Behavior with Human Citation Preferences

使大型语言模型行为与人类引用偏好对齐

Kenichiro Ando, Tatsuya Harada

机构 * RIKEN AIP(日本研究所)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过构建数据集分析LLM引用行为与人类偏好的一致性,发现模型在引用医学文本和数字句子上存在偏差,通过优化可提升对齐效果。

Comments Work In Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05049 2026-02-06 cs.CV cs.AI cs.LG cs.RO 62%

VISTA: Enhancing Visual Conditioning via Track-Following Preference Optimization in Vision-Language-Action Models

VISTA: 通过视觉跟踪偏好优化增强视觉条件化在视觉-语言-动作模型中

Yiye Chen, Yanan Jian, Xiaoyi Dong, Shuxin Cao, Jing Wu, Patricio Vela, Benjamin E. Lundell, Dongdong Chen

机构 * Nvidia(Nvidia公司) Microsoft(微软公司) University of Oxford(牛津大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 VISTA通过视觉跟踪偏好优化提升视觉条件化,增强VLA模型在视觉-动作对齐和任务性能上的表现。

Comments In submission. Project website: https://vista-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03876 2026-02-05 cs.LG cs.AI 62%

GOPO: Policy Optimization using Ranked Rewards

GOPO:基于排名奖励的策略优化

Kyuseong Choi, Dwaipayan Saha, Woojeong Kim, Anish Agarwal, Raaz Dwivedi

机构 * Cornell Tech, Cornell University, NY, United States(康奈尔科技、康奈尔大学,纽约,美国) Columbia University, NY, United States(哥伦比亚大学,纽约,美国)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

AI总结 GOPO通过使用奖励排名而非绝对值,提高了不可验证任务中策略优化的性能和效率。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13131 2026-02-05 cs.CL cs.LG stat.ML 62%

Improving Detection of Watermarked Language Models

提升水印语言模型的检测能力

Dara Bahri, John Wieting

机构 * Google DeepMind(谷歌DeepMind)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.LG

AI总结 本文通过结合水印与非水印检测器提升大型语言模型的检测能力。

Comments Published at TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03635 2026-02-04 cs.CL cs.LG 62%

TRE: Encouraging Exploration in the Trust Region

TRE: 在信任区域中鼓励探索

Chao Huang, Yujing Lu, Quangang Li, Shenghe Wang, Yan Wang, Yueyang Zhang, Long Xia, Jiashu Zhao, Zhiyuan Sun, Daiting Shi, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Baidu Inc.(百度公司) Wilfrid Laurier University(威尔弗里德·劳里埃大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 TRE通过在模型信任区域内鼓励探索,提升了大型语言模型在数学推理、组合搜索和偏好对齐任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01068 2026-02-03 cs.CL cs.AI 62%

From Utterance to Vividity: Training Expressive Subtitle Translation LLM via Adaptive Local Preference Optimization

从话语到生动性:通过自适应局部偏好优化训练表达性字幕翻译LLM

Chaoqun Cui, Shijing Wang, Liangbin Huang, Qingqing Gu, Zhaolong Huang, Xiao Zeng, Wenji Mao

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Hujing Digital Media & Entertainment Group(华景数字媒体与娱乐集团) Geely AI lab(吉利AI实验室)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出ALPO方法,通过构建多方向字幕语料库,优化翻译LLM的表达性和生动性,提升翻译质量的多维评估性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02341 2026-02-03 cs.CL cs.AI 62%

DRIFT: Learning from Abundant User Dissatisfaction in Real-World Preference Learning

DRIFT:从现实世界偏好学习中学习大量用户不满

Yifan Wang, Bolian Li, Junlin Wu, Zhaoxuan Tan, Zheli Liu, Ruqi Zhang, Ananth Grama, Qingkai Zeng

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

AI总结 DRIFT通过利用现实世界中的用户不满信号,提升大语言模型的偏好学习性能,实现更高的任务得分和胜率,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22432 2026-02-02 cs.LG cs.CL 62%

ReNCE: Learning to Reason by Noise Contrastive Estimation

ReNCE: 通过噪声对比估计学习推理

Wenzheng Zhang, Karl Stratos

机构 * Rutgers University(罗杰斯大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.LG

AI总结 ReNCE通过噪声对比估计学习提升大语言模型的推理能力,采用显式对比学习方法在数学基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21611 2026-01-30 cs.IR cs.AI cs.CL 62%

Thinking Broad, Acting Fast: Latent Reasoning Distillation from Multi-Perspective Chain-of-Thought for E-Commerce Relevance

深度思考,快速行动:多视角链式推理的潜在推理蒸馏用于电子商务相关性

Baopu Qiu, Hao Chen, Yuanrong Wu, Changtong Zan, Chao Wei, Weiru Zhang, Xiaoyi Zeng

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团) Zhejiang University(浙江大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

AI总结 本文提出多视角链式推理蒸馏方法,通过改进的教师模型和轻量级学生模型提升电子商务搜索相关性建模的准确性和效率。

Comments 12 pages, 6 figures, Accepted by WWW2026 industry track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11311 2026-01-30 cs.AI cs.CY 62%

Prompts to Proxies: Emulating Human Preferences via a Compact LLM Ensemble

通过紧凑的LLM集合模拟人类偏好:提示到代理

Bingchen Wang, Zi-Yu Khoo, Jingtan Wang

机构 * Independent Researcher, China(中国独立研究者) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 通过紧凑的LLM集合模拟人类偏好,P2P方法在无需微调和敏感数据的情况下,有效重建目标人群偏好并实现高质量预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14616 2026-01-29 cs.CL cs.AI 62%

Beyond Correctness: Evaluating Subjective Writing Preferences Across Cultures

超越正确性:跨文化的主观写作偏好评估

Shuangshuang Ying, Yunwen Li, Xingwei Qu, Xin Li, Sheng Jin, Minghao Liu, Zhoufutu Wen, Xeron Du, Tianyu Zheng, Yichi Zhang, Letian Ni, Yuyang Cheng, Zhenzhu Yang, Qiguang Chen, Jingzhe Ding, Shengda Long, Wangchunshu Zhou, Jiazhan Feng, Wanjun Zhong, Libo Qin, Ge Zhang, Wenhao Huang, Wanxiang Che, Chenghua Lin

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文提出WritingPreferenceBench数据集,发现基于序列的奖励模型在评估主观写作偏好时表现不佳,而生成奖励模型通过推理链达到更高准确率,揭示了当前RLHF方法在捕捉主观偏好方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21044 2026-01-28 cs.LG cs.AI 62%

Reinforcement Learning Fine-Tuning Enhances Activation Intensity and Diversity in the Internal Circuitry of LLMs

强化学习微调增强大语言模型内部电路的激活强度和多样性

Honglin Zhang, Qianyue Hao, Fengli Xu, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系,BNRist,清华大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG

AI总结 强化学习微调增强了LLMs内部电路的激活强度和多样性,相较于偏好优化方法,其在数学泛化上的优势源于信息流的冗余与灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10139 2026-01-28 cs.CL cs.AI 62%

Unsupervised Elicitation of Language Models

无监督的语言模型引导

Jiaxin Wen, Zachary Ankner, Arushi Somani, Peter Hase, Samuel Marks, Jacob Goldman-Wetzler, Linda Petrini, Henry Sleight, Collin Burns, He He, Shi Feng, Ethan Perez, Jan Leike

机构 * Anthropic Schmidt Sciences New York University(纽约大学) George Washington University(乔治华盛顿大学)

专题命中 偏好对齐 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出无监督算法ICM,通过模型自动生成标签来微调语言模型,无需外部监督,在多个任务中表现出色,尤其在超人类能力任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04472 2026-01-27 cs.CL cs.AI 62%

RECAP: REwriting Conversations for Intent Understanding in Agentic Planning

RECAP:用于代理规划中意图理解的对话重写

Kushan Mitra, Dan Zhang, Hannah Kim, Estevam Hruschka

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

AI总结 RECAP通过对话重写提升代理规划中的意图理解,提出新基准和方法,验证重写对规划效用的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05553 2026-01-22 cs.CL cs.CY 62%

Do Political Opinions Transfer Between Western Languages? An Analysis of Unaligned and Aligned Multilingual LLMs

政治观点在西方语言之间是否转移?对未对齐和对齐的多语言大语言模型的分析

Franziska Weeber, Tanise Ceron, Sebastian Padó

机构 * University of Stuttgart(斯图加特大学) Bocconi University(博科尼大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 研究探讨多语言大语言模型在五种西方语言中政治观点的转移情况,发现对齐前模型观点差异小,对齐后观点在各语言间均匀转移。

Comments EACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13806 2026-01-21 cs.CL cs.LG 62%

Knowledge Graph-Assisted LLM Post-Training for Enhanced Legal Reasoning

基于知识图谱的LLM后训练以增强法律推理

Dezhao Song, Guglielmo Bonifazi, Frank Schilder, Jonathan Richard Schwarz

机构 * Thomson Reuters Foundational Research(汤姆森·路透基础研究) Imperial College London(帝国理工学院伦敦分校)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于知识图谱的LLM后训练方法,通过构建法律知识图谱提升法律推理能力,在多个基准测试中优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20156 2026-01-21 cs.CL cs.AI cs.SD eess.AS 62%

Fun-Audio-Chat Technical Report

Fun-Audio-Chat 技术报告

Tongyi Fun Team, Qian Chen, Luyao Cheng, Chong Deng, Xiangang Li, Jiaqing Liu, Chao-Hong Tan, Wen Wang, Junhao Xu, Jieping Ye, Qinglin Zhang, Qiquan Zhang, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

AI总结 Fun-Audio-Chat通过双分辨率语音表示和核心鸡尾酒训练,解决语音-文本模型的时间分辨率不匹配和灾难性遗忘问题,实现高效且高质量的音频理解与生成。

Comments Authors are listed in alphabetical order, 21 pages, open-source at https://github.com/FunAudioLLM/Fun-Audio-Chat

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09929 2026-01-21 eess.AS cs.AI cs.LG 62%

Aligning Generative Speech Enhancement with Perceptual Feedback

将生成式语音增强与感知反馈对齐

Haoyang Li, Nana Hou, Yuchen Hu, Jixun Yao, Sabato Marco Siniscalchi, Xuyi Zhuang, Deheng Ye, Wei Yang, Eng Siong Chng

机构 * Nanyang Technological University, Singapore(南洋理工大学) Independent Researcher(独立研究者) Northwestern Polytechnical University, China(西北工业大学) University of Palermo, Italy(巴勒莫大学) Tencent(腾讯)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于语言模型的语音增强方法,通过引入感知反馈和直接偏好优化,提升语音质量并建立新的感知对齐增强范式。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11579 2026-01-21 cs.CL cs.AI 62%

Bielik 11B v3: Multilingual Large Language Model for European Languages

Bielik 11B v3:面向欧洲语言的多语言大语言模型

Krzysztof Ociepa, Łukasz Flis, Remigiusz Kinas, Krzysztof Wróbel, Adrian Gwoździej

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

AI总结 Bielik 11B v3是一款针对波兰语优化,同时支持多种欧洲语言的高性能大语言模型,通过深度扩展和四阶段训练流程实现了高效参数利用和广泛任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏