arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3229 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3229 篇

2606.18747 2026-06-18 cs.RO cs.AI 新提交 81%

Generating Natural and Expressive Robot Gestures through Iterative Reinforcement Learning with Human Feedback using LLMs

通过基于人类反馈的迭代强化学习利用大语言模型生成自然且富有表现力的机器人手势

Chris Lee, Flora Salim, Benjamin Tag, Francisco Cruz

机构 * University of New South Wales(新南威尔士大学) Universidad Central de Chile(智利中央大学)

专题命中 偏好对齐 :RLHF(summary_cn,abstract);分类 cs.AI

AI总结 针对社交机器人手势生成僵硬问题,提出将ChatGPT集成到Pepper机器人中生成共语手势,并引入基于人类反馈的迭代强化学习(RLHF)优化手势,实验表明RLHF提升了手势的表现力、相关性和流畅性。

Comments 8 Pages, 6 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14629 2026-06-15 cs.CR cs.AI 新提交 81%

When Good Verifiers Go Bad: Self-Improving VLMs Can Regress on New Tasks

当好的验证器变坏:自我改进的视觉语言模型可能在新任务上退步

Jianzhe Lin

机构 * MetaAI(Meta)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI

AI总结 本文发现验证器驱动的自我DPO中,验证器质量具有任务特异性,在低准确率任务上会导致学生模型性能退步,并给出机制解释和部署建议。

Comments 12 pages, 2 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12578 2026-06-12 cs.CL 新提交 81%

MARD: Mirror-Augmented Reasoning Distillation for Mechanism-Level Drug-Drug Interaction Prediction

MARD: 镜像增强推理蒸馏用于机制级药物-药物相互作用预测

Mohammadreza Riyazat, Vian Lelo, Rameen Jafri, Yumna Khan, Abeer Badawi

机构 * University of Guelph(圭尔夫大学) York University(约克大学) Vector Institute(向量研究所)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL

AI总结 提出MARD-7B模型,通过镜像增强推理蒸馏、单token KL散度、PRM加权DPO和机制感知检索通道,在机制级DDI预测中准确率超越GPT-4o 6.7个百分点,且成本仅为1%。

Comments 29 pages, 9 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09533 2026-06-11 cs.AI 版本更新 81%

Autoregressive Direct Preference Optimization

自回归直接偏好优化

Masanari Oi, Mahiro Ukai, Masahiro Kaneko, Naoaki Okazaki, Nakamasa Inoue

机构 * University of Tokyo(东京大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI

AI总结 提出自回归直接偏好优化(ADPO),在应用Bradley-Terry模型前显式引入自回归假设,通过将DPO目标中的求和操作移至log-sigmoid函数外部,实现更优的偏好对齐,并首次区分token长度μ和反馈长度μ'两种度量。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23982 2026-06-11 cs.CL cs.AI cs.CY cs.LG cs.NE 版本更新 81%

Toward Preference-aligned Large Language Models via Residual-based Model Steering

基于残差模型引导的偏好对齐大型语言模型

Lucio La Cava, Andrea Tagarelli

机构 * DIMES Dept., University of Calabria, Italy(卡利博大学DIMES系)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 提出PaLRS方法,利用残差流中的偏好信号提取轻量级引导向量,无需训练即可在推理时对齐模型偏好,在数学推理和代码生成任务上取得一致提升,同时节省大量时间。

Comments Accepted at IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04929 2026-06-04 cs.LG cs.CR 81%

Sequential Data Poisoning in LLM Post-Training

LLM后训练中的顺序数据投毒

Jack Sanderson, Yihan Wang, Xiaoqian Lu, Gautam Kamath, Yiwei Lu

机构 * University of Chicago(芝加哥大学) University of Waterloo(滑铁卢大学) University of Ottawa(渥太华大学) Vector Institute(向量研究所)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);分类 cs.LG

AI总结 提出顺序数据投毒威胁模型,研究多个攻击者在LLM后训练不同阶段(SFT和偏好数据)分别投毒,发现单一攻击者看似威胁小但多阶段协作会暴露真实漏洞,且不同管道中贡献呈加性或互补性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04588 2026-06-04 cs.CL 81%

VCIFBench: Evaluating Complex Instruction Following for Video Understanding

VCIFBench:评估视频理解中的复杂指令遵循能力

Huangchen Xu, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University(知识驱动人机智能工程研究中心,吉林大学) International Center of Future Science, Jilin University(未来科学国际中心,吉林大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL

AI总结 提出VCIFBench基准,通过混合验证流水线评估多模态大模型在视频理解中遵循内容、格式、风格和结构约束的复杂指令能力,实验表明联合约束满足仍具挑战,DPO训练可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16014 2026-06-03 cs.CL 81%

Ranking Free RAG: Replacing Re-ranking with Selection in RAG for Sensitive Domains

无排序RAG:用选择替代重排序以应用于敏感领域

Yash Saxena, Ankur Padia, Mandar S Chaudhary, Kalpa Gunaratna, Srinivasan Parthasarathy, Manas Gaur

机构 * University of Washington(华盛顿大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL

AI总结 提出METEORA框架,通过DPO微调LLM生成检索理由、统计肘部检测自适应截断和验证器过滤,在敏感领域实现可解释、高效且鲁棒的证据选择,无需重排序。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01914 2026-06-02 cs.CL cs.CV 81%

Mechanistic Diagnostics of Spatial Lexical Bias in Multimodal Large Language Model Spatial Reasoning

多模态大语言模型空间推理中空间词汇偏差的机制诊断

Chuang Ma, Qianying Liu, Tomoyuki Obuchi, Fei Cheng, Wang Yang, Sudong Cai, Shuyuan Zheng, Akiko Aizawa, Sadao Kurohashi

机构 * Kyoto University(京都大学) NII LLMC(日本国立信息与通信技术研究所语言模型中心) RIKEN AIP(日本理化学研究所先进理工研究所) Case Western Reserve University(凯斯西储大学) The Hong Kong Polytechnic University(香港理工大学) The University of Osaka(大阪大学) University of Tokyo(东京大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL

AI总结 本文发现多模态大语言模型存在空间词汇偏差,即添加空间关系词会吸引模型选择该选项,并通过机制可解释性工具揭示偏差主要源于语言侧而非视觉侧,最后提出轻量级LLM-only DPO更新可有效缓解偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28888 2026-05-29 cs.IR cs.LG 81%

Generative Spatiotemporal Intent Sequence Recommendation via Implicit Reasoning in Amap

高德地图中基于隐式推理的生成式时空意图序列推荐

Sicong Wang, Ruiting Dong, Yue Liu, Bowen Zheng, Jun Meng, Jie Li, Shuaijun Guo, Yu Gu, Fanyi Di, Xin Li

机构 * AMAP, Alibaba Group(阿里集团地图(AMAP))

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.LG

AI总结 提出GPlan框架,通过渐进式隐式思维链蒸馏和时空反事实DPO,将LLM推理能力压缩至轻量模型,实现低延迟且符合时空约束的意图序列生成。

Comments 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21883 2026-05-27 cs.CL 81%

Token-weighted Direct Preference Optimization with Attention

基于注意力的令牌加权直接偏好优化

Chengyu Huang, Zhuohang Li, Sheng-Yen Chou, Claire Cardie

机构 * Cornell University(康奈尔大学) Vanderbilt University(范德比大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL

AI总结 提出Token-weighted DPO (TwDPO)方法,利用注意力机制估计令牌权重,在不增加额外训练成本的情况下提升大语言模型与人类偏好对齐的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24686 2026-05-26 cs.AI 81%

Emotional intelligence in large language models is fragmented across perception, cognition, and interaction

大型语言模型中的情商在感知、认知和交互上存在碎片化

Minghao Lv, Lu Chen, Enchang Zhang, Anji Zhou, Xiaoran Xue, Hanyi Zhang, Fenghua Tang, Zhuo Rachel Han, Mengyue Wu

机构 * X-LANCE Lab(X-LANCE实验室) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) MoE Key Lab of Artificial Intelligence(人工智能MOE重点实验室) Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室) Beijing Key Laboratory of Applied Experimental Psychology(北京应用实验心理学重点实验室) National Demonstration Center for Experimental Psychology Education, Faculty of Psychology, Beijing Normal University(北京师范大学实验心理学教育国家级示范中心,心理学学院)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出FACET框架,基于Mayer-Salovey-Caruso四分支能力模型评估大型语言模型的情商,发现其并非单一能力,而是在认知和交互维度上碎片化,且隐藏情绪识别是普遍瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22211 2026-05-22 cs.AI 81%

CLORE: Content-Level Optimization for Reasoning Efficiency

CLORE:面向推理效率的内容级优化

Yuyang Wu, Qiyao Xue, Guanxing Lu, Weichen Liu, Zihan Wang, Manling Li, Olexandr Isayev

机构 * Carnegie Mellon University(卡内基梅隆大学) Northwestern University(西北大学) University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校) University of Pittsburgh(匹兹堡大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI

AI总结 本文提出CLORE框架,通过编辑正确在线轨迹来提升大语言模型的推理效率,通过外部增强模型删除冗余、不可读或无关内容,同时保留最终答案,并结合辅助参考-free DPO目标和标准策略梯度训练优化增强-原始对,实验表明CLORE在五个数学推理基准上提升了准确性和效率的平衡,并与GRPO、DAPO、Training Efficient和ThinkPrune兼容。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22664 2026-05-19 cs.AI 81%

Real-Time Aligned Reward Model beyond Semantics

实时对齐奖励模型超越语义

Zixuan Huang, Xin Xia, Yuxi Ren, Jianbin Zheng, Xuefeng Xiao, Hongyan Xie, Li Huaqiu, Songshi Liang, Zhongxiang Dai, Fuzhen Zhuang, Jianxin Li, Yikun Ban, Deqing Wang

机构 * Beihang University(北京航空航天大学) Tsinghua University(清华大学) Renmin University of China(中国人民大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 偏好对齐 :RLHF(summary_cn,abstract);分类 cs.AI

AI总结 本文提出R2M框架,通过实时利用策略模型反馈来对齐策略分布偏移,解决RLHF中奖励过拟合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00778 2026-05-18 cs.LG 81%

What Is Preference Optimization Doing, and Why?

偏好优化在做什么,为什么这样做?

Yue Wang, Qizhou Wang, Zizhuo Zhang, Gang Niu, Bo Han, Masashi Sugiyama

机构 * TMLR Group, Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系 TMLR 组) RIKEN AIP(理化学研究所 AIP 分室) The University of Tokyo(东京大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.LG

AI总结 本文分析了偏好优化中DPO和PPO的优化动态,揭示了其算法行为差异及根本原因,探讨了正学习、负学习和损失再加权的作用,并通过消融研究验证了这些动态对优化效率和性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13307 2026-05-14 cs.CL cs.HC 81%

PRISM-X: Experiments on Personalised Fine-Tuning with Human and Simulated Users

PRISM-X:基于人类和模拟用户的人个性化微调实验

Hannah Rose Kirk, Liu Leqi, Fanzhi Zeng, Henry Davidson, Bertie Vidgen, Christopher Summerfield, Scott A. Hale

机构 * University of Oxford(牛津大学) UK AI Security Institute(英国人工智能安全研究所) University of Texas at Austin(德克萨斯大学奥斯汀分校) Mercor Meedan

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL

AI总结 研究通过大规模内侧实验评估个性化语言模型在多轮对话中的表现,发现基于偏好微调的P-DPO方法优于通用模型和个性化提示,但个性化数据训练收益有限,且微调会放大趋炎附势行为,可能带来长期负面影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08178 2026-05-12 cs.AI 81%

Aligning Agents via Planning: A Benchmark for Trajectory-Level Reward Modeling

通过规划对齐代理:一个轨迹级奖励建模的基准测试

Jiaxuan Wang, Yulan Hu, Wenjin Yang, Zheng Pan, Xin Li, Lan-Zhe Guo

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) AMAP, Alibaba Group(阿里集团AMAP)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出Plan-RewardBench,用于评估奖励模型在复杂工具使用场景中区分优选与干扰代理轨迹的能力,揭示了代理级奖励建模在长周期轨迹上的挑战。

Comments accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26120 2026-04-30 cs.AI 81%

Hierarchical Multi-Persona Induction from User Behavioral Logs: Learning Evidence-Grounded and Truthful Personas

层级多角色诱导从用户行为日志:学习证据导向且真实的角色

Nayoung Choi, Haeyu Jeong, Changbong Kim, Hongjun Lim, Jinho D. Choi

机构 * Department of Computer Science, Emory University(埃默里大学计算机科学系) Naver Corporation(Naver公司)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出层级框架,通过聚类和标注用户行为记忆,诱导多个证据支撑的角色,提升角色的连贯性、证据性和可信度,同时提高未来交互预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24953 2026-04-30 cs.CV cs.AI 81%

ViPO: Visual Preference Optimization at Scale

ViPO:大规模视觉偏好优化

Ming Li, Jie Wu, Justin Cui, Xiaojie Li, Rui Wang, Chen Chen

机构 * University of Central Florida(中央佛罗里达大学) ByteDance Seed(字节跳动种子) UCLA(加州大学洛杉矶分校)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI

AI总结 本文提出ViPO大规模偏好数据集和Poly-DPO方法,通过提升数据质量和算法鲁棒性,实现视觉生成模型的高效偏好优化。

Comments ICLR 2026 Paper. Project Page: https://liming-ai.github.io/ViPO ; Code: https://github.com/liming-ai/ViPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23646 2026-04-28 cs.AI cs.CR 81%

Structural Enforcement of Goal Integrity in AI Agents via Separation-of-Powers Architecture

通过分权架构在AI代理中强制实施目标完整性

Rong Xiang

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出分权架构PEA,通过分离意图生成、授权和执行层,强制保障系统安全,解决AI代理目标不一致问题,提出五个核心贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19406 2026-04-22 cs.CV cs.AI 81%

HP-Edit: A Human-Preference Post-Training Framework for Image Editing

HP-Edit:一种用于图像编辑的人类偏好后训练框架

Fan Li, Chonghuinan Wang, Lina Lei, Yuping Qiu, Jiaqi Xu, Jiaxiu Jiang, Xinran Qin, Zhikai Chen, Fenglong Song, Zhixin Wang, Renjing Pei, Wangmeng Zuo

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) Harbin Institute of Technology(哈尔滨工业大学) Nankai University(南开大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出HP-Edit框架和RealPref-50K数据集,通过少量人类偏好评分数据和预训练视觉大语言模型开发自动评估器,提升图像编辑模型对人类偏好的契合度。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18489 2026-04-21 cs.SD cs.CL eess.AS 81%

Aligning Language Models for Lyric-to-Melody Generation with Rule-Based Musical Constraints

基于规则的音乐约束对齐语言模型用于歌词到旋律生成

Hao Meng, Siyuan Zheng, Shuran Zhou, Qiangqiang Wang, Yang Song

机构 * Zuoyebang Education Technology(中关村教育科技)

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract);分类 cs.CL

AI总结 本文提出基于规则的音乐约束对齐框架,通过DPO和KTO优化减少旋律生成中的约束违规,提升音乐性和连贯性。

Comments Accepted by IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08441 2026-01-14 cs.AI 81%

YaPO: Learnable Sparse Activation Steering Vectors for Domain Adaptation

YaPO: 用于领域适应的可学习稀疏激活引导向量

Abdelaziz Bounhar, Rania Hossam Elmohamady Elbadry, Hadi Abdine, Preslav Nakov, Michalis Vazirgiannis, Guokan Shang

机构 * MBZUAI Ecole Polytechnique(巴黎政治学院)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);safety(abstract);jailbreak(abstract)

AI总结 YaPO通过学习稀疏激活引导向量实现LLM的高效、稳定和细粒度对齐,适用于领域适应和文化对齐等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03300 2026-01-08 cs.CR cs.LG 81%

TRYLOCK: Defense-in-Depth Against LLM Jailbreaks via Layered Preference and Representation Engineering

TRYLOCK:通过分层偏好和表征工程实现对LLM劫持的纵深防御

Scott Thornton

机构 * AI/ML Security Researcher(人工智能与机器学习安全研究员)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);safety(abstract);jailbreak(abstract)

AI总结 TRYLOCK通过分层偏好和表征工程实现对LLM劫持的纵深防御,结合DPO、RepE、自适应侧车和输入规范化,有效降低攻击成功率并提升安全性与易用性的平衡。

Comments 14 pages, 4 figures. Code and datasets at https://github.com/scthornton/trylock

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08123 2025-12-05 cs.CL 81%

QA-LIGN: Aligning LLMs through Constitutionally Decomposed QA

QA-LIGN:通过宪法分解的问答对对齐大语言模型

Jacob Dineen, Aswin RRV, Qin Liu, Zhikun Xu, Xiao Ye, Ming Shen, Zhaonan Li, Shijie Lu, Chitta Baral, Muhao Chen, Ben Zhou

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);safety(abstract);harmlessness(abstract)

AI总结 QA-LIGN通过分解奖励信号提升LLM对齐效果,降低攻击成功率并保持低拒绝率,实现安全与帮助性的帕累托最优。

Comments Findings of the Association for Computational Linguistics: EMNLP 2025, pages 20619-20642, Suzhou, China

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, pages 20619-20642, Suzhou, China, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21819 2025-03-31 cs.CL 81%

Optimizing Safe and Aligned Language Generation: A Multi-Objective GRPO Approach

Xuying Li, Zhuo Li, Yuji Kosuga, Victor Bian

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15997 2024-07-04 cs.CL 81%

Aligning Large Language Models with Human Preferences through Representation Engineering

Wenhao Liu, Xiaohua Wang, Muling Wu, Tianlong Li, Changze Lv, Zixuan Ling, Jianhao Zhu, Cenyuan Zhang, Xiaoqing Zheng, Xuanjing Huang

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);safety(abstract);harmlessness(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13787 2024-06-11 cs.LG 81%

RewardBench: Evaluating Reward Models for Language Modeling

Nathan Lambert, Valentina Pyatkin, Jacob Morrison, LJ Miranda, Bill Yuchen Lin, Khyathi Chandu, Nouha Dziri, Sachin Kumar, Tom Zick, Yejin Choi, Noah A. Smith, Hannaneh Hajishirzi

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);safety(abstract)

Comments 44 pages, 19 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.07124 2023-10-10 cs.CL 81%

RAIN: Your Language Models Can Align Themselves without Finetuning

Yuhui Li, Fangyun Wei, Jinjing Zhao, Chao Zhang, Hongyang Zhang

专题命中 偏好对齐 :alignment(abstract);safety(abstract);harmlessness(abstract);AI safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19824 2026-07-23 cs.AI cs.CL 新提交 81%

Rewarding Better Thinking for LLM Preference Alignment

奖励更好的思维以实现大语言模型偏好对齐

Xubo Liu, Wenya Guo, Ruxue Yan, Xinying Qian, Ying Zhang

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型偏好对齐问题,提出思维清单奖励(TCR)方法,将偏好对转化为思维清单评估推理轨迹,引入EMA残差公式减少与结果监督重叠,实验证明该方法能提升对齐性能。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏