arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3235 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3235 篇

2510.06670 2026-04-10 cs.CL 79%

PIKA: Expert-Level Synthetic Datasets for Post-Training Alignment from Scratch

PIKA:从零开始的专家级合成数据集用于训练后对齐

Shangjian Yin, Shining Liang, Wenbiao Ding, Yuli Qian, Zhouxing Shi, Hongzhi Li, Yutao Xie

机构 * University of California, Riverside(加州大学河滨分校) Microsoft AI(微软人工智能)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 PIKA通过高效的数据集提升对齐效果,仅用3万例超越大规模数据集,在AlpacaEval 2.0等基准测试中表现优异,且提供高质量偏好优化数据,降低数据需求,促进资源受限研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07181 2026-04-09 cs.CL 79%

PACIFIC: Can LLMs Discern the Traits Influencing Your Preferences? Evaluating Personality-Driven Preference Alignment in LLMs

PACIFIC:LLM能否辨别影响您偏好的特质?评估LLM中由性格驱动的偏好对齐

Tianyu Zhao, Siqi Li, Yasser Shoukry, Salma Elmalaki

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 研究通过实验发现,基于用户性格特征的偏好对齐可显著提升个性化问答准确性,提出PACIFIC数据集及自动检索框架,用于改进LLM回答生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05965 2026-04-08 cs.AI 79%

Beyond Compromise: Pareto-Lenient Consensus for Efficient Multi-Preference LLM Alignment

超越妥协:用于高效多偏好LLM对齐的帕累托宽容共识

Renxuan Tan, Rongpeng Li, Zhifeng Zhao, Honggang Zhang

机构 * Zhejiang Lab(之江实验室) Macau University of Science and Technology(澳门科技大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出帕累托宽容共识框架,通过动态谈判过程解决多目标偏好对齐中的局部收敛问题,提升模型对全局帕累托最优前沿的探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14708 2026-04-03 econ.TH cs.AI cs.GT 79%

Human Misperception of Generative-AI Alignment: A Laboratory Experiment

人类对生成式人工智能对齐的误判:一项实验室实验

Kevin He, Ran Shorrer, Mengjia Xia

机构 * University of Pennsylvania(宾夕法尼亚大学) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 研究通过激励性实验室实验探讨人们在经济决策中对生成式人工智能对齐的感知,发现人们高估了生成式人工智能与人类选择的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27868 2026-03-31 econ.TH cs.AI cs.GT 79%

A Revealed Preference Framework for AI Alignment

为AI对齐的揭示偏好框架

Elchin Suleymanov

机构 * Department of Economics, Mitch Daniels School of Business, Purdue University(普渡大学米奇·丹尼尔斯商学院经济系)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出Luca对齐模型,通过揭示偏好技术研究AI是否实现人类偏好,证明在实验室和实地设置中可识别对齐程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13212 2026-03-17 cs.LG 79%

Towards Understanding Valuable Preference Data for Large Language Model Alignment

迈向理解大型语言模型对齐的有价值偏好数据

Zizhuo Zhang, Qizhou Wang, Shanshan Ye, Jianing Zhu, Jiangchao Yao, Bo Han, Masashi Sugiyama

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 本文研究了大型语言模型对齐中偏好数据的质量问题,提出截断影响函数(TIF)评估数据质量,并引入两种计算更简单的评分函数以提高偏好数据选择的准确性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13776 2026-03-17 cs.IR cs.AI 79%

Retrieval-Feedback-Driven Distillation and Preference Alignment for Efficient LLM-based Query Expansion

检索-反馈驱动的蒸馏与偏好对齐用于高效的基于大语言模型的查询扩展

Minghan Li, Guodong Zhou

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出一种检索反馈驱动的蒸馏与偏好对齐框架,通过从强教师模型转移检索友好的扩展行为到紧凑的学生模型,以降低推理成本并提升检索效果。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12565 2026-03-16 cs.SD cs.CL 79%

Speech-Worthy Alignment for Japanese SpeechLLMs via Direct Preference Optimization

通过直接偏好优化实现日语SpeechLLMs的Speech-Worthy对齐

Mengjie Zhao, Lianbo Liu, Yusuke Fujita, Hao Shi, Yuan Gao, Roman Koshkin, Yui Sudo

机构 * SB Intuitions

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出通过直接偏好优化方法,改进日语SpeechLLMs以生成适合语音合成的简洁、口语化文本,引入SpokenElyza基准测试,并在保持原有性能的同时显著提升语音质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25762 2026-03-06 cs.LG 79%

OPPO: Accelerating PPO-based RLHF via Pipeline Overlap

OPPO: 通过管道重叠加速基于PPO的RLHF

Kaizhuo Yan, Yingjie Yu, Yifan Yu, Haizhong Zheng, Fan Lai

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.LG

AI总结 OPPO通过管道重叠技术提升基于PPO的RLHF训练效率,加速训练过程并提高GPU利用率

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00485 2026-03-06 cs.AI 79%

Replacing Parameters with Preferences: Federated Alignment of Heterogeneous Vision-Language Models

用偏好替代参数:异构视觉-语言模型的联邦对齐

Shule Lu, Yujing Wang, Hainan Zhang, Xiaoshan Yang, Hongwei Zheng, Yongxin Tong, Changsheng Xu, Zhiming Zheng

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出MoR框架,通过用偏好替代参数实现异构视觉-语言模型的联邦对齐,提升泛化、鲁棒性和跨客户端适应性。

Comments Due to the need for substantial revisions, the authors believe that the paper should be retracted first.A revised version may be resubmitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07638 2026-03-03 cs.LG 79%

Data Selection for LLM Alignment Using Fine-Grained Preferences

利用细粒度偏好进行LLM对齐的数据选择

Jia Zhang, Yao Liu, Chen-Xi Zhang, Yi Liu, Yi-Xuan Jin, Lan-Zhe Guo, Yu-Feng Li

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Algorithm Tech, Taobao & Tmall Group of Alibaba(阿里巴巴集团算法技术部) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出了一种基于细粒度偏好的数据选择方法,通过优化偏好分歧来提升LLM对齐效果,实验表明在少量数据下也能实现显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22718 2026-02-27 cs.AI cs.DC 79%

RLHFless: Serverless Computing for Efficient RLHF

RLHFless:用于高效RLHF的无服务器计算

Rui Wei, Hanfei Yu, Shubham Jain, Yogarajan Sivakumar, Devesh Tiwari, Jian Li, Seung-Jong Park, Hao Wang

机构 * Stevens Institute of Technology Northeastern University Stony Brook University Missouri University of Science \& Technology

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.AI

AI总结 RLHFless通过无服务器计算环境实现高效同步RLHF训练,预计算共享前缀并采用成本感知的演员扩展策略,提升训练速度并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20457 2026-02-25 cs.LG stat.ML 79%

Oracle-Robust Online Alignment for Large Language Models

面向大语言模型的Oracle鲁棒在线对齐

Zimeng Li, Mudit Gaur, Vaneet Aggarwal

机构 * Purdue University(普渡大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出了一种Oracle鲁棒的在线对齐方法,通过引入不确定性集和敏感性惩罚,实现了对大语言模型在不准确偏好反馈下的鲁棒优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09650 2026-02-23 cs.LG 79%

Cultivating Pluralism In Algorithmic Monoculture: The Community Alignment Dataset

在算法单一性中培育多元主义:社区对齐数据集

Lily Hong Zhang, Smitha Milli, Karen Jusko, Jonathan Smith, Brandon Amos, Wassim Bouaziz, Manon Revel, Jack Kussman, Yasha Sheynin, Lisa Titus, Bhaktipriya Radharapu, Jane Yu, Vidya Sarma, Kris Rose, Maximilian Nickel

机构 * FAIR at Meta(Meta 的 FAIR 部门) Governance at Meta(Meta 的治理部门) AI at Meta(Meta 的人工智能部门) Social Issues Research at Meta(Meta 的社会问题研究部门) AI Policy Team at Meta(Meta 的人工智能政策团队) Center for Data Science, New York University(纽约大学数据科学中心)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 本文通过构建社区对齐数据集,探讨如何通过负相关采样提升LLM对不同偏好的适应能力,推动算法多元主义发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13891 2026-02-17 cs.SD cs.AI 79%

GSRM: Generative Speech Reward Model for Speech RLHF

GSRM:生成式语音奖励模型用于语音强化学习反馈机制

Maohao Shen, Tejas Jayashankar, Osama Hanna, Naoyuki Kanda, Yancheng Wang, Kateřina Žmolíková, Ruiming Xie, Niko Moritz, Anfeng Xu, Yashesh Gaur, Gregory Wornell, Qing He, Jilong Wu

机构 * Meta Superintelligence Labs(Meta超智能实验室) Massachusetts Institute of Technology(麻省理工学院) Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学)

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.AI

AI总结 GSRM通过生成式语音奖励模型提升语音生成的自然度,利用可解释的推理链实现更准确的自然度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12180 2026-02-13 cs.LG cs.GT 79%

How Sampling Shapes LLM Alignment: From One-Shot Optima to Iterative Dynamics

采样如何塑造大语言模型对齐:从单次最优到迭代动态

Yurong Chen, Yu He, Michael I. Jordan, Fan Yao

机构 * Inria(法国国家信息与自动化研究所) École Normale Supérieure(巴黎高等师范学校) PSL Research University(巴黎综合理工研究所) Northwestern University(西北大学) University of California, Berkeley(加州大学伯克利分校) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 研究探讨了采样对大语言模型对齐的影响,发现适当采样可提升排序保证,而偏向采样可能导致集中问题,并分析了迭代动态中的稳定性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09653 2026-02-12 cs.AI 79%

ClinAlign: Scaling Healthcare Alignment from Clinician Preference

ClinAlign: 从医生偏好扩展医疗对齐

Shiwei Lyu, Xidong Wang, Lei Liu, Hao Zhu, Chaohe Zhang, Jian Wang, Jinjie Gu, Benyou Wang, Yue Shen

机构 * Ant Group(蚂蚁集团) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 ClinAlign通过HealthRubrics和HealthPrinciples实现医疗输出与医生偏好的高效对齐,验证了资源高效的临床对齐方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09538 2026-02-11 cs.CL 79%

UniARM: Towards a Unified Autoregressive Reward Model for Multi-Objective Test-Time Alignment

UniARM: 向多目标测试时间对齐的统一自回归奖励模型迈进

Hongyan Xie, Yikun Ban, Ruiyu Fang, Zixuan Huang, Deqing Wang, Jianxin Li, Yitong Yao, Chao Wang, Shuangyong Song

机构 * School of Computer, Beihang University(北京航空航天大学计算机学院) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 UniARM通过统一自回归奖励模型实现多目标测试时间对齐,通过共享特征和偏好调节模块减少特征纠缠,提升对偏好权衡的控制能力。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07743 2026-02-04 cs.CL 79%

OpenRubrics: Towards Scalable Synthetic Rubric Generation for Reward Modeling and LLM Alignment

OpenRubrics: 向奖励建模和大语言模型对齐的可扩展合成 rubric 生成迈进

Tianci Liu, Ran Xu, Tony Yu, Ilgee Hong, Carl Yang, Tuo Zhao, Haoyu Wang

机构 * Purdue University(普渡大学) Emory University(埃默里大学) Georgia Institute of Technology(佐治亚理工学院) University at Albany(阿尔巴尼大学)

专题命中 偏好对齐 :alignment(title);RLHF(abstract);分类 cs.CL

AI总结 OpenRubrics 提出了一种基于对比的 rubric 生成方法,通过大规模(提示,rubric)对提升奖励建模和大语言模型对齐的性能。

Comments The first two authors contributed equally. Updated OpenRubrics dataset, RMs, and results

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01002 2026-02-03 cs.AI 79%

How RLHF Amplifies Sycophancy

如何通过RLHF放大阿谀行为

Itai Shapira, Gerdus Benade, Ariel D. Procaccia

机构 * harvard(哈佛大学)

专题命中 偏好对齐 :RLHF(title);alignment(abstract);分类 cs.AI

AI总结 本文研究了RLHF如何通过放大机制增强阿谀行为,提出了一种训练干预措施以减少这种偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04832 2026-02-03 cs.LG 79%

Discrete Diffusion Trajectory Alignment via Stepwise Decomposition

通过分步分解实现离散扩散轨迹对齐

Jiaqi Han, Austin Wang, Minkai Xu, Wenda Chu, Meihua Dang, Haotian Ye, Huayu Chen, Yisong Yue, Stefano Ermon

机构 * Stanford University(斯坦福大学) Caltech(加州理工学院) Tsinghua University(清华大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 本研究提出一种离线偏好优化方法,通过分步分解实现离散扩散模型的轨迹对齐,提升DNA序列设计和语言建模的性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17671 2026-01-27 cs.CL 79%

Align to the Pivot: Dual Alignment with Self-Feedback for Multilingual Math Reasoning

对齐基准:双语自反馈的多语言数学推理

Chunxu Zhao, Xin Huang, Xue Han, Shujian Huang, Chao Deng, Junlan Feng

机构 * JIUTIAN Research, China Mobile, Beijing, China(JIUTIAN研究, 中国移动, 北京) National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室, 南京大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 PASMR通过基准语言自反馈机制提升多语言数学推理能力,解决LLMs在多语言环境下的性能下降问题。

Comments This paper has been accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16403 2026-01-26 cs.LG 79%

Towards a Theoretical Understanding to the Generalization of RLHF

迈向RLHF泛化性的理论理解

Zhaochun Li, Mingyang Yi, Yue Wang, Shisheng Cui, Yong Liu

机构 * Beijing Institute of Technology(北京理工大学) Zhongguancun Academy(中关村学院) Renmin University of China(中国人民大学)

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.LG

AI总结 本文通过算法稳定性框架,在线性奖励模型下构建了RLHF下LLM的泛化理论,证明在特征覆盖条件下策略模型的泛化界为O(n^{-1/2}),并推广到梯度方法参数。

Comments 31 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18099 2026-01-22 cs.LG 79%

Stackelberg Self-Annotation: A Robust Approach to Data-Efficient LLM Alignment

Stackelberg 自注释:一种鲁棒的数据高效 LLM 对齐方法

Xu Chu, Zhixin Zhang, Tianyu Jia, Yujie Jin

机构 * Key Laboratory of High Confidence Software Technologies, Ministry of Education(高可信软件技术重点实验室,教育部) Center on Frontiers of Computing Studies, Peking University(计算前沿研究中心,北京大学) School of Computer Science, Peking University(计算机学院,北京大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出Stackelberg自标注方法,通过少量人工标注和迭代自我标注,实现高效LLM对齐,减少对昂贵人工标注的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04346 2026-01-13 cs.CL 79%

Adding Alignment Control to Language Models

向语言模型添加对齐控制

Wenhong Zhu, Weinan Zhang, Rui Wang

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出CLM模型,通过添加身份层实现语言模型的对齐控制,通过插值系数实现对齐的插值和外推,提升模型的可用性。

Comments I have changed the title of the paper and resubmitted a new one on arXiv titled "Flexible realignment of language models" (arXiv:2506.12704)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00623 2026-01-05 cs.AI 79%

DA-DPO: Cost-efficient Difficulty-aware Preference Optimization for Reducing MLLM Hallucinations

DA-DPO:面向减少多模态大语言模型幻觉的高效难度感知偏好优化

Longtian Qiu, Shan Ning, Chuyu Zhang, Jiaxuan Sun, Xuming He

机构 * ShanghaiTech University(上海科技大学) Lingang Laboratory(灵冈实验室) Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程技术研究中心)

专题命中 偏好对齐 :DPO(title,abstract);分类 cs.AI

AI总结 DA-DPO通过难度感知机制优化多模态大语言模型的偏好学习,有效减少幻觉并提升模型鲁棒性与泛化能力。

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04752 2025-12-15 cs.LG 79%

RLHFSpec: Breaking the Efficiency Bottleneck in RLHF Training via Adaptive Drafting

RLHFSpec: 通过自适应草稿打破RLHF训练的效率瓶颈

Siqi Wang, Hailong Yang, Junjie Zhu, Xuezhu Wang, Yufan Xu, Depei Qian

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.LG

AI总结 RLHFSpec通过自适应草稿策略和高效样本再分配,提升RLHF训练效率,缓解生成瓶颈,提高整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18541 2025-12-05 cs.AI 79%

Align$^2$LLaVA: Cascaded Human and Large Language Model Preference Alignment for Multi-modal Instruction Curation

Align$^2$LLaVA: 多模态指令编纂的级联人类与大语言模型偏好对齐

Hongzhe Huang, Jiang Liu, Zhewen Yu, Li Cai, Dian Jiao, Wenqiao Zhang, Siliang Tang, Juncheng Li, Hao Jiang, Haoyuan Li, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Alibaba(阿里巴巴)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 Align$^2$LLaVA通过级联人类与LLM偏好对齐方法,有效压缩多模态指令数据,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03399 2025-12-04 cs.LG 79%

Full-Stack Alignment: Co-Aligning AI and Institutions with Thick Models of Value

全栈对齐:通过厚价值模型对齐人工智能与机构

Joe Edelman, Tan Zhi-Xuan, Ryan Lowe, Oliver Klingefjord, Vincent Wang-Mascianica, Matija Franklin, Ryan Othniel Kearns, Ellie Hain, Atrisha Sarkar, Michiel Bakker, Fazl Barez, David Duvenaud, Jakob Foerster, Iason Gabriel, Joseph Gubbels, Bryce Goodman, Andreas Haupt, Jobst Heitzig, Julian Jara-Ettinger, Atoosa Kasirzadeh, James Ravi Kirkpatrick, Andrew Koh, W. Bradley Knox, Philipp Koralus, Joel Lehman, Sydney Levine, Samuele Marro, Manon Revel, Toby Shorin, Morgan Sutherland, Michael Henry Tessler, Ivan Vendrov, James Wilken-Smith

机构 * Meaning Alignment Institute(意义对齐研究所) Massachusetts Institute of Technology(麻省理工学院) University College London(伦敦大学学院) University of Oxford(牛津大学) Western University(西方大学) University of Toronto(多伦多大学) McGill University(麦吉尔大学) Stanford University(斯坦福大学) Potsdam Institute for Climate Impact Research(波茨坦气候影响研究所) Yale University(耶鲁大学) Carnegie Mellon University(卡内基梅隆大学) UT Austin(德克萨斯大学奥斯汀分校) New York University(纽约大学) Harvard University(哈佛大学) Midjourney Core contributor(Midjourney核心贡献者)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出通过厚价值模型实现全栈对齐,以解决AI与机构目标不一致导致的不良后果,涵盖价值表示、规范推理和集体利益建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02807 2025-12-03 cs.CL 79%

SR-GRPO: Stable Rank as an Intrinsic Geometric Reward for Large Language Model Alignment

SR-GRPO:稳定秩作为大语言模型对齐的内在几何奖励

Yixuan Tang, Yi Yang

机构 * The Hong Kong University of Science and Technology(香港理工大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 SR-GRPO通过稳定秩作为内在几何奖励信号,无需外部监督提升大语言模型对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏