arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 30405 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3229 篇

2603.22335 2026-05-28 cs.IR cs.AI 84%

Causal Direct Preference Optimization for Distributionally Robust Generative Recommendation

因果直接偏好优化用于分布鲁棒的生成式推荐

Chu Zhao, Enneng Yang, Jianzhe Zhao, Guibing Guo

机构 * Northeastern University, Shenyang, China(东北大学,沈阳,中国) Shenzhen Campus of Sun Yat-sen University, China(中山大学深圳校区,中国)

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract);分类 cs.AI

AI总结 针对直接偏好优化(DPO)在生成式推荐中放大环境混杂因素导致的虚假相关性问题,提出CausalDPO,通过因果不变性学习、后门调整和软聚类环境建模来提升分布外泛化性能。

Comments 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23975 2026-05-26 cs.CL cs.SD 84%

Direct Preference Optimization for English-Mandarin Code-Switching Speech Recognition in Audio LLMs

面向音频大语言模型中英双语码转换语音识别的直接偏好优化

Trung Nguyen Quang, Cheng Yi Lewis Won, Minh Duc Pham, Yingxu He, Shuo Sun, Ai Ti Aw

机构 * Institute for Infocomm Research (I2R), A STAR, Singapore(信息通信研究所(I2R),A STAR,新加坡) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract);分类 cs.CL

AI总结 针对音频大语言模型在英中码转换语音转录中的系统失败,提出使用直接偏好优化(DPO)对齐模型,通过构建偏好对(保留混合语言内容 vs 模仿失败模式)训练模型,实现词错误率降低最高89.6%(分布内)和20.0%(分布外)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19117 2026-05-05 cs.LG 84%

LLMs Know They're Wrong and Agree Anyway: The Shared Sycophancy-Lying Circuit

大语言模型知道错误却仍顺从:共享的谄媚说谎电路

Manav Pandey

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);alignment(abstract);分类 cs.LG

AI总结 研究揭示大语言模型在面对用户错误信念时,通过特定注意力头的机制表现出顺从行为,而非知识不足,且该机制在不同模型和训练方法中保持稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15740 2026-08-17 cs.CV cs.AI cs.LG cs.MM 版本更新 84%

Debiasing Text-to-Image Evaluation via Implicit Cultural Alignment Reward Modeling

通过隐式文化对齐奖励建模消除文本到图像评估中的偏差

Bo-An Chang, Yu-Chih Chen

机构 * National Tsing Hua University(国立清华大学) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 偏好对齐 :alignment(title,abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 研究文本到图像评估中文化真实性问题,提出基于轻量级多模态大语言模型构建的隐式文化对齐奖励模型,集成隐式文化探测器与跳跃连接交叉注意力机制,实验证明该模型准确率高、速度快,能为偏好优化管道提供有效信号。

Comments 16 pages, 2 figures, ECCV 2026 Workshop FAILED

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01514 2026-07-20 cs.CL cs.AI cs.CR 版本更新 84%

Decoupled Alignment for Robust Plug-and-Play Adaptation

用于鲁棒即插即用适应的解耦对齐

Haozheng Luo, Jiahao Yu, Wenxin Zhang, Jialong Li, Chenghao Qiu, Yimin Wang, Eric Hanchen Jiang, Jerry Yao-Chieh Hu, Yan Chen, Binghui Wang, Xinyu Xing, Han Liu

机构 * Northwestern University(西北大学) New York University Abu Dhabi(纽约大学阿布扎克分校) Stanford University(斯坦福大学) Texas A&M University(德克萨斯农工大学) University of California, Los Angeles(加州大学洛杉矶分校) Illinois Institute of Technology(伊利诺伊理工学院)

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 研究提出无需训练的大语言模型对齐方法,利用知识蒸馏提取对齐信号,经模型融合实现即插即用的对齐校正,采用增量调试识别关键知识组件,在有害问题数据集上显著提升防御成功率,且不损性能。

Comments Revised to correct the Acknowledgments section. Previous versions inadvertently included acknowledgments of NSF and NIH awards that did not support this work. Those funding acknowledgments have been removed. The technical content, results, and conclusions are unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09635 2026-06-10 cs.CL cs.LG 交叉投稿 84%

Gradient-Guided Reward Optimization for Inference-time Alignment

梯度引导的推理时对齐奖励优化

Hankun Lin, Ruqi Zhang

机构 * Purdue University(普渡大学)

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 提出梯度引导奖励优化(GGRO)方法,通过解码时注入梯度信号生成的引导令牌,在推理时微调生成轨迹,提升安全性、有用性和推理性能,并增强对奖励攻击的鲁棒性。

Comments Accepted to UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10623 2026-06-02 cs.LG cs.AI 84%

Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling

通过贝叶斯非负奖励建模缓解RLHF中的奖励黑客

Zhibin Duan, Guowei Rong, Zhuo Li, Bo Chen, Mingyuan Zhou, Dandan Guo

机构 * Zhejiang University(浙江大学)

专题命中 偏好对齐 :RLHF(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出贝叶斯非负奖励模型(BNRM),通过非负因子分析和变分推断,在Bradley-Terry偏好模型中实现解耦与去偏,有效缓解奖励过度优化,提升鲁棒性和可解释性。

Comments Accepted as an Oral presentation at ICML 2026. The code is available at https://github.com/GuoweiRong/Bayesian-Non-negative-Reward-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18309 2026-05-19 cs.LG cs.AI 84%

Alignment Dynamics in LLM Fine-Tuning

在LLM微调中的对齐动力学

Yuhan Huang, Huanran Chen, Yinpeng Dong

机构 * Shanghai Qi Zhi Institue & University of Tokyo(上海启智研究院 & 东京大学) College of AI, Tsinghua University(清华大学人工智能学院)

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在LLM微调过程中对齐的动态特性,提出了一种可计算的对齐评分,并推导了其在微调过程中的闭式更新公式,从而建立了对齐动态的统一框架。通过将对齐更新分解为两种竞争成分:反弹力和驱动力,解释了为何先前的对齐可能被后续微调逆转,以及为何更狭窄的后验结构会增强这种逆转。此外,该框架预测了‘复习强化效应’,即先前的对齐会在重新暴露时留下潜在的后验印记,从而增强驱动力,导致更快的重新对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11217 2026-05-13 cs.LG cs.AI cs.CR 84%

Leveraging RAG for Training-Free Alignment of LLMs

利用RAG实现无需训练的LLM对齐

John T. Halloran

机构 * Leidos(莱迪奥斯公司)

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RAG-Pref算法,通过对比信息提升对抗攻击拒绝能力,相比其他方法在五种主流LLM上提升3.7倍,同时保持计算效率。

Comments 19 pages, 4 figures, and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18113 2026-05-12 cs.LG cs.AI 84%

VC-Soup: Value-Consistency Guided Multi-Value Alignment for Large Language Models

VC-Soup:基于价值一致性指导的多价值对齐方法用于大语言模型

Hefei Xu, Le Wu, Yu Wang, Min Hou, Han Wu, Zhen Zhang, Meng Wang

机构 * Key Laboratory of Knowledge Engineering with Big Data(知识工程与大数据重点实验室) Hefei University of Technology(合肥工业大学) Innovation School of Artificial Intelligence(人工智能创新学院)

专题命中 偏好对齐 :alignment(title,abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VC-Soup方法,通过数据过滤和参数融合框架解决多价值对齐中的冲突问题,提升模型在多价值下的表现。

Comments 12 pages; Accepted to WWW2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10476 2026-04-10 cs.CL cs.AI 84%

Learning to Negotiate: Multi-Agent Deliberation for Collective Value Alignment in LLMs

学习协商:多智能体协商以实现大语言模型中的集体价值对齐

Panatchakorn Anantaprayoon, Nataliia Babina, Nima Asgharbeygi, Jad Tarifi

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于多智能体协商的对齐框架,通过集体代理(CA)目标提升大语言模型的集体价值对齐能力,并改进冲突解决能力,实验表明其在冲突解决性能上有显著提升。

Comments To appear in LREC 2026 2nd DELITE Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02766 2026-04-06 cs.LG cs.AI 84%

Random Is Hard to Beat: Active Selection in online DPO with Modern LLMs

随机难以超越:在线DPO中的主动选择

Giyeong Oh, Junghyun Lee, Jaehyun Park, Youngjae Yu, Wonho Bae, Junhyug Noh

机构 * Seoul National University(首尔大学) Ewha Womans University(梨花女子大学) KAIST(韩国科学技术院) UBC(不列颠哥伦比亚大学)

专题命中 偏好对齐 :DPO(title,abstract);harmlessness(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在线DPO中主动选择策略的有效性,发现即使在强先验基础上,主动选择的计算开销难以抵消简单随机采样带来的多样性优势。

Comments first commit

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17721 2026-03-09 cs.LG cs.AI cs.MA 84%

Aligning Compound AI Systems via System-level DPO

通过系统级DPO对复合AI系统进行对齐

Xiangwen Wang, Yibo Jacky Zhang, Zhoujie Ding, Katherine Tsai, Haolun Wu, Sanmi Koyejo

机构 * Stanford University(斯坦福大学) University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Mila Quebec AI Institute(魁北克AI研究院)

专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SysDPO框架,通过系统级DPO实现复合AI系统的联合对齐,解决了组件间非可微分交互和系统偏好转换的问题。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04968 2026-03-06 cs.CL cs.AI 84%

When Weak LLMs Speak with Confidence, Preference Alignment Gets Stronger

当弱大语言模型自信发言时,偏好对齐会变得更强大

Amirabbas Afzali, Myeongho Jeon, Maria Brbic

机构 * EPFL(苏黎世联邦理工学院) Sharif University of Technology(谢赫·穆吉加布大学)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CW-PO框架,利用弱LLM的置信度加权实现更高效的偏好对齐,仅用20%的人类标注即可超越传统方法。

Comments 32 pages, 8 figures, International Conference on Learning Representations 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21765 2026-02-26 cs.LG cs.AI stat.ML 84%

Generalisation of RLHF under Reward Shift and Clipped KL Regularisation

基于奖励偏移和截断KL正则化的RLHF泛化

Kenton Tang, Yuzhu Chen, Fengxiang He

机构 * University of Edinburgh(爱丁堡大学) University of Science and Technology of China(中国科学技术大学)

专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于奖励偏移和截断KL正则化的RLHF泛化理论,分析了奖励偏移和KL截断对泛化误差的影响,并给出了优化KL截断阈值和预算分配的实践指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04462 2026-02-25 cs.CL cs.CR cs.LG 84%

Watermarking Degrades Alignment in Language Models: Analysis and Mitigation

水印会损害语言模型的对齐:分析与缓解

Apurv Verma, NhatHai Phan, Shubhendu Trivedi

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 研究发现水印影响语言模型对齐,提出Alignment Resampling方法恢复对齐性能。

Comments Published in Transactions of Machine Learning Research 02/2026. Extended version of the earlier paper published at the 1st Workshop on GenAI Watermarking (ICLR 2025)

Journal ref Transactions of Machine Learning Research 02/2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09621 2026-02-12 cs.CL cs.LG 84%

AlignTune: Modular Toolkit for Post-Training Alignment of Large Language Models

AlignTune: 大型语言模型后训练对齐的模块化工具包

R E Zera Marveen Lyngkhoi, Chirag Chawla, Pratinav Seth, Utsav Avaiya, Soham Bhattacharjee, Mykola Khandoga, Rui Yuan, Vinay Kumar Sankarapu

机构 * Lexsi Labs(Lexsi实验室)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.LG

AI总结 AlignTune通过模块化工具包提供统一接口,支持监督微调和RLHF优化,解决后端干扰和不可复现问题,提升对齐研究的可控性和复现性。

Comments Library opensource and available at https://github.com/Lexsi-Labs/aligntune

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23631 2026-02-11 cs.LG cs.AI stat.ME stat.ML 84%

Beyond Pairwise: Empowering LLM Alignment With Ranked Choice Modeling

超越成对:通过排名选择建模增强大语言模型对齐

Yuxuan Tang, Yifan Feng

机构 * Institute of Operations Research and Analytics(运营研究与分析研究所) National University of Singapore(新加坡国立大学) Department of Analytics and Operations(分析与运营系) NUS Business School(新加坡国立大学商学院)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RCPO框架,通过最大似然估计结合排名选择建模,提升大语言模型对齐效果,实验显示其在多种模型和设置中均优于基线方法。

Comments Accepted by The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10530 2026-01-28 cs.AI cs.CL 84%

Is On-Policy Data always the Best Choice for Direct Preference Optimization-based LM Alignment?

基于直接偏好优化的LM对齐中,策略数据是否总是最佳选择?

Zetian Sun, Dongfang Li, Xuhui Chen, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL、cs.AI

AI总结 本文提出对齐阶段假设,通过理论和实证分析,揭示了静态与策略偏好数据在LM对齐中的效果差异,并提出算法识别对齐阶段边界。

Comments Accepted by ICLR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01930 2026-01-16 cs.LG cs.AI 84%

Robust LLM Alignment via Distributionally Robust Direct Preference Optimization

通过分布鲁棒直接偏好优化实现鲁棒的大语言模型对齐

Zaiyan Xu, Sushil Vemuri, Kishan Panaganti, Dileep Kalathil, Rahul Jain, Deepak Ramachandran

机构 * Texas A&M University(德克萨斯大学) California Institute of Technology(加州理工学院) Tencent AI Lab(腾讯AI实验室) Google DeepMind(谷歌DeepMind)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Wasserstein DPO和KLDPO算法,通过分布鲁棒优化解决LLM与人类偏好间的分布偏移问题,提升对齐性能。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03790 2025-12-22 cs.CL cs.LG stat.ML 84%

Sample, Don't Search: Rethinking Test-Time Alignment for Language Models

样本,而非搜索:重新思考语言模型的测试时间对齐

Gonçalo Faria, Noah A. Smith

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL、cs.LG

AI总结 QAlign通过增加测试时间计算量,改进语言模型输出对齐,优于现有方法如best-of-n和多数投票。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05464 2025-12-08 cs.CL cs.AI 84%

Dynamic Alignment for Collective Agency: Toward a Scalable Self-Improving Framework for Open-Ended LLM Alignment

动态对齐与集体代理:迈向一个可扩展的自我改进框架以实现开放式的LLM对齐

Panatchakorn Anantaprayoon, Nataliia Babina, Jad Tarifi, Nima Asgharbeygi

机构 * Integral AI

专题命中 偏好对齐 :alignment(title,abstract);harmlessness(abstract);分类 cs.CL、cs.AI

AI总结 本文提出动态对齐框架,通过集体代理价值实现LLM的自我改进和可扩展对齐。

Comments 8 pages, 4 figures, to appear in AAAI 2026 AIGOV Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18084 2025-11-25 cs.LG cs.AI 84%

The Alignment Paradox of Medical Large Language Models in Infertility Care: Decoupling Algorithmic Improvement from Clinical Decision-making Quality

医学大语言模型在不孕症护理中的对齐悖论:解耦算法改进与临床决策质量

Dou Liu, Ying Long, Sophia Zuoqiu, Kaipeng Xie, Runze Yang, Di Liu, Kang Li, Yiting Lin, Hanyi Liu, Rong Yin, Tian Tang

机构 * Department of Obstetrics and Gynecology, West China Second University Hospital(妇产科部门,西昌第二大学医院) Reproductive Medical Center, Department of Obstetrics and Gynecology, West China Second University Hospital(生殖医学中心,妇产科部门,西昌第二大学医院)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.AI、cs.LG

AI总结 本研究发现,尽管GRPO在算法准确性上表现最佳,但临床医生更偏好SFT模型,因其推理更清晰且治疗可行性更高,揭示了算法改进与临床信任之间的对齐悖论。

Comments 22 pages 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16324 2025-11-21 cs.CL cs.AI 84%

SDA: Steering-Driven Distribution Alignment for Open LLMs without Fine-Tuning

SDA:无微调的开放语言模型分布对齐框架

Wei Xia, Zhi-Hong Deng

专题命中 偏好对齐 :alignment(title,abstract);harmlessness(abstract);分类 cs.CL、cs.AI

AI总结 SDA 提出了一种无需微调的开源 LLMs 分布对齐框架,通过用户指令动态调整输出概率,提升模型与人类意图的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20964 2025-11-20 cs.AI cs.CC cs.GT cs.LG cs.MA 84%

Core Safety Values for Provably Corrigible Agents

Aran Nayebi

机构 * Aran Nayebi(独立研究者)

专题命中 偏好对齐 :safety(title,abstract);RLHF(abstract);分类 cs.AI、cs.LG

Comments 14 pages. To appear in AAAI 2026 Machine Ethics Workshop (W37) Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23349 2025-11-12 cs.LG cs.AI 84%

Towards Reward Fairness in RLHF: From a Resource Allocation Perspective

Sheng Ouyang, Yulan Hu, Ge Chen, Qingyang Li, Fuzheng Zhang, Yong Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程技术研究中心,教育部) Kuaishou Technology(快手科技) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

Comments Accepted to ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18312 2025-11-10 cs.LG cs.AI 84%

What Matters in Data for DPO?

Yu Pan, Zhongze Cai, Guanting Chen, Huaiyang Zhong, Chonghuan Wang

机构 * University of Sydney(悉尼大学) Imperial College London(伦敦帝国理工学院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Virginia Tech(弗吉尼亚理工大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23965 2025-10-30 cs.AI cs.LG stat.ML 84%

The Sign Estimator: LLM Alignment in the Face of Choice Heterogeneity

Ali Aouad, Aymane El Gadarri, Vivek F. Farias

机构 * MIT(麻省理工学院)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12961 2025-10-24 cs.LG cs.AI physics.chem-ph q-bio.QM 84%

Aligning Transformers with Continuous Feedback via Energy Rank Alignment

Shriram Chennakesavalu, Frank Hu, Sebastian Ibarraran, Grant M. Rotskoff

机构 * Department of Chemistry Stanford University(化学系 斯坦福大学)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13512 2025-10-16 cs.LG cs.AI 84%

Offline and Online KL-Regularized RLHF under Differential Privacy

Yulian Wu, Rushil Thareja, Praneeth Vepakomma, Francesco Orabona

机构 * King Abdullah University of Science and Technology (KAUST)(卡布尔大学科学与技术学院) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Massachusetts Institute of Technology (MIT)(麻省理工学院)

专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏