arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3229 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3229 篇

2511.06222 2025-11-11 cs.CL cs.CY 88%

SPA: Achieving Consensus in LLM Alignment via Self-Priority Optimization

Yue Huang, Xiangqi Wang, Xiangliang Zhang

机构 * University of Notre Dame(诺特大学)

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);harmlessness(abstract);trustworthy(abstract)

Comments Accepted by AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18576 2025-08-08 cs.AI cs.CL cs.CV 88%

SafeWork-R1: Coevolving Safety and Intelligence under the AI-45$^{\circ}$ Law

Shanghai AI Lab, :, Yicheng Bao, Guanxu Chen, Mingkang Chen, Yunhao Chen, Chiyu Chen, Lingjie Chen, Sirui Chen, Xinquan Chen, Jie Cheng, Yu Cheng, Dengke Deng, Yizhuo Ding, Dan Ding, Xiaoshan Ding, Yi Ding, Zhichen Dong, Lingxiao Du, Yuyu Fan, Xinshun Feng, Yanwei Fu, Yuxuan Gao, Ruijun Ge, Tianle Gu, Lujun Gui, Jiaxuan Guo, Qianxi He, Yuenan Hou, Xuhao Hu, Hong Huang, Kaichen Huang, Shiyang Huang, Yuxian Jiang, Shanzhe Lei, Jie Li, Lijun Li, Hao Li, Juncheng Li, Xiangtian Li, Yafu Li, Lingyu Li, Xueyan Li, Haotian Liang, Dongrui Liu, Qihua Liu, Zhixuan Liu, Bangwei Liu, Huacan Liu, Yuexiao Liu, Zongkai Liu, Chaochao Lu, Yudong Lu, Xiaoya Lu, Zhenghao Lu, Qitan Lv, Caoyuan Ma, Jiachen Ma, Xiaoya Ma, Zhongtian Ma, Lingyu Meng, Ziqi Miao, Yazhe Niu, Yuezhang Peng, Yuan Pu, Han Qi, Chen Qian, Xingge Qiao, Jingjing Qu, Jiashu Qu, Wanying Qu, Wenwen Qu, Xiaoye Qu, Qihan Ren, Qingnan Ren, Qingyu Ren, Jing Shao, Wenqi Shao, Shuai Shao, Dongxing Shi, Xin Song, Xinhao Song, Yan Teng, Xuan Tong, Yingchun Wang, Xuhong Wang, Shujie Wang, Xin Wang, Yige Wang, Yixu Wang, Yuanfu Wang, Futing Wang, Ruofan Wang, Wenjie Wang, Yajie Wang, Muhao Wei, Xiaoyu Wen, Fenghua Weng, Yuqi Wu, Yingtong Xiong, Xingcheng Xu, Chao Yang, Yue Yang, Yang Yao, Yulei Ye, Zhenyun Yin, Yi Yu, Bo Zhang, Qiaosheng Zhang, Jinxuan Zhang, Yexin Zhang, Yinqiang Zheng, Hefeng Zhou, Zhanhui Zhou, Pengyu Zhu, Qingzi Zhu, Yubo Zhu, Bowen Zhou

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 偏好对齐 :safety(title,abstract);alignment(abstract);RLHF(abstract);trustworthy(abstract)

Comments 47 pages, 18 figures, authors are listed in alphabetical order by their last names; v3 modifies minor issues

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03708 2024-08-20 cs.LG cs.AI 88%

Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization

Zhanhui Zhou, Jie Liu, Jing Shao, Xiangyu Yue, Chao Yang, Wanli Ouyang, Yu Qiao

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);safety(abstract)

Comments Findings of ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02475 2024-03-06 cs.LG cs.CL 88%

Enhancing LLM Safety via Constrained Direct Preference Optimization

Zixuan Liu, Xiaolin Sun, Zizhan Zheng

专题命中 偏好对齐 :safety(title,abstract);RLHF(abstract);DPO(abstract);harmlessness(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02554 2024-02-27 cs.LG cs.CL 88%

ULMA: Unified Language Model Alignment with Human Demonstration and Point-wise Preference

Tianchi Cai, Xierui Song, Jiyan Jiang, Fei Teng, Jinjie Gu, Guannan Zhang

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);harmlessness(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12773 2023-10-20 cs.AI cs.LG 88%

Safe RLHF: Safe Reinforcement Learning from Human Feedback

Josef Dai, Xuehai Pan, Ruiyang Sun, Jiaming Ji, Xinbo Xu, Mickel Liu, Yizhou Wang, Yaodong Yang

专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);safety(abstract);harmlessness(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00307 2024-08-02 cs.LG cs.AI cs.CL 88%

ABC Align: Large Language Model Alignment for Safety & Accuracy

Gareth Seneque, Lap-Hang Ho, Ariel Kuperman, Nafise Erfanian Saeedi, Jeffrey Molendijk

专题命中 偏好对齐 :alignment(title,abstract);safety(title);分类 cs.CL、cs.AI、cs.LG

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06179 2026-08-07 cs.LG 新提交 87%

SAGA: Score-Weighted Adaptive Generation Alignment for Low-Resource Nordic Language Models

SAGA:面向低资源北欧语言模型的分数加权自适应生成对齐

Hoda Fakharzadehjahromy, Emil Wiman, Andreas Bueff, Hafsteinn Einarsson, Fredrik Heintz

机构 * Linköping University(林雪平大学) University of Iceland(冰岛大学)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);分类 cs.LG

AI总结 该研究提出SAGA框架,用依存句法分析器监督取代人类偏好标注,在丹麦语、冰岛语等低资源北欧语言上提升了GPT-SW3-1.3B的语法质量,为相关语言的语法对齐提供了实用替代方案。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21350 2026-05-19 cs.LG 87%

Factored Causal Representation Learning for Robust Reward Modeling in RLHF

因式分解因果表示学习用于RLHF中的鲁棒奖励建模

Yupei Yang, Lin Yang, Wanxi Deng, Lin Qu, Fan Feng, Biwei Huang, Shikui Tu, Lei Xu

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团) University of California San Diego(加州大学圣地亚哥分校) Mohamed bin Zayed University of Artificial Intelligence(莫莫德·本·扎耶德人工智能大学)

专题命中 偏好对齐 :RLHF(title,title_cn);分类 cs.LG

AI总结 本文提出因式分解表示学习框架,通过分离因果因素与非因果因素提升奖励模型鲁棒性,有效缓解奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22631 2025-12-30 cs.CL 87%

Evaluating GRPO and DPO for Faithful Chain-of-Thought Reasoning in LLMs

评估GRPO和DPO在LLM中的忠实链式推理能力

Hadi Mohammadi, Tamas Kozak, Anastasia Giachanou

机构 * Utrecht University, Department of Information and Computing Sciences(乌特勒支大学信息与计算科学系)

专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);safety(abstract);trustworthy(abstract)

AI总结 本文评估GRPO和DPO在提升LLM链式推理忠实性方面的性能,发现GRPO在大模型中表现更优,有助于开发更透明可信的推理方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17937 2025-11-25 cs.AI 87%

Alignment Faking - the Train -> Deploy Asymmetry: Through a Game-Theoretic Lens with Bayesian-Stackelberg Equilibria

对齐欺骗 - 训练到部署的不对称性:通过博弈论视角的贝叶斯-斯克尔伯格均衡

Kartik Garg, Shourya Mishra, Kartikeya Sinha, Ojaswi Pratap Singh, Ayush Chopra, Kanishk Rai, Ammar Sheikh, Raghav Maheshwari, Aman Chadha, Vinija Jain, Amitava Das

机构 * Pragya Lab, BITS Pilani Goa, India(BITS Pilani Goa学院) Apple, USA(苹果公司) Google, USA(谷歌公司)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);safety(abstract);harmlessness(abstract)

AI总结 通过博弈论视角研究AI对齐欺骗现象,分析不同偏好优化方法在安全、无害和有用性方面的表现,揭示其成因及发生条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01233 2025-03-04 cs.CL 87%

PEO: Improving Bi-Factorial Preference Alignment with Post-Training Policy Extrapolation

Yuxuan Liu

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);harmlessness(abstract)

Comments Technical report, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03095 2025-02-06 cs.LG 87%

Reveal the Mystery of DPO: The Connection between DPO and RL Algorithms

Xuerui Su, Yue Wang, Jinhua Zhu, Mingyang Yi, Feng Xu, Zhiming Ma, Yuting Liu

专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);RLHF(abstract);safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03048 2026-04-24 cs.AI cs.CY cs.LG cs.MA 87%

The Specification Trap: Why Static Value Alignment Alone Is Insufficient for Robust Alignment

规范陷阱:为何仅靠静态价值对齐无法实现稳健对齐

Austin Spizzirri

机构 * Belmont University(贝尔蒙特大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);分类 cs.AI、cs.CY、cs.LG

AI总结 本文指出静态内容导向的人工智能价值对齐在能力扩展、分布偏移和自主性提升时无法实现稳健对齐,探讨了哲学难题及现有方法的结构性漏洞。

Comments 31 pages, no figures. Version 5. First posted as arXiv:2512.03048 in November 2025. First in a six-paper research program on AI alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13079 2026-04-16 cs.CY cs.AI cs.GT cs.LG 87%

Alignment as Institutional Design: From Behavioral Correction to Transaction Structure in Intelligent Systems

对齐作为制度设计:从行为修正到智能系统中的交易结构

Rui Chai

机构 * Shanghai Sanda University(上海沙达大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出将AI对齐视为制度设计,通过内部交易结构使对齐行为成为各组件的低成本策略,将对齐问题转化为政治经济学问题。

Comments This is Paper 5 in a 10-paper series on Super-Alignment via Wuxing Institutional Architecture. It shifts alignment from external behavioral correction to internal institutional design, making aligned behavior the lowest-cost equilibrium

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00426 2026-02-03 cs.LG cs.AI cs.CL eess.SP 87%

LLMs as High-Dimensional Nonlinear Autoregressive Models with Attention: Training, Alignment and Inference

基于注意力机制的高维非线性自回归模型:训练、对齐与推理

Vikram Krishnamurthy

机构 * Cornell University(康奈尔大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文将LLMs表述为具有注意力依赖的高维非线性自回归模型,探讨了训练、对齐与推理的原理及方法。

Comments 27 pages, 12 figures. Mathematical survey framing LLMs as high-dimensional nonlinear autoregressive models with attention, covering training, alignment, and inference, with nanoGPT/nanochat-style code examples. Feedback welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10884 2024-11-06 cs.CL cs.AI cs.CV cs.LG 87%

Multi-modal Preference Alignment Remedies Degradation of Visual Instruction Tuning on Language Models

Shengzhi Li, Rongyu Lin, Shichao Pei

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,comments);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Project code, model and data: https://github.com/findalexli/mllm-dpo

Journal ref Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 14188-14200, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18571 2024-03-07 cs.LG cs.AI cs.CL stat.ML 87%

Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards

Haoxiang Wang, Yong Lin, Wei Xiong, Rui Yang, Shizhe Diao, Shuang Qiu, Han Zhao, Tong Zhang

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

Comments The code and model are released at https://github.com/Haoxiang-Wang/directional-preference-alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19243 2026-07-22 cs.CL cs.AI 新提交 87%

Inference-Time Steering for Cross-Lingual Factual Consistency in LLMs

大语言模型中跨语言事实一致性的推理时引导

Alexander Manev

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型跨语言事实不一致问题,评估零样本上下文引导、CAA、DPO四种干预策略,通过实验发现角色提示是最强干预方式,CAA对配置敏感,DPO适配器收益窄且可转移性低,表明跨语言不一致部分是选择问题,简单干预可能更优。

Comments 8 pages (21 in total), 2 figures, 4 tables. Original manuscript for a Guided Research project conducted at the Technical University of Munich, detailing the complete methodology, full data pipeline, and comprehensive experimental results. A related, condensed subset of this work was subsequently adapted and published at the StereACuLT 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19744 2026-06-19 cs.CL cs.AI cs.HC 新提交 87%

Beyond Uniform Forgetting: A Study of Sequential Direct Preference Optimization Across Preference Settings

超越统一遗忘:不同偏好设置下顺序直接偏好优化的研究

Pranav Bhandari, Nicolas Fay, Amitava Datta, Usman Naseem, Mehwish Nasim

机构 * Network Analysis and Social Influence Modelling (NASIM) Lab(网络分析与社会影响建模实验室) School of Physics Maths and Computing, The University of Western Australia(西澳大学物理数学与计算学院) School of Psychological Science, The University of Western Australia(西澳大学心理科学学院) School of Computing, Macquarie University(麦考瑞大学计算机学院)

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 研究顺序DPO在不同偏好设置下的影响,发现遗忘模式并非统一,而是取决于目标关系、信号强度和训练顺序,并提出未来对齐流程应考虑目标兼容性。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15396 2026-06-16 cs.CL cs.AI 新提交 87%

CHILLGuard: Towards Fine-Grained Chinese LLM Safety Guardrail with Scalable Data Construction and Model-aware Preference Alignment

CHILLGuard:面向细粒度中文大语言模型安全护栏的可扩展数据构建与模型感知偏好对齐

Wenbo Yu, Bohua Wang, Hao Fang, Kuofeng Gao, Jingru Zeng, Xiaochen Yang, Tianyi Zhang, Xiaoxiao Ma, Jiawei Kong, Hao Wu, Bin Chen, Shu-Tao Xia, Min Zhang

机构 * Tsinghua University(清华大学) Beijing Normal University(北京师范大学) South China University of Technology(华南理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen ShenNong Information Technology Co., Ltd.(深圳神农信息技术有限公司)

专题命中 偏好对齐 :safety(title,abstract);alignment(title);分类 cs.CL、cs.AI

AI总结 针对中文场景,提出细粒度风险分类体系(5大类31小类),通过可扩展数据构建管道生成高质量训练数据,并采用模型感知直接偏好优化训练CHILLGuard,在基准上F1分数提升15.92%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04261 2026-04-07 cs.LG cs.AI 87%

APPA: Adaptive Preference Pluralistic Alignment for Fair Federated RLHF of LLMs

APPA:自适应偏好多元对齐用于大语言模型公平联邦强化学习从人类反馈

Mahmoud Srewa, Tianyu Zhao, Salma Elmalaki

机构 * University of California, Irvine(加利福尼亚大学尔湾分校)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(title);分类 cs.AI、cs.LG

AI总结 本文提出APPA框架,通过动态调整群体奖励权重,提升联邦强化学习中多群体公平对齐效果,实验显示其在保持整体对齐性的同时,显著提升最差群体对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05619 2026-03-03 cs.AI cs.LG 87%

Beyond RLHF and NLHF: Population-Proportional Alignment under an Axiomatic Framework

超越RLHF和NLHF:在公理框架下的人口比例对齐

Kihyun Kim, Jiawei Zhang, Asuman Ozdaglar, Pablo A. Parrilo

机构 * MIT LIDS(麻省理工学院LIDS) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(title);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于公理框架的人口比例对齐方法,通过社会选择理论解决传统偏好学习中的偏差和操纵问题,并在推荐任务和语言模型对齐中验证了其有效性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11456 2024-05-02 cs.LG cs.AI stat.ML 87%

Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint

Wei Xiong, Hanze Dong, Chenlu Ye, Ziqi Wang, Han Zhong, Heng Ji, Nan Jiang, Tong Zhang

专题命中 偏好对齐 :RLHF(title,abstract);DPO(abstract,comments);alignment(abstract);分类 cs.AI、cs.LG

Comments 53 pages; theoretical study and algorithmic design of iterative RLHF and DPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14912 2026-05-15 cs.AI cs.CY cs.HC cs.LG 87%

From Sycophantic Consensus to Pluralistic Repair: Why AI Alignment Must Surface Disagreement

从阿谀共识到多元修复:为何AI对齐必须显现分歧

Varad Vishwarupe, Nigel Shadbolt, Marina Jirotka

机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系) Institute for Ethics in AI, University of Oxford(牛津大学人工智能伦理研究所) Responsible Technology Institute, University of Oxford(牛津大学负责任技术研究所)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出多元对齐需通过对话机制表面价值冲突,提出多元修复评分指标,探讨部署阶段的治理层对多元主义的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06238 2026-01-13 cs.LG cs.AI cs.CL 87%

SPINAL -- Scaling-law and Preference Integration in Neural Alignment Layers

SPINAL -- 神经对齐层中的缩放律与偏好整合

Arion Das, Partha Pratim Saha, Amit Dhanda, Vinija Jain, Aman Chadha, Amitava Das

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SPINAL通过分析神经对齐层的几何特性,量化对齐在深度层的集中表现及稳定性变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08256 2025-10-10 cs.LG cs.AI cs.CL 87%

Mix- and MoE-DPO: A Variational Inference Approach to Direct Preference Optimization

Jason Bohne, Pawel Polak, David Rosenberg, Brian Bloniarz, Gary Kazantsev

机构 * Department of Applied Mathematics and Statistics(应用数学与统计学系) Stony Brook University(石溪大学) Institute for Advanced Computational Science(先进计算科学研究所) Center of Excellence in Wireless and Information Technology (CEWIT)(无线与信息技术卓越中心) AI Innovation Institute(人工智能创新研究院) Bloomberg(彭博) Toronto, ON M5J 2S1(多伦多,ON M5J 2S1) San Francisco, CA 94105(旧金山,CA 94105) Bloomberg New York, NY 10022(纽约,NY 10022)

专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16033 2025-09-04 cs.CL cs.AI cs.LG 87%

TreeBoN: Enhancing Inference-Time Alignment with Speculative Tree-Search and Best-of-N Sampling

Jiahao Qiu, Yifu Lu, Yifan Zeng, Jiacheng Guo, Jiayi Geng, Chenhao Zhu, Xinzhe Juan, Ling Yang, Huazheng Wang, Kaixuan Huang, Yue Wu, Mengdi Wang

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02832 2025-07-24 cs.CL cs.AI cs.LG 87%

AlignDistil: Token-Level Language Model Alignment as Adaptive Policy Distillation

Songming Zhang, Xue Zhang, Tong Zhang, Bojie Hu, Yufeng Chen, Jinan Xu

机构 * Key Laboratory of Big Data & Artificial Intelligence in Transportation, (Beijing Jiaotong University), Ministry of Education(大数据与人工智能交通运输联合实验室,(北京交通大学)教育部) School of Computer Science and Technology, Beijing Jiaotong University, Beijing, China(计算机科学与技术学院,北京交通大学,北京,中国) Tencent Inc, China(腾讯公司,中国)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL 2025 Main Conference, code available at: https://github.com/songmzhang/AlignDistil

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08617 2025-06-11 cs.LG cs.AI cs.CL 87%

RLHS: Mitigating Misalignment in RLHF with Hindsight Simulation

Kaiqu Liang, Haimin Hu, Ryan Liu, Thomas L. Griffiths, Jaime Fernández Fisac

机构 * Princeton University(普林斯顿大学)

专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 27 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏