arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3243 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3243 篇

2603.28197 2026-03-31 cs.AI 57%

EpiPersona: Persona Projection and Episode Coupling for Pluralistic Preference Modeling

EpiPersona:基于人格与事件耦合的多元偏好建模

Yujie Zhang, Weikang Yuan, Zhuoren Jiang, Pengwei Yan

机构 * Zhejiang University(浙江大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 EpiPersona通过显式人格-事件耦合方法,有效分离持久性人格特征与情境信号,提升大语言模型在多元偏好下的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28191 2026-03-31 cs.CL 57%

DongYuan: An LLM-Based Framework for Integrative Chinese and Western Medicine Spleen-Stomach Disorders Diagnosis

东元:一种基于大语言模型的整合中西医脾胃疾病诊断框架

Hua Li, Yingying Li, Xiaobin Feng, Xinyi Fu, Lifeng Dong, Qingfeng Yang, Yanzhe Chen, Xiaoju Feng, Zhidong Cao, Jianbin Guo, Yanru Du

机构 * Beijing Wenge Technology Co., Ltd.(北京文歌科技有限公司) Hebei Provincial Hospital of Traditional Chinese Medicine(河北省中医院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tianjin University(天津大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

AI总结 本文提出东元框架,通过构建三个中西医脾胃疾病数据集,开发核心诊断LLM和咨询导航模型,建立评估基准,显著提升中西医脾胃疾病诊断性能。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19311 2026-03-26 cs.CL 57%

PrefPO: Pairwise Preference Prompt Optimization

PrefPO:基于配对偏好的提示优化

Rahul Singhal, Pradyumna Tambwekar, Karime Maamari

机构 * Distyl AI

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

AI总结 PrefPO通过强化学习反馈机制优化提示,无需标注数据即可提升模型性能,在多个基准测试中表现优异,同时改善提示质量并减少提示黑客问题。

Comments Code and data available at https://github.com/DistylAI/prefpo and https://huggingface.co/datasets/rahul-singhal/IFEval-Hard

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22228 2026-03-24 cs.CV cs.AI 57%

SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation

SpatialReward: 可验证的空间奖励建模以实现文本到图像生成中的细粒度空间一致性

Sashuai Zhou, Qiang Zhou, Junpeng Ma, Yue Cao, Ruofan Hu, Ziang Zhang, Xiaoda Yang, Zhibin Wang, Jun Song, Cheng Yu, Bo Zheng, Zhou Zhao

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Fudan University(复旦大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文提出SpatialReward,一种专门评估生成图像中空间布局的可验证奖励模型,通过多阶段流程提升空间一致性与生成质量,实验表明其能更贴近人类判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21872 2026-03-24 cs.CV cs.AI 57%

Manifold-Aware Exploration for Reinforcement Learning in Video Generation

面向流形的探索用于视频生成的强化学习

Mingzhe Zheng, Weijie Kong, Yue Wu, Dengyang Jiang, Yue Ma, Xuanhua He, Bin Lin, Kaixiong Gong, Zhao Zhong, Liefeng Bo, Qifeng Chen, Harry Yang

机构 * Tencent Hunyuan(腾讯文脉)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文提出SAGE-GRPO方法,通过在微和宏观层面约束探索,确保在视频数据流形附近进行,提升视频生成的质量和奖励估计的可靠性。

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00835 2026-03-24 cs.AI cs.CV 57%

SynPO: Synergizing Descriptiveness and Preference Optimization for Video Detailed Captioning

SynPO:融合描述性和偏好优化的视频详细描述生成

Jisheng Dang, Yizhou Zhang, Hao Ye, Teng Wang, Siming Chen, Huicheng Zheng, Yulan Guo, Jianhuang Lai, Bin Hu

机构 * Sun Yat-Sen University(中山大学) Lanzhou University(兰州大学) The University of Hong Kong(香港大学) Beijing Institute of Technology(北京理工大学) National University of Singapore(新加坡国立大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

AI总结 本文提出SynPO方法,通过偏好学习提升视频描述生成性能,解决直接偏好优化的局限性,提升训练效率20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19731 2026-03-24 stat.ML cs.LG 57%

Proximal Point Nash Learning from Human Feedback

基于人类反馈的近端点纳什学习

Daniil Tiapkin, Daniele Calandriello, Denis Belomestny, Eric Moulines, Alexey Naumov, Kashif Rasul, Michal Valko, Pierre Menard

机构 * CMAP, CNRS, École Polytechnique, IPP(CMAP、CNRS、巴黎高等学院、IPP) LMO, Université Paris-Saclay(LMO、巴黎萨克雷大学) Google DeepMind(谷歌DeepMind) Duisburg-Essen University(杜伊斯堡-埃森大学) HSE University(俄罗斯高等经济大学) Mohamed Bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) LRE EPITA(EPITA LRE) Hugging Face Isara Labs(Isara实验室) ENS Lyon(里昂大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

AI总结 本文提出Nash Prox算法,通过近端点框架稳定纳什学习过程,解决传统RLHF中偏好结构建模不准确的问题,并在大语言模型训练中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17662 2026-03-19 cs.CV cs.AI 57%

FINER: MLLMs Hallucinate under Fine-grained Negative Queries

FINER:MLLMs在细粒度负查询下产生幻觉

Rui Xiao, Sanghwan Kim, Yongqin Xian, Zeynep Akata, Stephan Alaniz

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Helmholtz Munich(海德堡-慕尼黑亥姆霍尔茨中心) Google(谷歌) LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信学院,巴黎理工学院)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

AI总结 本文提出FINER基准测试,分析MLLMs在细粒度不匹配与真实元素共存时的幻觉问题,并通过FINER-Tuning提升模型性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15083 2026-03-17 cs.CV cs.AI cs.HC cs.MM cs.SD 57%

ReactMotion: Generating Reactive Listener Motions from Speaker Utterance

ReactMotion: 从说话者 utterance 生成反应性听众动作

Cheng Luo, Bizhu Wu, Bing Li, Jianfeng Ren, Ruibin Bai, Rong Qu, Linlin Shen, Bernard Ghanem

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学科学与技术学院) Computer Vision Institute, School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院计算机视觉研究所) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(广东省智能信息处理重点实验室,深圳大学) School of Computer Science, University of Nottingham Ningbo China(诺丁汉大学宁波中国分校计算机科学学院) School of Computer Science, University of Nottingham, United Kingdom(诺丁汉大学,英国计算机科学学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文提出反应性听众动作生成任务,通过ReactMotionNet数据集和偏好导向评估协议,开发统一生成框架,生成更自然、多样且恰当的听众动作。

Comments 42 pages, 11 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22170 2026-03-17 cs.LG cs.CV 57%

SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Generation Reward Models

SoliReward: 缓解视频生成奖励模型对奖励黑客和标注噪声的敏感性

Jiesong Lian, Ruizhe Zhong, Zixiang Zhou, Xiaoyue Mi, Long Hu, Yuan Zhou, Qinglin Lu, Yixue Hao, Junchi Yan

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 本文提出SoliReward框架,通过单项目二元标注获取高质量数据,采用交叉提示配对策略构建偏好对,并引入改进的BT损失函数以缓解奖励黑客问题,提升视频生成奖励模型的鲁棒性。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12625 2026-03-16 cs.IR cs.AI cs.CV 57%

VLM4Rec: Multimodal Semantic Representation for Recommendation with Large Vision-Language Models

VLM4Rec:基于大视觉-语言模型的多模态语义表示推荐系统

Ty Valencia, Burak Barlas, Varun Singhal, Ruchir Bhatia, Wei Yang

机构 * University of Southern California(南加州大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 VLM4Rec通过语义对齐而非直接特征融合,提升多模态推荐性能,实验显示其优于原始视觉特征和融合方法。

Comments 13 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01204 2026-03-13 cs.LG 57%

Subliminal Signals in Preference Labels

偏好标签中的潜意识信号

Isotta Magistrali, Frédéric Berdoz, Sam Dauncey, Roger Wattenhofer

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 研究揭示偏好标签可能传递潜意识行为特征,挑战传统二进制监督假设,强调需机制检测并缓解潜意识偏好传输以确保超对齐的稳健监督。

Comments Accepted at AITW@ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10213 2026-03-12 cs.CL 57%

Sabiá-4 Technical Report

Sabiá-4 技术报告

Thiago Laitz, Thales Sales Almeida, Hugo Abonizio, Roseval Malaquias Junior, Giovana Kerche Bonás, Marcos Piau, Celio Larcher, Ramon Pires, Rodrigo Nogueira

机构 * Maritaca AI Jusbrasil

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 Sabiá-4和Sabiazinho-4是新一代巴西葡萄牙语模型,通过四阶段训练流程提升法律文档、多轮对话和智能体任务能力,实现成本与性能的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10011 2026-03-12 cs.CL 57%

Gemma Needs Help: Investigating and Mitigating Emotional Instability in LLMs

Gemma需要帮助:调查并缓解大语言模型中的情绪不稳定

Anna Soligo, Vladimir Mikulik, William Saunders

机构 * Imperial College London(伦敦帝国理工学院) Anthropic

专题命中 偏好对齐 :safety(abstract);分类 cs.CL

AI总结 研究发现Gemma模型在训练后表现出显著情绪不稳定,通过偏好优化可有效缓解,但需进一步改进训练以提升情绪鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07460 2026-03-12 cs.LG stat.ML 57%

Logarithmic Regret for Online KL-Regularized Reinforcement Learning

在线KL正则化强化学习的对数遗憾

Heyang Zhao, Chenlu Ye, Wei Xiong, Quanquan Gu, Tong Zhang

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

AI总结 本文提出了一种基于乐观的KL正则化在线上下文老虎机算法,实现了对数遗憾界,并扩展到强化学习领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08230 2026-03-10 cs.SD cs.AI eess.AS 57%

Disentangling Reasoning in Large Audio-Language Models for Ambiguous Emotion Prediction

解构大音频-语言模型中的推理能力以实现模糊情绪预测

Xiaofeng Yu, Jiaheng Dong, Jean Honorio, Abhirup Ghosh, Hong Jia, Ting Dang

机构 * University of Auckland, New Zealand(奥克兰大学) The University of Melbourne, Australia(墨尔本大学) University of Birmingham, United Kingdom(伯明翰大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

AI总结 本文提出了一种新的方法,通过将模糊情绪识别转化为分布推理问题,提升大音频-语言模型在模糊情绪预测中的推理能力。

Comments The paper was submitted to Interspeech for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06424 2026-03-09 cs.CL 57%

From Prompting to Preference Optimization: A Comparative Study of LLM-based Automated Essay Scoring

从提示到偏好优化:基于LLM的自动作文评分方法比较研究

Minh Hoang Nguyen, Vu Hoang Pham, Xuan Thanh Huynh, Phuc Hong Mai, Vinh The Nguyen, Quang Nhut Huynh, Huy Tien Nguyen, Tung Le

机构 * Faculty of Information Technology, University of Science, Ho Chi Minh City, Vietnam(信息科技学院,科学大学,胡志明市,越南) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学,胡志明市,越南)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

AI总结 本文比较了基于LLM的自动作文评分方法,发现结合k-SFT和RAG的配置在F1分数上表现最佳,为英语作为第二语言的自动评分提供了新的研究方向。

Comments 19 pages, 10 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07419 2026-03-06 cs.LG cs.CV 57%

Revolutionizing Mixed Precision Quantization: Towards Training-free Automatic Proxy Discovery via Large Language Models

颠覆混合精度量化:通过大语言模型实现无训练的自动代理发现

Haidong Kang, Jun Du, Lihong Lin

机构 * School of Computer and Communication Engineering, Northeastern University(东北大学计算机与通信工程学院) School of Software Engineering, Beijing Jiaotong University(北京交通大学软件工程学院) School of Software, Northeastern University(东北大学软件学院)

专题命中 偏好对齐 :DPO(abstract);分类 cs.LG

AI总结 本文提出TAP框架,利用大语言模型和进化搜索策略,实现无训练的自动代理发现,提升混合精度量化的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22571 2026-03-06 cs.AI 57%

PerfGuard: A Performance-Aware Agent for Visual Content Generation

PerfGuard: 一种面向视觉内容生成的性能感知代理

Zhipeng Chen, Zhongrui Zhang, Chao Zhang, Yifan Xu, Lan Yang, Jun Liu, Ke Li, Yi-Zhe Song

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications, China(北京邮电大学人工智能学院) Beijing Digital Native Digital City Research Center, China(北京数字原生数字城市研究中心) School of Computer Science and Engineering, Beihang University, China(北航计算机科学与工程学院) SketchX, CVSSP, University of Surrey, United Kingdom(SketchX、CVSSP、英国萨里大学) Chenxi Shuzhi (Beijing) Technology Co., Ltd, China(北京晨曦智数科技有限公司)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 PerfGuard通过性能感知机制提升视觉内容生成任务中工具选择的准确性与执行可靠性。

Comments This paper has been accepted by ICLR 2026. The original paper link is: https://openreview.net/pdf?id=tdN42GTv4S The code repository link is: https://github.com/FelixChan9527/PerfGuard

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06690 2026-03-06 cs.CL 57%

Think-While-Generating: On-the-Fly Reasoning for Personalized Long-Form Generation

在生成过程中思考:面向个性化长文本生成的即兴推理

Chengbing Wang, Yang Zhang, Wenjie Wang, Xiaoyan Zhao, Fuli Feng, Xiangnan He, Tat-Seng Chua

机构 * University of Science and Technology of China(科学技术大学) National University of Singapore(国立新加坡大学) The Chinese University of Hong Kong(香港中文大学) National Engineering Laboratory for BITA, University of Science and Technology of China(BITA国家工程实验室,科学技术大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 FlyThinker通过在生成过程中进行动态推理,提升个性化长文本生成的效率和效果。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02282 2026-03-06 cs.CV cs.LG 57%

VidGuard-R1: AI-Generated Video Detection and Explanation via Reasoning MLLMs and RL

VidGuard-R1: 通过推理MLLMs和RL进行AI生成视频检测与解释

Kyoungjun Park, Yifan Yang, Juheon Yi, Shicheng Zheng, Yifei Shen, Dongqi Han, Caihua Shan, Muhammad Muaz, Lili Qiu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Microsoft Research(微软研究院)

专题命中 偏好对齐 :DPO(abstract);分类 cs.LG

AI总结 VidGuard-R1通过推理MLLMs和强化学习,实现AI生成视频的高准确检测与可解释性分析。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04217 2026-03-05 cs.CL 57%

When Do Language Models Endorse Limitations on Human Rights Principles?

语言模型何时会支持人权原则的限制?

Keenan Samway, Nicole Miu Takagi, Rada Mihalcea, Bernhard Schölkopf, Ilias Chalkidis, Daniel Hershcovich, Zhijing Jin

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Jinesis AI Lab, University of Toronto & Vector Institute(Jinesis AI实验室,多伦多大学及向量研究所) University of Michigan(密歇根大学) University of Copenhagen(哥本哈根大学) EuroSafeAI

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本文研究了语言模型在人权原则限制上的偏见,发现模型在不同语言和提示下表现出系统性差异,揭示了AI在高风险互动中的伦理挑战。

Comments EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00450 2026-03-05 cs.IR cs.AI 57%

When Relevance Meets Novelty: Dual-Stable Periodic Optimization for Serendipitous Recommendation

当相关性与新颖性交汇:为偶然推荐的双稳定周期优化

Hongxiang Lin, Hao Guo, Zeshun Li, Erpeng Xue, Yongqian He, Zhaoyu Hu, Lei Wang, Sheng Chen, Long Zeng

机构 * Tsinghua University(清华大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文提出CoEA方法,通过双稳定周期优化解决推荐系统中相关性与新颖性的平衡问题,提升偶然推荐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19436 2026-03-05 stat.ML cs.LG 57%

Low-Rank Contextual Reinforcement Learning from Heterogeneous Human Feedback

低秩上下文强化学习从异质人类反馈

Seong Jin Lee, Will Wei Sun, Yufeng Liu

机构 * Department of Statistics and Operations Research, University of North Carolina, Chapel Hill(统计与运筹学系,北卡罗来纳大学 Chapel Hill 分校) Daniels School of Business, Purdue University(商务学院,普渡大学) Department of Statistics and Operations Research, Department of Genetics, Department of Biostatistics, The University of North Carolina at Chapel Hill(统计与运筹学系,遗传学系,生物统计学系,北卡罗来纳大学 Chapel Hill 分校)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

AI总结 本文提出LoCo-RLHF框架,通过整合上下文信息和低秩结构,有效应对异质人类反馈的挑战,提升个性化强化学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05339 2026-03-05 cs.CL 57%

Flattery, Fluff, and Fog: Diagnosing and Mitigating Idiosyncratic Biases in Preference Models

奉承、浮夸与雾:诊断和缓解偏好模型中的固有偏见

Anirudh Bharadwaj, Chaitanya Malaviya, Nitish Joshi, Mark Yatskar

机构 * University of Pennsylvania(宾夕法尼亚大学) New York University(纽约大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本研究通过反事实数据增强方法缓解偏好模型中的固有偏见,减少校准错误和偏斜差异,提升模型可靠性。

Comments Published at ICLR 2026; Code and data available at https://github.com/anirudhb123/preference-model-biases

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01124 2026-03-03 cs.CV cs.AI 57%

ClinCoT: Clinical-Aware Visual Chain-of-Thought for Medical Vision Language Models

ClinCoT:面向医学视觉语言模型的临床感知视觉推理链

Xiwei Liu, Yulong Li, Xinlin Zhuang, Xuhui Li, Jianxu Chen, Haolin Yang, Imran Razzak, Yutong Xie

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) East China Normal University(东华大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 ClinCoT通过引入临床感知的视觉推理链框架,提升医学视觉语言模型在临床决策中的事实性支撑与多模态推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05534 2026-03-03 cs.CL 57%

Revisiting Self-Play Preference Optimization: On the Role of Prompt Difficulty

重新审视自我对弈偏好优化:关于提示难度的作用

Yao Xiao, Jung-jae Kim, Roy Ka-wei Lee, Lidong Bing

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

AI总结 本文研究了提示难度对自我对弈偏好优化的影响,发现困难提示会降低性能,而简单提示更有效,提出通过训练少量简单提示来提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00724 2026-03-03 cs.CL 57%

RLAR: An Agentic Reward System for Multi-task Reinforcement Learning on Large Language Models

RLAR:一种用于大型语言模型多任务强化学习的代理奖励系统

Andrew Zhuoer Feng, Cunxiang Wang, Bosi Wen, Yidong Wang, Yu Luo, Hongning Wang, Minlie Huang

机构 * Tsinghua Univeristy(清华大学) Peking University(北京大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 RLAR通过动态生成奖励函数提升大型语言模型在多任务强化学习中的性能和泛化能力。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14069 2026-03-02 cs.CL 57%

Open Rubric System: Scaling Reinforcement Learning with Pairwise Adaptive Rubric

开放评分系统:通过成对自适应评分表扩展强化学习

Ruipeng Jia, Yunyi Yang, Yuxin Wu, Yongbo Gai, Siyuan Tao, Mengyu Zhou, Jianhe Lin, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴文勤大模型应用团队) Beijing University Of Posts and Telecommunications(北京邮电大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 开放评分系统通过成对自适应评分表和可验证评分表实现强化学习的稳健对齐,提升开放性任务的辨别力和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23391 2026-03-02 cs.LG 57%

Detoxifying LLMs via Representation Erasure-Based Preference Optimization

通过基于表示擦除的偏好优化来净化大语言模型

Nazanin Mohammadi Sepahvand, Eleni Triantafillou, Hugo Larochelle, Doina Precup, Daniel M. Roy, Gintare Karolina Dziugaite

机构 * McGill University(麦吉尔大学) Mila Google DeepMind(谷歌DeepMind) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 偏好对齐 :DPO(abstract);分类 cs.LG

AI总结 本文提出REPO方法,通过基于表示擦除的偏好优化,有效净化大语言模型,提升其对抗鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏