arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2607.12640 2026-07-15 cs.AI cs.CL 新提交 81%

A Learning-Rate-Gated Failure of GRPO in a Small Language and Vision-Language Model Web Agent: A Controlled Null and Its Mechanism

小语言和视觉语言模型网络智能体中GRPO的学习率门控失败:一个可控的无效结果及其机制

Chengguang Gan, Zhixi Cai, Yunhao Liang, Hanjun Wei, Shiwen Ni, Qinghao Zhang

机构 * Monash University(莫纳什大学) University of Chinese Academy of Sciences(中国科学院大学) Shenzhen University of Advanced Technology(深圳先进技术大学) Pusan National University(釜山国立大学)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究4B到8B规模小语言和视觉语言模型网络智能体中GRPO的效果,通过控制变量实验发现其在已掌握任务上无明显提升,解释了学习率导致失败的机制,表明该耦合与模型规模相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10169 2026-07-14 cs.LG cs.AI 新提交 81%

Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization

超越欧几里得裁剪:通过黎曼等距策略优化克服大语言模型强化学习中的探索崩溃

Zhicheng Cai, Xinyuan Guo, Hanlin Wu, Mingxuan Wang, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou

专题命中 后训练与偏好优化 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型强化学习中PPO-Clip的探索崩溃问题,提出黎曼等距策略优化(RIPO)方法,通过保证黎曼流形上等距策略更新平衡探索与利用,在七个竞争级基准上显著超越现有算法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02998 2026-07-08 cs.CV cs.AI cs.LG 新提交 81%

CONFLUX: A Latent Diffusion Model for 3D Chest-CT Synthesis with RL Post-Training

CONFLUX:一种用于3D胸部CT合成的潜在扩散模型及强化学习后训练

Max Van Puyvelde, Halil Ibrahim Gulluk, Wim Van Criekinge, Olivier Gevaert

机构 * Department of Biomedical Data Science, Stanford University School of Medicine(斯坦福大学医学院生物医学数据科学系) Department of Mathematical Modelling, Statistics & Bioinformatics, Ghent University(根特大学数学建模、统计与生物信息学系) Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 提出CONFLUX潜在扩散模型用于胸部CT合成,由3D变分自编码器和整流流变压器构成,基于放射学元数据生成,通过强化学习后训练增强对临床属性控制,在三平面弗雷歇距离上领先并发布模型与数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05659 2026-07-07 cs.CV cs.AI cs.LG 版本更新 81%

When Rubrics Fail: Error Enumeration as Reward in Reference-Free RL Post-Training for Virtual Try-On

当评分标准失效时:在无参考RL后训练中通过错误枚举作为奖励

Wisdom Ikezogwo, Mehmet Saygin Seyfioglu, Ranjay Krishna, Karim Bouyarmane

机构 * University of Washington, Seattle, USA(华盛顿大学(西雅图)) Amazon, Seattle, USA(亚马逊(西雅图)) Allen Institute for AI(艾伦人工智能研究所)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出隐式错误计数方法,用于解决无参考答案的RL后训练问题,通过计算错误而非正确来生成可靠奖励,在虚拟试穿任务中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20657 2026-06-26 cs.AI cs.LG 新提交 81%

A-Evolve-Training: Autonomous Post-Training of a 30B Model

A-Evolve-Training: 30B模型的自主后训练

Zhan Shi, Bing He, Yisi Sang, Hanqing Lu, Benoit Dumoulin

机构 * A-EVO-Lab, Amazon(亚马逊A-EVO实验室)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一个无需人工干预的自主后训练系统,对30B参数模型进行多轮训练,在NVIDIA排行榜上接近人类最佳成绩,并展示了系统能自主发现并修正指标误导问题。

Comments 12 pages,

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02451 2026-06-23 cs.LG cs.AI 版本更新 81%

Active Causal Experimentalist (ACE): Learning Intervention Strategies via Direct Preference Optimization

主动因果实验者 (ACE): 通过直接偏好优化学习干预策略

Patrick Cooper, Alvaro Velasquez

机构 * University of Colorado Boulder(科罗拉多大学波德分校)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

AI总结 提出ACE框架,将实验设计建模为顺序策略,利用直接偏好优化从干预对比较中学习,在合成、物理和经济数据上以等干预预算取得70-71%的提升,并自主发现碰撞机制需集中干预父变量的理论策略。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19744 2026-06-19 cs.CL cs.AI cs.HC 新提交 81%

Beyond Uniform Forgetting: A Study of Sequential Direct Preference Optimization Across Preference Settings

超越统一遗忘:不同偏好设置下顺序直接偏好优化的研究

Pranav Bhandari, Nicolas Fay, Amitava Datta, Usman Naseem, Mehwish Nasim

机构 * Network Analysis and Social Influence Modelling (NASIM) Lab(网络分析与社会影响建模实验室) School of Physics Maths and Computing, The University of Western Australia(西澳大学物理数学与计算学院) School of Psychological Science, The University of Western Australia(西澳大学心理科学学院) School of Computing, Macquarie University(麦考瑞大学计算机学院)

专题命中 后训练与偏好优化 :preference optimization(title);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究顺序DPO在不同偏好设置下的影响,发现遗忘模式并非统一,而是取决于目标关系、信号强度和训练顺序,并提出未来对齐流程应考虑目标兼容性。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24357 2026-06-17 cs.LG cs.AI 版本更新 81%

DPRM: A Plug-in Doob h transform-induced Token-Ordering Module for Diffusion Language Models

DPRM: 一种用于扩散语言模型的即插即用Doob h变换诱导的令牌排序模块

Dake Bu, Wei Huang, Andi Han, Hau-San Wong, Qingfu Zhang, Taiji Suzuki, Atsushi Nitanda

机构 * City University of Hong Kong(香港城市大学) The Institute of Statistical Mathematics(统计数学研究所) University of Sydney(悉尼大学) Nanyang Technological University(南洋理工大学) The University of Tokyo(东京大学)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出DPRM模块,通过在线估计从置信度驱动排序逐步过渡到过程奖励引导排序,改进扩散语言模型的令牌排序策略,在九种任务中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12505 2026-06-12 cs.LG cs.AI 新提交 81%

Boosting Direct Preference Optimization with Penalization

通过惩罚增强直接偏好优化

Pengwei Sun

机构 * Pengwei Sun(Sun Pengwei)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

AI总结 提出DPOP,在DPO损失上增加对参考模型贪婪响应的门控惩罚,仅当当前策略对偏好响应概率低于拒绝响应时激活,在AlpacaEval 2.0上显著提升胜率。

Comments Accepted at ICML 2026 Workshop on Decision-Making from Offline Datasets to Online Adaptation: Black-Box Optimization to Reinforcement Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10968 2026-06-11 cs.LG cs.AI 版本更新 81%

Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning

超越大语言模型强化学习中的统一令牌级信任区域

Renjie Mao, Xiangxin Zhou, Lvfang Tao, Yixin Ding, Yu Shi, Yongguang Lin, Yuheng Wu, Honglin Zhu, Qian Qiu, Wenxi Zhu

机构 * Tencent Hunyuan(腾讯混元)

专题命中 后训练与偏好优化 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 针对PPO风格信任区域在自回归生成中的位置无关问题,提出CPPO方法,通过位置加权阈值和累积前缀预算动态调整令牌级约束,提升训练稳定性和推理准确性。

Comments Project Page: https://hunyuan-cppo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09563 2026-06-09 cs.AI cs.LG 新提交 81%

PRISM: Recovering Instruction Sets from Language Model Activations

PRISM:从语言模型激活中恢复指令集

Gilad Gressel, Rahul Pankajakshan, Julia Diament, Efim Hudis, Krishnashree Achuthan, Yisroel Mirsky

机构 * Center for Cybersecurity Systems & Networks, Amrita Vishwa Vidyapeetham(阿姆里塔·维什瓦·维迪亚佩瑟姆网络安全系统与网络中心) Microsoft(微软) Ben-Gurion University of the Negev(内盖夫本-古里安大学)

专题命中 后训练与偏好优化 :language model(title);LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 提出PRISM方法,通过激活条件解码从冻结目标模型隐藏状态中恢复活跃指令集,利用法官引导的GRPO优化,在多种场景下优于基线方法。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20978 2026-06-09 eess.AS cs.AI cs.LG 版本更新 81%

GenTSE: Enhancing Target Speaker Extraction via a Coarse-to-Fine Generative Language Model

GenTSE: 通过粗到细的生成语言模型增强目标说话人提取

Haoyang Li, Xuyi Zhuang, Azmat Adnan, Ye Ni, Wei Rao, Shreyas Gopal, Eng Siong Chng, Boon Siew Han, Yuanjin Zheng

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Southeast University, China(东南大学,中国) Schaeffler Hub for Advanced REsearch (SHARE) at Nanyang Technological University, Singapore(南洋理工大学Schaeffler先进研究 hub(SHARE),新加坡)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出GenTSE,一种两阶段解码器仅生成语言模型,先预测粗语义标记再生成细声学标记,结合冻结语言模型条件训练和直接偏好优化,在Libri2Mix上超越先前基于语言模型的系统。

Comments Accepted to Interspeech2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05434 2026-06-05 cs.LG cs.AI 81%

Selective-Advantage Entropy-Adaptive Horizon GRPO: Asymmetric Token-Level Discounting for Efficient Reinforcement Learning of Language Models

选择性优势熵自适应视野GRPO:用于语言模型高效强化学习的非对称令牌级折扣

Chirag Chawla, Rohan Charudatt Salvi, Madhav S. Baidya

机构 * Indian Institute of Technology (BHU)(印度理工学院(博生胡大学)) Department of Computer Science, University of Illinois Chicago(伊利诺伊大学芝加哥分校计算机科学系)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出选择性优势熵自适应视野GRPO(SA-AH-GRPO),通过非对称令牌级折扣(仅对负优势轨迹应用熵基折扣)来稳定训练并提升数学推理性能。

Comments 16 pages, 4 Figures, 7 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22717 2026-05-22 cs.SD cs.AI cs.LG cs.MM 81%

Live Music Diffusion Models: Efficient Fine-Tuning and Post-Training of Interactive Diffusion Music Generators

实时音乐扩散模型:交互式音乐生成扩散模型的高效微调与后训练

Zachary Novack, Stephen Brade, Haven Kim, Hugo Flores García, Nithya Shikarpur, Chinmay Talegaonkar, Suwan Kim, Valerie K. Chen, Julian McAuley, Taylor Berg-Kirkpatrick, Cheng-Zhi Anna Huang

机构 * UC San Diego(加州大学圣迭戈分校) MIT(麻省理工学院) Adobe(Adobe公司)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了音频扩散模型能否通过块级KV缓存高效地转化为交互式模型,从而在消费级硬件上实现。提出的Live Music Diffusion Models (LMDMs)通过块级KV缓存恢复并超越了离散Live Music Models (LMMs)的推理复杂度,并通过ARC-Forcing范式实现稳定的后训练对齐,从而在无需显式RL或奖励模型的情况下减少误差累积。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21893 2026-05-19 cs.LG cs.AI 81%

SIPO: Stabilized and Improved Preference Optimization for Aligning Diffusion Models

SIPO: 用于对齐扩散模型的人类偏好优化的稳定与改进方法

Xiaomeng Yang, Mengping Yang, Junyan Wang, Zhijian Zhou, Zhiyu Tan, Hao Li

机构 * Shanghai Science and Intelligence Institute, Shanghai, China(上海科学与智能研究所) Fudan University, Shanghai, China(复旦大学) Australian Institute for Machine Learning, The University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出SIPO框架,通过时间步感知的重要性重新加权和梯度稳定技术,解决扩散模型对齐中训练不稳定和策略偏差问题,提升了对齐效果和稳定性。

Comments This version supplements with more detailed content on reasoning and proof, additional experimental results, and ablation studies

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01698 2026-05-12 cs.CL cs.LG 81%

Restoring Exploration after Post-Training: Latent Exploration Decoding for Large Reasoning Models

训练后探索恢复:大型推理模型的潜在探索解码

Wenhui Tan, Fiorenzo Parascandolo, Enver Sangineto, Jianzhong Ju, Zhenbo Luo, Qian Cao, Rita Cucchiara, Ruihua Song, Jian Luan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China(中国人民大学北京校区人工智能学院) MiLM Plus, Xiaomi Inc., Beijing, China(小米公司北京MiLM Plus团队) University of Modena and Reggio Emilia(莫德纳和雷吉奥艾米莉亚大学) University of Pisa, Italy(比萨大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出Latent Exploration Decoding方法,通过累积中间后验并选择熵最大配置来提升推理模型的pass@1和pass@16准确率,同时增强强化学习中的探索能力。

Comments Project Page: https://github.com/AlbertTan404/LED

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19471 2026-05-12 cs.LG cs.AI 81%

Improving Inverse Folding for Peptide Design with Diversity-regularized Direct Preference Optimization

通过多样性正则化的直接偏好优化改进肽设计的反向折叠

Ryan Park, Darren J. Hsu, C. Brian Roland, Maria Korshunova, Chen Tessler, Shie Mannor, Olivia Viessmann, Bruno Trentini

机构 * Stanford University(斯坦福大学) NVIDIA(英伟达) Technion - Israel Institute of Technology(技术学院-以色列理工学院) Flagship Pioneering(旗领先锋) University of Oxford(牛津大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过改进的直接偏好优化方法,结合多样性正则化和领域特定先验,提升肽设计中反向折叠模型的序列多样性和结构一致性,实验表明在OpenFold生成结构条件下,模型在结构相似度上取得显著提升。

Comments Preprint. 10 pages plus appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07105 2026-05-11 cs.LG cs.CL cs.CY cs.IT math.IT 81%

Theoretical Limits of Language Model Alignment

语言模型对齐的理论极限

Lucas Monteiro Paes, Natalie Mackraz, Barry-John Theobald, Federico Danieli

机构 * Apple(苹果公司)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究语言模型对齐的理论极限,通过推导KL散度预算下的最大预期奖励增益,揭示了KL正则化对齐的信息论限制,并证明了奖励融合能缓解奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06078 2026-05-08 cs.CL cs.AI 81%

Milestone-Guided Policy Learning for Long-Horizon Language Agents

为长周期语言代理设计的里程碑引导策略学习

Zixuan Wang, Yuchen Yan, Hongxing Li, Teng Pan, Dingming Li, Ruiqing Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Baidu Inc.(百度公司)

专题命中 后训练与偏好优化 :language agent(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出BEACON框架,通过任务的组合结构实现精准信用分配,提升长周期语言代理的训练效果,在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02125 2026-05-04 cs.AI cs.LG 81%

Preference Goal Tuning: Post-Training as Latent Control for Frozen Policies

偏好目标微调:冻结策略的后训练作为潜在控制

Guangyu Zhao, Kewei Lian, Haoxuan Ru, Borong Zhang, Haowei Lin, Zhancun Mu, Haobo Fu, Qiang Fu, Shaofei Cai, Zihao Wang, Yitao Liang

机构 * Peking University(北京大学) Tencent AI Lab(腾讯AI实验室)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出偏好目标微调(PGT),通过冻结策略并优化潜在目标,使策略在无监督下适应任务偏好,实现在Minecraft SkillForge基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06416 2026-04-14 cs.LG cs.AI cs.HC 81%

Influencing Humans to Conform to Preference Models for RLHF

影响人类以符合偏好模型的强化学习从人类反馈

Stephane Hatgis-Kessell, W. Bradley Knox, Serena Booth, Peter Stone

机构 * Stanford University(斯坦福大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Brown University(布朗大学) Sony AI(索尼AI)

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过三项人类研究,探讨如何通过干预使人类偏好更符合预期模型,提升RLHF奖励函数对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19335 2026-03-23 cs.LG cs.AI 81%

Do Post-Training Algorithms Actually Differ? A Controlled Study Across Model Scales Uncovers Scale-Dependent Ranking Inversions

训练后算法真的不同吗?跨模型规模的受控研究揭示了规模依赖的排名倒置

Xiaoyi Li

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过跨模型规模的受控研究,揭示了训练后算法在不同规模下的稳定性差异、损失函数修改的微小收益以及算法利用的任务依赖性,为算法选择提供了指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13228 2026-03-17 cs.LG cs.AI cs.CV cs.RO 81%

PhysMoDPO: Physically-Plausible Humanoid Motion with Preference Optimization

PhysMoDPO:基于物理的类人运动与偏好优化

Yangsong Zhang, Anujith Muraleedharan, Rikhat Akizhanov, Abdul Ahad Butt, Gül Varol, Pascal Fua, Fabio Pizzati, Ivan Laptev

机构 * Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) LIGM, École des Ponts, IP Paris, Univ Gustave Eiffel, CNRS(LIGM,巴黎理工学院,IP巴黎,古斯塔夫·埃菲尔大学,国家科学研究中心) École polytechnique fédérale de Lausanne (EPFL)(洛桑联邦理工学院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

AI总结 PhysMoDPO通过整合完整身体控制器和偏好优化框架,提升生成运动在物理真实性和任务性能上的表现,适用于文本到运动和空间控制任务。

Comments Project page: https://mael-zys.github.io/PhysMoDPO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20629 2026-03-17 cs.CV cs.AI cs.LG 81%

MapReduce LoRA: Advancing the Pareto Front in Multi-Preference Optimization for Generative Models

MapReduce LoRA:在生成模型多偏好优化中推进帕累托前沿

Chieh-Yun Chen, Zhonghao Wang, Qi Chen, Zhifan Ye, Min Shi, Yue Zhao, Yinan Zhao, Hui Qu, Wei-An Lin, Yiru Shen, Ajinkya Kale, Irfan Essa, Humphrey Shi

专题命中 后训练与偏好优化 :preference optimization(title);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MapReduce LoRA和RaTE方法,通过并行训练偏好特定的LoRA专家和学习奖励特定的token嵌入,提升生成模型在多偏好优化中的性能,实验显示在文本到图像、文本到视频及语言任务中均取得显著改进。

Comments CVPR 2026; Code: https://github.com/SHI-Labs/MapReduce-LoRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12163 2026-03-13 cs.LG cs.AI math.ST stat.ML stat.TH 81%

A Quantitative Characterization of Forgetting in Post-Training

后训练中遗忘的定量刻画

Krishnakumar Balasubramanian, Shiva Prasad Kasiviswanathan

机构 * Department of Statistics, University of California, Davis(加州大学戴维斯分校统计系) Amazon(亚马逊)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了后训练中遗忘的定量刻画,通过理论分析揭示了不同KL目标对遗忘形式的影响,并探讨了回放与这些目标的交互作用,最终提出了保留旧质量与控制漂移的条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04277 2026-03-06 cs.LG cs.AI 81%

Bootstrapped Mixed Rewards for RL Post-Training: Injecting Canonical Action Order

基于强化学习后训练的混合奖励:注入经典动作顺序

Prakhar Gupta, Vaibhav Gupta

机构 * University of Michigan(密歇根大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出在强化学习后训练中引入混合奖励,通过结合稀疏任务奖励和顺序奖励,提升模型对经典求解顺序的适应能力,无需修改监督数据或架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04462 2026-02-25 cs.CL cs.CR cs.LG 81%

Watermarking Degrades Alignment in Language Models: Analysis and Mitigation

水印会损害语言模型的对齐:分析与缓解

Apurv Verma, NhatHai Phan, Shubhendu Trivedi

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究发现水印影响语言模型对齐,提出Alignment Resampling方法恢复对齐性能。

Comments Published in Transactions of Machine Learning Research 02/2026. Extended version of the earlier paper published at the 1st Workshop on GenAI Watermarking (ICLR 2025)

Journal ref Transactions of Machine Learning Research 02/2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16093 2026-02-19 cs.CL cs.AI 81%

Updating Parametric Knowledge with Context Distillation Retains Post-Training Capabilities

通过上下文蒸馏更新参数化知识可保留训练后能力

Shankar Padmanabhan, Mustafa Omer Gul, Tanya Goyal

机构 * Department of Computer Science, Cornell University(康奈尔大学计算机科学系)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出DiSC方法,通过上下文蒸馏实现持续知识适应,有效平衡新知识学习与原有能力保持。

Comments 15 pages. Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03441 2026-02-13 cs.LG cs.AI cs.CR 81%

PBP: Post-training Backdoor Purification for Malware Classifiers

PBP: 事后训练后门净化用于恶意软件分类器

Dung Thuy Nguyen, Ngoc N. Tran, Taylor T. Johnson, Kevin Leach

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 PBP是一种后训练方法,通过调节批量归一化层统计特性,有效净化恶意软件分类器中的后门,显著降低攻击成功率。

Comments The Network and Distributed System Security (NDSS) Symposium 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05125 2026-02-06 cs.LG cs.AI 81%

Rethinking Rubric Generation for Improving LLM Judge and Reward Modeling for Open-ended Tasks

重新思考评估标准生成以改进LLM评判与开放任务的奖励建模

William F. Shen, Xinchi Qiu, Chenxi Whitehouse, Lisa Alazraki, Shashwat Goel, Francesco Barbieri, Timon Willi, Akhil Mathur, Ilias Leontiadis

机构 * Meta Superintelligence Labs(Meta超智能实验室)

专题命中 后训练与偏好优化 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 RRD通过递归分解-过滤循环优化评估标准,提升LLM评判准确性和奖励建模效果。

详情

展开后加载摘要…

URL PDF HTML 收藏