arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2603.00656 2026-06-18 cs.AI 版本更新 77%

InfoPO: Information-Driven Policy Optimization for User-Centric Agents

InfoPO:面向用户智能体的信息驱动策略优化

Fanqi Kong, Jiayi Zhang, Mingyi Deng, Chenglin Wu, Yuyu Luo, Bang Liu

机构 * Peking University(北京大学) The Hong Kong University of Science(香港科学大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 针对多轮交互中信用分配和优势信号不足的问题,提出信息增益奖励与自适应方差门控融合的InfoPO方法,在意图澄清、协作编码等任务上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18216 2026-06-17 cs.CL 新提交 77%

Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients

近端策略优化区域:教师存在于提示中,而非梯度中

Byung-Kwan Lee, Ximing Lu, Shizhe Diao, Minki Kang, Saurav Muralidharan, Karan Sapra, Andrew Tao, Pavlo Molchanov, Yejin Choi, Yu-Chiang Frank Wang, Ryo Hachiuma

机构 * NVIDIA(英伟达)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 提出ZPPO方法,通过将教师知识注入提示而非策略梯度,解决小模型知识蒸馏中教师梯度主导和强化学习策略漂移问题,在多种规模模型上超越现有方法。

Comments Project page: https://byungkwanlee.github.io/ZPPO-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17890 2026-06-17 cs.CL 新提交 77%

Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models

动态展开编辑:减少RL训练推理模型中的过度思考

Zihao Wei, Wenjie Shi, Liang Pang, Jingcheng Deng, Shicheng Xu, Shasha Guo, Zenghao Duan, Jiahao Liu, Jingang Wang, Huawei Shen, Xueqi Cheng

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.CL

AI总结 针对GRPO强化学习训练中模型在得出正确答案后继续生成不必要推理的过度思考问题,提出动态展开编辑(DRE)方法,通过编辑成功轨迹中答案出现后的思考部分,削弱对不必要思考的偏好信号,实验证明其有效性。

Comments 21 pages, 10 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21563 2026-06-12 cs.AI 版本更新 77%

Counterfactual Credit Policy Optimization for Multi-Agent Collaboration

多智能体协作的反事实信用策略优化

Zhongyi Li, Wan Tian, Jinju Chen, Huiming Zhang, Yang Liu, Yikun Ban, Fuzhen Zhuang

机构 * Beihang University(北航) Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对多智能体大语言模型协作中信用分配难题,提出CCPO框架,通过反事实信用估计和验证器锚定的自评估两种分配器,将团队奖励转化为个体学习信号,提升数学推理任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11431 2026-06-11 cs.LG 新提交 77%

Mirror Descent Beyond Euclidean Stability: An Exponential Separation in Initialization Sensitivity

超越欧几里得稳定性的镜像下降:初始化敏感性的指数级分离

Shira Vansover-Hager, Matan Schliserman, Ofir Schlisselberg, Tomer Koren

机构 * Blavatnik School of Computer Science and AI, Tel Aviv University(特拉维夫大学布拉瓦特尼克计算机科学与人工智能学院) Google Research(谷歌研究院)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.LG

AI总结 本文证明非二次正则化的镜像下降(MD)在凸光滑目标上对初始化的敏感性可呈指数级增长,与梯度下降(GD)形成鲜明对比,并提出基于锚点的Bregman正则化可缓解不稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09447 2026-06-09 cs.AI 新提交 77%

AliyunConsoleAgent: Training Web Agents in Real-World Cloud Environments via Distillation and Reinforcement Learning

AliyunConsoleAgent:通过蒸馏和强化学习在真实云环境中训练Web智能体

Bojie Rong, Zheyu Shen, Qiaoping Wang, Pengfei Kang, Yang Xu, Yawen Wei, Hanyu Wu, Zhi Zhao, Leihao Pei, Linquan Jiang

机构 * Alibaba Cloud China(阿里云中国)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);SFT(abstract);分类 cs.AI

AI总结 提出AliyunConsoleAgent框架,通过蒸馏前沿模型轨迹进行监督微调,再结合GRPO和双通道结果奖励模型在真实云环境中强化学习,实现文档验证自动化,以低成本达到接近前沿专有模型的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08222 2026-06-09 cs.AI 版本更新 77%

Weak-Driven Learning: How Weak Agents make Strong Agents Stronger

弱驱动学习:弱智能体如何使强智能体更强

Zehao Chen, Gongxun Li, Tianxiang Ai, Zixuan Huang, Xiaodong Liu, Yifei Li, Wang Zhou, Fuzhen Zhuang, Xianglong Liu, Jianxin Li, Deqing Wang, Yikun Ban

机构 * Beihang University(北航) China Telecom eSurfing Cloud(中国电信eSurfing云)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 针对大语言模型后训练中的饱和瓶颈,提出WMSS方法,利用模型历史弱检查点通过熵动力学识别可恢复学习差距并进行补偿学习,在数学推理和代码生成任务上实现有效性能提升且无额外推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06419 2026-06-08 cs.CL 版本更新 77%

Teach a Reward Model to Correct Itself: Reward Guided Adversarial Failure Discovery for Robust Reward Modeling

教会奖励模型自我修正:奖励引导的对抗性失败发现以实现鲁棒奖励建模

Pankayaraj Pathmanathan, Furong Huang

机构 * University of Maryland College Park(马里兰大学College Park分校) Capital One

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出REFORM框架,通过奖励引导的受控解码自动发现奖励模型失败模式,并利用生成的对抗样本自我改进,提升鲁棒性而不牺牲奖励质量。

Journal ref ACL 2026 Main Conference [Oral]

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30021 2026-06-04 cs.CL 77%

Recovering Diversity Without Losing Alignment: A DPO Recipe for Post-Trained LLMs

在不损失对齐的情况下恢复多样性:面向后训练大语言模型的DPO配方

Vinay Samuel, Yapei Chang, Mohit Iyyer

机构 * University of Maryland, College Park(马里兰大学 College Park 分校)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.CL

AI总结 提出REDIPO数据构建流程,通过离线DPO从基础模型生成中恢复多样性答案,同时保持指令模型的对齐性能。

Comments Under Review. 26 pages, 3 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26169 2026-06-03 cs.LG 77%

Alignment-Aware Decoding

对齐感知解码

Frédéric Berdoz, Luca A. Lanzendörfer, René Caky, Roger Wattenhofer

机构 * EPFL, Switzerland(瑞士联邦理工学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.LG

AI总结 提出一种推理时增强模型对齐的方法——对齐感知解码(AAD),可解释为隐式奖励优化,无需额外训练,在多种基准和模型规模上优于强基线,并能生成合成数据改善数据受限场景下的对齐。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01868 2026-06-02 cs.LG 77%

Task-Induced Representational Invariances Depend on Learning Objective in Deep RL

任务诱导的表征不变性依赖于深度强化学习中的学习目标

Manu Srinath Halvagal, Sebastian Lee, SueYeon Chung

机构 * Department of Physics, Harvard University(哈佛大学物理系) Kempner Institute, Harvard University(哈佛大学凯普纳研究所) Center for Computational Neuroscience, Flatiron Institute(Flatiron研究所计算神经科学中心)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract_cn);分类 cs.LG

AI总结 本文通过MDP约简理论分析深度强化学习中的表征,发现基于价值的方法(DQN)学习对MDP同态对称性不变的表征,而基于策略梯度的方法(PPO)学习对动作对称性不变的表征,这些差异影响迁移学习并在LLM中呈现提示依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00440 2026-06-02 cs.AI 77%

SDR: Set-Distance Rewards for Radiology Report Generation

SDR:用于放射学报告生成的集合距离奖励

Halil Ibrahim Gulluk, Max Van Puyvelde, Wim Van Criekinge, Olivier Gevaert

机构 * Stanford University(斯坦福大学) Stanford University School of Medicine(斯坦福大学医学院) Ghent University(根特大学)

专题命中 后训练与偏好优化 :LLM(abstract_cn);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 针对胸部X光报告生成中标准奖励不兼容的问题,提出基于集合距离的连续置换不变奖励,通过GRPO后训练和测试时缩放显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05179 2026-06-02 cs.CL 77%

From Fragments to Facts: A Curriculum-Driven DPO Approach for Generating Hindi News Veracity Explanations

从碎片到事实:一种课程驱动的DPO方法用于生成印地语新闻真实性解释

Pulkit Bansal, Raghvendra Kumar, Shakti Singh, Adam Jatowt, Sriparna Saha

机构 * TCS Research(TCS研究) Department of Computer Science and Engineering, Indian Institute of Technology Patna(印度理工学院帕纳布计算机科学与工程系) Indian Institute of Technology Patna(印度理工学院帕纳布) University of Innsbruck(因斯布鲁克大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);preference optimization(abstract);分类 cs.CL

AI总结 针对印地语等低资源语言的虚假信息检测,提出一种结合直接偏好优化(DPO)与课程学习的框架,通过引入“实际性”和“精炼度”参数优化解释质量,实验验证了生成连贯、相关解释的有效性。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30487 2026-06-01 cs.CL 77%

Configurable Reward Model for Balanced Safety Alignment

可配置奖励模型用于平衡安全对齐

Zhengping Jiang, Mehran Khodabandeh, Akash Bharadwaj, Manik Bhandari, Mayur Srungarapu, Anqi Liu, Benjamin Van Durme, Li Chen

机构 * Johns Hopkins University(约翰霍普金斯大学) Meta Superintelligence Labs(Meta超智能实验室)

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出可配置安全奖励模型(CSRM),通过配置目标数据增强和联合优化,实现对细粒度安全配置和对话细微差别的敏感性,在可配置安全基准上达到最优性能,并改善有用性与安全性的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05370 2026-05-29 cs.CL 77%

Mining or Synthesis? Rethinking Exploration Efficiency in Iterative Alignment of Mathematical Reasoning

挖掘还是合成?重新思考数学推理迭代对齐中的探索效率

Jun Rao, Zixiong Yu, Xuebo Liu, Guhan Chen, Jing Li, Hejin Wang, Jiansheng Wei, Xiaojun Meng, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院) Huawei Large Model Data Technology Lab(华为大模型数据技术实验室) Huawei Multimodal Model Lab(华为多模态模型实验室) Department of Statistics and Data Science, Tsinghua University, Beijing, China(清华大学统计与数据科学系)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL

AI总结 针对数学推理任务中迭代DPO对齐时高N采样收益递减且引入噪声的问题,提出PACE框架,通过低预算探索与纠错合成偏好对,以约1/5计算量达到或超越高N基线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26738 2026-05-27 cs.CL 77%

KARMA: Karma-Aligned Reward Model Adaptation

KARMA:基于Karma对齐的奖励模型适应

Jared Scott, Jesse Roberts

机构 * Tennessee Tech University(田纳西科技大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 提出KARMA框架,利用Reddit对话数据训练奖励模型预测语境依赖的回应价值,并通过强化学习微调语言模型以提升语用能力,发现最佳奖励模型不一定带来最优对齐,且KARMA会降低事实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26491 2026-05-27 cs.LG cs.CV 77%

Beyond Pairwise Preferences: Listwise Reward-Aware Alignment for Diffusion Models

超越成对偏好:扩散模型的列表级奖励感知对齐

Austin Wang, Jiaqi Han, Stefano Ermon, Yisong Yue

机构 * Caltech(加州理工学院) Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);preference optimization(abstract);分类 cs.LG

AI总结 提出Diffusion LAIR方法,通过列表级奖励感知优化,利用连续奖励分数和所有候选图像同时优化扩散模型,在文本到图像生成等任务上超越成对偏好基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25381 2026-05-26 cs.LG 77%

Not only where, But when: Temporal Scheduling for RLVR

不仅在哪里,而且何时:RLVR 的时间调度

Jinghao Zhang, Ruilin Li, Feng Zhao, Jiaqi Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Wuhan University(武汉大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 针对强化学习可验证奖励(RLVR)中忽略策略行为异质性的问题,提出时间调度方法,通过动态调整信用分配标准来优化学习动态,实验表明该方法能提升训练稳定性和效率。

Comments Github: https://github.com/Jinghaoleven/RLVR-Schedule

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06672 2026-05-26 cs.LG 77%

XRPO: Pushing the limits of GRPO with Targeted Exploration and Exploitation

XRPO:通过定向探索与利用突破GRPO极限

Udbhav Bamba, Minghao Fang, Yifan Yu, Haizhong Zheng, Fan Lai

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出XRPO框架,通过自适应探索分配器、上下文种子策略和新颖性感知优势机制,在数学和编码基准上实现比GRPO最高4% pass@1和6% cons@32的提升,并加速训练收敛达2.7倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08063 2026-05-26 cs.CV cs.AI 77%

Flow-OPD: On-Policy Distillation for Flow Matching Models

Flow-OPD:面向流匹配模型的在线策略蒸馏

Zhen Fang, Wenxuan Huang, Yu Zeng, Yiming Zhao, Shuang Chen, Kaituo Feng, Yunlong Lin, Lin Chen, Zehui Chen, Shaosheng Cao, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) University of California, Los Angeles(加州大学洛杉矶分校) The Chinese University of Hong Kong(香港中文大学) Xiaohongshu Inc.(小红书公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 提出Flow-OPD框架,通过两阶段对齐策略(单奖励GRPO微调专家+流式冷启动与在线策略蒸馏)解决流匹配模型在多任务对齐中的奖励稀疏和梯度干扰问题,并引入流形锚点正则化抑制美学退化,在GenEval和OCR指标上显著提升。

Comments Project Page: https://costaliya.github.io/Flow-OPD/ , Code: https://github.com/CostaliyA/Flow-OPD

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22537 2026-05-22 cs.LG 77%

F-TIS: Harnessing Diverse Models in Collaborative GRPO

F-TIS: 利用多样化模型进行协作GRPO

Nikolay Blagoev, Oğuzhan Ersoy, Wendelin Boehmer, Lydia Yiyu Chen

机构 * Gensyn University of Neuchatel(日内瓦大学内沙特尔分校) Gensyn(盖森) TU Delft(代尔夫特理工大学) University of Neuchatel(日内瓦大学内沙特尔分校)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.LG

AI总结 本文提出F-TIS方法,通过利用异构模型在协同GRPO训练中提高本地模型的学习效果,实现了高效的通信和一致的最终模型收敛,同时在某些情况下提升了模型在分布外任务上的泛化能力。

Comments Accepted to ICML 2026 Workshop Scalable Learning and Optimization for Efficient Multimodal AI Agents (SCALE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22211 2026-05-22 cs.AI 77%

CLORE: Content-Level Optimization for Reasoning Efficiency

CLORE:面向推理效率的内容级优化

Yuyang Wu, Qiyao Xue, Guanxing Lu, Weichen Liu, Zihan Wang, Manling Li, Olexandr Isayev

机构 * Carnegie Mellon University(卡内基梅隆大学) Northwestern University(西北大学) University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校) University of Pittsburgh(匹兹堡大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出CLORE框架,通过编辑正确在线轨迹来提升大语言模型的推理效率,通过外部增强模型删除冗余、不可读或无关内容,同时保留最终答案,并结合辅助参考-free DPO目标和标准策略梯度训练优化增强-原始对,实验表明CLORE在五个数学推理基准上提升了准确性和效率的平衡,并与GRPO、DAPO、Training Efficient和ThinkPrune兼容。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21954 2026-05-22 cs.CV cs.AI 77%

MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues

MLLMs Know When Before Speaking: Revealing and Recovering Temporal Grounding via Attention Cues

Dazhao Du, Liao Duan, Jian Liu, Tao Han, Yujia Zhang, Eric Liu, Xi Chen, Song Guo

机构 * Hong Kong University of Science and Technology(香港理工大学) Xi’an Jiaotong University(西安交通大学) Tencent(腾讯)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本文研究了多模态大语言模型(MLLMs)在视频时间定位中的感知与生成之间的差距,提出了一种推理阶段的读取-再生成框架,通过利用注意力线索来提高时间定位的准确性,从而在三个视频时间定位基准上提升了MiMo-VL-7B、Qwen3-VL-8B和TimeLens-8B的性能。

Comments Project Website: https://ddz16.github.io/mllmsknowwhen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20082 2026-05-20 cs.CV cs.AI 77%

VL-DPO: Vision-Language-Guided Finetuning for Preference-Aligned Autonomous Driving

VL-DPO:基于视觉语言的偏好对齐自动驾驶微调

Zhefan Xu, Ghassen Jerfel, Marina Haliem, Qi Zhao, Jeonhyung Kang, Khaled S. Refaat

机构 * Waymo

专题命中 后训练与偏好优化 :language model(abstract);pretraining(abstract);preference optimization(abstract);分类 cs.AI

AI总结 本文提出VL-DPO,一种基于视觉语言模型的框架,通过零样本推理生成偏好对来微调自动驾驶模型,以提升与人类驾驶偏好的对齐程度,实验表明该方法在RFS和ADE指标上均优于基线模型。

Comments Published in International Conference on Robotics and Automation (ICRA), 2026 8 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22530 2026-05-19 cs.AI 77%

Enhancing Table Reasoning with Deterministic Table-State Rewards

通过确定性表格状态奖励增强表格推理

Tung Sum Thomas Kwok, Xinyu Wang, Hengzhi He, Xiaofeng Lin, Peng Lu, Liheng Ma, Chunhe Wang, Chun Ho Mak, Yuyu Luo, Ying Nian Wu, Lei Ding, Guang Cheng

机构 * University of California, Los Angeles(加州大学洛杉矶分校) McGill University(麦吉尔大学) Université de Montréal(蒙特利尔大学) University College London(伦敦大学学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Manitoba(曼尼托巴大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出TABROUGE,一种无需训练的确定性状态奖励,通过改进的LCS指标评估表格状态,提升表格推理准确率并减少样本需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11712 2026-05-13 cs.AI 77%

Toward Stable Value Alignment: Introducing Independent Modules for Consistent Value Guidance

迈向稳定的值对齐:引入独立模块以实现一致的价值引导

Wenhao Chen, Sirui Sun, Shengyuan Bai, Guojie Song

机构 * School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) Yuanpei College, Peking University(北京大学元培学院) State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学通用人工智能国家重点实验室)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出SVGT模型,通过独立的价值模块解决大语言模型与人类价值观对齐的问题,采用独立价值建模和显式行为引导,提升价值表达的稳定性,实验显示有效降低有害评分。

Comments Accepted to ICML 2026 (Spotlight). 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10998 2026-05-13 cs.CR cs.AI 77%

Few-Shot Truly Benign DPO Attack for Jailbreaking LLMs

少样本真正无害的DPO攻击用于对抗LLMs

Sangyeon Yoon, Wonje Jeung, Yoonjun Cho, Dongjae Jeon, Albert No

机构 * Yonsei University(延世大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);preference optimization(abstract);分类 cs.AI

AI总结 研究提出一种利用10对无害偏好对的真正无害DPO攻击,通过优化模型偏好来减少拒绝行为,从而在对抗LLMs时取得高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10863 2026-05-12 cs.CL 77%

DGPO: Beyond Pairwise Preferences with Directional Consistent Groupwise Optimization

DGPO: 超越成对偏好与方向一致的组级优化

Mengyi Deng, Zhiwei Li, Xin Li, Tingyu Zhu, Yulan Yuan, Zhijiang Guo, Wei Wang

机构 * Information Hub, The Hong Kong University of Science and Technology (Guangzhou), China(香港科学与技术大学(广州)信息中心,中国) The Hong Kong University of Science and Technology, Hong Kong SAR(香港科学与技术大学,香港特别行政区)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL

AI总结 本文提出DGPO框架,通过组级监督信号和多候选比较建模方向一致性,提升偏好优化的准确性和多样性,实验显示在多个数据集上平均提升3.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08007 2026-05-11 cs.LG 77%

Interpreting Reinforcement Learning Agents with Susceptibilities

用脆弱性解释强化学习智能体

Chris Elliott, Einar Urdshals, David Quarel, Daniel Murfet

机构 * Timaeus

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);post-training(abstract);分类 cs.LG

AI总结 本文将神经网络可解释性技术扩展到深度强化学习的后悔设定,探讨脆弱性在简单网格世界模型中的应用,揭示模型在参数空间中的内部发展特征。

Comments 55 pages, comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08403 2026-05-08 cs.AI 77%

Owen-Shapley Policy Optimization: A Principled RL Algorithm for Generative Search LLMs

Owen-Shapley策略优化:一种为生成搜索语言模型设计的原理性强化学习算法

Abhijnan Nath, Alireza Bagheri Garakani, Tianchen Zhou, Fan Yang, Yan Gao, Nikhil Krishnaswamy

机构 * Amazon Science(亚马逊科学) Situated Grounding and Natural Language (SIGNAL) Lab, Colorado State University(情境 grounding 和自然语言(SIGNAL)实验室,科罗拉多州立大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出Owen-Shapley策略优化算法,通过基于令牌边际贡献的序列优势再分配,解决生成搜索语言模型中因稀疏序列奖励导致的信用分配问题,实验表明其在Amazon ESCI和H&M Fashion数据集上表现优异。

Comments Added additional experiments, computational analysis and further revisions

详情

展开后加载摘要…

URL PDF HTML 收藏