arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2607.11172 2026-07-14 cs.AI cs.LG 新提交 73%

STAMP: Provenance-Guided Credit Assignment for Deep Search Agents

STAMP:深度搜索智能体的溯源引导信用分配

Ke Xu, Han Xu, Xinran Chen, Yuqian Wang, Zhixuan Li, Xiaojian Liu, Changwo Wu, Jianqiang Xia, Yuchen Li

机构 * Baidu Inc.(百度公司) Peking University(北京大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究深度搜索智能体强化学习中奖励-信用不匹配问题,提出STAMP方法,通过基于参考的验证器和首次曝光归因确定信用,经符号保留优势调制注入信用,实验表明该方法能提升GRPO基线分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11053 2026-07-14 cs.CL cs.AI 新提交 73%

Flout at Your Own Risk: LLMs Struggle with Pragmatic Cooperativity Under Epistemic Asymmetry

自担风险:在认知不对称下大语言模型在语用合作方面存在困难

Hannah VanderHoeven, Abhijnan Nath, Nikhil Krishnaswamy

机构 * Situated Grounding and Natural Language (SIGNAL) Lab(情境基础与自然语言(SIGNAL)实验室)

专题命中 后训练与偏好优化 :post-training(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型在多方协作任务部分信息条件下的语用推理能力,形式化协作认知不对称概念,评估其作为说话者和倾听者合作能力,发现虽有一定语用能力但信息不完整时仍有挑战,部分失败模式与格赖斯准则违反有关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17686 2026-07-14 cs.LG cs.AI 版本更新 73%

BRIDGE: Bridging Reasoning In Distillation Gap Elimination via Structure-Aware Masking

通过结构感知掩码和GRPO实现高效的链式推理知识蒸馏课程学习

Bowen Yu, Sheng Zhang, Binhao Wang, Yi Wen, Jingtong Gao, Bowen Liu, Zimo Zhao, Shanshan Ye, Wanyu Wang, Maolin Wang, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 通过结构感知掩码和GRPO实现高效的链式推理知识蒸馏,提升学生模型的准确率和输出简洁性。

Comments 14 pages, 13 figures. Accepted at SDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21545 2026-07-07 cs.LG cs.AI 73%

Evidence for Limited Metacognition in LLMs

对大语言模型有限元认知能力的证据

Christopher Ackerman

专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出评估大语言模型元认知能力的新方法,发现前沿模型在事实和推理问题上的自信心评估和预测能力有限,且与人类存在显著差异。

Comments 26 pages, 25 figures

Journal ref The Fourteenth International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01490 2026-07-03 cs.LG cs.AI 新提交 73%

Don't Let Gains FADE: Breaking Down Policy Gradient Weights in RL

不要让收益消失:解析强化学习中的策略梯度权重

Juliette Decugis, Sean O'Brien, Francis Bach, Gabriel Synnaeve, Taco Cohen

机构 * FAIR at Meta(Meta FAIR) Inria, Ecole Normale Supérieure(法国国家信息与自动化研究所,巴黎高等师范学院) University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出FADE方法,通过动态调整优势函数的正负和难度权重,解决RL训练不稳定和多样性崩溃问题,在7B和32B模型上分别提前20k和2k步达到最佳pass@1。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31054 2026-07-01 cs.CV cs.AI cs.CL cs.MM 新提交 73%

ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs

ADAPT: 通过偏好调优实现注意力动态对齐以增强多模态大模型的忠实性

Zhiyuan Yao, Zheren Fu, Zhixiao Zheng, Jiajun Li, Yi Tu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies Ltd.(华为技术有限公司) State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民网传播内容认知国家重点实验室)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大模型生成中的幻觉问题,提出ADAPT框架,通过跨注意力视觉锚点、注意力监督推理和视觉注意力引导DPO直接干预文本到图像的跨注意力动态,在多个基准上将幻觉率降低40%-60%。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06734 2026-07-01 cs.LG cs.AI 版本更新 73%

Corruption Robust Offline Reinforcement Learning with Human Feedback

具有人类反馈的鲁棒离线强化学习

Debmalya Mandal, Andi Nika, Parameswaran Kamalaruban, Adish Singla, Goran Radanović

机构 * University of Warwick(华威大学) Max-Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Independent Researcher(独立研究员)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究离线环境下人类反馈强化学习的数据鲁棒性,提出基于置信集和悲观策略的鲁棒方法,首次提供可证明的鲁棒性保证。

Comments Updated Algorithm 1 and the Proof of Theorem 3.3

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26057 2026-06-25 cs.AI cs.CR cs.LG 新提交 73%

The Unfireable Safety Kernel: Execution-Time AI Alignment for AI Agents and Other Escapable AI Systems

不可解雇的安全内核:面向AI代理及其他可逃逸AI系统的执行时AI对齐

Seth Dobrin, Łukasz Chmiel

机构 * ARYA Labs PBC

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出一种架构性控制机制“不可解雇的安全内核”,通过进程隔离、前置强制、故障关闭和外部验证四个属性实现执行时AI对齐,在可逃逸AI系统中阻止逃逸尝试。

Comments Pre-print submitted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21413 2026-06-23 cs.CL cs.LG 新提交 73%

CAT-Translate: Building Compact Open-Source Models for Japanese-English Translation

CAT-Translate: 构建用于日英翻译的紧凑型开源模型

Yuu Jinnai

机构 * CyberAgent

专题命中 后训练与偏好优化 :language model(abstract);small language model(abstract);分类 cs.CL、cs.LG

AI总结 针对特定语言对开发专用翻译模型是否值得?本文通过两阶段监督微调和多目标GRPO训练紧凑型模型(0.8B-7B参数),在真实场景基准上超越大型多语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19327 2026-06-18 cs.AI cs.CL 新提交 73%

Rethinking Reward Supervision: Rubric-Conditioned Self-Distillation

重新思考奖励监督:基于评分准则的自蒸馏

Siyi Gu, Jialin Chen, Sophia Zhou, Arman Cohan, Rex Ying

机构 * Yale University(耶鲁大学)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 提出评分准则条件自蒸馏框架,通过结构化细粒度反馈指导推理模型,在科学推理基准上平均超越GRPO 1.0分、OPSD 0.9分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18831 2026-06-18 cs.CL cs.AI 新提交 73%

Beyond Reward Engineering: A Data Recipe for Long-Context Reinforcement Learning

超越奖励工程:长上下文强化学习的数据配方

Xiaoyue Xu, Sikui Zhang, Xiaorong Wang, Xu Han, Chaojun Xiao

机构 * OpenBMB Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一种简单有效的数据配方,结合最小化基于结果的GRPO设置,显著提升大语言模型的长上下文推理能力,在多个基准和智能体任务上取得平均+3.2至+7.2点的提升。

Comments 15 pages, 6 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15134 2026-06-16 cs.CV cs.AI cs.LG 新提交 73%

Beyond Scalar Distances: Semantic Attribute Gradients from Frozen MLLMs for Visual Embeddings

超越标量距离:来自冻结MLLM的语义属性梯度用于视觉嵌入

Shubhang Bhatnagar, Dheeraj Baiju, Narendra Ahuja

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出SAGA框架,利用冻结的多模态大语言模型(MLLM)通过GRPO奖励机制为视觉编码器提供属性级监督,替代传统标量距离,提升零样本图像检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07678 2026-06-16 cs.LG cs.AI 新提交 73%

DOG-DPO:Dynamic Optimization in Geometry for Safety Alignment

DOG-DPO:几何中的动态优化用于安全对齐

Yi Nian, Tiankai Yang, Yudi Zhang, Qi Pan, Zelong Xu, Shenzhe Zhu, Qingqing Luan, Yue Huang, Xiangliang Zhang, Yue Zhao

机构 * University of Southern California(南加州大学) Iowa State University(爱荷华州立大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) UT Austin(德克萨斯大学奥斯汀分校) Independent Researcher(独立研究员) University of Notre Dame(圣母大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出DOG-DPO框架,将偏好对表示为模型表示空间中的方向,通过几何分解和多样性覆盖选择子集,仅用11%数据即可恢复大部分安全增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10768 2026-06-10 cs.LG cs.CL 新提交 73%

N-GRPO: Embedding-Level Neighbor Mixing for Enhanced Policy Optimization

N-GRPO:嵌入级邻居混合增强策略优化

Xukun Zhu, Hang Yu, Peng Di, Linchao Zhu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对大语言模型数学推理中探索策略的折衷问题,提出N-GRPO方法,通过语义邻居混合机制在嵌入层注入多样性,在保持语义一致性的同时提升策略优化效果。

Comments ACL 2026 Findings. 16 pages, 3 figures. Code: https://github.com/ZJUSCL/N-GRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10184 2026-06-10 cs.LG cs.AI 新提交 73%

Dropout-GRPO: Variational Stochasticity for Continuous Latent Reasoning

Dropout-GRPO: 用于连续潜在推理的变分随机性

Wooil Jung

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 后训练与偏好优化 :LLM(abstract_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 针对GRPO在连续潜在推理模型中因确定性轨迹导致优势为零的问题,提出通过结构化Dropout引入随机性,使GRPO能优化贝叶斯模型平均策略,在GSM8K上提升Coconut基线准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10321 2026-06-10 cs.LG cs.AI cs.RO math.OC 新提交 73%

Baseline-Free Policy Optimization for Neural Combinatorial Optimization

无基线的神经组合优化策略优化

Carlos S. Sepúlveda, Gonzalo A. Ruz

机构 * Facultad de Ingeniería y Ciencias, Universidad Adolfo Ibáñez(阿道夫·伊瓦涅斯大学工程与科学学院) Dirección de Programas, Investigación y Desarrollo, Armada de Chile(智利海军计划、研究与发展局) Millennium Nucleus for Social Data Science (SODAS)(千禧年社会数据科学核心(SODAS)) Millennium Nucleus in Data Science for Plant Resilience (PhytoLearning)(千禧年植物韧性数据科学核心(PhytoLearning))

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出使用GRPO算法消除神经组合优化中的基线依赖,避免训练崩溃,在TSP和CVRP上达到接近POMO的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01619 2026-06-09 cs.AI cs.LG stat.ML 版本更新 73%

ReSkill: Reconciling Skill Creation with Policy Optimization in Agentic RL

ReSkill:在智能体强化学习中协调技能创建与策略优化

Zelin He, Haotian Lin, Boran Han, Wei Zhu, Haoyang Fang, Bernie Wang, Xuan Zhu, Runze Li, Matthew Reimherr

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出ReSkill框架,通过GRPO的组结构嵌入断言驱动技能创建、组内轨迹采样和自适应汤普森采样,实现技能与策略的协同进化,在多个领域超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23286 2026-06-09 cs.CV cs.AI cs.LG 版本更新 73%

VideoGPA: Distilling Geometry Priors for 3D-Consistent Video Generation

VideoGPA: 通过几何先验知识蒸馏实现3D一致的视频生成

Hongyang Du, Junjie Ye, Xiaoyan Cong, Runhao Li, Jingcheng Ni, Aman Agarwal, Zeqi Zhou, Zekun Li, Randall Balestriero, Yue Wang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 后训练与偏好优化 :foundation model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 VideoGPA通过几何先验知识蒸馏提升视频生成的3D一致性,利用数据高效的自监督框架引导视频扩散模型,显著增强时间稳定性、几何合理性与运动一致性。

Comments 8 pages, 5 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03382 2026-06-08 cs.LG cs.AI 版本更新 73%

Local Guidance, Global Impact: Gaussian-Reshaped Trust Region Unlocks Behavior Transitions

局部引导,全局影响:高斯重塑信任区域解锁行为转变

Bingxu Liu, Jiashun Liu, Johan Obando-Ceron, Hao Wang, Runze Liu, Pablo Samuel Castro, Aaron Courville, Ling Pan

机构 * Hong Kong University of Science and Technology(香港科技大学) Mila - Québec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学) Fudan University(复旦大学) City University of Hong Kong(香港城市大学)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 针对PPO在非平稳环境中优化失效的问题,提出高斯信任区域策略优化(GTR),通过高斯核重塑信任区域实现非单调约束,在保持局部稳定性的同时允许必要的大幅策略更新,并在多种任务中取得强性能。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08097 2026-06-08 cs.CL cs.LG 版本更新 73%

AdaJudge: Adaptive Multi-Perspective Judging for Reward Modeling

AdaJudge: 自适应多视角评判用于奖励建模

Yongliang Miao, Yangyang Liang, Mengnan Du

机构 * Emory University(埃默里大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出AdaJudge框架,通过门控精化块和自适应多视角池化模块,联合优化表示与聚合,解决奖励建模中静态归纳偏差和表示不匹配问题,在RM-Bench和JudgeBench上超越现有模型。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14230 2026-06-02 cs.CL cs.AI cs.HC 73%

MASCOT: Towards Multi-Agent Socio-Collaborative Companion Systems

MASCOT: 迈向多智能体社会协作伴侣系统

Yiyang Wang, Yiqiao Jin, Alex Cabral, Josiah Hester

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对多智能体系统中的人格崩溃和社会谄媚问题,提出MASCOT框架,通过双层优化策略(人格感知行为对齐与协作对话优化)提升角色一致性和对话贡献。

Comments 15 pages, 9 figures. https://hello-diana.github.io/MASCOT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30758 2026-06-01 cs.CL cs.LG 73%

Pairwise Reference Alignment as a Model-Level Ordinal Observable

成对参考对齐作为模型级序数可观测量

Mujing Li

机构 * Independent Researcher(独立研究者)

专题命中 后训练与偏好优化 :instruction tuning(abstract);preference optimization(abstract);分类 cs.CL、cs.LG

AI总结 本文定义成对参考对齐为模型评分函数诱导的序数可观测量,提出中心化序参数统计量和基于边界的扩展,并给出有限样本估计和浓度界,通过Qwen2.5和RewardBench实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30447 2026-06-01 cs.LG cs.AI stat.ML 73%

Calibrated Preference Learning: The Case of Label Ranking

校准偏好学习:以标签排序为例

Santo M. A. R. Thies, Viktor Bengs, Timo Kaufmann, Sebastian J. Vollmer, Eyke Hüllermeier

机构 * Munich Center for Machine Learning, Munich (MCML), Germany(慕尼黑机器学习中心,慕尼黑(MCML),德国)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 针对概率标签排序问题,形式化定义了校准概念并建立层次体系,通过理论证明和实验验证了不同校准概念的关系及现有模型的校准缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29886 2026-05-29 cs.CL cs.AI 73%

CRITIC-R1: Learning Structured Critics for Retrieval-Augmented Generation

CRITIC-R1: 学习结构化评论用于检索增强生成

Wenhan Xiao, Ziwei Zhang, Chuanyue Yu, Xingcheng Fu, Qingyun Sun, Runhua Xu, Jianxin Li

机构 * Nankai University(南开大学) Beihang University(北航) Guangxi Normal University(广西师范大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出CRITIC-R1框架,通过强化学习将RAG评论建模为结构化错误诊断问题,设计保守判断对齐和诊断质量对齐奖励函数,提升检索增强生成的答案质量。

Comments 17 pages,13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29860 2026-05-29 cs.LG cs.AI 73%

ESPO: Early-Stopping Proximal Policy Optimization

ESPO:早期停止的近端策略优化

Zihang Li, Rui Zhou, Yingcheng Shi, Wenhan Yu, Zhewen Tan, Zixiang Liu, Zeming Li, Binhua Li, Yongbin Li, Tong Yang, Jieping Ye

机构 * Tongyi Lab(通义实验室) Alibaba Group(阿里巴巴集团) Peking University(北京大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出ESPO算法,通过在强化学习训练大语言模型时在线检测轨迹失败并提前终止,节省计算资源并提升数学推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12642 2026-05-29 cs.CL cs.AI 73%

Beyond Normalization: Rethinking the Partition Function as a Difficulty Scheduler for RLVR

超越归一化:重新审视配分函数作为RLVR的难度调度器

Dohyung Kim, Minbeom Kim, Jeonghye Kim, Sangmook Lee, Sojeong Rhee, Kyomin Jung

机构 * Seoul National University(首尔国立大学)

专题命中 后训练与偏好优化 :LLM(abstract_cn);post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PACED-RL框架,通过重新解释配分函数作为每提示期望奖励信号,利用其指导训练中的问题选择与重放,在保持生成多样性的同时提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25252 2026-05-28 cs.LG cs.AI 73%

Quantifying Empirical Compute-Supervision Tradeoffs in RLVR

量化 RLVR 中计算与监督的实证权衡

Ryo Mitsuhashi, Patrick Chen, Isabelle Tseng, Jasin Cekinmez, Addison J. Wu

机构 * Princeton University(普林斯顿大学)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 通过 GSM8K 上的 GRPO 实验,研究验证器噪声对 RLVR 的影响,发现计算扩展无法弥补监督噪声,且假阴性比假阳性危害更大。

Comments Workshop on Combining Theory and Benchmarks @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16358 2026-05-28 cs.LG cs.CL 73%

SaFeR-Steer: Evolving Multi-Turn MLLMs via Synthetic Bootstrapping and Feedback Dynamics

SaFeR-Steer:通过合成引导和反馈动力学进化多轮多模态大语言模型

Haolong Hu, Hanyu Li, Tiancheng He, Huahui Yi, An Zhang, Qiankun Li, Kun Wang, Yang Liu, Zhigang Zeng

机构 * Huazhong University of Science and Technology(华中科技大学) Beijing University of Posts and Telecommunications(北京邮电大学) West China Biomedical Big Data Center, Sichuan University(四川大学西部生物医学大数据中心) School of Public Policy and Administration, Chongqing University(重庆大学公共政策与管理学院) Nanyang Technological University(南洋理工大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 提出SaFeR-Steer框架,通过分阶段合成引导和导师参与的GRPO训练单学生模型,并引入轨迹一致总结奖励(TCSR)以解决多轮安全对齐中的长上下文安全衰减问题,显著提升多轮安全性和有用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22511 2026-05-27 cs.AI cs.CL cs.IR 73%

Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented Reasoning

Search-E1: 自蒸馏驱动搜索增强推理中的自我进化

Zihan Liang, Yufei Ma, Ben Chen, Zhipeng Qian, Xuxin Zhang, Huangyu Dai, Lingtao Mao

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 提出Search-E1方法,通过交替使用普通GRPO和在线策略自蒸馏(OPSD),让搜索增强智能体无需外部监督或复杂模块即可自我进化,在七个QA基准上以3B模型超越所有开源基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26315 2026-05-27 cs.LG cs.AI 73%

Curriculum Learning for Safety Alignment

用于安全对齐的课程学习

Sandeep Kumar, Virginia Smith, Chhavi Yadav

机构 * Carnegie Mellon University(卡内基梅隆大学) Simons Institute, UC Berkeley(Simons研究所,伯克利大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出基于课程学习的Staged-Competence框架,通过难度分级的偏好数据和渐进式参考模型更新,提升DPO安全对齐的鲁棒性,在三个模型族上平均降低16%的OOD有害响应率和20%的越狱攻击成功率。

Comments Accepted at the ICML 2026 GlobalSouthML Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏