Contextual Information Policy Optimization for Search Agents
面向搜索智能体的上下文信息策略优化
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对现有搜索智能体方法存在的先验驱动推理问题,提出CIPO框架,通过回合级信用分配对齐策略与证据使用,无需额外标注或奖励模型,在7个基准上性能优异。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
面向搜索智能体的上下文信息策略优化
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对现有搜索智能体方法存在的先验驱动推理问题,提出CIPO框架,通过回合级信用分配对齐策略与证据使用,无需额外标注或奖励模型,在7个基准上性能优异。
IndexTTS 2.5 技术报告
机构 * Bilibili Inc.(哔哩哔哩公司)
专题命中 后训练与偏好优化 :foundation model(abstract);post-training(abstract);分类 cs.AI
AI总结 IndexTTS 2.5通过四方面改进提升了多语言支持、推理速度和合成质量,实现了更广泛的语言覆盖和情感语调复制。
Comments 11 pages, 4 figures
Themis: 训练鲁棒的多语言代码奖励模型以实现灵活的多标准评分
机构 * UKP Lab, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(UKP实验室,德累斯顿理工大学及应用网络安全国家研究中心ATHENE)
专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.LG
AI总结 本文提出Themis-CodeRewardBench基准,评估多语言多标准代码奖励模型,训练了Themis-RM系列模型,展示了其在多语言迁移和多标准训练中的优势。
MathDebugger:检测与诊断合成数学数据中的错误
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 MathDebugger是用于评估模型检测诊断合成数学数据错误的基准,含6000个标注实例,评估发现模型在该任务上表现不足,错误类型信息可提升修正效果,为数学数据质量控制提供支撑。
PAIR:面向多轮代理优化的前缀感知内部奖励模型
机构 * KAIST(韩国科学技术院) ; Yonsei University(延世大学)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出PAIR模型,通过结合冻结的隐藏状态探针和轻量级注意力头部,解决多轮任务中内部正确性探针的可靠性问题,从而在不依赖外部模型调用或地面真实依赖的情况下,为GRPO训练提供密集的步骤级奖励信号。
Comments Under Review
具有可验证奖励的强化学习中噪声数据是破坏性的
机构 * Siebel School of Computing and Data Science, University of Illinois Urbana Champaign, USA(计算机与数据科学学院,伊利诺伊大学厄巴纳-香槟分校)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 研究指出,现有RLVR算法无法缓解噪声影响,噪声会破坏强化学习性能,真实世界噪声导致Text2SQL任务准确率下降5-12%。
Comments 16 pages, 17 figures
EmoAgent-R1:基于强化学习的动态智能体专业化实现多模态情感理解
机构 * Guangdong University of Technology(广东工业大学) ; Southern University of Science and Technology(南方科技大学) ; Xi’an Jiaotong University(西安交通大学) ; Guizhou Provincial Laboratory of Big Data, State Key Laboratory of Public Big Data, Guizhou University(贵州大学大数据省级重点实验室、公共大数据国家重点实验室)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对现有多模态情感识别方法忽视情感源动态性和复杂性的问题,提出基于强化学习的动态智能体专业化框架EmoAgent-R1,采用冷启动策略和两步智能体工作流程训练,并用P-GRPO优化,实验证明其在情感推理性能和优化稳定性上更优。
AGG:用于扩散模型高效GRPO训练的雅可比聚合组梯度
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 研究GRPO扩展到扩散模型的计算瓶颈问题,提出JAGG方法,通过特定插值和聚合梯度,减少反向传播次数,实验表明该方法能在质量损失小的情况下显著加速T2I训练中的DiT RL训练。
Comments 21 pages
PISmith: 基于强化学习的提示注入防御红队测试
机构 * The Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.LG
AI总结 本文提出PISmith框架,通过强化学习评估现有提示注入防御的鲁棒性,发现标准GRPO在攻击强防御时表现不佳,引入自适应熵正则化和动态优势加权以提升探索能力,实验表明最新防御仍易受适应性攻击影响。
Comments To appear in COLM 2026
Agents-K1:迈向智能体原生的知识编排
机构 * PJLab(上海人工智能实验室)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 提出Agents-K1管道,将原始文档转化为智能体原生科学知识图谱,通过多模态解析器、GRPO训练的4B信息抽取骨干和三源智能体接口,实现科学信息抽取、知识图谱构建和多跳推理。
策略改进强化学习
机构 * Beihang University(北航) ; Peking University(北京大学)
专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);分类 cs.LG
AI总结 提出策略改进强化学习(PIRL)框架,通过最大化跨迭代的累积策略改进来替代替代奖励最大化,并基于此设计策略改进策略优化(PIPO)算法,实现闭环优化,在数学推理基准上提升稳定性和性能。
Shepherd: 一个为元代理提供形式化执行迹的运行时基座
机构 * Northeastern University(东北大学) ; Stanford University(斯坦福大学)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 提出Shepherd,一个基于函数式编程的Python运行时基座,将代理执行作为一等对象,通过类似Git的执行迹支持元代理的检查、分叉和重放,在三个用例中显著提升性能。
Comments 50 pages, 22 figures, 14 tables
内省意识的机制
机构 * Anthropic Fellows Program(Anthropic Fellow项目) ; MIT(麻省理工学院) ; Constellation ; Anthropic
专题命中 后训练与偏好优化 :post-training(abstract);preference optimization(abstract);分类 cs.LG
AI总结 研究揭示了大语言模型在检测注入的转向向量时的内省意识机制,发现其行为稳健且源于训练后阶段,通过两阶段电路实现,且在不同层间机制存在差异。
混合饮食使DINO成为杂食视觉编码器
机构 * Google DeepMind(谷歌DeepMind) ; University College London(伦敦大学学院)
专题命中 后训练与偏好优化 :foundation model(abstract);post-training(abstract);分类 cs.AI
AI总结 针对DINOv2等预训练视觉编码器在不同视觉模态间特征对齐差的问题,提出杂食视觉编码器,通过后训练框架学习模态无关特征空间,实现跨模态鲁棒理解。
Comments CVPR 2026 Highlight
ACTIVE-o3:通过纯强化学习赋予多模态大语言模型主动感知能力
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出ACTIVE-o3框架,基于GRPO强化学习,通过模块化感知-动作设计和双形式奖励,使MLLM自主学会高效准确的区域选择策略,在开放世界和领域特定任务中显著提升主动感知能力。
Comments Accepted to ICML 2026. Project page: https://aim-uofa.github.io/ACTIVE-o3
Qwen-音乐技术报告
机构 * Qwen Team(通义团队)
专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract)
AI总结 介绍Qwen-音乐,它支持文本到音乐生成和翻唱歌曲生成两个核心任务。集成三个核心组件,通过特定机制建模并渲染。经多语言数据训练及多种训练方式,在多个音乐性和音频质量指标上达领先成果,获专业评估人员青睐。
人工智能对齐放大了种族、性别和残疾在招聘决策中的作用
专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)
AI总结 研究探讨语言模型在招聘决策中是否使用人口统计数据,发现对女性和黑人候选人有优势,对残疾候选人有劣势,且对齐过程放大了这些差异。
VGGRPO:迈向世界一致的视频生成的4D潜在奖励
机构 * Google(谷歌) ; University of Oxford(牛津大学) ; CREST-ENSAE, Institut Polytechnique de Paris(巴黎综合理工学院CREST-ENSAE) ; University of Copenhagen(哥本哈根大学)
专题命中 后训练与偏好优化 :foundation model(abstract);post-training(abstract)
AI总结 VGGRPO通过引入4D潜在几何模型和组相对策略优化,提升视频生成的几何一致性与稳定性,避免VAE解码的高计算开销。
Comments Accepted at ECCV 2026. Project Page: https://zhaochongan.github.io/projects/VGGRPO
EvoGuard: 一种基于代理强化学习的可扩展框架,用于实际和演化的AI生成图像检测
机构 * The University of Tokyo(东京大学) ; National Institute of Informatics(国家信息研究所)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)
AI总结 本文提出EvoGuard框架,利用多模态大语言模型和非MLLM检测器,通过能力感知的动态编排机制实现高效AIGI检测,优化后无需细粒度标注,实验表明其在准确性和可扩展性上均达最优。
Comments Template changed
Starve to Perceive: 通过受限视觉带宽驯服VLMs中的懒惰感知
机构 * Hong Kong University of Science and Technology(香港科学与技术大学) ; Technology University of Waterloo(滑铁卢大学)
专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)
AI总结 本文提出了一种新的训练方法,通过限制视觉带宽迫使视觉语言模型主动感知,从而提升其在高分辨率视觉环境中的表现。
MIND-V:基于强化学习物理对齐的长期机器人操作分层世界模型
机构 * Tsinghua University(清华大学) ; X Square Robot(X Square机器人) ; Sun Yat-sen University(中山大学) ; HKUST(香港科技大学)
专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)
AI总结 提出MIND-V分层世界模型,通过语义推理、行为语义桥接和运动视频生成,结合强化学习物理对齐,实现长期机器人操作视频的物理合理合成。
导航对齐-校准权衡:通过模型合并实现帕累托更优前沿
机构 * University of Cambridge(剑桥大学)
专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文发现后训练对齐不仅降低任务准确率,还严重损失校准性能,导致模型过度自信且输出多样性下降。通过简单地在对齐前后模型权重间进行插值,可以持续获得帕累托最优模型,同时提升准确率和恢复校准。
Comments ACL 2026 Findings
PRInTS:面向长程信息检索的奖励建模
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出PRInTS生成式过程奖励模型,通过密集评分和轨迹摘要提升长程信息检索中工具交互与推理能力,在多个基准上超越前沿模型。
Comments ACL 2026, 19 pages, code: https://github.com/G-JWLee/PRInTS
μ子何时有助于智能体强化学习?
专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG
AI总结 研究μ子在稀疏奖励智能体强化学习中的作用,通过与AdamW对比,发现在组内组策略优化下,μ子应用于隐藏权重矩阵能提升成功率,效果与优势估计器、学习率有关,表明其可使智能体RL受益,还需多种子和跨任务验证。
小型模型是GRPO中策略级多样性的自然探索者
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 后训练与偏好优化 :LLM(abstract_cn);分类 cs.AI、cs.LG
AI总结 提出S2L-PO框架,利用小型模型作为自然探索者生成策略级多样性的rollout,通过渐进退火策略过渡到大型模型自身采样,提升数学推理性能并减少计算开销。
TOPReward: 令牌概率作为机器人学中的隐式零样本奖励
机构 * University of Washington(华盛顿大学) ; Allen Institute for AI(人工智能研究所) ; Amazon(亚马逊) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG
AI总结 TOPReward通过利用预训练视频视觉-语言模型的令牌概率,提供高效的零样本奖励估计,显著提升机器人任务进度评估的性能和泛化能力。
循环循环者!
专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL、cs.AI
AI总结 研究提出最强大的循环Transformer——Loopie,由两个专家混合模型组成。它应对了循环Transformer面临的挑战,经消融研究表明在相同计算预算下优于普通基线,其训练后管道赋予强大推理能力,在竞赛中无需工具获金牌。
基于噪声声明验证的覆盖控制偏好挖掘用于基于证据的生成
机构 * Vanderbilt University(范德比大学) ; Vanderbilt University Medical Center(范德比大学医学中心) ; Lirio ; Virginia Tech(弗吉尼亚理工大学)
专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.CL、cs.LG
AI总结 研究临床简要医院病程总结中基于证据生成的问题,引入VERI-DPO框架,将噪声声明验证转化为覆盖控制的摘要级偏好,经实验验证该框架能降低不支持率,提升模型表现。
Comments 15 pages, 1 figure, 8 tables. Major revision with locked MIMIC-IV transfer evaluation, blinded pairwise human assessment, matched multi-seed ablations, revised title, and revised author list
GIPO:高斯重要性采样策略优化
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出了一种基于截断重要性采样的策略优化目标GIPO,通过使用基于对数比率的高斯信任权重替代硬裁剪,以软化极端重要性比率同时保持非零梯度,从而提高数据效率,实验表明GIPO在多种回放缓冲区大小下均取得最佳性能,表现出优越的偏差-方差权衡、高训练稳定性及改进的样本效率。
ICR-RL:通过上下文回归实现深度强化学习
机构 * Bar-Ilan University(巴伊兰大学) ; Tel Aviv University(特拉维夫大学)
专题命中 后训练与偏好优化 :foundation model(abstract);分类 cs.AI、cs.LG
AI总结 研究探索基于从强化学习到回归的经典简化的新方法,用预训练的回归基础模型作为上下文回归模型直接用于强化学习问题,引入无梯度方法ICR-RL,实验表明其能与常用方法竞争。
Comments Accepted to ICML 2026 Main Track