The Power of Test-Time Training for Approximate Sampling
测试时训练对近似采样的威力
机构 * Microsoft Research NYC(微软研究院纽约分校) ; MIT(麻省理工学院)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文形式化测试时训练(TTT)为从已知分布类中采样的问题,证明查询复杂度的二次下界,并展示在分布类大小受限时可规避该下界,为TTT提供理论框架。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
测试时训练对近似采样的威力
机构 * Microsoft Research NYC(微软研究院纽约分校) ; MIT(麻省理工学院)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文形式化测试时训练(TTT)为从已知分布类中采样的问题,证明查询复杂度的二次下界,并展示在分布类大小受限时可规避该下界,为TTT提供理论框架。
梯度引导的推理时对齐奖励优化
机构 * Purdue University(普渡大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 提出梯度引导奖励优化(GGRO)方法,通过解码时注入梯度信号生成的引导令牌,在推理时微调生成轨迹,提升安全性、有用性和推理性能,并增强对奖励攻击的鲁棒性。
Comments Accepted to UAI 2026
通过对抗性黑客-修复者循环强化智能体基准测试
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Fewshot Corp(Fewshot公司) ; Independent Researcher(独立研究员)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 提出黑客-修复者循环方法,通过LLM代理交替攻击和修补验证器,自动生成抗利用的验证器,将KernelBench攻击成功率从62%降至0%。
基于去噪反馈的强化学习
机构 * Fudan University(复旦大学) ; Ant Group(蚂蚁集团) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 提出RLDF方法,利用去噪反馈进行策略损失估计,通过优化中间噪声状态到裁剪干净状态并结合加权时间步采样,在扩散语言模型上提升性能和泛化性。
一种动态自演化抽取系统
机构 * Megagon Labs(Megagon实验室)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 提出DySECT系统,通过LLM抽取三元组构建知识库,结合概率知识和图推理丰富知识,再反馈优化抽取器,形成闭环持续提升。
MusaCoder: 在摩尔线程GPU上通过全栈训练实现原生GPU内核生成
机构 * Moore Threads AI
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG
AI总结 提出MusaCoder全栈训练框架,结合渐进式数据合成、多样性保持拒绝微调和基于执行反馈的强化学习,在CUDA和MUSA后端上生成高效原生GPU内核,9B模型匹配前沿闭源模型,27B模型达到新最优。
SaliMory: 为对话代理编排认知记忆
机构 * Meta Reality Labs(Meta现实实验室)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出SALIMORY框架,通过层级阶段过程奖励和奖励分解对比优化,端到端训练单一语言模型管理认知结构记忆,显著降低记忆相关错误并提升个性化表现。
Traj-Evolve:用于肺癌早期检测中患者轨迹建模的自进化多智能体系统
机构 * University of Washington(华盛顿大学) ; Fred Hutch Cancer Center(Fred Hutch癌症中心) ; Google(谷歌)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出Traj-Evolve,一种结合经验池和多智能体强化学习的自进化多智能体系统,通过检索相似患者和参数优化,在肺癌早期检测中优于9个强基线模型。
PR2: 基于MoE的大语言模型强化学习中的预测性路由重放
机构 * Rutgers University(罗格斯大学) ; AMD ; MBZUAI
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 针对MoE大语言模型强化学习中路由器漂移导致的不稳定性问题,提出预测性路由重放方法,通过轻量级演化预测器减少路由不匹配,提升训练稳定性和性能。
内化温度:面向强化学习的同策略自蒸馏作为策略加热器
机构 * Tsinghua University(清华大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 提出温度缩放同策略自蒸馏(TS-OPSD),通过将温度探索效应内化到模型参数中,缓解强化学习中的熵崩溃问题,无需外部教师或额外推理成本。
GRPO 秘密地是一个过程奖励模型
机构 * Department of Language Science ; Technology, Saarland Informatics Campus, Saarland University, Saarbr \"u cken, Germany
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文理论证明,使用结果奖励模型的 GRPO 强化学习算法等价于一个基于蒙特卡洛的过程奖励模型,并发现其缺陷,提出 λ-GRPO 改进,在推理任务上提升性能。
Comments 16 pages, 9 figures; accepted at ICML 2026
基于评分准则的逐步模型路由过程奖励
机构 * University of Science and Technology of China(中国科学技术大学) ; Southeast University(东南大学) ; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出RoRo框架,通过收集路由轨迹、构建偏好对、训练Rubricor生成评估准则和Judge评分,结合过程与结果奖励优化路由策略,提升大型推理模型逐步路由的准确性和成本效率。
Comments 17 pages, 9 figures, submitted to EMNLP 2026
无标签强化学习:跨模型熵方法
机构 * Independent Researcher(独立研究者) ; San Diego State University(圣地亚哥州立大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 提出跨模型熵(CME)作为无标签奖励信号,用于强化学习后训练大语言模型,在开放指令遵循任务上优于基线方法。
Soft-SVeRL: 基于软奖励的自验证强化学习
机构 * Cohere Labs(Cohere实验室)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG
AI总结 针对部分可验证任务,提出基于检查表分解的软奖励框架Soft-RLVR及其自验证变体Soft-SVeRL,通过密集部分信用信号提升强化学习训练效果,并解决自验证中的奖励膨胀问题。
通过边际锐化实现自一致性
机构 * Criteo AI Lab(Criteo AI实验室) ; CREST IP Paris(巴黎CREST研究所) ; ENSAE, Institut Polytechnique de Paris(巴黎理工学院ENSAE)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 提出一种自回归并行采样算法,通过锐化答案边际分布而非完整输出分布,在数学和编程基准上优于标准功率采样且速度更快。
量化 RLVR 中计算与监督的实证权衡
机构 * Princeton University(普林斯顿大学)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 通过 GSM8K 上的 GRPO 实验,研究验证器噪声对 RLVR 的影响,发现计算扩展无法弥补监督噪声,且假阴性比假阳性危害更大。
Comments Workshop on Combining Theory and Benchmarks @ ICML 2026
SelfJudge: 通过自监督验证器加速推测解码
机构 * Efficient AI ; Large Language Model(大型语言模型) ; Speculative Decoding(推测解码)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI
AI总结 提出SelfJudge方法,利用目标模型的自监督训练验证器,通过评估令牌替换后响应的语义保持性来加速推测解码,实现更优的推理-准确率权衡。
Journal ref ICML 2026
自验证蒸馏:你的语言模型秘密地就是它自己的合成数据管道
机构 * Stanford University(斯坦福大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 提出自验证蒸馏算法,让大语言模型仅用无标注种子问题,通过自生成、自验证和自训练提升推理能力,在数学、科学和编程任务上取得显著提升。
自主AI代理在供应链管理中的可靠性与有效性
机构 * Harvard University(哈佛大学) ; MIT/Purdue(麻省理工学院/普渡大学) ; MIT(麻省理工学院) ; Harvard University/Kempner Institute(哈佛大学/凯普勒研究所) ; Georgia Tech(佐治亚理工学院)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文通过MIT啤酒游戏研究多级供应链中的自主生成式AI代理,发现模型能力是性能主导因素,但平均性能掩盖可靠性风险,并引入代理牛鞭效应,提出基于GRPO的后训练框架以提高可靠性。
通过全循环Transformer简单稳定循环
机构 * Hong Kong Baptist University(香港 Baptist 大学) ; Jilin University(吉林大学)
专题命中 测试时计算 :test-time compute(abstract);分类 cs.AI、cs.LG
AI总结 针对循环Transformer在迭代次数增加时出现的训练不稳定性,提出全循环Transformer,通过全循环架构和注意力注入两种无参数修改,稳定训练至12次循环,下游任务性能提升最高13.2%。
vAttention: 验证的稀疏注意力
机构 * Electrical Engineering and Computer Sciences, University of California, Berkeley(加州大学伯克利分校电气工程与计算机科学系)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出vAttention,通过统一top-k和随机采样,实现首个具有用户指定(ε, δ)近似精度保证的实用稀疏注意力机制,显著提升质量-效率权衡。
Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026
召唤神谕以屠之:利用大语言模型缓解金融回测中的前瞻偏差
机构 * University of Edinburgh(爱丁堡大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出FinCAD方法,通过对抗性偏差发现和实体日期自适应规则,在不重新训练的情况下抑制大语言模型对历史结果的记忆,从而缓解金融回测中的参数化前瞻偏差。
ECHO: 终端代理免费学习世界模型
机构 * Microsoft Research(微软研究院)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG
AI总结 提出ECHO混合目标,通过预测环境观测令牌将终端反馈转化为密集监督信号,显著提升CLI代理在TerminalBench-2.0上的性能。
EchoDistill:面向鲁棒音频大语言模型的噪声到干净自蒸馏对齐
机构 * NTU(国立台湾大学) ; SHU(上海大学) ; ICT, CAS(中国科学院信息科技研究院) ; HDU(华中科技大学) ; BUPT(北京邮电大学) ; USTC(中国科学技术大学) ; SKL-NST, BUPT(北京邮电大学国家智能计算研究中心)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出EchoDistill框架,通过冻结的干净音频教师模型指导噪声学生模型进行组相对策略优化,实现噪声到干净的自蒸馏对齐,提升音频大语言模型在复杂噪声下的语义可靠性和任务性能。
R$^3$L: 反思-重试强化学习与语言引导探索、关键信用和正向放大
机构 * Tongyi Lab(通义实验室) ; Soochow University(苏州大学) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出R$^3$L框架,通过反思-重试机制合成高质量轨迹,结合关键信用分配和正向放大,解决强化学习在LLM推理和智能体任务中的探索与利用难题,在多个任务上取得5%到52%的相对提升。
超越一刀切:基于大语言模型的零样本图学习中的自适应子图去噪
机构 * JIUTIAN Research(JIUTIAN研究) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; MIIT Key Laboratory of Data and Decision Intelligence(信息与决策智能重点实验室) ; Beihang University(北航)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出GraphSSR框架,通过自适应子图提取和去噪方法,解决传统图神经网络在零样本学习中泛化能力不足的问题,提升大语言模型在图推理任务中的表现。
通过微分测试时间缩放进行代码生成
机构 * University of California, Davis(加州大学戴维斯分校)
专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出DiffCodeGen,一种基于覆盖引导的微分分析的代码生成方法,通过生成多样化的代码候选并利用覆盖引导模糊测试来合成输入,无需现有测试用例或大语言模型,从而提高效率和可扩展性。
Comments 16 main text, 21 pages with references
计算对齐训练:优化测试时间推断
机构 * Department of Statistics(统计学系) ; University of Michigan(密歇根大学)
专题命中 测试时计算 :test-time compute(abstract);分类 cs.AI、cs.LG
AI总结 本文提出计算对齐训练方法,通过将训练目标与测试时间策略对齐,提升大语言模型在测试时的推断性能。
不要让多臂老虎机反馈将连续LLM推荐系统更新偏离目标
机构 * SK Telecom(SK电信) ; KAIST(韩国科学技术院)
专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种名为Anchored Bandit Policy Optimization (ABPO)的框架,用于持续改进基于生成式大语言模型的推荐系统,通过结合组内相对策略优化(GRPO)和显式处理曝光偏差和反馈模糊性,以减少因部署日志提供的策略形状上下文老虎机反馈导致的偏差,并提高推荐准确性。
EnvFactory: 通过可执行环境合成和鲁棒强化学习扩展工具使用智能体
机构 * LARK, HKUST (GZ)(LARK,香港科技大学(广州)) ; University of Cambridge(剑桥大学) ; UCL(伦敦大学学院) ; Huawei Technologies Co., Ltd(华为技术有限公司)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文提出EnvFactory框架,通过自动合成可执行环境和鲁棒强化学习,解决工具使用智能体扩展中的环境可扩展性和训练数据不足问题,显著提升训练效率和下游性能。
Comments 11 pages