Inference-Time Chain-of-Thought Pruning with Latent Informativeness Signals
专题命中 测试时计算 :chain-of-thought(title);reasoning(abstract,comments);分类 cs.LG
Comments Accepted by NeurIPS 2025 Workshop on Efficient Reasoning
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 测试时计算 :chain-of-thought(title);reasoning(abstract,comments);分类 cs.LG
Comments Accepted by NeurIPS 2025 Workshop on Efficient Reasoning
M2Note: 通过错误笔记本学习实现视觉语言模型的持续演化
专题命中 测试时计算 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)
AI总结 提出M2Note,一种无需训练的持续演化框架,通过将失败轨迹转化为可编辑的笔记,利用多模态检索增强生成在推理时引导模型,避免重复错误,并在多个基准上提升性能。
训练大型语言模型以并行推理与全局分叉标记
机构 * University of Toronto(多伦多大学) ; Amazon(亚马逊) ; Vector Institute(向量研究所)
专题命中 测试时计算 :reasoning(abstract);math reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出SSFT和GFPO方法,通过集合基于的损失和双射匹配,提升大型语言模型在并行推理中的多样性和准确性,从而在数学推理和代码生成任务中取得优于传统SFT的性能。
Comments Accepted at ICLR 2026
Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026), https://openreview.net/forum?id=xBQvvkg4Wc
机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; University of California, Santa Barbara(加州大学圣巴巴拉分校) ; Beijing Wenge Technology Co., Ltd(北京文格科技有限公司)
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ACL 2025 Outstanding Paper Award, 33 pages, 51 figures
Journal ref ACL.Volume 1: Long Papers (2025) 27962-27994
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 测试时计算 :reasoning(abstract);CoT(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Abstract shortened for arXiv
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Paper accepted for publication at ACL 2024 Main (Bangkok, Thailand); 10 main paper pages, 30 appendix pages
BiasTrace:将大语言模型(LLM)中的推理行为与有偏输出关联起来
机构 * University College London(伦敦大学学院) ; NVIDIA(英伟达)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 本研究提出BiasTrace标注方案,将LLM的推理行为与有偏输出关联,构建大型标注数据集,发现有偏输出多源于微妙推理行为,且该方案可提升偏见检测与推理时缓解效果。
学习幅度而非方向:面向多轮多步骤大语言模型智能体的验证器约束信用分配
专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI
AI总结 该研究提出CrEST分层信用分配框架,保留RL的验证器约束上限并结合自我教师的密集token级信号,在BFCL V3和WildToolBench上优于基线,可简化教师在策略优化中的作用。
面向大语言模型生成的GPU内核的契约级验证器,以及门控线性循环(GDN)族的原生Blackward反向传播算法
机构 * E3A Healthcare(E3A医疗公司)
专题命中 测试时计算 :verifier(title,abstract);分类 cs.LG
AI总结 本文提出契约级GPU内核验证器,发现公开系统接受的2638个机器生成内核中39.5%存在无法修复的错误,还构建了GDN族的原生Blackwell反向传播算法,指出现有内核生成正确性信号被高估。
Comments 17 pages, 3 figures. Also archived at doi:10.5281/zenodo.21563213
基于模型合并的大语言模型推荐系统高效推理研究
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 本研究针对LLM推荐系统推理冗长导致成本高的问题,提出首个用于推理压缩的注意力头级细粒度模型合并框架,在不降低推荐准确率的前提下最多缩短24.3%的推理长度。
你的模型是在思考还是停滞不前?PUMA:通过相位动量对齐诊断推理病理学
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 研究大型推理模型测试时的“过度思考”问题,提出相位动量对齐假设并构建认知能量模型,引入PUMA框架,通过分层诊断架构区分主动探索与被动停滞,在多基准实验中优于现有基线,实现更好的准确性-效率权衡和跨域泛化。
顺序是保障:基于静态优先学习提议的验证者预算代码删除
专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI
AI总结 该研究针对验证者预算有限时的AI代码删除问题,提出DELSCOUT调度方法,结合静态与学习候选排序,提升已验证删除覆盖率并控制验证器调用,明确了模型、顺序与执行的分工。
将推理痕迹提炼为软件工程任务的建议提示词
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 本文受编程学习过程启发,提出将LLM推理痕迹提炼为建议提示词的方法,可减少LLM代码错误,部分提示词还能跨模型迁移,同时明确了方法适用场景。
面向基于大语言模型(LLM)的推荐系统的分层潜在推理方法
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 本文针对基于LLM的推荐系统提出分层潜在推理框架HiLaR,通过层感知强化优化提升推荐性能,在四个Amazon基准数据集上优于多种主流基线。
基于因子图的进化感知多序列比对抽样推理
机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG
AI总结 研究针对MSA抽样在有限预算下难以控制进化信号的问题,提出将其作为优化问题,引入基于亲和传播的因子图方法AP-REASONER,通过特定因子和控制旋钮进行推理,实验表明该方法在下游任务中表现优异,能可控恢复蛋白质构象。
用于量化小语言模型推理的CUSUM形状的推理时间监测和目标重解码
机构 * Novelis Research(诺贝丽斯研究中心)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 研究量化小语言模型推理时轨迹问题,提出MGT - B方法,通过映射窗口到概率、累积因子等操作监测并响应警报,经实验得出该方法对特定设置有一定效果,支持选择性监测与修复机制。
原生主动感知作为全模态理解的推理
机构 * The Chinese University of Hong Kong(香港中文大学) ; Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学) ; Qwen Team, Alibaba Group(阿里巴巴集团Qwen团队)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 提出OmniAgent,一种基于POMDP迭代观察-思考-行动循环的原生全模态智能体,通过主动感知将推理复杂度与视频时长解耦,在多个基准上达到开源模型最优性能。
Comments Accepted at ICML 2026. Code and models: https://github.com/harryhsing/omniagent
通过概念链进行隐式推理引导
机构 * School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院) ; Department of Computer Science, University of California, Davis(加利福尼亚大学戴维斯分校计算机科学系)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 研究大语言模型推理脆弱性,提出概念链方法,通过生成连接段落继续预训练模型,使自然文本能引导模型预测,揭示推理脆弱性可被利用,为潜在偏差影响模型决策创造渠道。
EVOQUANT:用于稳健量化交易的自进化验证器引导策略优化
机构 * HKUST(GZ)(香港科技大学(广州)) ; Paradoox AI Research(悖论人工智能研究)
专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI
AI总结 研究针对量化策略优化多依赖人工且易出错的问题,提出EVOQUANT框架,利用大语言模型诊断瓶颈、生成候选编辑,经多阶段验证选最佳策略,能提炼经验持续改进,实验表明该方法有效提升夏普比率,为金融策略研究提供新途径。
交互缩放:奠定测试时计算的第三轴基础
机构 * Pine AI(松树人工智能公司) ; University of Washington(华盛顿大学)
专题命中 测试时计算 :test-time compute(title);reasoning(abstract);分类 cs.AI
AI总结 研究测试时增加计算量的新方法,提出交互缩放概念,通过模型与外部仪器交互突破传统方法局限,在硬编码任务和视觉工件处理上展现优势,表明交互缩放真实且区别于推理和采样,需反馈和度量基于实际。
用于量化推理模型的校准e-CUSUM解码:为何令牌对数概率不适用于解码监测
机构 * Novelis Research(诺贝丽斯研究公司)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 研究针对低比特量化推理模型思维链退化问题,指出用居中令牌对数概率监测解码不可行。提出结合退化感知警报分数与校准e过程检测器的解码控制器,经GSM8K实验验证其有效性及不足,给出方法层面的解释与替代方案。
潜在奖励引导:一种自适应推理时框架,隐式促进推理大语言模型中的认知行为
机构 * Rutgers University(罗格斯大学) ; South China Agricultural University(华南农业大学) ; Columbia University(哥伦比亚大学) ; Fenz.AI ; QuantaAlpha ; Adobe ; Santa Clara University(圣克拉拉大学) ; City University of Hong Kong(香港城市大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 提出潜在奖励引导(LRS)框架,通过优化稀疏自编码器潜在状态隐式促进认知行为,利用最终答案正确性训练潜在奖励模型估计中间状态质量,并在推理时提供状态特定的修正方向,实验表明该方法能提升推理性能并修复原始推理错误。
选择性左移:将测试时计算和基于难度的筛选转化为低资源代码生成的训练数据
机构 * WSO2
专题命中 测试时计算 :test-time compute(title);reasoning(abstract);分类 cs.LG
AI总结 针对低资源代码生成难题,提出三阶段管道,先将推理计算左移合成训练数据,再微调嵌入句法先验,最后用可验证奖励强化学习,相比现有方法提升性能,减少数据使用和成本,且能推广到新语言。
Comments 11 Pages, 5 Figures
截断步骤级采样与过程奖励用于检索增强推理
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出SLATE方法,通过截断步骤级采样和密集过程奖励解决检索增强推理中的信用分配问题,实验表明其在多跳任务中表现优异。
AutoCedar:用于验证器引导的访问控制策略合成的智能体框架
专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI
AI总结 研究针对大语言模型将自然语言需求转化为访问控制代码存在的问题,构建验证器引导系统AutoCedar,先转化需求为可检查目标,再合成Cedar策略,通过分解意图原子等实现端到端策略编写,在多任务和案例中表现良好。
Comments 11 pages, 2 figures
打破失败级联:面向医学多模态推理的步骤感知强化学习
机构 * Korea University(高丽大学) ; Upstage AI ; Kyung Hee University(庆熙大学) ; KAIST(韩国科学技术院) ; Hanyang University College of Medicine(汉阳大学医学院) ; AIGEN Sciences
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 提出步骤感知强化学习算法MRPO,通过为早期错误推理步骤分配指数级惩罚,打破失败级联,显著提升医学视觉问答准确率。
利用同质性感知的结构和语义文本属性图压缩提升LLM推理能力
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 提出HS2C框架,通过结构熵最小化进行全局层次划分以识别同质社区,并利用检测到的结构同质性指导LLM进行差异化语义聚合,在10个节点级和7个图级基准上同时提升压缩率和推理精度。
面向大语言模型的推理时保形推理与有效事实性控制
机构 * Machine Learning, ICML(机器学习,国际机器学习大会)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI
AI总结 提出推理时保形推理框架,将保形预测集成到推理图生成中,通过图级不确定性校准生成停止阈值,实现有效事实性控制。
Comments Accepted at ICML 2026