Learning When to Think: Adaptive Reasoning for Test-Time Compute Allocation
学习何时思考:面向测试时计算分配的自适应推理
专题命中 测试时计算 :reasoning(title,abstract);test-time compute(title);分类 cs.AI
AI总结 该研究提出基于GRPO的自适应推理模型,通过三种模式选择分配测试时计算,在MATH数据集上减少41%响应长度且保留高准确率,还可迁移至其他基准。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
学习何时思考:面向测试时计算分配的自适应推理
专题命中 测试时计算 :reasoning(title,abstract);test-time compute(title);分类 cs.AI
AI总结 该研究提出基于GRPO的自适应推理模型,通过三种模式选择分配测试时计算,在MATH数据集上减少41%响应长度且保留高准确率,还可迁移至其他基准。
面向物理视觉-语言推理的答案级信任选择
专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.LG
AI总结 针对VLM部署中预测信任问题,提出模型无关的ATS框架,聚合8种诊断分数评估答案可靠性,可识别稳定错判等失效模式,补充模型级能力评估。
Comments Preprint
MPCoT: 奖励引导的多路径潜在推理用于测试时可扩展的视觉-语言-动作
机构 * Department of Electrical and Computer Engineering, Boston University(波士顿大学电气与计算机工程系) ; Department of Computer Science, Tsinghua University(清华大学计算机系)
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 提出MPCoT框架,通过奖励引导的多路径潜在推理,在保持零推理令牌和原始动作接口的同时,提升长时域和高不确定性控制任务中的VLA策略性能。
Comments 14 pages, 5 figures, submitted to CoRL
评估评估者:面向大语言模型推理的验证自主等级(L0-L5)
专题命中 测试时计算 :reasoning(title);verifier(abstract);分类 cs.CL
AI总结 该研究提出验证自主等级(VAL)元标准,解决验证领域的等级概念混淆,明确不同验证方案的完备性边界,相关代码与评估材料已公开。
Comments v2: reproducibility study (kappa~0.8), agent-security case (PPMF), anchor semantics, 15+ fixes. Code and data: this https URL (https://github.com/1549080929-debug/math_agent) Keywords: LLM verification; verification autonomy; completeness; ground truth; trustworthy AI Writing and implementation assisted by an AI language model; all experiments, data, and research decisions are the author's own
Zoom-IQA:基于可靠区域感知推理的图像质量评估
机构 * S-Lab, Nanyang Technological University, Singapore(S实验室,南洋理工大学,新加坡) ; SenseTime Research(商汤科技研究院)
专题命中 测试时计算 :reasoning(title,abstract)
AI总结 研究图像质量评估问题,提出基于视觉语言模型的Zoom-IQA,通过两阶段训练管道,包括监督微调与强化学习,有效减轻标注偏差,提升了模型在鲁棒性、可解释性和泛化性方面的表现,在下游任务中也展现出有效性。
Comments ECCV 2026, Project Page: this https URL (https://ethanliang99.github.io/ZOOMIQA-Projectpage)
MemTrapBench:大语言模型记忆使用中认知陷阱的基准测试
专题命中 测试时计算 :reasoning(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 研究人员提出MemTrapBench基准测试,发现现有LLM记忆策略存在认知陷阱致性能下降,进而提出AdaptiveMem方法可缓解该问题并提升标准记忆基准性能。
Comments Work in progress
PolicyGuide:从单一动作防护到合规LLM智能体的全流程引导
机构 * KAIST(韩国科学技术院)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 PolicyGuide将领域政策编译为工作流图,通过主动验证器引导LLM智能体合规执行,在多领域提升了合规率,且工作流可跨模型迁移,攻击成功率低、程序性合规性强。
Comments 26 pages, 15 figures, including appendices
快速分叉:高效估计文本生成中的不确定性动态
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对文本生成中不确定性动态估计成本高的问题,本研究开发统计模型平滑低采样推理数据以近似高采样数据,提升重采样分析效率,揭示不确定性动态的稳定模式及噪声来源。
打断循环:周期性主体变化提升基础语言模型的惊讶度与关联度
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI
AI总结 本研究探究基础语言模型的长文本生成特性,发现周期性注入新主体的打断操作可提升模型生成文本的惊讶度与关联度,还提出了长文本生成的评估方案。
Comments 48 pages including appendix; code, data pipeline and lab notebook at this https URL (https://github.com/RobertoOno/interrupting-the-loop)