arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-23 至 2026-06-23 共收录 20 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 20 篇

2603.08999 2026-06-23 cs.CL 版本更新 90%

Learning When to Sample: Confidence-Aware Selective Sampling for Efficient Chain-of-Thought Reasoning

学习何时采样:面向高效链式思维推理的置信度感知选择性采样

Juming Xiong, Kevin Guo, Congning Ni, Weixin Liu, Chao Yan, Katherine Brown, Avinash Baidya, Xiang Gao, Bradley Malin, Zhijun Yin

机构 * Vanderbilt University(范德比尔特大学) Vanderbilt University Medical Center(范德比尔特大学医学中心) Intuit AI Research(Intuit AI研究院)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL

AI总结 提出置信度感知选择性采样框架,通过分析单条推理轨迹自适应决定是否触发多路径采样,在保持性能的同时显著降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03093 2026-06-23 cs.LG cs.CL 版本更新 88%

ATLAS: Verifier-Guided Adaptive Latent Activation Steering for Efficient LLM Reasoning

ATLAS:验证器引导的自适应潜在激活引导用于高效LLM推理

Tuc Nguyen, Thai Le

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract);分类 cs.CL、cs.LG

AI总结 提出ATLAS框架,通过轻量级验证器动态调整推理时潜在状态引导策略,实现每步自适应控制,在数学和编码推理任务上提升准确率并减少测试时token使用。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22938 2026-06-23 cs.LG cs.AI 新提交 88%

Provable Benefits of RLVR over SFT for Reasoning Models: Learning to Backtrack Efficiently

RLVR 相对于 SFT 在推理模型中的可证明优势:学习高效回溯

Stanley Wei, Juno Kim

机构 * Princeton University(普林斯顿大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文从理论上证明,在推理任务中,基于可验证奖励的强化学习(RLVR)相比监督微调(SFT)能学习高效回溯,从而在推理时计算上实现指数级优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21777 2026-06-23 cs.CL cs.AI 新提交 84%

CalVerT: Augmenting Agents with Calibrated Verifier Telemetry Improves Action and Learning in Knowledge-Intensive Tasks

CalVerT: 通过校准验证器遥测增强智能体在知识密集型任务中的行动与学习

Ashwin Vinod, Ying Ding, Elias Stengel-Eskin

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出CalVerT方法,通过向智能体状态添加校准的自信心分数和基础验证器分数,减少过度依赖参数知识或冗余检索,提升知识密集型问答的准确性和效率。

Comments Code: https://github.com/ashwinn-v/CalVerT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22317 2026-06-23 cs.LG cs.AI 新提交 81%

Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model

课程强化学习可以激励LLMs超越基础模型的推理能力

Pengxiang Cai, Tianchen Fang, Xiaohan Li, Qingyuan Zeng, Guocong Li, Jintai Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出边界感知课程强化学习方法,通过定位推理能力边界、针对性教师引导和强化学习巩固,在Qwen、Llama和DeepSeek上同时提升pass@1和pass@256,平均pass@256比基础模型提升9.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07532 2026-06-23 cs.LG cs.AI 版本更新 81%

Neural Concept Verifier: Scaling Prover-Verifier Games via Concept Encodings

神经概念验证器:通过概念编码扩展证明者-验证者博弈

Berkant Turan, Suhrab Asadulla, David Steinmann, Kristian Kersting, Wolfgang Stammer, Sebastian Pokutta

机构 * Zuse Institute Berlin, Germany AI \& ML Lab, Computer Science Department, TU Darmstadt Hessian Center for AI (hessian.AI) Lab1141 German Research Center for AI (DFKI) Institute of Mathematics, Technische Universit\"at Berlin, Germany Max Planck Institute for Informatics, SIC

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI、cs.LG

AI总结 提出神经概念验证器(NCV)框架,结合概念编码与证明者-验证者博弈,实现高维输入的可验证分类,优于传统方法并缓解捷径行为。

Comments 28 pages, 5 figures, 12 tables, revised references. An earlier version of this work was presented at the ICML 2025 Workshop on Actionable Interpretability

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04579 2026-06-23 cs.AI 版本更新 79%

SCI-PRM: A Tool Aware Process Reward Model for Scientific Reasoning Verification

SCI-PRM:用于科学推理验证的工具感知过程奖励模型

Xiangyu Zhao, Henry Hengyuan Zhao, Yiheng Wang, Wanghan Xu, Yuhao Zhou, Qinglong Cao, Zhiwang Zhou, Lei Bai, Wenlong Zhang, Xiao-Ming Wu

机构 * The Hong Kong Polytechnic University(香港理工大学) Shanghai AI Lab(上海人工智能实验室) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) Sichuan University(四川大学) Tongji University(同济大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 针对科学推理中工具使用和事实一致性问题,提出Sci-PRM模型,通过构建包含工具链轨迹的数据集SCIPRM70K并训练过程奖励模型,在测试时扩展和强化学习中提供细粒度监督,提升基础模型性能。

Comments Accepted by KDD 2026 AI4Science Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24198 2026-06-23 cs.CL cs.AI cs.CE cs.LG cs.MA 版本更新 75%

Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis

奖励科学过程:面向代理数据分析的过程级奖励建模

Zhisong Qiu, Shuofei Qiao, Kewei Xu, Yuqi Zhu, Lun Du, Ningyu Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DataPRM,一种环境感知的生成过程奖励模型,通过主动验证和反思意识的三元奖励策略,提升动态数据分析任务中代理的性能,实验表明其在多个基准测试中表现优异。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19346 2026-06-23 cs.CL cs.AI 新提交 73%

Disentangling Linguistic Relatedness from Task Alignment in Cross-Lingual Transfer

跨语言迁移中语言相关性与任务对齐的解耦

Ahmed Haj Ahmed, Ruochen Zhang, Alvin Grissom

机构 * Haverford College(哈弗福德学院) Brown University(布朗大学)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 通过微调大语言模型并在闪语族与非闪语族语言上评估零样本阅读理解,发现跨语言迁移主要提升任务格式对齐而非语言特定知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04815 2026-06-23 cs.LG cs.AI 版本更新 73%

Learning While Acting: A Skill-Enhanced Test-Time Co-Evolution Framework for Online Lifelong Learning Agents

边行动边学习:面向在线终身学习智能体的技能增强测试时协同进化框架

Bo Mao, Jie Zhou, Yutao Yang, Xin Li, Xian Wei, Qin Chen, Xingjiao Wu, Liang He

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室) Software Engineering Institute, East China Normal University(东华大学软件工程学院)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 提出LifeSkill框架,通过验证器引导的技能学习和在线技能内化,使LLM智能体在测试时持续内化反馈,提升终身学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20621 2026-06-23 cs.AI cs.CL cs.LG cs.MA stat.ML 新提交 67%

PEAR: Permutation-Equivariant Adaptive Routing Multi-Agent Debate

PEAR: 置换等变自适应路由多智能体辩论

Yang Feng, Ziwei Xu, Xia Hu, Fengxiang He

机构 * University of Edinburgh(爱丁堡大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PEAR协议,通过动态重配置通信角色和稀疏拓扑,消除固定拓扑中的位置偏差,提升多智能体辩论的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19475 2026-06-23 cs.AI cs.CL 新提交 62%

Diffusion Language Models: An Experimental Analysis

扩散语言模型:一项实验分析

Thomas Bertolani, Davide Bucciarelli, Leonardo Zini, Marcella Cornia, Lorenzo Baraldi

机构 * University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学) University of Pisa(比萨大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文系统比较了八种扩散语言模型在推理、编码、翻译等任务上的表现,分析了去噪步数、上下文长度等推理因素对性能与效率的影响,揭示了扩散语言模型在不同任务和预算下的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16214 2026-06-23 cs.LG cs.AI 新提交 62%

Calibrated Sampling-Free Uncertainty Estimation in Bayesian Deep Learning

贝叶斯深度学习中的校准无采样不确定性估计

Tobias Jan Wieczorek, Leon de Andrade, Thomas Möllenhoff, Marcus Rohrbach

机构 * TU Darmstadt & hessian.AI, Darmstadt, Germany(达姆施塔特工业大学 & hessian.AI,德国达姆施塔特) RIKEN Center for Advanced Intelligence Project, Tokyo, Japan(日本理化学研究所革新智能研究中心,日本东京)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出校准方差传播(CVP),通过新型归一化层传播方法、激活函数处理技术及轻量校准步骤,在单次前向传播中高效估计不确定性,在Transformer和CNN上达到与MC采样相当的精度,成本显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23321 2026-06-23 cs.CL 新提交 57%

Tmax: A simple recipe for terminal agents

Tmax: 终端智能体的简单配方

Hamish Ivison, Junjie Oscar Yin, Rulin Shao, Teng Xiao, Nathan Lambert, Hannaneh Hajishirzi

机构 * Allen Institute for AI(人工智能研究院) University of Washington(华盛顿大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 提出Tmax配方,通过新颖分类法生成数据并结合结果奖励的强化学习,在9B参数下达到27%的Terminal-Bench 2.0性能,超越先前更大模型。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22813 2026-06-23 cs.AI 新提交 57%

Active Inference as the Test-Time Scaling Law for Physical AI Agents

主动推理作为物理AI代理的测试时缩放定律

Omar Hashash, Christo Kurisummoottil Thomas, Walid Saad, Merouane Debbah, Karl Friston, Adeel Razi

机构 * Bradley Department of Electrical and Computer Engineering(布拉德利电气与计算机工程系) Institute for Advanced Computing(先进计算研究所) Virginia Tech(弗吉尼亚理工大学) Department of Electrical and Computer Engineering(电气与计算机工程系) Worcester Polytechnic Institute(沃思堡理工学院) Khalifa University of Science and Technology(卡利法科学与技术大学) CentraleSupelec(中央超导研究所) University Paris Saclay(巴黎萨克雷大学) Queen Square Institute of Neurology(伦敦大学学院神经科学研究所) School of Psychological Sciences(心理学系) Monash University(莫纳什大学) CIFAR Global Scholars Program(CIFAR全球学者计划) Queen Square Institute of Neurology, University College London(伦敦大学学院神经科学研究所)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 提出基于主动推理第一性原理的测试时缩放定律,使物理AI代理通过世界模型推理在非平稳环境中泛化,并利用变分推理更新策略,在自动驾驶任务中提升36%以上推理效率。

Comments 53 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22793 2026-06-23 cs.AI 新提交 57%

A Formula-Driven Survey and Research Agenda for On-Policy Distillation

基于公式驱动的在线策略蒸馏综述与研究议程

Bowen Zhang

机构 * Tsinghua University(清华大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文提出一种公式驱动的分类法,将在线策略蒸馏(OPD)视为反馈到更新的问题,区分直接分布损失和策略梯度式对数比更新,并揭示状态兼容性、支持构建、时间信用、词汇路由等关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22305 2026-06-23 cs.CL 新提交 57%

Learning at the Right Pace: Adaptive Data Scheduling Improves LLM Reinforcement Learning

以合适的速度学习:自适应数据调度改进大语言模型强化学习

Zicheng Xu, Ruixuan Zhang, Yu-Neng Chuang, Xiuyi Lou, Hoang Anh Duy Le, Oren Gal, Alexander S. Szalay, Zhaozhuo Xu, Guanchu Wang, Vladimir Braverman

机构 * Johns Hopkins University(约翰霍普金斯大学) Rice University(莱斯大学) University of Haifa(海法大学) Workato University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 针对LLM强化学习后训练中均匀采样忽视数据语义和策略变化的问题,提出自适应数据调度框架ADS,通过语义聚类和策略边界样本选择实现双层级调度,在三个LLM和七个推理基准上平均准确率提升5.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20244 2026-06-23 cs.CV cs.AI 新提交 57%

SPOT-E: Test-Time Entropy Shaping with Visual Spotlights for Frozen VLMs

SPOT-E:基于视觉聚光灯的冻结VLM测试时熵整形

Bo Yin, Xiaobin Hu, Chengming Xu, Ruolin Shen, Mo Yang, Jiangning Zhang, Peng-Tao Jiang, Cheng Tan, Shuicheng Yan

机构 * National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Technical University of Munich(慕尼黑工业大学) Sagenic Tech Zhejiang University(浙江大学) vivo Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 提出SPOT-E方法,通过测试时熵整形和视觉聚光灯,解决VLM在证据密集型任务中因忽视局部关键证据而表现不佳的问题,无需重新训练即可提升定位与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05161 2026-06-23 cs.CV 版本更新 50%

Wasserstein-Aligned Localisation for VLM-Based Distributional OOD Detection in Medical Imaging

基于VLM的医学图像分布外检测的Wasserstein对齐定位

Bernhard Kainz, Johanna P Mueller, Matthew Baugh, Cosmin Bercea

机构 * Department of Computing, Imperial College London, UK(伦敦帝国理工学院计算机系) Technical University Munich, DE(慕尼黑技术大学) Munich Center for Machine Learning (MCML), DE(慕尼黑机器学习中心(MCML))

专题命中 测试时计算 :reasoning(abstract)

AI总结 提出WALDO框架,利用最优传输理论通过熵加权切片Wasserstein距离、Goldilocks区域采样和自一致性聚合实现零样本异常定位,在NOVA脑MRI基准上mAP@30达43.5%,相对提升19%。

Comments submitted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05613 2026-06-23 cond-mat.mtrl-sci 版本更新 50%

New Crystal Structures Hide in Plain Sight: A Stress Test for AI-Guided Materials Discovery

新晶体结构隐藏于眼前:AI引导材料发现的压力测试

Xin Zhang, Scott B. Lee, Sudipta Chatterjee, Hanqi Pi, Yi Jiang, Fatmagül Katmer, Emily G. Ward, Daniel E. Widdowson, Charles C. Tam, Sarah Schwarz, Connor J. Pollak, Jaime M. Moya, Grigorii Skorupskii, Vitaliy A. Kurlin, Stephen D. Wilson, B. Andrei Bernevig, Leslie M. Schoop

专题命中 测试时计算 :reasoning(abstract)

AI总结 通过实验合成发现GdNiSn4和LuNiSn4具有前所未有的结构类型,并以此测试两种生成式AI模型,发现它们无法在容忍度内重现该结构,表明编码化学推理(如已知基元堆叠)是AI发现结构新颖材料的具体路径。

详情

展开后加载摘要…

URL PDF HTML 收藏