arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-12 至 2026-08-12 共收录 16 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 16 篇

2608.07968 2026-08-12 cs.CL cs.AI 版本更新 90%

Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions

努力而非明智:推理模型无法在不同问题间合理分配测试时计算资源

Chenrui Fan, Yize Cheng, Ming Li, Yongyuan Liang, Tianyi Zhou, Soheil Feizi

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出考试式评估框架发现推理模型无法在不同难度分值的问题间合理分配共享测试时计算预算,明确规划提示可使分配更均匀但仍不敏感于分值难度,全局预算分配是现有模型未掌握的独特能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08326 2026-08-12 cs.AI 版本更新 87%

StructReward: Efficient Structured Process Rewards for Self-Correcting Multimodal Reasoning

StructReward:用于自修正多模态推理的高效结构化过程奖励

Yifan Li, Ruxin Sun, Tongzhou Zhao

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);verifier(abstract);self-correction(abstract)

AI总结 本研究提出StructReward框架,通过结构化步骤级奖励对齐结合GRPO目标等方式,在无额外验证器的情况下降低多模态强化学习开销,实现自修正多模态推理。

Comments 9 pages, 3 figures. Yifan Li and Ruxin Sun contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10665 2026-08-12 cs.AI cs.CV cs.GT 新提交 83%

VERDICT: Training-Free Step-Wise Verification of Multimodal Reasoning via Disagreement-Aware Consensus

VERDICT:基于分歧感知共识的多模态推理无训练逐步验证方法

Rohit Sinha, Kunal Tilaganji, Tanuja Ganu, Nagarajan Natarajan, Amit Sharma, Vineeth Balasubramanian

机构 * Indian Institute of Technology, Hyderabad(印度理工学院海得拉巴分校) Microsoft Research(微软研究院)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 该研究针对多模态大语言模型推理链易出错的问题,提出无训练的VERDICT方法,利用跨模态分歧的闭式解计算共识评分,在六个基准上提升最高达5.95%,性能接近需大量监督的特定领域评论家。

Comments European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08020 2026-08-12 cs.AI 版本更新 83%

Thought-Level Beam Search for Reasoning

用于推理的思维级束搜索

Lijie Yang, Hongyin Luo, Jiawei Zhao, Tri Dao, Ravi Netravali

机构 * Princeton University(普林斯顿大学) MIT(麻省理工学院) Meta AI

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.AI

AI总结 针对大型推理模型测试时计算分配的低效问题,提出执行思维级束搜索的Gambit算法,在固定硬件预算下,其在准确率、吞吐量、token消耗等指标上均优于现有基线方法。

Comments Add the author Jiawei Zhao in Meta Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05307 2026-08-12 cs.CL 版本更新 83%

MentorCollab: Large-to-Small Inference-Time Mentorship for Concise Reasoning in Language Models

MentorCollab: 选择性大到小推理时指导以实现高效推理

Haojin Wang, Yike Wang, Shangbin Feng, Hannaneh Hajishirzi, Yulia Tsvetkov

机构 * UIUC(伊利诺伊大学香槟分校) University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL

AI总结 MentorCollab通过选择性推理时指导,使小型模型在多步骤推理任务中实现高效协作,提升性能的同时降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07822 2026-08-12 cs.CL cs.AI cs.LG 版本更新 82%

Loop, Think, & Generalize: Implicit Reasoning in Recurrent-Depth Transformers

循环、思考与泛化:递归深度变换器中的隐式推理

Harsh Kohli, Srinivasan Parthasarathy, Huan Sun, Yuekun Yao

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了隐式推理能力,探讨了递归深度变换器在系统泛化和深度扩展中的作用,发现其能有效提升多跳推理能力,但过度递归会导致泛化能力下降。

Comments 21 pages, 21 figures. Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10447 2026-08-12 cs.IR cs.AI 新提交 79%

Towards Efficient Reasoning in LLM-Based Recommender Systems via Model Merging

基于模型合并的大语言模型推荐系统高效推理研究

Linh Dieu Le, Tong Chen, Shazia Sadiq, Hongzhi Yin, Ming Jin, Junliang Yu

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究针对LLM推荐系统推理冗长导致成本高的问题,提出首个用于推理压缩的注意力头级细粒度模型合并框架,在不降低推荐准确率的前提下最多缩短24.3%的推理长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17188 2026-08-12 cs.AI 版本更新 79%

UPAIR: Diagnosing Reasoning States via Uncertainty-Progress Alignment for Selective Intervention

你的模型是在思考还是停滞不前?PUMA:通过相位动量对齐诊断推理病理学

Cheng Yan, Zhijun Fan, Guangyang Ye, Fan Xu, Xiang Xia, Yawei Wang, Wuyang Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 研究大型推理模型测试时的“过度思考”问题,提出相位动量对齐假设并构建认知能量模型,引入PUMA框架,通过分层诊断架构区分主动探索与被动停滞,在多基准实验中优于现有基线,实现更好的准确性-效率权衡和跨域泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10333 2026-08-12 cs.LG 新提交 70%

MERA: Model Evolution and Routing with Skill Adaptation for Agentic Systems at Scale

MERA:面向大规模智能体系统的技能适配型模型演化与路由

Yuhang Yao, Zeyu Wang, Wanyi Chen, Tongyun Yang, Yuhang Han, Jie Xiao, Chengke Bao, Tianyi Zhao, Lynn Ai, Eric Yang, Tianyu Shi

机构 * Gradient Soochow University(苏州大学) Carnegie Mellon University(卡内基梅隆大学) Shanghai Jiao Tong University(上海交通大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.LG

AI总结 MERA以单模型调用为适应单元,通过多轮适配提升小模型能力,结合带验证器回退的成本校准路由,在HumanEval+MBPP、TAU-2等数据集上实现小模型性能提升与成本降低。

Comments Preliminary version in CAIS RL-Eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11181 2026-08-12 cs.CC cs.AI cs.LG 新提交 62%

How to Verify Consistency of Probabilistic Claims

如何验证概率断言的一致性

Orr Paradise, Oliver Richardson, Yoshua Bengio, Shafi Goldwasser

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对概率预测器答案的自洽性验证问题,基于Nilsson的工作构造交互式PCP,为概率预测器自洽性证明提供复杂性理论基础,是训练模型证明自身一致性的第一步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07943 2026-08-12 cs.CR cs.AI cs.CL 版本更新 62%

Poise: Position-Aware One-Instruction Skill Injection for Silent Execution on LLM Agents

POISE:面向LLM智能体的位置感知不可检测技能注入攻击

Haochang Hao, Dehai Min, Zhifang Zhang, Yunbei Zhang, Miao Xu, Yingqiang Ge, Lu Cheng

机构 * University of Illinois at Chicago(伊利诺伊大学香槟分校) University of Queensland(昆士兰大学) Tulane University(路易斯安那州立大学) Rutgers University(罗格斯大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出POISE攻击方法,通过位置感知将恶意指令压缩为单一良性指令嵌入技能正文,在保持隐蔽性的同时实现89.3%的攻击成功率,比随机位置基线高28.0个百分点。

Comments Title changed from "POISE: Position-Aware Undetectable Skill Injection on LLM Agents" to "Poise: Position-Aware One-Instruction Skill Injection for Silent Execution on LLM Agents"; the manuscript, figures, appendices, and reproducibility details have been updated. 15 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05629 2026-08-12 stat.ML cs.CL cs.LG 版本更新 62%

Spherical Flows for Sampling Categorical Data

用于分类数据采样的球面流

Jannis Chemseddine, Gregor Kornhardt, Gabriele Steidl

机构 * Technische Universität Berlin(柏林技术大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出在球面上利用von Mises-Fisher分布进行离散序列生成建模,通过径向对称性简化连续性方程为标量ODE,结合后验加权切线和与预测-校正采样实现高效采样。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10626 2026-08-12 cs.CL 新提交 57%

Dual-Loop Self-Evolution via Verifiable Emotion Feedback for Multi-Turn Empathetic Dialogue

基于可验证情感反馈的双循环自演化多轮共情对话

Yi Wei, Shuo Jiang, Huaixia Dou, Jie Zhu, Junhui Li, Lifan Guo, Feng Chen, Chi Zhang

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 该研究针对大语言模型共情能力不足问题,提出双循环自演化框架,在SAGE数据集上显著提升Qwen3-8B的共情对话性能,优于对比方法。

Comments 10 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20173 2026-08-12 cs.AI cs.SE 版本更新 57%

A Methodology for Selecting and Composing Runtime Architecture Patterns for Production LLM Agents

为生产大语言模型代理选择和组合运行时架构模式的方法

Vasundra Srinivasan

机构 * AI Architect, Independent Researcher(人工智能架构师,独立研究员) Stanford School of Engineering(斯坦福大学工程学院)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文提出了一种方法,用于选择和组合运行时架构模式,以定义大语言模型代理的随机-确定性边界,并探讨其在不同代理类型中的应用及可靠性分解。

Comments 26 pages, 2 figures, 6 tables. Companion repo at https://github.com/vasundras/agent-runtime-patterns

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09921 2026-08-12 cs.LG 版本更新 57%

A Tale of Two Temperatures: Simple, Efficient, and Diverse Sampling from Diffusion Language Models

双温度的故事:从扩散语言模型中实现简单、高效且多样的采样

Theo X. Olausson, Metod Jazbec, Xi Wang, Armando Solar-Lezama, Christian A. Naesseth, Stephan Mandt, Eric Nalisnick

机构 * Massachusetts Institute of Technology(麻省理工学院) UvA-Bosch Delta Lab, University of Amsterdam(阿姆斯特丹大学UvA-Bosch Delta实验室) Johns Hopkins University(约翰霍普金斯大学) University of California, Irvine(加州大学尔湾分校)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.LG

AI总结 本文提出通过温和的温度化方法提升扩散语言模型采样多样性,实现高效且多样化的样本生成,优于现有方法。

Comments V2: accepted as a full conference paper at COLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11076 2026-08-12 cs.CV 新提交 50%

Foundation Model-Enabled Efficient Data Sampling (FEEDS): A label-efficient training strategy for pan-cancer, multi-tracer PET/CT datasets

基于基础模型的高效数据采样(FEEDS):用于泛癌、多示踪剂PET/CT数据集的标签高效训练策略

Biratal Raj Wagle, Bashirul Azam Biswas, Grant Chau, Matthew E. Maeder, Muhammad Azeem Arshad, Michael S. Leapman, James B. Yu, Indrani Bhattacharya

机构 * Geisel School of Medicine at Dartmouth(达特茅斯盖泽尔医学院) Dartmouth Hitchcock Medical Center(达特茅斯-希区柯克医疗中心) Yale University(耶鲁大学)

专题命中 测试时计算 :planning(abstract)

AI总结 该研究提出FEEDS策略,利用视觉基础模型嵌入选择信息性和多样性未标注病例,在减少70%标注负担时达到全标注训练性能,解决了PET/CT病灶分割的标签稀缺问题。

Comments Code is publicly available on https://github.com/Image-and-Multimodal-Data-Analytics/FEEDS

详情

展开后加载摘要…

URL PDF HTML 收藏