arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1976 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1976 篇

2501.07861 2025-01-15 cs.CL 83%

ReARTeR: Retrieval-Augmented Reasoning with Trustworthy Process Rewarding

Zhongxiang Sun, Qipeng Wang, Weijie Yu, Xiaoxue Zang, Kai Zheng, Jun Xu, Xiao Zhang, Song Yang, Han Li

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06458 2025-01-14 cs.CL 83%

O1 Replication Journey -- Part 3: Inference-time Scaling for Medical Reasoning

Zhongzhen Huang, Gui Geng, Shengyi Hua, Zhen Huang, Haoyang Zou, Shaoting Zhang, Pengfei Liu, Xiaofan Zhang

专题命中 测试时计算 :reasoning(title,abstract);planning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14511 2024-10-01 cs.CL 83%

Investigating Mysteries of CoT-Augmented Distillation

Somin Wadhwa, Silvio Amir, Byron C. Wallace

专题命中 测试时计算 :CoT(title,abstract);reasoning(abstract);分类 cs.CL

Comments Accepted to EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14109 2024-07-04 cs.AI 83%

Boosting the Power of Small Multimodal Reasoning Models to Match Larger Models with Self-Consistency Training

Cheng Tan, Jingxuan Wei, Zhangyang Gao, Linzhuang Sun, Siyuan Li, Ruifeng Guo, Bihui Yu, Stan Z. Li

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract);分类 cs.AI

Comments Accepted by ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12939 2024-05-22 cs.CL 83%

Aggregation of Reasoning: A Hierarchical Framework for Enhancing Answer Selection in Large Language Models

Zhangyue Yin, Qiushi Sun, Qipeng Guo, Zhiyuan Zeng, Xiaonan Li, Tianxiang Sun, Cheng Chang, Qinyuan Cheng, Ding Wang, Xiaofeng Mou, Xipeng Qiu, XuanJing Huang

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

Comments 17 pages, 14 figures, accepted by LREC-COLING 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01714 2024-03-05 cs.CL 83%

Retrieval-augmented Multi-modal Chain-of-Thoughts Reasoning for Large Language Models

Bingshuai Liu, Chenyang Lyu, Zijun Min, Zhanyu Wang, Jinsong Su, Longyue Wang

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract);分类 cs.CL

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12397 2023-10-20 cs.AI 83%

GPT-4 Doesn't Know It's Wrong: An Analysis of Iterative Prompting for Reasoning Problems

Kaya Stechly, Matthew Marquez, Subbarao Kambhampati

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19280 2026-01-28 cs.LG cs.AI cs.CL 83%

Group Distributionally Robust Optimization-Driven Reinforcement Learning for LLM Reasoning

基于组分布鲁棒优化的强化学习用于大语言模型推理

Kishan Panaganti, Zhenwen Liang, Wenhao Yu, Haitao Mi, Dong Yu

机构 * Tencent AI Lab in Bellevue WA USA(腾讯AI实验室(西雅图华盛顿州))

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出多对手组分布鲁棒优化框架,通过动态调整训练分布提升大语言模型推理性能,实现训练后精度提升10.6%和10.1%。

Comments Keywords: Large Language Models, Reasoning Models, Reinforcement Learning, Distributionally Robust Optimization, GRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13930 2025-12-17 cond-mat.mtrl-sci cs.AI cs.CL cs.LG cs.MA 83%

Hierarchical Multi-agent Large Language Model Reasoning for Autonomous Functional Materials Discovery

分层多智能体大语言模型推理用于自主功能材料发现

Samuel Rothfarb, Megan C. Davis, Ivana Matanovic, Baikun Li, Edward F. Holby, Wilton J. M. Kort-Kamp

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MASTER通过多代理协作提升材料发现的自主性,利用大语言模型进行推理驱动的原子模拟优化,减少90%的计算需求。

Comments Keywords: Multi-agent reasoning; Large language models; Active learning; AI-driven simulation; Materials discovery; Density functional theory; Surface chemistry

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07822 2026-08-12 cs.CL cs.AI cs.LG 版本更新 82%

Loop, Think, & Generalize: Implicit Reasoning in Recurrent-Depth Transformers

循环、思考与泛化:递归深度变换器中的隐式推理

Harsh Kohli, Srinivasan Parthasarathy, Huan Sun, Yuekun Yao

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了隐式推理能力,探讨了递归深度变换器在系统泛化和深度扩展中的作用,发现其能有效提升多跳推理能力,但过度递归会导致泛化能力下降。

Comments 21 pages, 21 figures. Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06861 2026-08-07 cs.AI cs.CL cs.LG 版本更新 82%

Test-Time Scaling in Reasoning Models Is Not Effective for Knowledge-Intensive Tasks Yet

推理模型在知识密集型任务中的测试时间扩展效果有限

James Xu Zhao, Bryan Hooi, See-Kiong Ng

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现测试时间扩展在知识密集型任务中效果有限,主要因模型回答意愿和确认偏见导致幻觉增加,且无法提升真实答案的信息量。

Comments COLM 2026. 10+27 pages, 9 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05124 2026-08-06 cs.CL cs.AI cs.IT cs.LG eess.SP math.IT 新提交 82%

Chained Recursive Language Models for Multi-Iteration Reasoning

用于多轮迭代推理的链式递归语言模型

Purbesh Mitra, Sennur Ulukus

机构 * University of Maryland(马里兰大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM长上下文推理易传播早期错误的问题,提出Chained RLM推理架构,通过分阶段管理上下文提升多轮迭代推理准确率,验证其相比直接LLM回答的性能增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27823 2026-07-31 cs.CV 新提交 82%

Hallucinations Leave a Grounding Signature:Verifier-Guided Decoding for Selective Object Correction

幻觉留下 grounding 特征:用于选择性对象修正的验证器引导解码

Lei Yang, Xinze Liu, Dayan Wu, Ding Wang, Hengjie Zhu, Zihao Zhang, Tianzhu Hu, Hanqi Wu, Peng Fu, Zheng Lin

专题命中 测试时计算 :verifier(title,abstract)

AI总结 该研究针对大型视觉语言模型的对象幻觉问题,提出基于内在 grounding 特征(IGS)的验证器引导解码(VGD)框架,在保留视觉理解和对象覆盖率的同时,实现了最先进的对象幻觉缓解效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08116 2026-07-10 cs.NI 新提交 82%

MORES: Mobile Reasoning-as-a-Service via Distributed LLM Inference-Time Scaling

MORES:通过分布式大语言模型推理时间缩放实现移动推理即服务

Guanchen Liu, Hongyang Du, Kaibin Huang

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 研究针对大语言模型推理时间缩放的计算和内存开销问题,提出MORES框架,利用隐式推理递归结构及基于语义MoE的DRL算法优化资源分配,实现边缘设备协作推理,提升系统吞吐量约18%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22281 2026-06-17 cs.CV cs.AI cs.CL cs.LG cs.RO 版本更新 82%

ThinkJEPA: Empowering Latent World Models with Large Vision-Language Reasoning Model

ThinkJEPA:赋予潜在世界模型大型视觉-语言推理能力

Haichao Zhang, Yijiang Li, Shwai He, Tushar Nagarajan, Mingfei Chen, Jianglin Lu, Ang Li, Yun Fu

机构 * Northeastern University(东北大学) University of California San Diego(加州大学圣地亚哥分校) University of Maryland(马里兰大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Washington(华盛顿大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ThinkJEPA框架,结合密集JEPA分支与稀疏VLM思考者分支,通过分层金字塔表示提取模块,实现细粒度运动建模与长程语义引导,在手部操作轨迹预测任务上超越基线。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05145 2026-06-04 cs.LG cs.AI cs.CL 82%

Failed Reasoning Traces Tell You What Is Fixable (But Not by Reading Them)

失败推理轨迹告诉你什么是可修复的(但仅凭阅读它们不行)

Nizar Islah, Istabrak Abbes, Irina Rish, Sarath Chandar, Eilif B. Muller

机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Polytechnique Montréal(蒙特利尔理工学院) CHU Sainte-Justine(圣约斯特医院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过失败推理轨迹的分布特征而非文本内容来识别可修复的失败,并设计无训练的路由规则提升测试时干预效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07036 2026-06-04 cs.CL cs.AI cs.LG 82%

Mid-Think: Training-Free Intermediate-Budget Reasoning via Token-Level Triggers

Mid-Think: 通过词元级触发器实现无需训练的中间预算推理

Wang Yang, Debargha Ganguly, Xinpeng Li, Chaoda Song, Shouren Wang, Vikash Singh, Vipin Chaudhary, Xiaotian Han

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过分析注意力机制和提示实验,发现推理行为主要由少量触发词元控制,并据此提出Mid-Think方法,通过组合触发词元实现中间预算推理,在准确率-长度权衡上优于基线,并能在强化学习训练中减少时间并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05566 2026-05-08 cs.AI cs.CL cs.LG 82%

Nonsense Helps: Prompt Space Perturbation Broadens Reasoning Exploration

无意义帮助:提示空间扰动拓宽推理探索

Langlin Huang, Chengsong Huang, Jinyuan Li, Donghong Cai, Yuyi Yang, Jiaxin Huang

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LoPE框架,通过任务无关的提示空间扰动提升LLM推理能力,实验显示其在不同规模模型上均优于传统重采样方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00084 2026-04-28 cs.LG cs.AI cs.CL 82%

Learning to Refine: Self-Refinement of Parallel Reasoning in LLMs

学习以细化:LLMs中并行推理的自我细化

Qibin Wang, Pu Zhao, Shaohan Huang, Fangkai Yang, Lu Wang, Furu Wei, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

机构 * Microsoft(微软) Peking University(北京大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Generative Self-Refinement方法,通过并行生成候选答案并细化最终答案,提升LLM推理性能,实验显示其在多个数学基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12721 2026-04-24 cs.AI cs.CL cs.LG stat.ML 82%

Strategic Scaling of Test-Time Compute: A Bandit Learning Approach

测试时计算的战略扩展:一种多臂学习方法

Bowen Zuo, Yinglun Zhu

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种多臂学习方法,通过动态分配计算资源提升大语言模型性能,针对不同查询难度优化计算分配,实验表明在多个基准数据集上显著提升性能。

Comments To appear at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03066 2026-04-22 cs.CL cs.AI cs.LG 82%

Do LLMs Encode Functional Importance of Reasoning Tokens?

大型语言模型是否编码了推理标记的功能重要性?

Janvijay Singh, Dilek Hakkani-Tür

机构 * Grainger College of Engineering(格雷格纳工程学院) University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了大型语言模型是否内部编码了推理标记的功能重要性,提出贪心剪枝方法,在保持模型似然的前提下剪除对答案生成影响最小的推理标记,验证了模型在压缩推理链时的功能重要性结构。

Comments Updated after ACL Main 2026 acceptance; 25 pages, 8 figures, 4 tables;

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13607 2026-03-30 cs.CL cs.AI cs.LG 82%

Nemotron-Cascade: Scaling Cascaded Reinforcement Learning for General-Purpose Reasoning Models

Nemotron-Cascade:基于级联强化学习的通用推理模型规模化

Boxin Wang, Chankyu Lee, Nayeon Lee, Sheng-Chieh Lin, Wenliang Dai, Yang Chen, Yangyi Chen, Zhuolin Yang, Zihan Liu, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping

机构 * NVIDIA(英伟达)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出级联域强化学习(Cascade RL)方法,开发出Nemotron-Cascade模型,可在指令和深度思考模式间切换,性能不逊于纯思考模型,同时提升推理能力并保持跨领域基准性能。

Comments We publicly release the Nemotron-Cascade models and the full collection of training data at: https://huggingface.co/collections/nvidia/nemotron-cascade

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24844 2026-03-27 cs.LG cs.AI cs.CL 82%

Reaching Beyond the Mode: RL for Distributional Reasoning in Language Models

超越模式:语言模型中的分布推理强化学习

Isha Puri, Mehul Damani, Idan Shenfeld, Marzyeh Ghassemi, Jacob Andreas, Yoon Kim

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种多答案强化学习方法,使语言模型在推理时能生成多个可能的假设并评估其置信度,提升多样性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15417 2026-03-17 cs.LG cs.AI cs.CL cs.CR 82%

Amplification Effects in Test-Time Reinforcement Learning: Safety and Reasoning Vulnerabilities

测试时强化学习中的放大效应:安全性和推理漏洞

Vanshaj Khattar, Md Rafi ur Rashid, Moumita Choudhury, Jing Liu, Toshiaki Koike-Akino, Ming Jin, Ye Wang

机构 * Penn State University(宾夕法尼亚州立大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了测试时训练方法的安全性漏洞,发现测试时强化学习中有害提示注入会放大模型行为,导致推理能力下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12246 2026-03-13 cs.AI cs.CL cs.LG 82%

Examining Reasoning LLMs-as-Judges in Non-Verifiable LLM Post-Training

检验推理LLM作为裁判在不可验证LLM后续训练中的表现

Yixin Liu, Yue Yu, DiJia Su, Sid Wang, Xuewei Wang, Song Jiang, Bo Liu, Arman Cohan, Yuandong Tian, Zhengxing Chen

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过受控合成设置检验推理LLM作为裁判在非验证LLM后续训练中的效果,发现推理裁判能生成高性能策略,但易受对抗性输出影响,揭示了其在实际政策训练中的潜力与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07725 2026-03-10 cs.IR 82%

Verifiable Reasoning for LLM-based Generative Recommendation

基于LLM的生成推荐的可验证推理

Xinyu Lin, Hanqing Zeng, Hanchao Yu, Yinglong Xia, Jiang Zhang, Aashu Singh, Fei Liu, Wenjie Wang, Fuli Feng, Tat-Seng Chua, Qifan Wang

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract)

AI总结 VRec通过引入推理-验证-推荐范式,提升LLM生成推荐的准确性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07494 2026-03-10 cs.CV 82%

DocCogito: Aligning Layout Cognition and Step-Level Grounded Reasoning for Document Understanding

DocCogito: 对齐布局认知与分步 grounded 推理以实现文档理解

Yuchuan Wu, Minghan Zhuo, Teng Fu, Mengyang Zhao, Bin Li, Xiangyang Xue

机构 * Fudan University(复旦大学)

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract)

AI总结 DocCogito通过整合布局感知与结构化推理,提升文档理解的准确性和推理过程的系统性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16702 2026-02-19 cs.CV 82%

Saliency-Aware Multi-Route Thinking: Revisiting Vision-Language Reasoning

具有显著性意识的多路由思考:重新审视视觉-语言推理

Mingjia Shi, Yinhan He, Yaochen Zhu, Jundong Li

机构 * University of Virginia(弗吉尼亚大学)

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract)

AI总结 本文提出Saliency-Aware Principle(SAP)方法,通过高层次推理原则提升视觉-语言推理的稳定性与效率,减少幻觉并提升响应速度。

Comments preprint 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08672 2026-02-17 cs.CL cs.AI cs.LG 82%

RuleReasoner: Reinforced Rule-based Reasoning via Domain-aware Dynamic Sampling

RuleReasoner: 基于领域感知动态采样的强化规则推理

Yang Liu, Jiaqi Li, Zilong Zheng

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RuleReasoner通过领域感知动态采样方法提升规则推理性能,优于现有大型推理模型。

Comments ICLR 2026 camera ready, 28 pages, 10 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05539 2026-02-06 cs.LG cs.AI cs.CL 82%

Steering Large Reasoning Models towards Concise Reasoning via Flow Matching

通过流匹配引导大型推理模型实现紧凑推理

Yawei Li, Benjamin Bergner, Yinghan Zhao, Vihang Prakash Patil, Bei Chen, Cheng Wang

机构 * LMU Munich(慕尼黑莱茵河大学) Amazon(亚马逊)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过流匹配引导大型推理模型实现紧凑推理,提出非线性引导方法提升推理效率和任务性能。

Comments This paper has been accepted to Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏