arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 255 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 255 篇

2607.08116 2026-07-10 cs.NI 新提交 82%

MORES: Mobile Reasoning-as-a-Service via Distributed LLM Inference-Time Scaling

MORES:通过分布式大语言模型推理时间缩放实现移动推理即服务

Guanchen Liu, Hongyang Du, Kaibin Huang

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 研究针对大语言模型推理时间缩放的计算和内存开销问题,提出MORES框架,利用隐式推理递归结构及基于语义MoE的DRL算法优化资源分配,实现边缘设备协作推理,提升系统吞吐量约18%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13918 2026-07-16 math.ST cs.AI cs.LG stat.TH 新提交 82%

Partially Correlated Verifier Cascades in LLM Harnesses: Concave Log-Odds, Polynomial Reliability, and Blind-Spot Ceilings

大语言模型工具中的部分相关验证级联:凹对数优势、多项式可靠性和盲点上限

Jiangang Han

机构 * Independent researcher(独立研究者)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型工具中部分相关验证级联,将生成器错误接受率建模为潜在变量,给出理论。包括凹对数优势、多项式可靠性等特性,可测量,通过合成测试对比不同方法效果,指出实际应通过去相关而非加门提升可靠性。

Comments 14 pages, 2 figures. Code and synthetic-recovery experiments: https://github.com/jianganghan/harness-verifier-cascades

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22385 2026-07-27 cs.AI cs.LG 新提交 81%

Agentic Root Cause Analysis through Evidence-Grounded Reasoning

通过基于证据的推理进行智能根本原因分析

Amaury Wei, Olga Fink

机构 * EPFL - IMOS Laboratory(洛桑联邦理工学院 - IMOS实验室)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对工业异常根本原因诊断依赖人工且现有数据驱动方法有局限的问题,提出AgentRCA框架,结合数字孪生和大语言模型进行推理,在实际设施上评估,性能与监督基线相当且能产生透明推理轨迹,为工业根本原因分析提供实用基础。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14552 2026-07-17 cs.CL cs.AI 新提交 81%

Answer-Conditioned Chains of Thought Degrade Verifiable-Reasoning Distillation in Large Language Models

答案条件思维链降低大语言模型中的可验证推理蒸馏

Jungseob Lee, Seungyoon Lee, Suhyune Son, Dongyub Jude Lee, Sungbin Han, Sugyeong Eo, Heuiseok Lim

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究发现大语言模型推理能力蒸馏中,答案条件思维链会降低训练数据质量,导致可验证推理准确性下降,损失随难度增加,机制是从答案反向合理化,危害是数据属性,建议盲目生成答案。

Comments 13 pages, 4 figures, 14 tables. Code: https://github.com/js-lee-AI/answer-leakage

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09693 2026-07-14 cs.LG cs.AI 新提交 81%

Depth-Entropy Guided Sampling for Training-Free LLM Reasoning

用于无训练语言模型推理的深度熵引导采样

Zibin Meng, Peng Xie, Kani Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究旨在提升无训练语言模型推理能力,提出深度熵引导采样(DEGS)方法,利用逐层熵坍缩作为质量信号,结合序列似然性与深度熵结构,在多个模型和基准测试中达到无训练最优精度,在域外和难题测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09560 2026-07-13 cs.AI cs.LG 新提交 81%

Beyond Fixed Representations: The Vocabulary and Verifier Gaps in Open-Ended AI

超越固定表示:开放式人工智能中的词汇与验证差距

Yuan Cao, Haiqian Yang

机构 * MIT(麻省理工学院)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI、cs.LG

AI总结 研究指出当前人工智能系统虽能力强但表示框架固定,构建开放式智能需新操作。通过词汇和验证差距刻画与真正开放式智能的距离,基于智能行为的认知转换区分不同类型转换,进而提出创新自主性阶梯及推进开放式人工智能的方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06974 2026-07-09 cs.CL cs.LG 新提交 81%

MILES: Modular Instruction Memory with Learnable Selection for Self-Improving LLM Reasoning

MILES:用于自我改进的语言模型推理的具有可学习选择的模块化指令内存

Ruilin Tong, Dong Gong

机构 * University of New South Wales(新南威尔士大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 研究针对LLMs测试时推理问题,提出MILES框架,通过动态扩展内存及正确性优化的内存组合,利用模块化内存单元与可学习选择头实现粗到细检索机制,实验表明该框架在性能、效率及权衡上表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06720 2026-07-09 cs.AI cs.CL 新提交 81%

When Does In-Context Search Help? A Sampling-Complexity Theory of Reflection-Driven Reasoning

上下文搜索何时有用?基于反射驱动推理的采样复杂性理论

Yotam Wolf, Noam Wies, Amnon Shashua

机构 * The Hebrew University(希伯来大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究上下文搜索何时有用,通过将其建模为对推理轨迹的近似推理分析采样复杂性,表明反思能定位早期错误时可指数级改进,收益稳健可学习,还在强化学习抽象下验证了理论预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22317 2026-06-23 cs.LG cs.AI 新提交 81%

Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model

课程强化学习可以激励LLMs超越基础模型的推理能力

Pengxiang Cai, Tianchen Fang, Xiaohan Li, Qingyuan Zeng, Guocong Li, Jintai Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出边界感知课程强化学习方法,通过定位推理能力边界、针对性教师引导和强化学习巩固,在Qwen、Llama和DeepSeek上同时提升pass@1和pass@256,平均pass@256比基础模型提升9.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07602 2026-06-09 cs.LG cs.AI 新提交 81%

Sample-Efficient Post-Training for LEGO Spatial-Physics Reasoning

面向LEGO空间物理推理的样本高效后训练

Yuhuan Yuan, Zhouliang Yu, Minghao Liu, Weiyang Liu, Ge Lin Kan

机构 * HKUST(GZ)(香港科技大学(广州)) CUHK(香港中文大学) ZODA

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 针对LLM生成LEGO组装时出现的物理有效但几何语义错位问题,提出基于模型的数据选择方法和样本高效强化学习PVPO,结合体素空间几何奖励,提升结构、语义对齐和物理有效性。

Comments Technical Report V1, 15 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00685 2026-07-02 cs.MA 新提交 80%

M2Note: Continual Evolution of Vision Language Models via Mistake Notebook Learning

M2Note: 通过错误笔记本学习实现视觉语言模型的持续演化

Haiwen Li, Jing Tang, Rui Chen, Lei Sun, Xiangxiang Chu

专题命中 测试时计算 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 提出M2Note,一种无需训练的持续演化框架,通过将失败轨迹转化为可编辑的笔记,利用多模态检索增强生成在推理时引导模型,避免重复错误,并在多个基准上提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14161 2026-08-17 cs.AI 新提交 79%

BiasTrace: Linking Reasoning Behaviours to Biased Outputs in LLMs

BiasTrace:将大语言模型(LLM)中的推理行为与有偏输出关联起来

Varsha Ramineni, Hossein A. Rahmani, Jerome Ramos, Karin Sevegnani, Emine Yilmaz

机构 * University College London(伦敦大学学院) NVIDIA(英伟达)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出BiasTrace标注方案,将LLM的推理行为与有偏输出关联,构建大型标注数据集,发现有偏输出多源于微妙推理行为,且该方案可提升偏见检测与推理时缓解效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13179 2026-08-14 cs.AI 新提交 79%

Teach the Magnitude, Not the Direction: Verifier-Bounded Credit Assignment for Multi-Turn Multi-step LLM Agents

学习幅度而非方向:面向多轮多步骤大语言模型智能体的验证器约束信用分配

Zechuan Wang, Siyuan Lu, Hongxuan Zhang, Linjian Mo, Chenyi Zhuang, Leilei Gan

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI

AI总结 该研究提出CrEST分层信用分配框架,保留RL的验证器约束上限并结合自我教师的密集token级信号,在BFCL V3和WildToolBench上优于基线,可简化教师在策略优化中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12700 2026-08-14 cs.LG cs.AR cs.DC 新提交 79%

A Contract-Grade Verifier for LLM-Generated GPU Kernels, and a Native Blackwell Backward for the Gated-Linear-Recurrence Family

面向大语言模型生成的GPU内核的契约级验证器,以及门控线性循环(GDN)族的原生Blackward反向传播算法

Rishi Shah, Rishav Shrestha

机构 * E3A Healthcare(E3A医疗公司)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.LG

AI总结 本文提出契约级GPU内核验证器,发现公开系统接受的2638个机器生成内核中39.5%存在无法修复的错误,还构建了GDN族的原生Blackwell反向传播算法,指出现有内核生成正确性信号被高估。

Comments 17 pages, 3 figures. Also archived at doi:10.5281/zenodo.21563213

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10447 2026-08-12 cs.IR cs.AI 新提交 79%

Towards Efficient Reasoning in LLM-Based Recommender Systems via Model Merging

基于模型合并的大语言模型推荐系统高效推理研究

Linh Dieu Le, Tong Chen, Shazia Sadiq, Hongzhi Yin, Ming Jin, Junliang Yu

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究针对LLM推荐系统推理冗长导致成本高的问题,提出首个用于推理压缩的注意力头级细粒度模型合并框架,在不降低推荐准确率的前提下最多缩短24.3%的推理长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04611 2026-08-06 cs.SE cs.AI 新提交 79%

The Order Is the Guarantee: Verifier-Budgeted Code Deletion with Static-First Learned Proposals

顺序是保障:基于静态优先学习提议的验证者预算代码删除

Ruitong Li, Binjie Guo, Aisheng Mo, Guowei Su, Han Wang, Jie Li, Ru Zhang

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI

AI总结 该研究针对验证者预算有限时的AI代码删除问题,提出DELSCOUT调度方法,结合静态与学习候选排序,提升已验证删除覆盖率并控制验证器调用,明确了模型、顺序与执行的分工。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00437 2026-08-04 cs.SE cs.AI 新提交 79%

Distilling Reasoning Traces into Advisory Prompts for Software Engineering Tasks

将推理痕迹提炼为软件工程任务的建议提示词

Faizan Faisal, Prem Devanbu, Toufique Ahmed

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本文受编程学习过程启发,提出将LLM推理痕迹提炼为建议提示词的方法,可减少LLM代码错误,部分提示词还能跨模型迁移,同时明确了方法适用场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27760 2026-07-31 cs.IR cs.AI 新提交 79%

Hierarchical Latent Reasoning for LLM-based Recommendation

面向基于大语言模型(LLM)的推荐系统的分层潜在推理方法

Peiyu Hu, Siying Gu, Weihai Lu, Zhuodong Liu, Yuntian Tang, Jiahao Liang, Yiying Xie, Jiang Rong, Zhaokai Luo, Zhiyong Wang, Jia Wang

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本文针对基于LLM的推荐系统提出分层潜在推理框架HiLaR,通过层感知强化优化提升推荐性能,在四个Amazon基准数据集上优于多种主流基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22314 2026-07-27 cs.LG 新提交 79%

Evolution-Aware MSA Reasoning for Subsampling via Factor Graphs

基于因子图的进化感知多序列比对抽样推理

Zhangzhi Xiong, Minzhang Li, Haotian Yu, Sixian Shen, Kexin Zhang, Mingrui Li, Jie Zheng, Kewei Tu, Jingyi Yu

机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 研究针对MSA抽样在有限预算下难以控制进化信号的问题,提出将其作为优化问题,引入基于亲和传播的因子图方法AP-REASONER,通过特定因子和控制旋钮进行推理,实验表明该方法在下游任务中表现优异,能可控恢复蛋白质构象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20129 2026-07-23 cs.AI 新提交 79%

CUSUM-Shaped Inference-Time Monitoring and Targeted Re-Decoding for Quantized Small Language Model Reasoning

用于量化小语言模型推理的CUSUM形状的推理时间监测和目标重解码

El Hassane Ettifouri, Ayoub Belfatmi, Mahaman Sanoussi Yahaya Alassan, Walid Dahhane

机构 * Novelis Research(诺贝丽斯研究中心)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 研究量化小语言模型推理时轨迹问题,提出MGT - B方法,通过映射窗口到概率、累积因子等操作监测并响应警报,经实验得出该方法对特定设置有一定效果,支持选择性监测与修复机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14242 2026-07-17 cs.CL 新提交 79%

Implicit Reasoning Steering via Concept Chaining

通过概念链进行隐式推理引导

Xiao Ye, Sanika Chavan, Yuxi Huang, Shahriar Kabir Nahin, Muhao Chen, Anshuman Chhabra, Ben Zhou

机构 * School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院) Department of Computer Science, University of California, Davis(加利福尼亚大学戴维斯分校计算机科学系)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 研究大语言模型推理脆弱性,提出概念链方法,通过生成连接段落继续预训练模型,使自然文本能引导模型预测,揭示推理脆弱性可被利用,为潜在偏差影响模型决策创造渠道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12455 2026-07-15 cs.AI cs.CE 新提交 79%

EVOQUANT: Self-Evolving Verifier-Guided Strategy Optimization for Robust Quantitative Trading

EVOQUANT:用于稳健量化交易的自进化验证器引导策略优化

Jie Mao, Changlun Li, Xiang Li, Qiqi Duan, Jinhui Yuan, Xiang Liu, Yuyu Luo, Jing Tang, Xiaowen Chu, Nan Tang

机构 * HKUST(GZ)(香港科技大学(广州)) Paradoox AI Research(悖论人工智能研究)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI

AI总结 研究针对量化策略优化多依赖人工且易出错的问题,提出EVOQUANT框架,利用大语言模型诊断瓶颈、生成候选编辑,经多阶段验证选最佳策略,能提炼经验持续改进,实验表明该方法有效提升夏普比率,为金融策略研究提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11598 2026-07-14 cs.AI 新提交 79%

Interaction Scaling: Grounding the Third Axis of Test-Time Compute

交互缩放:奠定测试时计算的第三轴基础

Bojie Li, Noah Shi

机构 * Pine AI(松树人工智能公司) University of Washington(华盛顿大学)

专题命中 测试时计算 :test-time compute(title);reasoning(abstract);分类 cs.AI

AI总结 研究测试时增加计算量的新方法,提出交互缩放概念,通过模型与外部仪器交互突破传统方法局限,在硬编码任务和视觉工件处理上展现优势,表明交互缩放真实且区别于推理和采样,需反馈和度量基于实际。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11317 2026-07-14 cs.AI cs.IT math.IT 新提交 79%

Calibrated e-CUSUM Decoding for Quantized Reasoning Models: Why Token Log-Probability Is the Wrong Observable for Decoding Monitors

用于量化推理模型的校准e-CUSUM解码:为何令牌对数概率不适用于解码监测

El Hassane Ettifouri, Ayoub Belfatmi, Mahaman Sanoussi Yahaya Alassan, Walid Dahhane

机构 * Novelis Research(诺贝丽斯研究公司)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 研究针对低比特量化推理模型思维链退化问题,指出用居中令牌对数概率监测解码不可行。提出结合退化感知警报分数与校准e过程检测器的解码控制器,经GSM8K实验验证其有效性及不足,给出方法层面的解释与替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07748 2026-07-10 cs.LG 新提交 79%

Selective Left-Shift: Turning Test-Time Compute and Difficulty-based Curation into Training Data for Low-Resource Code Generation

选择性左移:将测试时计算和基于难度的筛选转化为低资源代码生成的训练数据

Didula Samaraweera, Anjana Supun, Srinath Perera

机构 * WSO2

专题命中 测试时计算 :test-time compute(title);reasoning(abstract);分类 cs.LG

AI总结 针对低资源代码生成难题,提出三阶段管道,先将推理计算左移合成训练数据,再微调嵌入句法先验,最后用可验证奖励强化学习,相比现有方法提升性能,减少数据使用和成本,且能推广到新语言。

Comments 11 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03656 2026-07-07 cs.SE cs.AI cs.CR 新提交 79%

AutoCedar: An Agentic Framework for Verifier-Guided Access Control Policy Synthesis

AutoCedar:用于验证器引导的访问控制策略合成的智能体框架

Adarsh Vatsa, Sachi Shome, Yingming Zhou, William Eiers

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI

AI总结 研究针对大语言模型将自然语言需求转化为访问控制代码存在的问题,构建验证器引导系统AutoCedar,先转化需求为可检查目标,再合成Cedar策略,通过分解意图原子等实现端到端策略编写,在多任务和案例中表现良好。

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31825 2026-07-01 cs.CV cs.AI 新提交 79%

Breaking Failure Cascades: Step-Aware Reinforcement Learning for Medical Multimodal Reasoning

打破失败级联:面向医学多模态推理的步骤感知强化学习

Junha Jung, Minbyul Jeong, Suhyeon Lim, Sungwook Jung, Jaehoon Yun, Taeyun Roh, Mujeen Sung, Jaewoo Kang

机构 * Korea University(高丽大学) Upstage AI Kyung Hee University(庆熙大学) KAIST(韩国科学技术院) Hanyang University College of Medicine(汉阳大学医学院) AIGEN Sciences

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 提出步骤感知强化学习算法MRPO,通过为早期错误推理步骤分配指数级惩罚,打破失败级联,显著提升医学视觉问答准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08831 2026-06-30 cs.AI 新提交 79%

Inference-Time Conformal Reasoning with Valid Factuality Control for Large Language Models

面向大语言模型的推理时保形推理与有效事实性控制

Ting Wang, Yuanjie Shi, Yan Yan, Huan Zhang

机构 * Machine Learning, ICML(机器学习,国际机器学习大会)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 提出推理时保形推理框架,将保形预测集成到推理图生成中,通过图级不确定性校准生成停止阈值,实现有效事实性控制。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15633 2026-06-18 cs.LG 新提交 79%

Formalizing and Mitigating Structural Distortion in LLM Attention for Graph Reasoning

形式化并缓解大语言模型注意力中的结构失真以实现零样本图推理

Donald Loveland, Puja Trivedi, Ari Weinstein, Edward W Huang, Danai Koutra

机构 * University of Michigan(密歇根大学) Amazon(亚马逊)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本文形式化了大语言模型处理文本属性图时因图线性化导致的结构失真机制,并提出轻量级推理时修改方法GaLA,通过校正注意力偏差提升零样本图推理性能。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11609 2026-06-11 cs.CL 新提交 79%

Multi-Agent Reasoning with Adaptive Worker Allocation for Stance Detection

基于自适应工人分配的多智能体推理用于立场检测

Meysam Sabbaghan, Arman Zareian Jahromi, Doina Caragea

机构 * Kansas State University(堪萨斯州立大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 提出一种Manager-Worker多智能体框架,通过自适应分配工人智能体进行推理级合成,而非标签级投票,在隐式和上下文依赖的立场检测上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏