arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-14 至 2026-08-14 共收录 125 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 6 篇

2608.12331 2026-08-14 cs.CL cs.AI 新提交 88%

Thought-Aware KV Cache Compaction for Reasoning via Adaptive Attention Matching

基于自适应注意力匹配的思维感知KV缓存压缩方法用于推理

Yang Liu, Bin Chong, Chongyang Zhang, Hao Zheng, Jiayu Liang, Xu Kefu

机构 * Tsinghua University(清华大学) Peking University(北京大学) Soochow University(苏州大学)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对推理语言模型 KV 缓存的内存瓶颈问题,提出思维感知注意力匹配(TAM)方法,通过三种机制实现高效压缩,在降低内存占用的同时保持了推理准确率。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12348 2026-08-14 cs.DB cs.AI 新提交 77%

StreamReason-Bench: Can Large Language Models Reason about Event-Time Stream-Processing Semantics?

StreamReason-Bench:大型语言模型能否推理事件时间流处理语义?

Zhuoxi Wang

专题命中 数学推理 :CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 该研究构建了StreamReason-Bench基准测试,发现LLM在事件时间流处理语义推理任务上表现不佳,思维链可提升其性能,难点在于事件时间与延迟数据处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13517 2026-08-14 cs.CL cs.AI 新提交 74%

DFM Mimir v1: An Open HRM Delivering Frontier Performance at 1B Parameters Using Only Permissible Post-Training Data

DFM Mimir v1:仅使用许可的后训练数据,在10亿参数规模下实现前沿性能的开放HRM模型

Peter Schneider-Kamp, Jacob Nielsen, Gianluca Barmina, Kenneth Enevoldsen, Lukas Galke Poech

专题命中 数学推理 :reasoning(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究人员因大模型开发依赖非许可数据受阻,本文提出仅用许可后训练数据训练的10亿参数HRM模型Mimir v1,其在多基准测试中性能优于同规模HRM-Text 1B,可与更大前沿模型媲美,且在丹麦语任务达新SOTA,已发布于Hugging Face Hub

Comments Technical Report, 20 Pages, 1 Model, Hierarchical Reasoning Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13317 2026-08-14 cs.AI 新提交 70%

StateBridge: Training-free Hidden-state Alignment for Latent Communication in LLM Multi-Agent Systems

StateBridge:面向大语言模型多智能体系统潜在通信的无训练隐藏状态对齐

Yanwen Peng, Delvin Ce Zhang, Xi Wang, Nikolaos Aletras

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI

AI总结 StateBridge 是一种无训练的潜在通信方法,通过闭式正交变换对齐大语言模型多智能体的隐藏状态,在 26 个模型-任务对中 22 个取得最优或并列最优性能,优于基线。

Comments 18 pages, 3 figures, 4 tables, accepted by COLM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13129 2026-08-14 cs.AI 新提交 57%

Numeracy in Large Language Models: Fundamental Limitations and Paths to Improvement

大型语言模型中的数字能力:基本局限与改进路径

Aoxin Ni

机构 * University of Chinese Academy of Sciences(中国科学院大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对LLMs在基础数值任务中的不可靠性,提出数值基础框架(NGF)并结合三大基准评估前沿模型,给出改进数值能力的部署建议与研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08322 2026-08-14 cs.AI cs.HC math.CO 版本更新 57%

Agentic Neurosymbolic Collaboration for Mathematical Discovery: A Case Study in Combinatorial Design

代理神经符号协作用于数学发现:组合设计的一个案例研究

Hai Xia, Carla P. Gomes, Bart Selman, Stefan Szeider

机构 * Algorithms and Complexity Group, TU Wien(算法与复杂性组,维也纳技术大学) Department of Computer Science, Cornell University(计算机科学系,康奈尔大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过代理神经符号协作方法,在组合设计理论中发现了一个新的紧下界,展示了人类与AI协作在数学发现中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 3 篇

2608.12876 2026-08-14 cs.CV cs.AI 新提交 79%

SPARED: Reasoning-Based AI-Generated Image Detection via Adversarially Edited Data

SPARED:基于推理的AI生成图像检测方法,采用对抗编辑数据

Yicheng Bao, Xiahui Guo, Xuhong Wang, Xin Tan

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出对抗强化学习框架SPARED,通过扩散图像编辑器与推理型MLLM的交替博弈,训练出能抗捷径、泛化能力强的AI生成图像检测器,在三个外部基准上性能单调提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09538 2026-08-14 cs.CL cs.AI 版本更新 62%

TCS-BENCH: Benchmarking State-of-the-Art Generative AI Theoretical Computer Science Research Ability

TCS-BENCH:评估最先进生成式AI理论计算机科学研究能力的基准

Vincent Cohen-Addad, Dimitris Paparas, Ernest van Wijland, Max Springer, Julien Canitrot-Paradis, Honghao Lin, David Woodruff, Adarsh Kumarappan, Rajesh Jayaram, Rudrajit Das, Lalit Jain, Ola Svensson, Silvio Lattanzi, Mislav Balunovic, Theophane Weber, Vahab Mirrokni

专题命中 代码与定理证明 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 研究人员推出TCS-Bench基准,基于STOC、FOCS、SODA论文的定理证明任务评估LLMs,结合验证智能体,参考验证器在专家标注集准确率超90%,为评估生成式AI的TCS研究能力提供工具

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13077 2026-08-14 cs.SE 新提交 50%

How Powerful are LLMs in Generating Formal Program Specifications?

大型语言模型在生成形式化程序规约方面的能力有多强?

Fanpeng Yang, Xing Li, Shuling Wang, Jie An, Zeyu Sun, Shenghua Feng, Wenhan Wang, Weiyi Wang, Naijun Zhan, Fanjiang Xu

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 该研究引入基于Rocq的Coins评估框架,在HumanEval数据集上开展大规模研究,发现LLMs生成形式化程序规约仍具挑战,准确的规约评估是理解其能力的核心。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 9 篇

2608.12325 2026-08-14 cs.AI cs.CL cs.LG 新提交 82%

Position: Reasoning is a Learnable Rule-Based Process

立场:推理是一个可学习的基于规则的过程

Rachel Lawrence, Jacqueline Maasch

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出推理是可学习的基于规则的过程,针对生成式AI社区推理定义模糊问题,给出操作定义与研究交流最佳实践清单,以保障推理评估的结构效度。

Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12374 2026-08-14 cs.CL cs.AI 新提交 82%

Are you Talking Logic to Me? Assessing Language Models Syllogistic Reasoning Capabilities

你在跟我讲逻辑吗?评估语言模型的三段论推理能力

Hanna Abi Akl, Fabien Gandon, Catherine Faron, Pierre Monnin

机构 * Université Côte d’Azur(科特阿祖尔大学) Inria(法国国家信息与自动化研究所) CNRS(法国国家科学研究中心) I3S(信息科学与系统实验室) Data ScienceTech Institute(数据科学技术学院)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究通过扩展FOLIO和P-FOLIO数据集,探究不同KR符号对SLMs三段论推理的影响,提出SEF分类法并开源CLGC框架,为提升小型模型推理能力提供了新方法。

Comments Accepted to the International Joint Conference on Rules and Reasoning (RuleML+RR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13268 2026-08-14 cs.PL cs.LO 新提交 78%

Multiobjective Preexpectation Reasoning for Probabilistic Programs

概率程序的多目标预期望推理

Lena Verscht, Hannah Mertens, Kevin Batz, Sebastian Junges, Benjamin Lucien Kaminski, Joost-Pieter Katoen

专题命中 逻辑推理 :reasoning(title);planning(abstract)

AI总结 针对带非确定性的概率程序规划问题,提出多目标预期望变换器及对应策略综合规则,构建了无限MDP上多目标优化的程序层面符号方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12486 2026-08-14 cs.CL 新提交 77%

DIVE: Unlocking Self-Improvement in Frozen Language Models Through Diversity-Driven Skill Evolution

DIVE:通过多样性驱动的技能进化解锁冻结语言模型的自我提升

Siheng Xiong, Ali Payani, Oguzhan Gungordu, Faramarz Fekri

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 DIVE是一种多样性驱动的无参数框架,可让冻结LLM从任务经验和验证器反馈中进化出自然语言技能,在多项推理任务上优于现有方法,还能实现模型间技能迁移,让小模型性能匹配或超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12426 2026-08-14 cs.AI cs.CL 新提交 73%

Large Language Models Can Follow Instructions, But Not Many at Once: Phase Transitions in Compositional Constraint Satisfaction

大语言模型能遵循指令,但无法同时遵循太多:组合约束满足中的相变

Mariya I. Vasileva

机构 * Meta Superintelligence Labs(元超级智能实验室)

专题命中 逻辑推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出约束饱和评估基准,发现大语言模型在同时遵循5-6个以上指令约束时可靠性崩溃,不同类型约束的性能下降幅度存在差异,失败呈近独立的乘法累积效应。

Comments 35 pages, 7 figures, 13 tables. Reviewed in the ARR May 2026 cycle

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12599 2026-08-14 cs.AI cs.LG 新提交 62%

Dead text or binding clause? Measuring and restoring constraint influence in black-box LLM dialogues

无效文本还是绑定条款?测量并恢复黑盒大语言模型对话中的约束影响

Haoyuan Zhu

机构 * University of Sheffield(谢菲尔德大学)

专题命中 逻辑推理 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对黑盒大语言模型对话中撤销约束失效的问题,提出 sysname 方法,通过合约账本、顺序消融探针和修复阶梯实现复发率的测量、预测与修复,降低了约束撤销的失效概率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13450 2026-08-14 cs.SE cs.CR cs.LG 新提交 57%

LLM-Assisted Dynamic Threat Analysis for Attacker-Reachable Software Weaknesses in Autonomous Vehicles

大语言模型辅助的自动驾驶车辆中攻击者可及软件弱点的动态威胁分析

Md Wasiul Haque, Sagar Dasgupta, Mizanur Rahman, Md Rayhanur Rahman

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 该研究针对自动驾驶车辆软件弱点的动态威胁分析难题,探究LLM辅助Autoware的自动化测试工件生成,发现构建集成是核心障碍,推理模型编译测试用例的表现优于代码专用模型。

Comments 17 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11344 2026-08-14 cs.CY cs.AI q-fin.RM 版本更新 57%

Governing Agentic AI in FinTech

金融科技中智能体人工智能的治理

Henry Han

专题命中 逻辑推理 :verifier(abstract);分类 cs.AI

AI总结 针对金融科技中智能体AI治理研究不足的问题,构建多层次治理理论,通过三项研究验证其机制,发现可验证性缺口是核心约束,该框架可扩展至其他高风险领域。

Comments 58 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03421 2026-08-14 cs.MA 版本更新 50%

When Truth Is Distributed: Misinformation Derails Collective Fact Recovery in LLM-Based Multi-Agent Systems

当真相被分散时:错误信息会破坏基于大语言模型(LLM)的多智能体系统中的集体事实恢复

Chenfei Yan, Zeyang Yue, Feifei Zhao, Erliang Lin, Lu Jia, Haibo Tong, Mingyang Lyu, Chengyi Sun, Yi Zeng

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本研究提出Hi-Agreement评估框架,发现基于LLM的多智能体系统中,关键证据持有者的虚假证词会破坏集体事实恢复,使恢复率从72.50%降至14.17%,且虚假证据会持续传播。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 21 篇

2608.13221 2026-08-14 cs.AI 新提交 89%

TsuGO: Probing Search Efficiency in LLM Reasoning via Go Life-and-Death Problems

TsuGO:通过围棋死活问题探究大语言模型推理中的搜索效率

Shunwen Bai, Ziping Ma, Chaoyang Zhang, Yarong Wang, Jiale Liu, Zhen Qin, Qingpei Guo

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);CoT(abstract,abstract_cn);分类 cs.AI

AI总结 本研究提出围棋死活问题基准TsuGO,发现现有LLM的推理搜索组织能力远逊于神经引导的KataGo,指出搜索组织是LLM推理评估的缺失维度。

Comments 23 pages, 12 figures, 20 tables, 2 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12877 2026-08-14 cs.AI 新提交 83%

ReflectFact: Self-Reflective Agents for Improving Comprehension and Reasoning in Multi-Hop Fact Verification

ReflectFact:用于提升多跳事实验证中理解与推理能力的自反思智能体

Runze Zhao, Zixin Tang, Xiaoshuai Hao, Leyuan Chang, Xiaopeng Fu, Boyu Qiao, Dongyang Zhang

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 针对多跳事实验证中智能体推理偏离目标及参数知识与证据冲突的问题,提出自反思智能体框架ReflectFact,经HOVER、EX-FEVER实验,性能优于最强基线。

Comments 9 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17045 2026-08-14 cs.CL 版本更新 83%

Large Language Models Persuade Without Planning Theory of Mind

大语言模型无需规划即可说服理论之心理论

Jared Moore, Rasmus Overmark, Ned Cooper, Beba Cibralic, Nick Haber, Cameron R. Jones

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 大语言模型通过战略性揭示信息说服目标,无需显式理论之心推理,实验显示其在说服任务中表现优于人类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12626 2026-08-14 cs.CL cs.AI cs.MA 新提交 82%

LLMs Are Not Good Strategists, Yet Memory-Enhanced Agency Boosts Reasoning

大型语言模型(LLMs)并非优秀的战略家,然而记忆增强的智能体可提升推理能力

Yi Wu, Zhimin Hu

机构 * University of Chicago(芝加哥大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI;planning(journal_ref)

AI总结 该研究针对LLM在长时环境中战略推理的缺陷,提出EpicStar框架,结合跨回合记忆与动态门控机制,在星际争霸II测试中实现更高胜率且令牌消耗大幅减少。

Journal ref Published at Reasoning and Planning for LLMs at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12751 2026-08-14 cs.AR cs.AI 新提交 79%

SynAct: A Reasoning-Acting Large Language Model Agent for Adaptive Synthesis Optimization

SynAct:用于自适应综合优化的推理-行动大语言模型智能体

Fangzhou Liu, Peiyi Han, Jiawei Liu, Yuan Pu, Zhuolun He, Rongliang Fu, Tsung-Yi Ho, Bei Yu

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 SynAct是一种自适应闭环LLM推理-行动智能体,通过结合电路状态、工具知识与历史经验发布针对性命令,在14个商用设计实验中将平均WNS降至引导式综合的27%,实现高效自适应逻辑综合优化。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12372 2026-08-14 cs.AI cs.CY 新提交 79%

Position: We Need Practical AI Alignment Methods to Mirror Human Reasoning

立场:我们需要实用的AI对齐方法来镜像人类推理

Vijay Keswani, Breanna K. Nguyen, Cyrus Cousins, Vincent Conitzer, Walter Sinnott-Armstrong, Jana Schaich Borg

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 该论文提出需实用AI对齐方法镜像人类推理,指出认知对齐可提升AI可理解性与可信赖度,提出研究议程以缩小现有对齐方法与认知对齐需求的差距,助力用户信赖AI系统。

Comments Accepted in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12920 2026-08-14 cs.CV 新提交 78%

TennisVAR: A Stroke-Evidence-Grounded Multimodal Large Language Model for Tactical Reasoning in Tennis Videos

TennisVAR:一种基于击球证据的多模态大语言模型,用于网球视频中的战术推理

Yifan Mei, Qingling Shi, Changli Wu, Jiayuan Rao, Jiayi Ji, Liujuan Cao

专题命中 规划推理 :reasoning(title,abstract)

AI总结 该研究针对网球视频理解的感知与理解差距,提出回合级战术推理任务,构建专家标注基准TRACE,开发基于证据的多模态大语言模型TennisVAR,实现网球视频的战术推理。

Comments Project Page: https://whynotgit2025.github.io/TennisVAR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12915 2026-08-14 cs.DC cs.AI 新提交 74%

InFactPlanner: Planning Sustainable Geo-Distributed LLM Data Centers

InFactPlanner:可持续地理分布式大语言模型(LLM)数据中心规划

Nicoletta Tsiopani, Moysis Symeonides, George Pallis, Marios D. Dikaiakos

专题命中 规划推理 :planning(title);分类 cs.AI

AI总结 InFactPlanner是用于LLM推理的可持续地理分布式数据中心部署假设分析的决策支持框架,可通过多维度建模分析得出可持续性与延迟最优选择存在差异等结论。

Comments Author copy of paper published at 34th International Symposium on the Modeling, Analysis, and Simulation of Computer and Telecommunication System (MASCOTS2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28166 2026-08-14 cs.CL cs.AI 版本更新 73%

Commit Locally, Exit Globally: Coordinating Adaptive Sampling and Early Exit in Diffusion Language Models

提交时机与位置:扩散语言模型的候选感知解码

Chia-Ming Lee, Shao-Kai Liu, Ming-Ching Chang, Xin Li, Yu-Lun Liu, Chih-Chung Hsu

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) University at Albany, SUNY(纽约州立大学奥尔巴尼分校)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对扩散语言模型解码过早终止问题,提出无训练的候选感知提前退出框架LATCH,结合CVC与BWEC,在零样本11项任务上,以准确率损失极小的代价实现多倍解码速度提升。

Comments Code is available at https://github.com/ming053l/C4-dLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22651 2026-08-14 cs.LG cs.AI cs.CE cs.MA 版本更新 73%

Automated Design Optimization via Strategic Search with Large Language Models

通过大语言模型的战略搜索实现自动化设计优化

Anthony Carreon, Vansh Sharma, Venkat Raman

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出AUTO框架,利用大语言模型的战略搜索实现GPU代码优化,提升搜索效率并降低成本。

Comments 16 pages, 4 tables, 8 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12854 2026-08-14 cs.RO cs.AI cs.CV 新提交 70%

BrainWAM: Action-Space Coordination of Semantic Priors and Predictive Dynamics for Autonomous Driving

BrainWAM:面向自动驾驶的语义先验与预测动力学的动作空间协调框架

Bing Zhan, Shuyao Shang, Jiahao Gu, Shuo Lu, Yuan Xu, Zhao Wang, Yida Wang, Xueyang Zhang, Kun Zhan, Lue Fan, Zhaoxiang Zhang

机构 * Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) Li Auto Inc.(理想汽车)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 该研究针对自动驾驶中语义与预测动力学的规划需求,提出BrainWAM框架,通过结构化动作空间协调及异步整流流推理,在NAVSIM数据集上实现最优性能,优于仅VLA或仅WAM方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11753 2026-08-14 cs.CL 版本更新 70%

Agentic Aggregation for Parallel Scaling of Long-Horizon Agentic Tasks

代理聚合用于长周期代理任务的并行扩展

Yoonsang Lee, Howard Yen, Xi Ye, Danqi Chen

机构 * Princeton Language and Intelligence, Princeton University(普林斯顿大学语言与智能实验室)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出AggAgent,通过将并行轨迹视为环境,有效解决长周期代理任务中轨迹信息聚合问题,提升性能并降低开销。

详情

展开后加载摘要…

URL PDF HTML 收藏