arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-05 至 2026-08-05 共收录 103 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 5 篇

2608.03550 2026-08-05 cs.AI 新提交 92%

Soft Guidance Starts to Outperform CoT Prompting as LLMs Improve

随着大型语言模型(LLM)性能提升,软引导开始优于思维链(CoT)提示

Denys Pushkin, Albert Q. Jiang, Aryo Lotfi, Colin Sandon, Emmanuel Abbé

专题命中 数学推理 :CoT(title,title_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 该研究发现,随着LLM性能提升,标准CoT提示的干扰作用凸显,推理专用模型在零样本设置下的数学推理性能优于少样本CoT提示。

Comments 10 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03068 2026-08-05 cs.CL cs.AI cs.LG 新提交 82%

CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning

CVPO:通过值方差自适应与动态课程学习增强大语言模型的强化学习推理能力

Ziqi Jia, Yalu Ouyang, Bo Pang, Panpan Li, Hangfei Xu, Shengzhao Wen, Shiyong Li, Yanpeng Wang

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM强化学习推理中反馈精度不足与问题难度漂移问题,提出CVPO方法,通过值方差自适应与动态课程学习优化,在数学任务上性能优于VAPO等基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03447 2026-08-05 cs.LG cs.AI 新提交 62%

Approximate Speculative Decoding

近似投机解码

Yuannuo Feng, Zegang Peng, Yuxin Xie, Yubing Ye, Yizhe Chen, Wenshuai Yao, Wenyong Zhou, Wang Kang

专题命中 数学推理 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出无需训练的Approximate Speculative Decoding(ASD),通过带预算的最长前缀选择优化投机解码,提升了生成吞吐量与验证器接受率,且无需新草稿模型或微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02867 2026-08-05 cs.CL cs.AI 新提交 62%

BODHI: Do LLMs Branch Out and Discover Heterogeneous Inferences?

BODHI:大型语言模型是否会分支拓展并发现异构推理?

Soumadeep Saha, Krish Sharma, Akshay Chaturvedi, Nicholas Asher

机构 * ANITI, Université de Toulouse(图卢兹大学ANITI) LINAGORA Labs(LINAGORA实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究通过迷宫求解实验和BODHI-Trees分析,发现RLVR训练的LLMs存在策略熵崩溃,其采样效率提升以推理分支多样性下降为代价。

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02942 2026-08-05 cs.CL 新提交 57%

OPTD: On-Policy Transition Distillation with Consistency-Guided Adaptive Compression for Few-Step Diffusion Language Models

OPTD:用于少步扩散语言模型的一致性引导自适应压缩的策略内转换蒸馏

Xiaocheng Lu, Hualei Zhang, Shuhan Guo, Jie Zhang, Xiaoyi Pang, Jian Liu, Haoxi Li, Bohai Gu, Haoxuan Che, Jingcai Guo, Song Guo

机构 * HKUST(香港科技大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 针对少步扩散语言模型现有离线策略蒸馏的轨迹不匹配问题,提出 OPTD 策略内转换蒸馏方法,在四个推理基准上改善质量效率权衡并取得最优质量约束 AUP。

Comments 9 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 2 篇

2608.03291 2026-08-05 cs.LG cs.AI cs.CL 新提交 93%

The Tell-Tale Trace: Detecting Reasoning Failures in LLMs Using Chain-of-Thought Dynamics

可察觉的轨迹:利用思维链动态检测大语言模型中的推理失败

Shashwat Sourav, Aishwarya Balwani

专题命中 代码与定理证明 :chain-of-thought(title,abstract);CoT(summary_cn,abstract);reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究利用思维链动态特性,在不假设语言化CoT语义忠实性的情况下,检测大语言模型在布尔可满足性任务中的分布式推理失败,并通过针对性提示干预提升了Llama3-70B的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02774 2026-08-05 cs.CR cs.AI 新提交 57%

Privacy-Preserving AI Verification via Minimal Information Disclosure

通过最小信息披露实现隐私保护的AI验证

Sleem Abdelghafar, Gabriel Kulp

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 该研究提出最小信息披露(MID)方法,通过条件互信息衡量AI验证中的附带泄露,在多项验证任务中实现完美验证且零附带泄露,并支持基于Groth16 zk-SNARK的ZKP认证发布。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 6 篇

2608.03506 2026-08-05 cs.AI stat.ML 新提交 83%

When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMs

当存在多个有效答案时,投票会失效:针对大语言模型中K选1最佳因果推理的符号验证

Omatharv Bharat Vaidya, Connor Thomas Jerzak, Zayne Rea Sprague, Fangcong Yin, Nhat Ho

专题命中 逻辑推理 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 针对大语言模型因果推理中多有效答案下投票失效的问题,提出无需训练的符号验证器CALVER,在CLEAR数据集等场景下显著提升了推理选择准确率。

Comments 28 pages, 5 figures, 28 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03450 2026-08-05 cs.MM cs.AI cs.CL cs.CV 新提交 82%

Balancing Efficiency and Efficacy: Training-Free Attention-Guided Switching Between Explicit and Latent Thoughts for MLLMs

平衡效率与效能:面向多模态大语言模型(MLLM)的无训练注意力引导式显式与隐式思维切换

Haoqian Kang, Liupeng Li, Kuofeng Gao, Jinpeng Wang, Zhenyu Lu, Bin Chen, Ke Chen, Yaowei Wang

专题命中 逻辑推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 针对MLLM推理中感知与逻辑混淆的问题,提出无训练的注意力引导式切换框架,通过视觉-文本注意力比率自适应切换显式与隐式推理,实现性能与效率的双重提升。

Comments Accepted by ACM MM 2026. 10 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02662 2026-08-05 cs.LG cs.AI 新提交 81%

Verifier-Guided Model Discovery for Physical Dynamical Systems with Pretrained Symbolic Transformers

基于预训练符号 Transformer 的物理动力系统验证器引导式模型发现

Farbod Faraji, Francesco Belardinelli

机构 * Imperial College London(伦敦帝国学院)

专题命中 逻辑推理 :verifier(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出了一种验证器引导式(VG)工作流程,基于预训练符号 Transformer ODEFormer 实现物理动力系统的可解释预测,在范德波尔振荡器和涡旋脱落场景中展现出优于原方法的性能与泛化能力。

Comments 33 pages, 13 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03154 2026-08-05 cs.CL 新提交 57%

ANCHOR-RE: An Agentic Neuro-Symbolic Framework for Grounded Biomedical Relation Extraction

ANCHOR-RE:用于接地生物医学关系抽取的智能体神经符号框架

Shufan Ming, Yikun Han, Gibong Hong, Rui Zhang, Halil Kilicoglu

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 该研究提出ANCHOR-RE框架,将本体引导推理等集成到LLM推理中,在多个BioRE基准及2026年生物医学文章数据集上,该框架性能优于直接LLM提示及部分现有方法,是实用的无训练生物医学文献挖掘方法。

Comments Submitted to Journal of Biomedical Informatics (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03137 2026-08-05 cs.AI 新提交 57%

Verifiable Memory: Learning Unified Memory Management with Local and Global Verifiers for Large Language Model Agents

可验证记忆:为大语言模型智能体学习结合局部与全局验证器的统一记忆管理

Xiaolong Sun, Qichao Wang, Hangyu Li, Liang Chen

专题命中 逻辑推理 :verifier(abstract);分类 cs.AI

AI总结 提出VerMem框架,用含七个原子操作的统一策略管理LTM等状态,结合局部与全局验证器训练,在多基准测试中性能与效率均优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03558 2026-08-05 cs.SE 新提交 50%

EffiHolmes: Differential Profiling-Guided Repository Level Time Inefficiency Fix Localization

EffiHolmes:基于差分分析的仓库级时间低效修复定位

Haowen Yang, Yun Peng, Zishuo Ding

专题命中 逻辑推理 :reasoning(abstract)

AI总结 EffiHolmes是基于LLM的仓库级时间低效修复定位框架,通过差分分析等技术提升定位精度,在RepoEffi-Bench上优于多种基线方法,且跨模型规模稳健。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026). 13 pages, 3 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 20 篇

2608.03034 2026-08-05 cs.RO cs.AI 新提交 85%

PACE: Adaptive Budget Allocation for Time-Efficient Embodied Planning

PACE:面向时间高效具身规划的自适应预算分配

Yuchen Huang, Xijiang Ying, Zhenhua Ma, Xiaxiang Yuan, Zhijie Gao, Jiayi Huang, Ruichi Mao, Jiazheng Zhang, Hongsheng Ti, Maotao Tian, Rong Shi, Lu Zhao, Shizhuang Zhang, Zhuo Cui, He Wang, Ling Liu, Wei Zhang

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 PACE框架通过交错式思考-执行架构和动态预算分配器,在Robotouille基准测试中较ReAct+Think基线提升规划成功率,同时大幅减少推理时间,实现具身规划的时间效率与质量同步提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02650 2026-08-05 cs.AI cs.SE 新提交 83%

HyperAgent: Planning and Acting over Tool-Schema Hypergraphs for Tool-Use LLM Agents

HyperAgent:面向工具-模式超图的规划与执行,用于工具使用型大语言模型智能体

Zian Zhai, Xingyu Tan, Gaowang Zou, Xiaoyang Wang, Wenjie Zhang

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 HyperAgent是一种基于工具-模式超图的LLM智能体框架,通过构建相关图引导任务规划与执行,在AppWorld实验中提升了任务完成性能并降低了资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03779 2026-08-05 cs.CV 新提交 82%

AgenticVAU: Multi-Agent Explore-Verify Reasoning for Video Anomaly Understanding

AgenticVAU:用于视频异常理解的多智能体探索-验证推理框架

Yuxiang Duan, Huining Li, Ao Li, Shuai Feng, Lanju Kong, Ning Liu, Jian Zhang, Xingdong Sheng, Yuntao Du

专题命中 规划推理 :reasoning(title,abstract);planning(abstract)

AI总结 本文提出无需训练的多智能体框架AgenticVAU,通过四个专门智能体协作完成视频异常理解的探索-验证过程,在VAU-Bench数据集上优于零样本推理及强化学习基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03735 2026-08-05 cs.MA cs.CL 新提交 79%

An Actionable Diagnosis of Multilingual, Multi-Agent Planning Failures

多语言多智能体规划失败的可操作诊断

Vikas Pahuja, Jonathan Brokman, Omer Hofman, Tamir Nizri, Daniel Vishna, Seraphina Goldfarb-Tarrant, Kelly Marchisio, Hisashi Kojima, Roman Vainshtein

专题命中 规划推理 :planning(title,abstract);分类 cs.CL

AI总结 本研究针对多语言多智能体系统在非英语场景下的规划失败问题,提出规划-接地失败分类法,开发TART方法,在多语言任务中显著提升了现有系统的性能。

Comments 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03468 2026-08-05 cs.AI 新提交 79%

ToolLIFT: Lifting Tool-Specific Trajectories into Function-Level Graphs for Generalizable Tool Planning

ToolLIFT:将工具特定轨迹提升为函数级图以实现可泛化的工具规划

Xiuhui You, Jiayi Luo, Zichao Shen, Qingyun Sun, Ziwei Zhang

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出ToolLIFT框架,通过将工具特定轨迹提升为函数级工作流图,实现了更具泛化性的工具规划,在多个基准上优于现有方法,对未见过的工具集泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03028 2026-08-05 cs.AI 新提交 79%

Evaluating Counterfactual Sensitivity to Patient Information in Medication-Safety Reasoning

评估药物安全推理中对患者信息的反事实敏感性

Zhitian Hou, Yuhang Liu, Pengkai Wang, Zeyu Liu, Guanghao Zhu, Zheng Liu, Shuo Cai, Congkai Xie, Zhijie Sang, Kun Zeng, Hongxia Yang

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究推出MedPIC-Bench基准,评估不同LLM在药物安全推理中对患者信息的反事实敏感性,发现所有模型在反事实问题上表现更差,医学专用LLM的反事实表现落后于通用LLM,凸显静态准确性的评估局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03408 2026-08-05 cs.RO cs.DC 新提交 78%

Flying over The Uncertain Nature (FORTUNE): Intelligent and Humanistic 3D Path Planning for Low-Altitude Collaboration

飞越不确定性自然(FORTUNE):面向低空协同的智能且人文的三维路径规划

Minghui Liwang, Wenhan Jia, Xinlei Yi, Wenbo Zhu, Yuhan Su, Xianbin Wang

专题命中 规划推理 :planning(title,abstract)

AI总结 本文针对低空智能体的三维多无人机路径规划问题,提出FORTUNE分层离线-在线框架,其在真实与合成场景中性能优于现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03169 2026-08-05 cs.CR cs.SE 新提交 78%

Test-time reasoning effort and unauthorized tool use in language-model agents: a prespecified equivalence study

语言模型智能体的测试时推理工作量与未授权工具使用:一项预先指定的等效性研究

Xiaonan Xu, Wenjing Wu

专题命中 规划推理 :reasoning(title,abstract)

AI总结 该研究在GPT-5.6上开展预先指定的等效性研究,发现调整推理工作量未导致未授权工具使用,且规则探测率上升的模式与针对性搜索假设不符。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02974 2026-08-05 cs.SE 新提交 78%

ConFL: Explainable Concurrent Fault Localization via Hierarchy-Guided LLM Reasoning

ConFL:基于层次引导大语言模型推理的可解释并发故障定位框架

Shuai Shao, Dingbang Wang, Yiming Zeng, Tingting Yu

专题命中 规划推理 :reasoning(title,abstract)

AI总结 ConFL是一种可解释的并发故障定位框架,通过构建并发知识库与LLM引导的层次检索,在8个Java项目的并发漏洞实验中,其MRR达0.503、MAP达0.486,性能优于同类基线方法且鲁棒性良好。

Comments Accepted at ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03502 2026-08-05 cs.AI cs.LG cs.MA 新提交 73%

Hybrid LLM-Augmented Reinforcement Learning Agents for Complex Sequential Decision Tasks

用于复杂序列决策任务的混合大语言模型增强强化学习智能体

Christophe D. Hounwanou, John Emeka Eze, Yaé Ulrich Gaba

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出混合LLM增强RL智能体,融合LLM规划与RL动作优化,经实验验证其在序列决策任务上优于仅RL、仅LLM的基线方法,为构建更强自主系统提供了新方向。

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03868 2026-08-05 cs.LG cs.AI 新提交 62%

GENESIS: Towards Explainable Causal Discovery

GENESIS:迈向可解释的因果发现

Abhinav Thorat, Ravi Kumar Kolla, Vishak K Bhat, Harsh Vardhan Singh Chauhan, Niranjan Pedanekar

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出可解释混合因果发现框架GENESIS,实现100%决策可追溯性,在多数基准数据集上性能优于纯统计方法,可与先进LLM辅助方法媲美。

Comments 13 pages, 2 figures, 13 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03263 2026-08-05 cs.LG cs.AI 新提交 62%

The Ignition Is Real, and It Lives at the Readout: Latent composition, difficulty-clocked ignition, and the interface-constituted commit in a recurrent-depth reasoner

激活是真实存在的,且存在于读出层:循环深度推理器中的潜在组成、难度驱动的激活以及由界面构成的提交

Simon Lam-Muir

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究验证潜在推理模型的“组成激活”为真实计算,复现30M参数循环深度推理器,发现激活存在于读出层,决策时边际跃升,隐藏状态方向突变后冻结,撤回早期速度低谷声明。

Comments 9 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03958 2026-08-05 cs.AI 新提交 57%

A game theory for foundation models shows new paths to rational cooperation through similarity inference

基础模型的博弈论:通过相似性推理实现理性合作的新路径

Alexander Meulemans, Maciej Wołczyk, Marissa A. Weis, Rajai Nasser, Roberta Rocca, Seijin Kobayashi, Guillaume Lajoie, Angelika Steger, Blake Richards, Marcus Hutter, James Manyika, Rif A. Saurous, João Sacramento, Blaise Agüera y Arcas

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出针对基础模型智能体的嵌入贝叶斯智能体理论模型,通过嵌入均衡机制实现相似性推理,破解经典博弈论预测的社会困境中相互背叛问题,达成稳定合作。

Comments 75 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03918 2026-08-05 cs.CV cs.AI 新提交 57%

When and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video Understanding

何时与何地查看:用于高效长视频理解的自适应视觉证据调度

Ke Li, Jiayu Chen, Maoliang Li, Zihao Zheng, Hailong Zou, Hengyi Zhang, Xuanzhe Liu, Xiang Chen

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出无需训练的EcoFrame框架,通过熵门控预算调度和注意力引导候选提议实现高效视觉证据调度,在多个长视频理解基准上实现精度与效率的更优权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03420 2026-08-05 cs.AI 新提交 57%

Towards Improving Sequential Decision-Making in LLM Agents via Experience Memory

基于经验记忆提升大语言模型智能体的序列决策能力

Jakub Rada, Viliam Lisý

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对LLM智能体序列决策性能不足的问题,提出带经验记忆的智能体框架,通过对局后反思与规则提取,在不修改模型权重的情况下提升了井字棋任务的表现。

Comments 8 pages, 6 figures, 14 tables, 5 appendices, accepted at Neuro-Symbolic Intelligence for LLMs and Autonomous Agents workshop at IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03413 2026-08-05 cs.AI cs.ET 新提交 57%

Enactive Artificial Intelligence: A Decision-Centric Architecture for Complex Systems

能动人工智能:面向复杂系统的以决策为中心的架构

Zuojun Max Shen, Yuan Qu, Pujun Zhang, Anbang Liu, Yunhao Liang

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出能动人工智能框架,通过组织世界、站点世界等四个角色构建以决策为中心的架构,拓展AI前沿,为企业与工业复杂系统的可靠AI部署提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03190 2026-08-05 cs.AI 新提交 57%

TumorBoard: Evidence-Grounded Multi-Agent Decision Support for Longitudinal Neuro-Oncology

TumorBoard:基于证据的多智能体纵向神经肿瘤学决策支持系统

Yantong Liu, Zheyu Zhang, Runpeng Liu, Mu Xitang, Seong-Yoon Shin, Hyun-Ae Lee

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 TumorBoard是基于证据的多智能体纵向神经肿瘤学决策支持系统,经360例基准测试,其性能优于现有基线,安全管控模块可有效降低有害建议比例。

详情

展开后加载摘要…

URL PDF HTML 收藏