arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-04 至 2026-08-04 共收录 156 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 15 篇

2608.00533 2026-08-04 cs.CL cs.AI cs.LG 新提交 89%

Native Multilingual Chain-of-Thought Reasoning in Low-Resource Southeast Asian Languages

低资源东南亚语言中的原生多语言思维链推理

Sean Gip Lim, William Chandra Tjhi, Hai Leong Chieu

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对低资源东南亚语言大模型推理的跨语言崩溃与微调瓶颈,提出OSCD算法,结合翻译智能体循环与联合嵌入语义对齐,在AIME25等基准上实现数学推理的显著提升。

Comments 22 pages, 16 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01922 2026-08-04 cs.CL 新提交 83%

TRAM: Enhancing Multimodal Reasoning with Trajectory-Derived Auxiliary Memory

TRAM:利用轨迹衍生辅助记忆增强多模态推理

Kang Liu, Zijing Wang, Yongkang Liu, Mengjie Zhao, Xiaocui Yang, Shi Feng, Yifei Zhang, Daling Wang

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 TRAM是一种无需训练的多模态推理增强方法,通过轨迹衍生辅助记忆整合推理信息,在4种MLRM变体的8个基准测试中提升了多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02149 2026-08-04 cs.AI 新提交 79%

Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning

超越均值:面向大语言模型推理的多时刻策略优化

Yijun Zhang, Yule Xie, Jiaxin Ding, Xin Ding, Fan Xu, Haoxiang Zhang, Luoyi Fu

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文针对大语言模型推理提出多时刻策略优化(MMPO)框架,联合最小化失败概率分布的多个矩,在五个数学推理基准上优于基线方法,为策略优化目标设计提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02026 2026-08-04 cs.AI 新提交 79%

HPFA: Hypergraph-Based Paired Failure Attribution for LLM Reasoning

HPFA:基于超图的大语言模型推理配对失败归因

Runchuan Zhu, Hongbin Lai, Bowen Jiang, Junrui Zhang, Zhangheng LI, Ostap Kilbasovych, Junyuan Hong

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究针对LLM推理的失败归因缺陷,提出HPFA框架,通过超图配对分析高效定位根本原因,提升归因准确率与效率,训练的归因器可改善推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01631 2026-08-04 cs.CL 新提交 79%

Does Accuracy Equal Evidence? Reasoning Faithfulness under KV Cache Compression

准确率等同于证据吗?KV缓存压缩下的推理忠实性

Mengting Ai, Jingrui He, Yue Guo

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 该研究针对大型推理模型,发现KV缓存压缩中存在答案-证据差距,即令牌驱逐类方法可保留高准确率却大幅降低推理忠实性,而量化方法受影响更小,表明失效源于推理轨迹部分丢失。

Comments https://github.com/famous-blue-raincoat/Safe_KV_Compress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01593 2026-08-04 cs.AI 新提交 79%

Latent Thought Credit: Multi-Answer Credit Assignment for Latent Reasoning

潜思维信用:面向潜推理的多答案信用分配

Xuyang Zhao, Liting Zhang, Zichen Xu, Yong Chen, Wenjia Zeng, Shiwan Zhao, Qicheng Li

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究针对潜推理的信用分配难题,提出LTC分层框架,结合多答案估计与GRPO在线策略训练,在数学推理等任务上取得最优平均准确率,可降低奖励估计误差并缓解思维级信用问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00605 2026-08-04 cs.AI 新提交 79%

Escaping Confidence Trap: Evolutionary Decoding for Mathematical Reasoning in Diffusion LLMs

逃离置信陷阱:扩散大语言模型数学推理的进化解码

Zhenhong Sun, Hanqing Zhao, Yatao Bian, Rongcheng Tu, Liuyue Xie, Xu Zhang, Jue Wang, Davide Modolo, Daoyi Dong, Dacheng Tao

机构 * Australian National University(澳大利亚国立大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Amazon(亚马逊) University of Technology Sydney(悉尼科技大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 针对扩散大语言模型数学推理的置信陷阱,提出无训练的进化解码框架,通过逐步选择与分块变异提升LLaDA 2.0的数学推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01667 2026-08-04 cs.AI 新提交 77%

TCPO: Turn-Level Credit Policy Optimization

TCPO:回合级信用策略优化

Sicong Liao, Zhi Chen, Yaohua Tang

机构 * Moore Threads AI(摩尔线程人工智能)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 该研究针对验证器引导多回合强化学习的信用分配问题,提出TCPO方法,在多类任务和模型上提升了LLM的多回合推理与智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01522 2026-08-04 cs.LG cs.AI cs.CL 新提交 67%

Question Begets Question: Self-Evolving Curriculum for Reinforcement Fine-Tuning on Competition Mathematics

问题催生问题:面向竞赛数学强化微调的自演进课程

Longtian Bao, Jianyou Wang, Yang Zhang, Youze Zheng, Ramamohan Paturi

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文针对竞赛数学强化微调的三大困难,提出Question-begets-Question(QbQ)方法及自演进课程,使Qwen2.5-Math-7B的AIME任务pass@1从5.6%提升至16.5%,且能解决更难问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00004 2026-08-04 cs.CL cs.AI cs.LG 新提交 67%

Cost-Effective Automated Judging of Natural-Language Mathematical Proofs

自然语言数学证明的高性价比自动评判

Benjamin Grayzel

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究以 IMO-GradingBench 为基准,验证 GPT-OSS 120B 等三个低成本模型作为数学证明评判器的效果,发现全票通过规则的低成本方案与前沿模型效果相当,成本低达 100 倍。

Comments 7 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01418 2026-08-04 cs.AI cs.LG 新提交 62%

Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning

策略滞后下的回滚复用:面向大语言模型强化学习的前缀归一化策略优化

Wenhao Zhang, Yibo Xie, Rui Wang, Jiahua Yang, Lei Jiang, Zibo Yang, Yawei Wang, Jiali Xu, jasperawang, Haoyang Long, Huan Xiong, alantzhao

机构 * Tencent(腾讯) Harbin Institute of Technology(哈尔滨工业大学) Jinan University(暨南大学) University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对大语言模型强化学习中回滚复用导致的离策略问题,提出前缀归一化策略优化(PNPO),在4个更新周期时其数学推理性能优于GSPO,可降低更新批次需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00434 2026-08-04 cs.CL cs.AI 新提交 62%

AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction

AdaMTP:一种面向多令牌预测的自适应训练范式

Ziqiang Cui, Han Shi, Bowei He, Yu Pan, Peiyang Liu, Shengyin Sun, Yankai Chen, Haoli Bai, Yichun Yin, Xue Liu, Chen Ma

机构 * City University of Hong Kong(香港城市大学) Huawei Technologies(华为技术有限公司) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) McGill University(麦吉尔大学) Peking University(北京大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 AdaMTP是适配序列内在可预测性的自适应MTP训练范式,通过熵算法划分语义边界抑制噪声梯度,在三类主干模型的多任务基准中均优于标准MTP,兼具性能与推理速度优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02181 2026-08-04 cs.LG 新提交 57%

Start Classifying: Categorical Critics for LLM Reinforcement Learning

开始分类:用于大语言模型强化学习的分类式评判器

Zhijian Zhou, Long Li, Xuan Zhang, Zongkai Liu, Yulei Qin, Ke Li, Xing Sun, Xiaoyu Tan, Chao Qu, Yuan Qi

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Tencent YoutuLab(腾讯优图实验室) Griffith University(格里菲斯大学) Shanghai Academy of Artificial Intelligence for Science(上海科学人工智能研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 该研究提出HL-Gauss PPO,将PPO的标量评判器改为分类式预测器,在多任务及Qwen2.5、Qwen3主干上均优于PPO、DAPO基线,可改进评判器信号与优势估计。

Comments Accepted at COLM 2026. 26 pages, 9 figures. Code: https://github.com/ZhijianZhou/HL-guass-ppo

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00531 2026-08-04 cs.AI 新提交 57%

CURE: Local Uncertainty Repair for Block-Parallel Speculative Decoding

CURE:面向块并行推测解码的局部不确定性修复

Aofan Liu, Jingxiang Meng, Fangxin Liu, Yongbiao Chen

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 针对并行推测解码的长序列精度下降问题,提出预算感知动态修复树CURE,通过定位高不确定性token修复错误,在多个基准上提升平均接受长度并实现2.66-3.49倍端到端速度提升。

Comments 9 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00418 2026-08-04 cs.AI 新提交 57%

Mask-Based Priors Are More Persistent than Query-Key Initializations

基于掩码的先验比查询-键初始化更具持久性

Mingze Ma, Hemanth Saratchandran, Cameron Gordon, Simon Lucey

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所) Adelaide University(阿德莱德大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对 Transformer 在布尔外推任务上的系统性错误泛化问题,提出直接初始化注意力掩码的方法,该方法可保留结构先验,在布尔推理等任务上实现优异外推效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 4 篇

2608.02295 2026-08-04 cs.AI cs.LO 新提交 57%

MechGeo: Autoformalizing and Proving Euclidean Geometry in Lean 4

MechGeo:在Lean 4中自动形式化与证明欧几里得几何

Hao Shen, Junyu Guo, Tian Cui, Yuxuan Xiao, Lihong Zhi

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 MechGeo是基于Mathlib的智能体框架,可在Lean 4中自动形式化欧几里得几何问题并构造认证证明,在43道IMO几何题及Lean-IMO-Bbench上取得显著成果,为可信形式几何提供实用基础。

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01000 2026-08-04 cs.AI 新提交 57%

Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets

判断并非枚举:大语言模型生成的可接受集合中的隐性遗漏

Wenhui Chen, Jianlin Chen, Ziyao Lin, Peiji Long, Chi Man Vong

机构 * University of Macau(澳门大学) South China University of Technology(华南理工大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 该研究发现大语言模型作为评估者时,生成可接受集合的表现远差于判断表现,核心问题是隐性遗漏,通过重写错误预期值可大幅提升修复后的套件产量。

Comments 53 pages, 14 figures, 26 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00981 2026-08-04 cs.AI 新提交 57%

Auditing Discovery Claims: A Two-Sided Criterion for Agentic Science, with the Negative Side Decidable

审计发现主张:面向智能体科学的双边准则,其负面侧可判定

Wenhui Chen, Jianlin Chen, Ziyao Lin, Chi Man Vong

机构 * University of Macau(澳门大学) South China University of Technology(华南理工大学)

专题命中 代码与定理证明 :verifier(abstract);分类 cs.AI

AI总结 该研究提出面向智能体科学的双边审计准则,通过实验揭示AI科学系统能力主张的夸大问题,证实智能体编写的程序在低计算量下可击败人类程序,但未明确可迁移的机制。

Comments 51 pages, 10 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01938 2026-08-04 cs.CR 新提交 50%

D-MUTRA: DLT-based MUTual Remote Attestation for Multi-Agent Systems

D-MUTRA:面向多智能体系统的基于分布式账本(DLT)的相互远程证明

Adam Zahir, Vincent Lefebvre, Mark Angoustures, Milan Groshev, Carlos J. Bernardos

专题命中 代码与定理证明 :verifier(abstract)

AI总结 针对多智能体系统传统远程证明的局限,本文提出基于区块链的D-MUTRA框架,实现智能体间的持续相互证明,可检测恶意软件修改,且扩展时开销可忽略。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 13 篇

2608.00583 2026-08-04 cs.CR cs.AI cs.CL cs.LG 新提交 88%

A False Average: Chain-of-Thought Monitors Collapse Where They Are the Only Defense

虚假的平均值:思维链监控在其作为唯一防御的地方失效

Shikhar Shiromani, Leo Richter

专题命中 逻辑推理 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究指出思维链监控在作为唯一防御时会失效,攻击者通过重写智能体推理可大幅降低监控捕获率,攻击可跨模型迁移,仅轨迹防御难恢复,需外部信息辅助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01078 2026-08-04 cs.CL cs.AI 新提交 84%

Attend to Your Own Thoughts: Breaking the Barrier for Post-Training Quantization of Reasoning LLMs through the Lens of 1.58-Bit Quantization

关注自身思维:通过1.58比特量化视角打破推理型大语言模型的后训练量化障碍

Shigeng Wang, Chao Li, Yangyuxuan Kang, Jiawei Fan, Anbang Yao

机构 * Intel Labs China(英特尔中国实验室)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出ScaleQ-1.58三值后训练量化框架,通过集成AYOT校准方法,提升推理型LLM量化性能,该框架可扩展且泛化性强,仅需少量校准token即可实现优异效果。

Comments This research work was completed and submitted for publication in early May 2026. The project page: https://github.com/IntelChina-AI/BitTern

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00975 2026-08-04 cs.CV 新提交 80%

MonitorVLM-v2: A Deployed Vision-Language Framework for Real-Time Safety Violation Detection

MonitorVLM-v2:用于实时安全违规检测的已部署视觉-语言框架

Jiang Wu, Sichao Wu, Yinsong Ma, Lifang Zheng, Jingliang Duan

机构 * School of Mechanical Engineering, University of Science and Technology Beijing(北京科技大学机械工程学院) The Laboratory for Computational Sensing and Robotics, Johns Hopkins University(约翰霍普金斯大学计算传感与机器人实验室)

专题命中 逻辑推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出MonitorVLM-v2框架,将VLM安全评估转化为有限符号空间概率推理,结合SymPO算法与熵驱动分类机制,在地下矿部署中实现19.45倍提速,确认违规量达人工检查的2.78倍,满足实时可审计工业监控需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01534 2026-08-04 cs.CV 新提交 78%

Recursive Vision Language Models for General Symbolic Reasoning

用于通用符号推理的递归视觉语言模型

Omid Nejati Manzari, Guillaume Lajoie, Hassan Rivaz

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 提出基于预训练Qwen的递归推理框架R-Qwen,结合递归模型与预训练LLMs的优势,在8个基准测试中优于同类模型和更大LLMs,ARC-AGI上提升27.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00878 2026-08-04 cs.IT math.IT 新提交 71%

Goal-Oriented Logic-based Semantic Communication for Neuro-Symbolic Reasoning with Applications onto Autonomous Driving

面向目标的基于逻辑的语义通信及用于自动驾驶的神经符号推理

Ahmet Faruk Saz, Duo Xu, Faramarz Fekri

专题命中 逻辑推理 :reasoning(title)

AI总结 本文针对自动驾驶场景,提出基于一阶逻辑的目标导向语义通信方法,通过选择关键证据传输实现安全决策,在相同通信预算下优于均匀证据选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01763 2026-08-04 cs.CR cs.AI cs.LO cs.SE 新提交 57%

EntailLLM: Verifying LLM-Generated Vulnerability Discovery Paths with Domain Knowledge via Logic Programming

EntailLLM:通过逻辑编程结合领域知识验证大语言模型生成的漏洞发现路径

Kaustuv Mukherji, Jaikrishna Manojkumar Patil, Colton Payne, Paulo Shakarian, Dana Warmsley, Nigel Stepp, Evelyn Kim

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 EntailLLM通过逻辑编程结合领域知识验证LLM生成的漏洞发现路径,在三类CWE、四个LLM等多组实验中,将合并蕴含率从78%提升至98%,可端到端部署且无需逐设备调优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01528 2026-08-04 cs.LG 新提交 57%

Gram-Space: Structure-Preserving Codebook Compression for Memory-Efficient Neuro-Symbolic AI

Gram-Space:面向内存高效神经符号AI的结构保持码本压缩

Weilun Wang, Wantong Li

机构 * University of California Riverside(加州大学河滨分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出Gram-Space压缩框架,通过格拉姆-施密特正交化保留VSA所需点积结构,可降低神经符号AI模型GPU内存使用与推理延迟,提升硬件利用率。

Comments International Conference on Neuro-symbolic Systems (NeuS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00937 2026-08-04 cs.CR cs.AI cs.MA 新提交 57%

Neuro-Symbolic Participation Governance for Verifiable AI Agents in Open Digital Twin Ecosystems

开放数字孪生生态中可验证AI智能体的神经符号参与治理

Juan Li, Wei Cai, Yan Bai

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对开放数字孪生生态中AI智能体的验证需求,提出神经符号去中心化治理框架,结合神经推理与制度治理,通过区块链智能合约实现可审计参与,经原型验证可管控开销下保障合规协作。

Comments Accepted at the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC 2026), Bellevue, WA, USA, October 4-7, 2026. 7 pages, 1 figure, 5 tables. Code: https://github.com/weicaiuw/verigov-ai (DOI: 10.5281/zenodo.21706699)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00894 2026-08-04 cs.AR 新提交 50%

Rethinking Agentic Kernel Generation for Emerging Accelerators

面向新兴加速器的智能体内核生成方法反思

Ruijie Gao, Jirong Yang, Barry Lyu, Haoran Jin, Nathan Bleier

专题命中 逻辑推理 :reasoning(abstract)

AI总结 针对新兴加速器内核生成的现有方法反复重建无关语义的问题,提出编译器介导的Zomboss框架,将语义编译为可复用接口,在20个Gemmini和36个PLENA工作负载上实现全实例正确,且性能优于基线方法、推理成本更低。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00678 2026-08-04 cs.CV 新提交 50%

Breaking the Horizontal Prior: From Long-Tailed Orientation Bias to Roll-Robust Monocular Depth Estimation

打破水平先验:从长尾方向偏差到抗翻滚单目深度估计

Kaihua Tang, Ziqing Xia, Xiaoxu Zheng, Xiaoxue Zhang, Michael Bi Mi, Zhan Xu, Dave Zhenyu Chen

专题命中 逻辑推理 :reasoning(abstract)

AI总结 该研究针对单目深度估计中受水平先验(长尾方向偏差)导致的相机翻滚鲁棒性差问题,提出训练时监督策略ID-Constraint,经多基准数据集实验验证了方法的有效性。

Comments The code is publicly available on GitHub: https://github.com/KaihuaTang/Horizontal-Prior

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00629 2026-08-04 cs.GR 新提交 50%

ParticleGen: A Multi-Agent System for Particle Effects Generation

ParticleGen:用于粒子效果生成的多智能体系统

Junhao Zhuge, Junyi Yang, Yuqing Wang, Kangzhan Wang, Sipeng Yang, Xiaogang Jin

专题命中 逻辑推理 :planning(abstract)

AI总结 本研究提出多智能体框架ParticleGen,可从自然语言描述合成结构化可编辑粒子系统,经Unreal Engine 5的Niagara系统多场景验证,能降低创作门槛、提升迭代效率。

详情

展开后加载摘要…

URL PDF HTML 收藏