arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-11 至 2026-08-11 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 17 篇

2608.08168 2026-08-11 cs.CL 新提交 89%

Thinking vs. NoThinking: Towards Interpreting Reasoning Mechanisms of Large Language Models via Sparse Autoencoders

思考与非思考:基于稀疏自编码器的大语言模型推理机制可解释性研究

Bo Cheng, Qiaolin Lu, Yi Chang, Yuan Wu

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);CoT(abstract,abstract_cn);分类 cs.CL

AI总结 本研究基于稀疏自编码器分析DeepSeek-R1-Distill-Qwen-7B的推理机制,揭示思考与非思考模式的神经差异,为大语言模型推理可解释性提供新见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08786 2026-08-11 cs.AI 新提交 85%

SymDiag: Explainable Diagnosis for LLM Reasoning via Neuro-Symbolic Verification

SymDiag:基于神经符号验证的LLM推理可解释诊断

Wenyao Cui, Huaping Zhang, Yongyi Huang, Qiuchi Li, Jian Xu, Cheng-Lin Liu, Chunxiao Gao, Juan Wang, Baohua Zhang

机构 * Beijing Institute of Technology(北京理工大学) Zhongguancun Academy(中关村学院) Xinjiang Future Enterprise Incubator Co., Ltd.(新疆未来企业孵化器有限公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 逻辑推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI

AI总结 SymDiag是一种神经符号框架,将LLM推理验证重构为结构化故障诊断,可定位推理故障步骤、分离翻译与推理错误,在多类基准中提升了不可靠推理检测与推理修复反馈效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08146 2026-08-11 cs.AI 新提交 84%

Long SKILL Compliance as Logical Reasoning: Closure-Grounded Detection with Scaling-Guided On-Policy Distillation

长SKILL合规性检测作为逻辑推理:基于闭包的检测与尺度引导的在线策略蒸馏

Shuaitao Zhao, Feng Ni, Lichao Ma, Jiaye Lin, Fei Han, Yang Wei, Lu Pan

机构 * Meituan(美团)

专题命中 逻辑推理 :reasoning(title);logical reasoning(title);分类 cs.AI

AI总结 针对长SKILL合规性检测的成本与精度矛盾,提出SkillCDG框架,结合两级检索与依赖闭包实现检测,在多数据集上优于基线,还发现尺度趋势以优化小模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08113 2026-08-11 cs.AI 新提交 84%

Think Deep, Speak Once: Relit, A Recursive Latent Implicit Transformer Framework

深度思考,一次输出:ReLIT,一种递归隐式隐式Transformer框架

Abhishek Panwar, Maheep Singh, Saksham Bansal

机构 * Indian Institute of Technology Roorkee(鲁尔基印度理工学院)

专题命中 逻辑推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);logical reasoning(abstract)

AI总结 该研究针对思维链提示计算开销大、微型递归模型语义连贯性差的问题,提出ReLIT框架,结合TinyLlama-1.1B骨干与可训练递归块,在逻辑推理基准上高效实现推理,性能优于或媲美更大模型。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00417 2026-08-11 cs.AI 版本更新 83%

SymboUQ: Symbolic Uncertainty Quantification for Spatial Reasoning in LLMs

SymboUQ:面向大语言模型空间推理的符号化不确定性量化框架

Dahai Yu, Lin Jiang, Rongchao Xu, Guang Wang

专题命中 逻辑推理 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 SymboUQ是面向LLMs空间推理的符号化不确定性量化框架,通过区分可符号性与语义确定性,整合三类分数估计最终答案可靠性,在五个空间推理基准的四个冻结LLM骨干上,使AUROC相对提升约8%、Brier损失相对降低7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04902 2026-08-11 cs.LG 版本更新 83%

Are Latent Reasoning Models Easily Interpretable?

潜在推理模型是否易于解释?

Connor Dilgren, Sarah Wiegreffe

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.LG

AI总结 本文研究了潜在推理模型的可解释性,发现其推理令牌往往不必要,且可通过解码自然语言推理轨迹验证预测正确性,表明当前LRMs主要编码可解释过程。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09374 2026-08-11 cs.AI cs.CV 新提交 79%

CircuitReason-1k: Benchmarking Long-Horizon Visual-to-Symbolic Reasoning inElectrical Circuits

CircuitReason-1k:电路中的长程视觉到符号推理基准测试

Xinqi Yang, Kang An, Tengyue Wang, Zhongyu Yang, Chenxu Du, Yuanchi Zhu, Hebao Zhu, Ziliang Wang, Faqiang Qian, Yunli Yang, Qibing Ren

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 CircuitReason-1k是含1000个真实教材电路问题的基准,用于评估多模态模型的长程视觉到符号推理,现有模型在长程问题上表现差,该基准为相关测试提供了聚焦平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09217 2026-08-11 cs.LG cs.AI 新提交 73%

Beyond Solvability: Task Learnability as a Static Prior for LLM RL Post-Training

超越可解性:任务可学习性作为大语言模型强化学习后训练的静态先验

Ting Zhou, Zhenqing Ling, Daoyuan Chen, Qianli Shen, Yilun Huang, Ying Shen, Yaliang Li

机构 * Sun Yat-Sen University(中山大学) Alibaba Group(阿里巴巴集团)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出TrajVal估计任务可学习性,将其作为静态先验用于LLM的RL后训练任务采样,可提升数据效率并与在线调度方法互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03374 2026-08-11 cs.CL cs.AI 版本更新 73%

CresOWLve: Benchmarking Creative Problem-Solving Over Real-World Knowledge

CresOWLve:基于现实世界知识的创造性问题解决基准测试

Mete Ismayilzada, Renqing Cuomao, Daniil Yurshevich, Anna Sotnikova, Lonneke van der Plas, Antoine Bosselut

机构 * EPFL(瑞士联邦理工学院洛桑) Università della Svizzera italiana (USI)(意大利语区瑞士大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CresOWLve基准测试,评估创造性问题解决能力,通过现实世界知识中的谜题,发现模型在事实性问题与创造性问题上的表现差异显著。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00143 2026-08-11 cs.CR cs.AI 版本更新 70%

Symbolic Attack Chain Generation from Atomic Red Team Techniques: An Empirical Study of Predicate Representation Granularity

基于Atomic Red Team技术的符号化攻击链生成:谓词表示粒度的实证研究

Ramya Varunsegar

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本研究对比九类与五类谓词粒度的AALM,发现粒度对攻击链有效性影响小,81.3%结果一致,高粒度仅提升规划论证的内部结构分辨率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09931 2026-08-11 cs.CV 新提交 67%

Perception Before Supervision: Self-Contained Visual Distillation from Counterfactual Blind Spots

监督之前的感知:来自反事实盲区的自包含视觉蒸馏

Shravan Venkatraman, Omkar Thawakar, Ritesh Thawkar, Abdelrahman Shaker, Rao Muhammad Anwer

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Aalto University(阿尔托大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)

AI总结 该研究提出首个完全自包含的视觉自蒸馏框架 CVPD,通过识别模型视觉盲区生成密集对比监督,在 Qwen3-VL-8B-Instruct 上的 12 个基准中优于 6 个自进化基线,取得多项指标提升且无性能倒退。

Comments BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08118 2026-08-11 cs.AI cs.LG cs.SC math.CO 新提交 62%

Neurosymbolic Discovery of Algebraic Graph Constructions

代数图构造的神经符号发现

David Seka, Stefan Szeider

机构 * TU Wien(维也纳技术大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对仅提供原始图数据无法揭示其结构性质的问题,提出基于通用大语言模型与SageMath的神经符号智能体,可自动发现代数图构造,在100个高度对称图基准上全部成功,还找到Bernhart-Kainen可散度猜想的最小反例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09125 2026-08-11 cs.CL cs.LG 版本更新 62%

LogicIF: Towards Complex Logic Instruction Following

复杂逻辑指令生成

Mian Zhang, Shujian Liu, Sixun Dong, Ming Yin, Yebowen Hu, Xun Wang, Simin Ma, Song Wang, Sathish Reddy Indurthi, Haoyun Deng, Zhiyu Zoey Chen, Kaiqiang Song

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Independent Researcher(独立研究者) Duke University(杜克大学) University of Central Florida(佛罗里达大学中央分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出LogicIFGen和LogicIFEval,用于生成和评估复杂逻辑指令,揭示了当前LLMs在复杂指令跟随上的不足。

Comments COLM 2026 Acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07965 2026-08-11 cs.AI 新提交 57%

CyberAGENTS: Structured Autonomy for Agentic Gamified Learning in Cybersecurity

CyberAGENTS:面向网络安全领域智能体游戏化学习的结构化自主机制

Ivan Hornung, Deepthi Marasinghe Arachchige, Tharindu Kumarage, Garima Agrawal, Yuli Deng, Ying-Chih Chen, Huan Liu

机构 * Arizona State University(亚利桑那州立大学) Amazon AGI(亚马逊AGI)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出CyberAGENTS框架,通过结构化自主机制实现游戏化网络安全学习,经课堂评估验证其可提升学习者参与度与对AI响应的信任度,为相关系统设计提供蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00326 2026-08-11 cs.AI 版本更新 57%

Learning to Coordinate Symbolic Tools: LLM Agents for Verified Sum-of-Squares Certificates

学习协调符号工具:用于验证平方和(SOS)证书的大语言模型(LLM)智能体

Bohan Chen, Shivam N. Patel, Richard Hoffmann, Sam Looi, Tony Yue Yu

专题命中 逻辑推理 :verifier(abstract);分类 cs.AI

AI总结 该研究开发结合领域训练、符号工具和验证反馈的LLM智能体,在加权SOS验证任务上达到78.96%成功率,为可精确检查输出领域的工具调用智能体设计提供案例。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22758 2026-08-11 cs.AI 版本更新 57%

AutoRefine: Compiling Trajectories into Validated Typed Agent Artifacts

AutoRefine: 从轨迹到可重用的专业知识为连续LLM代理优化

Libin Qiu, Zhirong Gao, Junfu Chen, Yuhang Ye, Liangyu Li, Weizhi Huang, Xiaobo Xue, Wenkai Qiu, Shuo Tang

机构 * alibaba(阿里巴巴集团)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 AutoRefine通过提取和维护双重形式的经验模式,提升连续LLM代理的知识积累与维护效率,实现98.4%的准确率提升。

Comments 7 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17162 2026-08-11 cs.AI 版本更新 57%

The Belief-Desire-Intention Ontology for modelling mental reality and agency

信念-愿望-意图本体用于建模心理现实与代理

Sara Zuppiroli, Carmelo Fabio Longo, Anna Sofia Lippolis, Rocco Paolillo, Lorenzo Giammei, Miguel Ceriani, Francesco Poggi, Antonio Zinilli, Andrea Giovanni Nuzzolese

机构 * CNR - Institute of Cognitive Sciences and Technologies(CNR认知科学与技术研究所) CNR - Institute for Research on Population and Social Policies(CNR人口与社会政策研究所) CNR - Research Institute on Sustainable Economic Growth(CNR可持续经济增长研究所) University of Bologna - Department of Philosophy(博洛尼亚大学哲学系)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种形式化的BDI本体,通过模块化设计模式实现信念、愿望、意图及其动态关系,结合LLMs和Semas平台验证其在认知基础和语义可互操作性中的应用。

Journal ref Journal of Web Semantics (2026) 90:100885

详情

展开后加载摘要…

URL PDF HTML 收藏