arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-21 至 2026-08-21 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 10 篇

2604.06501 2026-08-21 cs.LG cs.CL 版本更新 88%

Transformer See, Transformer Do: Copying as an Intermediate Step in Learning Analogical Reasoning

Transformer 见,Transformer 作:复制作为学习类比推理的中间步骤

Philipp Hellwig, Willem Zuidema, Claire E. Stevenson, Martha Lewis

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文研究了通过Meta-Learning for Compositionality训练的Transformer在类比推理任务中的表现,发现引入复制任务可提升模型对字母字符串类比的学习能力,并通过异质数据集训练提高了对新字母集的泛化能力。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19794 2026-08-21 cs.AI cs.RO 新提交 83%

Towards general embodied intelligence: integrating large language models, knowledge bases, and reasoning capabilities to build the next generation of AI agents

迈向通用具身智能:整合大语言模型、知识库与推理能力以构建下一代AI智能体

Fujiang Yuan, Xia Huang, Lusheng Wang, Jun Ding, Zhen Tian, Yuxin Wang, Shaojie Gu, Yuki Funabora, Yanhong Peng, Zebing Mao

机构 * College of Mechanical Engineering, Chongqing University of Technology(重庆理工大学机械工程学院) James Watt School of Engineering, University of Glasgow(格拉斯哥大学詹姆斯·瓦特工程学院) School of Energy and Power, Jiangsu University of Science and Technology(江苏科技大学能源与动力学院) Magnesium Research Center, Kumamoto University(熊本大学镁研究中心) Department of Information and Communication Engineering, Nagoya University(名古屋大学信息与通信工程系) State Key Laboratory of Fluid Power and Mechatronic Systems, Zhejiang University(浙江大学流体动力与机电系统国家重点实验室)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文综述以LLM为核心的智能系统演进,提出整合LLMs、KBs、RA与具身性的概念框架,明确高效LLM部署等五大挑战,为开发复杂动态环境下的自适应多模态智能体提供路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17417 2026-08-21 cs.LG physics.chem-ph physics.comp-ph quant-ph 版本更新 83%

Grounded verification of chemical and materials reasoning: detection is the bottleneck

化学与材料推理的有根据验证:检测是瓶颈

Can Polat, Mustafa Kurban, Erchin Serpedin, Hasan Kurban

专题命中 逻辑推理 :reasoning(title,abstract);verifier(abstract);分类 cs.LG

AI总结 研究针对大语言模型在化学推理中虚构对象的问题,提出分层验证器,通过与数据库核对及门控校正减少公式错误,检索次数大幅减少,修复成功率高,但检测召回率是瓶颈,基于事实验证可提高答案质量,长尾错误处提升明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07761 2026-08-21 cs.CV 版本更新 78%

Video Evidence to Reasoning Efficient Video Understanding via Explicit Evidence Grounding

视频证据推理:通过显式证据接地实现高效的视频理解

Yanxiang Huang, Guohua Gao, Zhaoyang Wei

机构 * Department of Applied Mathematics, The Hong Kong Polytechnic University(应用数学系,香港理工大学)

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 本文提出CoE框架,通过显式证据接地模块和强化学习优化的锚定协议,提升视频推理的准确性和可靠性。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19701 2026-08-21 cs.AI 新提交 74%

Beyond Memory Majority: Latent-Source Reasoning for Multi-Agent Memory Arbitration

超越记忆多数:面向多智能体记忆仲裁的潜在源推理

Chenchen Lin, Wenhao Yuan, Xuehe Wang, Edith Cheuk Han Ngai

专题命中 逻辑推理 :reasoning(title);分类 cs.AI

AI总结 该研究针对多智能体记忆仲裁中的记忆关联偏差问题,提出CAMA框架,通过解耦记忆、估计独立证据源数量及主动恢复缺失证据,有效抑制虚假多数,性能优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19880 2026-08-21 cs.AI cs.CL cs.LG 新提交 67%

EnvHarness: Awakening Static Worlds for Agent Learning

EnvHarness:为智能体学习唤醒静态环境

Chengsong Huang, Zifeng Wang, Rujun Han, Jun Yan, Yanfei Chen, Zoey CuiZhu, Ke Jiang, Peng Xia, Han Yu, Yufan Zhuang, Yifei Ming, Jiaqi Pan, Bhavana Dalvi Mishra, Jiaxin Huang, Burak Gokturk, Tomas Pfister, Chen-Yu Lee

专题命中 逻辑推理 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 EnvHarness是包裹静态环境的可编程插件层,结合EnvRigger自动合成组件,在多领域基准测试中提升智能体学习性能,减少执行步骤并支持策略与环境协同进化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20201 2026-08-21 cs.AI cs.SE 新提交 57%

The Third Restructuring of Software Form: From the Three-Tier Architecture to Storage, Models, and Agents

软件形态的第三次重构:从三层架构到存储、模型与智能体

Wei Lin, Tao Zhou, Zhaofei Xie, Changgui Hong

机构 * Nanjing Liancheng Intelligent Technology Group(南京连城智能科技集团)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出软件形态正经历第三次范式转变Software 3.0,其核心为存储、大模型与智能体的架构,将重塑开发者、数据库行业及软件工程的角色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19379 2026-08-21 cs.CY cs.HC 新提交 50%

Multi-Tier Mentorship with AI-Assisted Development: Authentic Engineering for K-12 and Undergraduates

结合AI辅助开发的多层级指导模式:面向K-12学生与本科生的真实工程实践

Kelly Yuan, Ronald Liu, Daniel Crawford, Weihao Qu

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出结合AI辅助开发的多层级指导框架,让K-12学生与本科生协作开发LuckyTag系统,试点显示该模式可降低技术障碍、提升架构理解,为跨群体计算协作提供了新方案。

Comments 8 pages, 8 figures, 2 tables. Accepted to IEEE ISEC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13148 2026-08-21 cs.CR 版本更新 50%

TrustMee: Self-Verifying Remote Attestation Evidence

TrustMee: 自验证远程证明证据

Parsa Sadri Sinaki, Zainab Ahmad, Wentao Xie, Merlijn Sebrechts, Jimmy Kjällman, Lachlan J. Gunn

专题命中 逻辑推理 :verifier(abstract)

AI总结 TrustMee通过自验证远程证明证据机制,实现跨平台的证明验证,无需特定平台代码,利用WebAssembly组件实现验证逻辑的通用性。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09774 2026-08-21 cs.CR 版本更新 50%

QRS: A Rule-Synthesizing Neuro-Symbolic Triad for Autonomous Vulnerability Discovery

QRS:一种用于自主漏洞发现的神经符号三元组规则生成器

George Tsigkourakos, Constantinos Patsakis

专题命中 逻辑推理 :reasoning(abstract)

AI总结 QRS通过神经符号方法生成代码查询,发现超出预定义模式的漏洞,显著降低假阳性,并在低开销下发现高严重性漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏