arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-20 至 2026-07-20 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 11 篇

2607.15281 2026-07-20 cs.AI 新提交 79%

Causal-Audit: Explicit and Auditable Graph-based Reasoning via Target-Aware Causal Chain Construction

因果审计:通过目标感知因果链构建进行显式且可审计的基于图的推理

Su Lan, Xuefei Yin, Yanming Zhu, Alan Wee-Chung Liew

机构 * School of Information and Communication Technology, Griffith University(信息与通信技术学院,格里菲斯大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 针对无上下文干预问答,提出因果审计框架,通过目标感知因果图构建和路径级因果证据聚合机制,将因果推理结构化,实验证明该框架优于现有方法,能提供可解释且可审计的推理痕迹。

Journal ref The 64th Annual Meeting of the Association for Computational Linguistics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22204 2026-07-20 cs.RO cs.AI 版本更新 79%

Human-Inspired Neuro-Symbolic World Modeling and Logic Reasoning for Interpretable Safe UAV Landing Site Assessment

受人类启发的神经符号世界建模与逻辑推理用于可解释的安全无人机着陆点评估

Weixian Qian, Tianyi Yang, Sebastian Schroder, Yao Deng, Jiaohong Yao, Xiao Cheng, Richard Han, Xi Zheng

机构 * Macquarie University(麦考瑞大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 NeuroSymLand通过结合神经符号方法,实现了可解释的安全无人机着陆点评估,优于现有基线方法。

Comments The paper has a major update, which is uploaded to https://arxiv.org/abs/2607.02277

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12262 2026-07-20 cs.CV 版本更新 75%

Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously

视频流思考:VideoLLMs可以同时观看和思考

Yiran Guan, Liang Yin, Dingkang Liang, Jianzhong Ju, Zhenbo Luo, Jian Luan, Yuliang Liu, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) MiLM Plus Xiaomi Inc.(小米公司)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);logical reasoning(abstract)

AI总结 VST提出了一种视频流理解的新范式,通过在流式过程中激活推理,提高实时响应和理解能力,同时在多个基准测试中表现出更高的效率和泛化能力。

Comments Accepted by ECCV 2026, project page https://1ranguan.github.io/VST/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15647 2026-07-20 cs.AI 新提交 70%

Neuro-Symbolic AI for LEED compliance: Document-Centric Benchmarking, Deterministic Numeric Checking, and When Multimodal Hurts

用于LEED合规的神经符号人工智能:以文档为中心的基准测试、确定性数值检查以及多模态何时有害

Aritro De, Juliana Felkner

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 逻辑推理 :chain-of-thought(abstract);verifier(abstract);分类 cs.AI

AI总结 研究小型本地部署语言模型对LEED文档筛选及符号组件作用,引入神经符号管道,通过对齐PDF、检索证据、语言模型验证和数值检查器检查来验证合规性,实验表明特定模型在任务中表现较好,管道及基线提供了参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04539 2026-07-20 cs.CL cs.AI 版本更新 62%

RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization

RLearner-LLM: 通过混合直接偏好优化平衡大语言模型中的逻辑性与流畅性

Qiming Bao, Juho Leinonen, Paul Denny, Michael J. Witbrock

机构 * University of Auckland(奥克兰大学) Aalto University(阿alto大学)

专题命中 逻辑推理 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RLearner-LLM,通过融合DeBERTa-v3 NLI信号与验证器LLM评分,解决直接偏好优化在知识密集型生成中的逻辑对齐问题,实现NLI指标显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13545 2026-07-20 cs.AI cs.CL cs.CY 版本更新 62%

The AI Fiction Paradox

人工智能虚构悖论

Katherine Elkins

机构 * Integrated Program in Humane Studies, Kenyon College(肯尼恩学院人文学研究整合项目) AI CoLab, Kenyon College(肯尼恩学院人工智能协作实验室) Human-Centered AI Lab(以人为中心的人工智能实验室)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨人工智能生成虚构内容的困境,指出叙事因果、信息重评和多尺度情感架构三大挑战,揭示AI生成虚构的难题及潜在风险。

Comments 15 pages, Presented at the MFS Cultural AI Conference, Purdue University, September 18, 2025. Accepted for publication as a collection of essays for a special issue of MFS Modern Fiction Studies on Cultural AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13237 2026-07-20 cs.AI cs.CL 62%

NL2LOGIC: AST-Guided Translation of Natural Language into First-Order Logic with Large Language Models

NL2LOGIC: 基于抽象语法树的自然语言到一阶逻辑翻译框架

Rizky Ramadhana Putra, Raihan Sultan Pasha Basuki, Yutong Cheng, Peng Gao

机构 * Virginia Tech(弗吉尼亚理工大学) Universitas Ary Ginanjar(阿里·金纳jar大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 NL2LOGIC通过引入抽象语法树,结合递归大语言模型和生成器,实现了高准确性的自然语言到一阶逻辑转换,提升了逻辑求解的准确性和可执行性。

Comments Accepted to Findings of EACL 2026. 17 pages, 6 figures

Journal ref 2026.findings-eacl.317

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22402 2026-07-20 cs.CL cs.FL cs.LG 版本更新 62%

Bifocal Attention: Harmonizing Geometric and Spectral Positional Embeddings for Algorithmic Generalization

双焦点注意力:协调几何与谱域的位置嵌入以实现算法泛化

Kanishk Awadhiya

机构 * Indian Institute of Technology, Delhi(印度理工学院德里分校)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出双焦点注意力机制,通过协调几何与谱域的位置嵌入,解决算法泛化中的结构间隙问题,提升模型对递归推理的处理能力。

Comments There is issue with affiliation, any further updates will be communicated but right now removal is necessary

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12711 2026-07-20 cs.AI cs.LO 版本更新 57%

MaxSAT-Based Feedback for Guiding Vision-Language Models in Sudoku

基于最大可满足性的反馈在数独中引导视觉语言模型

Pedro Orvalho, Guillem Alenyà, Felip Manyà

机构 * Artificial Intelligence Research Institute (IIIA), Consejo Superior de Investigaciones Científicas (CSIC)(人工智能研究所(IIIA),西班牙科学研究高级理事会(CSIC)) Institut de Robòtica i Informàtica Industrial (IRI-CSIC-UPC)(工业机器人与信息学研究所(IRI-CSIC-UPC))

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 研究在数独中引导视觉语言模型的问题,提出通过MaxSAT预言机将形式约束推理集成到VLM求解过程的神经符号方法,经实验验证该方法能提高逻辑一致性和解决实例数量,增强视觉语言推理可靠性。

Comments Accepted at the 25th EPIA Conference on Artificial Intelligence, EPIA 2026. 16 pages, 1 figure, and 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15535 2026-07-20 cond-mat.mtrl-sci 新提交 50%

Symbolic Predicate-Guided Language Agents for Inverse Design of Perovskite Oxides

用于钙钛矿氧化物逆设计的符号谓词引导语言智能体

Dong Hyeon Mok, Seoin Back, Victor Fung, Guoxiang Hu

专题命中 逻辑推理 :reasoning(abstract)

AI总结 研究钙钛矿氧化物逆设计,引入 DSL 引导策略,将自然语言规则转化为符号谓词,开发 ORCHESTRA 框架。该策略能增强 LLM 智能体推理能力,无需大量特定任务数据集或额外训练,提升材料设计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24819 2026-07-20 cs.SE cs.PL 版本更新 50%

A Roadmap for Tamed Interactions with Large Language Models

与大语言模型进行可控交互的路线图

Vincenzo Scotti, Jan Keim, Tobias Hey, Andreas Metzger, Anne Koziolek, Raffaela Mirandola

专题命中 逻辑推理 :reasoning(abstract)

AI总结 研究针对大语言模型交互可靠性等问题,提出LLM脚本语言LSL,将其交互构建为可分析程序,通过引入多种抽象支持规范开发,还能外化提示设计,减少隐式推理,为更易维护的提示系统提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏