arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 259 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 259 篇

2607.24794 2026-07-29 cs.AI cs.CV 新提交 79%

Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding

利用记忆进行推理:一种用于免训练长视频理解的时间粒度自适应框架

Linghao Meng, Qiankun Li, Junyuan Mao, Pujin Liao, Zhicheng He, Enbo Zhang, Kun Wang, Yang Liu, Huazhu Fu, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(高性能计算研究所,科学、技术与研究机构(A*STAR)) Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) Jilin University(吉林大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型长视频理解受限问题,提出ReMem框架,通过双级记忆增强自适应,在查询和视频级别分别处理,能适应不同时间粒度,经实验验证在多个基准测试中实现高效零样本性能,提升模型长视频推理能力。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24789 2026-07-29 cs.IR cs.CV cs.LG cs.MM 新提交 79%

NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model

NEXT:通过视觉语言模型进行推理驱动的视频推荐

Yuming Liu, Hongye Yang, Harrison Zhao, Ellie Zhu, Bokai Cao, Lei Huang, Lizhu Zhang, Xiangjun Fan

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.LG

AI总结 研究提出推理驱动的视频推荐框架NEXT,通过对用户已观看视频推理推断其下一个意图来检索后续视频。训练NEXT-8B视觉语言模型,在DocVQA性能上表现出色,在特定评估中提升下一个意图逻辑质量,部署后带来生产收益,证明其可作为实用推理引擎。

Comments 13 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17240 2026-07-21 cs.AI 新提交 79%

Constrained Path Reasoning: Measuring When Committed Stages Earn Their Cost

受限路径推理:衡量已提交阶段何时值得付出成本

Honglin Li

机构 * ShanghaiTech University(上海科技大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究LLM推理管道中已提交阶段何时值得付出成本,提出受限路径推理(CPR)方法,通过源感知路径假设与阶段级核算结合,在多个实验设置下验证,可测量相关指标,为LLM推理提供新的衡量与验证方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15281 2026-07-20 cs.AI 新提交 79%

Causal-Audit: Explicit and Auditable Graph-based Reasoning via Target-Aware Causal Chain Construction

因果审计:通过目标感知因果链构建进行显式且可审计的基于图的推理

Su Lan, Xuefei Yin, Yanming Zhu, Alan Wee-Chung Liew

机构 * School of Information and Communication Technology, Griffith University(信息与通信技术学院,格里菲斯大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 针对无上下文干预问答,提出因果审计框架,通过目标感知因果图构建和路径级因果证据聚合机制,将因果推理结构化,实验证明该框架优于现有方法,能提供可解释且可审计的推理痕迹。

Journal ref The 64th Annual Meeting of the Association for Computational Linguistics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11696 2026-07-14 cs.AI 新提交 79%

Think Through a Bottleneck: Hourglass Reasoning for Rigorous Induction

突破瓶颈:用于严格归纳的沙漏推理

Huan Zhu

机构 * Peking University(北京大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究针对大语言模型少样本归纳推理能力不足的问题,提出沙漏推理方法,通过在推理阶段强制实现严格上下文隔离,构建符号编码器 - 解码器。实验表明该方法在多基准测试中显著提升准确率,证实收益源于阶段隔离和初始归纳质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10678 2026-07-14 cs.AI 新提交 79%

Personalized Emotional Intelligence in Generative AI through Symbolic Affective Reasoning

通过符号情感推理实现生成式人工智能中的个性化情商

Qing Lin, Mengmi Zhang

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究旨在解决生成式人工智能中缺乏个性化情感理解等问题,提出EROS混合框架,结合符号推理与深度学习,利用大规模数据集发现情感规则等,通过可扩展记忆库实现个性化,实验表明其能有效引发目标情感反应并适应个体偏好,为相关AI系统奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04096 2026-07-07 cs.AI 新提交 79%

Forethought: Verifiable Reasoning from Neurosymbolic Primitive Programming

预思考:神经符号原始编程的可验证推理

Vishvesh Bhat, Jay Vaghasiya, Emmanuel Anaya Gonzalez

机构 * CoreThink AI UC San Diego(加州大学圣地亚哥分校)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究改进智能体工作流推理能力问题,提出神经符号推理系统Forethought,将推理视为可验证程序,由符号和神经原语库构建,经特定语言组合,提升了基础模型准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02491 2026-07-03 cs.AI 新提交 79%

G-RRM: Guiding Symbolic Solvers with Recurrent Reasoning Models

G-RRM:用循环推理模型引导符号求解器

Timo Bertram, Sidhant Bhavnani, Richard Freinschlag, Erich Kobler, Andreas Mayr, Günter Klambauer

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出神经符号方法G-RRM,将符号等变循环推理模型与回溯或SAT求解器结合,通过神经引导提升约束满足问题的搜索效率,在9×9数独上回溯加速33.3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26108 2026-06-26 cs.CL 新提交 79%

Where Larger Models Excel: The Primacy of Constraint-Guided Reasoning

大模型何处更胜一筹:约束引导推理的首要性

Guan-Yi Lin, Hen-Hsen Huang

机构 * National Chengchi University(国立政治大学) Academia Sinica(中央研究院)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL

AI总结 研究大语言模型在推理基准上性能差距的原因,提出AdvCluster框架自动识别大模型优势问题并提取细粒度优势描述,发现约束引导推理是大模型的核心优势。

Comments 10 pages, 3 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22488 2026-06-23 cs.AI 新提交 79%

SCOPE: Evolving Symbolic World for Planning in Open-Ended Environments

SCOPE:面向开放环境规划的演化符号世界

Yundaichuan Zhan, Minghe Gao, Zhongqi Yue, Wendong Bu, Wenqiao Zhang, Guoming Wang, Jisheng Dang, Juncheng Li, Siliang Tang, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Chalmers University of Technology(查尔姆斯理工大学) Lanzhou University(兰州大学)

专题命中 逻辑推理 :planning(title,abstract);分类 cs.AI

AI总结 提出SCOPE框架,通过符号执行模拟器和自适应符号记忆模块,在开放环境中演化符号世界表示,提升规划完整性和鲁棒性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20227 2026-06-19 cs.AI cs.SE 新提交 79%

QMFOL: Benchmarking Large Language Model Reasoning via Quantifiable Monadic First-Order Logic Test Case Generation

QMFOL:通过可量化的一元一阶逻辑测试用例生成来基准测试大语言模型推理

Xinyi Zheng, Ling Shi, Tianlong Yu, Yongxin Zhao, Lorenz Goette, Kailong Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学) Hubei University(湖北大学) East China Normal University(华东师范大学) National University of Singapore(新加坡国立大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出QMFOL框架,通过可控制复杂度的合取/析取模式生成一元一阶逻辑推理任务,并构建包含2880个实例的基准QMFOLBench,评估显示逻辑复杂度增加导致性能下降和计算开销上升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15155 2026-06-16 cs.LG 新提交 79%

Semantic Reasoning in Medicine: The Role of Knowledge Graphs Across Five Key Domains

医学中的语义推理:知识图谱在五个关键领域的作用

Haniye Sherafatmandjoo, Mohammad Akbari, Zahed Rahmati

机构 * Amirkabir University of Technology(阿米尔卡比尔理工大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.LG

AI总结 综述知识图谱在医学中的应用,涵盖临床决策支持、疾病预测、健康推荐、精准医疗和医学问答,并讨论构建方法、挑战及未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09195 2026-06-09 cs.CL 新提交 79%

Symbolic and Abstractive Reasoning with Complex Visual Queries

复杂视觉查询的符号与抽象推理

Yichi Zhang, Jingdian Lu, Zhuo Chen, Lingbing Guo, Jun Xu, Wen Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) Nanjing University(南京大学) Ant Group(蚂蚁集团)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出复杂视觉查询(CVQ)概念,通过多模态知识图谱合成数据集,并设计两阶段训练框架,提升多模态大语言模型的符号与抽象推理能力。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08471 2026-06-09 cs.CL cs.AI 新提交 79%

More Yap Less Meaning: Uncovering Self-Improvement Behavior in SLMs

更多废话,更少意义:揭示小语言模型中的自我改进行为

Marina Igitkhanian, Erik Arakelyan

机构 * American University of Armenia(亚美尼亚美国大学) NVIDIA(英伟达)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过构建充分性测试,发现小语言模型在自我纠正中仅获得4.4%的准确率提升,且较长的提示反而与错误答案正相关,表明其推理能力有限。

Comments GEM Workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13268 2026-08-14 cs.PL cs.LO 新提交 78%

Multiobjective Preexpectation Reasoning for Probabilistic Programs

概率程序的多目标预期望推理

Lena Verscht, Hannah Mertens, Kevin Batz, Sebastian Junges, Benjamin Lucien Kaminski, Joost-Pieter Katoen

专题命中 逻辑推理 :reasoning(title);planning(abstract)

AI总结 针对带非确定性的概率程序规划问题,提出多目标预期望变换器及对应策略综合规则,构建了无限MDP上多目标优化的程序层面符号方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06760 2026-08-10 cs.NI 新提交 78%

A Parameter-Specific Retrieval and Knowledge-Guided Reasoning Framework for LLM-Based GPSR Optimization in FANETs

面向FANET中基于LLM的GPSR优化的参数特定检索与知识引导推理框架

Zhipeng Lin, Bin Duo, Tong Liu, Jie Lin, Jianting Yuan, Xiaojun Yuan

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 针对FANET中现有GPSR协议难以适配动态环境的问题,提出基于LLM的PMKR-GPSR框架,通过参数特定多索引检索和知识引导约束图实现协议一致的路由参数适配,在高移动性场景下提升了数据包投递率并降低了端到端时延。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01534 2026-08-04 cs.CV 新提交 78%

Recursive Vision Language Models for General Symbolic Reasoning

用于通用符号推理的递归视觉语言模型

Omid Nejati Manzari, Guillaume Lajoie, Hassan Rivaz

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 提出基于预训练Qwen的递归推理框架R-Qwen,结合递归模型与预训练LLMs的优势,在8个基准测试中优于同类模型和更大LLMs,ARC-AGI上提升27.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01138 2026-07-02 cs.CR 新提交 78%

Antaeus: Hunting Repository-Level Logic Vulnerabilities via Context-Grounded LLM Reasoning

Antaeus: 通过上下文锚定的LLM推理发现仓库级逻辑漏洞

Michele Armillotta, Nicolò Romandini, Rebecca Montanari, Lorenzo Cavallaro

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 提出Antaeus框架,通过仓库级代码上下文锚定LLM推理,结合函数优先级排序、上下文推理、比较验证和结构化报告,有效检测逻辑漏洞,在28个仓库中检测出15个漏洞,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00544 2026-07-02 cs.CV 新提交 78%

GEAR-Seg: A Grounded Explainable Agent for Reasoning Segmentation and Data Engine

GEAR-Seg:用于推理分割和数据引擎的基于可解释智能体

Yanan Wang, Wen Li, Yibin Ying, Zhenghao Fei

机构 * College of Biosystems Engineering and Food Science, Zhejiang University(浙江大学生物系统工程与食品科学学院) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学杭州国际科创中心)

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 提出GEAR-Seg,一种解耦的智能体框架,通过将像素转换为属性文本实现可解释推理分割,零样本性能优异,并可作为数据引擎构建大规模基准GEAR-131K。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18164 2026-06-17 cond-mat.dis-nn physics.data-an 新提交 78%

Learning Dynamics of Chain-of-Thought State Tracking in a Solvable Transformer Model

可解Transformer模型中思维链状态追踪的学习动力学

Niklas Forner, Marcel Kühn, Matthias Thamm, Bernd Rosenow

专题命中 逻辑推理 :chain-of-thought(title,abstract)

AI总结 通过可解设置研究Transformer在思维链状态追踪中的学习动力学,发现注意力检索与MLP逻辑模块分阶段协同发展。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08442 2026-06-09 cs.CY 新提交 78%

Clinical Reasoning in the Age of AI: Longitudinal Cognition and Human-AI Collaboration

人工智能时代的临床推理:纵向认知与人机协作

Irene Yi, Grace Brown, Sufian Aldogom, Nathan Roll, Eric J. Basile, Pamela M. Resnikoff, Bianca Sanchez, Chirag Lodha, Isaac Gutterman, Oscar Schiff, Keira Salata, Benjamin Mujkic, Ammar Ahmed

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 本研究通过混合方法揭示临床推理的纵向结构,发现当前AI系统主要支持单次就诊任务,与医生多就诊的推理过程存在关键不匹配,为设计更符合真实临床推理的AI系统提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07872 2026-06-09 cs.CV 新提交 78%

VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?

VisualFLIP: 在多模态推理中,预测是否依赖于任务关键的视觉证据?

Didi Zhu, Changrui Chen, Stefanos Zafeiriou, Jiankang Deng

机构 * Imperial College London(伦敦帝国理工学院)

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 提出VisualFLIP基准,通过成对图像扰动测试多模态大模型是否真正依赖关键视觉证据,发现正确预测与证据依赖存在分离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12486 2026-08-14 cs.CL 新提交 77%

DIVE: Unlocking Self-Improvement in Frozen Language Models Through Diversity-Driven Skill Evolution

DIVE:通过多样性驱动的技能进化解锁冻结语言模型的自我提升

Siheng Xiong, Ali Payani, Oguzhan Gungordu, Faramarz Fekri

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 DIVE是一种多样性驱动的无参数框架,可让冻结LLM从任务经验和验证器反馈中进化出自然语言技能,在多项推理任务上优于现有方法,还能实现模型间技能迁移,让小模型性能匹配或超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08960 2026-07-13 cs.LG cs.AI 新提交 76%

Eluna: An Agentic LLM System for Automating Warehouse Operations with Reasoning and Task Execution

Eluna:一个用于通过推理和任务执行实现仓库运营自动化的智能语言模型系统

Ning Liu, Kalle Kujanpää, Zhaoxuan Zhu, P Aditya Sreekar, Kaiwen Liu, Chuanneng Sun, Jorge Marchena Menendez, Matthew Bales, Tianyu Yang, Shahnawaz Alam, Rose Yu, Baoyuan Liu, Kristina Klinkner, Shervin Malmasi

机构 * Amazon.com, Inc. Fulfillment Technologies and Robotics(亚马逊公司履约技术与机器人部门)

专题命中 逻辑推理 :reasoning(title);分类 cs.AI、cs.LG

AI总结 研究针对仓库运营中SOP执行问题,提出Eluna智能体系统,它是图形引导多智能体框架,采用非对称情节蒸馏方法,在基准测试和生产应用中,微调模型表现出色,匹配或超教师模型,击败基线,在票务处理应用达94%专家一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00342 2026-07-02 eess.SP 新提交 75%

Semantic-based Internet of Embodied Intelligence: Visions and Frontiers

基于语义的具身智能物联网:愿景与前沿

Yaheng Wang, Rui Meng, Xiaodong Xu, Yiming Liu, Feiliang Song, Linyuan Hu, Huishi Song, Lexi Xu, Tony Q. S. Quek, Ping Zhang

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);logical reasoning(abstract)

AI总结 提出基于语义的具身智能物联网(SIoEI),通过语义信息统一度量解决多智能体网络中的多模态数据传输开销和逻辑推理与物理约束解耦问题,并验证其在信道鲁棒性和端到端延迟方面的优势。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07924 2026-06-09 cs.CV cs.AI cs.CL cs.LG cs.MM 新提交 75%

Decoupling Semantics and Logic: A Training-Free Coarse-to-Fine Pipeline for Video Retrieval-Augmented Generation

解耦语义与逻辑:一种无需训练的从粗到精的视频检索增强生成流水线

Jiaxin Dai, Zehang Wei, Jiamin Yan, Xiang Xiang

机构 * School of Computer Science & Tech, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) School of AI and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种无需训练的两阶段级联视频RAG流水线,通过解耦语义检索与逻辑推理,实现跨语言长视频理解、严格角色遵循和零幻觉时间定位。

Comments To be presented at ACL 2026 MAGMAR Workshop (Oral; Retrieval leaderboard No.1)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18249 2026-07-22 q-bio.QM cs.AI 新提交 74%

MechAInistic: An LLM-guided Multi-Agent System for Reasoning over Genome-Scale Constraint-Based Metabolic Models

MechAInistic:一种由大语言模型引导的多智能体系统,用于基于基因组规模的约束代谢模型进行推理

Josh Loecker, Narayna Puraja, William Bryan, Bhanwar Lal Puniya, Ahmed Abdeen Hamed, Tomáš Helikar

专题命中 逻辑推理 :reasoning(title);分类 cs.AI

AI总结 研究旨在降低基于约束的代谢建模使用门槛,开发了MechAInistic多智能体系统,借助大语言模型,围绕特定模式将自然语言问题转化为可执行工作流程,通过两个免疫细胞代谢模型用例验证,能生成可追溯的治疗假设。

Comments 23 pages, 6 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16738 2026-07-21 cs.AI 新提交 74%

Supporting Autonomous Process Execution within a Multi-Perspective Constraint Frame via Numeric Planning

通过数值规划在多视角约束框架内支持自主流程执行

Paul Wittlinger, Giacomo Acitelli, Anti Alman, Fabrizio Maria Maggi, Andrea Marrella

专题命中 逻辑推理 :planning(title);分类 cs.AI

AI总结 研究在人工智能增强业务流程管理系统中,通过引入新工具,用多视角约束增强流程框架,为部分流程执行推荐最优延续,经实证评估该技术具可扩展性和有效性,能支持自主及约束感知决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07316 2026-07-09 cs.LG 新提交 74%

Mechanistic Interpretability for Neural Networks: Circuits, Sparse Features and Symbolic Reasoning

神经网络的机械可解释性:电路、稀疏特征和符号推理

Pranav Sawant, Jakub Krejčí

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) VSB—Technical University of Ostrava(奥斯特拉瓦技术大学)

专题命中 逻辑推理 :reasoning(title);分类 cs.LG

AI总结 研究神经网络机械可解释性,通过Transformer电路分析、Sparse Autoencoders等工具应对叠加等挑战,探索控制模型行为方法,还将机械见解与神经符号人工智能框架联系,以实现神经网络内部算法逆向工程及可解释。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00447 2026-07-02 cs.CL 新提交 74%

Understanding Why Language Models Hallucinate: Testing Reasoning Against Priors

理解语言模型为何产生幻觉:针对先验知识的推理测试

Yangfan Hu, Xuhan Tong, Haoyue Bai, Xi Ding, Shashank Muralidhar Bharadwaj, Siyang Cao, Robert Nowak, Jiawei Zhang

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 逻辑推理 :reasoning(title);分类 cs.CL

AI总结 本文提出推理错位假说,认为幻觉源于模型偏向统计显著的潜在关联而非遵循提示约束,并通过TrapQA测试集验证了两种偏差模式。

Comments Project page: https://neohughus.github.io/Understanding_Why_Language_Models_Hallucinate/

详情

展开后加载摘要…

URL PDF HTML 收藏