arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3005 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 3005 篇

2208.11556 2022-10-20 cs.AI cs.MA 83%

Knowledge-based and Data-driven Reasoning and Learning for Ad Hoc Teamwork

Hasra Dodampegama, Mohan Sridharan

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

Comments Presented at the AI-HRI Symposium at AAAI Fall Symposium Series(FSS), 2022 (arXiv:cs/2209.14292)

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.13841 2022-08-31 cs.AI 83%

Visual-Imagery-Based Analogical Construction in Geometric Matrix Reasoning Task

Yuan Yang, Keith McGreggor, Maithilee Kunda

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.00418 2021-01-19 cs.AI cs.LO 83%

Machine Reasoning Explainability

Kristijonas Cyras, Ramamurthy Badrinath, Swarup Kumar Mohalik, Anusha Mujumdar, Alexandros Nikou, Alessandro Previti, Vaishnavi Sundararajan, Aneta Vulgarakis Feljan

专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.04864 2020-11-11 cs.CL 83%

Natural Language Inference in Context -- Investigating Contextual Reasoning over Long Texts

Hanmeng Liu, Leyang Cui, Jian Liu, Yue Zhang

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.10621 2019-05-28 cs.AI 83%

Dynamic Epistemic Logic with ASP Updates: Application to Conditional Planning

Pedro Cabalar, Jorge Fandinno, Luis Fariñas del Cerro

专题命中 逻辑推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08514 2026-08-13 cs.AI cs.CL cs.LG 交叉投稿 83%

Reproducing and Stress-Testing Two Approaches to LLM Reasoning Reliability: Test-Time Probability Aggregation and Logic-Representation Editing

复现与压力测试两种提升大语言模型(LLM)推理可靠性的方法:测试时概率聚合与逻辑表示编辑

Minhan Cho, Jimin Kweon

机构 * Sungkyunkwan University(成均馆大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究复现了RPC与LCF两种提升LLM推理可靠性的方法,在多任务域与多模型上压力测试,发现RPC优势未达显著且样本量增大后效果逆转,LCF效果弱且无统计显著性。

Comments 16 pages, 3 figures, 9 tables. Code, data, and experiment logs: https://github.com/rabqatab/llm-reasoning-reliability-reproduction

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03450 2026-08-05 cs.MM cs.AI cs.CL cs.CV 新提交 82%

Balancing Efficiency and Efficacy: Training-Free Attention-Guided Switching Between Explicit and Latent Thoughts for MLLMs

平衡效率与效能:面向多模态大语言模型(MLLM)的无训练注意力引导式显式与隐式思维切换

Haoqian Kang, Liupeng Li, Kuofeng Gao, Jinpeng Wang, Zhenyu Lu, Bin Chen, Ke Chen, Yaowei Wang

专题命中 逻辑推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 针对MLLM推理中感知与逻辑混淆的问题,提出无训练的注意力引导式切换框架,通过视觉-文本注意力比率自适应切换显式与隐式推理,实现性能与效率的双重提升。

Comments Accepted by ACM MM 2026. 10 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09149 2026-07-14 cs.LG cs.AI cs.MA 版本更新 82%

Enabling Agents to Communicate Entirely in Latent Space

使智能体能够在潜在空间中完全交流

Zhuoyun Du, Runze Wang, Huiyu Bai, Zouying Cao, Xiaoyong Zhu, Yu Cheng, Bo Zheng, Wei Chen, Haochao Ying

机构 * State Key Lab of CAD&CG(CAD与CG国家重点实验室) Future Living Lab of Alibaba(阿里巴巴未来生活实验室) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江医学影像人工智能重点实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 逻辑推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Interlat方法,通过利用LLM的连续隐藏状态实现智能体间的潜在空间通信,实验表明其在跨异构模型中表现优异,提升了推理速度并保持性能。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12415 2026-05-14 cs.CL cs.AI 82%

Table-R1: Region-based Reinforcement Learning for Table Understanding

基于区域的表格理解强化学习:Table-R1

Zhenhe Wu, Jian Yang, Zhongjiang He, Changzai Pan, Jie Zhang, Jiaheng Liu, Xianjie Wu, Yu Zhao, Shuangyong Song, Yongxiang Li, Zhoujun Li, Xueling Li

机构 * Beihang University(北京航空航天大学) Xingchen AGI Lab(星辰AGI实验室) China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(中国电信人工智能技术(北京)有限公司) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI))

专题命中 逻辑推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Table-R1,通过区域证据增强和TARPO优化提升LLM的表格理解能力,在多个数据集上提升14.36个百分点,同时降低响应token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12426 2026-04-15 cs.LG cs.CL 82%

Do Transformers Use their Depth Adaptively? Evidence from a Relational Reasoning Task

Transformer 是否会根据深度进行自适应使用?来自关系推理任务的证据

Alicia Curth, Rachel Lawrence, Sushrut Karmalkar, Niranjani Prasad

机构 * Microsoft Research Cambridge(微软研究院剑桥分部)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.LG;logical reasoning(comments)

AI总结 本文通过控制多跳关系推理任务研究Transformer是否自适应使用深度,发现预训练模型在简单任务中使用较少层,而微调模型在更复杂的任务中更一致地自适应调整深度。

Comments Accepted at the ICLR 2026 Workshop on Logical Reasoning of Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20999 2025-09-17 cs.LG cs.CL 82%

LoRA-PAR: A Flexible Dual-System LoRA Partitioning Approach to Efficient LLM Fine-Tuning

Yining Huang, Bin Li, Keke Tang, Meilian Chen

机构 * School of Politics and Public Administration, South China Normal University(华南师范大学政治与公共管理学院) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Shenyang institute of computing technology, Chinese academy of sciences(中国科学院沈阳计算技术研究所)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03930 2025-04-08 cs.AI cs.CC cs.LG 82%

Have Large Language Models Learned to Reason? A Characterization via 3-SAT Phase Transition

Rishi Hazra, Gabriele Venturato, Pedro Zuidberg Dos Martires, Luc De Raedt

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)

Comments An updated version of arXiv:2408.07215v2, featuring: (1) inclusion of recent LRMs and recent LLMs, (2) revised conclusions reflecting recent developments, and (3) updated analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07432 2025-02-11 cs.LG cs.AI cs.LO 82%

Can Transformers Reason Logically? A Study in SAT Solving

Leyan Pan, Vijay Ganesh, Jacob Abernethy, Chris Esposo, Wenke Lee

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)

Comments 41 pages, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04669 2024-10-29 cs.LG cs.CL 82%

Towards a Theoretical Understanding of the 'Reversal Curse' via Training Dynamics

Hanlin Zhu, Baihe Huang, Shaolun Zhang, Michael Jordan, Jiantao Jiao, Yuandong Tian, Stuart Russell

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)

Comments 41 pages, 18 figures, NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02439 2024-04-23 cs.AI cs.CL cs.CV 82%

Let's Think Outside the Box: Exploring Leap-of-Thought in Large Language Models with Creative Humor Generation

Shanshan Zhong, Zhongzhan Huang, Shanghua Gao, Wushao Wen, Liang Lin, Marinka Zitnik, Pan Zhou

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.00447 2023-08-02 cs.AI cs.CL 82%

Structural Embeddings of Tools for Large Language Models

Eren Unlu

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12325 2026-08-14 cs.AI cs.CL cs.LG 新提交 82%

Position: Reasoning is a Learnable Rule-Based Process

立场:推理是一个可学习的基于规则的过程

Rachel Lawrence, Jacqueline Maasch

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出推理是可学习的基于规则的过程,针对生成式AI社区推理定义模糊问题,给出操作定义与研究交流最佳实践清单,以保障推理评估的结构效度。

Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11844 2026-08-05 cs.CV 版本更新 82%

Beyond the Single Camera: Agentic Multi-View Reasoning in Sports Video Understanding

超越单摄像头:体育视频理解中的智能多视角推理

Kerui Chen, Jinglu Wang, Xiaoyi Zhang, Yan Lu

机构 * Zhejiang University(浙江大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract)

AI总结 针对体育视频多视角理解缺乏评估基准及MLLMs难以利用多视角信息的问题,引入SportMV - Bench基准,分析瓶颈所在,并提出SportMV - Agent框架,通过迭代循环实现主动视角选择等,相比最强MLLM基线有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22241 2026-07-31 cs.CV 版本更新 82%

AgentHOI: Multi-Agent Reasoning for Human-Object-Interaction Video Generation via Implicit Representation Alignment

AgentHOI:通过隐式表示对齐进行人类-物体交互视频生成的多智能体推理

Ziyao Huang, Shunkai Li, Juan Cao, Chenyu Li, Youliang Zhang, Zixiang Zhou, Cong Wang, Yuan Zhou, Qinglin Lu, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent HunYuan(腾讯混元)

专题命中 逻辑推理 :reasoning(title,abstract);planning(abstract)

AI总结 研究针对HOI视频生成中现有方法依赖显式运动控制的问题,提出AgentHOI,通过多智能体推理和隐式文本-运动对齐策略,实现文本驱动的HOI视频生成,提升了交互自然性等,改进了复杂场景下的表现。

Comments Under review. The code is available at https://github.com/bone-11/agenthoi

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03701 2026-07-30 cs.CV 版本更新 82%

VidNum: Diagnosing VLM Failure Modes in Video-Grounded Numerical Reasoning

VidNum-1.4K:一个全面的视频基于数值推理基准

Shaoyang Cui, Lingbei Meng, Yaodi Luo, Peize He

机构 * Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本文提出VidNum-1.4K基准,通过1379个严格人工标注的视频问题对,评估视频基于的数值推理能力,揭示当前VLMs在多步骤逻辑推理上的不足。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31260 2026-07-01 cs.RO 新提交 82%

Plan Right, Then Plan Tight: Symbolic RL for Efficient Embodied Reasoning

先规划正确,再规划紧凑:面向高效具身推理的符号强化学习

Xiangli Shi, Xiaomeng Zhu, Ye Tian, Yuchun Guo, Ziyang Sun, Lujie Yin, Yuxuan Zhou, Yufei Huang

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学) Tencent(腾讯) University of London(伦敦大学)

专题命中 逻辑推理 :reasoning(title);planning(abstract);verifier(abstract)

AI总结 针对具身任务规划中缺乏低成本确定性验证的问题,提出基于BDDL规范的符号强化学习框架,通过视频解析、LLM验证和轻量符号引擎提供毫秒级密集反馈,并引入难度感知长度调度GroupAdapt,在BEHAVIOR-1000上实现97.3的严格通过率,相对Qwen3-8B提升25.9%。

Comments 18 pages, 10 figures, 14 tables; includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27281 2026-06-26 cs.LO 新提交 82%

Resource-Aware Neuro-Symbolic Reasoning for Local Small Language Models

资源感知的神经符号推理用于本地小型语言模型

Carlos Ramírez Ovalle, Abel Alvarez

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 提出VFR-LLM管道,将问题翻译为类型化有限域规则和约束,通过符号层验证一致性,用确定性求解器推理,在本地小模型上以单次调用达到高精度,替代重复采样。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16886 2026-06-16 cs.SE 新提交 82%

Neuro-Symbolic Software Verification: Hyper-charging Local Language Models with Symbolic Reasoning at Scale

神经符号软件验证:通过符号推理在规模上增强本地语言模型

Muhammad A. A. Pirzada, Julian Parsert, Weiqi Wang, Konstantin Korovin, Lucas C. Cordeiro

专题命中 逻辑推理 :reasoning(title);chain-of-thought(abstract);verifier(abstract)

AI总结 提出VerIbmc管道,结合符号不变量生成与本地开源语言模型及ESBMC验证工具,通过结构化的验证器反馈迭代优化,实现隐私保护且高效的循环不变量合成,在520个问题上达到86.4%的解决率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05641 2026-06-02 cs.CL cs.AI cs.LG 82%

Skill-Based Mixture-of-Experts: Adaptive Routing for Heterogeneous Reasoning via Inferred Skills

基于技能的混合专家模型:通过推断技能实现异构推理的自适应路由

Justin Chih-Yao Chen, Sukwon Yun, Elias Stengel-Eskin, Tianlong Chen, Mohit Bansal

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Skill-MoE框架,通过推断查询所需技能进行实例级专家选择,并采用批推理策略降低开销,在单GPU上集成16个专家模型,在多个推理基准上平均提升8.15%。

Comments ICML 2026 (Camera-Ready). The first three authors contributed equally. Project Page: https://skill-moe.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19944 2026-05-20 cs.LG cs.AI cs.CC cs.CL 82%

A Measure-Theoretic Analysis of Reasoning: Structural Generalization and Approximation Limits

关于推理的测度论分析:结构泛化与近似限制

Yuyang Zhang, Yifu Zhang, Xuehai Zhou, Xiaoyin Chen

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过最优传输理论分析推理过程,揭示了结构泛化和近似限制的理论机制,发现位置依赖注意力机制和Transformer电路深度对推理性能有显著影响。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14036 2026-05-15 cs.AI cs.CC cs.CL cs.LG 82%

Enhanced and Efficient Reasoning in Large Learning Models

增强和高效的大型学习模型推理

Leslie G. Valiant

机构 * John A. Paulson School of Engineering and Applied Sciences(约翰·A·保罗森工程与应用科学学院)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种高效且基于原理的推理方法,用于改进大型语言模型,通过预处理和机器学习流程提升推理能力,实现更稳健的逻辑推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00775 2026-05-13 cs.RO cs.SY eess.SY 82%

SAGAS: Semantic-Aware Graph-Assisted Stitching for Offline Temporal Logic Planning

SAGAS:语义感知的图辅助拼接用于离线时序逻辑规划

Ruijia Liu, Ancheng Hou, Xiang Yin

机构 * School of Automation and Intelligent Sensing(自动化与智能感知学院)

专题命中 逻辑推理 :planning(title,abstract);reasoning(abstract)

AI总结 SAGAS结合符号合成的组成性和从离线轨迹学习的数据驱动可达结构,实现零样本泛化,无需任务特定奖励或在线交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00017 2026-04-10 cs.CL cs.AI cs.DB cs.LG 82%

ReCellTy: Domain-Specific Knowledge Graph Retrieval-Augmented LLMs Reasoning Workflow for Single-Cell Annotation

ReCellTy:领域特定的知识图谱检索增强型大语言模型推理工作流用于单细胞注释

Dezheng Han, Yibin Jia, Ruxiao Chen, Wenjie Han, Shuaishuai Guo, Jianbo Wang

机构 * Shandong University(山东大学) Qilu Hospital of Shandong University(山东大学齐鲁医院) Johns Hopkins University(约翰霍普金斯大学) Cognicore Artificial Intelligence Co., Ltd.(科智人工智能有限公司)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ReCellTy,通过整合生物信息知识图谱和多任务推理工作流,提升单细胞注释的准确性与自动化水平,改进人类评估得分和语义相似度,缩小大中小语言模型性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04124 2026-03-05 cs.AI cond-mat.mtrl-sci cs.CL cs.LG 82%

BeamPERL: Parameter-Efficient RL with Verifiable Rewards Specializes Compact LLMs for Structured Beam Mechanics Reasoning

BeamPERL: 参数高效强化学习与可验证奖励用于结构梁力学推理

Tarjei Paule Hage, Markus J. Buehler

机构 * Department of Mechanical Engineering(机械工程系) Massachusetts Institute of Technology(麻省理工学院) Department of Civil and Environmental Engineering(土木与环境工程系) Schwarzman College of Computing(施瓦茨曼计算学院)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BeamPERL通过参数高效强化学习与可验证奖励,提升紧凑语言模型在结构梁力学推理中的能力,发现精确奖励无法保证可转移的物理推理,需结合结构化推理支架以实现稳健科学推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11556 2026-03-02 cs.LG cs.AI cs.CL cs.SD eess.AS 82%

CSyMR: Benchmarking Compositional Music Information Retrieval in Symbolic Music Reasoning

CSyMR:在符号音乐推理中进行组合音乐信息检索的基准测试

Boyang Wang, Yash Vishe, Xin Xu, Zachary Novack, Xunyi Jiang, Julian McAuley, Junda Wu

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CSyMR-Bench通过工具增强的检索和推理框架,在符号音乐推理中实现组合音乐信息检索的准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏