arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45051 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 3033 篇

2504.14239 2025-04-22 cs.AI cs.CL 79%

InfiGUI-R1: Advancing Multimodal GUI Agents from Reactive Actors to Deliberative Reasoners

Yuhang Liu, Pengxiang Li, Congkai Xie, Xavier Hu, Xiaotian Han, Shengyu Zhang, Hongxia Yang, Fei Wu

机构 * Zhejiang University(浙江大学) Dalian University of Technology(大连理工大学) Reallm Labs(Reallm实验室) The Hong Kong Polytechnic University(香港理工大学)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

Comments 10 pages, 3 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14180 2025-02-21 cs.LG cs.CL 79%

On the logical skills of large language models: evaluations using arbitrarily complex first-order logic problems

Shokhrukh Ibragimov, Arnulf Jentzen, Benno Kuckuck

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);logical reasoning(abstract);分类 cs.CL、cs.LG

Comments 67 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18130 2024-12-09 cs.AI cs.CL 79%

Logic Agent: Enhancing Validity with Logic Rule Invocation

Hanmeng Liu, Zhiyang Teng, Chaoli Zhang, Yue Zhang

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments The experiment is subject to certain errors

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02336 2024-05-08 cs.AI cs.LG cs.NI 79%

Artificial General Intelligence (AGI)-Native Wireless Systems: A Journey Beyond 6G

Walid Saad, Omar Hashash, Christo Kurisummoottil Thomas, Christina Chaccour, Merouane Debbah, Narayan Mandayam, Zhu Han

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);logical reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08411 2023-07-18 cs.AI cs.LG cs.LO 79%

Neurosymbolic AI for Reasoning on Biomedical Knowledge Graphs

Lauren Nicole DeLong, Ramon Fernández Mir, Zonglin Ji, Fiona Niamh Coulter Smith, Jacques D. Fleuriot

专题命中 逻辑推理 :reasoning(title,comments);分类 cs.AI、cs.LG;logical reasoning(comments)

Comments Proceedings of the $\mathit{40}^{th}$ International Conference on Machine Learning: Workshop on Knowledge and Logical Reasoning in the Era of Data-driven Learning (https://klr-icml2023.github.io/schedule.html). PMLR 202, 2023. Condensed, workshop-ready version of previous survey, arXiv:2302.07200 , which is under review. 13 pages (9 content, 4 references), 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15541 2023-05-26 cs.CL cs.AI 79%

Harnessing the Power of Large Language Models for Natural Language to First-Order Logic Translation

Yuan Yang, Siheng Xiong, Ali Payani, Ehsan Shareghi, Faramarz Fekri

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07761 2026-08-21 cs.CV 版本更新 78%

Video Evidence to Reasoning Efficient Video Understanding via Explicit Evidence Grounding

视频证据推理:通过显式证据接地实现高效的视频理解

Yanxiang Huang, Guohua Gao, Zhaoyang Wei

机构 * Department of Applied Mathematics, The Hong Kong Polytechnic University(应用数学系,香港理工大学)

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 本文提出CoE框架,通过显式证据接地模块和强化学习优化的锚定协议,提升视频推理的准确性和可靠性。

Comments 6 pages

Journal ref ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13268 2026-08-14 cs.PL cs.LO 新提交 78%

Multiobjective Preexpectation Reasoning for Probabilistic Programs

概率程序的多目标预期望推理

Lena Verscht, Hannah Mertens, Kevin Batz, Sebastian Junges, Benjamin Lucien Kaminski, Joost-Pieter Katoen

专题命中 逻辑推理 :reasoning(title);planning(abstract)

AI总结 针对带非确定性的概率程序规划问题,提出多目标预期望变换器及对应策略综合规则,构建了无限MDP上多目标优化的程序层面符号方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06760 2026-08-10 cs.NI 新提交 78%

A Parameter-Specific Retrieval and Knowledge-Guided Reasoning Framework for LLM-Based GPSR Optimization in FANETs

面向FANET中基于LLM的GPSR优化的参数特定检索与知识引导推理框架

Zhipeng Lin, Bin Duo, Tong Liu, Jie Lin, Jianting Yuan, Xiaojun Yuan

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 针对FANET中现有GPSR协议难以适配动态环境的问题,提出基于LLM的PMKR-GPSR框架,通过参数特定多索引检索和知识引导约束图实现协议一致的路由参数适配,在高移动性场景下提升了数据包投递率并降低了端到端时延。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01534 2026-08-04 cs.CV 新提交 78%

Recursive Vision Language Models for General Symbolic Reasoning

用于通用符号推理的递归视觉语言模型

Omid Nejati Manzari, Guillaume Lajoie, Hassan Rivaz

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 提出基于预训练Qwen的递归推理框架R-Qwen,结合递归模型与预训练LLMs的优势,在8个基准测试中优于同类模型和更大LLMs,ARC-AGI上提升27.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07515 2026-07-30 eess.SY cs.SY 版本更新 78%

Domain-Aware Machine Learning for Accelerating MILP-Based Motion Planning with Temporal Logic and Chance Constraints

神经符号加速基于MILP的运动规划与时间逻辑和随机约束

Junyang Cai, Weimin Huang, Brendan Long, Matthew Cleaveland, Jyotirmoy V. Deshmukh, Lars Lindemann, Bistra Dilkina

专题命中 逻辑推理 :planning(title,abstract)

AI总结 本文提出利用神经符号方法加速MILP运动规划,通过机器学习指导求解器的符号搜索,提升处理时间逻辑、随机约束等复杂规划问题的效率和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01848 2026-07-22 cs.CV 版本更新 78%

Semantic Richness or Geometric Reasoning? The Fragility of VLM's Visual Invariance

语义丰富性还是几何推理?VLM视觉不变性的脆弱性

Jason Qiu, Zachary Meurer, Xavier Thomas, Deepti Ghadiyaram

机构 * Boston University(波士顿大学)

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 研究揭示VLM在基本几何变换下的脆弱性,指出其在空间不变性与等变性上的不足,影响物体识别的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01138 2026-07-02 cs.CR 新提交 78%

Antaeus: Hunting Repository-Level Logic Vulnerabilities via Context-Grounded LLM Reasoning

Antaeus: 通过上下文锚定的LLM推理发现仓库级逻辑漏洞

Michele Armillotta, Nicolò Romandini, Rebecca Montanari, Lorenzo Cavallaro

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 提出Antaeus框架,通过仓库级代码上下文锚定LLM推理,结合函数优先级排序、上下文推理、比较验证和结构化报告,有效检测逻辑漏洞,在28个仓库中检测出15个漏洞,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00544 2026-07-02 cs.CV 新提交 78%

GEAR-Seg: A Grounded Explainable Agent for Reasoning Segmentation and Data Engine

GEAR-Seg:用于推理分割和数据引擎的基于可解释智能体

Yanan Wang, Wen Li, Yibin Ying, Zhenghao Fei

机构 * College of Biosystems Engineering and Food Science, Zhejiang University(浙江大学生物系统工程与食品科学学院) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学杭州国际科创中心)

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 提出GEAR-Seg,一种解耦的智能体框架,通过将像素转换为属性文本实现可解释推理分割,零样本性能优异,并可作为数据引擎构建大规模基准GEAR-131K。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01472 2026-06-30 cs.RO 78%

AERMANI-VLM: Structured Prompting and Reasoning for Aerial Manipulation with Vision Language Models

AERMANI-VLM:基于视觉语言模型的空中 manipulation 的结构提示与推理

Sarthak Mishra, Rishabh Dev Yadav, Avirup Das, Saksham Gupta, Wei Pan, Spandan Roy

机构 * Robotics Research Center, IIIT Hyderabad(IIIT海得拉巴机器人研究中心) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) Newcastle University(纽卡斯尔大学)

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 本文提出AERMANI-VLM框架,通过分离高层推理与低层控制,利用结构化提示生成自然语言推理轨迹,实现安全可靠的空中 manipulation 任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02564 2026-06-26 cs.CV 版本更新 78%

VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization

VLMs 是视频推理的好老师:通过自适应测试时优化

Junhao Cheng, Liang Hou, Tianxiong Zhong, Xin Tao, Pengfei Wan, Kun Gai, Jing Liao

机构 * City University of Hong Kong(香港城市大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 提出将视觉语言模型(VLM)作为“教师”,通过提取任务规则并设计可微分奖励,指导视频生成模型(VGM)在测试时在线优化轻量级 LoRA 模块,从而提升视频推理的泛化能力。

Comments Project Page: https://VLM-as-Teacher.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18164 2026-06-17 cond-mat.dis-nn physics.data-an 新提交 78%

Learning Dynamics of Chain-of-Thought State Tracking in a Solvable Transformer Model

可解Transformer模型中思维链状态追踪的学习动力学

Niklas Forner, Marcel Kühn, Matthias Thamm, Bernd Rosenow

专题命中 逻辑推理 :chain-of-thought(title,abstract)

AI总结 通过可解设置研究Transformer在思维链状态追踪中的学习动力学,发现注意力检索与MLP逻辑模块分阶段协同发展。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20306 2026-06-12 cs.HC 版本更新 78%

Structured Visualization Design Knowledge for Grounding Generative Reasoning and Situated Feedback

结构化可视化设计知识:用于基础生成推理和情境反馈

Péter Ferenc Gyarmati, Dominik Moritz, Torsten Möller, Laura Koesten

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 提出一种结构化方案,将可视化设计知识编码为带语义元数据的自然语言指南,支持专家编写、机器查询,并嵌入向量空间以分析冲突和跨领域原则,弥补符号系统与生成模型之间的鸿沟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05972 2026-06-12 cs.DC 版本更新 78%

DWM-RO: Decentralized World Models with Reasoning Offloading for SWIPT-enabled Satellite-Terrestrial HetNets

DWM-RO:面向支持SWIPT的卫星-地面异构网络的去中心化世界模型与推理卸载

Guangyuan Liu, Yinqiu Liu, Ruichen Zhang, Nan Ma, Jiawen Kang, Sumei Sun, Abbas Jamalipour, Ping Zhang

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 针对SWIPT卫星-地面异构网络中多智能体强化学习样本效率低和协调性差的问题,提出去中心化世界模型与推理卸载框架,通过想象策略训练和边缘协调机制实现快速收敛、高谱效和低约束违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08442 2026-06-09 cs.CY 新提交 78%

Clinical Reasoning in the Age of AI: Longitudinal Cognition and Human-AI Collaboration

人工智能时代的临床推理:纵向认知与人机协作

Irene Yi, Grace Brown, Sufian Aldogom, Nathan Roll, Eric J. Basile, Pamela M. Resnikoff, Bianca Sanchez, Chirag Lodha, Isaac Gutterman, Oscar Schiff, Keira Salata, Benjamin Mujkic, Ammar Ahmed

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 本研究通过混合方法揭示临床推理的纵向结构,发现当前AI系统主要支持单次就诊任务,与医生多就诊的推理过程存在关键不匹配,为设计更符合真实临床推理的AI系统提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07872 2026-06-09 cs.CV 新提交 78%

VisualFLIP: Do Predictions Depend on Task-Critical Visual Evidence in Multimodal Reasoning?

VisualFLIP: 在多模态推理中,预测是否依赖于任务关键的视觉证据?

Didi Zhu, Changrui Chen, Stefanos Zafeiriou, Jiankang Deng

机构 * Imperial College London(伦敦帝国理工学院)

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 提出VisualFLIP基准,通过成对图像扰动测试多模态大模型是否真正依赖关键视觉证据,发现正确预测与证据依赖存在分离。

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.01579 2026-06-04 eess.SY cs.RO cs.SY 78%

Motion and Cooperative Transportation Planning for Multi-Agent Systems under Temporal Logic Formulas

多智能体系统在时序逻辑公式下的运动与协作运输规划

Christos K. Verginis, Dimos V. Dimarogonas

机构 * KTH Center for Autonomous Systems(KTH 自主系统中心)

专题命中 逻辑推理 :planning(title,abstract)

AI总结 本文提出一种混合控制框架,用于在高阶目标表达为线性时序逻辑(LTL)公式的情况下,多智能体系统的运动规划。设计控制协议以实现智能体在预定义兴趣区域间的过渡及协作运输物体。通过抽象智能体与物体的耦合行为为有限状态转移系统,设计满足智能体和物体规格的高层多智能体计划。

Comments Submitted to IEEE Transactions on Automation Science and Engineering. arXiv admin note: text overlap with arXiv:1611.05186

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.11085 2026-06-04 eess.SY cs.SY 78%

Communication-aware Motion Planning for Multi-agent Systems from Signal Temporal Logic Specifications

面向信号时间逻辑规范的多智能体通信感知运动规划

Zhiyu Liu, Jin Dai, Bo Wu, Hai Lin

专题命中 逻辑推理 :planning(title,abstract)

AI总结 本文提出一种数学框架,用于合成满足复杂高层正式局部规范的多智能体运动计划,通过联合优化运动规划与无线通信,确保通信质量的同时避免碰撞。

Comments 6 pages, 3 figures. arXiv admin note: text overlap with arXiv:1705.10259

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00669 2026-06-02 cs.CR 78%

NeuroLog: Reasoning You Can Audit -- Neuro-Symbolic Vulnerability Discovery via LLM Facts, Datalog, and SMT

NeuroLog: 可审计的推理——通过LLM事实、Datalog和SMT进行神经符号漏洞发现

Sanjay Rawat

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 提出NeuroLog流水线,结合LLM提取事实、Souffle规则组合和Z3后处理,实现无需构建的漏洞发现,并在多个真实项目中重新发现CVE级漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22322 2026-05-22 cs.RO 78%

How can reasoning capability empower the AI copilot robot in endoscopic surgery

推理能力如何赋能内窥手术中的AI助手机器人

Guankun Wang, Long Bai, Hongliang Ren

机构 * Department of Electronic Engineering(电子工程系)

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 本文研究了推理能力在内窥手术中AI助手机器人中的应用,提出通过整合多模态线索、解读手术意图和推断隐藏组织动态来提高手术的精确性、安全性和可持续性。

Comments Accepted by npj digital medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10294 2026-04-28 cs.CR 78%

Reasoning Hijacking: The Fragility of Reasoning Alignment in Large Language Models

推理劫持:大语言模型中推理对齐的脆弱性

Yuansen Liu, Yixuan Tang, Anthony Kum Hoe Tun

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 本文指出现有安全研究忽视了推理对齐的脆弱性,提出新的对抗性提示攻击方法'推理劫持',通过注入虚假决策标准影响模型推理逻辑,实验表明即使先进模型也易受此类攻击影响。

Comments accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15079 2026-04-08 cs.SE 78%

Assessing Coherency and Consistency of Code Execution Reasoning by Large Language Models

通过大型语言模型评估代码执行推理的连贯性与一致性

Changshu Liu, Yang Chen, Reyhaneh Jabbarvand

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 本文提出CES任务,评估大语言模型在模拟程序执行和编程任务中的推理能力,引入连贯性概念以判断执行逻辑是否符合常识,提出新的度量标准以衡量推理一致性,发现LLM在编程任务中存在路径敏感分析的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13218 2026-04-07 cs.AI cs.CL cs.LG cs.LO 78%

Scaling the Scaling Logic: Agentic Meta-Synthesis of Logic Reasoning

扩展扩展逻辑:代理元合成逻辑推理

Bowen Liu, Zhi Wu, Runquan Xie, Zhanhui Kang, Jia Li

专题命中 逻辑推理 :reasoning(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SSLogic框架,通过代理迭代生成和优化可执行的生成器-验证器对,生成具有新规则和难度梯度的任务家族,提升训练效率。

Comments 41 pages, 8 figures, 5 tables in the main body. Project page: https://github.com/AdAstraAbyssoque/Scaling-the-Scaling-Logic, typos corrected, claims cleared

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02154 2026-04-03 cs.HC 78%

Designing Transformational Games to Support Socio-ethical Reasoning about Generative AI

设计转型游戏以支持关于生成式人工智能的社伦理推理

Jaemarie Solyst, Ruth Karen Nakigozi, Chloe Fong, R. Benjamin Shapiro

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 本文设计了两款游戏,通过同伴评估、基于约束的创造力和社会推理元素,促进青少年对生成式人工智能的社伦理推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27204 2026-03-31 cs.CR cs.SE 78%

"Elementary, My Dear Watson." Detecting Malicious Skills via Neuro-Symbolic Reasoning across Heterogeneous Artifacts

我的爱,华生。通过神经符号推理跨异构工件检测恶意技能

Shenao Wang, Junjie He, Yanjie Zhao, Yayi Wang, Kan Yu, Haoyu Wang

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 本文提出MalSkills框架,通过符号解析与LLM语义分析提取异构工件中的安全敏感操作,构建技能依赖图并进行神经符号推理,实现恶意技能检测,实验表明其在F1得分上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏