arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-11 至 2026-05-11 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 12 篇

2605.07315 2026-05-11 cs.CL 91%

LaTER: Efficient Test-Time Reasoning via Latent Exploration and Explicit Verification

LaTER:通过潜在探索和显式验证实现高效的推理

Xuan Li, Yining Wang, Yuchen Liu, Guanjun Liu, Delai Qiu, Shengping Liu, Jiaen Liang, Wei Huang, Jun Yu, Junnan Zhu

机构 * University of Science and Technology of China(科学技术大学) Unisound AI Technology Co., Ltd(Unisound AI技术有限公司) MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院)

专题命中 逻辑推理 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);分类 cs.CL

AI总结 LaTER通过连续潜在空间的有限探索和显式CoT验证提升推理效率,在多个基准测试中减少16%-32%的token使用量,同时提升准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07334 2026-05-11 cs.CV 89%

RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation

RCoT-Seg:强化链式推理用于视频推理与分割

Junwei Wen, Deshui Miao, Guangming Lu, Xin Li, Wenjie Pei

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) Pazhou Lab (Huangpu)(琶洲实验室(黄埔))

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(title);CoT(abstract,abstract_cn)

AI总结 本文提出RCoT-Seg框架,通过分离时间推理与空间感知,改进视频分割中关键帧选择与定位,提升多目标场景下的鲁棒性与精度。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07140 2026-05-11 cs.CV cs.AI 88%

Neurosymbolic Framework for Concept-Driven Logical Reasoning in Skeleton-Based Human Action Recognition

基于骨架的人体动作识别的概念驱动逻辑推理神经符号框架

Talha Ilyas, Deval Mehta, Zongyuan Ge

机构 * Department of ECSE, Faculty of Engineering, Monash University, Australia(莫纳什大学工程学院电子与计算机工程系,澳大利亚) AIM for Health Lab, Faculty of Information Technology, Monash University, Australia(莫纳什大学信息科技学院健康人工智能实验室,澳大利亚) Department of DSAI, Faculty of Information Technology, Monash University, Australia(莫纳什大学信息科技学院数据科学与人工智能系,澳大利亚)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种神经符号框架,将骨架动作识别转化为概念驱动的一阶逻辑推理,通过结合表征学习与符号推理,提升动作识别的可解释性。

Comments Accepted In Proceedings of the 35th International Joint Conference on Artificial Intelligence (IJCAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20338 2026-05-11 cs.LG 85%

Emergent Manifold Separability during Reasoning in Large Language Models

大语言模型推理中的涌现流形分离

Chanwoo Chun, Alexandre Polo, SueYeon Chung

机构 * Department of Physics, Harvard University(哈佛大学物理系) Center for Data Science, New York University(纽约大学数据科学中心) Kempner Institute, Harvard University(哈佛大学 Kempner 研究所) Center for Computational Neuroscience, Flatiron Institute(Flatiron 机构计算神经科学中心)

专题命中 逻辑推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 研究大语言模型推理过程中的流形分离现象,通过曼福容量理论分析两种组合推理任务,发现概念流形在计算前解耦为线性可分子空间,揭示动态流形管理机制。

Comments Alexandre Polo and Chanwoo Chun contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06728 2026-05-11 q-bio.GN cs.AI q-bio.CB 83%

OmicsLM: A Multimodal Large Language Model for Multi-Sample Omics Reasoning

OmicsLM:一种多模态大语言模型用于多样本组学推理

Maciej Sypetkowski, Joanna Krawczyk, Łukasz Smoliński, Remigiusz Kinas, Przemysław Pietrzak, Tomasz Jetka, Rafał Powalski

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

AI总结 OmicsLM通过整合定量组学数据与自然语言任务,实现多样本组学推理,其在多任务类型上表现优异,尤其在生物语言指导的推理任务中超越专用模型和通用LLM。

Comments 13 pages (main text), 14 pages (appendix), 1 figure, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07877 2026-05-11 cs.RO 67%

Melding LLM and temporal logic for reliable human-swarm collaboration in complex scenarios

将大语言模型与时序逻辑融合以实现复杂场景中可靠的人-群智协作

Junfeng Chen, Yuxiao Zhu, An Zhuo, Xintong Zhang, Shuo Zhang, Guanghui Wen, Xiwang Dong, Meng Guo, Zhongkui Li

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) Division of Natural and Applied Sciences, Duke Kunshan University(杜克昆山大学自然与应用科学学院) School of Automaton, Southeast University(东南大学自动化学院) School of Automation Science and Electrical Engineering, Beihang University(北航自动化科学与电气工程学院)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出一种神经符号框架,结合时序逻辑与大语言模型,实现长周期人-群智协作,通过形式化任务规划与上下文感知推理,提升动态环境中任务规划的可靠性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06110 2026-05-11 cs.AI cs.CL 62%

On Time, Within Budget: Constraint-Driven Online Resource Allocation for Agentic Workflows

按时、在预算内:面向代理工作流的约束驱动在线资源分配

Xinglin Wang, Zishen Liu, Shaoxiong Feng, Peiwen Yuan, Yiwei Li, Jiayi Shi, Yueqi Zhang, Chuyi Tan, Ji Zhang, Boyuan Pan, Yao Hu, Kan Li

机构 * School of Computer Science, Beijing Institute of Technology(北京理工大学计算机科学学院) Xiaohongshu Inc(小红书公司)

专题命中 逻辑推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在预算和截止时间约束下,如何通过约束驱动的在线资源分配提高代理工作流的成功概率,提出MCPP算法并在CodeFlow和ProofFlow上验证其有效性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06839 2026-05-11 cond-mat.mtrl-sci cs.AI 57%

LLM-Guided Open Hypothesis Learning from Autonomous Scanning Probe Microscopy Experiments

基于自主扫描探针显微镜实验的LLM引导开放假设学习

Boris Slautin, Utkarsh Pratiush, Yu Liu, Kamyar Barakati, Sergei Kalinin

机构 * Department of Materials Science and Engineering, University of Tennessee, Knoxville, TN 37923, USA(材料科学与工程系,田纳西大学, Knoxville,TN 37923,USA)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出结合符号回归与大语言模型物理评估的开放假设学习框架,用于自主扫描探针显微镜实验,通过稀疏测量生成候选分析关系,并通过物理合理性评估发现可解释的电压-时间增长定律。

Comments 21 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06822 2026-05-11 cs.LG 57%

SHARP: A Self-Evolving Human-Auditable Rubric Policy for Financial Trading Agents

SHARP: 一种自进化可审计的规则策略用于金融交易代理

Xiwen Chen, Wenhui Zhu, Songzhu Zheng, Kashif Rasul, Yueyue Deng, Huayu Li

机构 * Morgan Stanley(摩根大通) Arizona State University(亚利桑那州立大学) Columbia University(哥伦比亚大学) University of Arizona(亚利桑那大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.LG

AI总结 SHARP通过结构化规则优化解决金融交易代理中信用分配问题,提升策略鲁棒性和透明度,使紧凑模型性能提升10-20个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07737 2026-05-11 cs.SE 50%

Securing the Dark Matter: A Semantic-Enhanced Neuro-Symbolic Framework for Supply Chain Analysis of Opaque Industrial Software

守护暗物质:一种语义增强的神经符号框架用于opaque工业软件的供应链分析

Bowei Ning, Xuejun Zong, Lian Lian, Kan He, Yifei Sun, Yuxiang Lei, Plamen Vasilev

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出一种语义增强的神经符号框架,通过直接从opaque二进制中重建行为语义,实现可扩展的全局风险推理,提升供应链分析的准确性和语义映射精度。

Comments 33 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19759 2026-05-11 cs.CC 50%

Pushing Blocks without Fixed Walls via Checkable Gizmos: Push-1 is PSPACE-Complete

通过可检查的工具推动方块而不依赖固定墙壁:Push-1 是 PSPACE 完全的

MIT Hardness Group, Josh Brunner, Lily Chung, Erik D. Demaine, Jenny Diomidova, Della Hendrickson, Jayson Lynch

专题命中 逻辑推理 :planning(abstract)

AI总结 本文证明了Push-1问题PSPACE完全性,移除了固定墙壁的需要,展示了新的可检查工具框架,并连接了运动规划通过工具框架与图定向重配置问题。

Comments 34 pages, 20 figures. Improved writing and added intuition

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06966 2026-05-11 cs.RO cs.SE 50%

Traffic Scenario Orchestration from Language via Constraint Satisfaction

通过约束满足实现基于语言的交通场景编排

Frieda Rong, Chris Zhang, Kelvin Wong, Raquel Urtasun

机构 * University of Toronto(多伦多大学) Waabi

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出一种基于约束满足的交通场景编排方法,通过自然语言生成约束条件,利用现成求解器实现闭环测试中的精确场景控制,显著提高了场景编排成功率。

Comments 19 pages, 10 figures; full version of paper accepted for poster presentation at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏