arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-08 至 2026-04-08 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 6 篇

2604.05649 2026-04-08 cs.CV cs.AI 88%

Analogical Reasoning as a Doctor: A Foundation Model for Gastrointestinal Endoscopy Diagnosis

作为医生的类比推理:一种胃肠内镜诊断的基础模型

Peixi Peng, Housheng Xie, Yanling Wei, Guangcong Ruan, Xiaoyang Zou, Qian Cao, Yongjian Nian, Guoyan Zheng

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.AI

AI总结 本文提出RATNet基础模型,通过类比推理提升胃肠内镜诊断的泛化能力与鲁棒性,在六个场景中超越现有模型,支持联邦学习隐私保护部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07432 2026-04-08 cs.AI 80%

TS-Agent: Understanding and Reasoning Over Raw Time Series via Iterative Insight Gathering

TS-Agent:通过迭代洞察获取理解并推理原始时间序列

Penghang Liu, Elizabeth Fons, Annita Vapsi, Mohsen Ghassemi, Svitlana Vyetrenko, Daniel Borrajo, Vamsi K. Potluru, Manuela Veloso

机构 * JPMorgan AI Research, NY, USA(摩根大通人工智能研究院,纽约,美国)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 TS-Agent通过迭代洞察获取机制,在时间序列理解和推理任务中匹配或超越文本、视觉及时间序列语言模型基线,尤其在零样本设置下表现更优。

Comments NeurIPS 2025 Workshop on Foundations of Reasoning in Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15079 2026-04-08 cs.SE 78%

Assessing Coherency and Consistency of Code Execution Reasoning by Large Language Models

通过大型语言模型评估代码执行推理的连贯性与一致性

Changshu Liu, Yang Chen, Reyhaneh Jabbarvand

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 本文提出CES任务,评估大语言模型在模拟程序执行和编程任务中的推理能力,引入连贯性概念以判断执行逻辑是否符合常识,提出新的度量标准以衡量推理一致性,发现LLM在编程任务中存在路径敏感分析的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05383 2026-04-08 cs.AI 70%

Towards Effective In-context Cross-domain Knowledge Transfer via Domain-invariant-neurons-based Retrieval

通过领域不变神经元的检索实现有效的跨领域知识转移

Jianzhi Yan, Zhiming Li, Le Liu, Zike Yuan, Shiwei Chen, Youcheng Pan, Buzhou Tang, Yang Xiang, Danny Dongning Sun

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Pengcheng Laboratory, Shenzhen, China(鹏城实验室)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文提出领域不变神经元检索方法,用于提升大语言模型在跨领域推理中的性能,实验表明方法在数学和逻辑推理迁移中平均提升1.8。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06015 2026-04-08 cs.AI 57%

How LLMs Follow Instructions: Skillful Coordination, Not a Universal Mechanism

大语言模型如何遵循指令:技能协调,而非通用机制

Elisabetta Rocchetti, Alfio Ferrara

机构 * Department of Computer Science, Università degli Studi di Milano(米兰大学计算机科学系)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 研究通过九种不同任务分析发现,大语言模型遵循指令并非依赖通用机制,而是通过协调多种语言能力实现,且存在任务间转移弱、依赖稀疏等特点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05955 2026-04-08 cs.SE cs.AI 57%

Does Pass Rate Tell the Whole Story? Evaluating Design Constraint Compliance in LLM-based Issue Resolution

通过率能讲述全部故事吗?评估基于LLM的问题解决的设计约束合规性

Kai Yu, Zhenhao Zhou, Junhao Zeng, Ying Wang, Xueying Du, Zhiqiang Yuan, Junwei Liu, Ziyu Zhou, Yujia Wang, Chong Wang, Xin Peng

机构 * Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

专题命中 逻辑推理 :verifier(abstract);分类 cs.AI

AI总结 本文提出设计感知问题解决方法,引入bench基准,通过挖掘和验证真实项目中的设计约束,评估LLM在问题解决中设计约束的合规性,发现测试通过率高并不代表设计合规性好。

详情

展开后加载摘要…

URL PDF HTML 收藏