arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-06 至 2026-04-06 共收录 83 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 4 篇

2604.02819 2026-04-06 cs.CL 85%

Student-in-the-Loop Chain-of-Thought Distillation via Generation-Time Selection

通过生成时间选择的学生在环链式思维蒸馏

Chaoqun He, Yingfa Chen, Chaojun Xiao, Xu Han, Lijie Wen

机构 * Tsinghua University(清华大学)

专题命中 数学推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出Gen-SSD框架,通过生成时间选择提升链式思维蒸馏效果,实验显示其在数学推理基准上优于传统知识蒸馏和其他基线方法。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28204 2026-04-06 cs.LG cs.AI 81%

ERPO: Token-Level Entropy-Regulated Policy Optimization for Large Reasoning Models

ERPO:基于熵调节的策略优化用于大推理模型

Song Yu, Li Li, Wenwen Zhao, Zhisheng Yang

机构 * School of Computer and Information Science, Southwest University(西南大学计算机与信息科学学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 ERPO通过引入熵感知门控、桶式隐式归一化和结果锚定优势合成,解决大语言模型中因统一优势信号导致的探索不足问题,提升推理准确性和路径简洁性。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02450 2026-04-06 cs.LG cs.AI cs.CL 75%

Do We Need Frontier Models to Verify Mathematical Proofs?

我们是否需要前沿模型来验证数学证明?

Aaditya Naik, Guruprerana Shabadi, Rajeev Alur, Mayur Naik

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 数学推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究评估了开源和前沿LLM在验证数学证明中的表现,发现较小模型在准确性上接近前沿模型,但一致性较差,通过定制提示词提升性能。

Comments 21 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23048 2026-04-06 cs.AI 57%

From Abstract to Contextual: What LLMs Still Cannot Do in Mathematics

从抽象到语境:大语言模型在数学中仍无法做到的事情

Bowen Cao, Dongdong Zhang, Yixia Li, Junpeng Liu, Shijue Huang, Chufan Shi, Hongyuan Lu, Yaokang Wu, Guanhua Chen, Wai Lam, Furu Wei

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究揭示LLM在现实应用中数学推理能力不足,提出ContextMATH基准测试,发现正确问题建模是成功的关键,但建模与推理仍是限制因素。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 逻辑推理 8 篇

2604.02699 2026-04-06 cs.CL cs.AI 81%

Trivial Vocabulary Bans Improve LLM Reasoning More Than Deep Linguistic Constraints

词汇禁令对LLM推理的提升胜过深层语言约束

Rodney Jehu-Appiah

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究通过对比不同词汇禁令对语言模型推理的影响,发现简单禁令比深层语言约束更有效,揭示了输出正则化机制对推理提升的作用。

Comments 19 pages, 10 tables, 3 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02434 2026-04-06 cs.AI 79%

Compositional Neuro-Symbolic Reasoning

组合式神经符号推理

Anugyan Das, Omkar Ghugarkar, Vishvesh Bhat, Asad Aali

机构 * CoreThink AI Stanford University(斯坦福大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种结合神经和符号方法的推理框架,通过提取网格对象结构、利用神经先验提出变换候选方案并过滤假设,提升ARC-AGI-2任务表现,无需任务特定微调或强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02954 2026-04-06 cs.CL cs.AI 73%

LogicPoison: Logical Attacks on Graph Retrieval-Augmented Generation

逻辑毒药:图检索增强生成中的逻辑攻击

Yilin Xiao, Jin Chen, Qinggang Zhang, Yujing Zhang, Chuang Zhou, Longhao Yang, Lingfei Ren, Xin Yang, Xiao Huang

机构 * Southwestern University of Finance and Economics(西南财经大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LogicPoison攻击框架,通过逻辑推理而非注入虚假内容,破坏图检索增强生成系统中的拓扑结构,从而降低其性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02346 2026-04-06 cs.LG cs.AI cs.SE q-bio.BM 73%

DrugPlayGround: Benchmarking Large Language Models and Embeddings for Drug Discovery

DrugPlayGround:大型语言模型和嵌入式在药物发现中的基准测试

Tianyu Liu, Sihan Jiang, Fan Zhang, Kunyang Sun, Teresa Head-Gordon, Hongyu Zhao

机构 * Yale University(耶鲁大学) Broad Institute of MIT and Harvard(麻省理工学院和哈佛大学博德研究所) The Chinese University of Hong Kong(香港中文大学) University of California, Berkeley(加州大学伯克利分校) UC Berkeley(加州大学伯克利分校)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DrugPlayGround框架,用于评估大型语言模型在生成药物物理化学特性、药物协同作用等文本描述方面的性能,同时通过专家解释验证模型的化学和生物推理能力。

Comments 29 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02695 2026-04-06 cs.CV 67%

XrayClaw: Cooperative-Competitive Multi-Agent Alignment for Trustworthy Chest X-ray Diagnosis

XrayClaw:协作-竞争多智能体对齐用于可信的胸部X光诊断

Shawn Young, Lijian Xu

机构 * Shenzhen University of Advanced Technology, Shenzhen, China(深圳理工大学,深圳,中国)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)

AI总结 本文提出XrayClaw框架,通过协作-竞争架构提升胸部X光诊断的可靠性,实现高准确性和临床推理一致性。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02734 2026-04-06 cs.AI 57%

Aligning Progress and Feasibility: A Neuro-Symbolic Dual Memory Framework for Long-Horizon LLM Agents

对齐进展与可行性:一种神经符号双记忆框架用于长周期LLM智能体

Bin Wen, Ruoxuan Zhang, Yang Chen, Hongxia Xie, Lan-Zhe Guo

机构 * Nanjing University(南京大学) Jilin University(吉林大学)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 本文提出神经符号双记忆框架,通过分离语义进展指导与逻辑可行性验证,解决长周期任务中进展漂移与可行性违反问题,实验显示在ALFWorld、WebShop和TextCraft上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12643 2026-04-06 cs.AI 57%

Learn to Relax with Large Language Models: Solving Constraint Optimization Problems via Bidirectional Coevolution

通过大语言模型学习放松:通过双向共进化解决约束优化问题

Beidan Liu, Zhengqiu Zhu, Chen Gao, Tianle Pu, Yong Zhao, Wei Qi, Quanjun Yin

机构 * State Key Laboratory of Digital Intelligent Modeling and Simulation, National University of Defense Technology(国防科技大学数字智能建模与仿真国家重点实验室) BNRist, Tsinghua University(清华大学北京信息科学与技术国家研究中心) Department of Industrial Engineering, Tsinghua University(清华大学工业工程系) College of Systems Engineering, National University of Defense Technology(国防科技大学系统工程学院)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AutoCO方法,结合运筹学约束放松原理与LLM推理,通过双向共进化机制提升复杂约束优化问题的求解能力,实验验证其在硬问题中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17586 2026-04-06 cs.DB 50%

DeepEye-SQL: A Software-Engineering-Inspired Text-to-SQL Framework

DeepEye-SQL: 一种受软件工程启发的文本到SQL框架

Boyan Li, Chong Chen, Zhujun Xue, Yinan Mei, Yuyu Luo

专题命中 逻辑推理 :reasoning(abstract)

AI总结 DeepEye-SQL通过结构化协作提升文本到SQL的可靠性,采用软件开发生命周期指导,实现73.5%的BIRD-Dev准确率和89.8%的Spider-Test表现,优于现有方法。

Comments SIGMOD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 规划推理 18 篇

2604.02910 2026-04-06 cs.AI cs.CL 86%

Analysis of Optimality of Large Language Models on Planning Problems

大型语言模型在规划问题中的最优性分析

Bernd Bohnet, Michael C. Mozer, Kevin Swersky, Wil Cunningham, Aaron Parisi, Kathleen Kenealy, Noah Fiedel

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大型语言模型在规划问题中的最优性,通过Blocksworld领域和Path-Star图任务,发现增强推理的LLM在复杂多目标配置中显著优于传统规划器,且能精确跟踪理论最优限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02965 2026-04-06 cs.RO cs.CL 83%

Open-Loop Planning, Closed-Loop Verification: Speculative Verification for VLA

开环规划,闭环验证:VLA的推测验证

Zihua Wang, Zhitao Lin, Ruibo Li, Yu Zhang, Xu Yang, Siya Mi, Xiu-Shen Wei

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Nanyang Technological University(南洋理工大学) School of Cyber Science and Engineering, Southeast University(东南大学网络空间安全学院) Purple Mountain Laboratories(紫金山实验室)

专题命中 规划推理 :planning(title,abstract);verifier(abstract);分类 cs.CL

AI总结 本文提出SV-VLA框架,结合高效开环长周期规划与轻量闭环在线验证,提升VLA在动态环境中的效率与可靠性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29585 2026-04-06 cs.GR cs.AI 83%

Learn2Fold: Structured Origami Generation with World Model Planning

Learn2Fold: 基于世界模型规划的结构化折纸生成

Yanjia Huang, Yunuo Chen, Ying Jiang, Jinru Han, Zhengzhong Tu, Yin Yang, Chenfanfu Jiang

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出Learn2Fold框架,通过结合符号推理与物理模拟,解决从文本生成物理有效的折纸折叠序列问题。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01202 2026-04-06 cs.AI 70%

Therefore I am. I Think

因此我存在。我认为

Esakkivel Esakkiraja, Sai Rajeswar, Denis Akhiyarov, Rajagopal Venkatesaramani

机构 * Mila, ServiceNow Research(米拉研究所,ServiceNow研究院) ServiceNow(ServiceNow公司)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文探讨了大语言推理模型在做决定时是先思考后决定还是先决定后思考的问题,通过证据表明早期编码的决策影响推理链,展示了一个简单线性探针能从预生成激活中高精度解码工具调用决策,甚至在生成首个推理标记前。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02375 2026-04-06 cs.SE cs.PL 67%

KAIJU: An Executive Kernel for Intent-Gated Execution of LLM Agents

KAIJU:一种意图门控的LLM代理执行内核

Cormac Guerin, Frank Guerin

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 KAIJU通过解耦LLM推理层与代理执行流程,引入意图门控执行和执行内核,提升LLM代理在复杂任务中的执行效率与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03174 2026-04-06 cs.CL cs.AI 62%

Beyond the Parameters: A Technical Survey of Contextual Enrichment in Large Language Models: From In-Context Prompting to Causal Retrieval-Augmented Generation

超越参数:大型语言模型中上下文丰富技术的综述:从上下文提示到因果检索增强生成

Prakhar Bansal, Shivangi Agarwal

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大型语言模型中通过增加结构化上下文来提升性能的技术,涵盖上下文学习、提示工程、检索增强生成等方法,并提出透明的文献筛选协议和可信检索增强NLP的研究优先级。

Comments 7 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29093 2026-04-06 cs.CL cs.AI cs.IR 62%

APEX-EM: Non-Parametric Online Learning for Autonomous Agents via Structured Procedural-Episodic Experience Replay

APEX-EM:通过结构化程序-经验经验回放实现自主代理的非参数在线学习

Pratyay Banerjee, Masud Moshtaghi, Ankit Chadha

机构 * Amazon, AGI / Sunnyvale, USA(亚马逊 AGI / 美国森尼韦尔)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出APEX-EM框架,通过结构化经验表示和PRGII工作流,实现自主代理的非参数在线学习,提升跨领域任务的性能。

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03173 2026-04-06 cs.CL 57%

Detecting and Correcting Reference Hallucinations in Commercial LLMs and Deep Research Agents

检测和纠正商业大语言模型和深度研究代理中的参考幻觉

Delip Rao, Eric Wong, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 规划推理 :self-correction(abstract);分类 cs.CL

AI总结 研究通过评估10种模型和代理在DRBench和ExpertQA上的引用URL可靠性,发现3-13%的URL存在幻觉,5-18%无法解析。提出urlhealth工具可有效减少非解析URL,验证引用URL的有效性与可纠正性。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02543 2026-04-06 cs.CV cs.LG 57%

Overconfidence and Calibration in Medical VQA: Empirical Findings and Hallucination-Aware Mitigation

过度自信与校准在医学视觉问答中的研究:实证发现与幻觉意识缓解

Ji Young Byun, Young-Jin Park, Jean-Philippe Corbeil, Asma Ben Abacha

机构 * Johns Hopkins University, School of Medicine(约翰霍普金斯大学医学院) Massachusetts Institute of Technology(麻省理工学院) Microsoft Healthcare & Life Sciences(微软医疗健康与生命科学)

专题命中 规划推理 :chain-of-thought(abstract);分类 cs.LG

AI总结 本文研究了医学VQA中VLMs的过度自信问题,发现校准方法如Platt缩放能有效提升校准精度,但无法提升预测区分度,提出幻觉意识校准方法以提高可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02539 2026-04-06 cs.IR cs.LG 57%

Synapse: Evolving Job-Person Fit with Explainable Two-phase Retrieval and LLM-guided Genetic Resume Optimization

Synapse:通过可解释的双阶段检索和LLM引导的遗传简历优化实现就业-个人匹配

Ansel Kaplan Erol, Seohee Yoon, Keenan Hom, Xisheng Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 Synapse通过双阶段检索和遗传优化提升招聘推荐系统,解决信息不平衡问题,提高推荐精度和透明度,实验显示nDCG@10提升22%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02522 2026-04-06 cs.CR cs.AI 57%

Opal: Private Memory for Personal AI

Opal:面向个人AI的隐私内存

Darya Kaviani, Alp Eren Ozdarendeli, Jinhao Zhu, Yu Ding, Raluca Ada Popa

机构 * Google DeepMind(谷歌DeepMind) UC Berkeley(加州大学伯克利分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 Opal通过将数据依赖推理与个人数据分离,利用可信 enclave 提高检索准确率,并在基础设施成本上取得显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02490 2026-04-06 cs.CR cs.AI 57%

Automated Malware Family Classification using Weighted Hierarchical Ensembles of Large Language Models

基于预训练大语言模型加权层次集成的自动化恶意软件家族分类

Samita Bai, Hamed Jelodar, Tochukwu Emmanuel Nwankwo, Parisa Hamedi, Mohammad Meymani, Roozbeh Razavi-Far, Ali A. Ghorbani

机构 * Canadian Institute for Cybersecurity, Faculty of Computer Science, University of New Brunswick(加拿大网络安全研究所,新不伦瑞克大学计算机科学学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于预训练大语言模型加权层次集成的零标签恶意软件家族分类框架,通过聚合多个互补推理能力的语言模型决策预测,提升分类鲁棒性和分析员推理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02409 2026-04-06 cs.CV cs.AI 57%

LumiVideo: An Intelligent Agentic System for Video Color Grading

LumiVideo:一种用于视频色彩分级的智能代理系统

Yuchen Guo, Junli Gong, Hongmin Cai, Yiu-ming Cheung, Weifeng Su

机构 * Northwestern University(西北大学) Northeastern University(东北大学) South China University of Technology(华南理工大学) Hong Kong Baptist University(香港浸会大学) Beijing Normal - Hong Kong Baptist University(北京师范大学-香港浸会大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 LumiVideo通过感知、推理、执行和反思四个阶段模仿专业调色师的工作流程,利用LLM和RAG框架实现非线性色彩参数空间导航,生成符合行业标准的色彩配置文件,并支持通过自然语言反馈进行迭代优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03066 2026-04-06 eess.SY cs.SY 50%

Redefining End-of-Life: Intelligent Automation for Electronics Remanufacturing Systems

重新定义生命周期终点:面向电子再制造系统的智能自动化

Sibo Tian, Xiao Liang, Sara Behdad, Minghui Zheng

专题命中 规划推理 :planning(abstract)

AI总结 本文探讨电子再制造中智能自动化的核心挑战与机遇,分析机器人、控制与AI在构建可扩展、安全的再制造系统中的作用,提出多模态感知、不确定性决策等方法,为未来再制造系统发展提供指导。

Comments Accepted at the American Control Conference (ACC) 2026; to appear in the proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02687 2026-04-06 eess.SY cs.SY 50%

Inverse Safety Filtering: Inferring Constraints from Safety Filters for Decentralized Coordination

逆安全过滤:从安全过滤器推断约束以实现去中心化协调

Minh Nguyen, Jingqi Li, Gechen Qu, Claire J. Tomlin

专题命中 规划推理 :planning(abstract)

AI总结 本文提出一种在线方法,通过观察其他智能体的安全过滤动作推断约束,结合去中心化规划方法确保安全,通过仿真和硬件实验验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02501 2026-04-06 eess.SP 50%

ECG Foundation Models and Medical LLMs for Agentic Cardiovascular Intelligence at the Edge: A Review and Outlook

ECG基础模型与医疗大语言模型用于边缘端心血管智能:综述与展望

Mudassir Hasan Khan, Ahmad Nayfeh, Mudassir Masood, Ali Ahmad Al-Shaikhi, Muhammad Mahboob Ur Rahman, Tareq Y. Al-Naffouri

专题命中 规划推理 :reasoning(abstract)

AI总结 本文综述了用于心血管疾病诊断、监测和临床决策支持的ECG基础模型和医疗大语言模型,探讨了其在边缘计算中的应用及未来发展方向。

Comments 18 pages, 4 figures, 4 tables, under review with a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05094 2026-04-06 cs.HC 50%

Agentic Link Construction for Environment and Intent Aware 6G Communication

面向环境和意图感知的6G通信代理链路构建

Zhaoyang Li, Shangzhuo Xie, Qianqian Yang

专题命中 规划推理 :planning(abstract)

AI总结 本文提出基于强化学习的多模态通信决策模型,实现链路构建的语义对齐与个性化适应,提升6G通信的鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01297 2026-04-06 cs.MA 50%

SimCity: Multi-Agent Urban Development Simulation with Rich Interactions

SimCity: 基于丰富交互的多智能体城市开发模拟

Yeqi Feng, Yucheng Lu, Hongyu Su, Yixin Tao, Tianxing He

专题命中 规划推理 :reasoning(abstract)

AI总结 SimCity利用大语言模型构建可解释的宏观经济系统,通过自然语言推理实现灵活适应行为,模拟摩擦性劳动力市场、异质商品市场和金融市场,并通过视觉语言模型生成虚拟城市地图,复现宏观经济规律和城市扩张动态。

Comments 34 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏