arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-06 至 2026-04-06 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 18 篇

2604.02910 2026-04-06 cs.AI cs.CL 86%

Analysis of Optimality of Large Language Models on Planning Problems

大型语言模型在规划问题中的最优性分析

Bernd Bohnet, Michael C. Mozer, Kevin Swersky, Wil Cunningham, Aaron Parisi, Kathleen Kenealy, Noah Fiedel

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大型语言模型在规划问题中的最优性,通过Blocksworld领域和Path-Star图任务,发现增强推理的LLM在复杂多目标配置中显著优于传统规划器,且能精确跟踪理论最优限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02965 2026-04-06 cs.RO cs.CL 83%

Open-Loop Planning, Closed-Loop Verification: Speculative Verification for VLA

开环规划,闭环验证:VLA的推测验证

Zihua Wang, Zhitao Lin, Ruibo Li, Yu Zhang, Xu Yang, Siya Mi, Xiu-Shen Wei

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Nanyang Technological University(南洋理工大学) School of Cyber Science and Engineering, Southeast University(东南大学网络空间安全学院) Purple Mountain Laboratories(紫金山实验室)

专题命中 规划推理 :planning(title,abstract);verifier(abstract);分类 cs.CL

AI总结 本文提出SV-VLA框架,结合高效开环长周期规划与轻量闭环在线验证,提升VLA在动态环境中的效率与可靠性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29585 2026-04-06 cs.GR cs.AI 83%

Learn2Fold: Structured Origami Generation with World Model Planning

Learn2Fold: 基于世界模型规划的结构化折纸生成

Yanjia Huang, Yunuo Chen, Ying Jiang, Jinru Han, Zhengzhong Tu, Yin Yang, Chenfanfu Jiang

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出Learn2Fold框架,通过结合符号推理与物理模拟,解决从文本生成物理有效的折纸折叠序列问题。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01202 2026-04-06 cs.AI 70%

Therefore I am. I Think

因此我存在。我认为

Esakkivel Esakkiraja, Sai Rajeswar, Denis Akhiyarov, Rajagopal Venkatesaramani

机构 * Mila, ServiceNow Research(米拉研究所,ServiceNow研究院) ServiceNow(ServiceNow公司)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文探讨了大语言推理模型在做决定时是先思考后决定还是先决定后思考的问题,通过证据表明早期编码的决策影响推理链,展示了一个简单线性探针能从预生成激活中高精度解码工具调用决策,甚至在生成首个推理标记前。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02375 2026-04-06 cs.SE cs.PL 67%

KAIJU: An Executive Kernel for Intent-Gated Execution of LLM Agents

KAIJU:一种意图门控的LLM代理执行内核

Cormac Guerin, Frank Guerin

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 KAIJU通过解耦LLM推理层与代理执行流程,引入意图门控执行和执行内核,提升LLM代理在复杂任务中的执行效率与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03174 2026-04-06 cs.CL cs.AI 62%

Beyond the Parameters: A Technical Survey of Contextual Enrichment in Large Language Models: From In-Context Prompting to Causal Retrieval-Augmented Generation

超越参数:大型语言模型中上下文丰富技术的综述:从上下文提示到因果检索增强生成

Prakhar Bansal, Shivangi Agarwal

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大型语言模型中通过增加结构化上下文来提升性能的技术,涵盖上下文学习、提示工程、检索增强生成等方法,并提出透明的文献筛选协议和可信检索增强NLP的研究优先级。

Comments 7 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29093 2026-04-06 cs.CL cs.AI cs.IR 62%

APEX-EM: Non-Parametric Online Learning for Autonomous Agents via Structured Procedural-Episodic Experience Replay

APEX-EM:通过结构化程序-经验经验回放实现自主代理的非参数在线学习

Pratyay Banerjee, Masud Moshtaghi, Ankit Chadha

机构 * Amazon, AGI / Sunnyvale, USA(亚马逊 AGI / 美国森尼韦尔)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出APEX-EM框架,通过结构化经验表示和PRGII工作流,实现自主代理的非参数在线学习,提升跨领域任务的性能。

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03173 2026-04-06 cs.CL 57%

Detecting and Correcting Reference Hallucinations in Commercial LLMs and Deep Research Agents

检测和纠正商业大语言模型和深度研究代理中的参考幻觉

Delip Rao, Eric Wong, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 规划推理 :self-correction(abstract);分类 cs.CL

AI总结 研究通过评估10种模型和代理在DRBench和ExpertQA上的引用URL可靠性,发现3-13%的URL存在幻觉,5-18%无法解析。提出urlhealth工具可有效减少非解析URL,验证引用URL的有效性与可纠正性。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02543 2026-04-06 cs.CV cs.LG 57%

Overconfidence and Calibration in Medical VQA: Empirical Findings and Hallucination-Aware Mitigation

过度自信与校准在医学视觉问答中的研究:实证发现与幻觉意识缓解

Ji Young Byun, Young-Jin Park, Jean-Philippe Corbeil, Asma Ben Abacha

机构 * Johns Hopkins University, School of Medicine(约翰霍普金斯大学医学院) Massachusetts Institute of Technology(麻省理工学院) Microsoft Healthcare & Life Sciences(微软医疗健康与生命科学)

专题命中 规划推理 :chain-of-thought(abstract);分类 cs.LG

AI总结 本文研究了医学VQA中VLMs的过度自信问题,发现校准方法如Platt缩放能有效提升校准精度,但无法提升预测区分度,提出幻觉意识校准方法以提高可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02539 2026-04-06 cs.IR cs.LG 57%

Synapse: Evolving Job-Person Fit with Explainable Two-phase Retrieval and LLM-guided Genetic Resume Optimization

Synapse:通过可解释的双阶段检索和LLM引导的遗传简历优化实现就业-个人匹配

Ansel Kaplan Erol, Seohee Yoon, Keenan Hom, Xisheng Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 Synapse通过双阶段检索和遗传优化提升招聘推荐系统,解决信息不平衡问题,提高推荐精度和透明度,实验显示nDCG@10提升22%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02522 2026-04-06 cs.CR cs.AI 57%

Opal: Private Memory for Personal AI

Opal:面向个人AI的隐私内存

Darya Kaviani, Alp Eren Ozdarendeli, Jinhao Zhu, Yu Ding, Raluca Ada Popa

机构 * Google DeepMind(谷歌DeepMind) UC Berkeley(加州大学伯克利分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 Opal通过将数据依赖推理与个人数据分离,利用可信 enclave 提高检索准确率,并在基础设施成本上取得显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02490 2026-04-06 cs.CR cs.AI 57%

Automated Malware Family Classification using Weighted Hierarchical Ensembles of Large Language Models

基于预训练大语言模型加权层次集成的自动化恶意软件家族分类

Samita Bai, Hamed Jelodar, Tochukwu Emmanuel Nwankwo, Parisa Hamedi, Mohammad Meymani, Roozbeh Razavi-Far, Ali A. Ghorbani

机构 * Canadian Institute for Cybersecurity, Faculty of Computer Science, University of New Brunswick(加拿大网络安全研究所,新不伦瑞克大学计算机科学学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于预训练大语言模型加权层次集成的零标签恶意软件家族分类框架,通过聚合多个互补推理能力的语言模型决策预测,提升分类鲁棒性和分析员推理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02409 2026-04-06 cs.CV cs.AI 57%

LumiVideo: An Intelligent Agentic System for Video Color Grading

LumiVideo:一种用于视频色彩分级的智能代理系统

Yuchen Guo, Junli Gong, Hongmin Cai, Yiu-ming Cheung, Weifeng Su

机构 * Northwestern University(西北大学) Northeastern University(东北大学) South China University of Technology(华南理工大学) Hong Kong Baptist University(香港浸会大学) Beijing Normal - Hong Kong Baptist University(北京师范大学-香港浸会大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 LumiVideo通过感知、推理、执行和反思四个阶段模仿专业调色师的工作流程,利用LLM和RAG框架实现非线性色彩参数空间导航,生成符合行业标准的色彩配置文件,并支持通过自然语言反馈进行迭代优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03066 2026-04-06 eess.SY cs.SY 50%

Redefining End-of-Life: Intelligent Automation for Electronics Remanufacturing Systems

重新定义生命周期终点:面向电子再制造系统的智能自动化

Sibo Tian, Xiao Liang, Sara Behdad, Minghui Zheng

专题命中 规划推理 :planning(abstract)

AI总结 本文探讨电子再制造中智能自动化的核心挑战与机遇,分析机器人、控制与AI在构建可扩展、安全的再制造系统中的作用,提出多模态感知、不确定性决策等方法,为未来再制造系统发展提供指导。

Comments Accepted at the American Control Conference (ACC) 2026; to appear in the proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02687 2026-04-06 eess.SY cs.SY 50%

Inverse Safety Filtering: Inferring Constraints from Safety Filters for Decentralized Coordination

逆安全过滤:从安全过滤器推断约束以实现去中心化协调

Minh Nguyen, Jingqi Li, Gechen Qu, Claire J. Tomlin

专题命中 规划推理 :planning(abstract)

AI总结 本文提出一种在线方法,通过观察其他智能体的安全过滤动作推断约束,结合去中心化规划方法确保安全,通过仿真和硬件实验验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02501 2026-04-06 eess.SP 50%

ECG Foundation Models and Medical LLMs for Agentic Cardiovascular Intelligence at the Edge: A Review and Outlook

ECG基础模型与医疗大语言模型用于边缘端心血管智能:综述与展望

Mudassir Hasan Khan, Ahmad Nayfeh, Mudassir Masood, Ali Ahmad Al-Shaikhi, Muhammad Mahboob Ur Rahman, Tareq Y. Al-Naffouri

专题命中 规划推理 :reasoning(abstract)

AI总结 本文综述了用于心血管疾病诊断、监测和临床决策支持的ECG基础模型和医疗大语言模型,探讨了其在边缘计算中的应用及未来发展方向。

Comments 18 pages, 4 figures, 4 tables, under review with a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05094 2026-04-06 cs.HC 50%

Agentic Link Construction for Environment and Intent Aware 6G Communication

面向环境和意图感知的6G通信代理链路构建

Zhaoyang Li, Shangzhuo Xie, Qianqian Yang

专题命中 规划推理 :planning(abstract)

AI总结 本文提出基于强化学习的多模态通信决策模型,实现链路构建的语义对齐与个性化适应,提升6G通信的鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01297 2026-04-06 cs.MA 50%

SimCity: Multi-Agent Urban Development Simulation with Rich Interactions

SimCity: 基于丰富交互的多智能体城市开发模拟

Yeqi Feng, Yucheng Lu, Hongyu Su, Yixin Tao, Tianxing He

专题命中 规划推理 :reasoning(abstract)

AI总结 SimCity利用大语言模型构建可解释的宏观经济系统,通过自然语言推理实现灵活适应行为,模拟摩擦性劳动力市场、异质商品市场和金融市场,并通过视觉语言模型生成虚拟城市地图,复现宏观经济规律和城市扩张动态。

Comments 34 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏