arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-23 至 2026-04-23 共收录 27 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 27 篇

2604.08712 2026-04-23 cs.AI 88%

Model Space Reasoning as Search in Feedback Space for Planning Domain Generation

模型空间推理作为反馈空间中的搜索用于规划领域生成

James Oswald, Daniel Obolensky, Volodymyr Varha, Vasilije Dragovic, Kavitha Srinivas, Harsha Kokel, Michael Katz, Shirin Sohrabi

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) IBM Research(IBM研究院)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

AI总结 本文探讨了通过反馈空间中的启发式搜索优化规划领域生成的质量,利用符号反馈机制提升生成效果。

Comments Accepted at ICLR 2026 the 2nd Workshop on World Models: Understanding, Modelling and Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20795 2026-04-23 cs.AI 84%

Automatic Ontology Construction Using LLMs as an External Layer of Memory, Verification, and Planning for Hybrid Intelligent Systems

利用LLMs构建自动本体:作为混合智能系统记忆、验证和规划的外部层

Pavel Salovskii, Iuliia Gorshkova

专题命中 规划推理 :planning(title,abstract);reasoning(abstract,comments);分类 cs.AI

AI总结 本文提出了一种混合架构,通过扩展LLMs的外部本体记忆层,实现结构化知识图谱的构建与维护,提升多步推理性能并支持生成-验证-修正流程。

Comments Artificial Intelligence; Knowledge Representation and Reasoning; Information Retrieval; Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19937 2026-04-23 cs.CV cs.AI 83%

Infection-Reasoner: A Compact Vision-Language Model for Wound Infection Classification with Evidence-Grounded Clinical Reasoning

Infection-Reasoner: 一种用于伤口感染分类的紧凑视觉-语言模型,结合证据支撑的临床推理

Palawat Busaranuvong, Reza Saadati Fard, Emmanuel Agu, Deepak Kumar, Shefalika Gautam, Bengisu Tulu, Diane Strong

机构 * Worcester Polytechnic Institute(沃斯特理工学院) UMass Chan Medical School(UMass Chan医学院)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出Infection-Reasoner,一种紧凑的视觉-语言模型,通过两阶段训练提升伤口感染分类和推理生成的准确性与解释性,实验结果显示其在分类和推理质量上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20043 2026-04-23 cs.CL cs.AI 81%

TriEx: A Game-based Tri-View Framework for Explaining Internal Reasoning in Multi-Agent LLMs

TriEx:一种基于游戏的三视角框架,用于解释多智能体大语言模型中的内部推理

Ziyi Wang, Chen Zhang, Wenjun Peng, Qi Wu, Xinyu Wang

机构 * Adelaide University(阿德莱德大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 TriEx通过三视角框架提升多智能体大语言模型的可解释性,通过结构化自我推理、对手信念状态和 oracle 审计分析,揭示模型在信念动态和评估可靠性上的系统性不匹配。

Comments ACL2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19766 2026-04-23 cs.CL cs.AI 81%

OThink-SRR1: Search, Refine and Reasoning with Reinforced Learning for Large Language Models

OThink-SRR1: 通过强化学习增强大语言模型的搜索、细化与推理

Haijian Liang, Zenghao Niu, Junjie Wu, Changwang Zhang, Wangchunshu Zhou, Jun Wang

机构 * Shenzhen University(深圳大学) OPPO Research Institute(OPPO研究院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 OThink-SRR1通过强化学习训练的迭代搜索-细化-推理流程,有效解决复杂多跳问题中的检索噪声干扰和计算成本问题,实验表明其在多跳问答基准上准确率优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17555 2026-04-23 cs.AI cs.CL cs.IR 81%

CoSearch: Joint Training of Reasoning and Document Ranking via Reinforcement Learning for Agentic Search

CoSearch:通过强化学习联合训练推理和文档排序以实现代理搜索

Hansi Zeng, Liam Collins, Bhuvesh Kumar, Neil Shah, Hamed Zamani

机构 * Center for Intelligent Information Retrieval, University of Massachusetts Amherst(智能信息检索中心,马萨诸塞大学阿默斯特分校) Snap Inc(Snap公司)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CoSearch框架,通过群体相对策略优化联合训练推理代理和生成文档排序模型,以解决代理搜索中检索系统性能瓶颈问题,实验表明其在多个问答基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20283 2026-04-23 cs.CL 79%

Multi-Perspective Evidence Synthesis and Reasoning for Unsupervised Multimodal Entity Linking

多视角证据综合与推理用于无监督多模态实体链接

Mo Zhou, Jianwei Wang, Kai Wang, Helen Paik, Ying Zhang, Wenjie Zhang

机构 * The University of New South Wales(新南威尔士大学) Shanghai Jiao Tong University(上海交通大学) University of Technology Sydney(技术大学悉尼)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出MSR-MEL框架,通过多视角证据综合与推理提升无监督多模态实体链接性能,采用图神经网络和大语言模型进行证据整合与推理,实验表明优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09574 2026-04-23 cs.RO 78%

Online Structure Learning and Planning for Autonomous Robot Navigation using Active Inference

基于主动推断的自主机器人导航在线结构学习与规划

Daria de tinguy, Tim Verbelen, Emilio Gamba, Bart Dhoedt

机构 * Ghent University(根特大学) Verses FlandersMake(弗拉芒制造)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出AIMAPP框架,通过统一生成模型实现映射、定位和决策,支持在不确定环境中自主探索和导航,无需预定义地图或大量训练。

Comments yet to be submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17261 2026-04-23 cs.RO cs.LG 74%

High-Level Multi-Robot Trajectory Planning And Spurious Behavior Detection

高层多机器人轨迹规划与异常行为检测

Fernando Salanova, Jesús Roche, Cristian Mahulea, Eduardo Montijano

机构 * Spanish project PID2024-159284NB-I00 funded by MCIN/AEI/10.13039/501100011033(西班牙项目PID2024-159284NB-I00,由MCIN/AEI/10.13039/501100011033资助) ERDF A way of making Europe and by the European Union NextGenerationEU/PRTR(ERDF推动欧洲发展,以及欧洲联盟NextGenerationEU/PRTR) DGA T45-23R and T64-23R(DGA T45-23R和T64-23R)

专题命中 规划推理 :planning(title);分类 cs.LG

AI总结 本文提出基于Nets-within-Nets框架的多机器人轨迹规划方法,结合Transformer模型检测异常行为,实验表明在识别执行效率低下、核心任务违规和约束适应性异常方面具有高准确率。

Comments 6 pages,3 figures, Iberian Robotics Conference 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19756 2026-04-23 cs.LG cs.AI 73%

WorkflowGen:an adaptive workflow generation mechanism driven by trajectory experience

WorkflowGen:一种基于轨迹经验的自适应工作流生成机制

Ruocan Wei, Shufeng Wang, Ziwei Shi

机构 * China Telecom Cloud(中国电信云)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出WorkflowGen,一种基于轨迹经验的自适应工作流生成机制,通过捕捉完整轨迹提取可重用知识,减少token消耗,提升效率和成功率。

Comments 16 pages,3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20146 2026-04-23 cs.IR cs.CL 70%

SAKE: Self-aware Knowledge Exploitation-Exploration for Grounded Multimodal Named Entity Recognition

SAKE: 为基于地面的多模态命名实体识别的自我意识知识利用-探索

Jielong Tang, Xujie Yuan, Jiayang Liu, Jianxing Yu, Xiao Dong, Lin Chen, Yunlai Teng, Shimin Di, Jian Yin

机构 * Sun Yat-sen University(中山大学) Shandong Normal University(山东师范大学) University of the Chinese Academy of Sciences(中国科学院大学) Southeast University(东南大学)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 针对开放世界社交媒体平台中长尾、快速演变和未见实体的挑战,SAKE提出一种端到端代理框架,通过自我意识推理和自适应搜索工具调用,结合内部知识利用和外部知识探索,提升多模态命名实体识别的精度与鲁棒性。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19839 2026-04-23 cs.CV cs.AI 70%

Environmental Understanding Vision-Language Model for Embodied Agent

面向具身智能体的环境理解视觉-语言模型

Jinsik Bang, Jaeyeon Bae, Donggyu Lee, Siyeol Jung, Taehwan Kim

机构 * UNIST(全南国立大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出EUEA框架,通过细调四项核心技能提升具身智能体的环境理解能力,结合恢复步骤和GRPO阶段提升任务执行效果,实验显示在ALFRED任务中性能显著优于行为克隆基线。

Comments CVPR Findings 2026, Project Page: https://eu-ea.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18570 2026-04-23 cs.LG cs.AI cs.CL 67%

A multimodal and temporal foundation model for virtual patient representations at healthcare system scale

面向医疗系统规模的多模态与时间基础模型:虚拟患者表示

Andrew Zhang, Tong Ding, Sophia J. Wagner, Caiwei Tian, Ming Y. Lu, Rowland Pettit, Joshua E. Lewis, Alexandre Misrahi, Dandan Mo, Long Phi Le, Faisal Mahmood

机构 * Department of Pathology, Mass General Brigham, Harvard Medical School(病理学系,马萨诸塞州总医院与哈佛医学院) Cancer Program, Broad Institute of Harvard and MIT(癌症计划,哈佛-麻省理工Broad研究所) Data Science Program, Dana-Farber Cancer Institute(数据科学计划,达纳-法伯癌症研究所) Health Sciences and Technology, Harvard-MIT(健康科学与技术,哈佛-麻省理工) Harvard John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛约翰·A·保罗森工程与应用科学学院,哈佛大学) Department of Biomedical Informatics, Harvard Medical School(生物医学信息学系,哈佛医学院) Electrical Engineering and Computer Science, Massachusetts Institute of Technology (MIT)(电气工程与计算机科学,麻省理工学院(MIT)) School of Computer and Communication Sciences, EPFL, Lausanne, Switzerland(计算机与通信科学学院,EPFL,瑞士洛桑)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Apollo模型,整合多模态和时间信息,构建虚拟患者表示,用于预测疾病风险、治疗反应等,展示其在医疗计算中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09781 2026-04-23 cs.LG cs.AI 62%

Explainability in Generative Medical Diffusion Models: A Faithfulness-Based Analysis on MRI Synthesis

生成医学扩散模型的可解释性:基于忠实度的MRI合成分析

Surjo Dey, Pallabi Saikia

机构 * Rajiv Gandhi institute of petroleum technology(拉吉夫·甘地石油技术学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨生成扩散模型在医学影像中的可解释性,聚焦MRI合成,通过分析原型方法评估生成与训练特征的关系,实验表明EPPNet在忠实度上表现最佳,提升生成过程的透明度和可信度。

Comments Accepted at 3rd World Congress on Smart Computing (WCSC2026) conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00911 2026-04-23 cs.CR cs.AI cs.ET cs.HC cs.LG 62%

Device-Native Autonomous Agents for Privacy-Preserving Negotiations

设备本机自主代理用于隐私保护的谈判

Joyjit Roy, Samaresh Kumar Singh

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于设备的自主代理系统,通过零知识证明和本地推理实现隐私保护的谈判,实验显示在保险和B2B采购场景中成功率高,隐私保护效果显著。

Comments 9 pages, 6 figures, 9 tables. This version updates metadata after publication in IEEE Xplore

Journal ref 2026 IEEE SoutheastCon, Huntsville, AL, USA, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09871 2026-04-23 cs.AI cs.HC cs.LG 62%

Epistemology gives a Future to Complementarity in Human-AI Interactions

认识论为人类-人工智能互动中的互补性赋予未来

Andrea Ferrario, Alessandro Facchini, Juan M. Durán

机构 * SUPSI, Dalle Molle Institute for Artificial Intelligence (IDSIA)(SUPSI,达姆施塔特人工智能研究所(IDSIA)) Management in Networked and Digital Societies (MINDS) Department, Kozminski University(网络化与数字化社会管理系(MINDS)部,科米斯基大学) TU Delft(代尔夫特理工大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过认识论重构互补性,将其作为可靠知识过程的证据,提升人类-人工智能团队预测的可靠性,并提出设计与治理建议。

Comments Submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20548 2026-04-23 cs.CL cs.AI cs.DL cs.IR 62%

Enhancing Research Idea Generation through Combinatorial Innovation and Multi-Agent Iterative Search Strategies

通过组合创新和多智能体迭代搜索策略增强研究想法生成

Shuai Chen, Chengzhi Zhang

机构 * Department of Information Management, Nanjing University of Science and Technology(南京理工大学信息管理学院)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出结合迭代知识搜索与LLM多智能体系统的框架,通过反复交互生成、评估和优化研究想法,提升多样性与新颖性,在自然语言处理领域实验表明优于现有基线方法。

Comments Scientometrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20370 2026-04-23 cs.LG stat.ML 57%

Cold-Start Forecasting of New Product Life-Cycles via Conditional Diffusion Models

通过条件扩散模型进行新产品生命周期的冷启动预测

Ruihan Zhou, Zishi Zhang, Jinhui Han, Yijie Peng, Xiaowei Zhang

机构 * Guanghua School of Management, Peking University(北京大学光华管理学院) Department of Industrial Engineering and Decision Analytics, The Hong Kong University of Science and Technology(香港科技大学工业工程与决策分析系)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出CDLF模型,利用静态描述、参考轨迹和新观察数据预测新产品生命周期,解决冷启动问题,提升预测准确性与概率预测质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20158 2026-04-23 cs.AI 57%

Stateless Decision Memory for Enterprise AI Agents

无状态决策记忆用于企业AI代理

Vasundra Srinivasan

机构 * Vasundra Srinivasan

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出无状态决策记忆(DPM),在企业监管领域中通过无状态设计提升决策精度和可审计性,同时提高效率。

Comments 16 pages, 4 figures, 4 tables. Companion paper to "Four-Axis Decision Alignment for Long-Horizon Enterprise AI Agents" (arXiv:TBD). Code and reproducibility artifacts at https://github.com/vasundras/stateless-decision-memory-enterprise-ai-agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20151 2026-04-23 cs.RO cs.LG 57%

Toward Safe Autonomous Robotic Endovascular Interventions using World Models

迈向安全的自主机器人内血管干预的世模型

Harry Robertshaw, Nikola Fischer, Han-Ru Wu, Andrea Walker Perez, Weiyuan Deng, Benjamin Jackson, Christos Bergeles, Alejandro Granados, Thomas C Booth

机构 * Surgical & Interventional Engineering, School of Biomedical Engineering & Imaging Sciences, King’s College London(外科与介入工程系,生物医学工程与成像科学学院,伦敦国王学院) Department of Radiology, National Taiwan University Hospital(放射科,台湾大学医院) Department of Neuroradiology, King’s College Hospital(神经放射科,伦敦国王医院)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出基于世模型的框架,利用TD-MPC2方法在内血管导航中实现自主机械取栓,通过仿真和体外实验验证其在安全性和泛化性上的优势。

Comments This manuscript is a preprint and has been submitted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20070 2026-04-23 cs.HC cs.AI cs.CE 57%

Auditing and Controlling AI Agent Actions in Spreadsheets

对电子表格中AI代理行为的审计与控制

Sadra Sabouri, Zeinabsadat Saghi, Run Huang, Sujay Maladi, Esmeralda Eufracio, Sumit Gulwani, Souti Chattopadhyay

机构 * University of Southern California(南加州大学) California State Polytechnic University(加州州立理工大学) Microsoft(微软公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Pista,一种可审计、可控的电子表格AI代理,通过分解执行过程让用户实时干预决策,提升用户对任务的理解和控制感。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19926 2026-04-23 cs.AI 57%

CreativeGame:Toward Mechanic-Aware Creative Game Generation

CreativeGame:迈向机制感知的创意游戏生成

Hongnan Ma, Han Wang, Shenglin Wang, Tieyue Yin, Yiwei Shi, Yucong Huang, Yingtian Zou, Muning Wen, Mengyue Yang

机构 * University of Bristol(布里斯托大学) Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Nanjing University(南京大学) Sreal AI Project(Sreal AI项目)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出CreativeGame系统,通过机制感知规划循环和跨版本经验积累,实现迭代式HTML5游戏生成,支持可解释的版本间进化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19825 2026-04-23 cs.SE cs.AI 57%

SolidCoder: Bridging the Mental-Reality Gap in LLM Code Generation through Concrete Execution

SolidCoder:通过具体执行弥合LLM代码生成中的心理现实差距

Woojin Lee, Jin-Xia Huang

机构 * Electronics and Telecommunications Research Institute, Republic of Korea(韩国电信研究所)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 SolidCoder通过强制边缘情况意识和沙盒执行解决心理现实差距,提升代码生成性能,实现HumanEval、CodeContests和APPS的高准确率。

Comments 23 pages, 2 figures, Accepted at Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00696 2026-04-23 cs.CL 57%

DRIV-EX: Counterfactual Explanations for Driving LLMs

DRIV-EX:用于驾驶LLM的反事实解释

Amaia Cardiel, Eloi Zablocki, Elias Ramzi, Eric Gaussier

机构 * Aptikal, Université Grenoble Alpes(Aptikal,格勒诺布尔大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出DRIV-EX方法,通过反事实解释研究驾驶LLM的决策过程,利用梯度优化生成语义变化的场景描述,提升解释的可理解性和鲁棒性。

Comments Accepted at ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20486 2026-04-23 cs.CV 50%

ProMMSearchAgent: A Generalizable Multimodal Search Agent Trained with Process-Oriented Rewards

ProMMSearchAgent:一种通过过程导向奖励训练的通用多模态搜索代理

Wentao Yan, Shengqin Wang, Huichi Zhou, Yihang Chen, Kun Shao, Yuan Xie, Zhizhong Zhang

机构 * East China Normal University(东中国师范大学) Shanghai Innovation Institute(上海创新研究院) Huawei Noah's Ark Lab(华为诺亚实验室) Independent Researcher(独立研究者) University College London(伦敦大学学院)

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出ProMMSearchAgent,通过过程导向奖励解决多模态代理在知识密集型视觉推理中的训练难题,实现零样本迁移至Google搜索API。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19819 2026-04-23 econ.EM 50%

Decision Traces: What Multi-System Data Fusion Reveals About Institutional Knowledge in Enterprise Hiring

决策轨迹:多系统数据融合揭示企业招聘中的机构知识

Saad Bin Shafiq

专题命中 规划推理 :reasoning(abstract)

AI总结 研究通过多系统数据融合揭示企业招聘中机构知识的获取,发现关键词无法预测生产表现,行为评估提升预测能力,且生产速度存在可量化的经济常数。

Comments 32 pages, 4 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13942 2026-04-23 q-fin.GN 50%

AI Agents in Financial Markets: Architecture, Applications, and Systemic Implications

金融市场中的AI代理:架构、应用与系统性影响

Hui Gong

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出一个整合框架分析代理金融,探讨自主AI系统在信息处理、决策支持等流程中的作用,通过四层架构和代理金融市场模型,研究代理设计参数与市场结果的关系,展示如何利用公开数据研究可观察预期渠道。

Comments 35 pages, 3 figures, 7 tables. Updated to reflect the published journal version in FinTech; journal reference and DOI added

Journal ref FinTech 2026, 5(2), 34

详情

展开后加载摘要…

URL PDF HTML 收藏