arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-20 至 2026-04-20 共收录 23 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 23 篇

2604.16022 2026-04-20 cs.AI cs.LG cs.MA 88%

SocialGrid: A Benchmark for Planning and Social Reasoning in Embodied Multi-Agent Systems

SocialGrid:一种用于具身多智能体系统规划与社交推理的基准测试

Hikaru Shindo, Hanzhao Lin, Lukas Helff, Patrick Schramowski, Kristian Kersting

机构 * Technical University of Darmstadt(达姆施塔特技术大学) German Research Center for Artificial Intelligence(德国人工智能研究中心) Lab1141(Lab1141实验室) Centre for Cognitive Science, Darmstadt(达姆施塔特认知科学中心)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI、cs.LG

AI总结 SocialGrid通过评估LLM在具身多智能体环境中的规划、任务执行与社交推理能力,揭示了现有模型在任务完成和社交推理上的不足,并提供规划 oracle 和竞争排行榜以促进改进。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02935 2026-04-20 cs.CL cs.AI cs.MA 88%

Theory of Mind in Action: The Instruction Inference Task in Dynamic Human-Agent Collaboration

行动中的理论思维:动态人机协作中的指令推断任务

Fardin Saad, Pradeep K. Murukannaiah, Munindar P. Singh

机构 * North Carolina State University(北卡罗来纳州立大学) Delft University of Technology(代尔夫特理工大学)

专题命中 规划推理 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);planning(abstract)

AI总结 本文提出指令推断任务,通过Tomcat模型评估人机协作中理论思维能力,实验表明Fs-CoT在GPT-4o和DeepSeek-R1上表现接近人类参与者。

Comments 66 pages with appendix, 10 figures (Appendix: 26 Figures), 11 tables. Code available at: https://github.com/fardinsaad/Tomcat-LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12390 2026-04-20 cs.AI 83%

Heuristic Classification of Thoughts Prompting (HCoT): Integrating Expert System Heuristics for Structured Reasoning into Large Language Models

思维提示的启发式分类(HCoT):将专家系统启发式方法整合到大型语言模型中的结构化推理

Lei Lin, Jizhao Zhu, Yong Liu, Donghong Sun, Hongbo He, Yihua Du

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Shenyang Aerospace University(沈阳航空航天大学) ZGC LAB, Beijing,China(北京ZGC实验室) Institute for Network Sciences and Cyberspace, Tsinghua University(清华大学网络科学与网络空间研究院)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出HCoT方法,通过启发式分类模型整合专家系统启发式方法,提升大型语言模型在复杂问题中的推理能力,实现更高效的决策和更稳定的推理链。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16263 2026-04-20 cs.RO 82%

Semantic Area Graph Reasoning for Multi-Robot Language-Guided Search

语义区域图推理用于多机器人语言引导搜索

Ruiyang Wang, Hao-Lun Hsu, Jiwoo Kim, Miroslav Pajic

专题命中 规划推理 :reasoning(title,abstract);planning(abstract)

AI总结 本文提出语义区域图推理框架,通过结构化语义拓扑抽象实现多机器人语义搜索,提升复杂室内环境中的目标搜索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20020 2026-04-20 cs.AI cs.CL 81%

Persona-Assigned Large Language Models Exhibit Human-Like Motivated Reasoning

具有人格分配的大型语言模型表现出类似人类的动机推理

Saloni Dash, Amélie Reymond, Emma S. Spiro, Aylin Caliskan

机构 * University of Washington(华盛顿大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了分配不同政治和社会人口属性的人格对大型语言模型动机推理的影响,发现人格分配的模型在评估信息真实性时表现下降,且政治人格在科学证据评估中更倾向于与自身身份一致的结论,传统去偏方法效果有限。

Comments ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15705 2026-04-20 cs.LG 79%

Towards Robust Endogenous Reasoning: Unifying Drift Adaptation in Non-Stationary Tuning

迈向稳健的内生推理:统一非平稳调谐中的漂移适应

Xiaoyu Yang, En Yu, Wei Duan, Jie Lu

机构 * Australian Artificial Intelligence Institute (AAII)(澳大利亚人工智能研究所) Faculty of Engineering and Information Technology(工程与信息技术学院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出CPO++框架,解决多模态大语言模型在内生推理中的漂移问题,通过反事实推理与领域知识结合,提升推理连贯性和决策精度,适用于医疗诊断和自动驾驶等安全关键领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10446 2026-04-20 cs.RO cs.AI 79%

VeriGraph: Scene Graphs for Execution Verifiable Robot Planning

VeriGraph:用于可验证机器人规划的场景图

Daniel Ekpo, Mara Levy, Saksham Suri, Chuong Huynh, Archana Swaminathan, Abhinav Shrivastava

机构 * University of Maryland, College Park, MD USA(马里兰大学学院公园分校)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 VeriGraph通过整合视觉语言模型和场景图,提升机器人任务规划的可行性验证与修正,显著提高任务完成率。

Comments Accepted to ICRA 2026. Project website: https://verigraph-agent.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15456 2026-04-20 cs.AI 70%

DeepER-Med: Advancing Deep Evidence-Based Research in Medicine Through Agentic AI

DeepER-Med: 通过代理AI推进医学中的深度证据导向研究

Zhizheng Wang, Chih-Hsuan Wei, Joey Chan, Robert Leaman, Chi-Ping Day, Chuan Wu, Mark A Knepper, Antolin Serrano Farias, Jordina Rincon-Torroella, Hasan Slika, Betty Tyler, Ryan Huu-Tuan Nguyen, Asmita Indurkar, Mélanie Hébert, Shubo Tian, Lauren He, Noor Naffakh, Aseem Aseem, Nicholas Wan, Emily Y Chew, Tiarnan D L Keenan, Zhiyong Lu

机构 * Division of Intramural Research (DIR), National Library of Medicine (NLM), National Institutes of Health (NIH)(国家医学图书馆(NLM)内务研究部,国家卫生研究院(NIH)) Hunterian Neurosurgical Laboratory, Johns Hopkins School of Medicine(约翰霍普金斯医学院霍尔特神经外科实验室) Cancer Data Science Laboratory, Center for Cancer Research, National Cancer Institute (NCI), National Institutes of Health (NIH)(国家癌症研究所(NCI)癌症数据科学实验室,国家癌症研究中心,国家卫生研究院(NIH)) Experimental Immunology Branch, National Cancer Institute (NCI), National Institutes of Health (NIH)(国家癌症研究所(NCI)实验免疫学分支,国家卫生研究院(NIH)) Epithelial Systems Biology Laboratory, Systems Biology Center, National Heart, Lung, and Blood Institute (NHLBI), National Institutes of Health (NIH)(国家心肺血液研究所(NHLBI)上皮系统生物学实验室,系统生物学中心,国家卫生研究院(NIH)) Brain Tumor Genetics Lab, Department of Neurosurgery, Johns Hopkins Hospital(约翰霍普金斯医院神经外科部脑肿瘤遗传实验室) Division of Hematology/Oncology, University of Illinois Chicago(伊利诺伊大学芝加哥分校血液/肿瘤科部) University of Illinois Cancer Center, Chicago, IL 60612, USA(伊利诺伊大学癌症中心,芝加哥,IL 60612,美国) Division of Epidemiology and Clinical Applications, National Eye Institute (NEI), National Institutes of Health (NIH)(国家眼耳研究所(NEI)流行病学与临床应用部,国家卫生研究院(NIH)) University of Michigan Medical School, Ann Arbor, MI 48109, USA(密歇根大学医学学院,安阿伯,MI 48109,美国)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 DeepER-Med通过代理AI框架提升医学研究的证据生成流程,包含研究规划、协作和证据综合模块,并通过专家评估和真实临床案例验证其有效性。

Comments 37 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05722 2026-04-20 cs.LG physics.chem-ph 70%

Teaching Language Models Mechanistic Explainability Through MechSMILES

通过MechSMILES教会语言模型机制性可解释性

Théo A. Neukomm, Zlatko Jončev, Philippe Schwaller

机构 * Laboratory of Artificial Chemical Intelligence (LIAC), Institut des Sciences et Ingénierie Chimiques, Ecole Polytechnique Fédérale de Lausanne (EPFL), Lausanne 1015, Switzerland(人工化学智能实验室(LIAC)、化学与工程学院、瑞士联邦理工学院(EPFL)、拉沃斯纳1015号)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 本文提出MechSMILES框架,通过箭头推导法教会语言模型预测化学反应机制,实现了反应路径验证、原子映射和催化剂识别等能力,展示了在复杂机制预测任务中的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10635 2026-04-20 cs.CV 67%

ChatENV: An Interactive Vision-Language Model for Sensor-Guided Environmental Monitoring and Scenario Simulation

ChatENV: 一种用于传感器引导的环境监测和场景模拟的交互式视觉-语言模型

Hosam Elgendy, Ahmed Sharshar, Ahmed Aboeitta, Mohsen Guizani

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 ChatENV通过整合卫星图像与真实传感器数据,实现环境变化的时序推理与假设验证,提升了环境监测的交互性和准确性。

Comments 11 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15710 2026-04-20 cs.SD 67%

VoxMind: An End-to-End Agentic Spoken Dialogue System

VoxMind:一个端到端的智能语音对话系统

Tianle Liang, Yifu Chen, Shengpeng Ji, Yijun Chen, Zhiyang Jia, Jingyu Lu, Fan Zhuo, Xueyi Pu, Yangzhuo Li, Zhou Zhao

机构 * Zhejiang University(浙江大学) China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区) Xiamen University(厦门大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出VoxMind,通过引入智能代理能力,提升端到端语音对话系统在复杂任务中的表现,实验表明其任务完成率显著提高。

Comments Accepted to ACL 2026 Main Conference.Code and data available at https://github.com/MM-Speech/VoxMind

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04377 2026-04-20 cs.CL cs.AI cs.LG 67%

Disco-RAG: Discourse-Aware Retrieval-Augmented Generation

Disco-RAG: 语篇意识的检索增强生成

Dongqi Liu, Hang Ding, Qiming Feng, Xurong Xie, Zhucun Xue, Chengjie Wang, Jian Li, Jiangning Zhang, Yabiao Wang

机构 * Saarland University(萨尔兰大学) Shanghai Jiaotong University(上海交通大学) Fudan University(复旦大学) Zhejiang University(浙江大学) Tencent YouTu Lab(腾讯优图实验室)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Discourse-aware RAG框架通过构建篇章内结构树和跨篇章修辞图,提升知识整合能力,在问答和长文档摘要任务中取得最佳效果。

Comments ACL 2026 Main & Long Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15672 2026-04-20 cs.LG cs.CL 62%

Faster LLM Inference via Sequential Monte Carlo

通过序列蒙特卡洛方法加速大语言模型推理

Yahya Emara, Mauricio Barba da Costa, Chi-Chih Chang, Cameron Freer, Tim Vieira, Ryan Cotterell, Mohamed S. Abdelfattah

机构 * Cornell University(康奈尔大学) Makora(马科拉) MIT(麻省理工学院) ETH Zürich(苏黎世联邦理工学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出SMC-SD方法,通过重要性加权重采样替代传统拒绝采样,提升推理速度,实验证明在多个基准测试中保持高精度的同时,比推测解码和自回归解码分别快2.36倍和5.2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15344 2026-04-20 cs.HC cs.AI cs.IR cs.LG 62%

To LLM, or Not to LLM: How Designers and Developers Navigate LLMs as Tools or Teammates

对LLM而言,是使用还是不使用:设计师和开发者如何将LLM视为工具或队友

Varad Vishwarupe, Ivan Flechais, Nigel Shadbolt, Marina Jirotka

机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了设计师和开发者在系统设计过程中如何将LLM视为工具或队友,分析了角色框架对决策权、问责制、监督策略和组织接受度的影响。

Comments 6 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14967 2026-04-20 cs.CV cs.AI 57%

UniDoc-RL: Coarse-to-Fine Visual RAG with Hierarchical Actions and Dense Rewards

UniDoc-RL: 基于分层动作和密集奖励的粗到细视觉RAG

Jun Wang, Shuo Tan, Zelong Sun, Tiancheng Gu, Yongle Zhao, Ziyong Feng, Kaicheng Yang, Zhiwu Lu

机构 * DeepGlint-AI

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 UniDoc-RL通过分层动作空间和密集奖励方案,提升视觉RAG系统的细粒度视觉语义处理能力,实现端到端训练,实验显示优于现有方法。

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14646 2026-04-20 cs.AI 57%

Targeted Exploration via Unified Entropy Control for Reinforcement Learning

通过统一熵控制实现定向探索的强化学习

Chen Wang, Lai Wei, Yanzhi Zhang, Chenyang Shao, Zedong Dan, Weiran Huang, Ge Lan, Yue Wang

机构 * College of Software, Nankai University(南开大学软件学院) Zhongguancun Academy(中关村学院) Shanghai Jiao Tong University(上海交通大学) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学) Sun Yat-sen Univeristy(中山大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出UEC-RL框架,通过定向探索机制和稳定器解决强化学习中的熵崩溃问题,提升大模型推理性能。

Comments Accepted for publication in Findings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14518 2026-04-20 cs.AI 57%

Mind DeepResearch Technical Report

Mind DeepResearch 技术报告

MindDR Team, Li Auto Inc

机构 * MindDR Team(MindDR团队) Li Auto Inc(Li Auto公司)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 MindDR通过高效多智能体深度研究框架,在仅30B参数模型下实现领先性能,采用精心设计的数据合成和多阶段训练流程,其核心创新为三智能体架构及四阶段智能体专用训练流程,展现竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07043 2026-04-20 cs.LG 57%

COMPASS: Benchmarking Constrained Optimization in LLM Agents

COMPASS:评估LLM代理在约束优化中的表现

Tian Qin, Felix Bai, Ting-Yao Hu, Raviteja Vemulapalli, Hema Swetha Koppula, Zhiyang Xu, Bowen Jin, Mert Cemri, Jiarui Lu, Zirui Wang, Meng Cao

机构 * Harvard University(哈佛大学) Apple(苹果公司) Virginia Tech(弗吉尼亚理工学院) UIUC(伊利诺伊大学香槟分校) UC Berkeley(加州大学伯克利分校)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 COMPASS基准测试评估LLM代理在真实旅行规划中的约束优化能力,揭示当前模型在可行性与最优性之间存在显著差距,表明搜索空间探索不足是核心限制,编码代理提供潜在解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15493 2026-04-20 physics.optics cs.ET 50%

End-to-End Physical Design Automation Flow for Yield-Optimized Inverse-Designed Large-Scale Electronic-Photonic Integrated Circuits

端到端的物理设计自动化流程用于优化良率的逆向设计大规模电子-光子集成电路

Hongjian Zhou, Haoyu Yang, Haoxing Ren, Joaquin Matres, Jiaqi Gu

专题命中 规划推理 :planning(abstract)

AI总结 本文提出OptoSynthesizer流程,通过整合逆向设计、布局和路由工具,实现大规模电子-光子集成电路的高良率和紧凑设计。

Comments 4 page. Accepted to DAC 2026 Special Research Session

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15393 2026-04-20 quant-ph 50%

Projected Dynamic Programming for Sequential Quantum State Discrimination

投影动态规划用于顺序量子态辨识

Jaehun Jeong, Donghwa Ji, Hyunjun Jang, Kabgyun Jeong

专题命中 规划推理 :planning(abstract)

AI总结 本文将顺序量子态辨识问题建模为静态隐藏状态部分可观测马尔可夫决策过程,通过网格离散化连续信念单纯形并分析误差和计算复杂性,验证了量子领域中的精度与复杂性权衡及维度诅咒。

Comments 54 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12659 2026-04-20 eess.SP 50%

Two-Layer Reinforcement Learning-Assisted Joint Beamforming and Trajectory Optimization for Multi-UAV Downlink Communications

双层强化学习辅助多无人机下行通信中的联合波束成形与轨迹优化

Ruiqi Wang, Essra M. Ghoura, Omar Alhussein, Yuzhi Yang, Jing Ren, Shizhong Xu, Sami Muhaidat

专题命中 规划推理 :planning(abstract)

AI总结 本文提出双层框架,结合图神经网络与多智能体强化学习,解决无人机波束成形与轨迹优化问题,提升系统速率和收敛速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24758 2026-04-20 eess.SY cs.CY cs.MA cs.SY 50%

A Digital Twin Framework for Decision-Support and Optimization of EV Charging Infrastructure in Localized Urban Systems

面向本地城市系统的电动车充电基础设施决策支持与优化的数字孪生框架

Bui Khanh Linh Do, Thanh H. Nguyen, Nghi Huynh Quang, Doanh Nguyen-Ngoc, Laurent El Ghaoui

专题命中 规划推理 :planning(abstract)

AI总结 本文提出一种整合基于代理的决策支持与嵌入式优化的数字孪生框架,用于动态模拟电动车充电行为、基础设施布局及政策响应,通过大学校园案例分析,展示了动态通知和优化策略在提升用户满意度和能源管理中的作用。

Comments 38 pages, 11 figures. Accepted for publication in CEUS. This version is made available under the CC-BY-NC-ND 4.0 license. Final version available at: https://doi.org/10.1016/j.compenvurbsys.2026.102422

Journal ref Computers, Environment and Urban Systems, Volume 127, 102422 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18142 2026-04-20 cs.HC cs.CY cs.IR 50%

Mirroring Users: Towards Building Preference-aligned User Simulator with User Feedback in Recommendation

镜像用户:构建基于用户反馈的偏好对齐用户模拟器

Tianjun Wei, Huizhong Guo, Yingpeng Du, Zhu Sun, Huang Chen, Dongxia Wang, Jie Zhang

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出一种基于用户反馈的用户模拟器构建框架,通过生成高质量模拟数据提升推荐系统与用户偏好的对齐能力,并通过实验验证其有效性。

Comments ACL 2026 Main. Github: https://github.com/Joinn99/UserMirrorer

详情

展开后加载摘要…

URL PDF HTML 收藏