arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-29 至 2026-04-29 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 15 篇

2604.24831 2026-04-29 cs.SE cs.LG 85%

FGDM: Reasoning Aware Multi-Agentic Framework for Software Bug Detection using Chain of Thought and Tree of Thought Prompting

FGDM:基于推理的多智能体框架用于软件缺陷检测的链式思维和树式思维提示

Srita Padmanabhuni, Bhargavi Karuturi, Jerusha Karen Indupalli, Santhan Reddy Chilla, Vivek Yelleti

机构 * SRM University, Andhra Pradesh(安得拉邦SRM大学)

专题命中 规划推理 :reasoning(title);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.LG

AI总结 本文提出FGDM框架,利用链式思维和树式思维提示,通过流程图识别代码错误并生成修复代码,有效提升大型代码库中缺陷检测的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16518 2026-04-29 cs.RO cs.CL cs.CV 84%

MiMo-Embodied: X-Embodied Foundation Model Technical Report

MiMo-Embodied:X-Embodied基础模型技术报告

Xiaoshuai Hao, Lei Zhou, Zhijian Huang, Zhiwen Hou, Yingbo Tang, Lingfeng Zhang, Guang Li, Zheng Lu, Shuhuai Ren, Xianhui Meng, Yuchen Zhang, Jing Wu, Jinghui Lu, Chenxu Dang, Jiayi Guan, Jianhua Wu, Zhiyi Hou, Hanbing Li, Shumeng Xia, Mingliang Zhou, Yinan Zheng, Zihao Yue, Shuhao Gu, Hao Tian, Yuannan Shen, Jianwei Cui, Wen Zhang, Shaoqing Xu, Bing Wang, Haiyang Sun, Zeyu Zhu, Yuncheng Jiang, Zibin Guo, Chuhong Gong, Chaofan Zhang, Wenbo Ding, Kun Ma, Guang Chen, Rui Cai, Diyun Xiang, Heng Qu, Fuli Luo, Hangjun Ye, Long Chen

机构 * Xiaomi Embodied Intelligence Team(小米具身智能团队)

专题命中 规划推理 :CoT(summary_cn,abstract);planning(abstract);分类 cs.CL

AI总结 MiMo-Embodied是首个跨具身基础模型,成功整合并实现自动驾驶和具身AI领域的最先进性能,在17个具身AI基准和12个自动驾驶基准中均取得新纪录,通过多阶段学习、数据构建和CoT/RL微调实现领域间的强正迁移。

Comments Code: https://github.com/XiaomiMiMo/MiMo-Embodied | Model: https://huggingface.co/XiaomiMiMo/MiMo-Embodied-7B

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14248 2026-04-29 cs.AI cs.CL 84%

Why Do LLM-based Web Agents Fail? A Hierarchical Planning Perspective

为什么基于大语言模型的网络代理会失败?一种分层规划视角

Mohamed Aghzal, Gregory J. Stein, Ziyu Yao

机构 * Department of Computer Science, George Mason University(乔治·马歇尔大学计算机科学系)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文从分层规划角度分析了LLM网络代理失败原因,发现低层执行是主要瓶颈,改进感知接地和自适应控制对实现人类可靠性至关重要。

Comments Accepted to The 64th Annual Meeting of the Association for Computational Linguistics (ACL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07927 2026-04-29 cs.AI 83%

EigentSearch-Q+: Enhancing Deep Research Agents with Structured Reasoning Tools

EigentSearch-Q+: 通过结构化推理工具增强深度研究代理

Boer Zhang, Mingyan Wu, Dongzhuoran Zhou, Yuqicheng Zhu, Wendong Fan, Puzhen Zhang, Zifeng Ding, Guohao Li, Yuan He

机构 * Meta Northeastern University, China(东北大学) University of Oslo(奥斯陆大学) Bosch Center for AI(博世人工智能中心) University of Stuttgart(斯图加特大学) University of Cambridge(剑桥大学) Mina AI Amazon(亚马逊)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出Q+工具,通过引导查询规划和证据提取提升深度研究代理的搜索效率,实验显示在多个基准测试中提升了模型准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07236 2026-04-29 cs.AI cs.CL 81%

How Much Heavy Lifting Can an Agent Harness Do?: Measuring the LLM's Residual Role in a Planning Agent

代理能承载多少实质性工作?:测量规划代理中LLM的残余作用

Sungwoo Jung, Seonil Son

机构 * Independent Researcher(独立研究者)

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究通过外部测量规划代理各层,量化LLM在决策中的残余作用,发现声明性规划承担主要工作,而符号反思和LLM支持的修订仅在特定情况下生效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25683 2026-04-29 cs.IR 78%

K-CARE: Knowledge-driven Symmetrical Contextual Anchoring and Analogical Prototype Reasoning for E-commerce Relevance

K-CARE:基于知识的对称上下文锚定与类比原型推理用于电商相关性

Chen Yifei, Tian Zhixing, Wang Chenyang, Cheng Ziguang

专题命中 规划推理 :reasoning(title,abstract)

AI总结 K-CARE通过结合外部知识与类比推理,解决电商搜索中因知识边界缺失导致的相关性问题,显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25482 2026-04-29 cs.CL cs.AI 73%

From World-Gen to Quest-Line: A Dependency-Driven Prompt Pipeline for Coherent RPG Generation

从World-Gen到Quest-Line:一种依赖驱动的提示管道用于连贯的RPG生成

Dominik Borawski, Marta Szulc, Robert Chudy, Małgorzata Giedrowicz, Piotr Mironowicz

机构 * Gdańsk University of Technology(格但斯克技术大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种依赖驱动的提示管道,通过结构化中间表示建模叙事依赖,以生成连贯的RPG内容。该方法通过分阶段生成世界构建、NPC创建、玩家角色创建、战役级任务规划和任务扩展,减少叙事漂移并支持可扩展的叙事元素生成。

Comments 13 pages, 1 figure, 5 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25040 2026-04-29 cs.AI cs.CL 62%

Leverage Laws: A Per-Task Framework for Human-Agent Collaboration

利用率法则:一种面向任务的人机协作框架

Stan Loosmore

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种面向任务的利用率比率,用于衡量人机协作中人类工作被代理所替代的比例,结合信息需求的流向和时间成本,探讨了利用率的渐进行为及任务新颖性对规划的影响。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24832 2026-04-29 cs.LG cs.AI 62%

On the Trainability of Masked Diffusion Language Models via Blockwise Locality

通过块级局部性训练掩码扩散语言模型

Yuxiang Wang, Yu Xiang, Baojian Zhou, Qifang Zhao, Keyue Jiang, Yanghua Xiao, Xiaoxiao Xu

机构 * Fudan University, Shanghai, China(复旦大学,上海,中国) Alibaba Group, China(阿里巴巴集团,中国)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究通过块级局部性改进掩码扩散语言模型,发现其在结构生成任务中稳定性不足,提出Jigsaw和Scatter模型提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25885 2026-04-29 hep-ph cs.LG hep-ex 57%

Explainable AI for Jet Tagging: A Comparative Study of GNNExplainer, GNNShap, and GradCAM for Jet Tagging in the Lund Jet Plane

可解释的AI用于喷注标记:GNNExplainer、GNNShap和GradCAM在Lund喷注平面中喷注标记的比较研究

Pahal D. Patel, Sanmay Ganguly

机构 * Department of Physics, Indian Institute of Technology, Kanpur Uttar-Pradesh-208016, India(印度理工学院坎浦尔分校物理系)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 本文比较了GNNExplainer、GNNShap和GradCAM在Lund喷注平面中喷注标记的性能,通过蒙特卡洛真实解释掩码和物理指导评估框架,揭示了非微扰与微扰区域的解释质量变化,并量化了解释器分配的节点重要性与经典喷注子结构观测量的相关性。

Comments 25 pages, 9 figures. Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25389 2026-04-29 cs.HC cs.AI 57%

Co-Writing with AI: An Empirical Study of Diverse Academic Writing Workflows

与AI共同写作:关于多样化学术写作流程的实证研究

Silvia Bodei, Duncan P. Brumby, Katie Fisher, Jon Mella

机构 * University College London(伦敦大学学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究探讨大学生如何整合AI工具到写作流程中,分析不同写作任务中AI使用模式及个体因素影响,揭示AI整合的多样性与三种价值导向的配置。

Comments 25 pages, 1 table, 5 figures. Accepted at CHIWORK 2026 (ACM Symposium on Human-Computer Interaction for Work)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09618 2026-04-29 cs.DC cs.AI cs.CR 57%

HearthNet: Edge Multi-Agent Orchestration for Smart Homes

HearthNet:边缘多智能体协调用于智能家居

Zhonghao Zhan, Krinos Li, Yefan Zhang, Hamed Haddadi

机构 * Imperial College London(伦敦帝国学院) Independent Researcher(独立研究员)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 HearthNet通过边缘多智能体系统解决智能家居中自然语言控制、设备故障和持续协调的问题,采用MQTT、Git共享状态和授权租赁实现设备管理。

Comments (CAIS 2026) Proceedings of the ACM Conference on AI and Agentic Systems, Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08567 2026-04-29 cs.CL cs.MA 57%

Multi-User Large Language Model Agents

多用户大语言模型代理

Shu Yang, Shenzhe Zhu, Hao Zhu, José Ramón Enríquez, Di Wang, Alex Pentland, Michiel A. Bakker, Jiaxin Pei

机构 * Stanford University(斯坦福大学) KAUST UT Austin(得克萨斯大学奥斯汀分校) MIT(麻省理工学院)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 本文首次系统研究多用户LLM代理,提出统一交互协议并设计压力测试场景,揭示前沿模型在优先级维护、隐私保护和协调效率方面的系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00931 2026-04-29 cs.AI 57%

PsychAgent: An Experience-Driven Lifelong Learning Agent for Self-Evolving Psychological Counselor

PsychAgent: 一种基于经验的终身学习代理用于自我进化的心理辅导员

Yutao Yang, Junsong Li, Qianjun Pan, Jie Zhou, Kai Chen, Qin Chen, Jingyuan Zhao, Ningning Zhou, Xin Li, Liang He

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室) School of Psychology and Cognitive Science, East China Normal University(东华大学心理学与认知科学学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出PsychAgent,通过长期多会话交互的内存增强规划引擎、技能进化引擎和强化内化引擎,实现心理辅导员的自我进化,提升多会话咨询的一致性和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09981 2026-04-29 cs.CV cs.RO 50%

ReSim: Reliable World Simulation for Autonomous Driving

ReSim:面向自动驾驶的可靠世界模拟

Jiazhi Yang, Kashyap Chitta, Shenyuan Gao, Long Chen, Yuqian Shao, Xiaosong Jia, Hongyang Li, Andreas Geiger, Xiangyu Yue, Li Chen

机构 * The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) OpenDriveLab at Shanghai AI Lab(上海人工智能实验室OpenDrive实验室) NVIDIA Research(NVIDIA研究) Xiaomi EV(小米电动车) Shanghai Jiao Tong University(上海交通大学) University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心) HKUST(香港科技大学)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出ReSim模型,通过整合真实数据与模拟数据提升自动驾驶场景模拟的可靠性与可控性,提升规划和策略选择性能。

Comments NeurIPS 2025 Spotlight. Project page: https://opendrivelab.com/ReSim

详情

展开后加载摘要…

URL PDF HTML 收藏