arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-09 至 2026-04-09 共收录 22 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 22 篇

2604.06427 2026-04-09 cs.LG cs.AI cs.CL 88%

The Depth Ceiling: On the Limits of Large Language Models in Discovering Latent Planning

深度上限:大语言模型在发现潜在规划中的局限性

Yi Xu, Philipp Jettkant, Laura Ruis

机构 * University of Cambridge(剑桥大学) Imperial College London(帝国理工学院) MIT(麻省理工学院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 研究探讨了大语言模型在无监督情况下发现多步规划策略的极限,发现模型在单次前向传递中能执行最多七步潜在规划,揭示了训练与测试时能力的差异。

Comments 10 pages, 3 figures, 1 table (30 pages, 9 figures, 10 tables including references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08409 2026-04-09 cs.AI 88%

Faithful-First Reasoning, Planning, and Acting for Multimodal LLMs

多模态大语言模型中的忠实优先推理、规划与行动

Junxian Li, Xinyue Xu, Sai Ma, Di Zhang, Sichao Li

机构 * Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology(香港科技大学) The Australian National University(澳大利亚国立大学) Fudan University(复旦大学) University of Sydney(悉尼大学)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

AI总结 本文提出Faithful-First RPA框架,通过逐步监督提升多模态推理的忠实度,实验表明其在多个基准上提升了24%的感知忠实度,且不降低任务准确性。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29908 2026-04-09 cs.AI 83%

C-TRAIL: A Commonsense World Framework for Trajectory Planning in Autonomous Driving

C-TRAIL:用于自动驾驶轨迹规划的常识世界框架

Zhihong Cui, Haoran Tang, Tianyi Li, Yushuai Li, Peiyuan Guan, Amir Taherkordi, Tor Skeie

机构 * University of Oslo(奥斯陆大学) Hong Kong Polytechnic University(香港理工大学) Aalborg University(奥尔堡大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出C-TRAIL框架,结合常识世界与信任机制,通过Recall-Plan-Update循环提升自动驾驶轨迹规划的可靠性,实验表明其在ADE、FDE和SR指标上均优于现有方法。

Journal ref IEEE Transactions on Vehicular Technology, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14063 2026-04-09 cs.RO 82%

Adaptive Obstacle-Aware Task Assignment and Planning for Heterogeneous Robot Teaming

自适应障碍感知异构机器人协同的任务分配与规划

Nan Li, Jiming Ren, Haris Miller, Samuel Coogan, Karen M. Feigh, Ye Zhao

机构 * Institute for Robotics and Intelligent Machines, Georgia Institute of Technology(佐治亚理工学院机器人与智能机器研究所) Lockheed Martin Corporation(洛克希德·马丁公司)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 本文提出OATH框架,通过自适应Halton序列地图和集群拍卖选择机制,提升异构机器人在障碍密集环境中的任务分配效率与适应性,结合LLM实现实时指令解读。

Comments 24 pages, 19 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07345 2026-04-09 eess.SY cs.DC cs.LG cs.SY 79%

Measurement of Generative AI Workload Power Profiles for Whole-Facility Data Center Infrastructure Planning

面向全设施数据中心基础设施规划的生成式AI工作负载功率谱测量

Roberto Vercellino, Jared Willard, Gustavo Campos, Weslley da Silva Pereira, Olivia Hull, Matthew Selensky, Juliane Mueller

机构 * National Laboratory of the Rockies (NLR)(落基山国家实验室(NLR))

专题命中 规划推理 :planning(title,abstract);分类 cs.LG

AI总结 本文通过高精度测量生成式AI工作负载的功率消耗,结合MLCommons和vLLM基准,建立全设施能效模型,为电网接入、本地能源生成和微电网规划提供数据支持。

Comments The data associated with this publication can be found at http://doi.org/10.7799/3025227

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07148 2026-04-09 cs.LG 79%

Multi-Turn Reasoning LLMs for Task Offloading in Mobile Edge Computing

面向移动边缘计算的任务卸载的多轮推理LLM

Ning Yang, Chuangxin Cheng, Haijun Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Machano-Electronic Engineering, Xidian University(西安电子科技大学机电工程学院) School of Computer and Communication Engineering, University of Science and Technology Beijing(北京科技大学计算机与通信工程学院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出COMLLM框架,通过整合GRPO与LACS机制,实现移动边缘计算中的前瞻性决策,提升任务卸载效率与负载均衡公平性,支持零样本拓扑扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06882 2026-04-09 cs.RO cs.SY eess.SP eess.SY 78%

Telecom World Models: Unifying Digital Twins, Foundation Models, and Predictive Planning for 6G

电信世界模型:统一数字孪生、基础模型和预测规划用于6G

Hang Zou, Yuzhi Yang, Lina Bariah, Yu Tian, Yuhuan Lu, Bohao Wang, Anis Bara, Brahim Mefgouda, Hao Liu, Yiwei Tao, Sergy Petrov, Salma Cheour, Nassim Sehad, Sumudu Samarakoon, Chongwen Huang, Samson Lasaulce, Mehdi Bennis, Mérouane Debbah

机构 * Research Institute for Digital Future, Khalifa University(哈利法大学数字未来研究所) College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息与电子工程学院) University of Oulu(奥卢大学) Aalto University(阿尔托大学) Université de Lorraine, CNRS, CRAN(洛林大学,法国国家科学研究中心,CRAN)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出电信世界模型(TWM),结合数字孪生与基础模型,解决6G网络中动态建模、不确定性处理和多层控制规划问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06598 2026-04-09 cs.RO cs.SY eess.SY 78%

Train-Small Deploy-Large: Leveraging Diffusion-Based Multi-Robot Planning

训练小型部署大型:利用基于扩散的多机器人规划

Siddharth Singh, Soumee Guha, Qing Chang, Scott Acton

机构 * University of Virginia(弗吉尼亚大学)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出基于扩散模型的多机器人路径规划方法,通过训练少量代理并有效扩展到更多代理,解决动态变化中的规划问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18841 2026-04-09 cs.CL cs.AI cs.LG 75%

LongWriter-Zero: Mastering Ultra-Long Text Generation via Reinforcement Learning

LongWriter-Zero: 通过强化学习掌握超长文本生成

Yuhao Wu, Yushi Bai, Zhiqiang Hu, Roy Ka-Wei Lee, Juanzi Li

机构 * Singapore University of Technology and Design, Singapore(新加坡科技设计大学) Tsinghua University, Beijing, China(清华大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种基于激励的方法,无需标注或合成数据,通过强化学习使LLM生成超长高质量文本,实验表明其在长文本任务中优于传统SFT方法,达到WritingBench和Arena-Write的最优效果。

Comments ICLR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06260 2026-04-09 cs.LG cs.AI 73%

$S^3$: Stratified Scaling Search for Test-Time in Diffusion Language Models

$S^3$:分层缩放搜索用于扩散语言模型的测试时间

Ahsan Bilal, Muhammad Ahmed Mohsin, Muhammad Umer, Asad Aali, Muhammad Usman Khanzada, Muhammad Usman Rafique, Zihao He, Emily Fox, Dean F. Hougen

机构 * University of Oklahoma(俄克拉荷马大学) Stanford University(斯坦福大学) University of Göttingen(哥廷根大学) Zoox Meta

专题命中 规划推理 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出$S^3$方法,通过在去噪过程中重新分配计算资源提升生成质量,实验证明其在数学推理任务中表现最佳。

Comments Submitted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06177 2026-04-09 cs.IR cs.AI cs.CL 73%

WebExpert: domain-aware web agents with critic-guided expert experience for high-precision search

WebExpert: 基于领域感知的网页代理:通过批评者引导的专家经验实现高精度搜索

Yuelin Hu, Zhengxue Cheng, Ronghua Wu, Qunshan Gu, Hongwei Hu, Wei Liu, Qiao Liang, Li Song

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 WebExpert通过领域感知的网页代理,结合批评者引导的专家经验,提升搜索精度,其核心方法包括句子级经验检索、结构化轻量级领域诱导及偏好优化规划,有效提升了答案准确率。

Comments accepted by icassp2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10512 2026-04-09 cs.AI cs.LG cs.NE 73%

Resource-constrained Amazons chess decision framework integrating large language models and graph attention

资源受限的亚马逊国际象棋决策框架整合大语言模型和图注意力

Tianhao Qian, Zhuoxuan Li, Jinde Cao, Xinli Shi, Leszek Rutkowski

机构 * School of Mathematics, Southeast University(东南大学数学学院) Systems Research Institute of the Polish Academy of Sciences(波兰科学院系统研究所) Institute of Computer Science, AGH University of Krakow(AGH科技大学计算机科学研究所) SAN University(SAN大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种轻量级混合框架,结合图注意力学习和大语言模型生成能力,提升亚马逊国际象棋决策准确性,实验显示在资源受限条件下实现显著性能提升。

Comments 20 pages, 15 figures. Supported by the National Key Research and Development Project of China (No. 2020YFA0714300), NSFC (No. 61833005, 12061088), the Open Project of Key Laboratory of Transport Industry of Comprehensive Transportation Theory (Nanjing Modern Multimodal Transportation Laboratory) (MTF2023004), and the China Postdoctoral Science Foundation (2024T170129, GZC20240261)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18258 2026-04-09 cs.MA cs.AI cs.LG 73%

Hybrid Agentic AI and Multi-Agent Systems in Smart Manufacturing

智能制造中混合代理AI与多代理系统

Mojtaba A. Farahani, Md Irfan Khan, Thorsten Wuest

机构 * University of South Carolina(南卡罗来纳大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种混合代理AI与多代理框架,用于预测性维护,结合LLM代理的战略协调与规则代理的高效任务处理,通过分层架构实现动态模型适应与可解释决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05529 2026-04-09 cs.AI cs.RO 70%

Before We Trust Them: Decision-Making Failures in Navigation of Foundation Models

在我们信任之前:基础模型导航决策中的失败

Jua Han, Jaeyoon Seo, Jungbin Min, Sieun Choi, Huichan Seo, Jihie Kim, Jean Oh

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究发现基础模型在导航任务中存在显著决策失败,需更细致评估以理解其局限性。

Comments Corrected author order in metadata; manuscript changed

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16150 2026-04-09 cs.AI cs.HC cs.SY eess.SY 70%

A Comprehensive Survey of Agents for Computer Use: Foundations, Challenges, and Future Directions

用于计算机的代理全面综述:基础、挑战与未来方向

Pascal J. Sager, Benjamin Meyer, Peng Yan, Rebekka von Wartburg-Kottler, Layan Etaiwi, Aref Enayati, Gabriel Nobel, Ahmed Abdulkadir, Benjamin F. Grewe, Thilo Stadelmann

机构 * Zurich University of Applied Sciences(苏黎世应用科技大学) University of Zurich(苏黎世大学) ETH AI Center(苏黎世联邦理工学院人工智能中心) University of Fribourg(弗里堡大学) European Centre for Living Technology(欧洲生活技术中心)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文综述了用于计算机的代理(ACUs)的发展现状、趋势及研究空白,提出统一的分类体系,分析了六个主要研究缺口,并提出改进方向。

Journal ref Journal of Artificial Intelligence Research, vol. 85, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06571 2026-04-09 cs.CL cs.AI cs.IR cs.LG 67%

LLM-based Schema-Guided Extraction and Validation of Missing-Person Intelligence from Heterogeneous Data Sources

基于大型语言模型的异构数据源中缺失人员情报提取与验证方案

Joshua Castillo, Ravi Mukkamala

机构 * Old Dominion University(欧道明大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Guardian Parser Pack,通过AI驱动的解析与规范化流程,将多源调查文档统一为符合模式的表示,提升缺失人员情报的提取与验证效率,同时展示系统架构及性能评估结果。

Comments 9 pages, 6 figures. Accepted at International Conference on Intelligent Digitization of Systems and Services (IDSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06603 2026-04-09 cs.CL cs.AI 62%

Scientific Knowledge-driven Decoding Constraints Improving the Reliability of LLMs

基于科学知识的解码约束:提升大语言模型的可靠性

Maotian Ma, Zheni Zeng, Zhenghao Liu, Yukun Yan

机构 * Nanjing University(南京大学) Tsinghua University(清华大学) Northeastern University(东北大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SciDC方法,通过整合领域知识与强约束提升LLM在科学任务中的可靠性,实验显示在工业配方设计、肿瘤诊断和逆合成规划中平均准确率提升12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06696 2026-04-09 cs.AI 57%

AgentGate: A Lightweight Structured Routing Engine for the Internet of Agents

AgentGate: 一种轻量级的结构化路由引擎用于物联网代理

Yujun Cheng, Enfang Cui, Hao Qin, Zhiyuan Liang, Qi Xu

机构 * School of Artificial Intelligence, University of Science and Technology Beijing(北京科技大学人工智能学院) China Telecom Research Institute(中国电信研究院) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出AgentGate,一种轻量级结构化路由引擎,用于在资源受限条件下高效且隐私友好的代理系统,通过分阶段决策和结构化接地提升路由效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06280 2026-04-09 physics.med-ph cs.AI 57%

DosimeTron: Automating Personalized Monte Carlo Radiation Dosimetry in PET/CT with Agentic AI

DosimeTron:利用代理AI自动化PET/CT中的个性化蒙特卡洛辐射剂量学

Eleftherios Tzanis, Michail E. Klontzas, Antonios Tzortzakakis

机构 * Division of Radiology, Department for Clinical Science, Intervention and Technology (CLINTEC), Karolinska Institutet(卡罗林斯卡学院临床科学、干预与技术系放射学部门) Artificial Intelligence and Translational Imaging (ATI) Lab, Department of Radiology, School of Medicine, University of Crete(克里特大学医学院放射学系人工智能与转化影像实验室) Department of Nuclear Medicine and Medical Physics, Section Nuclear Medicine Huddinge, Karolinska University Hospital(卡罗林斯卡大学医院核医学与医学物理系胡丁厄核医学部门) Department of Nuclear Medicine and Medical Physics, Theranostics Trial Center, Karolinska University Hospital(卡罗林斯卡大学医院核医学与医学物理系治疗诊断试验中心) Computational Biomedicine Laboratory, Institute of Computer Science Foundation for Research and Technology Hellas (ICS - FORTH)(研究与技术基金会计算机科学研究所计算生物医学实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出DosimeTron,一种基于代理AI的系统,用于自动化PET/CT检查中的患者特定蒙特卡洛内部辐射剂量学,通过自然语言交互实现DICOM元数据提取、图像预处理、MC模拟、器官分割和剂量报告,验证了其在114例病例和22个器官上的高精度与临床可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06198 2026-04-09 cs.CY cs.AI 57%

Concentrated siting of AI data centers drives regional power-system stress under rising global compute demand

人工智能数据中心的集中布局在日益增长的全球计算需求下加剧了区域电力系统压力

Danbo Chen, Zijun Zhou, Yongyang Cai, Jiahong Qin, Ani Katchova, Lei Chen

机构 * The Ohio State University(俄亥俄州立大学) Meta Platforms Inc.(Meta平台公司) Zhejiang A&F University(浙江农林大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文研究了人工智能数据中心的集中布局对电力系统的影响,通过结合大语言模型分析和能源系统建模,预测了2025至2030年间AI数据中心的电力足迹,发现北美、西欧和亚太地区占90%以上计算能力,部分区域电网面临高压力。

Comments 32 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14735 2026-04-09 q-fin.CP cs.AI cs.CV 57%

PyFi: Toward Pyramid-like Financial Image Understanding for VLMs via Adversarial Agents

PyFi: 通过对抗代理实现金字塔式金融图像理解的愿景语言模型

Yuqun Zhang, Yuxuan Zhao, Sijia Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Yantai Research Institute, Harbin Engineering University(哈尔滨工程大学烟台研究院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 PyFi通过对抗代理生成的金字塔结构数据集,提升VLM在金融图像理解中的推理能力,实验显示模型在复杂金融问题上的准确率提升19.52%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06376 2026-04-09 cs.CV 50%

MTA-Agent: An Open Recipe for Multimodal Deep Search Agents

MTA-Agent:多模态深度搜索代理的开放配方

Xiangyu Peng, Can Qin, An Yan, Xinyi Yang, Zeyuan Chen, Ran Xu, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce 人工智能研究院)

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出MTA-Agent,通过构建高质量多跳视觉-语言训练数据,实现多模态深度搜索代理,其在六个基准测试中达到54.63%的平均准确率,优于其他模型,同时降低训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏