arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-23 至 2026-03-23 共收录 20 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 20 篇

2508.13876 2026-03-23 cs.AI cs.CL 84%

Improved Generalized Planning with LLMs through Strategy Refinement and Reflection

通过策略细化与反思改进基于LLM的通用规划

Katharina Stein, Nils Hodel, Daniel Fišer, Jörg Hoffmann, Michael Katz, Alexander Koller

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过生成伪代码并自动调试,结合反思步骤提升LLM生成的通用规划质量,实验显示改进后配置在17个基准领域达到82%的平均覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19515 2026-03-23 cs.AI 83%

ItinBench: Benchmarking Planning Across Multiple Cognitive Dimensions with Large Language Models

ItinBench:利用大语言模型在多个认知维度上进行规划的基准测试

Tianlong Wang, Pinqiao Wang, Weili Shi, Sheng li

机构 * University of Virginia(弗吉尼亚大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出ItinBench,通过整合空间推理和传统语言推理任务,评估大语言模型在多认知维度上的规划能力,发现模型在同时处理多个维度时性能不稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19257 2026-03-23 cs.CL 83%

Constraint-aware Path Planning from Natural Language Instructions Using Large Language Models

基于自然语言指令的约束感知路径规划:利用大语言模型

Dylan Shim, Minghan Wei

专题命中 规划推理 :planning(title,abstract);self-correction(abstract);分类 cs.CL

AI总结 本文提出利用大语言模型解决带约束的路径规划问题,通过自然语言输入进行问题匹配和自推断,实现灵活且可扩展的解决方案。

Comments Accepted by 2026 SPIE Security + Defense Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18377 2026-03-23 cs.CR cs.AI cs.ET 79%

PlanTwin: Privacy-Preserving Planning Abstractions for Cloud-Assisted LLM Agents

PlanTwin: 云辅助规划中的隐私保护规划抽象

Guangsheng Yu, Qin Wang, Rui Lang, Shuai Su, Xu Wang

机构 * University of Technology Sydney(悉尼技术大学) CSIRO Data61(CSIRO数据61)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 PlanTwin通过构建规划导向的数字孪生,实现云辅助规划中本地环境信息的隐私保护,同时保持规划质量接近全上下文系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17021 2026-03-23 cs.AI 79%

Generative AI-assisted Participatory Modeling in Socio-Environmental Planning under Deep Uncertainty

生成AI辅助的参与建模在深不确定性下的社会环境规划

Zhihao Pei, Nir Lipovetzky, Angela M. Rojas-Arevalo, Fjalar J. de Haan, Enayat A. Moallemi

机构 * School of Computing(计算学院) Information Systems, Faculty of Engineering(信息学院,工程学院) Information Technology, The University of Melbourne, Parkville VIC 3010, Australia(信息科技,墨尔本大学,帕克维尔 VIC 3010, 澳大利亚) Industrial Research Organization (CSIRO), Research Way, Clayton VIC 3168, Australia(工业研究组织(CSIRO),Research Way,克莱顿 VIC 3168, 澳大利亚) Department of Psychiatry, The University of Melbourne, Parkville VIC 3010, Australia(精神病学系,墨尔本大学,帕克维尔 VIC 3010, 澳大利亚)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出利用大语言模型简化社会环境规划中深不确定性下的问题概念化过程,通过模板化工作流实现参与建模,提升建模效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19838 2026-03-23 cs.RO 78%

Multi-Agent Motion Planning on Industrial Magnetic Levitation Platforms: A Hybrid ADMM-HOCBF approach

多智能体在工业磁悬浮平台上的运动规划:一种混合ADMM-HOCBF方法

Bavo Tistaert, Stan Servaes, Alejandro Gonzalez-Garcia, Ibrahim Ibrahim, Louis Callens, Jan Swevers, Wilm Decré

机构 * MECO Research Team, Dept. of Mechanical Engineering, KU Leuven and Flanders Make(MECO研究团队,机械工程系,KU莱顿和弗拉芒制造)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出了一种新颖的混合运动规划方法,用于具有holonomic特性的多智能体系统。通过结合去中心化的交替方向乘子法(ADMM)与集中式的高阶控制屏障函数(HOCBF)架构,解决了传统集中式MPC在智能体数量增加时的可计算性问题,并提供安全性保障。

Comments 8 pages, 4 figures, accepted to the European Control Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14052 2026-03-23 cs.CV cs.MA 78%

A Multi-Agent Perception-Action Alliance for Efficient Long Video Reasoning

一种多智能体感知-行动联盟用于高效长视频推理

Yichang Xu, Gaowen Liu, Ramana Rao Kompella, Tiansheng Huang, Sihao Hu, Fatih Ilhan, Selim Furkan Tekin, Zachary Yahn, Ling Liu

机构 * Georgia Institute of Technology(佐治亚理工学院) Cisco Systems(思科系统)

专题命中 规划推理 :reasoning(title,abstract)

AI总结 本文提出A4VL多智能体感知-行动探索联盟,通过多轮感知-行动探索循环提升长视频推理效率,采用事件驱动划分和线索引导块对齐技术,实现高质量推理并降低推理延迟。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19685 2026-03-23 cs.AI cs.LG cs.MA 73%

A Subgoal-driven Framework for Improving Long-Horizon LLM Agents

一种用于提升长周期LLM代理的子目标驱动框架

Taiyi Wang, Sian Gooding, Florian Hartmann, Oriana Riva, Edward Grefenstette

机构 * Google DeepMind(谷歌DeepMind)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出子目标分解规划框架和MiRA强化学习框架,通过实时规划和密集奖励信号提升LLM在长周期任务中的表现,成功率达到43.0%。

Comments 50 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19564 2026-03-23 cs.LG 70%

Wearable Foundation Models Should Go Beyond Static Encoders

可穿戴基础模型应超越静态编码器

Yu Yvonne Wu, Yuwei Zhang, Hyungjun Yoon, Ting Dang, Dimitris Spathis, Tong Xia, Qiang Yang, Jing Han, Dong Ma, Sung-Ju Lee, Cecilia Mascolo

机构 * Dartmouth College, USA(达特茅斯学院) University of Cambridge, UK(剑桥大学) The University of Melbourne, Australia(墨尔本大学) Google Research, UK(谷歌研究) Tsinghua University, China(清华大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 本文提出可穿戴基础模型需超越静态编码器,通过结构丰富数据、纵向感知多模态建模和代理推理系统实现连续性健康支持。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00171 2026-03-23 cs.CV 67%

CompAgent: An Agentic Framework for Visual Compliance Verification

CompAgent:一种用于视觉合规验证的代理框架

Rahul Ghosh, Baishali Chaudhury, Hari Prasanna Das, Meghana Ashok, Ryan Razkenari, Long Chen, Sungmin Hong, Chun-Hao Liu

机构 * Generative AI Innovation Center(生成式人工智能创新中心) Amazon Web Services(亚马逊网络服务)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出CompAgent,一种基于代理的视觉合规验证框架,通过集成视觉工具和规划代理,提升多模态推理能力,在公开基准测试中取得76%的F1分数,优于现有方法。

Comments Accepted to IEEE CVPR 2026 GRAIL-V Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18994 2026-03-23 cs.AI cs.LG 62%

Evaluating Game Difficulty in Tetris Block Puzzle

评估 Tetris 块谜题的难度

Chun-Jui Wang, Jian-Ting Guo, Hung Guei, Chung-Chin Shih, Ti-Rong Wu, I-Chen Wu

机构 * NYCUNational Yang Ming Chiao Tung University(纽约国家阳明交通大学) ASAcademia Sinica(学术院)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了 Tetris 块谜题难度评估,采用 Stochastic Gumbel AlphaZero 方法,通过训练奖励和收敛迭代等指标,分析了不同规则变化对难度的影响,发现增加持有块规则降低难度,增加 Tetris 块变种提高难度。

Comments Accepted by the Game Programming Workshop (GPW 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19248 2026-03-23 cs.CL cs.AI 62%

DuCCAE: A Hybrid Engine for Immersive Conversation via Collaboration, Augmentation, and Evolution

DuCCAE:通过协作、增强和进化实现沉浸式对话的混合引擎

Xin Shen, Zhishu Jiang, Jiaye Yang, Haibo Liu, Yichen Wan, Jiarui Zhang, Tingzhi Dai, Luodong Xu, Shuchen Wu, Guanqiang QI, Chenxi Miao, Jiahui Liang, Yang Li, Weikang Li, Deguo Xia, Jizhou Huang

机构 * Baidu Inc(百度公司)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 DuCCAE通过解耦实时响应与异步代理执行,提升沉浸式对话的响应速度与任务能力,减少延迟并增强用户留存与复杂任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20094 2026-03-23 cs.IR cs.AI cs.DB 57%

LLM-Enhanced Semantic Data Integration of Electronic Component Qualifications in the Aerospace Domain

基于大语言模型的航空领域电子元件资格语义数据整合

Antonio De Santis, Marco Balduini, Matteo Belcao, Andrea Proia, Marco Brambilla, Emanuele Della Valle

机构 * Politecnico di Milano, DEIB(米兰Politecnico大学DEIB系) Quantia Consulting(Quantia咨询公司) Motus ml(Motus ml实验室) Thales Alenia Space(Thales Alenia空间公司)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出利用虚拟知识图谱和大语言模型整合航空领域电子元件资格数据,通过本体数据访问和向量搜索提升检索效率,减少人工处理成本。

Comments ESWC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20028 2026-03-23 cs.SE cs.AI 57%

Orchestrating Human-AI Software Delivery: A Retrospective Longitudinal Field Study of Three Software Modernization Programs

协调人机AI软件交付:三种软件现代化项目的回顾纵向实地研究

Maximiliano Armesto, Christophe Kolb

机构 * Taller Technologies(塔勒技术)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究通过回顾三个软件现代化项目,分析AI与人类协作在软件交付各阶段的效果,发现嵌入协调工作流的AI能显著提升效率与覆盖率。

Comments 18 pages, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19896 2026-03-23 cs.AI 57%

Utility-Guided Agent Orchestration for Efficient LLM Tool Use

基于效用的代理协调以提高大语言模型工具使用效率

Boyan Liu, Gongming Zhao, Hongli Xu

机构 * University of Science and Technology of China(科学技术大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种基于效用的代理协调策略,通过平衡收益、成本、不确定性及冗余性来优化大语言模型工具使用中的质量与成本权衡。实验表明显式协调信号显著影响代理行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19710 2026-03-23 cs.IR cs.AI 57%

AIGQ: An End-to-End Hybrid Generative Architecture for E-commerce Query Recommendation

AIGQ: 电商查询推荐的端到端混合生成架构

Jingcao Xu, Jianyun Zou, Renkai Yang, Zili Geng, Qiang Liu, Haihong Tang

机构 * Taobao \& Tmall Group of Alibaba Hangzhou China University of Electronic Science Taobao \& Tmall Group of Alibaba

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 AIGQ通过端到端生成框架解决电商查询推荐中的语义浅层、冷启动差和偶然性问题,采用兴趣感知列表监督微调和兴趣感知列表组相对策略优化,提升查询相关性和列表属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07451 2026-03-23 cs.CL 57%

DLLM Agent: See Farther, Run Faster

DLLM Agent: 看得更远,跑得更快

Huiling Zhen, Weizhe Lin, Renxi Liu, Kai Han, Yiming Li, Yuchuan Tian, Hanting Chen, Xiaoguang Li, Xiaosong Li, Chen Chen, Xianzhi Yu, Mingxuan Yuan, Youliang Yan, Peifeng Qin, Jun Wang, Yu Wang, Dacheng Tao, Yunhe Wang

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) UCL(伦敦大学学院) Tsinghua University(清华大学) NTU(国立新加坡大学) Peking University(北京大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 本文研究了扩散大语言模型(DLLM)在代理多步决策中的表现,发现其在准确率相当的情况下,整体效率比自回归模型(AR)高30%以上,并提出部署扩散骨架的两个实用考虑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20795 2026-03-23 cs.CL 57%

Test-Time Alignment for Large Language Models via Textual Model Predictive Control

通过文本模型预测控制对大型语言模型进行测试时对齐

Kuang-Da Wang, Teng-Ruei Chen, Yu Heng Hung, Guo-Xun Ko, Shuoyang Ding, Yueh-Hua Wu, Yu-Chiang Frank Wang, Chao-Han Huck Yang, Wen-Chih Peng, Ping-Chun Hsieh

机构 * National Yang Ming Chiao Tung University NVIDIA National Taiwan University

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 本文提出TMPC方法,通过文本模型预测控制解决测试时对齐问题,通过分层强化学习原理改进生成过程,提升不同任务的性能。

Comments Accepted for ICLR 2026. Project page: https://rl-bandits-lab.github.io/TMPC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13757 2026-03-23 cs.CY 50%

Assessing the Case for Africa-Centric AI Safety Evaluations

评估非洲中心的AI安全评估的必要性

Gathoni Ireri, Cecil Abungu, Jean Cheptumo, Sienka Dounia, Mark Gitau, Stephanie Kasaon, Michael Michie, Chinasa T. Okolo, Jonathan Shock

专题命中 规划推理 :planning(abstract)

AI总结 本文探讨了非洲环境中前沿AI系统带来的严重风险,提出了一种分类方法来识别这些风险,并提出了针对非洲情境的威胁建模策略及评估指导。

Comments 41 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17861 2026-03-23 cs.RO 50%

From Vocal Instructions to Household Tasks: The Inria TIAGo++ in the euROBIN Service Robots Coopetition

从语音指令到家庭任务:Inria TIAGo++在euROBIN服务机器人竞赛中的应用

Fabio Amadio, Clemente Donoso, Dionis Totsila, Raphael Lorenzo, Quentin Rouxel, Olivier Rochel, Enrico Mingo Hoffman, Jean-Baptiste Mouret, Serena Ivaldi

机构 * Inria/LORIA

专题命中 规划推理 :planning(abstract)

AI总结 本文介绍了Inria团队在euROBIN竞赛中使用的集成机器人系统,通过改进TIAGo++平台实现自主和远程操作模式,并结合LLM进行指令理解和任务规划,解决了服务机器人部署中的实际问题。

详情

展开后加载摘要…

URL PDF HTML 收藏