Improved Generalized Planning with LLMs through Strategy Refinement and Reflection
通过策略细化与反思改进基于LLM的通用规划
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出通过生成伪代码并自动调试,结合反思步骤提升LLM生成的通用规划质量,实验显示改进后配置在17个基准领域达到82%的平均覆盖率。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
通过策略细化与反思改进基于LLM的通用规划
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出通过生成伪代码并自动调试,结合反思步骤提升LLM生成的通用规划质量,实验显示改进后配置在17个基准领域达到82%的平均覆盖率。
ItinBench:利用大语言模型在多个认知维度上进行规划的基准测试
机构 * University of Virginia(弗吉尼亚大学)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI
AI总结 本文提出ItinBench,通过整合空间推理和传统语言推理任务,评估大语言模型在多认知维度上的规划能力,发现模型在同时处理多个维度时性能不稳定。
基于自然语言指令的约束感知路径规划:利用大语言模型
专题命中 规划推理 :planning(title,abstract);self-correction(abstract);分类 cs.CL
AI总结 本文提出利用大语言模型解决带约束的路径规划问题,通过自然语言输入进行问题匹配和自推断,实现灵活且可扩展的解决方案。
Comments Accepted by 2026 SPIE Security + Defense Conference
PlanTwin: 云辅助规划中的隐私保护规划抽象
机构 * University of Technology Sydney(悉尼技术大学) ; CSIRO Data61(CSIRO数据61)
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
AI总结 PlanTwin通过构建规划导向的数字孪生,实现云辅助规划中本地环境信息的隐私保护,同时保持规划质量接近全上下文系统。
生成AI辅助的参与建模在深不确定性下的社会环境规划
机构 * School of Computing(计算学院) ; Information Systems, Faculty of Engineering(信息学院,工程学院) ; Information Technology, The University of Melbourne, Parkville VIC 3010, Australia(信息科技,墨尔本大学,帕克维尔 VIC 3010, 澳大利亚) ; Industrial Research Organization (CSIRO), Research Way, Clayton VIC 3168, Australia(工业研究组织(CSIRO),Research Way,克莱顿 VIC 3168, 澳大利亚) ; Department of Psychiatry, The University of Melbourne, Parkville VIC 3010, Australia(精神病学系,墨尔本大学,帕克维尔 VIC 3010, 澳大利亚)
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
AI总结 本文提出利用大语言模型简化社会环境规划中深不确定性下的问题概念化过程,通过模板化工作流实现参与建模,提升建模效率与准确性。
多智能体在工业磁悬浮平台上的运动规划:一种混合ADMM-HOCBF方法
机构 * MECO Research Team, Dept. of Mechanical Engineering, KU Leuven and Flanders Make(MECO研究团队,机械工程系,KU莱顿和弗拉芒制造)
专题命中 规划推理 :planning(title,abstract)
AI总结 本文提出了一种新颖的混合运动规划方法,用于具有holonomic特性的多智能体系统。通过结合去中心化的交替方向乘子法(ADMM)与集中式的高阶控制屏障函数(HOCBF)架构,解决了传统集中式MPC在智能体数量增加时的可计算性问题,并提供安全性保障。
Comments 8 pages, 4 figures, accepted to the European Control Conference 2026
一种多智能体感知-行动联盟用于高效长视频推理
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Cisco Systems(思科系统)
专题命中 规划推理 :reasoning(title,abstract)
AI总结 本文提出A4VL多智能体感知-行动探索联盟,通过多轮感知-行动探索循环提升长视频推理效率,采用事件驱动划分和线索引导块对齐技术,实现高质量推理并降低推理延迟。
Comments Accepted by CVPR2026
一种用于提升长周期LLM代理的子目标驱动框架
机构 * Google DeepMind(谷歌DeepMind)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出子目标分解规划框架和MiRA强化学习框架,通过实时规划和密集奖励信号提升LLM在长周期任务中的表现,成功率达到43.0%。
Comments 50 pages, 15 figures
可穿戴基础模型应超越静态编码器
机构 * Dartmouth College, USA(达特茅斯学院) ; University of Cambridge, UK(剑桥大学) ; The University of Melbourne, Australia(墨尔本大学) ; Google Research, UK(谷歌研究) ; Tsinghua University, China(清华大学)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG
AI总结 本文提出可穿戴基础模型需超越静态编码器,通过结构丰富数据、纵向感知多模态建模和代理推理系统实现连续性健康支持。
Comments 13 pages
CompAgent:一种用于视觉合规验证的代理框架
机构 * Generative AI Innovation Center(生成式人工智能创新中心) ; Amazon Web Services(亚马逊网络服务)
专题命中 规划推理 :reasoning(abstract);planning(abstract)
AI总结 本文提出CompAgent,一种基于代理的视觉合规验证框架,通过集成视觉工具和规划代理,提升多模态推理能力,在公开基准测试中取得76%的F1分数,优于现有方法。
Comments Accepted to IEEE CVPR 2026 GRAIL-V Workshop
评估 Tetris 块谜题的难度
机构 * NYCUNational Yang Ming Chiao Tung University(纽约国家阳明交通大学) ; ASAcademia Sinica(学术院)
专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了 Tetris 块谜题难度评估,采用 Stochastic Gumbel AlphaZero 方法,通过训练奖励和收敛迭代等指标,分析了不同规则变化对难度的影响,发现增加持有块规则降低难度,增加 Tetris 块变种提高难度。
Comments Accepted by the Game Programming Workshop (GPW 2025)
DuCCAE:通过协作、增强和进化实现沉浸式对话的混合引擎
机构 * Baidu Inc(百度公司)
专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI
AI总结 DuCCAE通过解耦实时响应与异步代理执行,提升沉浸式对话的响应速度与任务能力,减少延迟并增强用户留存与复杂任务完成率。
基于大语言模型的航空领域电子元件资格语义数据整合
机构 * Politecnico di Milano, DEIB(米兰Politecnico大学DEIB系) ; Quantia Consulting(Quantia咨询公司) ; Motus ml(Motus ml实验室) ; Thales Alenia Space(Thales Alenia空间公司)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 本文提出利用虚拟知识图谱和大语言模型整合航空领域电子元件资格数据,通过本体数据访问和向量搜索提升检索效率,减少人工处理成本。
Comments ESWC 2026
协调人机AI软件交付:三种软件现代化项目的回顾纵向实地研究
机构 * Taller Technologies(塔勒技术)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 研究通过回顾三个软件现代化项目,分析AI与人类协作在软件交付各阶段的效果,发现嵌入协调工作流的AI能显著提升效率与覆盖率。
Comments 18 pages, 4 figures, 12 tables
基于效用的代理协调以提高大语言模型工具使用效率
机构 * University of Science and Technology of China(科学技术大学)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出一种基于效用的代理协调策略,通过平衡收益、成本、不确定性及冗余性来优化大语言模型工具使用中的质量与成本权衡。实验表明显式协调信号显著影响代理行为。
AIGQ: 电商查询推荐的端到端混合生成架构
机构 * Taobao \& Tmall Group of Alibaba Hangzhou China ; University of Electronic Science ; Taobao \& Tmall Group of Alibaba
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 AIGQ通过端到端生成框架解决电商查询推荐中的语义浅层、冷启动差和偶然性问题,采用兴趣感知列表监督微调和兴趣感知列表组相对策略优化,提升查询相关性和列表属性。
DLLM Agent: 看得更远,跑得更快
机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) ; UCL(伦敦大学学院) ; Tsinghua University(清华大学) ; NTU(国立新加坡大学) ; Peking University(北京大学)
专题命中 规划推理 :planning(abstract);分类 cs.CL
AI总结 本文研究了扩散大语言模型(DLLM)在代理多步决策中的表现,发现其在准确率相当的情况下,整体效率比自回归模型(AR)高30%以上,并提出部署扩散骨架的两个实用考虑。
通过文本模型预测控制对大型语言模型进行测试时对齐
机构 * National Yang Ming Chiao Tung University ; NVIDIA ; National Taiwan University
专题命中 规划推理 :planning(abstract);分类 cs.CL
AI总结 本文提出TMPC方法,通过文本模型预测控制解决测试时对齐问题,通过分层强化学习原理改进生成过程,提升不同任务的性能。
Comments Accepted for ICLR 2026. Project page: https://rl-bandits-lab.github.io/TMPC/
评估非洲中心的AI安全评估的必要性
专题命中 规划推理 :planning(abstract)
AI总结 本文探讨了非洲环境中前沿AI系统带来的严重风险,提出了一种分类方法来识别这些风险,并提出了针对非洲情境的威胁建模策略及评估指导。
Comments 41 pages, 1 figure
从语音指令到家庭任务:Inria TIAGo++在euROBIN服务机器人竞赛中的应用
机构 * Inria/LORIA
专题命中 规划推理 :planning(abstract)
AI总结 本文介绍了Inria团队在euROBIN竞赛中使用的集成机器人系统,通过改进TIAGo++平台实现自主和远程操作模式,并结合LLM进行指令理解和任务规划,解决了服务机器人部署中的实际问题。