Reinforced Planning with Latent World Models
基于潜世界模型的强化规划
机构 * Pantheon Industries(万神殿工业公司)
专题命中 规划决策 :planning(title,abstract);分类 cs.LG
AI总结 该研究提出RP1方法,将良好搜索规则强化到神经规划器中,可改进多步计划,在多个机器人任务中性能优于手工搜索算法,且效率更高。
Comments Preprint
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
基于潜世界模型的强化规划
机构 * Pantheon Industries(万神殿工业公司)
专题命中 规划决策 :planning(title,abstract);分类 cs.LG
AI总结 该研究提出RP1方法,将良好搜索规则强化到神经规划器中,可改进多步计划,在多个机器人任务中性能优于手工搜索算法,且效率更高。
Comments Preprint
用于复杂序列决策任务的混合大语言模型增强强化学习智能体
专题命中 规划决策 :agent(abstract);autonomous agent(abstract);tool-use(abstract);planning(abstract)
AI总结 本文提出混合LLM增强RL智能体,融合LLM规划与RL动作优化,经实验验证其在序列决策任务上优于仅RL、仅LLM的基线方法,为构建更强自主系统提供了新方向。
Comments This submission is withdrawn because the uploaded manuscript does not accurately reflect the intended structure or results. Several components referenced in the text are incomplete or not represented in the PDF, and the current version may mislead readers. The work is therefore withdrawn to maintain clarity of the record
PILOT技术报告
专题命中 规划决策 :agent(abstract,abstract_cn);planning(abstract);agentic(abstract)
AI总结 该研究针对现有推荐系统优化智能体方法的反应式缺陷,提出PILOT框架,通过三类角色构建控制循环,在淘宝平台对比ROAM验证,实现多项指标提升且搜索效率显著提高,无需人工干预。
Comments Technical Report, 42 pages, 10 figures
ORBITER:面向智能体的最后一公里配送的冲突感知决策方法
专题命中 规划决策 :agentic(title,abstract);分类 cs.AI
AI总结 本文针对最后一公里配送决策的可解释性与可靠性问题,提出ORBITER框架,结合LLM与结构化决策机制,在四城市数据上较最优基线平均提升9.2%,验证了方法的有效性。
RTPO:用于稳定智能体强化学习训练的反向回合策略优化
机构 * Adelaide University(阿德莱德大学) ; The University of Sydney(悉尼大学) ; Curtin University(科廷大学) ; School of CSIT(计算机科学与信息技术学院) ; ACFR(澳大利亚空间研究中心) ; School of EECMS(电子工程、计算机与数学科学学院)
专题命中 规划决策 :agentic(title,abstract);分类 cs.AI
AI总结 针对多回合智能体RL训练不稳定问题,提出RTPO方法,通过反向回合策略优化消除上下文不匹配与异步漂移,实验显示其较基线提升21.50%、10.76%。
LiteOdyssey: 一种用于可解释罕见病诊断的轻量级推理AI智能体
机构 * Vanderbilt University(范德堡大学) ; Vanderbilt University Medical Center(范德堡大学医学中心) ; University of South Florida(南佛罗里达大学)
专题命中 规划决策 :agentic(title,abstract);分类 cs.AI
AI总结 提出轻量级框架LiteOdyssey,通过人类-AI协作的诊断策略和公共生物医学工具增强单个推理语言模型,在罕见病诊断基准上达到最先进性能,无需微调或多智能体集成。
Comments Updated abalation experiments and layout
面向长上下文自动驾驶的规划对齐令牌压缩
机构 * NVIDIA Research(NVIDIA研究) ; School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)
专题命中 规划决策 :planning(title,abstract);分类 cs.AI
AI总结 提出COMPACT-VA框架,基于条件VQ-VAE将长上下文压缩为有界表示,通过规划对齐实现决策关键信息保留,在动态场景中成功率提升超6%,速度提升3.3倍。
Comments Accepted by IEEE Robotics and Automation Letters (RA-L) 2026. 8 pages
面向城市规划的图像生成技术
专题命中 规划决策 :planning(title,abstract)
AI总结 本研究开发了基于掩码的加权条件流匹配(MWCFM)模型,用于自动生成城市场景中的建筑演示图像,并通过应用相关指标评估其性能,为城市规划图像生成提供优化方案。
Comments 9 pages (incl. references), 3 figures, 2 tables
考虑需求不确定性的、结合光伏自发自用的电动汽车与电动公交车充电基础设施的鲁棒联合规划
专题命中 规划决策 :planning(title,abstract)
AI总结 本文提出结合光伏自发自用的混合整数线性规划框架,对电动汽车与电动公交车充电基础设施进行鲁棒联合规划,通过50节点案例验证了相关策略的有效性。
Comments This manuscript has been submitted for peer review
EVADE:带弃权机制的证据验证智能诊断方法
机构 * Monash University(莫纳什大学) ; Murdoch University(默多克大学)
专题命中 规划决策 :agentic(title,abstract)
AI总结 该研究针对医学VLMs不可靠问题,提出无需训练的EVADE方法,通过跨图像视图验证一致性并引入弃权机制,在多医学VQA数据集上提升了校准度与选择性风险,同时维持了准确率。
面向AI危机准备的基于能力的规划
专题命中 规划决策 :planning(title,abstract)
AI总结 该研究针对AI难以预测的问题,提出三部分组成的基于能力的规划方法框架,经四类AI赋能威胁试点验证,为AI危机准备提供实用工具。
GAPL:面向基于大语言模型的轨迹规划的接地动作效果策略学习
机构 * University of Oslo(奥斯陆大学) ; Aalborg University(奥尔堡大学) ; University of Sydney(悉尼大学) ; Nanjing University of Information Science and Technology(南京信息工程大学) ; Simula Research Laboratory(西穆拉研究院)
专题命中 规划决策 :planning(title,abstract)
AI总结 针对LLM用于自动驾驶轨迹规划时存在的幻觉、接地不足等问题,提出GAPL框架,整合三类模块并经实验验证其性能优于基线方法
Comments 11 pages, 5 figures, 6 tables
使用信号时序逻辑的字典序最小违规运动规划
机构 * School of Computation, Information and Technology, Technical University of Munich(慕尼黑技术大学计算信息与技术学院) ; ZF Friedrichshafen AG(弗赖堡汽车集团) ; Institute of System Dynamics, HTWG Konstanz(康斯坦茨HTWG系统动力学研究所)
专题命中 规划决策 :planning(title,abstract)
AI总结 提出一种将字典序多目标优化转化为单目标标量优化的方法,通过非均匀量化和位移扩展MPPI求解器,并引入结合时空违规的谓词鲁棒性度量,实现可解释且可扩展的字典序STL最小违规运动规划。
Comments Accepted for publication in the IEEE Open Journal of Intelligent Transportation Systems (OJ-ITS)
WESPR:风适应的节能安全感知与规划用于四旋翼机稳健飞行
机构 * University of Maryland, College Park(马里兰大学学院公园分校)
专题命中 规划决策 :planning(title,abstract)
AI总结 WESPR通过预测环境几何对局部风的影响,实现四旋翼无人机的风适应性路径规划与控制优化,显著提升飞行稳定性与路径精度。
Comments 8 pages, 9 Figures. Accepted to IROS 2026
潜在世界模型中的决策度量对齐:MPC规划的诊断与动作条件目标
专题命中 规划决策 :planning(title);分类 cs.LG
AI总结 该研究针对潜在世界模型中MPC规划的决策度量对齐问题,提出两种秩一致性诊断指标,开发DA-LeWM模型,验证其可加快收敛并提升在线成功率,改善潜在MPC的几何结构。
神经符号具身智能体
机构 * Imperial College London(帝国理工学院) ; Johns Hopkins University(约翰斯·霍普金斯大学) ; City, University of London(伦敦城市大学)
专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL
AI总结 该研究提出一种神经符号具身智能体,将长周期家庭任务分解为视觉探索与符号规划,在VirtualHome、ALFWorld基准测试中表现优异,约束与搜索结合可大幅提升任务解决率,且无需专门训练。
SkillGate:训练长视距智能体中的策略内技能选择
机构 * Shanghai Jiao Tong University(上海交通大学) ; Xiaohongshu Inc.(小红书科技有限公司)
专题命中 规划决策 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 SkillGate 针对长视距智能体策略内技能选择的选择器信用匮乏问题,通过划分信用通道提升了 9B 策略的试验成功率,减少了误导性候选接触并降低技能读取次数。
Comments 17 pages, 6 figures, 6 tables. Code: this https URL (https://github.com/DeepExperience/SkillGate). Models: this https URL (https://huggingface.co/simonlqy/SkillGate-9B)
爆炸式DecPOMDPs的奇特案例:通过策略计数控制这一“火势”
机构 * University of Münster(明斯特大学)
专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 针对DecPOMDPs策略空间爆炸问题,本文提出策略计数DecPOMDPs及对应的策略计数动态规划方法,实现智能体数量维度的可处理性。
Comments Full version including appendix of a paper accepted at the 17th International Conference on Scalable Uncertainty Management (SUM2026) under the same name
演化不确定性下的风险量化:面向安全序贯决策的信念依赖鲁棒性
机构 * Technical University of Munich(慕尼黑工业大学) ; Masaryk University(马萨里克大学)
专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI
AI总结 本文提出RATTL算法,将智能体谨慎程度与认知不确定性绑定,证明其规划问题适定且满足安全三明治性质,可保障LLM等智能体在不确定性下的运行时安全。
Comments Accepted for presentation at the IJCAI-ECAI 2026 RobustifAI workshop
AI后训练AI缺失了什么?一项实证分析
机构 * Tsinghua University(清华大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Renmin University of China(中国人民大学)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文通过实证分析发现,LLM智能体后训练时存在策略锁定问题,其缺失的是执行过程中自发重新评估训练策略的机制,而非经验、指导或推理计算。
面向分层分布式无人机交通管理的模型预测监督控制
专题命中 规划决策 :agent(abstract);multi-agent(abstract)
AI总结 本研究提出分层模型预测监督控制(MPSC)框架,结合滚动时域最优控制与监督控制理论保障安全等特性,开发城市UTM模型,实现时变需求下取送任务的高效支持。
Comments 6 pages, 7 figures, IFAC conference
rEDMRec:将大语言模型推理提炼为可编辑的体验记忆用于推荐
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL
AI总结 rEDMRec将教师LLM推理提炼为四类可编辑体验记忆,轻量级学生LLM通过检索记忆排序,在多数据集和主干模型上优于零样本、少样本、RAG及GraphRAG,记忆优化可提升推荐性能并降低重复率。
用于无线场建模的物理展开神经算子
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 提出物理展开混合神经算子(PU-HNO),通过三级级联结构逐步捕捉无线传播效应,在不同平面图上的实验中,其在图像质量和无线部署指标上均优于多种基线模型。
Comments 37 pages, 8 figures, 9 tables
FraudBench:针对自适应欺诈的基于政策的银行智能体压力测试
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG
AI总结 研究人员推出基于τ²-bench框架和τ-Knowledge环境的可执行基准FraudBench,测试银行智能体应对自适应欺诈的安全性,评估发现4款智能体攻击安全性为49%-65%,资金骡和第一方欺诈是主要薄弱点。
Comments 9 Pages, 2 figures
从序列到结构:面向大语言模型智能体的关系型不确定性传播
机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本研究针对现有LLM智能体不确定性量化方法忽略长程依赖的问题,提出RUPA框架,通过建模轨迹图的关系依赖传播不确定性,在多个基准上实现更优性能。
EgoCITE:面向长时程自我中心记忆的上下文增强索引与时序感知检索
机构 * University of Michigan(密歇根大学)
专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL
AI总结 本研究针对长时程自我中心记忆系统的索引不可靠、忽略时序意图的问题,提出EgoCITE框架,经多数据集评估,其准确率优于基线且成本显著低于长上下文LLM智能体。
SLAI T-Rex:在升腾超级集群上对DeepSeek-V4系列进行全参数训练后优化
专题命中 规划决策 :workflow(abstract);分类 cs.AI、cs.CL
AI总结 研究针对万亿参数规模MoE模型全参数训练后优化的系统挑战,在升腾NPU超级集群上以DeepSeek-V4为目标工作负载开发分层优化框架,建立CPT和SFT工作流程,提升模型性能,推动复杂推理前沿模型系统发展。
Comments 73 pages, 22 figures, 20 tables
RouteCost:一种受生产启发的多阶段框架,用于电子商务中的预订单运输成本估计
机构 * Northeastern University(东北大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 研究电子商务中预订单运输成本估计问题,提出受生产启发的多阶段框架RouteCost,将其分解为多步骤,通过路线加权期望公式汇总成本估计,在大量订单等数据上提高了预测质量和校准,保留了路线级可解释性。
EgoMemReason:一种基于记忆的推理基准,用于长时间的以自身为中心的视频理解
机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; NTU Singapore(新加坡国立大学)
专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL
AI总结 EgoMemReason通过记忆驱动推理评估一周的自身中心视频理解,包含500个问题和六个核心挑战,揭示长时间记忆仍面临挑战。
Comments Accepted by COLM2026. The first two authors contributed equally. Project website: this https URL (https://egomemreason.github.io/)
符合性策略控制
机构 * Johns Hopkins University(约翰霍普金斯大学) ; New York University(纽约大学)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种基于安全参考策略的符合性校准方法,用于在不违反安全约束的前提下,使优化但未测试的策略能够安全地进行探索,并在有限样本下提供理论保证。
Comments International Conference on Machine Learning (ICML), 2026. v4: Revised CPC theory to (a) show enforced smoothness for likelihood-ratio control parameter and (b) for general control parameter, assume smoothness only of constrained policy $π_t^{(β)}$ w.r.t. $β$ (rather than of $(l_i - α)\cdotπ_t^{(β)}$ or of conformal weights)