Hybrid Reinforcement Learning and Search for Flight Trajectory Planning
混合强化学习与搜索的飞行轨迹规划
专题命中 工具调用 :planning(title,abstract);agent(abstract);分类 cs.AI
AI总结 本文提出一种混合强化学习与搜索的方法,用于快速优化民航飞行路径,通过预计算近优路径减少求解空间,提升计算效率并保持燃油消耗相近。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
混合强化学习与搜索的飞行轨迹规划
专题命中 工具调用 :planning(title,abstract);agent(abstract);分类 cs.AI
AI总结 本文提出一种混合强化学习与搜索的方法,用于快速优化民航飞行路径,通过预计算近优路径减少求解空间,提升计算效率并保持燃油消耗相近。
风车覆盖最优密度边界的计算机辅助证明
专题命中 工具调用 :agent(abstract)
AI总结 本文通过结合已有技术与新数学见解,经计算机辅助搜索验证,确定风车覆盖调度的最优密度边界α*=1.264…,解决了相关开放问题,且该结果被独立证实。
Comments A conference version will appear in ESA 2026
用于复杂序列决策任务的混合大语言模型增强强化学习智能体
专题命中 规划决策 :agent(abstract);autonomous agent(abstract);tool-use(abstract);planning(abstract)
AI总结 本文提出混合LLM增强RL智能体,融合LLM规划与RL动作优化,经实验验证其在序列决策任务上优于仅RL、仅LLM的基线方法,为构建更强自主系统提供了新方向。
Comments This submission is withdrawn because the uploaded manuscript does not accurately reflect the intended structure or results. Several components referenced in the text are incomplete or not represented in the PDF, and the current version may mislead readers. The work is therefore withdrawn to maintain clarity of the record
LiteOdyssey: 一种用于可解释罕见病诊断的轻量级推理AI智能体
机构 * Vanderbilt University(范德堡大学) ; Vanderbilt University Medical Center(范德堡大学医学中心) ; University of South Florida(南佛罗里达大学)
专题命中 规划决策 :agentic(title,abstract);分类 cs.AI
AI总结 提出轻量级框架LiteOdyssey,通过人类-AI协作的诊断策略和公共生物医学工具增强单个推理语言模型,在罕见病诊断基准上达到最先进性能,无需微调或多智能体集成。
Comments Updated abalation experiments and layout
面向长上下文自动驾驶的规划对齐令牌压缩
机构 * NVIDIA Research(NVIDIA研究) ; School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)
专题命中 规划决策 :planning(title,abstract);分类 cs.AI
AI总结 提出COMPACT-VA框架,基于条件VQ-VAE将长上下文压缩为有界表示,通过规划对齐实现决策关键信息保留,在动态场景中成功率提升超6%,速度提升3.3倍。
Comments Accepted by IEEE Robotics and Automation Letters (RA-L) 2026. 8 pages
使用信号时序逻辑的字典序最小违规运动规划
机构 * School of Computation, Information and Technology, Technical University of Munich(慕尼黑技术大学计算信息与技术学院) ; ZF Friedrichshafen AG(弗赖堡汽车集团) ; Institute of System Dynamics, HTWG Konstanz(康斯坦茨HTWG系统动力学研究所)
专题命中 规划决策 :planning(title,abstract)
AI总结 提出一种将字典序多目标优化转化为单目标标量优化的方法,通过非均匀量化和位移扩展MPPI求解器,并引入结合时空违规的谓词鲁棒性度量,实现可解释且可扩展的字典序STL最小违规运动规划。
Comments Accepted for publication in the IEEE Open Journal of Intelligent Transportation Systems (OJ-ITS)
WESPR:风适应的节能安全感知与规划用于四旋翼机稳健飞行
机构 * University of Maryland, College Park(马里兰大学学院公园分校)
专题命中 规划决策 :planning(title,abstract)
AI总结 WESPR通过预测环境几何对局部风的影响,实现四旋翼无人机的风适应性路径规划与控制优化,显著提升飞行稳定性与路径精度。
Comments 8 pages, 9 Figures. Accepted to IROS 2026
神经符号具身智能体
机构 * Imperial College London(帝国理工学院) ; Johns Hopkins University(约翰斯·霍普金斯大学) ; City, University of London(伦敦城市大学)
专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL
AI总结 该研究提出一种神经符号具身智能体,将长周期家庭任务分解为视觉探索与符号规划,在VirtualHome、ALFWorld基准测试中表现优异,约束与搜索结合可大幅提升任务解决率,且无需专门训练。
爆炸式DecPOMDPs的奇特案例:通过策略计数控制这一“火势”
机构 * University of Münster(明斯特大学)
专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 针对DecPOMDPs策略空间爆炸问题,本文提出策略计数DecPOMDPs及对应的策略计数动态规划方法,实现智能体数量维度的可处理性。
Comments Full version including appendix of a paper accepted at the 17th International Conference on Scalable Uncertainty Management (SUM2026) under the same name
从序列到结构:面向大语言模型智能体的关系型不确定性传播
机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本研究针对现有LLM智能体不确定性量化方法忽略长程依赖的问题,提出RUPA框架,通过建模轨迹图的关系依赖传播不确定性,在多个基准上实现更优性能。
EgoCITE:面向长时程自我中心记忆的上下文增强索引与时序感知检索
机构 * University of Michigan(密歇根大学)
专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL
AI总结 本研究针对长时程自我中心记忆系统的索引不可靠、忽略时序意图的问题,提出EgoCITE框架,经多数据集评估,其准确率优于基线且成本显著低于长上下文LLM智能体。
SLAI T-Rex:在升腾超级集群上对DeepSeek-V4系列进行全参数训练后优化
专题命中 规划决策 :workflow(abstract);分类 cs.AI、cs.CL
AI总结 研究针对万亿参数规模MoE模型全参数训练后优化的系统挑战,在升腾NPU超级集群上以DeepSeek-V4为目标工作负载开发分层优化框架,建立CPT和SFT工作流程,提升模型性能,推动复杂推理前沿模型系统发展。
Comments 73 pages, 22 figures, 20 tables
RouteCost:一种受生产启发的多阶段框架,用于电子商务中的预订单运输成本估计
机构 * Northeastern University(东北大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 研究电子商务中预订单运输成本估计问题,提出受生产启发的多阶段框架RouteCost,将其分解为多步骤,通过路线加权期望公式汇总成本估计,在大量订单等数据上提高了预测质量和校准,保留了路线级可解释性。
EgoMemReason:一种基于记忆的推理基准,用于长时间的以自身为中心的视频理解
机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; NTU Singapore(新加坡国立大学)
专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL
AI总结 EgoMemReason通过记忆驱动推理评估一周的自身中心视频理解,包含500个问题和六个核心挑战,揭示长时间记忆仍面临挑战。
Comments Accepted by COLM2026. The first two authors contributed equally. Project website: this https URL (https://egomemreason.github.io/)
符合性策略控制
机构 * Johns Hopkins University(约翰霍普金斯大学) ; New York University(纽约大学)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种基于安全参考策略的符合性校准方法,用于在不违反安全约束的前提下,使优化但未测试的策略能够安全地进行探索,并在有限样本下提供理论保证。
Comments International Conference on Machine Learning (ICML), 2026. v4: Revised CPC theory to (a) show enforced smoothness for likelihood-ratio control parameter and (b) for general control parameter, assume smoothness only of constrained policy $π_t^{(β)}$ w.r.t. $β$ (rather than of $(l_i - α)\cdotπ_t^{(β)}$ or of conformal weights)
当状态成为攻击面:大语言模型驱动的具身智能体中的状态语义注入
机构 * Wuhan University(武汉大学) ; University at Buffalo(布法罗大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 该文聚焦LLM驱动的具身智能体,梳理其技术演进与现有模型,指出其需结合多类信息完成任务落地后执行,为后续状态语义注入攻击研究奠定基础。
Comments submitted to USENIX Security 2027
AMPLIFAI:用于基准测试LI-RADS肝脏病变评估临床推理的多期CT数据集
机构 * University of Maryland, College Park(马里兰大学帕克分校) ; University of Maryland School of Medicine(马里兰大学医学院) ; University of Maryland Institute for Health Computing(马里兰大学健康计算研究所) ; University of Maryland Medical System(马里兰大学医学系统)
专题命中 规划决策 :workflow(abstract);分类 cs.LG
AI总结 研究针对LI-RADS肝脏病变评估AI模型缺乏公开高质量数据集的问题,推出首个公开多期腹部CT扫描的AMPLIFAI数据集,标注LI-RADS类别并分割关键特征,助力相关透明可复现研究。
Comments 15 pages, 6 figures, 3 tables
RL-MACRO:一种用于多模态自适应机器人开颅手术的控制论闭环智能框架
机构 * Dalian University of Technology(大连理工大学) ; Second Hospital of Dalian Medical University(大连医科大学附属第二医院) ; The University of Tokyo(东京大学)
专题命中 规划决策 :planning(abstract)
AI总结 研究针对自主机器人开颅手术面临的挑战,提出RL-MACRO框架,通过多模态感知、自适应决策和机器人执行实现闭环控制,利用CNN-LSTM观测器重建温度,经IQL策略和双头执行器优化行为,实验验证了该框架在骨切割方面的有效性。
作物产量评估的代理影响建模
专题命中 规划决策 :planning(abstract)
AI总结 本文提出SECSF框架,利用每日温度和降水数据高效模拟作物生长,减少计算成本,支持区域作物压力分析及早期预警。
基于问卷的 Clearance 约束下的个性化自动驾驶最优控制
机构 * Department of Mechanical Engineering, Seoul National University(机械工程系,首尔国立大学) ; Department of Aerospace Engineering, Seoul National University(航空航天工程系,首尔国立大学)
专题命中 规划决策 :planning(abstract)
AI总结 本文提出基于用户问卷的个性化自动驾驶规划框架,通过将用户偏好作为约束条件,改进自动驾驶中的安全距离控制。
ORV:基于占用的4D机器人视频生成
机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; IIIS, Tsinghua University(清华大学人工智能研究院) ; Shanghai Jiao Tong University(上海交通大学) ; Eastern Institute of Technology, Ningbo(宁波工程技术院) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; S-Lab, Nanyang Technological University(南洋理工大学S实验室) ; ByteDance(字节跳动) ; Kling, Kuaishou Technology(Kling,快手科技) ; GigaAI ; AIR, Tsinghua University(清华大学人工智能研究院)
专题命中 规划决策 :planning(abstract)
AI总结 ORV提出一种基于占用的4D机器人视频生成框架,通过结合动作先验与占用视觉先验,提升视频生成质量与可控性,实现多视角一致合成和仿真到现实的迁移。
Comments CVPR 2026. Project page: this https URL (https://orangesodahub.github.io/ORV/) Code: this https URL (https://github.com/OrangeSodahub/ORV)
经 Cine MRI 验证的双心室电机械数字孪生框架用于预测区域心内膜运动
专题命中 规划决策 :planning(abstract)
AI总结 该研究提出经 Cine MRI 验证的双心室电机械数字孪生框架,整合多类心脏生理机制,可预测区域心内膜运动,为心内植入物植入部位选择及患者特异性规划提供支持。
保守型冒险者具有更高的未来学术影响力
专题命中 规划决策 :planning(abstract)
AI总结 该研究通过分析31780857篇论文的数据集,发现“保守型冒险者”在相近领域内频繁转换主题,其未来引用量比其他群体最高高出19%,为科学职业规划提供了新见解。
Comments v4: remove the unnecessary coloring. v3: As close as possible to the published version with Scientometrics, with the supplement appended. 31 pages of main text and 86 pages of supplement. Corresponding authors: Fengnan Gao and Haipeng Zhang
ReasFlow:通过基于知识的多智能体系统助力应用数学中以推理为中心的科学发现
专题命中 多智能体 :agent(title,abstract);multi-agent(title);AI agent(abstract);autonomous agent(abstract)
AI总结 针对理论驱动科学发现探索不足的问题,ReasFlow引入以推理为中心的自主智能体系统,通过内部验证循环和知识检索机制减少专家干预,能统一多项科研任务,从最少提示生成高质量论文,在开源基线中表现出色。
从多智能体到单智能体:技能蒸馏何时有益?
机构 * The Chinese University of Hong Kong(香港中文大学) ; LIGHTSPEED
专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);workflow(abstract);分类 cs.AI
AI总结 研究探讨了技能蒸馏在多智能体系统到单智能体系统转换中的有效性,提出通过评估指标的拓扑刚性预测技能效用,并引入AdaSkill框架实现自适应蒸馏。
Comments 35 pages, 15 figures, 17 tables
智能体调控蒸馏:自主多智能体系统中的推理时调控提取与利用
专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract)
AI总结 本文提出AHD框架,将AMAS推理时调控提取形式化为新安全问题,实验证实其可提取调控致IP泄露,还提出对应欺骗防御,揭示AMAS新安全威胁。
多智能体具身自动驾驶:从V2X信息交换到共享世界模型
机构 * Lingnan University, Hong Kong(岭南大学(香港))
专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);planning(abstract)
AI总结 本文综述了从单车智能向多智能体具身系统转变的自动驾驶技术,通过共享世界模型实现感知共享、意图推断和协同规划,并指出了在仿真评估、实时安全保证等方面的研究空白。
Co-RL:多智能体强化学习中多样群体涌现的无监督推理
机构 * University of Exeter(埃克塞特大学) ; ByteDance(字节跳动) ; Johns Hopkins University(约翰斯·霍普金斯大学) ; UC San Diego(加州大学圣迭戈分校)
专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG
AI总结 本研究提出Co-RL框架,通过参数不共享的多智能体协作训练,利用同伴奖励减少对真实标注的依赖,提升纯文本及多模态任务的推理性能,缓解训练崩溃与响应同质化问题。
Comments 30 pages, 5 figures, 11 tables
MITRE-SAGE:一种多智能体网络安全问答模型
专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG
AI总结 针对网络安全领域LLM的不足,研究提出多智能体框架MITRE-SAGE,结合MITRE-QA基准验证其在多项网络安全问答任务中优于基线方法,轻量级配置表现突出。
多智能体大语言模型中的集体幻觉:建模与防御
专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract)
AI总结 提出一种系统级模型描述多智能体LLM中幻觉的传播与放大,并设计交互感知控制方法,通过置信加权聚合、自适应影响调节、外部验证和隔离不可靠智能体来抑制错误传播,在TruthfulQA和TriviaQA上使幻觉降低39%,事实准确率提升至0.87。