Partial differential equations versus cellular automata for modelling combat
偏微分方程与元胞自动机在作战建模中的比较
专题命中 规划决策 :autonomous agent(abstract);planning(abstract)
AI总结 本文利用简单偏微分方程复现元胞自动机复杂行为,通过确定性数值近似替代智能体拟人化,解释ISAAC兵棋推演中的空间行为。
Comments 12 pages, 16 figures
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
偏微分方程与元胞自动机在作战建模中的比较
专题命中 规划决策 :autonomous agent(abstract);planning(abstract)
AI总结 本文利用简单偏微分方程复现元胞自动机复杂行为,通过确定性数值近似替代智能体拟人化,解释ISAAC兵棋推演中的空间行为。
Comments 12 pages, 16 figures
利用奖励不确定性在强化学习中诱导多样化行为
机构 * New York University(纽约大学) ; Google DeepMind(谷歌DeepMind)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG
AI总结 针对传统强化学习缺乏多样性的问题,提出将奖励函数替换为奖励分布,通过非线性集合目标自然产生可控的多样化行为,并推导出梯度估计器,实验证明其鲁棒性和理论优势。
Comments Core contributors: Anthony GX-Chen, Ankit Anand, Gheorghe Comanici, André Barreto, Mark Rowland
SkillPyramid:一种用于自我进化智能体的层次化技能整合框架
机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China(认知与决策智能复杂系统重点实验室,自动化研究所,中国科学院,北京,中国) ; School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院,北京,中国) ; Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) ; Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院,北京,中国)
专题命中 规划决策 :AI agent(abstract);分类 cs.AI、cs.CL
AI总结 针对智能体缺乏系统性技能构建、积累和迁移的问题,提出SkillPyramid层次化技能整合框架,通过自进化机制在任务执行中组合、验证和吸收新技能,在三个基准上平均奖励提升38.0%,执行步骤减少27.7%。
监督微调的大语言模型规划器中世界模型恢复的深入探究
机构 * National Laboratory of the Rockies(落基山国家实验室)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 通过可解释性实验,研究监督微调如何影响大语言模型在经典规划任务中恢复世界模型的能力,发现微调使模型线性编码动作有效性和状态谓词,且更广泛的状态空间覆盖有助于更准确的世界模型恢复。
Comments 17 pages. Under review at TMLR
基于模型的强化学习的后验鲁棒性
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG
AI总结 提出一种在推理时利用学习模型和名义策略进行鲁棒策略改进的后验鲁棒化方法,通过对抗性展开的模型预测控制提升鲁棒性,无需额外训练神经网络。
多段注意力:实现高效KV缓存管理以加速大型语言模型服务
机构 * Peking University(北京大学)
专题命中 规划决策 :agent(abstract);分类 cs.CL、cs.LG
AI总结 提出AsymCache,一种计算延迟感知的KV缓存管理系统,通过多段注意力、缓存驱逐策略和自适应分块调度器,在保持无损精度的同时显著降低TTFT和TPOT。
WRIT: 面向多轮用户代理的写密集型轨迹合成
机构 * North Carolina State University(北卡罗来纳州立大学) ; Case Western Reserve University(凯斯西储大学)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL
AI总结 针对多轮用户代理在信息收集和决策中面临的证据负担挑战,提出WRIT方法,通过合成写密集型和读密集型轨迹,训练代理在信息负载下做出基于证据的决策,仅用2K轨迹即可提升性能并减少推理时token使用。
SL-BiLEM: 用于预测和政策评估的结构化可学习行为循环流行病模型
机构 * Faculty of Computing, Harbin Institute of Technology(计算学院,哈尔滨工业大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 提出SL-BiLEM模型,通过物理约束正则化实现鲁棒外推,在政策干预导致的分布偏移下预测准确率提升76%,并支持反事实分析。
Comments ACM SIGKDD 2026
Hedge-Bench:在金融推理相关的困难、现实任务上对智能体进行基准测试
机构 * Trata ; Brigham Young University
专题命中 规划决策 :AI agent(abstract);分类 cs.AI
AI总结 提出Hedge-Bench基准,包含102个基于对冲基金分析师实际工作推理轨迹的任务,用于评估AI智能体在开放金融推理问题上的表现,前沿模型得分低于16%。
Comments Dataset and evaluation harness available at github.com/Trata-Inc/trata-hedge-bench
基于遗传优化的稀疏道路观测城市交通仿真校准
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 提出一种基于遗传算法的框架,利用稀疏道路观测数据校准城市交通仿真,无需详细就业数据,生成与真实测量高度相关的交通流和就业分布。
先抓取后规划与失败归因:一种用于精确且可泛化机器人操作的闭环两阶段框架
机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 提出GTP-FA框架,通过任务导向的两阶段抓取-规划流程和失败归因模型,在抓取和规划模块中分别注入任务先验和风险惩罚以及针对高风险初始状态进行数据收集和微调,显著提升机器人操作任务的成功率。
Comments 32 pages, project page: https://sites.google.com/view/gtp-fa/
先感知后推理:一种用于高效可靠主动移动代理的预推理感知框架
机构 * HyperAI Team, Xiaomi Corporation(HyperAI团队,小米公司) ; Zhongnan University of Economics and Law(中南财经政法大学) ; Jilin University(吉林大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 规划决策 :agent(abstract);分类 cs.AI
AI总结 提出预推理感知框架(PRPF),通过轻量级多模态主动感知器(MPP)进行干预门控和上下文压缩,仅在需要时激活主动代理推理器(PAR),以解决主动移动代理中干预时机与方式决策的目标错位和冗余推理问题。
基于本地部署RAG的课程选择学术咨询系统
专题命中 规划决策 :planning(abstract);分类 cs.CL
AI总结 提出一种本地部署的RAG学术咨询系统,利用大语言模型和结构化课程大纲检索,以隐私保护方式支持课程选择、先修课程理解和个性化学习规划。
Comments to be published in Elsevier's Procedia Computer. Sci. (KES 2026)
多模态机器学习用于乳腺癌复发预测
机构 * Department of Industrial & Systems Engineering, The University of Tennessee, Knoxville, TN 37996, USA(工业与系统工程系,田纳西大学,诺克斯维尔,TN 37996,美国) ; The University of Tennessee Medical Center, Knoxville, TN 37920, USA(田纳西大学医学中心,诺克斯维尔,TN 37920,美国)
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 本研究通过整合结构化与非结构化临床数据(治疗记录、病理报告和临床笔记),结合基于规则的正则表达式提取和优先级冲突解决策略,显著提升了乳腺癌复发预测的准确性。
Comments 33 pages, 10 figures
闭环分子设计中的校准式退让
机构 * Microsoft Discovery & Quantum(微软发现与量子) ; Microsoft Research(微软研究院) ; Department of Chemical and Environmental Engineering, Yale University(耶鲁大学化学与环境工程系) ; CanAm Bioresearch Inc.(CanAm 生物研究公司)
专题命中 规划决策 :agent(abstract);分类 cs.AI
AI总结 提出CLIO智能体,通过持续更新的信念状态图和递归计划-行动循环实现校准式退让,在闭环人机协作中成功设计出性能优于文献基准的AORFB负极电解液。
面向短租动态定价的人机协同上下文赌博机:历史预热与审批门控在线学习的结构等价性
机构 * Oleg Miroshnichenko(奥列格·米罗什尼琴科)
专题命中 规划决策 :agent(abstract);分类 cs.LG
AI总结 针对短租动态定价中反馈稀疏、决策风险高的问题,提出人机协同门控赌博机框架,证明历史定价数据与在线策略预热数据的结构等价性,并设计正则化岭回归预热方法,将冷启动周期从约150轮压缩至约30轮。
基于混合专家模型的动态云工作流截止时间感知调度
机构 * School of Engineering and Computer Science, Victoria University of Wellington(维多利亚大学工程与计算机科学学院)
专题命中 规划决策 :workflow(abstract);分类 cs.AI
AI总结 提出一种基于混合专家模型的深度强化学习调度策略DEFT,通过图自适应门控机制动态路由决策,有效降低执行成本和截止时间违反率。
Comments This paper has been accepted by the Fourteenth International Conference on Learning Representations (ICLR 2026)
Journal ref International Conference on Learning Representations (ICLR 2026)
认知异质性动力学:基于大语言模型模拟的多阶段供应链中行为偏差研究
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 规划决策 :agent(abstract);分类 cs.AI
AI总结 本文通过引入大语言模型模拟多阶段供应链,基于分层推理框架分析认知异质性对智能体交互的影响,发现信息共享可缓解短视和自利行为导致的系统效率低下。
Comments Accepted to the Main Conference of ACL 2026. 18 pages, 8 figures in total (9 pages, 7 figures for the main text)
未知扰动下的功率感知认知雷达多目标跟踪
机构 * Université Paris-Saclay, CNRS, CentraleSupélec, Laboratoire des Signaux et Systèmes(巴黎萨克雷大学、法国国家科学研究中心、中央理工大学、信号与系统实验室) ; SAMOVAR, Télécom SudParis, Institut Polytechnique de Paris(SAMOVAR、 Télécom SudParis、巴黎公立理工学院) ; DR2I-IPSA
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 针对未知扰动下多目标跟踪问题,提出一种基于部分可观测蒙特卡洛规划(POMCP)的认知雷达框架,通过自适应波形设计和功率分配提升低信噪比目标检测概率和跟踪精度。
学习在严格截止日期下进行前瞻性任意有效测试的投注
机构 * Department of Electrical and Computer Engineering, University of Michigan(密歇根大学电气与计算机工程系)
专题命中 规划决策 :agent(abstract);分类 cs.LG
AI总结 本文通过将前瞻性投注建模为有限时域最优控制问题,利用深度强化学习学习通用策略,在严格截止日期下实现有界均值的任意有效测试和置信序列。
Comments To appear in ICML 2026; 29 pages, 22 figures
通过深度强化学习发现自主量子纠错
机构 * Zhiyuan College, Shanghai Jiao Tong University, Shanghai 200240, P.R. China(上海交通大学玉泉学院) ; State Key Laboratory of Photonics and Communications, Institute for Quantum Sensing and Information Processing, Shanghai Jiao Tong University, Shanghai 200240, P.R. China(上海交通大学光子通信国家重点实验室) ; Hefei National Laboratory, Hefei, 230088, P.R. China(合肥国家实验室) ; Shanghai Research Center for Quantum Sciences, Shanghai, 201315, P.R. China(上海量子科学研究中心) ; AI Lab, Lenovo Research, Beijing 100094, P.R. China(联想AI实验室)
专题命中 规划决策 :agent(abstract);分类 cs.LG
AI总结 本文利用课程学习启发的深度强化学习,在近似自主量子纠错框架下发现抵抗单光子和双光子损失的玻色子码,并实现超越盈亏平衡点的最优码字。
Journal ref Phys. Rev. A 112, 062618 (2025)
时间一致折现
专题命中 规划决策 :agent(abstract);分类 cs.AI
AI总结 本文通过引入随年龄变化的折现函数,刻画了时间一致与不一致的折现函数,并证明了即使折现函数时间不一致,智能体仍存在理性策略。
Comments 17 LaTeX pages, 5 figures
Journal ref Proc. 22nd International Conf. on Algorithmic Learning Theory (ALT-2011) pages 383-397
局部控制器的鲁棒组合
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 针对高维连续MDP规划问题,提出非参数化组合局部控制器的方法,并分别应用于随机最短路径和折扣MDP,前者保证高概率到达目标,后者通过鲁棒线性规划处理模型不确定性。
Comments Appears in Proceedings of the Seventeenth Conference on Uncertainty in Artificial Intelligence (UAI2001)
Video-Mirai: 自回归视频扩散模型需要远见
机构 * The University of Tokyo(东京大学) ; National Institute of Informatics(信息处理研究所) ; Peking University(北京大学)
专题命中 规划决策 :planning(abstract)
AI总结 提出Video-Mirai训练方法,通过冻结的远见编码器从完整生成序列中提取未来信息并蒸馏到因果状态,在不改变推理过程的情况下弥合表示层面的规划差距,提升长视频生成的一致性。
DyaPlex: 用于二元交互的全双工语音-运动模型
机构 * NVIDIA ; HKUST(香港科技大学)
专题命中 规划决策 :agent(abstract)
AI总结 提出DyaPlex,一种流式全双工语音-运动模型,通过双塔Transformer架构和统一二元令牌交织机制,实现同步多模态交互,在单体和二元交互基准上达到最优性能。
Comments Project page: https://research.nvidia.com/labs/amri/projects/DyaPlex
集成技术经济框架下的最优微电网设计:澳大利亚案例研究
专题命中 规划决策 :planning(abstract)
AI总结 提出一种集成技术经济框架,通过时间序列仿真、调度运行和全生命周期成本评估,优化包含光伏、风电、电池、柴油、电网和可选氢能子系统的微电网设计,并在澳大利亚昆士兰州的1000户社区进行案例研究,通过系统敏感性分析揭示最优设计的关键驱动因素。
互联线路流量的代理建模:机器学习替代全规模电力系统仿真及其在跨境电力交换中的应用
专题命中 规划决策 :planning(abstract)
AI总结 提出机器学习代理框架,将节点时序数据映射为合成互联线路流量序列,并引入自定义损失函数惩罚不可行流量模式,在保持决策相关精度的同时实现约500倍计算加速。
VirtualMLE: 一种优化序列推荐器的虚拟机器学习工程师
专题命中 规划决策 :agent(abstract)
AI总结 提出VirtualMLE,一种利用LLM认知能力将推荐器优化组织为执行、反思和记忆更新闭环的框架,在SASRec和HSTU上以更少试验达到竞争性推荐质量,并展示了跨数据集迁移调优启发式的潜力。
无磁铁质子治疗与四维笔形束递送优化
专题命中 规划决策 :planning(abstract)
AI总结 提出一种四维笔形束递送策略,通过将呼吸运动纳入动态治疗计划,在无磁铁和无机架配置下实现移动肿瘤的质子治疗,并评估其剂量适形性和治疗效率。
利用大规模GPS数据揭示电动汽车驾驶员在充电会话之外的活动模式
专题命中 规划决策 :planning(abstract)
AI总结 本文提出一个可扩展框架,通过大规模GPS数据推断电动汽车所有权和充电行为,揭示驾驶员在充电期间对周边设施的访问模式及经济溢出效应。