Shapley Meets Tutte
沙普利值与图特多项式相遇
专题命中 规划决策 :agent(abstract);planning(abstract)
AI总结 研究存在预先对齐代理组的合作博弈,通过连通性增强局部值的沙普利值建模局部连接对网络连通性的贡献,并将其与色多项式、图特多项式及Potts模型配分函数相联系,以解决相关网络问题。
Comments 14 pages, 0 figures
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
沙普利值与图特多项式相遇
专题命中 规划决策 :agent(abstract);planning(abstract)
AI总结 研究存在预先对齐代理组的合作博弈,通过连通性增强局部值的沙普利值建模局部连接对网络连通性的贡献,并将其与色多项式、图特多项式及Potts模型配分函数相联系,以解决相关网络问题。
Comments 14 pages, 0 figures
daVinci-kernel:通过强化学习协同进化技能选择、总结与利用的GPU内核优化
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出daVinci-kernel框架,通过强化学习联合训练技能选择、策略生成和技能总结三个智能体,共享LLM骨干,实现GPU内核优化,在KernelBench上超越先前最优模型。
AutoFed: 通过自适应提示实现个性化联邦交通预测
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出AutoFed框架,通过自适应提示学习实现个性化联邦交通预测,解决传统联邦学习在非独立同分布数据下的不足,无需手动调参,提升交通预测性能。
Transformer 如何通过多令牌预测学习规划
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Shanghai Jiao Tong University(上海交通大学) ; University of Pennsylvania(宾夕法尼亚大学) ; RIKEN Center for Advanced Intelligence Project(日本理化学研究院先进智能项目中心) ; The Institute of Statistical Mathematics(统计数学研究所)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 本文研究多令牌预测如何促进推理,特别是规划,通过实验和理论分析展示其优于单令牌预测的性能及背后的机制。
Comments COLM 2026
CRAFT: 通过强化学习进行多跳问答的校准推理与答案忠实轨迹
专题命中 规划决策 :planning(abstract);分类 cs.CL、cs.LG
AI总结 CRAFT通过强化学习框架提升多跳问答的推理准确性和答案忠实度,结合确定性奖励和判官奖励,增强推理轨迹的可审计性与语义一致性。
动作充分的目标表示
机构 * Department of Electrical and Computer Engineering (ECE), Seoul National University(电子与计算机工程系,首尔国立大学) ; Interdisciplinary Program in Artificial Intelligence (IPAI), Seoul National University(人工智能交叉项目,首尔国立大学) ; ASRI / INMC, Seoul National University(ASRI/INMC,首尔国立大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出动作充分性概念,通过信息论框架改进目标表示,使动作学习更有效,实验表明其在离散环境中优于传统方法。
用于弹性运营的双时间尺度分层强化学习
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 研究全球运营中意外冲击下的决策问题,提出双时间尺度分层强化学习框架,通过同步更新长期和短期策略增强弹性,在二手车案例中提高利润并保持稳定,且不改变现有决策结构。
通过物理感知策略蒸馏实现可解释强化学习
专题命中 规划决策 :agent(abstract);分类 cs.LG
AI总结 研究针对安全关键领域中深度强化学习的黑箱问题,利用策略蒸馏框架,以高性能TD3为教师模型,基于浅层决策树生成可解释学生代理,通过特定方法生成数据集,实现性能与教师相当并保持系统稳定性和可解释性。
Comments 6 pages, 7 figures
CADER:用于长视频理解的置信度感知动态证据推理
专题命中 规划决策 :tool use(abstract);分类 cs.AI
AI总结 针对长视频理解中现有系统推理过程不考虑难度的问题,提出CADER框架。它先全局推理估计置信度让高置信度示例提前退出,对不确定示例激活第二阶段工具增强循环定位证据,实验证明其能提升长视频推理能力并提供实用推理路线。
KAP:弥合大语言模型系统中知识选择与运行时消耗的差距
机构 * QiYuanLab(启元实验室)
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 研究大语言模型系统中知识选择与运行时消耗的差距,提出知识访问规划(KAP)范式,通过建立通用中间表示编译知识信号控制KV访问,以GraphSpec实例化,改变长上下文生成扩展轨迹,提升运行时消耗效率。
Comments 3 figures, 5 tables
使用后继表示的约束强化学习
机构 * Technical University of Darmstadt (TU Darmstadt)(达姆施塔特工业大学) ; Hessian Center for Artificial Intelligence (hessian.AI)(黑森州人工智能中心) ; Fraunhofer Institute for Integrated Circuits IIS, Fraunhofer IIS(弗劳恩霍夫集成电路研究所IIS) ; University of Technology Nuremberg (UTN)(纽伦堡工业大学)
专题命中 规划决策 :agent(abstract);分类 cs.LG
AI总结 研究针对现实世界强化学习中策略难适应成本函数变化的问题,提出SafeDSR方法,通过引入可学习权重矩阵扩展深度后继表示到约束强化学习,能快速重训策略,在二维导航环境展示竞争力与灵活性。
Comments published in Transactions for Machine Learning Research 2026
Journal ref Michael Girstl, Alexander Mattick, & Christopher Mutschler (2026). Constrained Reinforcement Learning Using Successor Representations. Transactions on Machine Learning Research
MulRobBench:用于安全且符合安全策略的多模态无人机智能体的决策级基准测试
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 智慧城市中无人机需在复杂条件下决策,MulRobBench作为决策级基准测试,将多模态观测、安全策略等集成,含多任务样本和评分维度,评估结合多种方式,给出模型得分,通过研究找出决策不稳定原因,为无人机多模态决策提供可重复基准。
Comments 22 pages, 18 figures, 17 tables
寥寥数语,成效显著:语言引导的机器人策略合成
机构 * University of Washington(华盛顿大学) ; Microsoft Research(微软研究院) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 规划决策 :agent(abstract);分类 cs.AI
AI总结 研究针对视觉-语言-动作模型难以解释等问题,提出ARCHITECT框架,利用大语言模型编码代理合成模块化机器人程序,通过人类自然语言修正引导策略并积累技能库,在机器人基准评估中表现出色,提供了新的机器人学习方案。
训练语言模型以与推理时控制器协作
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 研究LLM性能依赖推理时控制器的问题,提出CALM框架,将其表述为多任务强化学习,通过模块级分解研究训练策略,评估显示该框架能提升推理时工作流程的泛化能力。
用于稀疏奖励长视野强化学习的分层软演员-评论家算法
机构 * National Engineering School of Tunis, University of Tunis El Manar(突尼斯艾尔玛纳尔大学突尼斯国立工程师学校) ; University of Tripoli(的黎波里大学) ; University of Picardie Jules Verne Amiens(亚眠皮卡第朱尔斯·凡尔纳大学)
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 针对稀疏奖励长视野强化学习挑战,提出两级分层强化学习框架,高级战略规划与低级SAC算法结合并利用熵正则化策略优化,经SAR-2数据集训练评估,HRL-SAC在多方面优于普通SAC,为相关任务提供有前途的解决方案。
Comments 27 pages, 6 figures, 11 Tables
从完整退化轨迹进行剩余使用寿命预测的泛化界和样本复杂度
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 研究数据驱动的剩余使用寿命预测中样本复杂度问题,通过建立泛化界等七个围绕三个主题的结果,给出基本学习率,量化领域知识作用及数据质量影响,提供闭式表达式,跨域验证结果,为相关应用提供实用指南。
Comments This manuscript has been accepted for publication in Measurement Science and Technology. The final Version of Record is available at https://iopscience.iop.org/article/10.1088/1361-6501/ae7109/meta
Journal ref Meas. Sci. Technol. 37(2026) 226203
迈向电子健康记录中文档不一致性的自动检测
机构 * Duke University(杜克大学) ; Columbia University Medical Center(哥伦比亚大学医学中心) ; Vanderbilt University Medical Center(范德堡大学医学中心)
专题命中 规划决策 :planning(abstract);分类 cs.CL
AI总结 研究旨在检测电子健康记录中文档不一致性,采用两阶段LLM管道对3000份出院小结进行分析,发现多种类型不一致及反复出现的失败模式,建立了方法基础和概念框架以指导后续大规模分析。
按需共享:面向视角感知人工智能的联邦披露
机构 * Toronto Metropolitan University(多伦多都会大学) ; Flybits Labs(Flybits实验室) ; MIT Media Lab(麻省理工学院媒体实验室)
专题命中 规划决策 :agent(abstract);分类 cs.AI
AI总结 研究跨域边界最小必要披露问题,提出“来源保留编年史”协议,通过编译持有者编年史为授权证据子图,遵循“按需共享”规则,保持本地主权并分阶段返回数据,实现安全披露上下文。
HiLLTS:用于可持续交通的零样本分层大语言模型引导的交通信号控制
机构 * School of Electronic Engineering, Dublin City University(都柏林城市大学电子工程学院)
专题命中 规划决策 :agent(abstract);分类 cs.AI
AI总结 针对传统交通信号控制策略的问题,提出HiLLTS框架,它采用分层三层架构,由中央协调代理等组成。实验表明其能改善拥堵和环境性能,相比不同基线,在减少等待时间和二氧化碳排放上效果显著,消融研究验证了大语言模型引导协调的作用。
最优奖励塑造:自动驾驶汽车停车案例研究
专题命中 规划决策 :agent(abstract);分类 cs.LG
AI总结 研究非完整约束下无模型强化学习奖励函数设计难题,提出含覆盖门控对齐反馈等的参数化奖励塑造框架,通过联合元优化及基于代理的贝叶斯优化,优化后的深度Q网络代理在停车任务中表现出色。
Comments 12 pages, 8 figures. Includes supplementary video demonstration and open-source code link
关于受控世界模型的可识别性
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 研究受控世界模型的可识别性问题,建立在状态依赖高斯行为策略下的联合可识别性理论,识别出两个条件,证明满足条件时JEPA目标的全局极小值可识别潜在状态和受控转移,推导定量界限并通过实验验证理论。
资本市场大语言模型可靠性评分(CM-LRS):从似是而非到可信赖
专题命中 规划决策 :workflow(abstract);分类 cs.CL
AI总结 研究资本市场大语言模型输出的可信赖问题,提出CM-LRS从七个维度评估工作流程输出,通过五个工作流程对四个模型与四位评判者评分,发现前沿闭源模型聚类近,差距集中在检索合成,决策有用性离散度大且评判者一致性高。
Comments 23 pages. Rubrics, prompts, and demonstration tasks are publicly available
MARS:用于知识图谱问答的多跳自适应检索与SPARQL生成
机构 * Heinz Nixdorf Institute, Paderborn University(海因茨·尼克斯多夫研究所,帕德博恩大学)
专题命中 规划决策 :agentic(abstract);分类 cs.CL
AI总结 研究针对大型语言模型在知识密集型任务中可靠性受限的问题,提出MARS方法,通过结构化检索过程链接问题实体与知识图谱,迭代获取信息并决定检索深度或生成SPARQL查询,在多个基准测试中性能有竞争力且高效可扩展。
Comments EKAW 2026 (accepted-posters-and-demos" target="_blank" rel="noopener">https://ekaw2026.di.unito.it/accepted-posters-and-demos)
通用决策学习器
机构 * Adobe Research(Adobe研究院) ; University of Massachusetts(马萨诸塞大学) ; Amherst(阿默斯特)
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 本文提出通用决策学习器(UDL)的范畴论框架,通过左Kan扩展和右Kan扩展将局部决策行为规范地扩展到全局一致行为,统一了规划、强化学习、因果干预、在线学习和博弈均衡等多种决策形式。
Comments Revised the central construction to use type-correct staged left/right Kan extensions; corrected the semantic quotient theorem; added an explicit discounted-MDP/Bellman derivation; and expanded the non-RL decision examples and limitations. A detailed change log appears in the supplement
变分神经信念参数化用于多模态不确定性下的鲁棒灵巧抓取
机构 * Department of Electrical & Computer Engineering and Institute for Systems Research, University of Maryland, College Park, MD, USA(电气与计算机工程系和系统研究所,马里兰大学,College Park, MD, USA) ; Maryland Applied Graduate Engineering, A. James Clark School of Engineering, University of Maryland, College Park, MD, USA(马里兰应用研究生工程学院,A. James Clark工程学院,马里兰大学,College Park, MD, USA)
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 本文提出变分推理方法,通过可微高斯混合模型表示信念,利用Gumbel-Softmax和位置-尺度重参数化实现平滑采样,提升抓取鲁棒性并减少规划时间。
Comments 11 pages, 10 figures. Accepted for publication at IROS 2026. Code, simulation assets, and dataset at https://github.com/coenwerem/vnb-grasp
经济学中强化学习的综述
机构 * Georgetown University(乔治城大学)
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 本文综述了强化学习在经济学中的应用,探讨了其在高维状态和连续动作问题中的扩展,分析了算法的局限性及经济结构下的灵活性。
一种结合3D点云和RSSI的室内无线电映射数据集
机构 * Jožef Stefan Institute, Department of Communication Systems(乔泽夫·斯塔芬研究所,通信系统系) ; International Postgraduate School Jožef Stefan, Information and Communication Technologies(国际研究生学校乔泽夫·斯塔芬,信息与通信技术) ; Faculty of Engineering, Shibaura Institute of Technology(工学院, Shibaura技术研究所)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 本文提出了一种结合3D点云和RSSI的室内无线电映射数据集,用于支持无线网络规划和优化。
Comments 19 pages, 8 figures, 3 tables
GFLAN:生成功能布局
机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 GFLAN通过两阶段分解生成功能布局,结合拓扑规划与几何实现,提升建筑生成的准确性与合理性。
Comments 21 pages, 15 figures
基于射线长度条件的生成性心脏运动
机构 * Tel Aviv University(特拉维夫大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 本文提出了一种基于条件变分自编码器的方法,通过合成带有密集3D流场标注的心脏CT帧对,生成逼真的心脏运动数据,以减少对人工标注的依赖。
Journal ref In: Artificial Intelligence in Medicine and Surgery: An Exploration of Current Trends, Potential Opportunities, and Evolving Threats, Volume 5, IntechOpen, 2026
基于不确定性增强的地形分类用于空间探索机器人的本体数据
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 本文提出一种基于不确定性量化的神经网络方法,利用本体数据实现可靠的地形分类,以提高空间探索机器人在不可预测环境中的决策可靠性。
Comments 6 pages, 4 figures. LatinX in AI Workshop @ ICML 2023 Camera Ready
Journal ref International Conference on Machine Learning Conference: LatinX in AI (LXAI) Research Workshop 2023