A Unified Framework for Zero-Shot Reinforcement Learning
零样本强化学习的统一框架
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 本文提出了一种统一框架,用于零样本强化学习,通过分类体系和误差分解,促进不同方法的比较与理解。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
零样本强化学习的统一框架
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 本文提出了一种统一框架,用于零样本强化学习,通过分类体系和误差分解,促进不同方法的比较与理解。
有限时间MDP中一般状态和动作的策略优化景观
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 本文研究了有限时间MDP中一般状态和动作的策略优化问题,提出PŁK条件以确保策略梯度方法在非凸情况下以非渐近速率收敛,并适用于多种控制和运营模型。
自适应双预约策略用于门诊调度的多目标强化学习
专题命中 规划决策 :agent(abstract);分类 cs.LG
AI总结 本文提出一种基于多目标强化学习的自适应双订策略,通过个性化缺席预测和多策略共进化机制,动态优化门诊调度决策,提升效率并减少患者等待时间。
Comments 26 pages, 10 figures
通过不确定性最小化提升推理时间的推理能力
机构 * Aarhus University(奥胡斯大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 通过在单个思想层面最大化自我确定性,提升推理能力并实现高效推理时间扩展。
基于统计收缩的非高斯随机系统的可能性约束轨迹优化
机构 * Department of Aerospace Engineering, The Grainger College of Engineering, University of Illinois Urbana-Champaign(航空航天工程系、格拉inger工程学院、伊利诺伊大学厄巴纳-香槟分校)
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 本文提出基于统计收缩的非高斯随机系统轨迹优化方法,通过共形推断生成置信集并保证闭环约束满足,适用于安全关键应用。
构建未来的伦理AI框架:从哲学到实践
机构 * Graduate School of Global Studies(全球研究研究生院) ; Tokyo University of Foreign Studies(东京外国语大学) ; AI Product Development Division(人工智能产品开发部门) ; Money Forward, Inc.(Money Forward公司)
专题命中 规划决策 :agentic(abstract);分类 cs.AI
AI总结 本文提出了一种伦理设计控制架构,通过三重闸门机制整合后果论、义务论和美德伦理,为AI生命周期提供可执行的治理方案。
Journal ref AI Ethics 6, 150 (2026)
基于大语言模型的语义选项发现用于促进自适应深度强化学习
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 本文提出基于大语言模型的闭环框架,通过语义驱动技能重用和实时约束监控,提升深度强化学习在数据效率、约束合规性和跨任务迁移能力方面的性能。
Llama-Mob:指令微调Llama-3-8B在城市级移动预测中表现优异
机构 * Southern University of Science and Technology(南方科技大学) ; The University of Tokyo(东京大学)
专题命中 规划决策 :planning(abstract);分类 cs.CL
AI总结 Llama-Mob通过指令微调Llama-3-8B模型,在城市级长期移动预测中表现出色,超越了现有方法,并具备良好的零样本泛化能力。
开放世界长期短期想象强化学习
机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能大模型关键实验室、人工智能研究院、上海交通大学) ; Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波数字孪生研究院、技术东院) ; School of Computer Science and Technology, East China Normal University(计算机科学与技术学院、华东师范大学)
专题命中 规划决策 :agent(abstract);分类 cs.LG
AI总结 本文提出LS-Imagine方法,通过扩展想象 horizon 提高开放世界强化学习中长期收益的探索效率。
Comments Accepted by ICLR 2025 Oral. Project page: https://qiwang067.github.io/ls-imagine
另一边未必更绿:在多个城市中,对绿色的感知存在种族和个性差异
机构 * Future Cities Lab Global, Singapore-ETH Centre(未来城市实验室全球,新加坡-ETH中心) ; Department of Architecture and Civil Engineering, City University of Hong Kong(香港城市大学建筑与土木工程系) ; Digital Geography Lab, Department of Geosciences and Geography, University of Helsinki(赫尔辛基大学地理科学与地理系数字地理实验室) ; Department of Architecture, National University of Singapore(新加坡国立大学建筑系) ; Department of Real Estate, National University of Singapore(新加坡国立大学房地产系)
专题命中 规划决策 :planning(abstract,journal_ref)
AI总结 本研究通过分析多个城市中绿色感知的差异,发现居住地对绿色感知有显著影响,而人口统计数据和个性在感知中作用较小。
Journal ref Landscape and Urban Planning 271 (2026) 105618
Diff-Muscle: 高效学习用于肌骨骼机器人乒乓球
机构 * Department of Computer Science and Technology, Tsinghua University, China(清华大学计算机科学与技术系)
专题命中 规划决策 :planning(abstract)
AI总结 Diff-Muscle通过微分平坦性将高维动作空间转化为低维关节空间,实现高效学习,使肌骨骼机器人在动态乒乓球任务中实现连续回球。
Comments 8 pages, 7 figures
城市蔓延的数学建模
专题命中 规划决策 :planning(abstract)
AI总结 本文提出基于偏微分方程框架的动态模型,用于研究城市扩张的空间动态及其影响因素。
Comments Perspective paper on spatial economics published in the 20th-anniversary special issue of Spatial Economic Analysis
Journal ref Spatial Economic Analysis, 1-21 (2026)
TumorChain: 交错多模态链式推理用于可追溯的临床肿瘤分析
机构 * Zhejiang University(浙江大学) ; DAMO Academy, Alibaba Group(阿里集团达摩院) ; Hupan Lab(虎扑实验室) ; Shanghai Institution of Pancreatic Disease(上海胰腺疾病研究所) ; Shengjing Hospital of China Medical University(中国医科大学盛京医院) ; Sun Yat-sen University Cancer Center(中山大学肿瘤中心)
专题命中 规划决策 :planning(abstract)
AI总结 TumorChain通过多模态交错推理框架提升临床肿瘤分析的可追溯性和准确性。
Comments Accepted at ICLR 2026. 10 pages + appendix
自主直升机轨迹跟踪控制设计:保证误差界限
机构 * Institute of Flight Systems, German Aerospace Center (DLR)(飞行系统研究所,德国航天中心) ; Institute for Production Technology and Systems, Leuphana University of Lueneburg(生产技术与系统研究所,路比哈大学)
专题命中 规划决策 :planning(abstract)
AI总结 本文提出基于RPI集的自主直升机轨迹跟踪控制设计,通过计算保证误差界限并比较不同控制器架构的性能与保守性。
Comments Submitted to the 2026 International Conference on Unmanned Aircraft Systems (ICUAS)
TeamHOI: 学习一种统一的策略以处理任意团队规模的协作人-物体交互
机构 * Garena ; Sea AI Lab ; National University of Singapore(新加坡国立大学)
专题命中 规划决策 :agent(abstract)
AI总结 TeamHOI通过统一策略实现任意团队规模的协作人-物体交互,采用Transformer网络和对抗运动先验策略提升协作行为的物理合理性和多样性。
Comments CVPR 2026. Project page: https://splionar.github.io/TeamHOI/ Code: https://github.com/sail-sg/TeamHOI
PreHO:用于低轨卫星网络的预测切换
专题命中 规划决策 :planning(abstract)
AI总结 PreHO通过预测性切换机制优化低轨卫星网络中的切换过程,降低信令开销和延迟,提升整体效率。
DAISS:面向双臂机器人超声引导干预的相位感知模仿学习
机构 * Chair for Computer Aided Medical Procedures(CAMP), Technical University of Munich(TUM)(计算机辅助医疗程序主席职位(CAMP),慕尼黑技术大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; The University of Hong Kong(HKU)(香港大学)
专题命中 规划决策 :workflow(abstract)
AI总结 DAISS通过相位感知模仿学习实现双臂机器人在超声引导干预中的精准操作,减少认知负担。
Comments 8 pages, 8 figures
Brain-WM: 脑部胶质瘤世界模型
专题命中 规划决策 :planning(abstract)
AI总结 Brain-WM通过统一治疗预测与MRI生成,实现了肿瘤与治疗的共进化动态建模,提升了治疗计划的准确率和MRI生成的质量。
OVerSeeC: 从卫星图像和自然语言生成开放词汇成本图
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; DEVCOM Army Research Laboratory(陆军研究实验室)
专题命中 规划决策 :planning(abstract)
AI总结 OVerSeeC通过模块化基础模型实现从卫星图像和自然语言生成开放词汇成本图,支持任务自适应的全球规划。
Comments Website : https://amrl.cs.utexas.edu/overseec/
FLARE: 从视觉-语言模型中学习未来感知的潜在表示以实现自动驾驶
机构 * Shanghai Jiaotong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; OpenDriveLab at The University of Hong Kong(香港大学OpenDrive实验室) ; Li Auto Inc.(Li汽车公司)
专题命中 规划决策 :planning(abstract)
AI总结 FLARE通过自监督的未来特征预测目标,从大规模未标记数据中学习鲁棒驾驶表示,无需语言监督,提升自动驾驶性能。
FEALPy:一个跨平台智能数值模拟引擎
专题命中 规划决策 :planning(abstract)
AI总结 FEALPy是一个基于统一张量抽象层的跨平台数值模拟引擎,支持多种计算后端,实现不同数值方法与深度学习的无缝集成,适用于线性弹性、高阶PDEs等多种应用。
基于互信息的量子策略梯度流程中时间表达性和可训练性估计度量
专题命中 规划决策 :agent(abstract)
AI总结 本文提出基于互信息的时间表达性度量,用于评估量子策略梯度流程中的表达性和可训练性。
Comments 22 pages, 8 figures
HiconAgent: 历史上下文感知的GUI代理策略优化
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Shenzhen Loop Area Institute(深圳河套学院) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 规划决策 :agent(abstract)
AI总结 HiconAgent通过历史上下文感知策略优化,高效利用历史信息,在GUI导航任务中实现更高的准确率和效率。
径向与非径向解结构为有界设定中的准线性哈密顿-雅可比-贝尔曼方程
专题命中 规划决策 :planning(abstract)
AI总结 本文研究了有界域中准线性HJB方程的径向与非径向解结构,通过构造性证明和概率推导,拓展了随机最优控制与椭圆正则性分析的联系,并在生产计划和图像修复中验证了理论框架的实用性。
Comments 19 pages
基于视觉的目标导向抓取与振动的机器人授粉在受控环境中应用
机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Department of Mechanical & Aerospace Engineering, University of California, Los Angeles(加州大学洛杉矶分校机械与航空航天工程系) ; Department of Computer Science, University of California, Los Angeles(加州大学洛杉矶分校计算机科学系)
专题命中 规划决策 :planning(abstract)
AI总结 本研究提出了一种基于视觉的机器人授粉系统,结合3D重建、抓取规划和振动建模,实现精准授粉并验证其有效性。
Comments YouTube: https://youtu.be/XHLA7pEXhZU; GitHub: https://github.com/StructuresComp/robotic-pollination
TransUNet-GradCAM: 一种融合自注意力机制和可解释可视化的小说Transformer-U-Net用于足部溃疡分割
专题命中 规划决策 :planning(abstract)
AI总结 TransUNet-GradCAM通过融合自注意力机制和可解释可视化,实现足部溃疡分割的高精度与可解释性。
GeoNav: 通过双尺度地理推理赋能大语言模型实现语言目标的空中导航
机构 * College of Systems Engineering, National University of Defense Technology(系统工程学院,国防科技大学) ; State Key Laboratory of Digital Intelligent Modeling and Simulation(数字智能建模与仿真国家重点实验室) ; BNRist, Tsinghua University(清华大学BNRist)
专题命中 规划决策 :agent(abstract)
AI总结 GeoNav通过双尺度地理推理赋能大语言模型,实现语言目标的空中导航,提升城市场景下的导航成功率和精度。
Comments Published in Pattern Recognition (2026)
Journal ref Pattern Recognition, Volume 177, 113365, 2026
基于视觉的MPPI用于敏捷无人机竞速:通过神经签名距离场导航任意门姿态
机构 * College of Control Science and Engineering, Zhejiang University(控制科学与工程学院,浙江大学)
专题命中 规划决策 :planning(abstract)
AI总结 本文提出基于视觉的MPPI框架,利用神经签名距离场实现无需参考的敏捷无人机飞行,有效应对动态变化的赛道和门姿态。
迈向安全人机协作的可扩展概率人类运动预测:基于高斯过程
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 规划决策 :planning(abstract)
AI总结 本文提出了一种基于高斯过程的可扩展模型,用于准确预测人类运动并提供可靠的不确定性估计,适用于人机协作中的安全应用。
Comments Submitted to IROS 2026
ACLM:基于ADMM的分布式模型预测控制用于协作的移动Manipulation
机构 * The Institute for Robotics and Intelligent Machines, Georgia Institute of Technology(机器人与智能机器研究所,佐治亚理工学院)
专题命中 规划决策 :planning(abstract)
AI总结 本文提出基于ADMM的分布式模型预测控制框架,用于四足机器人协作移动Manipulation,通过分解控制问题并结合力感知控制器,实现高效、实时的协作运输重物。