Aligning Flow Map Policies with Optimal Q-Guidance
对齐流映射策略与最优Q引导
机构 * Imperial College London(帝国理工学院伦敦分校) ; Mila
AI总结 本文提出流映射策略,通过学习任意大小的跳跃提升动作生成速度,并引入FMQ和QGBS方法,在12个机器人任务中实现最优性能。
高校专区
对齐流映射策略与最优Q引导
机构 * Imperial College London(帝国理工学院伦敦分校) ; Mila
AI总结 本文提出流映射策略,通过学习任意大小的跳跃提升动作生成速度,并引入FMQ和QGBS方法,在12个机器人任务中实现最优性能。
神经-施瓦茨铺砌:用于大规模几何通用PDE求解的通用方法
机构 * Imperial College London(伦敦帝国理工学院) ; Italian Institute of Artificial Intelligence(意大利人工智能研究所)
AI总结 本文提出NEST框架,通过局部物理求解器与施瓦茨迭代耦合,实现大规模PDE求解的通用性与可扩展性。
从想象的未来到可执行的动作:用于机器人操作的潜在动作混合
机构 * School of Data Science, Fudan University(复旦大学数据科学学院) ; Shanghai Innovation Institute(上海创新研究院) ; Imperial College London(伦敦帝国理工学院) ; University of Surrey(萨里大学)
AI总结 本文提出MoLA,一种面向控制的接口,将想象的未来视频转化为可执行的表示,通过混合预训练的逆动力学模型,提升机器人操作的稳定性和通用性。
Comments ICML 2026
语言模型对谁进行对齐?在高风险竞争需求下测量主导层级
机构 * Thomson Reuters Foundational Research(汤姆森·路透基础研究) ; University of Oxford(牛津大学) ; Imperial College London(帝国理工学院伦敦分校)
AI总结 研究探讨了在高风险专业场景中语言模型如何在用户、机构权威和专业规范之间进行对齐,发现模型在任务执行中常忽视专业规范,且对齐层级在不同领域和模型间不稳定。
基于归因的马尔可夫决策过程解释
机构 * University of Oslo(奥斯陆大学) ; Imperial College London(伦敦帝国理工学院) ; RWTH Aachen University(亚琛工业大学)
AI总结 本文提出基于归因的马尔可夫决策过程解释方法,通过策略合成技术计算状态和执行路径的重要性分数,提升序列决策代理的可解释性。
忠实还是只是合理?评估闭源LLM在医学推理中的忠实性
机构 * Stratified Precision ; Harvard Medical School(哈佛医学院) ; Imperial College London(帝国理工学院伦敦分校) ; National Health Service(国家健康服务系统) ; Ipsen France(Ipsen法国) ; University College London(伦敦大学学院)
AI总结 本文通过系统性黑盒评估,揭示闭源LLM在医学推理中的忠实性问题,发现链式推理步骤未必驱动预测,模型易受外部提示影响,强调忠实性比准确性更重要。
Journal ref Proceedings of Machine Learning Research, Vol. 297, pp. 1562-1591, 2026
GRASP:基于样本划分的引导残差适配器
机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃朗根-纽伦堡弗里德里希-亚历山大大学) ; Imperial College London(伦敦帝国理工学院)
AI总结 GRASP通过样本层面的划分和残差适配器提升长尾场景下的生成质量与多样性,有效解决传统方法在长尾设置中的性能下降问题。
Comments 16 pages, 6 figures, 6 tables
旋转掩码自编码器是通用学习者
机构 * University of Trieste(特里埃斯特大学) ; Abdus Salam International Centre for Theoretical Physics (ICTP)(阿布杜斯·萨拉姆国际理论物理学中心(ICTP)) ; Scuola Internazionale Superiore di Studi Avanzati (SISSA)(国际先进研究高等学院(SISSA)) ; University of Nova Gorica(诺瓦戈里察大学) ; INFN – National Institute for Nuclear Physics(意大利国家核物理研究所(INFN)) ; ICSC - Centro Nazionale di Ricerca in High Performance Computing(高性能计算国家研究中心(ICSC)) ; Imperial College London(伦敦帝国理工学院)
AI总结 RoMAE通过旋转位置嵌入实现多维连续位置学习,无需时间序列特化架构,在多种模态上表现优异,超越专门时间序列架构。
Comments NeurIPS 2025 Final Camera Ready
Journal ref Advances in Neural Information Processing Systems 38, NeurIPS 2025, Pages 133952-133987
基于原则的可解释不确定性监督在医学图像分割中
机构 * School of Data Science, Fudan University(复旦大学数据科学学院) ; Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑启发智能科学研究院) ; National Heart and Lung Institute, Imperial College London(伦敦帝国理工学院国家心脏和肺研究所)
AI总结 本文提出PriUS框架,通过原则指导提升医学图像分割中不确定性的可解释性,实验表明其在保持分割性能的同时提升了不确定性估计的一致性。
Comments 14 pages, 8 figures
通过随机选择实现可关闭代理
机构 * Massachusetts Institute of Technology(麻省理工学院) ; New College of Florida(佛罗里达新学院) ; Imperial College London(伦敦帝国理工学院) ; Brown University(布朗大学) ; Independent(独立)
AI总结 本文提出评估指标用于评估代理的有用性和中立性,通过DReST奖励函数训练代理在网格世界中导航,证明其能有效且中立地完成任务,为高级代理的可关闭性提供初步证据。
Journal ref Technical AI Safety (TAIS) Conference 2025