Grounded World Model for Semantically Generalizable Planning
基于语义泛化的世界模型用于规划
机构 * Independent(独立) ; EPFL(瑞士联邦理工学院洛桑) ; Beihang University(北京航空航天大学) ; University of Toronto(多伦多大学) ; NUS(新加坡国立大学)
AI总结 本文提出基于视觉-语言对齐潜在空间的世界模型,用于改进视觉-运动模型控制,实现更广泛的语义泛化能力。
高校专区
基于语义泛化的世界模型用于规划
机构 * Independent(独立) ; EPFL(瑞士联邦理工学院洛桑) ; Beihang University(北京航空航天大学) ; University of Toronto(多伦多大学) ; NUS(新加坡国立大学)
AI总结 本文提出基于视觉-语言对齐潜在空间的世界模型,用于改进视觉-运动模型控制,实现更广泛的语义泛化能力。
利用和校准通过互信息自我评估的 hindsight 过程奖励
机构 * Beijing Institute of Technology(北京理工大学) ; Beihang University(北京航空航天大学)
AI总结 本文提出MISE方法,通过生成自我评估提供密集奖励信号并校准环境反馈,使基于大语言模型的智能体能自主学习,理论证明其等价于结合互信息与KL散度的优化目标,实验表明其在无监督条件下优于基线方法。
Comments preprint
在线推理视频目标分割
机构 * Faculty of Computer Science and Artificial Intelligence, Shenzhen University of Advanced(深圳大学计算机科学与人工智能学院) ; School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) ; School of Electrical and Information Engineering, Northeast Petroleum University(东北石油大学电气与信息工程学院)
AI总结 本文研究了在线推理视频目标分割,提出ORVOS框架和ORVOSB基准,通过持续更新分割提示和结构化时间令牌水库,在有限计算下实现长时序推理,解决严格因果性和指称转移问题。
FlashMem: 通过计算复用提炼内在潜在记忆
机构 * School of ASEE, Beihang University(北京航空航天大学ASEE学院) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; School of BME, Beijing Advanced Innovation Center for BME, Beihang University(北京航空航天大学生物医学工程学院/北京生物医学工程高精尖创新中心) ; CAIR and CECS, VinUniversity(VinUniversity计算与人工智能研究中心/计算机工程与计算机科学系)
AI总结 FlashMem通过计算复用直接从临时推理状态提炼内在记忆,消除冗余重参数化,提升推理效率和持久认知能力。
MetroGS: 高精度大规模场景高效稳定重建
机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Beihang University(北京航空航天大学)
AI总结 本文提出MetroGS框架,通过分布式2D高斯点扩散表示和结构密集增强方案,结合单目与多视图优化策略,实现复杂城市环境中的高效高精度场景重建。
Comments Accepted by CVPR26; Project page: https://m3phist0.github.io/MetroGS
AmodalSVG:基于语义层剥离的模态图像向量化
机构 * School of Software, Beihang University(北京航空航天大学软件学院) ; Igarashi Lab, The University of Tokyo(东京大学五十岚实验室) ; Bambu Lab ; Department of Computer Science, The University of Hong Kong(香港大学计算机科学系)
AI总结 AmodalSVG通过语义层剥离技术,实现对自然图像中遮挡区域的完整几何向量化,提升SVG的结构编辑能力。
Mem$^2$Evolve:通过共进化能力扩展与经验蒸馏实现自进化智能体
机构 * Beihang University(北京航空航天大学) ; Beijing Institute of Technology(北京理工大学) ; Independent Researcher(独立研究者) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; University of Edinburgh(爱丁堡大学)
AI总结 本文提出Mem$^2$Evolve框架,通过共进化能力扩展与经验蒸馏实现自进化智能体,实验显示其在多个任务和基准上的性能显著优于传统方法。
Comments Accepted by ACL 2026 Main
STDDN:一种基于物理的深度学习框架用于人群模拟
机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) ; School of Software, Beihang University(北京航空航天大学软件学院) ; Beijing Digital Native Digital City Research Center(北京数字原生数字城市研究中心)
AI总结 本文提出STDDN框架,通过引入流体动力学的连续方程,结合神经普通微分方程和动态图学习模块,改进人群模拟的物理约束与效率,实现更稳定和高效的模拟性能。
Journal ref International Conference on Learning Representations (ICLR), 2026
GoT-R1:通过强化学习提升MLLM的视觉生成推理能力
机构 * HKU MMLAB(香港大学多媒体实验室) ; CUHK MMLAB(香港中文大学多媒体实验室) ; Sensetime(商汤科技) ; Beihang University(北京航空航天大学) ; SUAT(上海人工智能实验室)
AI总结 GoT-R1通过强化学习提升视觉生成中的语义-空间推理能力,改进了复杂提示下的图像生成效果,实验表明在T2I-CompBench基准上表现优异。
Comments Github page refer to: https://github.com/gogoduan/GoT-R1. Published as a conference paper at ICLR 2026