Provable Ordering and Continuity in Vision-Language Pretraining for Generalizable Embodied Agents
可证明的视觉-语言排序与连续性在通用化具身体验代理中的预训练
机构 * The University of Queensland(昆士兰大学) ; Tongji University(同济大学) ; University of Technology Sydney(悉尼科技大学)
AI总结 本文提出AcTOL方法,通过对比帧间语义差异和局部布朗桥约束,实现有序且连续的视觉-语言表示,提升具身体验代理在不同指令风格下的鲁棒性。
Comments NeurIPS 2025 Poster