Unveiling the Visual Counting Bottleneck in Vision-Language Models
揭示视觉语言模型中的视觉计数瓶颈
机构 * Department of Computer Science, ETH Zürich(苏黎世联邦理工学院计算机科学系)
AI总结 通过分解视觉计数为三个认知阶段,发现视觉语言模型在符号映射阶段失败,提出断裂数量假说:模型学习到分离的模态特定统计流形,无法实现跨模态对齐。
Comments ICML 2026
高校专区
揭示视觉语言模型中的视觉计数瓶颈
机构 * Department of Computer Science, ETH Zürich(苏黎世联邦理工学院计算机科学系)
AI总结 通过分解视觉计数为三个认知阶段,发现视觉语言模型在符号映射阶段失败,提出断裂数量假说:模型学习到分离的模态特定统计流形,无法实现跨模态对齐。
Comments ICML 2026
EgoExoMem: 跨视角记忆推理 over 同步的自身视角和外部视角视频
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; ETH Zurich(苏黎世联邦理工学院) ; University of Oxford(牛津大学) ; Hunan University(湖南大学)
AI总结 本文提出EgoExoMem,首个跨视角记忆推理基准,通过同步自身视角和外部视角视频进行跨视角记忆推理,利用E$^2$-Select方法实现高效的帧选择,实验表明自身和外部视角提供互补的记忆线索,但现有模型在基准测试中表现有限。
Comments The source code and dataset can be found at https://github.com/RuipingL/EgoExoMem
MegaFlow:零样本大位移光流
机构 * ETH Zurich(苏黎世联邦理工学院) ; Microsoft(微软) ; University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心)
AI总结 MegaFlow通过预训练视觉先验解决大位移零样本光流问题,利用全局Vision Transformer实现全局匹配,结合轻量迭代优化提升精度,实验显示其在多个光流基准和长距离点跟踪任务中表现优异。
Comments [ECCV 2026] Project Page: https://kristen-z.github.io/projects/megaflow Code: https://github.com/cvg/megaflow
如果呢?基于世界模型的仿真模拟用于情境推理
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; Hunan University(湖南大学) ; ETH Zürich(苏黎世联邦理工学院) ; INSAIT, Sofia University ``St. Kliment Ohridski''(INSAIT,索菲亚大学『圣克莱门特·奥赫里迪斯』) ; RAI Institute(RAI研究所)
AI总结 提出WanderDream数据集,利用世界模型进行心理探索的仿真模拟,使代理无需主动探索即可回答空间假设问题,实验证明心理探索对情境推理至关重要。
Comments Accepted at ECCV 2026. The data and code are available at: https://github.com/RuipingL/WanderDream
GrandTour: 一种用于多模态感知与状态估计的野外腿式机器人数据集
机构 * ETH Zurich(苏黎世联邦理工学院) ; Stanford University(斯坦福大学) ; UC Berkeley(伯克利大学) ; Oxford University(牛津大学)
AI总结 GrandTour数据集为多模态感知与状态估计提供了大规模野外腿式机器人数据,支持SLAM和高精度状态估计的研究与开发。
Comments Turcan Tuna, and Jonas Frey contributed equally. Submitted to Sage The International Journal of Robotics Research
ROAD-Waymo:一个用于自动驾驶的大规模动作感知数据集
机构 * Oxford Brookes University(奥克斯福德布鲁克斯大学) ; MAZUST ; University of Oxford(牛津大学) ; Imperial College London(伦敦帝国学院) ; ETH Zurich(苏黎世联邦理工学院)
AI总结 本文提出ROAD-Waymo数据集,用于道路场景中代理、动作等检测技术开发与基准测试,比现有数据集更大更具挑战性,含大量标注数据,通过新注释管道增强完整性,还能解决不同国家道路场景的域适应问题。