Video Generation Models are General-Purpose Vision Learners
视频生成模型是通用视觉学习者
机构 * Google DeepMind(谷歌DeepMind)
AI总结 研究探讨计算机视觉中实现通用模型的催化剂,提出大规模文本到视频生成是预训练范式。介绍GenCeption模型,利用视频生成扩散主干定义感知模型。实验表明该模型在多任务中性能领先,有数据效率优势且具涌现行为,为通用视觉智能提供基础路径。
Comments ECCV 2026
期刊&会议
European Conference on Computer Vision · 会议 · Computer Vision
视频生成模型是通用视觉学习者
机构 * Google DeepMind(谷歌DeepMind)
AI总结 研究探讨计算机视觉中实现通用模型的催化剂,提出大规模文本到视频生成是预训练范式。介绍GenCeption模型,利用视频生成扩散主干定义感知模型。实验表明该模型在多任务中性能领先,有数据效率优势且具涌现行为,为通用视觉智能提供基础路径。
Comments ECCV 2026
Wat3R:无需标注的水下3D几何学习
机构 * Huazhong University of Science and Technology(华中科技大学)
AI总结 针对水下3D几何估计难题,提出跨域半监督学习框架Wat3R,基于师生架构,无需标注水下数据,利用未标注视频学习,设计跨视图一致性损失,构建Water3D数据集,实验证明其在水下多视图深度估计和点云重建上性能优于现有方法。
Comments Accepted to ECCV 2026. The dataset and code are available at https://github.com/LSXI7/Wat3R
ZipDepth:在任何设备上随时随地实现轻量级零样本单目深度估计
机构 * University of Bologna(博洛尼亚大学)
AI总结 研究单目深度估计难题,提出ZipDepth轻量级网络,结合可重新参数化编码器-解码器与知识蒸馏,在多域训练集训练,参数仅610万,能在多设备实时运行,在五个基准测试中平衡零样本精度与部署效率,向高精度基础模型迈进。
Comments ECCV 2026. Code: https://github.com/fabiotosi92/ZipDepth - Project page: https://zipdepth.github.io/
SAM-MT:实时交互式多目标视频分割
机构 * Fudan University(复旦大学) ; Shanghai University of Finance and Economics(上海财经大学)
AI总结 研究针对多目标视频分割中帧率随目标数增加而降低的问题,基于SAM2提出SAM-MT。通过显式查询、解耦掩码注意力等方法,实现延迟与目标数解耦,保持分割性能,达到与单目标基线相当的实时速度。
Comments ECCV 2026, Project Page: https://henghuiding.com/SAM-MT/
Whareformer:学习在长时间的第一人称视角视频中追踪物体位置
机构 * University of Bristol(布里斯托大学) ; NAVER LABS Europe(NAVER欧洲实验室)
AI总结 针对第一人称视角视频的OSNOM任务,提出基于Transformer的Whareformer模型,通过可更新内存和轨迹分配模块联合推理物体外观与位置,在小数据集训练后在多数据集长测试视频上达SOTA,性能显著优于先前工作。
Comments Accepted at ECCV 2026. Project Webpage: https://jacobchalk.github.io/Whareformer/
HoloTetSphere:用于物理模拟的统一四面体网格重建
机构 * National University of Defense Technology, Changsha, China(国防科技大学,中国长沙) ; Institute of AI for Industries, Chinese Academy of Sciences, Nanjing, China(产业人工智能研究所,中国科学院,中国南京)
AI总结 研究针对物理模拟的3D重建问题,提出通过耦合高斯球与四面体元素、联合最小化网格平滑能量和多视图高斯渲染误差等方法,构建统一且拓扑连贯的四面体网格,优于现有技术,简化物理模拟。
Comments Accepted to ECCV 2026
作为潜在漂移的进展:缓慢演变病理的生成预测
机构 * Zhejiang University(浙江大学) ; The Hong Kong Polytechnic University(香港理工大学) ; IROOTECH TECHNOLOGY(IROOTECH技术) ; Wolf 1069 b Lab, Sany Group(Wolf 1069 b实验室,三一集团)
AI总结 研究针对缓慢演变神经退行性疾病未来解剖结构预测难题,提出潜在漂移的渐进生成框架,在压缩语义表示中学习变化,结合有限标量量化抑制干扰波动,实验表明该方法在神经预测上优于基线。
Comments Accepted to ECCV 2026
指标还是幻影?结肠镜息肉分割基准中评估不一致性的审查
机构 * Lunit, South Korea RPTU Kaiserslautern, Germany Aalborg University \& Pioneer Center, Denmark
AI总结 研究针对结肠镜息肉分割基准评估不一致性问题,审查27篇论文发现存在省略豪斯多夫距离、训练/测试分割协议不兼容、无统计显著性检验等问题,通过重新评估模型揭示问题严重性,进而提出息肉分割报告清单进行纠正。
Comments Submitted to ECCV Workshops
TMI:文本到图像与图像到图像结合用于互补数据合成以促进长尾实例分割
机构 * LG Electronics(LG电子)
AI总结 研究针对大词汇量实例分割受长尾分布和类间模糊性限制的问题,提出结合文本到图像生成与上下文感知图像到图像编辑的混合管道,引入VRAIN编辑器,在LVIS基准测试中超越基线,有效提升分割性能。
Comments Accepted to ECCV 2026. The first two authors contributed equally to this work
深入探究低秩视觉-语言对齐中的隐式偏差
机构 * Shenzhen University of Advanced Technology(深圳先进技术研究院) ; National University of Singapore(新加坡国立大学) ; Mininglamp(明略科技)
AI总结 挑战视觉-语言对齐需全参数更新的观点,研究低秩适应在此阶段的应用,发现其能降成本且性能优。通过实证、几何分析和理论推导探究现象原因,并进行多方面消融实验。
Comments Accepted by ECCV 2026
GrowFields:用于拓扑变化植物生长的组合式4D神经场
机构 * ETH Zürich(苏黎世联邦理工学院) ; Swiss Data Science Center(瑞士数据科学中心) ; Martin-Luther-Universität Halle-Wittenberg(马丁-路德-哈雷-维滕贝格大学)
AI总结 针对从稀疏纵向3D观测量化植物生长动力学的难题,提出GrowFields,将植物分解为器官并对齐到规范坐标系,学习共享神经变形场,在植物器官跟踪中表现优于现有表示。
Comments ECCV 2026 paper (main conference). v2 corrects the vertical guide lines in supplementary Figures 5-7. Project page and code available at https://joaquin-gajardo.github.io/growfields/
DeCoFlow: 用于持续异常检测的归一化流结构分解
机构 * Seoul National University(首尔国立大学)
AI总结 针对工业环境中新产品类别顺序到达且无法访问旧数据的持续异常检测问题,提出DeCoFlow方法,通过将子网络分解为冻结通用基和任务特定低秩适配器来隔离参数更新,并引入任务特定对齐、辅助耦合层和尾感知损失,在MVTec-AD和VisA数据集上达到最先进性能且零遗忘。
Comments Accepted to ECCV 2026
HIVE:理解视觉语言模型中的幻觉后推理
机构 * Purdue University(普渡大学) ; Rutgers University(罗格斯大学) ; Meta AI ; Kent State University(肯特州立大学) ; Imperial College London(伦敦帝国学院)
AI总结 研究视觉语言模型中幻觉后推理阶段,引入HIVE评估基础设施,通过九个任务和九个模型观察到模态依赖模式,发现幻觉线索能拓宽语义覆盖并重塑推理动态,强调理解此阶段对提升多模态推理系统可靠性和可解释性的重要性。
Comments Accepted by ECCV 2026
MMAgent-R$^2$:用于智能mRAG的重排与拒绝学习
机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院复杂系统管理与控制国家重点实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(北京多模态信息超智能安全重点实验室) ; WeChat Vision, Tencent Inc.(腾讯微信视觉团队) ; PeopleAI Inc.(人智公司) ; School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院)
AI总结 针对KB-VQA中现有mRAG方法在处理视觉相似实体时的不足,提出MMAgent-R$^2$框架,集成视觉重排和主动拒绝机制,设计复合奖励函数,经GRPO训练实现联合优化,实验证明其在多任务中性能达最优。
Comments Accepted by ECCV 2026
EditVerse3D:基于区域感知学习的高质量3D对象编辑
机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) ; Tencent AIPD(腾讯人工智能产品部)
AI总结 针对3D对象局部编辑难题,EditVerse3D框架输入3D对象、粗略边界框和参考2D图像,利用区域感知自适应损失及数据增强技术,输出高质量编辑对象,实验证明其性能优于现有方法。
Comments Accepted to ECCV 2026. Project page: https://editverse3d.github.io/
PUF:用于在线3D场景图生成的即插即用不确定性感知融合
机构 * Leibniz Universität Hannover(汉诺威莱布尼茨大学) ; Istituto Italiano di Tecnologia(意大利技术研究院) ; University of Bath(巴斯大学)
AI总结 研究在线3D场景图生成中不确定性问题,提出PUF框架,将节点关联概率化,用狄利克雷证据积累分配证据,可选先验补全边,在不同后端实例化有改进,实验表明该方法优于现有方法,确立不确定性感知融合范式。
Comments Accepted by ECCV'26
ColorFM:一种通过流匹配进行颜色迁移的从优化到学习的框架
机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) ; VIVO BlueImage Lab(VIVO 蓝图像实验室)
AI总结 针对颜色迁移中现有方法的问题,提出ColorFM框架,先通过ColorFM - O方案拟合速度场产生高质量配对数据,再基于此设计ColorFM - L前馈模型,实验证明该框架在多方面表现优异,结合了优化准确性与推理速度。
Comments Accepted to ECCV 2026
基于3D感知语言模型的自我-人类运动预测
机构 * Visual Intelligence Lab., KAIST(视觉智能实验室,韩国科学技术院)
AI总结 研究从自我中心视角预测人类运动问题,提出Ego3DLM模型,基于准确运动预测需3D环境理解及姿势语言整体预测原则,通过三阶段训练,在相关任务中取得领先性能,实现跨模态和时间一致的运动预测。
Comments Accepted to ECCV 2026
通过动态质量感知进行通用不完全多模态学习
机构 * University of Electronic Science and Technology of China(电子科技大学)
AI总结 针对多模态学习中模态间缺失和模态内退化共存问题,提出通用不完全多模态学习框架GIML,通过动态质量感知处理上述问题,引入噪声感知质量估计器和噪声语义解耦模块,经实验验证其有效性和通用性。
Comments Accepted by ECCV 2026. Corresponding author: Shicai Wei
检索和优化用于基于扩散的运动生成的获胜噪声票证
机构 * Institute of Science Tokyo(东京科学研究所) ; LY Corporation(LY公司) ; National Institute of Informatics (NII)(国立情报学研究所)
AI总结 研究基于扩散的文本到运动模型语义漂移问题,提出WINRO框架,通过在扩散采样前选择和优化获胜噪声票证改善文本与运动对齐,无需重新训练,提升了不同模型的文本与运动保真度、时间鲁棒性,并推广到多种应用。
Comments Accepted to ECCV 2026, Project page: https://sinc865.github.io/winro/
WildCity:用于渲染、模拟和空间智能的真实世界城市规模测试平台
机构 * May Mobility(五月出行公司) ; New York University(纽约大学) ; NVIDIA(英伟达公司) ; Stanford University(斯坦福大学)
AI总结 针对人工智能在构建城市规模空间表征方面的挑战,引入WildCity真实世界多模态数据集,建立重建基线并转化为模拟器,分析关键挑战,推动城市规模渲染及相关人工智能发展。
Comments ECCV 2026; Project Page: https://han-xiangyu.github.io/Wild-City/
SPEAR:用于逼真的具身人工智能研究的模拟器
机构 * Adobe Research(Adobe研究院) ; Intel Labs(英特尔实验室) ; Manycore Tech Inc(众核科技公司) ; Adobe(Adobe公司) ; NVIDIA(英伟达公司) ; ETH Zurich(苏黎世联邦理工学院) ; Imperial College London(伦敦帝国学院)
AI总结 研究针对现有逼真模拟器局限,提出SPEAR这一Python库,通过模块化插件架构连接控制UE应用程序,提升可编程性与渲染速度,还提供新图像模态和高级编程模型,经多样示例应用展示了其效用。
Comments Accepted for publication at the European Conference on Computer Vision (ECCV) 2026
CoMind:从多视角理解人类协作活动
机构 * ETH Zurich(苏黎世联邦理工学院) ; MPI for Informatics(马克斯·普朗克信息研究所) ; Microsoft Switzerland(微软瑞士公司) ; TU Munich(慕尼黑工业大学)
AI总结 研究旨在填补人类协作认知过程研究空白,引入CoMind数据集,整合多模态数据并标注,建立相关基准,有助于开发和评估能建模复杂社会互动及推理人类行为的AI系统。
Comments Accepted to ECCV 2026
SpaR3D-MoE:来自稀疏视图的自适应3D空间推理与几何归纳专家混合模型
机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; YUKUN Intelligent World(宇琨智能世界)
AI总结 研究针对多模态大语言模型在2D与3D表征差距问题,提出SpaR3D-MoE框架,通过自适应时空采样和几何归纳专家混合模型,从稀疏RGB输入实现自适应空间推理,在多个实验中取得最优性能。
Comments Accepted to ECCV 2026
D2PO:通过动态偏好优化扩散采样器
机构 * Seoul National University(首尔国立大学) ; Ulsan National Institute of Science and Technology(蔚山国立科学技术院)
AI总结 研究针对现有框架局限,提出D2PO框架优化扩散采样策略。核心方法是将其转化为基于偏好的对齐问题,利用DPO框架并建模为能量模型,引入新能量公式和动态偏好。主要贡献是使采样器与感知质量更忠实对齐,性能优于传统调度器。
Comments Accepted to ECCV 2026
MIMFlow:将掩码图像建模与归一化流集成用于端到端图像生成
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ; Alibaba Group(阿里巴巴集团) ; Shanghai AI Lab(上海人工智能实验室)
AI总结 提出MIMFlow框架,通过VAE编码器从掩码图像推断语义潜在变量,使归一化流专注于低频语义流形,解码器处理高频合成,解决NF容量瓶颈,在ImageNet 256×256上达到71.3%线性探测精度和2.50 FID。
Comments Accepted by ECCV 2026
图像无法表达的:语言引导的嗅觉表征学习
机构 * LIX, École Polytechnique, IP Paris, CNRS(LIX,巴黎高等理工学院,IP巴黎,CNRS)
AI总结 研究图像与嗅觉对齐难题,提出SCENT多模态框架,利用视觉语言模型生成场景描述符,训练气味编码器,通过语言引导潜在分解分离特定对象气味与环境贡献,提升跨模态检索性能,产生可解释表征。
Comments ECCV 2026. Project page: https://www.lix.polytechnique.fr/vista/projects/2026_scent_tsonis/
用于不完整多视图聚类的直线路径流匹配
机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) ; Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学) ; University of Auckland(奥克兰大学) ; University of New South Wales(新南威尔士大学) ; Communication University of China(中国通信大学)
AI总结 研究不完整多视图聚类问题,提出基于直线路径流匹配的框架,通过线性插值路径用概率流替代扩散,集成视图完成与聚类对齐,实验证明该框架在标准基准上达最优性能。
Comments Accepted to ECCV 2026. 28 pages, 6 figures, 4 tables
从检测器条件可达性的角度重新审视场景图生成
机构 * Technische Universität Berlin(柏林工业大学) ; Humboldt Universität zu Berlin(柏林洪堡大学) ; Univ. Grenoble Alpes, Inria, CNRS, Grenoble INP, LJK(格勒诺布尔大学、法国国家信息与自动化研究所、法国国家科学研究中心、格勒诺布尔国立综合理工学院、法国国家科学研究中心格勒诺布尔计算机科学实验室) ; Bernstein Center for Computational Neuroscience(伯恩斯坦计算神经科学中心) ; Science of Intelligence Research Cluster of Excellence(智能科学卓越研究集群)
AI总结 该研究从检测器条件可达性角度重新审视场景图生成,设计实验发现基于检测器和基于查询方法的预测行为有互补线索,进而引入双SGG方法整合两种机制,经多数据集实验验证了此方法的有效性。
Comments Accepted by ECCV 2026
RoME:针对多种对抗性扰动的低秩专家稳健混合
机构 * KAIST(韩国科学技术院) ; Oracle(甲骨文公司)
AI总结 研究针对多扰动对抗训练的鲁棒性权衡问题,提出RoME方法,通过低秩专家混合及双尺度门控、威胁引导门控多样化,在联合鲁棒性和自然准确性上优于现有方法,提升对未知威胁的鲁棒性。
Comments ECCV 2026