On Test-Time Scaling for Vision-Language Models
关于视觉-语言模型的测试时扩展
机构 * ETRO Department, Vrije Universiteit Brussel(布鲁塞尔自由大学ETRO部门) ; imec
AI总结 本文系统研究了视觉-语言模型(LVLM)的测试时扩展方法,发现小型高性能模型受益最大,性能提升可达30%,并揭示了视觉信息在推理链早期编码后图像令牌贡献显著下降。
Comments ECCV 2026
期刊&会议
European Conference on Computer Vision · 会议 · Computer Vision
关于视觉-语言模型的测试时扩展
机构 * ETRO Department, Vrije Universiteit Brussel(布鲁塞尔自由大学ETRO部门) ; imec
AI总结 本文系统研究了视觉-语言模型(LVLM)的测试时扩展方法,发现小型高性能模型受益最大,性能提升可达30%,并揭示了视觉信息在推理链早期编码后图像令牌贡献显著下降。
Comments ECCV 2026
无监督语义分割促进模型理解
机构 * Max-Delbruck-Center(马克斯·德尔布鲁克中心) ; Helmholtz Imaging(海德堡成像) ; Humboldt-Universität zu Berlin(柏林洪堡大学) ; Charité Universitätsmedizin(夏里特大学医学院) ; University of Potsdam(波茨坦大学)
AI总结 提出基于无监督语义分割的可视化协议,直观揭示不同自监督视觉Transformer的注意力机制、位置偏差和缩放行为等模型特性。
Comments Camera-ready version of paper accepted at ECCV 2026
MedSynapse-V:通过潜在记忆演化桥接视觉感知与临床直觉
机构 * Hunan University(湖南大学)
AI总结 提出MedSynapse-V框架,通过潜在诊断记忆演化模拟临床专家经验调用,解决医学视觉语言模型因离散分词导致的量化损失、长程信息消散和案例适应性问题,在诊断准确性上显著超越现有方法。
Comments ECCV 2026; Medical latent reasoning; Memory evolution
对比语言-彩色点图预训练用于统一3D场景理解
机构 * Imperial College London(帝国理工学院伦敦分校)
AI总结 提出UniScene3D,一种基于Transformer的编码器,通过多视图彩色点图联合建模外观和几何,并引入跨视图几何对齐和接地视图对齐,在少样本和任务特定微调中达到SOTA。
Comments 19 Pages, ECCV 2026 Accepted
Control-DINO:用于可控图像到视频扩散的特征空间条件
机构 * Huawei Technologies, Switzerland(华为技术(瑞士)) ; Huawei Technologies, Austria(华为技术(奥地利)) ; Graz University of Technology, Austria(格拉茨技术大学)
AI总结 本文提出Control-DINO,通过解耦外观与其他特征,实现对视频扩散模型的可控生成,提升生成渲染的可控性。
Comments ECCV 2026 - Project Page https://dedoardo.github.io/projects/control-dino/
CLIP-AUTT: 基于动作单元提示的测试时个性化方法用于细粒度视频情绪识别
机构 * LIVIA, ILLS, Dept. of Systems Engineering, ETS Montreal(LIVIA, ILLS, 系统工程学院, 蒙特利尔高等技术学院) ; LIVIA, Dept. of Software and IT Engineering, ETS Montreal(LIVIA, 软件与IT工程学院, 蒙特利尔高等技术学院) ; Dept. of Computer Science, École Polytechnique(计算机科学系, 巴黎综合理工学院)
AI总结 本文提出CLIP-AUTT,通过动作单元提示实现测试时个性化,提升细粒度视频情绪识别的鲁棒性和个性化能力。
Comments ECCV, 2026
Fisheye3R:将统一的3D前馈基础模型适应于鱼眼镜头
机构 * Yale University(耶鲁大学) ; Google XR(谷歌XR)
AI总结 本文提出Fisheye3R框架,通过灵活学习方案在不退化性能的前提下,使多视角3D重建模型适应高径向畸变的鱼眼图像。
Comments European Conference on Computer Vision 2026
GenHOI:具有遮挡意识的通用手-物体姿态估计
机构 * Hunan University(湖南大学) ; Lancaster University(兰卡斯特大学) ; University of Western Australia(西澳大学) ; University of Trento(特伦托大学) ; National University of Singapore(新加坡国立大学)
AI总结 本文提出GenHOI框架,通过整合层次语义知识与手部先验,提升在遮挡条件下手-物体姿态估计的泛化能力,实验表明在DexYCB和HO3Dv2基准上达到SOTA性能。
Comments European Conference on Computer Vision (ECCV), 2026
PASDiff: 面向真实世界低光人脸增强与恢复的物理感知语义引导
机构 * Nanjing University of Posts and Telecommunications(南京邮电大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; PCA Lab, Nanjing University of Science and Technology(南京理工大学PCA实验室) ; East China Normal University(华东师范大学)
AI总结 提出PASDiff,一种无需训练的物理感知语义扩散模型,通过逆强度加权和Retinex理论引入光度约束,并利用风格无关结构注入从现成人脸先验中提取结构,在真实低光人脸增强上实现自然光照、色彩恢复和身份一致性的优越平衡。
Comments Accepted by ECCV 2026
基于渐进调优的缺陷感知混合提示优化用于零样本多类型异常检测与分割
机构 * Corporate Research, Robert Bosch GmbH(罗伯特·博世集团企业研究部) ; Otto-von-Guericke-University(奥托·冯·格里克大学) ; Institute for Artificial Intelligence, University of Stuttgart(斯图加特大学人工智能研究所) ; Faculty of Computer Science, UniVie Doctoral School Computer Science, University of Vienna(维也纳大学计算机科学系) ; University of Southampton(南安普顿大学)
AI总结 提出DAPO框架,通过混合提示机制结合可读缺陷描述与可学习嵌入,对齐异常视觉特征与文本语义,在零样本多类型异常检测与分割任务中平均提升AUROC 3.6%和5.2%。
Journal ref European Conference on Computer Vision (ECCV 2026)
语言引导的Transformer分词器用于人体运动生成
机构 * Transsion Ltd.(Transsion有限公司) ; Chongqing University of Technology(重庆理工大学) ; State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) ; Shenzhen Graduate School(深圳研究生院)
AI总结 提出语言引导分词器LG-Tok,在分词阶段对齐语言与运动,产生紧凑高层语义表示,结合Transformer注意力机制实现高效运动生成,在HumanML3D和Motion-X上达到SOTA。
Comments Accepted by ECCV 2026
通过修补UV空间高斯建模的一次前馈360度可动画化头像
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Zeekr Automobile R&D Co., Ltd(Zeekr汽车研发有限公司)
AI总结 提出一种基于UV空间高斯建模的一次前馈框架,利用预训练3D GAN的先验知识修补缺失区域,实现360度全头可动画化头像的高质量重建与实时动画。
Comments Accepted by ECCV 2026. Project page: https://shaelynz.github.io/fhavatar/
直接扩散分数偏好优化:通过逐步对比策略对监督
机构 * Dept. of CSE, Korea University(韩国大学计算机科学与工程系) ; NVIDIA
AI总结 提出DDSPO方法,通过对比策略对直接监督反向去噪步骤,无需奖励建模或人工标注,在文本-图像对齐和美学质量任务上优于现有方法。
Comments Accepted to ECCV 2026
PPTArena: 一个用于PowerPoint编辑的基准测试
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 提出PPTArena基准,包含2125张幻灯片的1300+人工编辑任务,并设计PPTPilot智能体通过结构感知的规划-编辑-验证循环,在复合、布局敏感和跨幻灯片编辑上超越强基线10个百分点以上。
Comments ECCV 2026
面向扩散模型的局部感知持续遗忘学习
机构 * Indian Institute of Technology Hyderabad(印度海得拉巴印度理工学院) ; Sony AI(索尼人工智能) ; Sony Group Corporation(索尼集团)
AI总结 提出局部感知持续遗忘框架,通过局部感知目标选择和局部感知回放机制,解决扩散模型在连续概念移除中的性能崩溃问题,在10步顺序遗忘中保持高相关保留和通用保留。
Comments Accepted to ECCV 2026
生成树自回归视觉生成
机构 * Yonsei University(延世大学) ; Korea Institute of Science and Technology(韩国科学技术院) ; LG AI Research(LG人工智能研究) ; University of Michigan(密歇根大学) ; Seoul National University(首尔国立大学)
AI总结 提出生成树自回归(STAR)建模,通过均匀生成树的遍历顺序在保持采样性能的同时提供灵活序列顺序,支持图像编辑。
Comments Published as a main conference paper at ECCV 2026
MedRepBench:医学报告解读的综合基准
机构 * Baidu Inc.(百度公司)
AI总结 提出MedRepBench基准,包含1925张去标识中文医学报告图像,评估端到端视觉语言模型在报告字段结构化提取和患者友好解释上的性能,并提供GRPO对齐基线提升字段召回率6%。
Comments ECCV 2026 (main conference)