VSAS-BENCH: Real-Time Evaluation of Visual Streaming Assistant Models
VSAS-BENCH:视觉流助手模型的实时评估
机构 * Apple(苹果公司)
AI总结 本文提出VSAS-Bench,通过时序密集标注和标准化评估协议,评估流式视觉语言模型的实时性能,揭示模型在内存缓冲长度、访问策略等关键设计因素下的精度-延迟权衡。
Comments CVPR Findings 2026
期刊&会议
Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision
VSAS-BENCH:视觉流助手模型的实时评估
机构 * Apple(苹果公司)
AI总结 本文提出VSAS-Bench,通过时序密集标注和标准化评估协议,评估流式视觉语言模型的实时性能,揭示模型在内存缓冲长度、访问策略等关键设计因素下的精度-延迟权衡。
Comments CVPR Findings 2026
通过手语模型 bootstrap 手语注释
机构 * Apple(苹果公司) ; Gallaudet University(加劳德特大学)
AI总结 本文提出一种伪注释流程,利用手语视频和英语输入,生成手语、手指拼写词和手语分类器的注释。通过稀疏预测和K-Shot LLM方法,实现高精度的伪注释,为手语数据集提供高质量基准。
Comments Accepted to CVPR Findings 2026
视频中手术器械交接的事件级检测:可解释的视觉模型
机构 * Fraunhofer HHI(弗劳恩霍夫海因里希·赫兹研究所) ; Technical University of Berlin(柏林工业大学) ; Charité - Universitätsmedizin Berlin(柏林夏里特医学院) ; Université de Perpignan(佩皮尼昂大学)
AI总结 本文提出一种时空视觉框架,用于检测和分类手术器械交接事件,通过结合视觉Transformer和LSTM网络,实现高准确率的检测与方向分类,实验表明其在肾移植手术视频中表现优异。
Comments 12 Pages, 6 figures, CVPR 2026 Workshop AI4RWC
面向边缘设备的持续学习中关键补丁感知稀疏提示方法
机构 * School of Computer Science and Engineering, Chung-Ang University(中央大学计算机科学与工程学院) ; Department of Artificial Intelligence, Chung-Ang University(中央大学人工智能系)
AI总结 本文提出CPS-Prompt方法,通过关键补丁采样和解耦训练降低边缘设备上的训练内存和计算成本,实验证明其在内存、训练时间和能效方面优于基线模型,同时保持与现有方法相当的精度。
Comments Accepted to CVPR 2026. 10 pages, 8 figures
数据预热:面向高效扩散训练的复杂度感知课程学习
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; University of Pittsburgh(匹兹堡大学) ; University at Buffalo, SUNY(纽约州立大学布法罗分校)
AI总结 本文提出Data Warmup方法,通过按复杂度从简到繁安排训练图像,提升扩散模型训练效率,实验表明其在ImageNet上显著提升生成质量并提前达到基线水平。
Comments CVPRW in the proceedings of CVPR 2026
Face2Scene:利用面部退化作为扩散基于场景恢复的 oracle
机构 * University of Toronto(多伦多大学) ; Vector Institute(向量研究所) ; AI Center–Toronto, Samsung Electronics(三星电子多伦多AI中心) ; University Health Network(大学健康网络) ; York University(约克大学)
AI总结 本文提出Face2Scene框架,通过面部作为感知oracle估计退化并指导全图恢复,有效恢复身体和背景。
Comments Accepted at CVPR 2026
SUPERGLASSES:基于智能眼镜的视觉语言模型智能体基准测试
机构 * The Hong Kong Polytechnic University(香港理工大学)
AI总结 本文提出SUPERGLASSES基准,通过真实世界数据评估智能眼镜的多模态交互能力,提出SUPERLENS模型在VQA任务中超越GPT-4o,揭示了任务特定解决方案的重要性。
Journal ref 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition- FINDINGS Track (CVPRF)
多模态PFN:扩展先验数据拟合网络以进行多模态表格学习
机构 * Samsung Electronics(三星电子) ; Seoul National University of Science and Technology(首尔科学技术大学)
AI总结 本文提出MMPFN,通过引入多头门控MLP和跨注意力池化器,扩展TabPFN以处理表格和非表格模态,实验证明其在医疗和通用多模态数据集上优于现有方法。
Comments Accepted to CVPR 2026
AnomalyVFM -- 将视觉基础模型转变为零样本异常检测器
机构 * University of Ljubljana, Faculty of Computer and Information Science(卢布尔雅那大学计算机与信息科学学院)
AI总结 本文提出AnomalyVFM框架,通过合成数据生成与参数高效适应机制,使视觉基础模型在零样本异常检测中表现更优,实测在9个数据集上达到94.1%的AUROC。
Comments Accepted to CVPR 2026
伪专家正则化离线强化学习用于逼真闭环环境中的端到端自动驾驶
机构 * InfoTech, Toyota Motor Corporation(丰田汽车公司 InfoTech)
AI总结 本文提出一种基于摄像头的端到端离线强化学习框架,通过伪地面真实轨迹正则化提升自动驾驶安全性与效率,实验表明在nuScenes数据集上显著降低碰撞率并提高路线完成度。
Comments Accepted to CVPR Findings 2026
PSR: 通过成对主体一致性奖励实现多主体个性化图像生成的扩展
机构 * Zhejiang University(浙江大学) ; Huawei Inc.(华为技术有限公司)
AI总结 本文提出PSR框架,通过多主体数据生成管道和强化学习策略,提升多主体个性化图像生成的性能和一致性。
Comments Accepted by CVPR 2026
理解视觉-语言模型中的任务迁移
机构 * Microsoft Research India(微软研究院印度)
AI总结 本文研究视觉-语言模型中任务迁移的系统性影响,提出PGF指标衡量任务迁移对性能的影响,揭示任务间的正负迁移关系,指导更高效的模型训练。
Comments CVPR 2026 (Oral)
视频并行扩展:聚合多样化的帧子集用于VideoLLMs
机构 * EverEx ; University of Michigan(密歇根大学) ; KAIST(韩国科学技术院) ; ETH Zürich(苏黎世联邦理工学院) ; UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; Yonsei University(延世大学)
AI总结 本文提出Video Parallel Scaling方法,通过并行处理不同帧子集提升VideoLLMs的时序推理能力,实验表明其在不同模型架构和规模上均显著提升性能,且比其他并行方法更高效。
Comments CVPR Findings 2026; code: https://github.com/hyungjin-chung/VPS
ChangeBridge: 多模态控制下的遥感时空图像生成
机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) ; School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) ; School of Computer Science, Wuhan University(武汉大学计算机学院) ; Zhongguancun Academy(中关村学院) ; Graduate School of Frontier Sciences, The University of Tokyo(东京大学新领域创成科学研究科) ; Department of Computer Science, Stanford University(斯坦福大学计算机科学系)
AI总结 本文提出ChangeBridge模型,通过多模态事件控制生成时空一致的遥感图像,解决了现有方法在跨时间变化建模上的不足,提升了土地利用规划和变化检测任务的数据生成能力。
Comments Accepted by CVPR 2026
2ndMatch: 通过二阶雅可比匹配进行剪枝扩散模型的微调
AI总结 本文提出2ndMatch框架,通过二阶雅可比匹配损失提升剪枝扩散模型性能,实验表明其能显著改善输出质量。
Comments Accepted to CVPR 2026
Reason-SVG:通过强化学习增强向量图形生成的结构化推理
机构 * Beihang University(北京航空航天大学) ; The University of Hong Kong(香港大学)
AI总结 Reason-SVG通过引入Drawing-with-Thought范式和混合奖励机制,提升大语言模型生成高质量SVG的能力,实现结构化推理与视觉一致性。
Comments Accepted by CVPR 2026. 16 pages, 7 figures
RQR3D:基于鸟瞰图的3D目标检测的回归目标重新参数化
机构 * Amazon Lab 126(亚马逊126实验室) ; Togg/Trutek AI Team(Togg/Trutek人工智能团队)
AI总结 本文提出RQR3D方法,通过重新参数化回归目标将旋转目标检测转化为关键点回归任务,实现高效且准确的3D目标检测,适用于自动驾驶场景。
Comments To appear in proceedings of CVPR Findings 2026
DMin:用于扩散模型的可扩展训练数据影响估计
机构 * Rochester Institute of Technology(罗切斯特理工学院) ; Tufts University(塔夫茨大学)
AI总结 本文提出DMin框架,用于高效估计扩散模型中每个训练样本对生成图像的影响,解决了传统方法在大规模模型上的计算限制问题,实现了存储和计算效率的显著提升。
Comments Accepted to CVPR 2026 (Findings)
新颖的异常检测场景和评估指标以解决正常样本定义的模糊性
机构 * Meijo University(名城大学)
AI总结 本文提出新颖的异常检测场景和评估指标,以应对实际应用中正常样本定义的模糊性,并通过RePaste方法提升学习效果,实验证明其在MVTec AD基准上的优越性能。
Comments Accepted by CVPR 2026 Workshop
VGGT-SLAM++:基于视觉几何基础变换器的视觉SLAM系统
机构 * Indian Institute of Technology Delhi(印度理工学院德里分校) ; Addverb Technologies ; Brown University(布朗大学)
AI总结 VGGT-SLAM++结合视觉几何基础变换器的几何丰富输出,通过空间校正后端实现高频率局部捆绑调整,提升大规模映射精度与内存效率。
Comments 8 pages (main paper) + supplementary material. Accepted at CVPR 2026 Workshop (VOCVALC)
生成、分析与优化:基于MLLM元推理的无训练声源定位
机构 * Kyung Hee University(庆熙大学)
AI总结 本文提出无训练的声源定位框架,利用多模态大语言模型的推理能力,通过生成-分析-优化流程实现声源定位,实验表明在单源和多源基准上表现优异。
Comments Accepted to CVPR 2026
FedDAP: 面向领域偏移的联邦学习中的领域感知原型学习
机构 * G-LAMP NEXUS Institute, Kyung Hee University(庆熙大学G-LAMP NEXUS研究所) ; Kyung Hee University(庆熙大学)
AI总结 FedDAP通过构建领域特定的全局原型,解决联邦学习中因领域偏移导致的模型性能下降问题,通过领域感知的原型对齐提升本地学习和全局泛化能力。
Comments Accepted at CVPR 2026
面向对抗性移除与伪造攻击的鲁棒内容水印技术
机构 * Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) ; University of Chinese Academy of Sciences(中国科学院大学) ; University of Waterloo(滑铁卢大学)
AI总结 本文提出Instance-Specific watermarking with Two-Sided detection方法,通过动态控制水印注入时间和模式提升鲁棒性,有效对抗移除和伪造攻击。
Comments 14 pages, 5 figures, CVPR 2026 Findings
SubFLOT:通过最优传输实现高效且个性化的联邦学习子模型提取
机构 * Tsinghua University(清华大学) ; Beijing University of Technology(北京工业大学) ; Key Laboratory of Pervasive Computing, Ministry of Education(普适计算教育部重点实验室)
AI总结 SubFLOT通过最优传输增强剪枝模块生成定制化子模型,结合缩放适应正则化模块缓解参数分歧,实现高效个性化联邦学习。
Comments Accepted by CVPR 2026
PhysHead: 可模拟的高斯头部化身
机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; ETH Zürich(苏黎世联邦理工学院) ; University of Tübingen(图宾根大学) ; Technical University of Darmstadt(达姆施塔特工业大学) ; Tübingen AI Center(图宾根人工智能中心) ; Max Planck Institute for Informatics(马克斯·普朗克信息学研究所)
AI总结 本文提出PhysHead,一种结合3D参数网格和发丝的混合表示方法,用于生成具有真实发丝动态的可动画头部化身,通过多视角视频学习实现逼真发丝运动。
Comments Project Page: see https://phys-head.github.io/; Youtube Video: see https://www.youtube.com/watch?v=k68fsSSwzc0; Accepted to CVPR 2026
双层优化用于单一领域泛化
机构 * School of Computer Science, Carleton University(卡尔顿大学计算机科学学院) ; Amii(阿尔伯塔机器智能研究所)
AI总结 本文提出BiSDG框架,通过双层优化分离任务学习与领域建模,利用模拟分布偏移的替代领域提升泛化能力,实验表明在单一领域泛化任务中优于现有方法。
Comments CVPR Findings Track, 2026
CraterBench-R: 行为级陨石坑检索用于行星尺度
机构 * Northern Illinois University(北伊利诺伊大学) ; University of Arizona(亚利桑那大学)
AI总结 本文提出CraterBench-R,通过实例级图像检索解决行星表面陨石坑分析问题,展示自监督Vision Transformers在陨石坑检索中的优势,并提出实例-令牌聚合方法提升效率。
Comments Accepted at the EarthVision 2026 Workshop at CVPR 2026
扩散基图像压缩对位翻转错误的鲁棒性
机构 * Technion - Israel Institute of Technology(以色列理工学院) ; Deepkeep
AI总结 研究探讨了基于扩散的图像压缩在位翻转错误下的鲁棒性,提出更稳健的Turbo-DDCM变体,改进鲁棒性的同时保持率-失真-感知权衡。
Comments Accepted at AIGENS @ CVPR 2026
在模态缺失情况下通过知识蒸馏从噪声多模态教师中实现鲁棒的人体感知:Purify-then-Align
机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) ; Institute of Computer Science, Universität Bern(伯尔尼大学计算机科学研究所) ; College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
AI总结 本文提出PTA框架,通过元学习和知识扩散解决多模态人体感知中模态缺失问题,通过净化知识源和对齐模态提升单模态模型鲁棒性。
Comments Accepted by CVPR 2026 Workshop On Any-to-Any Multimodal Learning
从合成数据到真实修复:一种针对患者特定牙齿冠的扩散模型
机构 * Department of Computer Graphics and Multimedia, Brno University of Technology, Czechia(捷克布尔诺科技大学计算机图形与多媒体系)
AI总结 本文提出ToothCraft模型,通过合成数据生成患者特定的牙齿冠修复,解决训练数据不足问题,实验显示其在IoU和CD指标上的优异表现。
Comments VISAPP 2026 Conference / CVPR Workshop GenRecon3D