Stake the Points: Structure-Faithful Instance Unlearning
标注点:结构忠实的实例删除
机构 * Chung-Ang University(Chung-Ang 大学)
AI总结 本文提出结构忠实的实例删除框架,通过引入语义锚点保持知识结构,提升图像分类、检索和人脸识别性能,实现删除与保留的平衡。
Comments Accepted by CVPR 2026
期刊&会议
Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision
标注点:结构忠实的实例删除
机构 * Chung-Ang University(Chung-Ang 大学)
AI总结 本文提出结构忠实的实例删除框架,通过引入语义锚点保持知识结构,提升图像分类、检索和人脸识别性能,实现删除与保留的平衡。
Comments Accepted by CVPR 2026
光谱-几何神经场用于无姿态激光雷达视角合成
机构 * School of AIA, Huazhong University of Science and Technology(华中科技大学人工智能学院)
AI总结 本文提出SG-NLF框架,通过融合光谱信息与几何一致性实现无姿态激光雷达视角合成,提升重建质量和姿态精度。
Comments Accepted by CVPR 2026
Node-RF:基于神经ODE的NeRF学习通用连续时空场景动态
机构 * Technical University of Munich(慕尼黑技术大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心)
AI总结 Node-RF通过结合神经ODE与动态NeRF,实现连续时间空间动态表示,能超越观测轨迹进行泛化。利用ODE求解器学习隐式场景状态,通过微分计算传播特征嵌入,实现长距离外推。
Comments Accepted to CVPR 2026. 13 pages, 9 figures
Dark3R: 在黑暗中学习结构从运动
机构 * University of Toronto(多伦多大学) ; Vector Institute(向量研究所) ; York University(约克大学) ; Sony Corporation of America(美国索尼公司) ; Harvard University(哈佛大学) ; Purdue University(普渡大学)
AI总结 Dark3R通过教师-学生蒸馏适应大规模3D基础模型以应对极低光照条件,无需3D监督,仅需噪声-清洁原始图像对进行训练,实现低信噪比下的鲁棒特征匹配和相机姿态估计。
Comments CVPR 2026, Project Page: https://andrewguo.com/pub/dark3r
让您的图像随您的动作移动!-- 隐式多对象多动作转移
机构 * Tianjin University(天津大学) ; University of New South Wales(新南威尔士大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Hainan University(海南大学) ; University of Auckland(奥克兰大学)
AI总结 本文提出FlexiMMT框架,实现多对象多动作的隐式图像到视频转换,通过解耦注意力机制和改进的掩码传播机制,实现精确且高质量的多对象动作迁移。
Comments 15 pages, 11 figures, cvpr 2026, see https://ethan-li123.github.io/FlexiMMT_page/
FoV-Net:通过视场射线投射实现旋转不变的CAD B-rep学习
机构 * Ghent University(根特大学) ; CVAMO, Flanders(弗拉芒计算机视觉与建模实验室)
AI总结 本文提出FoV-Net,通过局部参考框架和视场网格实现旋转不变的B-rep学习,提升3D CAD分析的鲁棒性与效率。
Comments Manuscript accepted at CVPR 2026
从激活到初始化:为优化神经场扩展规模洞察
机构 * Australian Institute of Machine Learning, University of Adelaide, Australia(澳大利亚机器学习研究所,阿德莱德大学,澳大利亚) ; Amazon, Australia(亚马逊,澳大利亚)
AI总结 本文探讨神经场中初始化与激活的相互作用,揭示网络初始化、架构选择与优化过程之间的深层联系,为设计高效神经场提供理论基础。
Comments CVPR 2024
coDrawAgents:一种用于组合图像生成的多智能体对话框架
机构 * Lingnan University(岭南大学) ; CMU(卡内基梅隆大学) ; CUHK(香港中文大学) ; Alibaba DAMO Academy(阿里巴巴达摩院) ; SJTU(上海交通大学) ; HKU(香港大学) ; China University of Petroleum(中国石油大学)
AI总结 coDrawAgents通过四类智能体协作提升复杂场景中多对象生成的准确性与属性保持,实验表明其在文本-图像对齐、空间准确性和属性绑定方面表现更优。
Comments Accepted to CVPR 2026 Findings
SAVA-X:通过场景自适应视角对齐和双向跨视角融合进行视角到非视角模仿错误检测
机构 * University of Electronic Sience and Technology of China(电子科技大学)
AI总结 本文提出SAVA-X框架,通过场景自适应视角对齐和双向跨视角融合解决视角到非视角模仿错误检测问题,提升了在EgoMe基准上的AUPRC和均值tIoU表现。
Comments This article was accepted by CVPR 2026
HSEmotion团队在ABAW-10竞赛中的表现:面部表情识别、情绪估值估计、动作单元检测和细粒度暴力分类
机构 * Sber AI Lab(Sber AI实验室) ; HSE University(俄罗斯高等经济学院)
AI总结 本文提出了一种基于预训练EfficientNet模型的快速方法,用于面部情绪理解任务,同时通过滑动窗口平滑噪声以提升预测精度,并在细粒度暴力检测任务中评估了多种预训练架构。
Comments to be submitted to ABAW-10 workshop of CVPR 2026
AVION:从离线教师到提示调优网络的空域视觉-语言指令
机构 * The University of British Columbia, Okanagan(不列颠哥伦比亚大学奥克兰分校) ; The Ohio State University(俄亥俄州立大学) ; TerraSense Analytics(TerraSense分析)
AI总结 AVION提出一种知识蒸馏框架,通过构建语义丰富的文本原型和轻量级提示,提升视觉语言模型在遥感图像中的适应能力,提升少样本分类和跨模态检索性能。
Comments Accepted to CVPR 2026
A2Z-10M+: 通过A到Z BRep注释进行几何深度学习用于辅助CAD建模与逆向工程
AI总结 本文提出A2Z-10M+数据集,包含1000万种多模态注释,用于提升CAD逆向工程中的BRep学习能力,通过高分辨率网格、手绘草图和文本描述等多源数据训练基础模型,实现对CAD特征的精准识别。
Comments 27 pages, accepted to IEEE CVF CVPR 2026
真实智能手机超分辨率的RAW域退化模型
AI总结 本文提出通过校准和未处理公开渲染图像生成不同智能手机的RAW域图像对,训练单图像RAW到RGB超分辨率模型,以提升真实场景下的超分辨率性能。
Comments This paper has been accepted to The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026
SPARROW:在像素级视频MLLM中学习空间精度和时间参照一致性
AI总结 SPARROW通过引入目标特定跟踪特征和双提示设计,提升视频像素级理解的空间精度和时间一致性,基于30646个视频和45231对问答对的数据集,实现六个基准测试的显著改进。
Comments Accepted at CVPR 2026; Project page: https://risys-lab.github.io/SPARROW; Repository: https://github.com/RISys-Lab/SPARROW
跟随显著性:用于检索增强的密集视频描述的监督显著性
AI总结 本文提出STaRC框架,通过显著性检测模块监督帧级显著性,以提升密集视频描述中时间分割的准确性,实现更精确的检索和上下文相关的描述生成。
Comments CVPR 2026 accepted paper (main track)
Mobile-VTON: 高保真设备端虚拟试衣
AI总结 本文提出Mobile-VTON,一种基于设备端的高保真虚拟试衣框架,通过模块化架构和隐私保护技术,在无需云端支持的情况下实现高质量试衣效果。
Comments The project page is available at: https://zhenchenwan.github.io/Mobile-VTON/
Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026
基于傅里叶角对齐的遥感定向目标检测
机构 * Beijing Institute of Technology(北京理工大学) ; University of Hong Kong(香港大学) ; Tohoku University(东北大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; Hong Kong Generative AI Research and Development Center(香港生成式人工智能研究与发展中心)
AI总结 本文提出傅里叶角对齐方法,通过频谱分析角度信息并对其对齐,提升遥感中旋转目标检测的性能,实验显示在DOTA数据集上取得新的SOTA结果。
Comments Accepted by CVPR 2026
AOMGen: 为关节物体操控生成逼真、物理一致的演示
AI总结 本文提出AOMGen框架,通过单次真实扫描、演示和数字资产库生成逼真训练数据,提升机器人操控任务的成功率。
Comments Accepted by CVPR Findings2026
EMGauss:通过动态高斯建模在体积电子显微镜中实现连续切片到三维重建
AI总结 EMGauss通过动态高斯建模方法,解决体积电子显微镜中切片到三维重建的异质性限制,提升插值质量并实现连续切片合成。
Comments Accepted by CVPR 2026. Project page: https://raynehe.github.io/EMGauss/
多标准:在多元标准下评估多模态裁判
机构 * University of Maryland, College Park(马里兰大学学院公园分校) ; University of Waterloo(滑铁卢大学)
AI总结 本文提出Multi-Crit基准,评估多模态裁判在多元标准下的表现,揭示了专有模型和开源模型在遵循复杂标准方面的不足,以及整体判断信号对视觉理解的影响。
Comments Accepted to CVPR 2026
ID-Crafter:基于视觉语言模型的在线强化学习多主体视频生成框架
AI总结 本文提出ID-Crafter框架,通过层次化注意力机制、预训练视觉语言模型和在线强化学习,提升多主体视频生成中身份保持与语义一致性。
Comments Project page: https://angericky.github.io/ID-Crafter, Code: https://github.com/paulpanwang/IDCrafter
Journal ref CVPR 2026
用3D思考:从有限视角出发的几何想象引导的空间推理
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ; Meituan(美团) ; National University of Singapore(新加坡国立大学) ; Beihang University(北航) ; LMMs-Lab(LMMs实验室)
AI总结 本文提出3DThinker框架,通过利用图像中的丰富几何信息实现空间推理,无需3D先验输入或显式标注3D数据,在多个基准测试中优于现有方法。
Comments 25 pages, 17 figures
Journal ref CVPR 2026
HoneyBee: 用于视觉-语言推理器的数据食谱
AI总结 本文提出HoneyBee数据集,通过数据整理方法提升视觉-语言推理能力,发现上下文来源策略和数据干预显著提升性能,并提出测试时缩放策略以降低解码成本。
Comments 32 pages. Accepted to CVPR 2026 in Denver, Colorado, USA
MoVieDrive:基于多模态多视角视频扩散变换器的城市场景合成
机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) ; University of Toronto(多伦多大学)
AI总结 本文提出MoVieDrive,通过多模态多视角视频扩散变换器生成城市驾驶场景视频,实现多模态数据生成与可控生成。
Comments CVPR 2026 Findings Track
在有限预算下加速扩散模型训练:基于凝聚的视角
AI总结 本文提出D2C框架,通过选择和附加两阶段方法,从大规模数据集中凝聚出小数据集,从而在有限资源下加速扩散模型训练并保持生成质量。
Comments CVPR 2026 camera-ready version. Introduces D2C, a framework for efficient diffusion model training
一致性陷阱:当MLLM编写的叙述利用被篡改的视觉上下文
机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) ; School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) ; CSIRO(澳大利亚联邦科学与工业研究组织) ; Northwestern Polytechnical University(西北工业大学) ; University of Macau(澳门大学)
AI总结 本文提出AMD框架,通过Artifact Pre-perception Encoding策略和Manipulation-Oriented Reasoning,解决MLLM生成的多模态欺骗检测问题,验证了其在跨领域测试中的优越性能。
Comments Accepted to CVPR 2026 main track