arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11876
2604.05524 2026-04-08 cs.CV

Cross-Resolution Diffusion Models via Network Pruning

通过网络剪枝实现跨分辨率扩散模型

Jiaxuan Ren, Junhan Zhu, Huan Wang

机构 * Westlake University(西湖大学) University of Electronic Science and Technology of China(电子科技大学)

AI总结 本文提出CR-Diff方法,通过参数剪枝提升扩散模型在不同分辨率下的视觉一致性,保持默认分辨率性能,支持提示特定优化。

Comments Accepted by CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05497 2026-04-08 cs.AI cs.CV

Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models

Thinking Diffusion: 通过惩罚和引导在扩散多模态语言模型中抑制和引导视觉推理

Keuntae Kim, Mingyu Kang, Yong Suk Choi

机构 * Department of Computer Science, Hanyang University(汉阳大学计算机科学系) Department of Artificial Intelligence, Hanyang University(汉阳大学人工智能系)

AI总结 本文针对扩散多模态语言模型在视觉推理中生成过早答案的问题,提出位置与步数惩罚和视觉推理引导方法,提升推理准确率并加快推理速度。

Comments CVPR 2026 - main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05436 2026-04-08 cs.CV cs.AI

Human Interaction-Aware 3D Reconstruction from a Single Image

面向人类交互的单图像三维重建

Gwanghyun Kim, Junghun James Kim, Suh Yoon Jeon, Jason Park, Se Young Chun

机构 * Seoul National University(首尔大学)

AI总结 本文提出HUG3D框架,通过建模群体和实例级信息,解决多人类场景中的几何失真和交互问题,实现高保真三维重建。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05393 2026-04-08 cs.CV cs.MM

Beyond Semantic Search: Towards Referential Anchoring in Composed Image Retrieval

超越语义检索:面向组合图像检索的指代锚定

Yuxin Yang, Yinan Zhou, Yuxin Chen, Ziqi Zhang, Zongyang Ma, Chunfeng Yuan, Bing Li, Jun Gao, Weiming Hu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Tencent Inc.(腾讯公司) PeopleAI Inc.(人民人工智能公司) HelloGroup Inc.(哈啰集团) ShanghaiTech University(上海科技大学)

AI总结 本文提出OACIR任务,通过引入对象锚定机制提升组合图像检索的实例一致性,构建了包含16万多个四元组的OACIRR基准,采用AdaFocal框架实现动态关注平衡,实验表明其在保持实例一致性方面表现优异。

Comments Accepted to CVPR 2026. Project page, dataset, and code are available at: https://hahajun1101.github.io/OACIR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05316 2026-04-08 cs.CV

Indoor Asset Detection in Large Scale 360° Drone-Captured Imagery via 3D Gaussian Splatting

通过3D高斯散射实现大规模360°无人机拍摄影像中的室内资产检测

Monica Tang, Avideh Zakhor

机构 * UC Berkeley(加州大学伯克利分校)

AI总结 本文提出一种基于3D高斯散射的室内资产检测方法,通过结合掩码语义和空间信息,提升多视角掩码关联和检测精度,实验显示在两个大型室内场景中,F1分数提升65%,mAP提升11%。

Comments Accepted to CVPR 2026 3DMV Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05171 2026-04-08 cs.CV cs.AI

Modality-Aware and Anatomical Vector-Quantized Autoencoding for Multimodal Brain MRI

多模态脑MRI的模态感知与解剖矢量量化自编码

Mingjie Li, Edward Kim, Yue Zhao, Ehsan Adeli, Kilian M. Pohl

机构 * Stanford University(斯坦福大学)

AI总结 本文提出NeuroQuant,一种基于模态感知和解剖学的3D矢量量化自编码器,用于多模态脑MRI重建,通过共享潜在表示和双流编码提升重建精度。

Comments CVPR Fingdings track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04576 2026-04-08 cs.CV

PR-IQA: Partial-Reference Image Quality Assessment for Diffusion-Based Novel View Synthesis

PR-IQA:基于扩散模型的新型视角合成的部分参考图像质量评估

Inseong Choi, Siwoo Lee, Seung-Hun Nam, Soohwan Song

机构 * Dongguk University(东国大学) NAVER WEBTOON AI

AI总结 PR-IQA通过部分参考图像评估扩散生成的视角合成图像质量,提升3D重建效果,无需真实地面真值。

Comments Accepted at CVPR 2026. Project Page: https://kakaomacao.github.io/pr-iqa-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00503 2026-04-08 cs.CV

PET-DINO: Unifying Visual Cues into Grounding DINO with Prompt-Enriched Training

PET-DINO:将视觉线索统一到Grounding DINO中通过提示增强训练

Weifu Fu, Jinyang Li, Bin-Bin Gao, Jialin Li, Yuhuan Lin, Hanqiu Deng, Wenbing Tao, Yong Liu, Chengjie Wang

机构 * YouTu Lab, Tencent(腾讯优图实验室) Huazhong University of Science and Technology(华中科技大学) Kling Team, Kuaishou Technology(快手科技可灵团队)

AI总结 PET-DINO通过提示增强训练策略,统一视觉线索到Grounding DINO中,提升零样本目标检测性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26481 2026-04-08 cs.CV

SparseCam4D: Spatio-Temporally Consistent 4D Reconstruction from Sparse Cameras

SparseCam4D:从稀疏摄像机进行时空一致的4D重建

Weihong Pan, Xiaoyu Zhang, Zhuang Zhang, Zhichao Ye, Nan Wang, Haomin Liu, Guofeng Zhang

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) InSpatio Research

AI总结 本文提出一种基于稀疏摄像机的动态重建框架,通过建模生成观测中的时空不一致性和开发完整流程,实现高保真4D重建并显著优于现有方法。

Comments CVPR 2026. Project page: https://inspatio.github.io/sparse-cam4d/ and code: https://github.com/inspatio/sparse-cam4d

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11680 2026-04-08 cs.CV

UCAN: Unified Convolutional Attention Network for Expansive Receptive Fields in Lightweight Super-Resolution

UCAN:统一的卷积注意力网络用于轻量超分辨率中的扩展感受野

Cao Thien Tan, Phan Thi Thu Trang, Do Nghiem Duc, Ho Ngoc Anh, Hanyang Zhuang, Nguyen Duc Dung

机构 * Ho Chi Minh City Open University(胡志明市开放大学) AI Tech Lab, Ho Chi Minh City University of Technology(胡志明市科技大学人工智能技术实验室) Code Mely AI Research Team(Code Mely 人工智能研究团队) Global College, Shanghai Jiao Tong University(上海交通大学全球学院) Ha Noi University of Science and Technology(河内科技大学) University of Manitoba(曼尼托巴大学)

AI总结 UCAN通过融合卷积与注意力机制,有效扩展感受野,采用Hedgehog注意力和蒸馏模块实现高效轻量化,适用于资源受限设备的超分辨率恢复。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10649 2026-04-08 cs.CV

MINERVA-Cultural: A Benchmark for Cultural and Multilingual Long Video Reasoning

MINERVA-Cultural: 一个用于文化和多语言长视频推理的基准

Darshan Singh, Arsha Nagrani, Kawshik Manikantan, Harman Singh, Dinesh Tewari, Tobias Weyand, Cordelia Schmid, Anelia Angelova, Shachi Dave

机构 * Google DeepMind(谷歌DeepMind) UC Berkeley(加州大学伯克利分校)

AI总结 本文提出MINERVA-Cultural基准,旨在解决现有视频评估中文化偏见问题,通过多语言多文化视频数据和原生语言问题,推动视频推理模型的发展。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06928 2026-04-08 cs.CV

RenderFlow: Single-Step Neural Rendering via Flow Matching

RenderFlow:通过流匹配实现单步神经渲染

Shenghao Zhang, Runtao Liu, Christopher Schroers, Yang Zhang

机构 * Disney Research|Studios(迪士尼研究院/工作室) ETH Zürich(苏黎世联邦理工学院)

AI总结 本文提出RenderFlow框架,通过流匹配方法实现单步神经渲染,解决传统渲染方法的效率与精度问题,提升渲染质量和视觉效果。

Comments CVPR 2026; Supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13592 2026-04-08 cs.LG cs.CV

Image Diffusion Preview with Consistency Solver

图像扩散预览与一致性求解器

Fu-Yun Wang, Hao Zhou, Liangzhe Yuan, Sanghyun Woo, Boqing Gong, Bohyung Han, Ming-Hsuan Yang, Han Zhang, Yukun Zhu, Ting Liu, Long Zhao

机构 * Google DeepMind(谷歌DeepMind) The Chinese University of Hong Kong(香港中文大学) Seoul National University(首尔大学)

AI总结 本文提出ConsistencySolver,通过强化学习优化的轻量高阶求解器,提升图像扩散预览的质量与一致性,减少推理步骤,提高交互效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18359 2026-04-08 cs.CV

TRANSPORTER: Transferring Visual Semantics from VLM Manifolds

TRANSPORTER:从VLM流形转移视觉语义

Alexandros Stergiou

机构 * University of Twente, NL(荷兰特温特大学)

AI总结 本文提出TRANSPORTER方法,通过logits-to-video任务生成视频,揭示VLM预测背后的规则,为模型可解释性提供新方向。

Comments Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026, Project page: https://alexandrosstergiou.github.io/TRANSPORTER

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10610 2026-04-08 cs.CR cs.AI

LaSM: Layer-wise Scaling Mechanism for Defending Pop-up Attack on GUI Agents

LaSM:用于防御GUI代理中弹出攻击的分层缩放机制

Zihe Yan, Jiaping Gui, Zhuosheng Zhang, Gongshen Liu

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出LaSM机制,通过分层放大关键层的注意力和MLP模块,提升模型对任务相关区域的对齐性,有效防御弹出攻击,同时不影响模型整体能力。

Comments Accepted by CVPR-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22397 2026-04-08 eess.IV cs.AI cs.CV

HazeMatching: Dehazing Light Microscopy Images with Guided Conditional Flow Matching

HazeMatching:利用引导条件流匹配去雾光学显微镜图像

Anirban Ray, Ashesh Ashesh, Florian Jug

机构 * Human Technopole(人类技术中心) Technische Universität Dresden(德累斯顿工业大学)

AI总结 本文提出HazeMatching方法,通过引导条件流匹配框架平衡去雾图像的保真度与真实感,利用模糊观测引导生成过程,有效解决显微图像去雾中的保真与真实感平衡问题。

Comments Accepted to IEEE/CVF CVPR 2026 (Findings). 4 figures, 8 pages + refs, 45 pages total (including supplement), 28 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00727 2026-04-08 cs.LG cs.CR cs.CV

Perturb and Recover: Fine-tuning for Effective Backdoor Removal from CLIP

扰动与恢复:用于从CLIP中有效移除后门的微调

Naman Deep Singh, Francesco Croce, Matthias Hein

机构 * University of Tübingen & Tübingen AI Center(蒂宾根大学 & 蒂宾根人工智能中心) EPFL(瑞士联邦理工学院洛桑)

AI总结 本文提出PAR机制,通过微调有效移除CLIP中的后门,实验表明其在不同编码器和攻击类型上均能保持良好性能,且无需真实训练数据。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05366 2026-04-08 cs.CV

The DeepSpeak Dataset

DeepSpeak 数据集

Sarah Barrington, Maty Bohacek, Hany Farid

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

AI总结 本文提出DeepSpeak数据集,包含超过100小时的真实和深度伪造音频视频内容,旨在解决复杂的说话人头像场景。通过提供高质量的真实数据和生成的深度伪造数据,以及基于嵌入的身份匹配方法,提升深度伪造检测的鲁棒性。

Comments https://github.com/hfaridlab/deepspeak

Journal ref Published in CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06535 2026-04-08 cs.CV cs.LG

Controllable Image Generation with Composed Parallel Token Prediction

通过组合并行令牌预测实现可控图像生成

Jamie Stirling, Noura Al-Moubayed, Chris G. Willcocks, Hubert P. H. Shum

机构 * Durham University(杜伦大学)

AI总结 本文提出一种理论指导的离散生成过程组合方法,通过掩码生成(吸收扩散)实现多输入条件的精确组合,提升图像生成的可控性和效率。

Comments 8 pages + references, 7 figures, accepted to CVPR Workshops 2026 (LoViF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04934 2026-04-07 cs.CV

Vanast: Virtual Try-On with Human Image Animation via Synthetic Triplet Supervision

Vanast:通过合成三元监督实现的人像虚拟试穿

Hyunsoo Cha, Wonjung Woo, Byungjun Kim, Hanbyul Joo

机构 * Seoul National University(首尔国立大学)

AI总结 Vanast通过统一框架直接从单张人体图像、服装图像和姿态引导视频生成服装转移的人形动画视频,解决传统两阶段流程导致的身份漂移、服装扭曲和前后不一致问题。

Comments Accepted to CVPR 2026, Project Page: https://hyunsoocha.github.io/vanast/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04933 2026-04-07 cs.CV

PointTPA: Dynamic Network Parameter Adaptation for 3D Scene Understanding

PointTPA:用于3D场景理解的动态网络参数适应

Siyuan Liu, Chaoqun Zheng, Xin Zhou, Tianrui Feng, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学)

AI总结 PointTPA通过动态网络参数适应提升3D场景理解,采用SNG和DPP方法生成输入感知参数,实现参数高效且在ScanNet上取得78.4% mIoU。

Comments Accepted by CVPR 2026. The code is available at https://github.com/H-EmbodVis/PointTPA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04913 2026-04-07 cs.CV

A Frame is Worth One Token: Efficient Generative World Modeling with Delta Tokens

一个标记值得一个标记:高效生成世界建模与Delta标记

Tommie Kerssies, Gabriele Berton, Ju He, Qihang Yu, Wufei Ma, Daan de Geus, Gijs Dubbelman, Liang-Chieh Chen

机构 * Amazon(亚马逊) Eindhoven University of Technology(埃因霍温理工大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出DeltaTok和DeltaWorld,通过将视频特征差值编码为单个连续标记,实现高效生成世界建模,减少参数和计算量,提升预测多样性。

Comments CVPR 2026. Code and weights: https://deltatok.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04887 2026-04-07 cs.CV

HorizonWeaver: Generalizable Multi-Level Semantic Editing for Driving Scenes

HorizonWeaver: 通用多级语义编辑用于驾驶场景

Mauricio Soroco, Francesco Pittaluga, Zaid Tasneem, Abhishek Aich, Bingbing Zhuang, Wuyang Chen, Manmohan Chandraker, Ziyu Jiang

机构 * Simon Fraser University(西蒙菲莎大学) NEC Labs America(NEC美国实验室)

AI总结 本文提出HorizonWeaver,通过多级粒度、丰富高层语义和普遍领域转移解决驾驶场景编辑难题,构建大规模数据集并改进模型与训练方法,实现复杂驾驶场景的高质量指令驱动编辑。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04859 2026-04-07 cs.CV

Unified Vector Floorplan Generation via Markup Representation

通过标记表示实现统一的向量平面图生成

Kaede Shiohara, Toshihiko Yamasaki

机构 * The University of Tokyo(东京大学)

AI总结 本文提出Floorplan Markup Language,通过统一的结构化语法生成平面图,开发出 FMLM 模型,在多种条件下生成高质量平面图,实验显示其优于以往专用方法。

Comments CVPR 2026. Webpage: https://mapooon.github.io/FMLPage

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04722 2026-04-07 cs.CV

Don't Waste Bits! Adaptive KV-Cache Quantization for Lightweight On-Device LLMs

不要浪费比特!面向轻量级设备LLM的自适应KV缓存量化

Sayed Pedram Haeri Boroujeni, Niloufar Mehrabi, Patrick Woods, Gabriel Hillesheim, Abolfazl Razi

机构 * Clemson University(克莱姆森大学)

AI总结 本文提出自适应KV缓存量化方法,通过动态调整token重要性分配比特数,减少内存和延迟并提升准确性。

Comments Accepted by the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04575 2026-04-07 cs.CV

Erasure or Erosion? Evaluating Compositional Degradation in Unlearned Text-To-Image Diffusion Models

擦除或侵蚀?评估未学习文本到图像扩散模型中的组合退化

Arian Komaei Koma, Seyed Amir Kasaei, Ali Aghayari, AmirMahdi Sadeghzadeh, Mohammad Hossein Rohban

AI总结 本文通过组合文本到图像生成视角,评估未学习方法对 nudity 的影响,发现去除非目标概念与组合完整性之间存在权衡,现有评估方法存在局限。

Comments Accepted at CVPR 2026 Workshop on Machine Unlearning for Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04500 2026-04-07 cs.CV

Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward

Saliency-R1: 通过显著图对齐奖励增强可解释性和忠实的视觉-语言推理

Shizhan Gong, Minda Hu, Qiyuan Zhang, Chen Ma, Qi Dou

机构 * The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学)

AI总结 Saliency-R1通过显著图对齐奖励提升视觉-语言模型的推理可解释性和忠实性,利用显著图技术高效突出关键图像区域,结合GRPO优化策略增强模型对相关区域的关注,实验显示提升推理忠实性和任务性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04490 2026-04-07 eess.SP cs.AI eess.IV

RAVEN: Radar Adaptive Vision Encoders for Efficient Chirp-wise Object Detection and Segmentation

RAVEN:用于高效脉冲波束成像的雷达自适应视觉编码器

Anuvab Sen, Mir Sayeed Mohammad, Saibal Mukhopadhyay

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 RAVEN通过高效处理雷达数据实现目标检测和分割,采用自适应编码和早退出机制提升效率,减少计算量和延迟。

Comments CVPR submission / conference paper

Journal ref Computer Vision and Pattern Recognition Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04484 2026-04-07 eess.IV cs.CV

TM-BSN: Triangular-Masked Blind-Spot Network for Real-World Self-Supervised Image Denoising

TM-BSN:三角掩码盲 spot 网络用于真实世界自监督图像去噪

Junyoung Park, Youngjin Oh, Nam Ik Cho

机构 * Department of ECE, INMC, Seoul National University(首尔大学电气与计算机工程系、INMC) IPAI, Seoul National University(首尔大学IPAI)

AI总结 本文提出TM-BSN网络,通过三角掩码建模真实sRGB噪声的空间相关性,无需下采样即可实现高效自监督图像去噪,实验表明其性能优于现有方法。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04425 2026-04-07 cs.CV

HandDreamer: Zero-Shot Text to 3D Hand Model Generation using Corrective Hand Shape Guidance

HandDreamer: 通过纠正手形引导实现零样本文本到3D手模型生成

Green Rosh, Prateek Kukreja, Vishakha SR, Pawan Prasad B H

机构 * Samsung R&D Institute India Bangalore(三星印度班加罗尔研发中心)

AI总结 本文提出HandDreamer,通过MANO手模型初始化和手骨骼引导扩散过程,解决零样本文本生成3D手模型中的视角不一致和细节丢失问题,提升手部结构的自洽性与多样性。

Comments Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏