arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-04-07 至 2026-04-07 共收录 58
2604.04934 2026-04-07 cs.CV

Vanast: Virtual Try-On with Human Image Animation via Synthetic Triplet Supervision

Vanast:通过合成三元监督实现的人像虚拟试穿

Hyunsoo Cha, Wonjung Woo, Byungjun Kim, Hanbyul Joo

机构 * Seoul National University(首尔国立大学)

AI总结 Vanast通过统一框架直接从单张人体图像、服装图像和姿态引导视频生成服装转移的人形动画视频,解决传统两阶段流程导致的身份漂移、服装扭曲和前后不一致问题。

Comments Accepted to CVPR 2026, Project Page: https://hyunsoocha.github.io/vanast/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04933 2026-04-07 cs.CV

PointTPA: Dynamic Network Parameter Adaptation for 3D Scene Understanding

PointTPA:用于3D场景理解的动态网络参数适应

Siyuan Liu, Chaoqun Zheng, Xin Zhou, Tianrui Feng, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学)

AI总结 PointTPA通过动态网络参数适应提升3D场景理解,采用SNG和DPP方法生成输入感知参数,实现参数高效且在ScanNet上取得78.4% mIoU。

Comments Accepted by CVPR 2026. The code is available at https://github.com/H-EmbodVis/PointTPA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04913 2026-04-07 cs.CV

A Frame is Worth One Token: Efficient Generative World Modeling with Delta Tokens

一个标记值得一个标记:高效生成世界建模与Delta标记

Tommie Kerssies, Gabriele Berton, Ju He, Qihang Yu, Wufei Ma, Daan de Geus, Gijs Dubbelman, Liang-Chieh Chen

机构 * Amazon(亚马逊) Eindhoven University of Technology(埃因霍温理工大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出DeltaTok和DeltaWorld,通过将视频特征差值编码为单个连续标记,实现高效生成世界建模,减少参数和计算量,提升预测多样性。

Comments CVPR 2026. Code and weights: https://deltatok.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04887 2026-04-07 cs.CV

HorizonWeaver: Generalizable Multi-Level Semantic Editing for Driving Scenes

HorizonWeaver: 通用多级语义编辑用于驾驶场景

Mauricio Soroco, Francesco Pittaluga, Zaid Tasneem, Abhishek Aich, Bingbing Zhuang, Wuyang Chen, Manmohan Chandraker, Ziyu Jiang

机构 * Simon Fraser University(西蒙菲莎大学) NEC Labs America(NEC美国实验室)

AI总结 本文提出HorizonWeaver,通过多级粒度、丰富高层语义和普遍领域转移解决驾驶场景编辑难题,构建大规模数据集并改进模型与训练方法,实现复杂驾驶场景的高质量指令驱动编辑。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04859 2026-04-07 cs.CV

Unified Vector Floorplan Generation via Markup Representation

通过标记表示实现统一的向量平面图生成

Kaede Shiohara, Toshihiko Yamasaki

机构 * The University of Tokyo(东京大学)

AI总结 本文提出Floorplan Markup Language,通过统一的结构化语法生成平面图,开发出 FMLM 模型,在多种条件下生成高质量平面图,实验显示其优于以往专用方法。

Comments CVPR 2026. Webpage: https://mapooon.github.io/FMLPage

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04722 2026-04-07 cs.CV

Don't Waste Bits! Adaptive KV-Cache Quantization for Lightweight On-Device LLMs

不要浪费比特!面向轻量级设备LLM的自适应KV缓存量化

Sayed Pedram Haeri Boroujeni, Niloufar Mehrabi, Patrick Woods, Gabriel Hillesheim, Abolfazl Razi

机构 * Clemson University(克莱姆森大学)

AI总结 本文提出自适应KV缓存量化方法,通过动态调整token重要性分配比特数,减少内存和延迟并提升准确性。

Comments Accepted by the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04575 2026-04-07 cs.CV

Erasure or Erosion? Evaluating Compositional Degradation in Unlearned Text-To-Image Diffusion Models

擦除或侵蚀?评估未学习文本到图像扩散模型中的组合退化

Arian Komaei Koma, Seyed Amir Kasaei, Ali Aghayari, AmirMahdi Sadeghzadeh, Mohammad Hossein Rohban

AI总结 本文通过组合文本到图像生成视角,评估未学习方法对 nudity 的影响,发现去除非目标概念与组合完整性之间存在权衡,现有评估方法存在局限。

Comments Accepted at CVPR 2026 Workshop on Machine Unlearning for Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04500 2026-04-07 cs.CV

Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward

Saliency-R1: 通过显著图对齐奖励增强可解释性和忠实的视觉-语言推理

Shizhan Gong, Minda Hu, Qiyuan Zhang, Chen Ma, Qi Dou

机构 * The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学)

AI总结 Saliency-R1通过显著图对齐奖励提升视觉-语言模型的推理可解释性和忠实性,利用显著图技术高效突出关键图像区域,结合GRPO优化策略增强模型对相关区域的关注,实验显示提升推理忠实性和任务性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04490 2026-04-07 eess.SP cs.AI eess.IV

RAVEN: Radar Adaptive Vision Encoders for Efficient Chirp-wise Object Detection and Segmentation

RAVEN:用于高效脉冲波束成像的雷达自适应视觉编码器

Anuvab Sen, Mir Sayeed Mohammad, Saibal Mukhopadhyay

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 RAVEN通过高效处理雷达数据实现目标检测和分割,采用自适应编码和早退出机制提升效率,减少计算量和延迟。

Comments CVPR submission / conference paper

Journal ref Computer Vision and Pattern Recognition Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04484 2026-04-07 eess.IV cs.CV

TM-BSN: Triangular-Masked Blind-Spot Network for Real-World Self-Supervised Image Denoising

TM-BSN:三角掩码盲 spot 网络用于真实世界自监督图像去噪

Junyoung Park, Youngjin Oh, Nam Ik Cho

机构 * Department of ECE, INMC, Seoul National University(首尔大学电气与计算机工程系、INMC) IPAI, Seoul National University(首尔大学IPAI)

AI总结 本文提出TM-BSN网络,通过三角掩码建模真实sRGB噪声的空间相关性,无需下采样即可实现高效自监督图像去噪,实验表明其性能优于现有方法。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04425 2026-04-07 cs.CV

HandDreamer: Zero-Shot Text to 3D Hand Model Generation using Corrective Hand Shape Guidance

HandDreamer: 通过纠正手形引导实现零样本文本到3D手模型生成

Green Rosh, Prateek Kukreja, Vishakha SR, Pawan Prasad B H

机构 * Samsung R&D Institute India Bangalore(三星印度班加罗尔研发中心)

AI总结 本文提出HandDreamer,通过MANO手模型初始化和手骨骼引导扩散过程,解决零样本文本生成3D手模型中的视角不一致和细节丢失问题,提升手部结构的自洽性与多样性。

Comments Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04420 2026-04-07 cs.LG cs.AI

Is Prompt Selection Necessary for Task-Free Online Continual Learning?

提示选择是否对无任务在线持续学习必要?

Seoyoung Park, Haemin Lee, Hankook Lee

机构 * Sungkyunkwan University(成均馆大学)

AI总结 本文提出单提示方法,无需提示选择,通过优化分类器减少遗忘,实现无任务在线持续学习的最优性能。

Comments Accepted to CVPR Findings 2026. The code is available at https://github.com/efficient-learning-lab/SinglePrompt

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04406 2026-04-07 cs.CV

3D-Fixer: Coarse-to-Fine In-place Completion for 3D Scenes from a Single Image

3D-Fixer:从单张图像生成3D场景的粗到细就地补全

Ze-Xin Yin, Liu Liu, Xinjie Wang, Wei Sui, Zhizhong Su, Jian Yang, Jin Xie

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Horizon Robotics(地平线机器人) D-Robotics

AI总结 本文提出3D-Fixer,通过粗到细的生成方案解决单张图像生成3D场景的布局和3D资产恢复问题,结合双分支条件网络和Occlusion-Robust Feature Alignment策略,提升生成精度和效率,同时引入ARSG-110K数据集提升训练效果。

Comments 17 pages, 10 figures, CVPR 2026, project page: https://zx-yin.github.io/3dfixer

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04379 2026-04-07 cs.CV

Reinforce to Learn, Elect to Reason: A Dual Paradigm for Video Reasoning

强化以学习,选择以推理:视频推理的双范式

Songyuan Yang, Weijiang Yu, Jilin Ma, Ziyu Liu, Guijian Tang, Wenjing Yang, Huibin Tan, Nong Xiao

机构 * National University of Defense Technology(国防科技大学) Sun Yat-sen University(中山大学)

AI总结 本文提出RLER双范式,通过强化学习生成证据并验证推理一致性,提升视频推理的可靠性和可解释性,实验表明其在多个基准上均取得最佳性能。

Comments Accepted at CVPR 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04372 2026-04-07 cs.CV

Graph-to-Frame RAG: Visual-Space Knowledge Fusion for Training-Free and Auditable Video Reasoning

图到帧RAG:面向无训练和可审计的视频推理的视觉空间知识融合

Songyuan Yang, Weijiang Yu, Ziyu Liu, Guijian Tang, Wenjing Yang, Huibin Tan, Nong Xiao

机构 * National University of Defense Technology(国防科技大学) Sun Yat-sen University(中山大学)

AI总结 本文提出G2F-RAG,通过视觉空间知识融合提升视频推理的可解释性和效率,减少认知负担并保留可追溯的证据轨迹。

Comments Accepted at CVPR 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04348 2026-04-07 cs.SD cs.CV cs.MM

OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text

OmniSonic: 向通用和整体音频生成迈进:从视频和文本生成音频

Weiguo Pian, Saksham Singh Kushwaha, Zhimin Chen, Shijian Deng, Kai Wang, Yunhui Guo, Yapeng Tian

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) Clemson University(克莱姆森大学) University of Toronto(多伦多大学)

AI总结 本文提出UniHAGen任务,通过视频和文本生成涵盖屏幕内外声音的综合音频场景。OmniSonic基于流匹配扩散框架,采用TriAttn-DiT架构和MoE门控机制,实现屏幕内外声音和语音的联合生成,建立新的UniHAGen-Bench基准。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04117 2026-04-07 cs.RO cs.CV cs.LG

Efficient Onboard Spacecraft Pose Estimation with Event Cameras and Neuromorphic Hardware

高效的空间飞行器姿态估计:结合事件相机与神经形态硬件

Arunkumar Rathinam, Jules Lecomte, Jost Reelsen, Gregor Lenz, Axel von Arnim, Djamila Aouada

机构 * University of Luxembourg(卢森堡大学) Fortiss GmbH(Fortiss有限公司) Technical University of Munich(慕尼黑工业大学) Paddington Robotics(Paddington机器人公司)

AI总结 本文提出一种结合事件相机与神经形态硬件的空间飞行器六自由度姿态估计方案,通过轻量事件-帧表示训练紧凑的MobileNet风格关键点回归网络,实现低功耗实时推理,展示了首个在Akida硬件上端到端运行的飞行器姿态估计演示。

Comments AI4SPACE workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01646 2026-04-07 cs.CV

MonoSAOD: Monocular 3D Object Detection with Sparsely Annotated Label

MonoSAOD:基于稀疏标注标签的单目3D物体检测

Junyoung Jung, Seokwon Kim, Jung Uk Kim

机构 * Kyung Hee University(庆熙大学)

AI总结 本文提出MonoSAOD框架,通过Road-Aware Patch Augmentation和Prototype-Based Filtering实现稀疏标注下的单目3D物体检测,结合几何保留增强与原型引导伪标签,提升稀疏监督下的检测鲁棒性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10421 2026-04-07 cs.CV

Neural Collapse in Test-Time Adaptation

测试时适应中的神经塌陷

Xiao Chen, Zhongjing Du, Jiazhen Huang, Xu Jiang, Li Lu, Jingyan Jiang, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Peking University(北京大学) Sichuan University(四川大学) Shenzhen Technology University(深圳技术大学)

AI总结 本文基于神经塌陷理论,提出NCTTA方法,通过特征与分类器对齐缓解域偏移影响,实验证明其在ImageNet-C上优于Tent。

Comments Aceepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25348 2026-04-07 cs.CV cs.HC cs.MM

Editing Physiological Signals in Videos Using Latent Representations

通过潜在表示编辑视频中的生理信号

Tianwen Zhou, Akshay Paruchuri, Josef Spjut, Kaan Akşit

机构 * University College London(伦敦大学学院) UNC Chapel Hill(北卡罗来纳大学教堂山分校) NVIDIA(英伟达)

AI总结 本文提出了一种通过潜在空间编辑视频中生理信号的方法,利用3D VAE和FiLM技术实现视觉保真度与生理信号调节的平衡,实验显示在保持高质量的同时可有效控制心率。

Comments Accepted to CVPR 2026 Subtle Visual Computing Workshop, 13 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02212 2026-04-07 cs.CV cs.CL cs.LG

SciGA: A Comprehensive Dataset for Designing Graphical Abstracts in Academic Papers

SciGA:用于学术论文中设计图形摘要的综合性数据集

Takuro Kawada, Shunsuke Kitada, Sota Nemoto, Hitoshi Iyatomi

机构 * Hosei University(法政大学)

AI总结 本文提出SciGA-145k数据集,用于支持图形摘要的选择与推荐,以及自动化生成研究。通过定义两个任务和新的评估指标CAR,推动AI for Science中的科学传播。

Comments 28 pages, 21 figures, 9 tables. Accepted to CVPR Findings 2026. Project page: https://iyatomilab.github.io/SciGA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13130 2026-04-07 cs.CV cs.AI cs.CL

ZINA: Multimodal Fine-grained Hallucination Detection and Editing

ZINA:多模态细粒度幻觉检测与编辑

Yuiga Wada, Kazuki Matsuda, Komei Sugiura, Graham Neubig

机构 * Keio AI Research Center(庆应义塾大学人工智能研究中心) Keio University(庆应义塾大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出ZINA方法,用于多模态大语言模型的细粒度幻觉检测与编辑,通过构建VisionHall数据集验证了其在检测和编辑任务中的优越性。

Comments CVPR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07002 2026-04-07 cs.CV

BePo: Dual Representation for 3D Occupancy Prediction

BePo:3D占用预测的双表示

Yunxiao Shi, Hong Cai, Jisoo Jeong, Yinhao Zhu, Shizhong Han, Amin Ansari, Fatih Porikli

机构 * Qualcomm AI Research(高通人工智能研究院) Qualcomm Technologies, Inc.(高通技术公司)

AI总结 本文提出BePo,通过结合BEV和稀疏点的双表示,解决小物体和大平面的占用预测问题,实验表明其在多个基准上表现优异且推理成本低。

Comments CVPR 2026 Workshop on Autonomous Driving

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02794 2026-04-07 cs.GR cs.AI cs.CV

PhysGaia: A Physics-Aware Benchmark with Multi-Body Interactions for Dynamic Novel View Synthesis

PhysGaia:一个包含多体相互作用的物理感知基准,用于动态新视角合成

Mijeong Kim, Gunhee Kim, Jungyoon Choi, Wonjae Roh, Bohyung Han

机构 * Computer Vision Laboratory, Seoul National University(首尔大学计算机视觉实验室)

AI总结 PhysGaia是首个关注动态新视角合成中物理一致性重建的基准,包含复杂多体交互场景和多种材料,提供高保真物理模拟和真实轨迹数据以推动相关研究。

Comments Accepted at CVPR 2026 Project page: http://cvlab.snu.ac.kr/research/PhysGaia Dataset: https://huggingface.co/datasets/mijeongkim/PhysGaia/tree/main

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16042 2026-04-07 cs.CV

Pose-dIVE: Pose-Diversified Augmentation with Diffusion Model for Person Re-Identification

姿态多样化扩散模型:用于人体重识别的姿态多样化增强

Inès Hyeonsu Kim, Woojeong Jin, Soowon Son, Junyoung Seo, Seokju Cho, JeongYeol Baek, Byeongwon Lee, JoungBin Lee, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能学院) SK Telecom(SK电讯)

AI总结 本文提出Pose-dIVE,通过扩散模型结合姿态和视角信息,增强重识别模型对姿态和视角变化的鲁棒性,提升模型泛化能力。

Comments CVPR 2026 Findings, Project page: https://cvlab-kaist.github.io/Pose-dIVE

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18716 2026-04-07 cs.CV

SketchDeco: Training-Free Latent Composition for Precise Sketch Colourisation

SketchDeco:无需训练的潜在空间构图用于精确草图着色

Chaitat Utintu, Yi-Zhe Song

机构 * SketchX, CVSSP, University of Surrey(萨里大学CVSSP实验室SketchX团队)

AI总结 SketchDeco通过无需训练的潜在空间构图方法,实现精确草图着色,结合专业设计需求与直观区域控制,利用简单掩码和颜色调色板实现空间和色彩精确指定,无需手动分配或文本提示模糊性。

Comments Accepted in CVPR 2026. Project page available at https://chaitron.github.io/SketchDeco/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04086 2026-04-07 cs.CV

LAA-X: Unified Localized Artifact Attention for Quality-Agnostic and Generalizable Face Forgery Detection

LAA-X:统一的局部化瑕疵注意力用于质量无关且可泛化的面部伪造检测

Dat Nguyen, Enjie Ghorbel, Anis Kacem, Marcella Astrid, Djamila Aouada

机构 * CRISTAL laboratory, ENSI, University of Manouba(马努巴大学ENSI学院CRISTAL实验室) SnT, University of Luxembourg(卢森堡大学SnT中心)

AI总结 本文提出LAA-X框架,通过多任务学习与数据合成结合,实现对高质量伪造和未知篡改的鲁棒检测,支持CNN和Transformer结构,提供LAA-Net和LAA-Former两种版本,能与最新方法在多个基准上竞争。

Comments Journal version of LAA-Net (CVPR 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04063 2026-04-07 cs.CV

4C4D: 4 Camera 4D Gaussian Splatting

4C4D: 4台相机的4维高斯点散布

Junsheng Zhou, Zhifan Yang, Liang Han, Wenyuan Zhang, Kanle Shi, Shenkun Xu, Yu-Shen Liu

机构 * School of Software, Tsinghua University(清华大学软件学院) Kuaishou Technology(快手科技)

AI总结 本文提出4C4D框架,通过极稀疏相机拍摄实现高保真4维高斯点散布,解决视频中4维动态场景重建问题,提升几何建模能力。

Comments Accepted by CVPR 2026. Project page: https://junshengzhou.github.io/4C4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03972 2026-04-07 cs.CV

Hierarchical Point-Patch Fusion with Adaptive Patch Codebook for 3D Shape Anomaly Detection

具有自适应补丁代码书的分层点-补丁融合用于3D形状异常检测

Xueyang Kang, Zizhao Li, Tian Lan, Dong Gong, Kourosh Khoshelham, Liangliang Nan

机构 * The University of Melbourne(墨尔本大学) Tsinghua University(清华大学) The University of New South Wales(新南威尔士大学) Delft University of Technology(代尔夫特理工大学)

AI总结 本文提出一种分层点-补丁异常评分网络,通过联合建模区域部分特征和局部点特征,提升3D形状异常检测的鲁棒性。采用自适应补丁化模块捕捉复杂结构偏差,并在公开和工业数据集上取得优越的AUC-ROC和AUC-PR性能。

Comments 10 pages, 5 figures, 6 tables

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03950 2026-04-07 cs.LG cs.AI

Diagonal-Tiled Mixed-Precision Attention for Efficient Low-Bit MXFP Inference

对角 tiled 混合精度注意力机制用于高效低比特 MXFP 推理

Yifu Ding, Xinhao Zhang, Jinyang Guo

机构 * State Key Laboratory of Complex & Critical Software Environment (SKLCCSE), Beihang University(北京航空航天大学复杂关键软件环境国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Beijing Jiaotong University(北京交通大学)

AI总结 本文提出了一种低比特混合精度注意力核,利用MXFP数据格式在下一代GPU架构上实现高效低比特MXFP推理,通过融合核和硬件级并行性提升推理速度而不牺牲模型性能。

Comments CVPR Workshop EDGE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏