arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-04-22 至 2026-04-22 共收录 26
2604.19556 2026-04-22 cs.CV

Paparazzo: Active Mapping of Moving 3D Objects

Paparazzo:移动3D物体的主动映射

Davide Allegro, Shiyao Li, Stefano Ghidoni, Vincent Lepetit

机构 * University of Padova(帕多瓦大学)

AI总结 本文提出Paparazzo方法,通过学习-free方案实现移动3D物体的主动映射,提升3D重建的完整性和准确性,建立新基准测试。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19445 2026-04-22 cs.CV

LoViF 2026 Challenge on Real-World All-in-One Image Restoration: Methods and Results

LoViF 2026挑战:现实世界一站式图像修复方法与结果

Xiang Chen, Hao Li, Jiangxin Dong, Jinshan Pan, Xin Li, Xin He, Naiwei Chen, Shengyuan Li, Fengning Liu, Haoyi Lv, Haowei Peng, Yilian Zhong, Yuxiang Chen, Shibo Yin, Yushun Fang, Xilei Zhu, Yahui Wang, Chen Lu, Kaibin Chen, Xu Zhang, Xuhui Cao, Jiaqi Ma, Ziqi Wang, Shengkai Hu, Yuning Cui, Huan Zhang, Shi Chen, Bin Ren, Lefei Zhang, Guanglu Dong, Qiyao Zhao, Tianheng Zheng, Chunlei Li, Lichao Mou, Chao Ren, Wangzhi Xing, Xin Lu, Enxuan Gu, Jingxi Zhang, Diqi Chen, Qiaosi Yi, Bingcai Wei, Mingyu Liu, Pengyu Wang, Ce Liu, Miaoxin Guan, Boyu Chen, Hongyu Li, Jian Zhu, Xinrui Luo, Ziyang He, Jiayu Wang, Yichen Xiang, Huayi Qi, Haoyu Bian, Yiran Li, Sunlichen Zhou

AI总结 本文综述了LoViF挑战在现实世界一站式图像修复中的方法与结果,分析了多种退化条件下的修复技术,推动了统一修复模型的鲁棒性和泛化能力。

Comments CVPR Workshops 2026; https://lowlevelcv.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19432 2026-04-22 cs.CV

DINO Eats CLIP: Adapting Beyond Knowns for Open-set 3D Object Retrieval

DINO Eats CLIP:超越已知领域进行开放集3D物体检索

Xinwei He, Yansong Zheng, Qianru Han, Zhichuan Wang, Yuxuan Cai, Yang Zhou, Jingbo Xia, Yulong Wang, Jinhai Xiang, Xiang Bai

机构 * Huazhong Agricultural University(华中农业大学) Huazhong University of Science and Technology(华中科技大学) Shenzhen University(深圳大学)

AI总结 本文提出DEC框架,通过动态多视图整合和虚拟特征合成模块,提升开放集3D物体检索的性能,解决已知类别过拟合问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19420 2026-04-22 cs.CV

TESO: Online Tracking of Essential Matrix by Stochastic Optimization

TESO:通过随机优化在线跟踪本质矩阵

Jaroslav Moravec, Radim Šára, Akihiro Sugimoto

机构 * Czech Technical University in Prague(捷克技术大学布拉格) National Institute of Informatics(国家信息研究所)

AI总结 本文提出TESO方法,通过鲁棒损失函数和自适应随机优化实现对本质矩阵的在线跟踪,提升立体视觉精度与一致性,适用于资源受限的在线感知系统。

Comments Accepted at CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19392 2026-04-22 cs.CV

HarmoniDiff-RS: Training-Free Diffusion Harmonization for Satellite Image Composition

HarmoniDiff-RS:无训练扩散谐调用于卫星图像合成

Xiaoqi Zhuang, Jefersson A. Dos Santos, Jungong Han

机构 * The University of Sheffield(谢菲尔德大学) Tsinghua University(清华大学)

AI总结 本文提出HarmoniDiff-RS,一种无训练的扩散框架,用于在不同领域条件下谐调合成卫星图像。通过潜在均值偏移操作对齐源域和目标域,结合时间步的潜在融合策略生成候选合成图像,并利用轻量级和谐分类器选择最一致的结果。

Comments 8 pages, 6 figures, CVPR 2026 findings. Code is available at https://github.com/XiaoqiZhuang/HarmoniDiff-RS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19379 2026-04-22 cs.CV

PanDA: Unsupervised Domain Adaptation for Multimodal 3D Panoptic Segmentation in Autonomous Driving

PanDA: 无监督领域自适应用于自动驾驶中的多模态3D全景分割

Yining Pan, Shijie Li, Yuchen Wu, Xulei Yang, Na Zhao

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Institute for Infocomm Research (I2R), A*STAR, Singapore(新加坡资讯通信研究院(I2R),A*STAR,新加坡)

AI总结 本文提出PanDA框架,针对多模态3D全景分割的无监督领域自适应问题,通过不对称多模态增强和双专家伪标签细化模块提升鲁棒性和伪标签完整性,实验表明在多种领域转移场景下超越现有SOTA方法。

Comments Accepted at the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19369 2026-04-22 cs.CV

IonMorphNet: Generalizable Learning of Ion Image Morphologies for Peak Picking in Mass Spectrometry Imaging

IonMorphNet:质谱成像中离子图像形态的通用学习方法用于峰识别

Philipp Weigand, Niels Nawrot, Nikolas Ebert, Carsten Hopf, Oliver Wasenmüller

机构 * Mannheim University of Applied Sciences(曼海姆应用科学大学) Faculty of Biosciences, Heidelberg University(海德堡大学生物科学学院)

AI总结 IonMorphNet通过空间结构感知的表示模型实现无需任务特定监督的全数据驱动峰识别,提升多数据集性能并应用于肿瘤分类。

Comments This paper has been accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22650 2026-04-22 cs.CV cs.RO

MAGICIAN: Efficient Long-Term Planning with Imagined Gaussians for Active Mapping

MAGICIAN: 通过想象高斯分布实现高效的长期规划用于主动建图

Shiyao Li, Antoine Guédon, Shizhe Chen, Vincent Lepetit

机构 * LIGM, École Nationale des Ponts et Chaussées, IP Paris, Univ Gustave Eiffel, CNRS, France(LIGM,巴黎国立桥梁与道路学院,IP巴黎,格雷夫埃菲尔大学,法国国家科学研究中心,法国) École Polytechnique, France(法国高等理工学院,法国) Inria, École normale supérieure, CNRS, PSL Research University, France(法国国家科学研究中心,巴黎高等师范学院,法国国家信息与自动化技术研究院,法国)

AI总结 MAGICIAN通过想象高斯分布实现高效长期规划,提升主动建图的探索效率与重建完整性,适用于不同动作空间的室内和室外基准测试。

Comments Accepted at CVPR 2026 (Oral). Project webpage: https://shiyao-li.github.io/magician/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20409 2026-04-22 cs.CV cs.LG

CLIPoint3D: Language-Grounded Few-Shot Unsupervised 3D Point Cloud Domain Adaptation

CLIPoint3D: 基于语言的少样本无监督3D点云领域适应

Mainak Singha, Sarthak Mehrotra, Paolo Casari, Subhasis Chaudhuri, Elisa Ricci, Biplab Banerjee

机构 * University of Trento(特伦托大学) MDSR Labs Adobe(Adobe MDSR实验室) IIT Bombay(印度理工学院班加罗尔分校) Fondazione Bruno Kessler(布鲁诺·科斯勒基金会)

AI总结 本文提出CLIPoint3D,首个基于CLIP的3D点云无监督领域适应框架,通过知识驱动的提示调优和熵引导视图采样策略,实现跨领域3D点云适应,实验表明在PointDA-10和GraspNetPC-10基准上性能提升3-16%。

Comments Accepted in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03337 2026-04-22 cs.CV

Less is More: Token-Efficient Video-QA via Adaptive Frame-Pruning and Semantic Graph Integration

少即是多:通过自适应帧剪枝和语义图集成实现高效的视频问答

Shaoguang Wang, Weiyu Guo, Ziyang Chen, Yijie Xu, Xuming Hu, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州)中国) The Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科技大学,香港特别行政区,中国)

AI总结 本文提出一种结合自适应帧剪枝和轻量级语义图的框架,有效减少视频问答中输入token数量,提升效率并增强基模型性能。

Comments Accepted to CVPR 2026 Findings

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.02296 2026-04-22 cs.CV

Data Leakage Detection and De-duplication in Large Scale Geospatial Image Datasets

大规模遥感图像数据集中的数据泄露检测与去重

Yeshwanth Kumar Adimoolam, Charalambos Poullis, Melinos Averkiou

机构 * CYENS Centre of Excellence(CYENS卓越中心) Concordia University(康科迪亚大学) Cyprus University of Technology(塞浦路斯技术大学)

AI总结 研究分析了三个常用数据集,发现AICrowd Mapping Challenge数据集中90%的训练图像存在重复,验证集有93%的数据泄露,提出数据验证管道以解决这些问题,提升模型可靠性。

Comments 15 pages, 8 figures, 6 tables (Accepted as CVPR 2026 Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19318 2026-04-22 cs.CV

Multi-view Crowd Tracking Transformer with View-Ground Interactions Under Large Real-World Scenes

多视角人群跟踪变压器与视图-地面交互在大场景中的应用

Qi Zhang, Jixuan Chen, Kaiyi Zhang, Xinquan Yu, Antoni B. Chan, Hui Huang

机构 * College of Computer Science and Software Engineering, Shenzhen University, China(深圳大学计算机科学与软件工程学院,中国) Department of Computer Science, City University of Hong Kong, China(香港城市大学计算机科学系,中国)

AI总结 本文提出MVTrackTrans模型,通过相机视角与地面平面的交互提升多视角人群跟踪性能,并构建了两个大规模真实世界数据集,验证了模型在大场景下的优势。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19257 2026-04-22 cs.CV

Unposed-to-3D: Learning Simulation-Ready Vehicles from Real-World Images

未置姿到3D:从真实世界图像学习仿真准备的车辆

Hongyuan Liu, Bochao Zou, Qiankun Liu, Haochen Yu, Qi Mei, Jianfei Jiang, Chen Liu, Cheng Bi, Zhao Wang, Xueyang Zhang, Yifei Zhan, Jiansheng Chen, Huimin Ma

机构 * University of Science and Technology Beijing(北京科技大学) Li Auto Inc(利汽车公司)

AI总结 本文提出Unposed-to-3D框架,通过图像-only监督从真实驾驶图像重建3D车辆,解决现有方法在真实世界分布上的领域差距问题,实现姿态一致且符合仿真的3D模型生成。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19202 2026-04-22 cs.GR cs.CV

SketchFaceGS: Real-Time Sketch-Driven Face Editing and Generation with Gaussian Splatting

SketchFaceGS: 基于草图的实时人脸编辑与生成与高斯点散布

Bo Li, Jiahao Kang, Yubo Ma, Feng-Lin Liu, Bin Liu, Fang-Lue Zhang, Lin Gao

机构 * Shandong Technology and Business University(山东科技与商务大学) Nanchang Hangkong University(南昌航空大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) University of New South Wales(新南威尔士大学)

AI总结 本文提出SketchFaceGS,通过高斯点散布实现基于2D草图的实时人脸生成与编辑,采用粗到细架构和UV特征预测模块,提升生成和编辑的精度与灵活性。

Comments Accepted to CVPR 2026 as a Highlight. Jittor implementation: https://github.com/gogoneural/SketchFaceGS_jittor. (C) 2026 IEEE. Personal use of this material is permitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19141 2026-04-22 cs.CV

Denoising, Fast and Slow: Difficulty-Aware Adaptive Sampling for Image Generation

去噪、快速与缓慢:面向图像生成的难度感知自适应采样

Johannes Schusterbauer, Ming Gui, Yusong Li, Pingchuan Ma, Felix Krause, Björn Ommer

机构 * CompVis LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

AI总结 本文提出Patch Forcing框架,通过自适应采样和空间噪声变化提升图像生成效果,优于传统基线方法,适用于分类条件ImageNet和文本到图像生成。

Comments CVPR 2026, Code: https://github.com/CompVis/patch-forcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18957 2026-04-22 cs.CV

Bridging Foundation Models and ASTM Metallurgical Standards for Automated Grain Size Estimation from Microscopy Images

弥合基础模型与ASTM冶金标准以实现显微图像中的晶粒尺寸自动估计

Abdul Mueez, Shruti Vyas

机构 * University of Central Florida(中央佛罗里达大学)

AI总结 本文提出一种结合Cellpose-SAM和ASTM E112 Jeffries平面模块的自动化管道,用于显微图像中的密集实例分割和晶粒尺寸估计,通过拓扑感知梯度追踪和适应性提示生成,实现高精度的冶金评估。

Comments Accepted at the 11th IEEE Workshop on Computer Vision for Multimodal Microscopy Image Analysis (CVMI), CVPR Workshops 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18881 2026-04-22 cs.CV cs.AI

A Proxy Consistency Loss for Grounded Fusion of Earth Observation and Location Encoders

一种用于地球观测与位置编码器 grounded 融合的代理一致性损失

Zhongying Wang, Kevin Lane, Levi Cai, Morteza Karimzadeh, Esther Rolf

机构 * University of Colorado, Boulder(科罗拉多大学,博尔德)

AI总结 本文提出代理一致性损失,通过可训练的位置编码器融合地球观测数据与代理变量,提升小样本下的预测性能与鲁棒性。

Comments Accepted to EarthVision 2026 (CVPR Workshop). 13 pages total (10 pages main paper + 3 pages supplementary material), 5 main figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18867 2026-04-22 cs.CV cs.AI cs.LG

Hierarchically Robust Zero-shot Vision-language Models

层次化鲁棒零样本视觉-语言模型

Junhao Dong, Yifei Zhang, Hao Zhu, Yew-Soon Ong, Piotr Koniusz

机构 * Nanyang Technological University(南洋理工大学) CFAR, IHPC, A*STAR(CFAR、IHPC、A*STAR) Northwest Polytechnical University(西北工业大学) Data61 CSIRO University of New South Wales(新南威尔士大学)

AI总结 本文提出基于层次嵌入的鲁棒微调框架,提升视觉-语言模型对对抗攻击的鲁棒性,通过多级对抗对齐和层次嵌入深度控制,增强模型泛化能力与语义多样性。

Comments This paper is accepted by CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18829 2026-04-22 cs.CV

DUALVISION: RGB-Infrared Multimodal Large Language Models for Robust Visual Reasoning

DUALVISION:用于鲁棒视觉推理的RGB-红外多模态大语言模型

Abrar Majeedi, Zhiyuan Ruan, Ziyi Zhao, Hongcheng Wang, Jianglin Lu, Yin Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Amazon(亚马逊) Northeastern University(东北大学)

AI总结 本文提出DUALVISION,通过局部化交叉注意力融合IR-RGB信息,提升多模态大语言模型在视觉退化条件下的性能,并引入DV-204K和DV-500数据集进行评估。

Comments Accepted at CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18811 2026-04-22 cs.LG cs.CV

Rethinking Dataset Distillation: Hard Truths about Soft Labels

重新思考数据集蒸馏:关于软标签的硬事实

Priyam Dey, Aditya Sahdev, Sunny Bhati, Konda Reddy Mopuri, R. Venkatesh Babu

机构 * Vision and AI Lab, Indian Institute of Science, Bangalore(印度科学研究院视觉与人工智能实验室,班加罗尔) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) IIT Hyderabad(海得拉巴理工学院)

AI总结 本文重新审视数据集蒸馏,发现软标签在下游模型训练中性能与随机基线相当,提出CAD-Prune和CA2D方法提升数据效率。

Comments CVPR 2026 (Oral). First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17797 2026-04-22 cs.CV

Weakly-Supervised Referring Video Object Segmentation through Text Supervision

通过文本监督实现弱监督的指称视频对象分割

Miaojing Shi, Jun Huang, Zijie Yue, Hanli Wang

机构 * College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院)

AI总结 本文提出WSRVOS方法,通过文本表达训练模型,利用对比学习生成正负表达,实现细粒度多模态对齐,并引入实例感知分类和伪掩码融合策略,提升视频对象分割性能。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17736 2026-04-22 cs.CV

IncreFA: Breaking the Static Wall of Generative Model Attribution

IncreFA: 破解生成模型归因的静态壁垒

Haotian Qin, Dongliang Chang, Yueying Gao, Yuexuan Tan, Lei Chen, Zhanyu Ma

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Tsinghua University(清华大学)

AI总结 IncreFA将归因重新定义为结构化增量学习问题,通过层级约束和潜在记忆库机制,在28个生成模型上实现最先进的归因准确率和未见检测率。

Comments Accepted to CVPR 2026, with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16177 2026-04-22 cs.CV

Winner of CVPR2026 NTIRE Challenge on Image Shadow Removal: Semantic and Geometric Guidance for Shadow Removal via Cascaded Refinement

CVPR2026图像阴影去除挑战赛冠军:基于级联细化的语义与几何引导的阴影去除

Lorenzo Beltrame, Jules Salzinger, Filip Svoboda, Jasmin Lampert, Phillipp Fanta-Jende, Radu Timofte, Marco Körner

机构 * Austrian Institute of Technology(奥地利理工学院) Technical University of Munich(慕尼黑技术大学) University of Cambridge(剑桥大学) University of Würzburg(乌尔姆大学)

AI总结 本文提出一种三阶段渐进式阴影去除管道,结合冻结的DINOv2语义引导和单目深度及表面法线几何线索,通过级联细化消除残留误差,最终在WSRD+2026测试集上取得最佳成绩。

Comments 10 pages, 4 figures, 5 tables, accepted at the CVPR 2026 Workshops (NTIRE 2026 Image Shadow Removal Challenge). Code and materials are available at https://github.com/AIT-Assistive-Autonomous-Systems/SGCR-SR . Corrected author name spelling in metadata and manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06665 2026-04-22 cs.CV

VDPP: Video Depth Post-Processing for Speed and Scalability

VDPP:用于速度和可扩展性的视频深度后处理

Daewon Yoon, Injun Baek, Sangyu Han, Yearim Kim, Nojun Kwak

机构 * Seoul National University(首尔国立大学) Samsung Electronics(三星电子)

AI总结 本文提出VDPP框架,通过改进视频深度估计的后处理速度和精度,采用几何细化方法提升效率,实现与端到端系统同等的时序一致性,同时具备RGB-free架构,支持实时边缘部署。

Comments 8 pages, 6 figures. Accepted to CVPR 2026 ECV Workshop. Project page: https://github.com/injun-baek/VDPP

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15577 2026-04-22 cs.CV

MoonSeg3R: Monocular Online Zero-Shot Segment Anything in 3D with Reconstructive Foundation Priors

MoonSeg3R: 单目在线零样本三维实例分割与重建基础先验

Zhipeng Du, Duolikun Danier, Jan Eric Lenssen, Hakan Bilen

机构 * University of Edinburgh(爱丁堡大学) Max Planck Institute for Informatics, SIC(马克斯·普朗克信息研究所,SIC)

AI总结 本文提出MoonSeg3R,通过引入自监督查询精炼模块、3D查询索引记忆和CUT3R状态分布token,实现单目在线零样本三维实例分割,性能媲美RGB-D系统。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00993 2026-04-22 cs.CV

PhotoFramer: Multi-modal Image Composition Instruction

PhotoFramer:多模态图像构图指令

Zhiyuan You, Ke Wang, He Zhang, Xin Cai, Jinjin Gu, Tianfan Xue, Chao Dong, Zhoutong Zhang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Adobe NextCam Adobe Research Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(InnoHK下的CPII) Shenzhen University of Advanced Technology(深圳先进技术大学)

AI总结 PhotoFramer通过多模态框架为用户提供图像构图指导,通过自然语言描述改进方法并生成示例图像,结合文本与图像生成模型提升日常用户构图能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏