arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-04-09 至 2026-04-09 共收录 31
2604.07097 2026-04-09 cs.CV

Novel Anomaly Detection Scenarios and Evaluation Metrics to Address the Ambiguity in the Definition of Normal Samples

新颖的异常检测场景和评估指标以解决正常样本定义的模糊性

Reiji Saito, Satoshi Kamiya, Kazuhiro Hotta

机构 * Meijo University(名城大学)

AI总结 本文提出新颖的异常检测场景和评估指标,以应对实际应用中正常样本定义的模糊性,并通过RePaste方法提升学习效果,实验证明其在MVTec AD基准上的优越性能。

Comments Accepted by CVPR 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06830 2026-04-09 cs.CV cs.RO

VGGT-SLAM++

VGGT-SLAM++:基于视觉几何基础变换器的视觉SLAM系统

Avilasha Mandal, Rajesh Kumar, Sudarshan Sunil Harithas, Chetan Arora

机构 * Indian Institute of Technology Delhi(印度理工学院德里分校) Addverb Technologies Brown University(布朗大学)

AI总结 VGGT-SLAM++结合视觉几何基础变换器的几何丰富输出,通过空间校正后端实现高频率局部捆绑调整,提升大规模映射精度与内存效率。

Comments 8 pages (main paper) + supplementary material. Accepted at CVPR 2026 Workshop (VOCVALC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06824 2026-04-09 cs.CV

Generate, Analyze, and Refine: Training-Free Sound Source Localization via MLLM Meta-Reasoning

生成、分析与优化:基于MLLM元推理的无训练声源定位

Subin Park, Jung Uk Kim

机构 * Kyung Hee University(庆熙大学)

AI总结 本文提出无训练的声源定位框架,利用多模态大语言模型的推理能力,通过生成-分析-优化流程实现声源定位,实验表明在单源和多源基准上表现优异。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06795 2026-04-09 cs.CV cs.AI

FedDAP: Domain-Aware Prototype Learning for Federated Learning under Domain Shift

FedDAP: 面向领域偏移的联邦学习中的领域感知原型学习

Huy Q. Le, Loc X. Nguyen, Yu Qiao, Seong Tae Kim, Eui-Nam Huh, Choong Seon Hong

机构 * G-LAMP NEXUS Institute, Kyung Hee University(庆熙大学G-LAMP NEXUS研究所) Kyung Hee University(庆熙大学)

AI总结 FedDAP通过构建领域特定的全局原型,解决联邦学习中因领域偏移导致的模型性能下降问题,通过领域感知的原型对齐提升本地学习和全局泛化能力。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06662 2026-04-09 cs.CV cs.LG

Towards Robust Content Watermarking Against Removal and Forgery Attacks

面向对抗性移除与伪造攻击的鲁棒内容水印技术

Yifan Zhu, Yihan Wang, Xiao-Shan Gao

机构 * Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) University of Chinese Academy of Sciences(中国科学院大学) University of Waterloo(滑铁卢大学)

AI总结 本文提出Instance-Specific watermarking with Two-Sided detection方法,通过动态控制水印注入时间和模式提升鲁棒性,有效对抗移除和伪造攻击。

Comments 14 pages, 5 figures, CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06631 2026-04-09 cs.LG cs.AI cs.CV

SubFLOT: Submodel Extraction for Efficient and Personalized Federated Learning via Optimal Transport

SubFLOT:通过最优传输实现高效且个性化的联邦学习子模型提取

Zheng Jiang, Nan He, Yiming Chen, Lifeng Sun

机构 * Tsinghua University(清华大学) Beijing University of Technology(北京工业大学) Key Laboratory of Pervasive Computing, Ministry of Education(普适计算教育部重点实验室)

AI总结 SubFLOT通过最优传输增强剪枝模块生成定制化子模型,结合缩放适应正则化模块缓解参数分歧,实现高效个性化联邦学习。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06467 2026-04-09 cs.CV

PhysHead: Simulation-Ready Gaussian Head Avatars

PhysHead: 可模拟的高斯头部化身

Berna Kabadayi, Vanessa Sklyarova, Wojciech Zielonka, Justus Thies, Gerard Pons-Moll

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ETH Zürich(苏黎世联邦理工学院) University of Tübingen(图宾根大学) Technical University of Darmstadt(达姆施塔特工业大学) Tübingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所)

AI总结 本文提出PhysHead,一种结合3D参数网格和发丝的混合表示方法,用于生成具有真实发丝动态的可动画头部化身,通过多视角视频学习实现逼真发丝运动。

Comments Project Page: see https://phys-head.github.io/; Youtube Video: see https://www.youtube.com/watch?v=k68fsSSwzc0; Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06349 2026-04-09 cs.LG cs.AI cs.CV

Bi-Level Optimization for Single Domain Generalization

双层优化用于单一领域泛化

Marzi Heidari, Hanping Zhang, Hao Yan, Yuhong Guo

机构 * School of Computer Science, Carleton University(卡尔顿大学计算机科学学院) Amii(阿尔伯塔机器智能研究所)

AI总结 本文提出BiSDG框架,通过双层优化分离任务学习与领域建模,利用模拟分布偏移的替代领域提升泛化能力,实验表明在单一领域泛化任务中优于现有方法。

Comments CVPR Findings Track, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06245 2026-04-09 cs.CV

CraterBench-R: Instance-Level Crater Retrieval for Planetary Scale

CraterBench-R: 行为级陨石坑检索用于行星尺度

Jichao Fang, Lei Zhang, Michael Phillips, Wei Luo

机构 * Northern Illinois University(北伊利诺伊大学) University of Arizona(亚利桑那大学)

AI总结 本文提出CraterBench-R,通过实例级图像检索解决行星表面陨石坑分析问题,展示自监督Vision Transformers在陨石坑检索中的优势,并提出实例-令牌聚合方法提升效率。

Comments Accepted at the EarthVision 2026 Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05743 2026-04-09 cs.CV cs.AI

On the Robustness of Diffusion-Based Image Compression to Bit-Flip Errors

扩散基图像压缩对位翻转错误的鲁棒性

Amit Vaisman, Gal Pomerants, Raz Lapid

机构 * Technion - Israel Institute of Technology(以色列理工学院) Deepkeep

AI总结 研究探讨了基于扩散的图像压缩在位翻转错误下的鲁棒性,提出更稳健的Turbo-DDCM变体,改进鲁棒性的同时保持率-失真-感知权衡。

Comments Accepted at AIGENS @ CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05584 2026-04-09 cs.CV

Purify-then-Align: Towards Robust Human Sensing under Modality Missing with Knowledge Distillation from Noisy Multimodal Teacher

在模态缺失情况下通过知识蒸馏从噪声多模态教师中实现鲁棒的人体感知:Purify-then-Align

Pengcheng Weng, Yanyu Qian, Yangxin Xu, Fei Wang

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) Institute of Computer Science, Universität Bern(伯尔尼大学计算机科学研究所) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 本文提出PTA框架,通过元学习和知识扩散解决多模态人体感知中模态缺失问题,通过净化知识源和对齐模态提升单模态模型鲁棒性。

Comments Accepted by CVPR 2026 Workshop On Any-to-Any Multimodal Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26588 2026-04-09 cs.CV cs.LG

From Synthetic Data to Real Restorations: Diffusion Model for Patient-specific Dental Crown Completion

从合成数据到真实修复:一种针对患者特定牙齿冠的扩散模型

Dávid Pukanec, Tibor Kubík, Michal Španěl

机构 * Department of Computer Graphics and Multimedia, Brno University of Technology, Czechia(捷克布尔诺科技大学计算机图形与多媒体系)

AI总结 本文提出ToothCraft模型,通过合成数据生成患者特定的牙齿冠修复,解决训练数据不足问题,实验显示其在IoU和CD指标上的优异表现。

Comments VISAPP 2026 Conference / CVPR Workshop GenRecon3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26167 2026-04-09 cs.CV cs.CR

Gaussian Shannon: High-Precision Diffusion Model Watermarking Based on Communication

高斯香农:基于通信的高精度扩散模型水印技术

Yi Zhang, Hongbo Huang, Liang-Jie Zhang

AI总结 本文提出Gaussian Shannon水印框架,通过将扩散过程视为噪声通信信道,实现鲁棒追踪和精确位恢复,适用于无损元数据应用。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20284 2026-04-09 cs.CV cs.GR eess.IV

STAC: Plug-and-Play Spatio-Temporal Aware Cache Compression for Streaming 3D Reconstruction

STAC:用于流式3D重建的时空感知缓存压缩

Runze Wang, Yuxuan Song, Youcheng Cai, Ligang Liu

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出STAC框架,通过时空感知缓存机制提升流式3D重建的内存效率和重建质量,减少内存消耗并加速推理。

Comments 10 pages, 6 figures. Accepted by CVPR 2026. This version includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07527 2026-04-09 cs.CV cs.GR

From Orbit to Ground: Generative City Photogrammetry from Extreme Off-Nadir Satellite Images

从轨道到地面:从极端俯仰角卫星图像生成城市光束摄影测量

Fei Yu, Yu Liu, Luyang Tang, Mingchao Sun, Zengye Ge, Rui Bu, Yuchao Jin, Haisen Zhao, He Sun, Yangyan Li, Mu Xu, Wenzheng Chen, Baoquan Chen

机构 * Peking University(北京大学) AMAP(高德地图) Ant Group(蚂蚁集团) Shandong University(山东大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 本文提出两种设计选择,通过2.5D高度图和可微渲染技术,解决从稀疏轨道图像合成地面视图的挑战,实现大规模城市重建。

Comments Accepted by CVPR 2026 Findings. Project page: https://pku-vcl-geometry.github.io/Orbit2Ground/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22396 2026-04-09 cs.CV cs.AI

Asking like Socrates: Socrates helps VLMs understand remote sensing images

像苏格拉底提问:苏格拉底帮助VLMs理解遥感图像

Run Shao, Ziyu Li, Zhaoyang Zhang, Linrui Xu, Xinran He, Hongyuan Yuan, Bolei He, Yongxing Dai, Yiming Yan, Yijun Chen, Wang Guo, Haifeng Li

机构 * School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院) Baidu Inc.(百度公司) School of Earth Sciences, Zhejiang University(浙江大学地球科学学院)

AI总结 本文提出RS-EoT方法,通过迭代视觉证据寻求机制和两阶段强化学习策略,解决遥感图像中伪推理问题,提升视觉证据基础的推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15510 2026-04-09 cs.CV cs.RO

Exploring Conditions for Diffusion models in Robotic Control

探索扩散模型在机器人控制中的条件

Heeseong Shin, Byeongho Heo, Dongyoon Han, Seungryong Kim, Taekyung Kim

机构 * KAIST AI(韩国科学技术院人工智能学院) NAVER AI Lab(NAVER人工智能实验室)

AI总结 本文研究利用预训练文本到图像扩散模型获取任务适应的视觉表示,提出ORCA方法以动态视觉信息提升机器人控制性能。

Comments Accepted to CVPR 2026. Project page: https://orca-rc.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04880 2026-04-09 cs.CV eess.IV

MozzaVID: Mozzarella Volumetric Image Dataset

MozzaVID:莫扎瑞拉奶酪体积分类数据集

Pawel Tomasz Pieta, Peter Winkel Rasmussen, Anders Bjorholm Dahl, Jeppe Revall Frisvad, Siavash Arjomand Bigdeli, Carsten Gundlach, Anders Nymark Christensen

机构 * Technical University of Denmark(丹麦技术大学)

AI总结 本文提出MozzaVID数据集,用于体积分类任务,包含25种奶酪类型和149个样本,提供三种分辨率的数据,旨在促进体积分类算法的发展和食品结构研究。

Comments Accepted at MetaFood (CVPR 2026 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16240 2026-04-09 cs.LG

AFL: A Single-Round Analytic Approach for Federated Learning with Pre-trained Models

AFL:基于预训练模型的联邦学习单轮分析方法

Run He, Kai Tong, Di Fang, Han Sun, Ziqian Zeng, Haoran Li, Tianyi Chen, Huiping Zhuang

机构 * South China University of Technology(华南理工大学) Tsinghua University(清华大学) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心) The Hong Kong University of Science and Technology(香港科技大学) Microsoft(微软)

AI总结 本文提出AFL,一种利用分析解的联邦学习方法,通过单轮训练和绝对聚合法则,减少通信开销并提升收敛速度,具有数据分区不变性。

Comments Published in CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07306 2026-04-09 cs.CV cs.LG

Beyond Loss Values: Robust Dynamic Pruning via Loss Trajectory Alignment

超越损失值:通过损失轨迹对齐实现鲁棒动态剪枝

Huaiyuan Qin, Muli Yang, Gabriel James Goenawan, Kai Wang, Zheng Wang, Peng Hu, Xi Peng, Hongyuan Zhu

机构 * National University of Singapore(新加坡国立大学) Wuhan University(武汉大学) Sichuan University(四川大学)

AI总结 本文提出AlignPrune模块,通过动态对齐得分改进动态剪枝在标签噪声下的鲁棒性,实验表明其在多个基准上提升精度达6.3%。

Comments Published in CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07220 2026-04-09 cs.IR

HIVE: Query, Hypothesize, Verify An LLM Framework for Multimodal Reasoning-Intensive Retrieval

HIVE:一种用于多模态推理密集检索的LLM框架

Mahmoud Abdalla, Mahmoud SalahEldin Kasem, Mohamed Mahmoud, Mostafa Farouk Senussi, Abdelrahman Abdallah, Hyun-Soo Kang

AI总结 HIVE通过引入LLM进行显式视觉-文本推理,提升多模态检索效果,达到41.7的nDCG@10,优于现有文本和多模态模型。

Comments accepted at CVPR 2026 Workshop GRAIL-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07201 2026-04-09 cs.IR cs.CV

BRIDGE: Multimodal-to-Text Retrieval via Reinforcement-Learned Query Alignment

BRIDGE:通过强化学习查询对齐实现多模态到文本检索

Mohamed Darwish Mounis, Mohamed Mahmoud, Shaimaa Sedek, Mahmoud Abdalla, Mahmoud SalahEldin Kasem, Abdelrahman Abdallah, Hyun-Soo Kang

机构 * High institute for computer & information systems(高等计算机与信息系统学院) Chungbuk National University(忠北大学) Assiut University(艾斯尤特大学) University of Innsbruck(因斯布鲁克大学)

AI总结 BRIDGE通过强化学习查询对齐模型和增强神经搜索检索器,解决多模态查询在文本库中的检索问题,实现优于多模态编码器的nDCG@10性能。

Comments Accepted at CVPR 2026 Workshop GRAIL-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07198 2026-04-09 cs.LG cs.ET

Beyond the Mean: Modelling Annotation Distributions in Continuous Affect Prediction

超越均值:在连续情感预测中建模注释分布

Kosmas Pinitas, Ilias Maglogiannis

AI总结 本文提出了一种基于Beta分布的框架,用于建模注释共识,以捕捉情感感知的中心趋势、变异性、不对称性和不确定性。

Comments This paper has been accepted at the CVPR 2026 Workshop on Affective Behavior Analysis in-the-wild (ABAW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07193 2026-04-09 cs.CL cs.ET

LaScA: Language-Conditioned Scalable Modelling of Affective Dynamics

LaScA:语言条件下的可扩展情感动态建模

Kosmas Pinitas, Ilias Maglogiannis

机构 * University of Piraeus(比雷埃夫斯大学)

AI总结 本文提出LaScA框架,利用语言模型作为语义上下文条件器,结合手工制作的情感描述符建模情感变化,通过可解释的面部和声音特征提升预测准确性。

Comments This paper has been accepted at the CVPR 2026 Workshop on Affective Behavior Analysis in-the-wild (ABAW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07166 2026-04-09 cs.CV cs.HC cs.LG

DINO-QPM: Adapting Visual Foundation Models for Globally Interpretable Image Classification

DINO-QPM:为全球可解释的图像分类适应视觉基础模型

Robert Zimmermann, Thomas Norrenbrock, Bodo Rosenhahn

机构 * Institute for Information Processing, L3S - Leibniz University Hannover(信息处理研究所,L3S - 莱布尼茨汉诺威大学)

AI总结 DINO-QPM通过将复杂特征转换为可解释的对比表示,提升图像分类的可解释性,同时在准确性和解释质量上优于DINOv2线性探针。

Comments Accepted to the 5th Explainable AI for Computer Vision (XAI4CV) Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07132 2026-04-09 cs.CV cs.AI cs.LG

CSA-Graphs: A Privacy-Preserving Structural Dataset for Child Sexual Abuse Research

CSA-Graphs: 一种保护隐私的结构数据集用于儿童性虐待研究

Carlos Caetano, Camila Laranjeira, Clara Ernesto, Artur Barros, João Macedo, Leo S. F. Ribeiro, Jefersson A. dos Santos, Sandra Avila

机构 * Universidade Estadual de Campinas (UNICAMP)(坎皮纳斯州立大学) Instituto Federal de Educação, Ciência e Tecnologia de Minas Gerais (IFMG)(米纳斯吉拉斯联邦教育、科学和技术研究所) Universidade de São Paulo (USP)(圣保罗大学) Universidade Federal de Minas Gerais (UFMG)(米纳斯吉拉斯联邦大学) Polícia Federal (PF)(联邦警察) University of Sheffield(谢菲尔德大学)

AI总结 本文提出CSA-Graphs数据集,通过结构化表示替代原始图像,保留上下文信息以实现儿童性虐待图像分类,同时遵守法律和伦理限制。

Comments Conference on Computer Vision and Pattern Recognition (CVPR 2026), in the Workshop on Computer Vision for Children (CV4CHL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02945 2026-04-09 cs.CL

ACE-Merging: Data-Free Model Merging with Adaptive Covariance Estimation

ACE-Merging:无数据模型融合与自适应协方差估计

Bo Xu, Haotian Wu, Hehai Lin, Weiquan Huang, Beier Zhu, Yao Shu, Chengwei Qin

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出ACE-Merging方法,通过自适应协方差估计实现无数据模型融合,解决专家模型间干扰问题,实验表明其在视觉和语言基准上优于现有方法。

Comments Accepted to CVPR 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01558 2026-04-09 cs.CV

TopoMaskV3: 3D Mask Head with Dense Offset and Height Predictions for Road Topology Understanding

TopoMaskV3:用于道路拓扑理解的3D掩码头:具有密集偏移和高度预测

Muhammet Esat Kalfaoglu, Halil Ibrahim Ozturk, Ozsel Kilinc, Alptekin Temizel

机构 * Graduate School of Informatics, Middle East Technical University(中东技术大学信息学研究生院) Togg/Trutek AI Team(Togg/Trutek 人工智能团队)

AI总结 TopoMaskV3通过引入密集偏移场和高度图,实现了3D道路拓扑理解的稳健预测,同时解决了地理数据泄露问题,取得了新的性能突破。

Comments Accepted to CVPR 2026 Workshops (AUTOPILOT 2026): 3rd Workshop on Autonomous Understanding Through Open-world Perception and Integrated Language Models for On-road Tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21105 2026-04-09 cs.CV

BrepGaussian: CAD reconstruction from Multi-View Images with Gaussian Splatting

BrepGaussian:从多视角图像中通过高斯点划进行CAD重建

Jiaxing Yu, Dongyang Ren, Hangyu Xu, Zhouyuxiao Yang, Yuanqi Li, Jie Guo, Zhengkang Zhou, Yanwen Guo

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) Nanjing Urban Construction Tunnel& Bridge Intelligent Management Co., Ltd.(南京城建隧道桥梁智能管理有限公司)

AI总结 本文提出BrepGaussian框架,通过学习2D图像中的3D参数化表示,实现从多视角图像中重建CAD模型,其核心方法是结合可学习特征的高斯点划渲染器和特定拟合策略,有效分离了几何重建与特征学习。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15599 2026-04-09 cs.CV

FlexAvatar: Learning Complete 3D Head Avatars with Partial Supervision

FlexAvatar:通过部分监督学习完整的3D头像

Tobias Kirschstein, Simon Giebenhain, Matthias Nießner

机构 * Technical University of Munich(慕尼黑工业大学)

AI总结 FlexAvatar通过结合单目和多视角数据,解决单目数据不足和多视角数据获取困难的问题,实现高质量的3D头像生成。

Comments Accepted to CVPR 2026, Project website: https://tobias-kirschstein.github.io/flexavatar/ , Video: https://youtu.be/g8wxqYBlRGY

详情

展开后加载摘要…

URL PDF HTML 收藏