arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11871
2603.01332 2026-04-21 cs.CV

Perspective-Equivariant Fine-tuning for Multispectral Demosaicing without Ground Truth

视角等变微调用于无地面真实多光谱去马赛克

Andrew Wang, Mike Davies

机构 * School of Engineering(工程学院) University of Edinburgh(爱丁堡大学)

AI总结 本文提出PEFD框架,通过利用相机成像系统的投影几何,利用更丰富的群结构恢复更多空域信息,并通过微调预训练模型实现高效多光谱去马赛克,优于现有方法,接近监督学习性能。

Comments To appear in Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19945 2026-04-21 cs.LG cs.AI

DP-FedAdamW: An Efficient Optimizer for Differentially Private Federated Large Models

DP-FedAdamW: 一种用于差分隐私联邦大模型的高效优化器

Jin Liu, Yinbin Miao, Ning Xi, Junkang Liu

机构 * School of Cyber Engineering, Xidian University(西安电子科技大学电子信息学院) College of Intelligence and Computing, Tianjin University(天津大学智能科学与计算学院)

AI总结 本文提出DP-FedAdamW,一种针对差分隐私联邦学习的AdamW优化器,通过稳定二阶矩方差、消除DP偏差和对齐局部更新以缓解客户端漂移,提升了收敛效率和鲁棒性。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14122 2026-04-21 cs.CV

EgoSound: Benchmarking Sound Understanding in Egocentric Videos

EgoSound:评估egocentric视频中声音理解的基准测试

Bingwen Zhu, Yuqian Fu, Qiaole Dong, Guolei Sun, Tianwen Qian, Yuzheng Wu, Danda Pani Paudel, Xiangyang Xue, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Nankai University(南开大学) East China Normal University(华东师范大学) KAUST(卡塔尔大学)

AI总结 EgoSound首次系统评估多模态大语言模型在egocentric视频中的声音理解能力,包含7个任务分类,揭示当前模型在空间和因果理解上的局限。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16298 2026-04-20 cs.CV cs.RO

FineCog-Nav: Integrating Fine-grained Cognitive Modules for Zero-shot Multimodal UAV Navigation

FineCog-Nav:整合细粒度认知模块以实现零样本多模态无人机导航

Dian Shao, Zhengzheng Xu, Peiyang Wang, Like Liu, Yule Wang, Jieqi Shi, Jing Huo

机构 * Northwestern Polytechnical University(西北工业大学) Nanjing University(南京大学)

AI总结 本文提出FineCog-Nav框架,通过细粒度认知模块提升无人机零样本多模态导航性能,构建了AerialVLN-Fine基准测试集,实验表明其在指令遵循、长视距规划和环境泛化方面优于基线方法。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16284 2026-04-20 cs.CV

Enhancing Hazy Wildlife Imagery: AnimalHaze3k and IncepDehazeGan

增强雾状野生动物图像:AnimalHaze3k和IncepDehazeGan

Shivarth Rai, Tejeswar Pokuri

机构 * Department of Computer Science(计算机科学系) Manipal Institute of Technology(马普尔理工学院)

AI总结 本文提出AnimalHaze3k数据集和IncepDehazeGan模型,通过物理模拟生成雾状图像,提升野生动物图像清晰度,改进检测与跟踪性能。

Comments Accepted at CV4Animals Workshop, CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16248 2026-04-20 cs.CV

Where Do Vision-Language Models Fail? World Scale Analysis for Image Geolocalization

视觉-语言模型在何处失效?面向图像地理定位的世界尺度分析

Siddhant Bharadwaj, Ashish Vashist, Fahimul Aleem, Shruti Vyas

机构 * University of Central Florida(中央佛罗里达大学)

AI总结 本文评估了多种先进视觉-语言模型在国家层面图像地理定位中的表现,揭示了模型在粗粒度地理定位中的潜力及当前模型在细粒度地理线索捕捉上的局限。

Comments Accepted to the CVPR EarthVision 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16044 2026-04-20 cs.CV

Elucidating the SNR-t Bias of Diffusion Probabilistic Models

阐明扩散概率模型的SNR-t偏差

Meng Yu, Lei Sun, Jianhao Zeng, Xiangxiang Chu, Kun Zhan

机构 * Lanzhou University(兰州大学) AMAP Alibaba Group(AMAP阿里巴巴集团)

AI总结 本文揭示了扩散模型在推理阶段SNR与时间步的不匹配问题,提出差分校正方法提升生成质量,实验表明在多种模型和数据集上效果显著。

Comments Accepted to CVPR 2026, 19pages, with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15310 2026-04-20 cs.CV cs.GR

TokenLight: Precise Lighting Control in Images using Attribute Tokens

TokenLight: 利用属性标记实现图像中的精确光照控制

Sumit Chaturvedi, Yannick Hold-Geoffroy, Mengwei Ren, Jingyuan Liu, He Zhang, Yiqun Mei, Julie Dorsey, Zhixin Shu

机构 * Yale University(耶鲁大学) Adobe

AI总结 本文提出一种图像再照明方法,通过属性标记编码多种光照属性,实现精确连续控制,并在合成和真实图像上验证了其性能。

Comments 32 pages, CVPR 2026, Project Page: https://vrroom.github.io/tokenlight/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13543 2026-04-20 cs.LG cs.AI

Enhancing Visual Representation with Textual Semantics: Textual Semantics-Powered Prototypes for Heterogeneous Federated Learning

通过文本语义增强视觉表示:基于文本语义的原型用于异构联邦学习

Xinghao Wu, Jianwei Niu, Xuefeng Liu, Guogang Zhu, Jiayuan Zhang, Shaojie Tang, Wei Chen

机构 * State Key Laboratory of Virtual Reality Technology and Systems, School of Computer Science and Engineering, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室,计算机科学与工程学院,北京航空航天大学,北京,中国) Zhongguancun Laboratory, Beijing, China(中关村实验室,北京,中国) Center for AI Business Innovation, Department of Management Science and Systems, School of Management, University at Buffalo, USA(人工智能商业创新中心,管理科学与系统系,管理学院,布法罗大学,美国)

AI总结 本文提出FedTSP,利用预训练语言模型构建语义丰富的原型,以解决异构联邦学习中的数据异质性问题,提升模型收敛速度和泛化能力。

Comments Accepted by CVPR 2026 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16010 2026-04-20 cs.CV

IA-CLAHE: Image-Adaptive Clip Limit Estimation for CLAHE

IA-CLAHE:用于CLAHE的图像自适应剪裁限估计

Rikuto Otsuka, Yuho Shoji, Yuka Ogino, Takahiro Toizumi, Atsushi Ito

机构 * NEC Corporation(日本电报电话公司)

AI总结 本文提出IA-CLAHE,通过自适应估计图像剪裁限来改进CLAHE,解决了传统CLAHE中固定剪裁限导致的过增强问题,无需任务特定数据即可实现跨条件泛化。

Comments Accepted to NTIRE 2026 Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15979 2026-04-20 cs.CV

MMGait: Towards Multi-Modal Gait Recognition

MMGait:迈向多模态步态识别

Chenye Wang, Qingyuan Cai, Saihui Hou, Aoqi Li, Yongzhen Huang

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

AI总结 本文提出MMGait多模态步态基准,整合五种异构传感器数据,评估单模态、跨模态和多模态步态识别方法,引入Omni Multi-Modal Gait Recognition任务和OmniGait基线模型。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15923 2026-04-20 cs.SD cs.CV

Hierarchical Codec Diffusion for Video-to-Speech Generation

层次编码扩散用于视频到语音生成

Jiaxin Ye, Gaoxiang Cong, Chenhui Wang, Xin-Cheng Wen, Zhaoyang Li, Boyuan Cao, Hongming Shan

机构 * Fudan University(复旦大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 本文提出HiCoDiT,利用残差向量量化编码的层次结构,通过低层和高层块生成不同层级的语音令牌,以实现强音频视觉对齐,实验表明其在保真度和表达性上优于基线。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15857 2026-04-20 cs.CV

AHS: Adaptive Head Synthesis via Synthetic Data Augmentations

AHS: 通过合成数据增强实现自适应头部合成

Taewoong Kang, Hyojin Jang, Sohyun Jeong, Seunggi Moon, Gihwi Kim, Hoon Jin Jung, Jaegul choo

机构 * KAIST(韩国国立科学技术院) Korea University(韩国大学) FLIPTION

AI总结 本文提出AHS方法,通过合成数据增强解决头部合成中视角和表情多样性的限制,提升真实场景下的泛化能力。

Comments CVPR 2026, Project Page : https://keh0t0.github.io/AHS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15829 2026-04-20 cs.CV cs.CR

Beyond Text Prompts: Precise Concept Erasure through Text-Image Collaboration

超越文本提示:通过文本图像协作实现精确概念消除

Jun Li, Lizhi Xiong, Ziqiang Li, Weiwei Jiang, Zhangjie Fu, Yong Li, Guo-Sen Xie

机构 * Nanjing University of Information Science and Technology(南京信息工程大学) Southeast University(东南大学) Nanjing University of Science and Technology(南京理工大学)

AI总结 本文提出TICoE框架,通过连续凸概念流形和分层视觉表征学习,实现精确且忠实的概念消除,同时保留无关语义和视觉内容,并引入基于保真度的评估策略,实验表明其在概念消除精度和内容保真度上优于现有方法。

Comments 25 pages, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15828 2026-04-20 cs.CV

SSFT: A Lightweight Spectral-Spatial Fusion Transformer for Generic Hyperspectral Classification

SSFT:一种轻量级的光谱-空间融合Transformer用于通用超光谱分类

Alexander Musiat, Nikolas Ebert, Oliver Wasenmüller

机构 * Mannheim University of Applied Sciences(曼海姆应用科学大学)

AI总结 本文提出SSFT,通过光谱与空间路径融合,提升超光谱分类性能,实现参数更少但效果更优。

Comments This paper has been accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15809 2026-04-20 cs.CV

Aligning What Vision-Language Models See and Perceive with Adaptive Information Flow

对视觉-语言模型所见所感知进行对齐与适应性信息流

Chengxin Liu, Wonseok Choi, Chenshuang Zhang, Tae-Hyun Oh

机构 * KAIST(韩国科学技术院) POSTECH

AI总结 本文提出通过调节信息流提升视觉-语言模型的感知能力,通过动态令牌方法确定视觉令牌的重要性,从而提高视觉问答、视觉定位等任务的性能。

Comments CVPR 2026. Project page: https://cxliu0.github.io/AIF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15756 2026-04-20 cs.CL cs.CV

TTL: Test-time Textual Learning for OOD Detection with Pretrained Vision-Language Models

TTL: 用于基于预训练视觉-语言模型的分布外检测的测试时文本学习

Jinlun Ye, Jiang Liao, Runhe Lai, Xinhua Lu, Jiaxin Zhuang, Zhiyong Gan, Ruixuan Wang

机构 * Sun Yat-sen University(中山大学) China United Network Communications Corporation Limited Guangdong Branch(中国联合网络通信集团有限公司广东分公司) Peng Cheng Laboratory(鹏城实验室) Hong Kong University of Science and Technology(香港科技大学) Key Laboratory of Machine Intelligence and Advanced Computing, MOE(教育部机器智能与高级计算重点实验室)

AI总结 本文提出TTL框架,通过动态学习测试流中的分布外文本语义提升测试时分布外检测性能,实验表明其在多个基准上均取得最优效果。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15708 2026-04-20 cs.CV

APC: Transferable and Efficient Adversarial Point Counterattack for Robust 3D Point Cloud Recognition

APC:可转移且高效的对抗点反击用于鲁棒的3D点云识别

Geunyoung Jung, Soohong Kim, Inseok Kong, Jiyoung Jung

机构 * Department of Artificial Intelligence, University of Seoul, South Korea(首尔大学人工智能系,韩国) Department of Geo Informatics, University of Seoul, South Korea(首尔大学地理信息系,韩国)

AI总结 本文提出APC,一种轻量级输入级净化模块,通过生成实例特定的对抗扰动有效中和攻击,并通过混合训练策略提升跨不同攻击的泛化能力,实验表明其在3D识别基准上达到最先进的防御性能。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15678 2026-04-20 cs.CV

HyCal: A Training-Free Prototype Calibration Method for Cross-Discipline Few-Shot Class-Incremental Learning

HyCal:一种无需训练的跨学科少样本类增量学习原型校准方法

Eunju Lee, MiHyeon Kim, JuneHyoung Kwon, Yoonji Lee, JiHyun Kim, Soojin Jang, YoungBin Kim

机构 * Chung-Ang University(Chung-Ang 大学) KT Corporation(KT 公司) Dentium ETRI

AI总结 本文提出HyCal方法,通过结合余弦相似度和马氏距离,解决跨学科少样本类增量学习中的领域引力问题,提升在不平衡数据下的性能。

Comments Accepted to CVPR 2026. Eunju Lee and MiHyeon Kim contributed equally as co-first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15663 2026-04-20 cs.SE cs.AI

CodeMMR: Bridging Natural Language, Code, and Image for Unified Retrieval

CodeMMR:连接自然语言、代码和图像以实现统一检索

Jiahui Geng, Qing Li, Fengyu Cai, Fakhri Karray

机构 * MBZUAI Linköping University(林雪平大学) University of Groningen(格罗宁根大学) TU Darmstadt(图宾根大学)

AI总结 本文提出CodeMMR,通过指令式多模态对齐,将自然语言、代码和图像嵌入共享语义空间,实现跨模态和语言的强泛化,优于基线模型,并提升RAG中的代码生成精度与视觉 grounding。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15521 2026-04-20 cs.CV

Frequency-Aware Flow Matching for High-Quality Image Generation

面向频率的流匹配用于高质量图像生成

Sucheng Ren, Qihang Yu, Ju He, Xiaohui Shen, Alan Yuille, Liang-Chieh Chen

机构 * Johns Hopkins University(约翰霍普金斯大学) ByteDance(字节跳动)

AI总结 本文提出FreqFlow,通过时间依赖的自适应加权将频率感知条件融入流匹配框架,以提升图像生成的全局结构和细节质量,在ImageNet-256上取得最佳FID成绩。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15459 2026-04-20 eess.IV cs.AI cs.CV

RelativeFlow: Taming Medical Image Denoising Learning with Noisy Reference

RelativeFlow: 通过噪声参考驯服医学图像去噪学习

Yuxin Liu, Yiqing Dong, Wenxue Yu, Zhan Wu, Rongjun Ge, Yang Chen, Yuting He

机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院,中国) Department of Biomedical Engineering, Case Western Reserve University, USA(凯斯西储大学生物医学工程系,美国) School of Instrument Science and Engineering, Southeast University, China(东南大学仪器科学与工程学院,中国) Department of Optical Sciences, University of Arizona, USA(亚利桑那大学光学科学系,美国)

AI总结 针对医学图像去噪中噪声参考问题,提出RelativeFlow框架,通过分解绝对噪声到清洁映射为相对更噪声到噪声映射,结合一致传输和模拟基速度场提升去噪性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14605 2026-04-20 cs.CV

Towards Design Compositing

面向设计合成

Abhinav Mahajan, Abhikhya Tripathy, Sudeeksha Reddy Pala, Vaibhav Methi, K J Joseph, Balaji Vasan Srinivasan

机构 * Carnegie Mellon University(卡内基梅隆大学) IIT Kharagpur(印度理工学院哈里科特) IIT Kanpur(印度理工学院坎普尔) Adobe Research(Adobe研究)

AI总结 本文提出GIST,一种无需训练的身份保持图像合成器,用于提升组件到设计流程中的视觉和谐与美学质量。

Comments Accepted to CVEU workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13508 2026-04-20 cs.CV

Enhancing Mixture-of-Experts Specialization via Cluster-Aware Upcycling

通过簇感知再利用增强专家混合专业化

Sanghyeok Chu, Pyunghwan Ahn, Gwangmo Song, SeungHwan Kim, Honglak Lee, Bohyung Han

机构 * LG AI Research(LG人工智能研究)

AI总结 本文提出簇感知再利用策略,通过语义聚类初始化MoE模型,打破专家对称性并促进早期专业化,提升模型性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09232 2026-04-20 cs.CV cs.AI

Neural Distribution Prior for LiDAR Out-of-Distribution Detection

神经分布先验用于激光雷达分布外检测

Zizhao Li, Zhengkang Xiang, Jiayang Ao, Feng Liu, Joseph West, Kourosh Khoshelham

机构 * The University of Melbourne(墨尔本大学)

AI总结 本文提出神经分布先验框架,通过动态捕捉训练数据的logit分布模式和引入Perlin噪声生成策略,提升激光雷达分布外检测性能,实验显示在STU数据集上达到61.31%的AP,优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07786 2026-04-20 cs.CV cs.LG

Cross-Modal Emotion Transfer for Emotion Editing in Talking Face Video

跨模态情绪迁移用于谈话人脸视频中的情绪编辑

Chanhyuk Choi, Taesoo Kim, Donggyu Lee, Siyeol Jung, Taehwan Kim

机构 * Ulsan National Institute of Science and Technology (UNIST)(乌山国立科学技术研究院)

AI总结 本文提出跨模态情绪迁移(C-MET)方法,通过建模语音与视觉特征空间间的情绪语义向量,提升生成视频的情绪表达与真实感,实验表明其在MEAD和CREMA-D数据集上比现有方法提升14%的情绪准确性。

Comments Accepted to CVPR 2026. Project Page: https://chanhyeok-choi.github.io/C-MET/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02880 2026-04-20 cs.CV

InstructTable: Improving Table Structure Recognition Through Instructions

InstructTable: 通过指令提升表格结构识别

Boming Chen, Zining Wang, Zhentao Guo, Jianqiang Liu, Chen Duan, Yu Gu, Kai zhou, Pengfei Yan

机构 * Meituan(美团) Beijing Institute of Technology(北京理工大学)

AI总结 本文提出InstructTable框架,通过指令引导多阶段训练提升表格结构识别,结合指令预训练和细调,构建BCDSTab基准,实现在复杂表格识别中的最优性能。

Comments 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition- FINDINGS Track (CVPRF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02210 2026-04-20 cs.CV

HiFi-Inpaint: Towards High-Fidelity Reference-Based Inpainting for Generating Detail-Preserving Human-Product Images

HiFi-Inpaint:迈向高保真参考基于修复生成细节保留的人-产品图像

Yichen Liu, Donghao Zhou, Jie Wang, Xin Gao, Guisheng Liu, Jiatong Li, Quanwei Zhang, Qiang Lyu, Lanqing Guo, Shilei Wen, Weiqiang Wang, Pheng-Ann Heng

机构 * University of Chinese Academy of Sciences(中国科学院大学) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学)

AI总结 本文提出HiFi-Inpaint框架,通过Shared Enhancement Attention和Detail-Aware Loss解决人-产品图像生成中的细节保留问题,并构建了HP-Image-40K数据集,实验表明其在生成高保真图像方面表现优异。

Comments Accepted by CVPR 2026 (Project page: https://correr-zhou.github.io/HiFi-Inpaint/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23421 2026-04-20 cs.CV

DriveLaW:Unifying Planning and Video Generation in a Latent Driving World

DriveLaW:在潜在驾驶世界中统一规划与视频生成

Tianze Xia, Yongkang Li, Lijun Zhou, Jingfeng Yao, Kaixin Xiong, Haiyang Sun, Bing Wang, Kun Ma, Guang Chen, Hangjun Ye, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米电动车)

AI总结 DriveLaW通过统一视频生成与运动规划,提升自动驾驶中的预测与规划性能,实现视频生成与轨迹规划的一致性,取得新的state-of-the-art结果。

Comments 18 pages, 6 figures, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24058 2026-04-20 eess.SP cs.AI cs.LG

PULSE: Privileged Knowledge Transfer from Rich to Deployable Sensors for Embodied Multi-Sensory Learning

PULSE:从丰富到可部署传感器的特权知识转移以实现具身多感官学习

Zihan Zhao, Kaushik Pendiyala, Masood Mortazavi, Ning Yan

机构 * University of California San Diego(加州大学圣迭戈分校) University of California Davis(加州大学戴维斯分校) IC Lab, Futurewei Technologies Inc.(未来科技公司IC实验室)

AI总结 PULSE框架通过从信息丰富的教师传感器向更廉价的部署传感器转移知识,解决具身智能系统中传感器不对称问题,实现多感官学习。

Comments v2: Accepted at the CVPR 2026 Workshop on Sense of Space. 8 pages main content + references + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏