arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-03-25 至 2026-03-25 共收录 44
2602.23029 2026-03-25 cs.CV

WISER: Wider Search, Deeper Thinking, and Adaptive Fusion for Training-Free Zero-Shot Composed Image Retrieval

WISER:更广的搜索、更深入的思考和自适应融合用于无训练零样本复合图像检索

Tianyue Wang, Leigang Qu, Tianyu Yang, Xiangzhao Hao, Yifan Xu, Haiyun Guo, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) National University of Singapore(新加坡国立大学) Wuhan AI Research(武汉人工智能研究院) Minzu University of China(民族大学)

AI总结 WISER通过'检索-验证-细化'流程统一文本到图像和图像到图像检索,显式建模意图和不确定性意识,实现更广泛的搜索和更深入的思考,提升零样本复合图像检索性能。

Comments Accept to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22625 2026-03-25 cs.GR cs.CV

DiffBMP: Differentiable Rendering with Bitmap Primitives

DiffBMP:基于位图原语的可微渲染

Seongmin Hong, Junghun James Kim, Daehyeop Kim, Insoo Chung, Se Young Chun

机构 * INMC(智能媒体中心) IPAI(图像处理与人工智能研究所) Dept. of ECE, Seoul National University(首尔国立大学电子与计算机工程系)

AI总结 DiffBMP通过高效可微渲染引擎解决传统渲染器对矢量图形的限制,支持位图图像优化,具备高并行处理能力,可在1分钟内完成千级位图原语的参数优化。

Comments Accepted to CVPR 2026, https://diffbmp.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21395 2026-03-25 cs.CV

Momentum Memory for Knowledge Distillation in Computational Pathology

动量记忆用于计算病理学中的知识蒸馏

Yongxin Guo, Hao Lu, Onur C. Koyun, Zhengjie Zhu, Muhammet Fatih Demir, Metin Nafi Gurcan

机构 * Wake Forest University School of Medicine(威克森林大学医学院)

AI总结 本文提出MoMKD框架,通过动量更新的记忆机制整合基因组和病理学信息,提升跨模态知识蒸馏性能,实验表明其在病理学任务中表现优异。

Comments Accepted by CVPR 2026. Code: https://github.com/CAIR-LAB-WFUSM/MoMKD

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18993 2026-03-25 cs.CV

SeaCache: Spectral-Evolution-Aware Cache for Accelerating Diffusion Models

SeaCache: 基于频谱演化的缓存加速扩散模型

Jiwoo Chung, Sangeek Hyun, MinKyu Lee, Byeongju Han, Geonho Cha, Dongyoon Wee, Youngjun Hong, Jae-Pil Heo

机构 * Sungkyunkwan University(顺天乡大学) NAVER Cloud(NAVER云)

AI总结 本文提出SeaCache缓存机制,通过频谱对齐表示提升扩散模型推理效率,实验证明其在延迟与质量之间取得最优平衡。

Comments Accepted to CVPR 2026. Project page:https://jiwoogit.github.io/SeaCache

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01047 2026-03-25 cs.CV cs.AI

Residual Decoding: Mitigating Hallucinations in Large Vision-Language Models via History-Aware Residual Guidance

残差解码:通过历史感知残差引导减轻大视觉-语言模型中的幻觉

Xinrong Chen, Xu Chu, Yingmin Qiu, Hengyuan Zhang, Jing Xiong, Shiyu Tang, Shuai Liu, Shaokang Yang, Cheng Yang, Hayden Kwok-Hay So, Ngai Wong

机构 * Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Hong Kong(香港大学) ByteDance Inc.(字节跳动公司)

AI总结 本文提出残差解码方法,通过利用历史信息辅助解码,纠正大视觉-语言模型中的语言先验偏差,有效抑制幻觉并提升视觉接地能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11336 2026-03-25 cs.CV

UFVideo: Towards Unified Fine-Grained Video Cooperative Understanding with Large Language Models

UFVideo:迈向统一的细粒度视频协作理解的大型语言模型

Hewen Pan, Cong Wei, Dashuang Liang, Zepeng Huang, Pengfei Gao, Ziqi Zhou, Lulu Xue, Pengfei Yan, Xiaoming Wei, Minghui Li, Shengshan Hu

机构 * Huazhong University of Science and Technology(华中科技大学) Meituan(美团)

AI总结 UFVideo通过统一多粒度协作理解能力,实现视频理解的全面覆盖,展示了其在多粒度视频任务中的灵活性和优势。

Comments CVPR 2026 Camera Ready, Github Code: https://github.com/Heven-Pan/UFVideo

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02982 2026-03-25 cs.CV cs.RO

U4D: Uncertainty-Aware 4D World Modeling from LiDAR Sequences

U4D:从LiDAR序列中构建不确定性感知的4D世界模型

Xiang Xu, Alan Liang, Youquan Liu, Linfeng Li, Lingdong Kong, Ziwei Liu, Qingshan Liu

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室) Nanjing University of Posts and Telecommunications(南京邮电大学) SKL-TI

AI总结 本文提出U4D框架,通过估计空间不确定性图和分阶段生成方法,提升LiDAR序列的几何精度和时间一致性,推动自动驾驶感知与模拟的可靠性。

Comments CVPR 2026; 20 pages, 7 figures, 11 tables; Code at https://github.com/worldbench/U4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02487 2026-03-25 cs.CV cs.AI

Masking Matters: Unlocking the Spatial Reasoning Capabilities of LLMs for 3D Scene-Language Understanding

掩码至关重要:解锁LLMs的三维场景-语言理解的空间推理能力

Yerim Jeon, Miso Lee, WonJun Moon, Jae-Pil Heo

机构 * Sungkyunkwan University(庆尚国立大学)

AI总结 本文提出3D-SLIM掩码策略,通过适应性注意力掩码提升LLMs在三维场景-语言理解中的空间推理能力,解决传统因果掩码导致的顺序偏差和注意力受限问题。

Comments Accepted to CVPR 2026. GitHub Page: https://github.com/Jyerim/3D-SLIM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01248 2026-03-25 cs.CV

TRivia: Self-supervised Fine-tuning of Vision-Language Models for Table Recognition

TRivia: 基于视觉-语言模型的自监督微调用于表格识别

Junyuan Zhang, Bin Wang, Qintong Zhang, Fan Wu, Zichen Wen, Jialin Lu, Junjie Shan, Ziqi Zhao, Shuya Yang, Ziling Wang, Ziyang Miao, Huaping Zhong, Yuhang Zang, Xiaoyi Dong, Ka-Ho Chow, Conghui He

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiaotong University(上海交通大学) Sensetime

AI总结 TRivia通过自监督微调方法,使预训练视觉-语言模型直接从未标注的表格图像中学习表格识别,无需人工标注,提升了表格识别性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20996 2026-03-25 cs.CV

From Inpainting to Layer Decomposition: Repurposing Generative Inpainting Models for Image Layer Decomposition

从修复到层分解:重新利用生成修复模型进行图像层分解

Jingxi Chen, Yixiao Zhang, Xiaoye Qian, Zongxia Li, Cornelia Fermuller, Caren Chen, Yiannis Aloimonos

机构 * University of Maryland(马里兰大学) Amazon(亚马逊)

AI总结 本文提出利用生成修复模型进行图像层分解,通过轻量级微调和多模态上下文融合模块,实现更精确的物体移除和遮挡恢复,提升下游编辑和创意应用的可能性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17181 2026-03-25 cs.CV cs.LG cs.SD

Investigating self-supervised representations for audio-visual deepfake detection

探究用于音频-视觉深度伪造检测的自监督表示

Dragos-Alexandru Boldisor, Stefan Smeu, Dan Oneata, Elisabeta Oneata

机构 * Bitdefender Politehnica Bucharest(巴蒂亚努大学)

AI总结 本文系统评估了自监督表示在多模态和多领域中的检测效果、信息可解释性和跨模态互补性,发现音频引导的表示在深度伪造检测中表现最佳。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03334 2026-03-25 cs.CV

UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions

UniAVGen:基于非对称跨模态交互的统一音频视频生成

Guozhen Zhang, Zixiang Zhou, Teng Hu, Ziqiao Peng, Youliang Zhang, Yi Chen, Yuan Zhou, Qinglin Lu, Limin Wang

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) Tencent Hunyuan(腾讯文英) Shanghai Jiao Tong University(上海交通大学) Renmin University of China(中国人民大学) Tsinghua University(清华大学) Shanghai AI Lab(上海人工智能实验室)

AI总结 UniAVGen通过非对称跨模态交互机制和双分支联合合成架构,实现了音频视频的统一生成,提升同步精度和语义一致性,实验表明其在较少训练样本下表现更优。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04338 2026-03-25 cs.CV cs.AI

From Editor to Dense Geometry Estimator

从编辑器到密集几何估计器

JiYuan Wang, Chunyu Lin, Lei Sun, Rongying Liu, Lang Nie, Mingxing Li, Kang Liao, Xiangxiang Chu

机构 * BJTU(北京工业大学) Alibaba Group(阿里巴巴集团) CQUPT(重庆大学) NTU(国立科技大学)

AI总结 本文分析了编辑器和生成器在密集几何估计中的微调行为,提出FE2E框架,通过改进编辑模型的训练目标和精度处理,实现了零样本单目深度和法线估计的显著提升。

Comments Accepted to CVPR 2026, 18pages, with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22564 2026-03-25 cs.CV cs.AI cs.LG

PRISM: Video Dataset Condensation with Progressive Refinement and Insertion for Sparse Motion

PRISM:基于渐进细化和插入的稀疏运动视频数据集压缩

Jaehyun Choi, Jiwan Hur, Gyojin Han, Jaemyung Yu, Junmo Kim

机构 * Korea AI Safety Institute, ETRI(韩国人工智能安全研究所,ETRI) KAIST(韩国科学技术院) NAVER AI Lab(NAVER AI实验室)

AI总结 PRISM通过将视频视为统一的时空结构,解决视频处理计算成本高和时空依赖性难题,实现高效存储与复杂运动的保留。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏