arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-04-01 至 2026-04-01 共收录 44
2601.06874 2026-04-01 cs.CV

MVGGT: Multimodal Visual Geometry Grounded Transformer for Multiview 3D Referring Expression Segmentation

MVGGT:多模态视觉几何 grounded 变换器用于多视角3D指称表达分割

Changli Wu, Haodong Wang, Jiayi Ji, Yutian Yao, Chunsai Du, Jihua Kang, Yanwei Fu, Liujuan Cao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) ByteDance(字节跳动) Tianjin University of Science and Technology(天津科技大学)

AI总结 本文提出MVGGT,一种高效的端到端框架,通过双分支设计将语言信息整合到稀疏视角的几何推理中,解决稀疏视角下的优化障碍,建立首个强基线,实现高精度和快速推理。

Comments Accepted to CVPR 2026; Project Website: https://mvggt.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02536 2026-04-01 cs.CV

MovieRecapsQA: A Multimodal Open-Ended Video Question-Answering Benchmark

MovieRecapsQA: 一种多模态开放式视频问答基准

Shaden Shaar, Bradon Thymes, Sirawut Chaixanien, Claire Cardie, Bharath Hariharan

机构 * Cornell University(康奈尔大学)

AI总结 本文提出MovieRecapsQA基准,通过电影回顾视频生成8200个开放式问题及事实,构建无参考评估指标,评估多模态能力,发现视觉感知是主要瓶颈。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24176 2026-04-01 cs.CV cs.LG

Guiding a Diffusion Transformer with the Internal Dynamics of Itself

通过自身内部动态引导扩散变换器

Xingyu Zhou, Qifan Li, Xiaobin Hu, Hai Chen, Shuhang Gu

机构 * University of Electronic Science and Technology of China(电子科技大学) National University of Singapore(新加坡国立大学) Sun Yat-sen University(中山大学) North China Institute of Computer Systems Engineering(华北计算机系统工程研究所)

AI总结 本文提出内部引导策略,通过训练过程中中间层的辅助监督和采样时的中间层输出扩展,提升训练效率和生成质量,在ImageNet上取得显著效果。

Comments Accepted to CVPR 2026. Project Page: https://zhouxingyu13.github.io/Internal-Guidance/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17320 2026-04-01 cs.CV

EMMA: Concept Erasure Benchmark with Comprehensive Semantic Metrics and Diverse Categories

EMMA:具有综合语义度量和多样类别的概念擦除基准

Lu Wei, Yuta Nakashima, Noa Garcia

机构 * The University of Osaka(大阪大学)

AI总结 EMMA通过13项指标评估五种概念擦除方法,揭示其在隐含提示和视觉相似非目标概念下的鲁棒性问题,发现部分方法加剧性别和种族偏见。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10938 2026-04-01 cs.LG cs.AI cs.CL cs.CV

Stronger Normalization-Free Transformers

更强的无归一化变换器

Mingzhi Chen, Taiming Lu, Jiachen Zhu, Mingjie Sun, Zhuang Liu

机构 * Princeton University(普林斯顿大学) New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出Derf函数,通过大规模搜索找到更有效的归一化替代方案,其在视觉识别、语音表示和DNA序列建模中均优于LayerNorm、RMSNorm和DyT。

Comments Published in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10805 2026-04-01 cs.LG cs.CV

Interpretable and Steerable Concept Bottleneck Sparse Autoencoders

可解释且可操控的概念瓶颈稀疏自编码器

Akshay Kulkarni, Tsui-Wei Weng, Vivek Narayanaswamy, Shusen Liu, Wesam A. Sakla, Kowshik Thopalli

机构 * University of California, San Diego(加州大学圣迭戈分校) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

AI总结 本文提出CB-SAE框架,通过剪枝低效神经元和增加概念瓶颈提升LVLMs和图像生成任务的可解释性和可操控性,效果提升分别为32.1%和14.5%。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05597 2026-04-01 cs.CV

Fast SceneScript: Fast and Accurate Language-Based 3D Scene Understanding via Multi-Token Prediction

快速场景脚本:通过多令牌预测实现高效准确的语言基3D场景理解

Ruihong Yin, Xuepeng Shi, Oleksandr Bailo, Marco Manfredi, Theo Gevers

机构 * Qualcomm XR Labs(高通XR实验室) University of Amsterdam(阿姆斯特丹大学)

AI总结 本文提出Fast SceneScript,通过多令牌预测和自适应解码方法,在保持精度的同时提升3D场景理解的推理速度,实验表明其在合成和真实数据集上表现优异。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22715 2026-04-01 cs.CV cs.AI cs.CL cs.MM

ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering

ReAG:基于推理的生成用于基于知识的视觉问答

Alberto Compagnoni, Marco Morini, Sara Sarto, Federico Cocchi, Davide Caffagni, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳大学和雷焦艾米利亚大学) University of Pisa(比萨大学)

AI总结 ReAG通过结合粗粒度和细粒度检索及批评模型过滤无关信息,提升知识密集型视觉问答的准确性和可解释性。

Comments CVPR 2026 - Project page: https://aimagelab.github.io/ReAG/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00524 2026-04-01 cs.CV

Text-guided Fine-Grained Video Anomaly Understanding

基于文本引导的细粒度视频异常理解

Jihao Gu, Kun Li, He Wang, Kaan Akşit

机构 * University College London(伦敦大学学院) CVLab, College of Information Technology, United Arab Emirates University(阿联酋大学信息技术学院计算机视觉实验室)

AI总结 本文提出T-VAU框架,通过多模态推理提取细粒度视频异常证据,结合Anomaly Heatmap Decoder和Region-aware Anomaly Encoder提升异常检测与解释能力。

Comments Accepted by CVPR 2026 SVC Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23043 2026-04-01 cs.CV

HieraMamba: Video Temporal Grounding via Hierarchical Anchor-Mamba Pooling

HieraMamba:通过分层锚点-Mamba池化实现视频时间接地

Joungbin An, Kristen Grauman

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 HieraMamba通过分层锚点-Mamba池化结构,在长视频中实现精确的时间定位,解决了视频时间接地中的全局上下文与细粒度时间细节捕捉难题。

Comments CVPR 2026. Project Page: https://vision.cs.utexas.edu/projects/hieramamba/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10388 2026-04-01 cs.CV

VT-Intrinsic: Physics-Based Decomposition of Reflectance and Shading using a Single Visible-Thermal Image Pair

VT-Intrinsic: 基于物理的单可见-热图像对的反光与阴影分解

Zeqing Yuan, Mani Ramanagopal, Aswin C. Sankaranarayanan, Srinivasa G. Narasimhan

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出一种基于物理的单可见-热图像对的反光与阴影分解方法,通过利用热成像仪检测吸收的热量来关联可见和热图像的强度顺序,实现反光和阴影的自监督恢复。

Comments Accepted by CVPR 2026. Project webpage: https://vt-intrinsic.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12692 2026-04-01 cs.CV cs.AI cs.LG

Multi-Level Knowledge Distillation and Dynamic Self-Supervised Learning for Continual Learning

多级知识蒸馏与动态自监督学习用于持续学习

Taeheon Kim, San Kim, Minhyuk Seo, Dongjae Jeon, Wonje Jeung, Jonghyun Choi

机构 * Yonsei University(延世大学) Seoul National University(首尔大学)

AI总结 本文提出多级知识蒸馏和动态自监督学习,用于解决持续学习中的类别增量问题,通过利用未标记数据提升模型稳定性与可塑性,实验显示在CVPR CLVISION挑战中取得第二名。

Comments 2nd Place in Class-Incremental with Repetition (CIR) using Unlabeled Data Challenge at 5th CLVISION workshop, CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09082 2026-04-01 cs.CV cs.AI cs.LG

AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models

AVA-Bench:用于视觉基础模型的原子视觉能力基准

Zheda Mai, Arpita Chowdhury, Zihe Wang, Sooyoung Jeon, Lemeng Wang, Jiacheng Hou, Wei-Lun Chao

机构 * The Ohio State University(俄亥俄州立大学) Adobe Research(Adobe研究院) Boston University(波士顿大学)

AI总结 AVA-Bench通过解耦14种原子视觉能力,揭示视觉基础模型的性能差异,提升模型选择的科学性与效率。

Comments Accepted by CVPR 2026. The first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04466 2026-04-01 cs.CV

Emotional Speech-driven 3D Body Animation via Disentangled Latent Diffusion

基于解耦潜在扩散的情感语音驱动3D人体动画

Kiran Chhatre, Radek Daněček, Nikos Athanasiou, Giorgio Becherini, Christopher Peters, Michael J. Black, Timo Bolkart

机构 * KTH Royal Institute of Technology, Sweden(瑞典皇家理工学院) Max Planck Institute for Intelligent Systems, Germany(德国马克斯·普朗克智能系统研究所)

AI总结 本文提出AMUSE模型,通过解耦潜在向量实现情感语音驱动的3D人体动画生成,能控制情绪和风格,生成更符合语音内容且表现更真实的情绪动作序列。

Comments Conference on Computer Vision and Pattern Recognition (CVPR) 2024. Webpage: https://amuse.is.tue.mpg.de/

详情

展开后加载摘要…

URL PDF HTML 收藏