arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-05-15 至 2026-05-15 共收录 17
2605.15195 2026-05-15 cs.CV

VGGT-$Ω$

VGGT-Ω通过改进架构和训练方法,在静态和动态场景重建中提升精度与效率,同时减少内存消耗并利用更多数据

Jianyuan Wang, Minghao Chen, Shangzhan Zhang, Nikita Karaev, Johannes Schönberger, Patrick Labatut, Piotr Bojanowski, David Novotny, Andrea Vedaldi, Christian Rupprecht

机构 * Visual Geometry Group, University of Oxford(视觉几何组,牛津大学) Meta AI

AI总结 VGGT-Ω通过改进架构和训练方法,在静态和动态场景重建中提升精度与效率,同时减少内存消耗并利用更多数据。

Comments CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01015 2026-05-15 cs.CV

AuralSAM2: Enabling SAM2 Hear Through Pyramid Audio-Visual Feature Prompting

AuralSAM2:通过金字塔音频视觉特征提示实现SAM2的听觉能力

Yuyuan Liu, Yuanhong Chen, Chong Wang, Junlin Han, Junde Wu, Can Peng, Jingkun Chen, Yu Tian, Gustavo Carneiro

机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学人工智能研究所) Stanford University(斯坦福大学) University of Central Florida(佛罗里达中央大学) University of Surrey(萨里大学)

AI总结 AuralSAM2通过金字塔音频视觉特征提示整合音频,保持SAM2的可提示分割能力,引入AuralFuser融合音频和视觉特征,并通过音频引导对比损失对齐模态,提升分割精度。

Comments Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14885 2026-05-15 cs.CV

Masked Next-Scale Prediction for Self-supervised Scene Text Recognition

基于自监督的多尺度预测用于场景文本识别

Zhuohao Chen, Zeng Li, Yifei Zhang, Chang Liu, Yu Zhou

机构 * Nankai University(南开大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Department of Automation and BNRist, Tsinghua University(清华大学自动化系和清华大学脑科学与智能技术研究院)

AI总结 本文提出MNSP框架,通过跨尺度结构演化建模提升场景文本识别性能,实现86.2%的Union14M基准准确率。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026 Findings Track.10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14808 2026-05-15 cs.CV

SuperADD: Training-free Class-agnostic Anomaly Segmentation -- CVPR 2026 VAND 4.0 Workshop Challenge Industrial Track

SuperADD: 无需训练的类无关异常分割 -- CVPR 2026 VAND 4.0 工业赛道挑战

Lukas Roming, Felix Lehnerer, Jonas V. Funk, Andreas Michel, Georg Maier, Thomas Längle, Jürgen Beyerer

机构 * Fraunhofer IOSB(弗劳恩霍夫智能系统研究所)

AI总结 本文提出无需训练的类无关异常分割方法,通过改进鲁棒性以应对分布偏移,适用于工业场景,实现MVTec AD 2数据集上的高F1分数。

Comments Technical report for the CVPR 2026 VAND 4.0 workshop challenge industrial track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14708 2026-05-15 cs.CV

StyleTextGen: Style-Conditioned Multilingual Scene Text Generation

StyleTextGen: 多语言场景文本生成的风格条件化方法

Zeyu Chen, Fangmin Zhao, Yan Shu, Yichao Liu, Liu Yu, Yu Zhou

机构 * Nankai University(南开大学) University of Trento(特伦特大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

AI总结 本文提出StyleTextGen框架,解决多语言场景文本生成中风格提取与一致性维持问题,通过双分支编码器、一致性损失和掩码引导推理策略提升生成质量。

Comments This paper has been accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14569 2026-05-15 cs.CV

Bridging Brain and Semantics: A Hierarchical Framework for Semantically Enhanced fMRI-to-Video Reconstruction

连接大脑与语义:一种用于语义增强的fMRI到视频重建的分层框架

Yujie Wei, Chenglong Ma, Jianxiong Gao, Chenhui Wang, Shiwei Zhang, Biao Gong, Shuai Tan, Hangjie Yuan, Hongming Shan

机构 * Fudan University(复旦大学) Alibaba Group(阿里巴巴集团) Ant Group(蚂蚁集团)

AI总结 本文提出CineNeuron框架,通过分层结构解决fMRI信号与视频内容间的语义鸿沟问题,结合底部向上语义丰富和顶部向下记忆整合,提升视频重建效果。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14542 2026-05-15 cs.AI

VerbalValue: A Socially Intelligent Virtual Host for Sales-Driven Live Commerce

VerbalValue:面向销售驱动直播电商的社会智能虚拟主持人

Yuyan Chen

机构 * Cornell University(康奈尔大学)

AI总结 本文提出VerbalValue,一种以销售转化为导向的虚拟主持人,通过构建产品知识库和销售术语词典,结合大语言模型微调,提升直播电商中的信息传达和说服力。

Comments Accepted to the CVPR 2026 HiGen Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14191 2026-05-15 cs.CV

CoReDiT: Spatial Coherence-Guided Token Pruning and Reconstruction for Efficient Diffusion Transformers

CoReDiT:基于空间一致性引导的令牌剪枝与重建用于高效的扩散变换器

Zhuojin Li, Hsin-Pai Cheng, Hong Cai, Shizhong Han, Fatih Porikli

机构 * Qualcomm AI Research(高通人工智能研究)

AI总结 CoReDiT通过空间一致性引导的令牌剪枝与重建,显著降低扩散变换器的计算量,提升推理速度,同时保持高质量视觉输出。

Comments 8 pages, 8 figures, CVPR workshop

Journal ref 2026 CVPR Workshop of EDGE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13213 2026-05-15 cs.AI

Hierarchical Attacks for Multi-Modal Multi-Agent Reasoning

多模态多智能体推理的分层攻击

Hao Zhou, Tiru Wu, Yan Jiang, Wanqi Zhou, Junxing Hu, Ai Han

AI总结 本文提出HAM³框架,通过感知、通信、推理三层分层攻击,评估多智能体系统在不同推理范式下的攻击成功率,揭示多模态多智能体系统的安全漏洞。

Comments Accepted to CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00574 2026-05-15 cs.CV cs.AI

Decoupling Stability and Plasticity for Multi-Modal Test-Time Adaptation

解耦稳定性与可塑性以实现多模态测试时适应

Yongbo He, Zirun Guo, Tao Jin

机构 * Zhejiang University(浙江大学)

AI总结 本文提出DASP框架,通过解耦多模态测试时适应中的稳定性与可塑性,解决现有方法在无偏模态中的负迁移和有偏模态中的灾难性遗忘问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05008 2026-05-15 cs.CV

Multimodal Causal-Driven Representation Learning for Generalizable Medical Image Segmentation

多模态因果驱动表示学习用于通用化医学图像分割

Xusheng Liang, Lihua Zhou, Nianxin Li, Miao Xu, Ziyang Song, Dong Yi, Jinlin Wu, Jiawei Ma, Hongbin Liu, Zhen Lei, Jiebo Luo

机构 * City University of Hong Kong(香港城市大学) Shenzhen Loop Area Institute(深圳河套学院) CAIR, HKISI, Chinese Academy of Sciences(中国科学院计算智能研究所) UESTC(电子科技大学) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 本文提出MCDRL框架,结合因果推理与VLM解决医学图像分割的领域泛化问题,通过文本提示识别病变区域并消除领域特定影响,提升分割准确性与泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03519 2026-05-15 cs.LG

Revisiting Model Inversion Evaluation: From Misleading Standards to Reliable Privacy Assessment

重新审视模型反向评估:从误导性标准到可靠的隐私评估

Sy-Tuyen Ho, Koh Jun Hao, Ngoc-Bao Nguyen, Alexander Binder, Ngai-Man Cheung

机构 * Singapore University of Technology and Design(新加坡科技设计大学) University of Maryland College Park(马里兰大学学院公园分校)

AI总结 本文重新审视模型反向攻击的评估框架,揭示其存在虚假正例问题,并提出基于大规模语言模型的新评估方法以提升隐私评估的可靠性。

Comments Accepted to CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14136 2026-05-15 cs.CV

TeDiO: Temporal Diagonal Optimization for Training-Free Coherent Video Diffusion

TeDiO:基于时间对角优化的训练自由一致视频扩散

Nurislam Tursynbek, Zhiqiang Lao, Heather Yu, Gedas Bertasius, Marc Niethammer

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Futurewei Technologies Inc(未来科技有限公司) UCSD(加州大学圣迭戈分校)

AI总结 TeDiO通过优化内部注意力模式提升视频生成的时序一致性,无需训练或外部监督,实现更流畅的动态表现。

Comments CVPR'26 Workshop on Agentic AI for Visual Media

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14110 2026-05-15 cs.CV cs.RO

SToRe3D: Sparse Token Relevance in ViTs for Efficient Multi-View 3D Object Detection

SToRe3D:ViTs中稀疏令牌相关性用于高效多视角3D目标检测

Sandro Papais, Lezhou Feng, Charles Cossette, Lingting Ge

机构 * University of Toronto(多伦多大学) Zoox Inc(Zoox公司)

AI总结 SToRe3D通过联合选择2D图像令牌和3D目标查询,实现高效多视角3D目标检测,在nuScenes和新基准上达到3倍加速,保持精度。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14031 2026-05-15 cs.SD cs.CV cs.LG

Masked Autoencoders with Limited Data: Does It Work? A Fine-Grained Bioacoustics Case Study

受限数据下的掩码自编码器:它有效吗?一项细粒度生物声学案例研究

Wuao Liu, Mustafa Chasmai, Subhransu Maji, Grant Van Horn

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

AI总结 本文研究了在有限数据下使用掩码自编码器进行生物声学分类的效果,发现预训练数据规模在中等规模细粒度任务中起主导作用,而领域特定数据的额外预训练可能降低性能。

Comments Workshop on Fine-Grained Visual Categorization (FGVC) at CVPR 2026. 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14029 2026-05-15 cs.GR cs.CG

Fast and Robust Mesh Simplification for Generated and Real-World 3D Assets

快速且稳健的网格简化用于生成和现实世界的3D资产

Kunal Bhosikar, Preet Savalia, Lokender Tiwari, Brojeshwar Bhowmick

AI总结 本文提出了一种针对现代3D资产的全面网格简化流程,通过引入新的多项式误差公式,实现了快速且稳健的网格简化,保留精细几何结构和高质量外观,适用于大规模真实世界数据集。

Comments The IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshop on 3D Geometry Generation for Scientific Computing (3D4S) 2026 (Best Paper Award Runner-up)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13852 2026-05-15 cs.GR cs.CV cs.LG

Realiz3D: 3D Generation Made Photorealistic via Domain-Aware Learning

Realiz3D: 通过领域感知学习实现逼真3D生成

Ido Sobol, Kihyuk Sohn, Yoav Blum, Egor Zakharov, Max Bluvstein, Andrea Vedaldi, Or Litany

机构 * Technion(技术学院) Meta AI

AI总结 Realiz3D通过分离控制信号与视觉领域,提升生成图像的逼真度和3D一致性,适用于文本到多视角生成和3D输入纹理生成。

Comments Accepted to CVPR 2026. Project page: https://idosobol.github.io/realiz3d/

详情

展开后加载摘要…

URL PDF HTML 收藏