arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11871
2509.26037 2026-05-19 cs.AI cs.CV cs.LG

CoLLM-NAS: Collaborative Large Language Models for Efficient Knowledge-Guided Neural Architecture Search

CoLLM-NAS:协作大型语言模型用于高效知识引导的神经架构搜索

Zhe Li, Zhiwei Lin, Yongtao Wang

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机科学技术研究院)

AI总结 本文提出CoLLM-NAS,一种基于协作大型语言模型的两阶段神经架构搜索框架,通过导航和生成两个LLM及协调模块,有效指导搜索过程,提升效率并取得新状态最优结果。

Comments Accepted as Oral at CVPR 2026 Workshop on Neural Architecture Search (NAS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00666 2026-05-19 cs.CV

Explaining Object Detectors via Collective Contribution of Pixels

通过像素的集体贡献解释目标检测器

Toshinori Yamauchi, Hiroshi Kera, Kazuhiko Kawamoto

机构 * Chiba University(千叶大学) National Institute of Informatics(信息处理研究所)

AI总结 本文提出基于Shapley值和交互的游戏理论方法,以捕捉像素的个体和集体贡献,提升目标检测器的解释性与准确性。

Comments Accepted to CVPR 2026 (Highlight); code is available at: https://github.com/tttt-0814/VX-CODE

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09333 2026-05-19 cs.CV

Learning Spatial-Preserving Hierarchical Representations for Digital Pathology

学习空间保持的层次表示用于数字病理学

Weiyi Wu, Xingjian Diao, Chunhui Zhang, Chongyang Gao, Xinwen Xu, Siting Li, Jiang Gui

机构 * Dartmouth College(达特茅斯学院) Massachusetts General Hospital(麻省总医院) Northwestern University(西北大学)

AI总结 本文提出SPAN框架,通过保留空间关系和计算分配,提升数字病理学图像的层次表示能力,通过两种变体在多个数据集上验证了其有效性。

Journal ref CVPR 2026 (Findings Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16431 2026-05-19 cs.CV

CT-DegradBench: A Physics-Informed Benchmark for CT Degradation Detection and Severity Estimation

CT-DegradBench:一种用于CT退化检测和严重程度估计的物理引导基准

Yousra Nabila Taifour, Marouane Tliba, Zuheng Ming, Marie Luong, Nour Aburaed, Aladine Chetouani, Gorkem Durak, Alessandro Bruno, Faouzi Alaya Cheikh, Habib Zaidi, Ulas Bagci, Azeddine Beghdadi

机构 * Université Sorbonne Paris Nord(索邦巴黎北大学) University of Dubai(迪拜大学) Northwestern University(西北大学) IULM University(IULM大学) Norwegian University of Science and Technology(挪威科学与技术大学) University of Geneva(日内瓦大学)

AI总结 本文提出CT-DegradBench,一个用于评估CT退化检测和严重程度估计的基准,结合语义先验和频域线索,提出SeSpeCT框架,在多模态嵌入空间中构建免训练的语义质量轴,实现退化类型和严重程度的联合预测。

Comments Accepted in CVPR 2026 VISION Workshop (DEXTER track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16080 2026-05-18 cs.CV

ReAlign: Generalizable Image Forgery Detection via Reasoning-Aligned Representation

ReAlign:通过推理对齐表示实现通用图像伪造检测

Qing Huang, Zhipei Xu, Xuanyu Zhang, Xiangyu Yu, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院) School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息工程学院) Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology, Shenzhen Graduate School, Peking University(广东省超高清沉浸媒体技术重点实验室,北京大学深圳研究生院)

AI总结 本文提出ReAlign框架,通过对比学习将LLM生成的高质量推理文本转化为轻量级AIGI检测器,提升检测准确性和泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15951 2026-05-18 cs.CV

From Failure to Feedback: Group Revision Unlocks Hard Cases in Object-Level Grounding

从失败到反馈:群体修订解锁对象级 grounding 的难题

Yuyuan Liu, Yiping Ji, Anjie Le, Jiayuan Zhu, Jiazhen Pan, Can Peng, Jiajun Deng, Fengbei Liu, Junde Wu

机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学人工智能研究所) Technical University of Munich(慕尼黑技术大学) University of Science and Technology of China(中国科学技术大学) Cornell University(康奈尔大学)

AI总结 本文提出群体修订优化方法,通过生成改进候选响应提升硬案例学习效果,改进奖励和优势函数以增强高质量修订影响,优于现有GRPO方法。

Comments 8 pages, 5 figures, IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15792 2026-05-18 cs.CV

Reversing the Flow: Generation-to-Understanding Synergy in Large Multimodal Models

反向流动:大型多模态模型中的生成到理解协同效应

Yujun Tong, Dongliang Chang, Zijin Yin, Xintong Liu, Yuanchen Fang, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Key Laboratory of Multimodal Data Intelligent Perception and Governance(北京多模态数据智能感知与治理重点实验室)

AI总结 本文提出生成到理解协同效应,通过生成过程作为中间推理步骤提升多模态理解,揭示生成与理解的双向关系及模型自我反思的不足。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15689 2026-05-18 cs.CV

How to Choose Your Teacher for Fine Grained Image Recognition

如何为细粒度图像识别选择教师

Oswin Gosal, Edwin Arkel Rios, Augusto Christian Surya, Fernando Mikael, Bo-Cheng Lai, Min-Chun Hu

机构 * National Tsing Hua University, Taiwan(台湾国立清华大学) National Yang Ming Chiao Tung University, Taiwan(台湾国立阳明交通大学)

AI总结 本文提出Ratio 1-2指标,通过分析实验数据提升教师选择效果,使小模型在细粒度图像识别中获得17%的准确率提升。

Comments Accepted to The 13th Workshop on Fine-Grained Visual Categorization (FGVC13) @ CVPR 2026. Main: 6 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15421 2026-05-18 cs.CV

U-SEG: Uncertainty in SEGmentation -- A systematic multi-variable exploration

U-SEG:不确定性在分割中的探索——系统多变量研究

Michael Smith, Frank P. Ferrie

机构 * Centre for Intelligent Machines, McGill University(智能机器中心,麦吉尔大学)

AI总结 本文系统探讨了不确定性估计与分割交集中的关键问题,分析了不同变量对分割性能的影响,发现挑战性任务和样本多样性在分割中具有重要作用。

Comments Accepted to CVPR Findings Track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20630 2026-05-18 cs.CV

From Pairs to Sequences: Track-Aware Policy Gradients for Keypoint Detection

从配对到序列:面向跟踪的策略梯度方法用于关键点检测

Yepeng Liu, Hao Li, Liwen Yang, Fangzhen Li, Xudi Ge, Yuliang Gu, kuang Gao, Bing Wang, Guang Chen, Hangjun Ye, Yongchao Xu

机构 * School of Computer Science, Wuhan University(1 武汉大学计算机学院) Xiaomi EV(2 小米电动车)

AI总结 本文提出TraqPoint方法,将关键点检测视为序列决策问题,通过跟踪感知奖励机制提升关键点的长期可跟踪性,在稀疏匹配基准上优于现有方法。

Comments Accepted by CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15195 2026-05-15 cs.CV

VGGT-$Ω$

VGGT-Ω通过改进架构和训练方法,在静态和动态场景重建中提升精度与效率,同时减少内存消耗并利用更多数据

Jianyuan Wang, Minghao Chen, Shangzhan Zhang, Nikita Karaev, Johannes Schönberger, Patrick Labatut, Piotr Bojanowski, David Novotny, Andrea Vedaldi, Christian Rupprecht

机构 * Visual Geometry Group, University of Oxford(视觉几何组,牛津大学) Meta AI

AI总结 VGGT-Ω通过改进架构和训练方法,在静态和动态场景重建中提升精度与效率,同时减少内存消耗并利用更多数据。

Comments CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01015 2026-05-15 cs.CV

AuralSAM2: Enabling SAM2 Hear Through Pyramid Audio-Visual Feature Prompting

AuralSAM2:通过金字塔音频视觉特征提示实现SAM2的听觉能力

Yuyuan Liu, Yuanhong Chen, Chong Wang, Junlin Han, Junde Wu, Can Peng, Jingkun Chen, Yu Tian, Gustavo Carneiro

机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学人工智能研究所) Stanford University(斯坦福大学) University of Central Florida(佛罗里达中央大学) University of Surrey(萨里大学)

AI总结 AuralSAM2通过金字塔音频视觉特征提示整合音频,保持SAM2的可提示分割能力,引入AuralFuser融合音频和视觉特征,并通过音频引导对比损失对齐模态,提升分割精度。

Comments Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14885 2026-05-15 cs.CV

Masked Next-Scale Prediction for Self-supervised Scene Text Recognition

基于自监督的多尺度预测用于场景文本识别

Zhuohao Chen, Zeng Li, Yifei Zhang, Chang Liu, Yu Zhou

机构 * Nankai University(南开大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Department of Automation and BNRist, Tsinghua University(清华大学自动化系和清华大学脑科学与智能技术研究院)

AI总结 本文提出MNSP框架,通过跨尺度结构演化建模提升场景文本识别性能,实现86.2%的Union14M基准准确率。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026 Findings Track.10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14808 2026-05-15 cs.CV

SuperADD: Training-free Class-agnostic Anomaly Segmentation -- CVPR 2026 VAND 4.0 Workshop Challenge Industrial Track

SuperADD: 无需训练的类无关异常分割 -- CVPR 2026 VAND 4.0 工业赛道挑战

Lukas Roming, Felix Lehnerer, Jonas V. Funk, Andreas Michel, Georg Maier, Thomas Längle, Jürgen Beyerer

机构 * Fraunhofer IOSB(弗劳恩霍夫智能系统研究所)

AI总结 本文提出无需训练的类无关异常分割方法,通过改进鲁棒性以应对分布偏移,适用于工业场景,实现MVTec AD 2数据集上的高F1分数。

Comments Technical report for the CVPR 2026 VAND 4.0 workshop challenge industrial track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14708 2026-05-15 cs.CV

StyleTextGen: Style-Conditioned Multilingual Scene Text Generation

StyleTextGen: 多语言场景文本生成的风格条件化方法

Zeyu Chen, Fangmin Zhao, Yan Shu, Yichao Liu, Liu Yu, Yu Zhou

机构 * Nankai University(南开大学) University of Trento(特伦特大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

AI总结 本文提出StyleTextGen框架,解决多语言场景文本生成中风格提取与一致性维持问题,通过双分支编码器、一致性损失和掩码引导推理策略提升生成质量。

Comments This paper has been accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14569 2026-05-15 cs.CV

Bridging Brain and Semantics: A Hierarchical Framework for Semantically Enhanced fMRI-to-Video Reconstruction

连接大脑与语义:一种用于语义增强的fMRI到视频重建的分层框架

Yujie Wei, Chenglong Ma, Jianxiong Gao, Chenhui Wang, Shiwei Zhang, Biao Gong, Shuai Tan, Hangjie Yuan, Hongming Shan

机构 * Fudan University(复旦大学) Alibaba Group(阿里巴巴集团) Ant Group(蚂蚁集团)

AI总结 本文提出CineNeuron框架,通过分层结构解决fMRI信号与视频内容间的语义鸿沟问题,结合底部向上语义丰富和顶部向下记忆整合,提升视频重建效果。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14542 2026-05-15 cs.AI

VerbalValue: A Socially Intelligent Virtual Host for Sales-Driven Live Commerce

VerbalValue:面向销售驱动直播电商的社会智能虚拟主持人

Yuyan Chen

机构 * Cornell University(康奈尔大学)

AI总结 本文提出VerbalValue,一种以销售转化为导向的虚拟主持人,通过构建产品知识库和销售术语词典,结合大语言模型微调,提升直播电商中的信息传达和说服力。

Comments Accepted to the CVPR 2026 HiGen Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14191 2026-05-15 cs.CV

CoReDiT: Spatial Coherence-Guided Token Pruning and Reconstruction for Efficient Diffusion Transformers

CoReDiT:基于空间一致性引导的令牌剪枝与重建用于高效的扩散变换器

Zhuojin Li, Hsin-Pai Cheng, Hong Cai, Shizhong Han, Fatih Porikli

机构 * Qualcomm AI Research(高通人工智能研究)

AI总结 CoReDiT通过空间一致性引导的令牌剪枝与重建,显著降低扩散变换器的计算量,提升推理速度,同时保持高质量视觉输出。

Comments 8 pages, 8 figures, CVPR workshop

Journal ref 2026 CVPR Workshop of EDGE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13213 2026-05-15 cs.AI

Hierarchical Attacks for Multi-Modal Multi-Agent Reasoning

多模态多智能体推理的分层攻击

Hao Zhou, Tiru Wu, Yan Jiang, Wanqi Zhou, Junxing Hu, Ai Han

AI总结 本文提出HAM³框架,通过感知、通信、推理三层分层攻击,评估多智能体系统在不同推理范式下的攻击成功率,揭示多模态多智能体系统的安全漏洞。

Comments Accepted to CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00574 2026-05-15 cs.CV cs.AI

Decoupling Stability and Plasticity for Multi-Modal Test-Time Adaptation

解耦稳定性与可塑性以实现多模态测试时适应

Yongbo He, Zirun Guo, Tao Jin

机构 * Zhejiang University(浙江大学)

AI总结 本文提出DASP框架,通过解耦多模态测试时适应中的稳定性与可塑性,解决现有方法在无偏模态中的负迁移和有偏模态中的灾难性遗忘问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05008 2026-05-15 cs.CV

Multimodal Causal-Driven Representation Learning for Generalizable Medical Image Segmentation

多模态因果驱动表示学习用于通用化医学图像分割

Xusheng Liang, Lihua Zhou, Nianxin Li, Miao Xu, Ziyang Song, Dong Yi, Jinlin Wu, Jiawei Ma, Hongbin Liu, Zhen Lei, Jiebo Luo

机构 * City University of Hong Kong(香港城市大学) Shenzhen Loop Area Institute(深圳河套学院) CAIR, HKISI, Chinese Academy of Sciences(中国科学院计算智能研究所) UESTC(电子科技大学) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 本文提出MCDRL框架,结合因果推理与VLM解决医学图像分割的领域泛化问题,通过文本提示识别病变区域并消除领域特定影响,提升分割准确性与泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03519 2026-05-15 cs.LG

Revisiting Model Inversion Evaluation: From Misleading Standards to Reliable Privacy Assessment

重新审视模型反向评估:从误导性标准到可靠的隐私评估

Sy-Tuyen Ho, Koh Jun Hao, Ngoc-Bao Nguyen, Alexander Binder, Ngai-Man Cheung

机构 * Singapore University of Technology and Design(新加坡科技设计大学) University of Maryland College Park(马里兰大学学院公园分校)

AI总结 本文重新审视模型反向攻击的评估框架,揭示其存在虚假正例问题,并提出基于大规模语言模型的新评估方法以提升隐私评估的可靠性。

Comments Accepted to CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14136 2026-05-15 cs.CV

TeDiO: Temporal Diagonal Optimization for Training-Free Coherent Video Diffusion

TeDiO:基于时间对角优化的训练自由一致视频扩散

Nurislam Tursynbek, Zhiqiang Lao, Heather Yu, Gedas Bertasius, Marc Niethammer

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Futurewei Technologies Inc(未来科技有限公司) UCSD(加州大学圣迭戈分校)

AI总结 TeDiO通过优化内部注意力模式提升视频生成的时序一致性,无需训练或外部监督,实现更流畅的动态表现。

Comments CVPR'26 Workshop on Agentic AI for Visual Media

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14110 2026-05-15 cs.CV cs.RO

SToRe3D: Sparse Token Relevance in ViTs for Efficient Multi-View 3D Object Detection

SToRe3D:ViTs中稀疏令牌相关性用于高效多视角3D目标检测

Sandro Papais, Lezhou Feng, Charles Cossette, Lingting Ge

机构 * University of Toronto(多伦多大学) Zoox Inc(Zoox公司)

AI总结 SToRe3D通过联合选择2D图像令牌和3D目标查询,实现高效多视角3D目标检测,在nuScenes和新基准上达到3倍加速,保持精度。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14031 2026-05-15 cs.SD cs.CV cs.LG

Masked Autoencoders with Limited Data: Does It Work? A Fine-Grained Bioacoustics Case Study

受限数据下的掩码自编码器:它有效吗?一项细粒度生物声学案例研究

Wuao Liu, Mustafa Chasmai, Subhransu Maji, Grant Van Horn

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

AI总结 本文研究了在有限数据下使用掩码自编码器进行生物声学分类的效果,发现预训练数据规模在中等规模细粒度任务中起主导作用,而领域特定数据的额外预训练可能降低性能。

Comments Workshop on Fine-Grained Visual Categorization (FGVC) at CVPR 2026. 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14029 2026-05-15 cs.GR cs.CG

Fast and Robust Mesh Simplification for Generated and Real-World 3D Assets

快速且稳健的网格简化用于生成和现实世界的3D资产

Kunal Bhosikar, Preet Savalia, Lokender Tiwari, Brojeshwar Bhowmick

AI总结 本文提出了一种针对现代3D资产的全面网格简化流程,通过引入新的多项式误差公式,实现了快速且稳健的网格简化,保留精细几何结构和高质量外观,适用于大规模真实世界数据集。

Comments The IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshop on 3D Geometry Generation for Scientific Computing (3D4S) 2026 (Best Paper Award Runner-up)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13852 2026-05-15 cs.GR cs.CV cs.LG

Realiz3D: 3D Generation Made Photorealistic via Domain-Aware Learning

Realiz3D: 通过领域感知学习实现逼真3D生成

Ido Sobol, Kihyuk Sohn, Yoav Blum, Egor Zakharov, Max Bluvstein, Andrea Vedaldi, Or Litany

机构 * Technion(技术学院) Meta AI

AI总结 Realiz3D通过分离控制信号与视觉领域,提升生成图像的逼真度和3D一致性,适用于文本到多视角生成和3D输入纹理生成。

Comments Accepted to CVPR 2026. Project page: https://idosobol.github.io/realiz3d/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13755 2026-05-14 cs.CV

Generative Texture Diversification of 3D Pedestrians for Robust Autonomous Driving Perception

生成3D行人纹理多样化以实现自动驾驶感知的鲁棒性

Arka Bhowmick, Enes Ozeren, Ahmed Abdullah, Oliver Wasenmuller

机构 * BIT Technology Solutions GmbH(比特技术解决方案 GmbH) Mannheim University of Applied Sciences(曼海姆应用科学大学)

AI总结 本文提出一种简单有效的方法,通过StyleGAN2生成多样化的3D行人资产,用于合成场景生成,提升自动驾驶感知的鲁棒性。

Comments Published at SAIAD 2026 Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13467 2026-05-14 cs.CL

PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning

PDCR:感知分解置信度奖励用于视觉-语言推理

Hee Suk Yoon, Eunseop Yoon, Ji Woo Hong, SooHwan Eom, Gwanhyeong Koo, Mark Hasegawa-Johnson, Qi Dai, Chong Luo, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国高级科学技术研究院) University of Illinois at Urbana-Champaign (UIUC)(伊利诺伊大学厄巴纳-香槟分校) Microsoft Research Asia (MSRA)(微软亚洲研究院)

AI总结 PDCR通过分解任务中的感知与推理步骤,提升视觉-语言推理的训练效果,解决全局奖励导致的信号退化问题。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13465 2026-05-14 cs.CV

Z-Order Transformer for Feed-Forward Gaussian Splatting

Z-Order Transformer用于前馈高斯点云

Can Wang, Lei Liu, Wei Jiang, Dong Xu

机构 * The University of Hong Kong(香港大学) Futurewei Technologies Inc(未来科技公司)

AI总结 本文提出Z-Order Transformer用于前馈高斯点云,通过稀疏注意力机制和Z-order策略有效捕捉高斯点间空间与语义关系,提升实时渲染质量与效率。

Comments Accept by CVPR 2026, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏