arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11876
2512.17012 2026-04-14 cs.CV

4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillation

4D-RGPT:通过感知蒸馏实现区域级4D理解

Chiao-An Yang, Ryo Hachiuma, Sifei Liu, Subhashree Radhakrishnan, Raymond A. Yeh, Yu-Chiang Frank Wang, Min-Hung Chen

机构 * NVIDIA(英伟达)

AI总结 本文提出4D-RGPT和P4D框架,解决3D/4D视频问答中4D感知和时间理解不足的问题,并构建了区域级提示的R4D-Bench基准。

Comments CVPR 2026 (Highlight). Project page: https://www.ca-joe-yang.com/resource/projects/4D_RGPT/. GitHub: https://github.com/NVlabs/4D-RGPT. Dataset: https://huggingface.co/datasets/nvidia/R4D-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12968 2026-04-14 cs.CV

GrOCE:Graph-Guided Online Concept Erasure for Text-to-Image Diffusion Models

GrOCE:基于图的在线概念擦除用于文本到图像扩散模型

Ning Han, Zhenyu Ge, Feng Han, Yuhua Sun, Chengqing Li, Jingjing Chen

机构 * School of Computer Science, Xiangtan University(湘潭大学计算机科学学院) School of Computer Science, Fudan University(复旦大学计算机科学学院)

AI总结 GrOCE提出一种无需训练的框架,通过动态语义图和适应性聚类识别实现精准的在线概念擦除,提升文本到图像扩散模型的语义准确性和稳定性。

Comments Accepted to CVPR 2026 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03447 2026-04-14 cs.CV

CoPS: Conditional Prompt Synthesis for Zero-Shot Anomaly Detection

CoPS:用于零样本异常检测的条件提示合成

Qiyu Chen, Zhen Qu, Wei Luo, Haiming Yao, Yunkang Cao, Yuxin Jiang, Yinan Duan, Huiyuan Luo, Chengkan Lv, Zhengtao Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) CASIVISION(中科视语) THU(清华大学) HNU(湖南大学) HUST(华中科技大学)

AI总结 本文提出CoPS框架,通过动态提示合成提升零样本异常检测性能,利用视觉特征生成适应性状态模型,并在13个工业和医疗数据集上取得分类AUROC和分割AUROC的提升。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01201 2026-04-14 cs.CV

Perceptual Inductive Bias Is What You Need Before Contrastive Learning

感知归纳偏置是在对比学习之前所需的东西

Tianqin Li, Junru Zhao, Dunhan Jiang, Shenghao Wu, Alan Ramirez, Tai Sing Lee

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出在对比学习前引入感知归纳偏置,通过构建边界和表面表示来提升ResNet18的收敛速度和最终表示质量。

Comments CVPR 2025. Tianqin Li and Junru Zhao contributed equally to this work. Due to a formatting error during the CVPR submission, the equal contribution note was omitted in the official proceedings. This arXiv version corrects that oversight. The author order follows alphabetical order by last name. Code: https://github.com/juz031/MidVCL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10692 2026-04-14 cs.CV cs.RO

Exploring the best way for UAV visual localization under Low-altitude Multi-view Observation Condition: a Benchmark

探索在低空多视角观测条件下无人机视觉定位的最佳方法:一个基准

Yibin Ye, Xichao Teng, Shuo Chen, Leqi Liu, Kun Wang, Xiaokai Song, Zhang Li

机构 * National University of Defense Technology(国防科技大学)

AI总结 本文提出一个基准,用于评估低空多视角条件下无人机视觉定位方法,通过构建大规模数据集和统一框架,分析影响定位精度的关键因素,并提出新的检索指标PDM@K。

Comments Accepted by CVPRF 2026 (Findings of the Conference on Computer Vision and Pattern Recognition 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17163 2026-04-14 cs.CV

OSDFace: One-Step Diffusion Model for Face Restoration

OSDFace:面向面部修复的一步扩散模型

Jingkai Wang, Jue Gong, Lin Zhang, Zheng Chen, Xing Liu, Hong Gu, Yutong Liu, Yulun Zhang, Xiaokang Yang

机构 * Shanghai Jiao Tong University(上海交通大学) vivo Mobile Communication Co., Ltd(维沃移动通信有限公司)

AI总结 OSDFace提出一种一步扩散模型,通过视觉嵌入器和面部身份损失提升面部修复的视觉质量和身份一致性。

Comments Accepted to CVPR 2025. The code and model will be available at https://github.com/jkwang28/OSDFace

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10127 2026-04-14 cs.CV cs.AI

VGA-Bench: A Unified Benchmark and Multi-Model Framework for Video Aesthetics and Generation Quality Evaluation

VGA-Bench:一个统一的基准和多模型框架用于视频审美和生成质量评估

Longteng Jiang, DanDan Zheng, Qianqian Qiao, Heng Huang, Huaye Wang, Yihang Bo, Bao Peng, Jingdong Chen, Jun Zhou, Xin Jin

机构 * Ant Group(蚂蚁集团) Beijing Film Academy(北京电影学院) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,北京通用人工智能研究院)

AI总结 本文提出VGA-Bench,通过三层次分类体系,结合1016个多样化提示生成60000+视频数据集,设计多任务神经评估器,实现视频生成质量与审美质量的系统评估。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10064 2026-04-14 cs.CV

On The Application of Linear Attention in Multimodal Transformers

多模态Transformer中线性注意力的应用

Armin Gerami, Seyedehanita Madani, Ramani Duraiswami

机构 * University of Maryland(马里兰大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文研究了线性注意力在多模态框架中的应用,通过减少计算开销并保持性能,证明了线性注意力在多模态Transformer中的有效性。

Comments Workshop on Any-to-Any Multimodal Learning (Any2Any), CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10056 2026-04-14 cs.CV

U$^{2}$Flow: Uncertainty-Aware Unsupervised Optical Flow Estimation

U²Flow:基于不确定性的无监督光流估计

Xunpei Sun, Wenwei Lin, Yi Chang, Gang Chen

机构 * Sun Yat-sen University(中山大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 U²Flow是首个联合估计光流和像素不确定性的无监督框架,通过解耦学习策略从增强一致性中获取不确定性监督,提升训练稳定性。引入不确定性引导的双向流融合机制,实验表明其在KITTI和Sintel上达到无监督方法最优,生成可靠不确定性图。

Comments Accepted as an oral presentation at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10040 2026-04-14 cs.CV

Intra-finger Variability of Diffusion-based Latent Fingerprint Generation

基于扩散模型的指纹生成内部手指变异性研究

Noor Hussein, Anil K. Jain, Karthik Nandakumar

机构 * Michigan State University(密歇根州立大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

AI总结 本文系统评估了使用先进扩散模型生成的合成指纹(特别是潜在指纹)的内部手指变异性,通过构建包含七种多样数据集的潜在风格库,提高了生成模型的潜在风格多样性,并分析了生成指纹中ridge和 minutiae的完整性。

Comments Accepted at the 2nd Workshop on Foundation and Generative Models in Biometrics (FoundGen-Bio), held in conjunction with CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10023 2026-04-14 cs.CV cs.AI

FREE-Switch: Frequency-based Dynamic LoRA Switch for Style Transfer

FREE-Switch: 基于频率的动态LoRA切换用于风格迁移

Shenghe Zheng, Minyu Zhang, Tianhao Liu, Hongzhi Wang

机构 * Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出FREE-Switch方法,通过频率域重要性驱动动态LoRA切换,结合不同对象和风格的适配器,降低高质量定制生成的训练成本。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10017 2026-04-14 cs.CV

What and Where to Adapt: Structure-Semantics Co-Tuning for Machine Vision Compression via Synergistic Adapters

在何处以及何物进行适应:通过协同适配器实现机器视觉压缩的结构-语义协同调节

Shaobo Liu, Haobo Xiong, Kai Liu, Yuna Lin

机构 * Xidian University(西安电子科技大学)

AI总结 本文提出S2-CoT框架,通过结构和语义协同适配器提升图像压缩性能,实现高效参数调节与高质量编码。

Comments Accepted by the IEEE/CVF Conference on Computer Vision and Pattern Recognition Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09955 2026-04-14 cs.CV

Learnable Motion-Focused Tokenization for Effective and Efficient Video Unsupervised Domain Adaptation

可学习的运动聚焦分块化方法用于高效且有效的视频无监督领域自适应

Tzu Ling Liu, Ian Stavness, Mrigank Rochan

机构 * University of Saskatchewan(萨斯喀彻温大学)

AI总结 本文提出LMFT方法,通过学习去除低运动冗余分块,保留动作相关分块,提升视频无监督领域自适应的效果与效率。

Comments Accepted to IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09862 2026-04-14 cs.CV

FF3R: Feedforward Feature 3D Reconstruction from Unconstrained views

FF3R:从无约束视角实现前馈特征三维重建

Chaoyi Zhou, Run Wang, Feng Luo, Mert D. Pesé, Zhiwen Fan, Yiqi Zhong, Siyu Huang

机构 * Microsoft(微软) Clemson University(克莱姆森大学) Texas A&M University(德克萨斯A&M大学)

AI总结 FF3R提出一种无需标注的前馈框架,统一处理几何与语义推理,解决全局语义不一致和局部结构不一致问题,实验显示其在视图合成、语义分割和深度估计中表现优异。

Comments CVPR 2026 Findings. Project Page: https://chaoyizh.github.io/ff3r_project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09817 2026-04-14 cs.LG

NeuroFlow: Toward Unified Visual Encoding and Decoding from Neural Activity

NeuroFlow:迈向从神经活动统一的视觉编码和解码

Weijian Mai, Mu Nan, Yu Zhu, Jiahang Cao, Rui Zhang, Yuqin Dai, Chunfeng Song, Andrew F. Luo, Jiamin Wu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Hong Kong(香港大学) Shenzhen Loop Area Institute(深圳河套学院) Tsinghua University(清华大学) Chinese University of Hong Kong(香港中文大学)

AI总结 NeuroFlow首次提出统一框架,通过单一流模型联合建模视觉和神经活动的编码解码,提升效率与一致性。

Comments Accepted to CVPR 2026. Project page: https://michaelmaiii.github.io/NeuroFlow-S

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09710 2026-04-14 cs.CV cs.LG

Robust Fair Disease Diagnosis in CT Images

在CT图像中实现鲁棒的公平疾病诊断

Justin Li, Daniel Ding, Asmita Yuki Pritha, Aryana Hou, Xin Wang, Shu Hu

机构 * Carmel High School(卡梅尔高中) Capstone School Dhaka(达卡顶点学校) Clarkstown High School South(克拉克镇南部高中) University at Albany, State University of New York(纽约州立大学奥尔巴尼分校) Purdue University(普渡大学)

AI总结 本文提出双层目标解决CT图像中因数据不平衡和群体代表性不足导致的诊断不公问题,通过样本级和群体级损失函数提升模型公平性与准确性。

Comments 8 pages, 3 figures, 2 tables. Accepted at the 3rd Workshop on New Trends in AI-Generated Media and Security (AIMS) @ CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09706 2026-04-14 cs.CV cs.AI

The Deployment Gap in AI Media Detection: Platform-Aware and Visually Constrained Adversarial Evaluation

AI媒体检测中的部署差距:平台感知与视觉受限的对抗评估

Aishwarya Budhkar, Trishita Dhara, Siddhesh Sheth

机构 * Indiana University(印第安纳大学) Upper Hand Ace Rent a Car

AI总结 本文提出平台感知的对抗评估框架,揭示实验室环境下的高准确率在实际部署中显著下降,强调需考虑图像处理对检测性能的影响。

Comments Accepted at CVPR AIMS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09685 2026-04-14 cs.CV cs.LG

A Modular Zero-Shot Pipeline for Accident Detection, Localization, and Classification in Traffic Surveillance Video

一种用于交通监控视频事故检测、定位和分类的模块化零样本流水线

Amey Thakur, Sarvesh Talele

机构 * Independent Researcher(独立研究员)

AI总结 本文提出一种零样本流水线,通过三个独立模块分别实现交通事故的时间定位、位置确定和类型分类,无需真实世界标注数据。

Comments 9 pages, 7 figures, 2 tables. Submitted to the ACCIDENT @ CVPR 2026 Workshop. Source code and notebook available at https://www.kaggle.com/code/ameythakur20/zero-shot-cctv-traffic-accident-understanding/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09651 2026-04-14 cs.CV cs.LG cs.RO

FlowHijack: A Dynamics-Aware Backdoor Attack on Flow-Matching Vision-Language-Action Models

FlowHijack: 面向流匹配视觉-语言-动作模型的动态感知后门攻击

Xinyuan An, Tao Luo, Gengyun Peng, Yaobing Wang, Kui Ren, Dongxia Wang

机构 * Zhejiang University(浙江大学) Beijing Key Laboratory of Intelligent Space Robotic Systems Technology and Applications(北京市智能空间机器人系统技术与应用重点实验室) Huzhou Institute of Industrial Control Technology(湖州工业控制技术研究院)

AI总结 本文提出FlowHijack,首个针对流匹配VLA模型向量场动态的后门攻击框架,通过τ条件注入策略与动态模仿正则化,实现隐蔽触发器的高成功率攻击,同时保持正常任务性能。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02003 2026-04-14 cs.CV

ProDiG: Progressive Diffusion-Guided Gaussian Splatting for Aerial to Ground Reconstruction

ProDiG:渐进式扩散引导高斯点云法用于空到地重建

Sirshapan Mitra, Yogesh S. Rawat

机构 * CRCV, University of Central Florida(中佛罗里达大学计算机视觉研究中心)

AI总结 本文提出ProDiG方法,通过扩散引导逐步将空视图转换为地面级视图,利用几何感知因果注意力模块和距离自适应高斯模块,实现高斯点云的渐进式优化,提升重建的几何一致性和鲁棒性。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27383 2026-04-14 cs.CV

Decompose, Mix, Adapt: A Unified Framework for Parameter-Efficient Neural Network Recombination and Compression

分解、混合、适应:一种统一的框架用于参数高效神经网络重组与压缩

Nazia Tasnim, Shrimai Prabhumoye, Bryan A. Plummer

机构 * Boston University(波士顿大学) NVIDIA(英伟达)

AI总结 本文提出CRISP框架,通过分解预训练权重为基矩阵和混合投影,实现参数高效重组与压缩,优于现有方法4-5%,并在PEFT和PEFT+MC组合中表现更优。

Comments Accepted in CVPR, 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11346 2026-04-14 cs.CV cs.GR cs.RO

Learning to Assist: Physics-Grounded Human-Human Control via Multi-Agent Reinforcement Learning

学习协助:通过多智能体强化学习实现物理基础的人机控制

Yuto Shibata, Kashu Yamazaki, Lalit Jayanti, Yoshimitsu Aoki, Mariko Isogawa, Katerina Fragkiadaki

机构 * Carnegie Mellon University(卡内基梅隆大学) Keio AI Research Center(庆应义塾大学人工智能研究中心) Keio University(庆应义塾大学)

AI总结 本文提出通过多智能体强化学习实现人与人之间力交换的交互动作模仿,解决了连续关注人类伙伴和快速适应其动态的需求,展示了多智能体RL在物理基础和社交感知人形控制中的优势。

Comments Accepted at CVPR 2026 (main). Project page: https://yutoshibata07.github.io/AssistMimic/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08942 2026-04-14 cs.CV cs.AI cs.CL cs.LG

BiCLIP: Domain Canonicalization via Structured Geometric Transformation

BiCLIP:通过结构几何变换实现领域规范化

Pranav Mantini, Shishir K. Shah

机构 * University of Houston(休斯顿大学) The University of Oklahoma(俄克拉荷马大学)

AI总结 BiCLIP通过结构几何变换提升跨模态对齐,利用少量锚点样本实现领域规范化,实验表明其在11个基准测试中均取得最优性能。

Comments Accepted at Domain Generalization: Evolution, Breakthroughs, and Future Horizons Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02123 2026-04-14 cs.AI cs.CV

Nano-EmoX: Unifying Multimodal Emotional Intelligence from Perception to Empathy

Nano-EmoX:从感知到共情的多模态情感智能统一框架

Jiahao Huang, Fengyan Lin, Xuechao Yang, Chen Feng, Kexin Zhu, Xu Yang, Zhide Chen

机构 * Fujian Normal University(福建师范大学) RMIT University(皇家墨尔本理工大学) Minjiang University(闽江学院)

AI总结 本文提出Nano-EmoX,通过认知启发的三级架构整合感知、理解与交互层面的情感任务,首次实现六项核心情感任务的统一建模,展现高效且强大的泛化能力。

Comments This paper has been accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06993 2026-04-14 cs.CV

Can Textual Reasoning Improve the Performance of MLLMs on Fine-grained Visual Classification?

文本推理能否提升多模态大语言模型在细粒度视觉分类中的性能?

Jie Zhu, Yiyang Su, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 本文研究了文本推理对细粒度视觉分类任务的影响,发现推理长度过长会降低分类准确率,提出MRN和ReFine-RFT方法提升性能。

Comments CVPR Finding, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18329 2026-04-14 cs.CV

SciPostLayoutTree: A Dataset for Structural Analysis of Scientific Posters

SciPostLayoutTree:用于科学海报结构分析的数据集

Shohei Tanaka, Atsushi Hashimoto, Yoshitaka Ushiku

机构 * OMRON SINIC X Corporation(欧姆龙SINIC X公司)

AI总结 本文提出SciPostLayoutTree数据集,用于研究科学海报的结构分析,通过标注阅读顺序和父子关系,提升结构感知界面的准确性。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16428 2026-04-14 cs.CV

CylinderDepth: Cylindrical Spatial Attention for Multi-View Consistent Self-Supervised Surround Depth Estimation

CylinderDepth:多视角一致自监督周围深度估计的圆柱空间注意力

Samer Abualhanud, Christian Grannemann, Max Mehltretter

机构 * Leibniz University Hannover(莱布尼茨汉诺威大学)

AI总结 本文提出一种几何引导方法,通过圆柱空间注意力机制提升多视角自监督周围深度估计的精度和一致性。

Comments Accepted at 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18976 2026-04-14 cs.CV cs.HC

Ninja Codes: Neurally Generated Fiducial Markers for Stealthy 6-DoF Tracking

Ninja Codes: 由神经生成的隐匿式六自由度跟踪标记

Yuichiro Takeuchi, Yusuke Imoto, Shunya Kato

机构 * Osaka University(大阪大学) Kyoto University(京都大学)

AI总结 本文提出Ninja Codes,一种由神经网络生成的隐匿式标记,能自然融入真实环境,通过编码网络将任意图像转换为标记,用于机器人和增强现实等领域的隐匿六自由度跟踪。

Comments CVPR 2026 Findings; Project page: https://sento.net/research/ninjacodes

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05217 2026-04-14 cs.CV

Organizing Unstructured Image Collections using Natural Language

用自然语言组织无结构图像集合

Mingxuan Liu, Zhun Zhong, Jun Li, Gianni Franchi, Subhankar Roy, Elisa Ricci

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) ENSTA Paris, Institut Polytechnique de Paris(巴黎高等先进技术学院,巴黎综合理工学院) Hefei University of Technology(合肥工业大学) University of Bergamo(贝加莫大学) Technical University of Munich(慕尼黑工业大学)

AI总结 本文提出OpenSMC任务,通过自然语言发现图像的多种语义聚类标准,并实现自动组织。X-Cluster框架通过文本推理代理,发现多种聚类标准并生成有意义的簇。

Comments Accepted to CVPR 2026 Findings. Project page: https://oatmealliu.github.io/xcluster.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09527 2026-04-13 cs.CV cs.AI cs.LG

Envisioning the Future, One Step at a Time

逐步展望未来

Stefan Andreas Baumann, Jannik Wiese, Tommaso Martorella, Mahdi M. Kalayeh, Björn Ommer

机构 * Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Netflix

AI总结 本文提出通过稀疏点轨迹逐步推断来预测开放集未来场景动态,提升大规模探索效率,同时引入OWM基准测试预测准确性与现实不确定性下的多样性。

Comments CVPR 2026. For code and models, see http://compvis.github.io/myriad

详情

展开后加载摘要…

URL PDF HTML 收藏