arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11871
2604.23010 2026-04-28 cs.CV cs.RO

GenAssets: Generating in-the-wild 3D Assets in Latent Space

GenAssets:在真实世界中生成3D资产的潜在空间

Ze Yang, Jingkang Wang, Haowei Zhang, Sivabalan Manivasagam, Yun Chen, Raquel Urtasun

机构 * Waabi University of Toronto(多伦多大学)

AI总结 本文提出一种基于潜在空间的3D生成模型,利用真实世界LiDAR和相机数据生成高质量3D资产,通过重建-生成方法提升模拟中的多样性和可扩展性。

Comments CVPR 2025. Project page: https://waabi.ai/genassets

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22989 2026-04-28 cs.CV cs.AI

CheXmix: Unified Generative Pretraining for Vision Language Models in Medical Imaging

CheXmix:用于医学影像的统一生成预训练

Ashwin Kumar, Robbie Holland, Corey Barrett, Jangwon Kim, Maya Varma, Zhihong Chen, Yunhe Gao, Greg Zaharchuk, Tara Taghavi, Krishnaram Kenthapadi, Akshay Chaudhari

机构 * Stanford AIMI, Stanford University(斯坦福大学AIMI研究所,斯坦福大学) Oracle Health AI(Oracle健康AI) Department of Radiology, Stanford University(斯坦福大学放射科)

AI总结 CheXmix通过统一早融合生成方法,在医学影像中实现更精确的联合表征学习,优于现有生成模型,在多个任务上表现突出。

Comments CVPR Findings (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22984 2026-04-28 cs.CV cs.GR

BrickNet: Graph-Backed Generative Brick Assembly

BrickNet:基于图的生成积木组装

Peter Kulits, Cordelia Schmid

机构 * Inria, Ècole Normale Supèrieure, CNRS, PSL Research University(法国国家科学研究中心、巴黎高等师范学校、CNRS、巴黎萨克雷大学) Max Planck Institute for Intelligent Systems, Tübingen(图宾根人工智能研究所)

AI总结 BrickNet通过图结构生成积木构建序列,解决物理约束下的结构生成问题,提升生成序列的物理合理性。

Comments CVPR 2026; project page: https://kulits.github.io/BrickNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22865 2026-04-28 cs.CV

MeshLAM: Feed-Forward One-Shot Animatable Textured Mesh Avatar Reconstruction

MeshLAM:基于前馈的单次可动画纹理网格人像重建

Yisheng He, Steven Hoi

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

AI总结 MeshLAM通过单次前馈过程从单张图像生成高保真、可动画的3D人脸网格人像,采用双形状和纹理映射架构及改进的纹理指导机制,提升重建质量与动画能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22832 2026-04-28 cs.CV cs.AI cs.LG

Intervention-Aware Multiscale Representation Learning from Imaging Phenomics and Perturbation Transcriptomics

基于影像表型和扰动转录组的干预感知多尺度表征学习

Jiayuan Chen, Ruoqi Liu, Zishan Gu, Ping Zhang

机构 * The Ohio State University(俄亥俄州立大学)

AI总结 本文提出一种干预感知蒸馏框架,利用扰动转录组指导图像表征学习,通过基因表达和干预元数据生成化学感知的代码本,提升对未见干预的迁移能力及药物-靶点基因发现。

Comments CVPR 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07990 2026-04-28 cs.CV

SceneScribe-1M: A Large-Scale Video Dataset with Comprehensive Geometric and Semantic Annotations

SceneScribe-1M:一个具有全面几何和语义标注的大规模视频数据集

Yunnan Wang, Kecheng Zheng, Jianyuan Wang, Minghao Chen, David Novotny, Christian Rupprecht, Yinghao Xu, Xing Zhu, Wenjun Zeng, Xin Jin, Yujun Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团) Visual Geometry Group, University of Oxford(牛津大学视觉几何组) Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波数字孪生研究院,东部技术研究院,宁波) Zhejiang Key Laboratory of Industrial Intelligence and Digital Twin(浙江工业智能与数字孪生重点实验室)

AI总结 SceneScribe-1M通过提供一个包含一百万真实视频的数据集,支持3D几何感知与视频合成的统一资源,推动了单目深度估计、场景重建等下游任务及文本到视频合成等生成任务的发展。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20738 2026-04-28 cs.CV

SATTC: Structure-Aware Label-Free Test-Time Calibration for Cross-Subject EEG-to-Image Retrieval

SATTC: 结构感知的无标签测试时校准用于跨主体EEG到图像检索

Qunjie Huang, Weina Zhu

机构 * Yunnan University(云南大学)

AI总结 本文提出SATTC,一种无标签测试时校准方法,通过结合几何专家和结构专家,提升跨主体EEG到图像检索的准确性与稳定性。

Comments Accepted to CVPR 2026. Official code: https://github.com/QunjieHuang/SATTC-CVPR2026. This version corrects the dataset naming in the paper text and abstract: the experiments were conducted on THINGS-EEG2, whereas the previous version referred to it as THINGS-EEG in parts of the paper. Citations were already correct. Results are unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14882 2026-04-28 cs.CV

LLMind: Bio-inspired Training-free Adaptive Visual Representations for Vision-Language Models

LLMind: 基于生物启发的无训练自适应视觉表示用于视觉-语言模型

Soumyaratna Debnath, Bui Duc Manh, Zinan Liu, Lin Wang

机构 * Nanyang Technological University(南洋理工大学)

AI总结 LLMind通过生物启发的自适应采样策略,实现视觉-语言模型在有限像素预算下的高效自适应表示,实验显示在多个基准测试中性能显著提升。

Comments CVPR 2026, Highlight, 10 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19035 2026-04-28 cs.CV

OpenVO: Open-World Visual Odometry with Temporal Dynamics Awareness

OpenVO:具有时间动态意识的开放世界视觉里程计

Phuc D. A. Nguyen, Anh N. Nhu, Ming C. Lin

机构 * University of Maryland, College Park, USA(马里兰大学帕克分校)

AI总结 OpenVO通过时间动态信息编码和3D几何先验,提升在有限输入条件下对单目行车记录仪视频的现实尺度自我运动估计,实现鲁棒轨迹数据集构建。

Comments Main paper CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22177 2026-04-28 cs.LG cs.CV

Designing Instance-Level Sampling Schedules via REINFORCE with James-Stein Shrinkage

通过REINFORCE与James-Stein收缩设计实例级采样计划

Peiyu Yu, Suraj Kothawade, Sirui Xie, Ying Nian Wu, Hongliang Fei

机构 * Google(谷歌) Google DeepMind(谷歌DeepMind) UCLA(加州大学洛杉矶分校)

AI总结 本文提出通过REINFORCE学习实例级采样计划,结合James-Stein收缩估计器提升高维策略学习的梯度估计精度,实现文本图像对齐和生成质量提升。

Comments CVPR 2026; 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00956 2026-04-28 cs.CV

RefTon: Reference person shot assist virtual Try-on

RefTon:参考人物辅助虚拟试穿

Liuzhuozheng Li, Yue Gong, Shanyuan Liu, Dengyang Jiang, Zanyi Wang, Bo Cheng, Yuhang Ma, Leibucha Wu, Dawei Leng, Yuhui Yin

机构 * The University of Tokyo(东京大学) AI Research(360AI研究院) University of California, San Diego(加州大学圣地亚哥分校) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 RefTon提出一种基于流的人到人的虚拟试穿框架,通过无配对视觉参考提升服装真实感,无需复杂辅助输入或结构引导,利用额外参考图像优化纹理对齐和服装细节。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10113 2026-04-28 cs.CV

ImmerIris: A Large-Scale Dataset and Benchmark for Off-Axis and Unconstrained Iris Recognition in Immersive Applications

ImmerIris:用于沉浸式应用中非轴向和无约束虹膜识别的大型数据集和基准

Yuxi Mi, Qiuyang Yuan, Zhizhou Zhong, Xuan Zhao, Jiaogen Zhou, Fubao Zhu, Jihong Guan, Shuigeng Zhou

机构 * Shanghai Key Lab of Intelligent Information Processing(上海智能信息处理关键实验室) Fudan University(复旦大学) Huaiyin Normal University(淮阴师范学院) Zhengzhou University of Light Industry(郑州轻工业学院) Tongji University(同济大学)

AI总结 本文提出ImmerIris数据集,包含546名受试者499,791张虹膜图像,是目前最大的公开虹膜数据集,用于评估沉浸式应用中的虹膜识别系统,提出无预处理的虹膜识别方法,提升了识别鲁棒性。

Comments CVPR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26158 2026-04-28 cs.CV cs.AI

Towards Continual Expansion of Data Coverage: Automatic Text-guided Edge-case Synthesis

迈向数据覆盖的持续扩展:自动文本引导的边缘案例合成

Kyeongryeol Go

机构 * Superb AI Seoul, South Korea(首尔超凡AI研究所,韩国)

AI总结 本文提出自动文本引导的边缘案例合成方法,通过预训练语言模型生成多样化提示,提升模型鲁棒性,优于传统增强方法。

Comments Accepted in CVPR 2026 Workshop on How Do Vision Models Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04468 2026-04-28 cs.CV

NVILA: Efficient Frontier Visual Language Models

NVILA:高效的前沿视觉语言模型

Zhijian Liu, Ligeng Zhu, Baifeng Shi, Zhuoyang Zhang, Yuming Lou, Shang Yang, Haocheng Xi, Shiyi Cao, Yuxian Gu, Dacheng Li, Xiuyu Li, Yunhao Fang, Yukang Chen, Cheng-Yu Hsieh, De-An Huang, An-Chieh Cheng, Vishwesh Nath, Jinyi Hu, Sifei Liu, Ranjay Krishna, Daguang Xu, Xiaolong Wang, Pavlo Molchanov, Jan Kautz, Hongxu Yin, Song Han, Yao Lu

机构 * NVIDIA MIT(麻省理工学院) UC Berkeley(加州大学伯克利分校) UC San Diego(加州大学圣地亚哥分校) University of Washington(华盛顿大学) Tsinghua University(清华大学)

AI总结 NVILA通过'缩放后再压缩'方法提升效率与准确性,降低训练和推理成本,适用于高分辨率图像和长视频处理。

Comments CVPR 2025. Project page: https://z-lab.ai/projects/nvila/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22562 2026-04-27 cs.LG cs.AI cs.CV cs.DC

Data-Free Contribution Estimation in Federated Learning using Gradient von Neumann Entropy

在联邦学习中使用梯度von Neumann熵进行无数据贡献估计

Asim Ukaye, Mubarak Abdu-Aguye, Nurbek Tastan, Karthik Nandakumar

机构 * MBZUAI, UAE(马布里克大学人工智能研究所,阿联酋) Michigan State University, USA(密歇根州立大学,美国)

AI总结 本文提出无数据的联邦学习贡献估计方法,通过最终层更新的矩阵von Neumann熵衡量信息多样性,提出SpectralFed和SpectralFuse两种方案,验证熵值与客户端准确性的高相关性。

Comments 10 pages, 4 figures, 4 pages Appendix, 6 figures in Appendix. To appear in CVPR 2026 FedVision Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22310 2026-04-27 cs.CV

Revisiting Geometric Obfuscation with Dual Convergent Lines for Privacy-Preserving Image Queries in Visual Localization

重新审视双收敛线几何隐匿以实现隐私保护的图像查询在视觉定位中

Jeonggon Kim, Heejoon Moon, Je Hyeong Hong

机构 * Dept. Electronic Engineering, Hanyang University(韩江大学电子工程系) Dept. Artificial Intelligence, Hanyang University(韩江大学人工智能系)

AI总结 本文提出双收敛线方法,通过改变几何隐匿方式提升隐私保护图像查询的鲁棒性,实验验证其在不同数据集上的有效性与效率。

Comments Accepted at CVPR 2026 (oral). Supplementary material included after references. 18 pages, 11 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22281 2026-04-27 cs.CV

DocPrune:Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning

DocPrune:通过背景、问题和理解感知的令牌修剪实现高效的文档问答

Joonmyung Choi, Sanghyeok Lee, Jongha Kim, Sehyung Kim, Dohwan Ko, Jihyung Kil, Hyunwoo J. Kim

机构 * Korea University(韩国大学) KAIST(韩国科学技术院) Adobe Research(Adobe研究院)

AI总结 本文提出DocPrune框架,通过背景、问题和理解感知的令牌修剪提升长文档理解效率,实验显示在M3DocRAG上提升了吞吐量和F1分数。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22177 2026-04-27 cs.CV

Uni-Encoder Meets Multi-Encoders: Representation Before Fusion for Brain Tumor Segmentation with Missing Modalities

单编码器遇见多编码器:在缺失模态下的脑肿瘤分割中的表示学习前融合

Peibo Song, Xiaotian Xue, Jinshuo Zhang, Zihao Wang, Jinhua Liu, Shujun Fu, Fangxun Bao, Si Yong Yeo

机构 * School of Mathematics, Shandong University(山东大学数学学院) GSFS, The University of Tokyo(东京大学GSFS) MedVisAI Lab(医学视觉人工智能实验室) Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李光前医学院) Centre of AI in Medicine, Singapore(新加坡医学人工智能中心)

AI总结 本文提出UniME方法,通过两阶段异构架构在缺失模态下实现脑肿瘤分割,通过单编码器和多编码器的结合提升分割精度。

Comments CVPR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22139 2026-04-27 cs.CV cs.LG

Anatomy-Aware Unsupervised Detection and Localization of Retinal Abnormalities in Optical Coherence Tomography

基于解剖结构的无监督视网膜异常检测与定位方法

Tania Haghighi, Sina Gholami, Hamed Tabkhi, Minhaj Nur Alam

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

AI总结 本文提出一种无监督方法,通过学习健康视网膜的分布来检测和定位OCT图像中的异常,提高了临床应用中的标注效率,并在多个数据集上展示了优越的泛化能力。

Comments 11 pages, 3 figures, accepted in CVPR-CV4Clinical

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22045 2026-04-27 cs.CV cs.AI

H-Sets: Hessian-Guided Discovery of Set-Level Feature Interactions in Image Classifiers

H-Sets: 基于Hessian的图像分类器中集合级特征交互发现

Ayushi Mehrotra, Dipkamal Bhusal, Michael Clifford, Nidhi Rastogi

机构 * California Institute of Technology(加州理工学院) Rochester Institute of Technology(罗切斯特理工学院) Toyota InfoTech Labs(丰田信息科技实验室)

AI总结 本文提出H-Sets框架,通过Hessian检测局部交互对并递归合并为语义连贯的集合,结合IDG-Vis进行集合级特征交互归因,生成更可解释且忠实的显著性图。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16915 2026-04-27 cs.CV

KIRA: Knowledge-Intensive Image Retrieval and Reasoning Architecture for Specialized Visual Domains

KIRA:面向专业视觉领域的知识密集型图像检索与推理架构

Parthaw Goswami, Jaynto Goswami Deep

机构 * University of Missouri(密苏里大学) SAP Prague(SAP 布拉格)

AI总结 KIRA提出一种五阶段框架,解决视觉RAG中的核心问题,包括多粒度知识库构建、领域自适应对比编码、双路径跨模态检索、多跳视觉推理及证据条件生成,通过四个专业领域实验验证其有效性。

Journal ref CVPR 2026 2nd Workshop on Knowledge-Intensive Multimodal Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01907 2026-04-27 cs.CV cs.AI

Lifting Unlabeled Internet-level Data for 3D Scene Understanding

提升互联网级未标记数据用于3D场景理解

Yixin Chen, Yaowei Zhang, Huangyue Yu, Junchao He, Yan Wang, Jiangyong Huang, Hongyu Shen, Junfeng Ni, Shaofei Wang, Baoxiong Jia, Song-Chun Zhu, Siyuan Huang

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Beijing Institute of Technology(北京理工大学) Tsinghua University(清华大学)

AI总结 本文通过设计数据引擎利用互联网未标记视频生成训练数据,提升3D场景理解模型性能,验证了在不同感知粒度任务中的有效性。

Comments CVPR 2026. Project page: https://sv-pp.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21977 2026-04-27 cs.CV

When LoRA Betrays: Backdooring Text-to-Image Models by Masquerading as Benign Adapters

当LoRA背叛时:通过伪装成无害适配器对文本到图像模型进行后门攻击

Liangwei Lyu, Jiaqi Xu, Jianwei Ding, Qiyao Deng

机构 * People’s Public Security University of China(中国人民公安大学)

AI总结 研究提出MasqLoRA攻击框架,通过独立LoRA模块在文本到图像扩散模型中隐蔽注入恶意行为,实验显示其攻击成功率高达99.8%。

Comments Accepted to CVPR 2026 main track(poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05859 2026-04-27 cs.CV

Edit-aware RAW Reconstruction

具有编辑意识的RAW重建

Abhijith Punnappurath, Luxi Zhao, Ke Zhao, Hue Nguyen, Radek Grzeszczuk, Michael S. Brown

机构 * AI Center–Toronto, Samsung Electronics(多伦多人工智能中心,三星电子)

AI总结 本文提出了一种编辑感知的损失函数,用于提升RAW重建在不同渲染风格和编辑操作下的鲁棒性,通过可微的图像信号处理器模拟真实摄影流程,提升sRGB重建质量。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21453 2026-04-24 cs.CV

Instance-level Visual Active Tracking with Occlusion-Aware Planning

实例级视觉主动跟踪与遮挡感知规划

Haowei Sun, Kai Zhou, Hao Gao, Shiteng Zhang, Jinwu Hu, Xutao Wen, Qixiang Ye, Mingkui Tan

机构 * South China University of Technology(南方科技大学) Pazhou Laboratory(Pazhou实验室) Key Laboratory of Big Data and Intelligent Robot, Ministry of Education(教育部大数据与智能机器人重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出OA-VAT方法,通过实例感知原型初始化、在线原型增强跟踪和遮挡感知轨迹规划模块,解决遮挡和相似干扰问题,实现高精度实时跟踪。

Comments CVPR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21127 2026-04-24 cs.CV

HyperFM: An Efficient Hyperspectral Foundation Model with Spectral Grouping

HyperFM:一种高效的超光谱基础模型与光谱分组

Zahid Hassan Tushar, Sanjay Purushotham

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)

AI总结 本文提出HyperFM,一种高效超光谱基础模型,通过光谱分组和混合参数分解,提升对光谱空间关系的建模能力,同时降低计算成本,在四个大气云特性检索任务中表现优异,并发布HyperFM250K数据集支持进一步研究。

Comments 15 pages, 8 figures, to be published in CVPR 2026 findings, Code and data are publicly available on https://github.com/umbc-sanjaylab/HyperFM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21119 2026-04-24 cs.CV cs.AI cs.SD

Materialistic RIR: Material Conditioned Realistic RIR Generation

物质导向的RIR:基于材料的现实RIR生成

Mahnoor Fatima Saad, Sagnik Majumder, Kristen Grauman, Ziad Al-Halah

机构 * University of Utah(犹他大学) UT Austin(得克萨斯大学奥斯汀分校)

AI总结 本文提出一种基于材料的RIR生成方法,通过分离空间和材料影响,提升生成声学的真实感和材料敏感性,实验结果显示在声学和材料指标上均有显著提升。

Comments Accepted to CVPR 2026 Findings. Project page: https://mahnoor-fatima-saad.github.io/MatRIR.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21104 2026-04-24 cs.CV cs.LG

Pretrain Where? Investigating How Pretraining Data Diversity Impacts Geospatial Foundation Model Performance

预训练在哪里?探究预训练数据多样性如何影响地理空间基础模型性能

Amandeep Kaur, Mirali Purohit, Gedeon Muhawenayo, Esther Rolf, Hannah Kerner

机构 * Arizona State University(亚利桑那州立大学) University of Colorado Boulder(科罗拉多大学博尔德分校)

AI总结 本文研究预训练数据地理组成对模型下游性能的影响,发现欧洲预训练数据在全局和本地评估中表现最佳,发现光谱多样性与性能强相关。

Comments Accepted at EarthVision workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20878 2026-04-24 cs.CL cs.CV cs.LG eess.IV

AITP: Traffic Accident Responsibility Allocation via Multimodal Large Language Models

AITP:通过多模态大语言模型进行交通事故责任分配

Zijin Zhou, Songan Zhang

机构 * Global Institute of Future Technology(未来技术全球研究院)

AI总结 本文提出AITP模型,结合多模态链式推理和法律知识检索,解决交通事故责任分配问题,并构建DecaTARA基准测试集,验证模型在责任分配、事故检测和理解任务中的领先性能。

Journal ref CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10275 2026-04-24 cs.CV

FastSHADE: Fast Self-augmented Hierarchical Asymmetric Denoising for Efficient inference on mobile devices

FastSHADE:快速自增强分层非对称去噪用于移动设备上的高效推理

Nikolay Falaleev

机构 * Fanis London, UK(Fanis伦敦大学)

AI总结 本文提出FastSHADE,一种轻量级U-Net风格网络,用于移动设备上的实时高质量去噪。通过非对称频率去噪块和空间门控上采样器提升效率与图像质量,实现高效速度-保真度平衡。

Comments To appear in the Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏