arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11876
2604.07634 2026-04-10 cs.CV

VSAS-BENCH: Real-Time Evaluation of Visual Streaming Assistant Models

VSAS-BENCH:视觉流助手模型的实时评估

Pavan Kumar Anasosalu Vasu, Cem Koc, Fartash Faghri, Chun-Liang Li, Bo Feng, Zhengfeng Lai, Meng Cao, Oncel Tuzel, Hadi Pouransari

机构 * Apple(苹果公司)

AI总结 本文提出VSAS-Bench,通过时序密集标注和标准化评估协议,评估流式视觉语言模型的实时性能,揭示模型在内存缓冲长度、访问策略等关键设计因素下的精度-延迟权衡。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07606 2026-04-10 cs.CV

Bootstrapping Sign Language Annotations with Sign Language Models

通过手语模型 bootstrap 手语注释

Colin Lea, Vasileios Baltatzis, Connor Gillis, Raja Kushalnagar, Lorna Quandt, Leah Findlater

机构 * Apple(苹果公司) Gallaudet University(加劳德特大学)

AI总结 本文提出一种伪注释流程,利用手语视频和英语输入,生成手语、手指拼写词和手语分类器的注释。通过稀疏预测和K-Shot LLM方法,实现高精度的伪注释,为手语数据集提供高质量基准。

Comments Accepted to CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07577 2026-04-10 cs.CV

Event-Level Detection of Surgical Instrument Handovers in Videos with Interpretable Vision Models

视频中手术器械交接的事件级检测:可解释的视觉模型

Katerina Katsarou, George Zountsas, Karam Tomotaki-Dawoud, Alexander Ehrenhoefer, Paul Chojecki, David Przewozny, Igor Maximilian Sauer, Amira Mouakher, Sebastian Bosse

机构 * Fraunhofer HHI(弗劳恩霍夫海因里希·赫兹研究所) Technical University of Berlin(柏林工业大学) Charité - Universitätsmedizin Berlin(柏林夏里特医学院) Université de Perpignan(佩皮尼昂大学)

AI总结 本文提出一种时空视觉框架,用于检测和分类手术器械交接事件,通过结合视觉Transformer和LSTM网络,实现高准确率的检测与方向分类,实验表明其在肾移植手术视频中表现优异。

Comments 12 Pages, 6 figures, CVPR 2026 Workshop AI4RWC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07399 2026-04-10 cs.LG

Critical Patch-Aware Sparse Prompting with Decoupled Training for Continual Learning on the Edge

面向边缘设备的持续学习中关键补丁感知稀疏提示方法

Wonseon Lim, Jaesung Lee, Dae-Won Kim

机构 * School of Computer Science and Engineering, Chung-Ang University(中央大学计算机科学与工程学院) Department of Artificial Intelligence, Chung-Ang University(中央大学人工智能系)

AI总结 本文提出CPS-Prompt方法,通过关键补丁采样和解耦训练降低边缘设备上的训练内存和计算成本,实验证明其在内存、训练时间和能效方面优于基线模型,同时保持与现有方法相当的精度。

Comments Accepted to CVPR 2026. 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07397 2026-04-10 cs.LG cs.AI

Data Warmup: Complexity-Aware Curricula for Efficient Diffusion Training

数据预热:面向高效扩散训练的复杂度感知课程学习

Jinhong Lin, Pan Wang, Zitong Zhan, Lin Zhang, Pedro Morgado

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Pittsburgh(匹兹堡大学) University at Buffalo, SUNY(纽约州立大学布法罗分校)

AI总结 本文提出Data Warmup方法,通过按复杂度从简到繁安排训练图像,提升扩散模型训练效率,实验表明其在ImageNet上显著提升生成质量并提前达到基线水平。

Comments CVPRW in the proceedings of CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16570 2026-04-10 cs.CV

Face2Scene: Using Facial Degradation as an Oracle for Diffusion-Based Scene Restoration

Face2Scene:利用面部退化作为扩散基于场景恢复的 oracle

Amirhossein Kazerouni, Maitreya Suin, Tristan Aumentado-Armstrong, Sina Honari, Amanpreet Walia, Iqbal Mohomed, Konstantinos G. Derpanis, Babak Taati, Alex Levinshtein

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) AI Center–Toronto, Samsung Electronics(三星电子多伦多AI中心) University Health Network(大学健康网络) York University(约克大学)

AI总结 本文提出Face2Scene框架,通过面部作为感知oracle估计退化并指导全图恢复,有效恢复身体和背景。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22683 2026-04-10 cs.CV cs.AI

SUPERGLASSES: Benchmarking Vision Language Models as Intelligent Agents for AI Smart Glasses

SUPERGLASSES:基于智能眼镜的视觉语言模型智能体基准测试

Zhuohang Jiang, Xu Yuan, Haohao Qu, Shanru Lin, Kanglong Liu, Wenqi Fan, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学)

AI总结 本文提出SUPERGLASSES基准,通过真实世界数据评估智能眼镜的多模态交互能力,提出SUPERLENS模型在VQA任务中超越GPT-4o,揭示了任务特定解决方案的重要性。

Journal ref 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition- FINDINGS Track (CVPRF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20223 2026-04-10 cs.LG cs.AI

MultiModalPFN: Extending Prior-Data Fitted Networks for Multimodal Tabular Learning

多模态PFN:扩展先验数据拟合网络以进行多模态表格学习

Wall Kim, Chaeyoung Song, Hanul Kim

机构 * Samsung Electronics(三星电子) Seoul National University of Science and Technology(首尔科学技术大学)

AI总结 本文提出MMPFN,通过引入多头门控MLP和跨注意力池化器,扩展TabPFN以处理表格和非表格模态,实验证明其在医疗和通用多模态数据集上优于现有方法。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20524 2026-04-10 cs.CV

AnomalyVFM -- Transforming Vision Foundation Models into Zero-Shot Anomaly Detectors

AnomalyVFM -- 将视觉基础模型转变为零样本异常检测器

Matic Fučka, Vitjan Zavrtanik, Danijel Skočaj

机构 * University of Ljubljana, Faculty of Computer and Information Science(卢布尔雅那大学计算机与信息科学学院)

AI总结 本文提出AnomalyVFM框架,通过合成数据生成与参数高效适应机制,使视觉基础模型在零样本异常检测中表现更优,实测在9个数据集上达到94.1%的AUROC。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18662 2026-04-10 cs.RO cs.CV

Pseudo-Expert Regularized Offline RL for End-to-End Autonomous Driving in Photorealistic Closed-Loop Environments

伪专家正则化离线强化学习用于逼真闭环环境中的端到端自动驾驶

Chihiro Noguchi, Takaki Yamamoto

机构 * InfoTech, Toyota Motor Corporation(丰田汽车公司 InfoTech)

AI总结 本文提出一种基于摄像头的端到端离线强化学习框架,通过伪地面真实轨迹正则化提升自动驾驶安全性与效率,实验表明在nuScenes数据集上显著降低碰撞率并提高路线完成度。

Comments Accepted to CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01236 2026-04-10 cs.CV

PSR: Scaling Multi-Subject Personalized Image Generation with Pairwise Subject-Consistency Rewards

PSR: 通过成对主体一致性奖励实现多主体个性化图像生成的扩展

Shulei Wang, Longhui Wei, Xin He, Jianbo Ouyang, Hui Lu, Zhou Zhao, Qi Tian

机构 * Zhejiang University(浙江大学) Huawei Inc.(华为技术有限公司)

AI总结 本文提出PSR框架,通过多主体数据生成管道和强化学习策略,提升多主体个性化图像生成的性能和一致性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18787 2026-04-10 cs.CV cs.LG

Understanding Task Transfer in Vision-Language Models

理解视觉-语言模型中的任务迁移

Bhuvan Sachdeva, Karan Uppal, Abhinav Java, Vineeth N. Balasubramanian

机构 * Microsoft Research India(微软研究院印度)

AI总结 本文研究视觉-语言模型中任务迁移的系统性影响,提出PGF指标衡量任务迁移对性能的影响,揭示任务间的正负迁移关系,指导更高效的模型训练。

Comments CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08016 2026-04-10 cs.CV cs.LG

Video Parallel Scaling: Aggregating Diverse Frame Subsets for VideoLLMs

视频并行扩展:聚合多样化的帧子集用于VideoLLMs

Hyungjin Chung, Hyelin Nam, Jiyeon Kim, Hyojun Go, Byeongjun Park, Junho Kim, Joonseok Lee, Seongsu Ha, Byung-Hoon Kim

机构 * EverEx University of Michigan(密歇根大学) KAIST(韩国科学技术院) ETH Zürich(苏黎世联邦理工学院) UNC Chapel Hill(北卡罗来纳大学教堂山分校) Yonsei University(延世大学)

AI总结 本文提出Video Parallel Scaling方法,通过并行处理不同帧子集提升VideoLLMs的时序推理能力,实验表明其在不同模型架构和规模上均显著提升性能,且比其他并行方法更高效。

Comments CVPR Findings 2026; code: https://github.com/hyungjin-chung/VPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04678 2026-04-10 cs.CV

ChangeBridge: Spatiotemporal Image Generation with Multimodal Controls for Remote Sensing

ChangeBridge: 多模态控制下的遥感时空图像生成

Zhenghui Zhao, Chen Wu, Xiangyong Cao, Di Wang, Hongruixuan Chen, Datao Tang, Liangpei Zhang, Zhuo Zheng

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Academy(中关村学院) Graduate School of Frontier Sciences, The University of Tokyo(东京大学新领域创成科学研究科) Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

AI总结 本文提出ChangeBridge模型,通过多模态事件控制生成时空一致的遥感图像,解决了现有方法在跨时间变化建模上的不足,提升了土地利用规划和变化检测任务的数据生成能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05398 2026-04-10 cs.GR

2ndMatch: Finetuning Pruned Diffusion Models via Second-Order Jacobian Matching

2ndMatch: 通过二阶雅可比匹配进行剪枝扩散模型的微调

Caleb Zheng, Eli Shlizerman

AI总结 本文提出2ndMatch框架,通过二阶雅可比匹配损失提升剪枝扩散模型性能,实验表明其能显著改善输出质量。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24499 2026-04-10 cs.CV

Reason-SVG: Enhancing Structured Reasoning for Vector Graphics Generation with Reinforcement Learning

Reason-SVG:通过强化学习增强向量图形生成的结构化推理

Ximing Xing, Ziteng Xue, Yandong Guan, Jing Zhang, Dong Xu, Qian Yu

机构 * Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

AI总结 Reason-SVG通过引入Drawing-with-Thought范式和混合奖励机制,提升大语言模型生成高质量SVG的能力,实现结构化推理与视觉一致性。

Comments Accepted by CVPR 2026. 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17732 2026-04-10 cs.CV cs.AI cs.LG

RQR3D: Reparametrizing the regression targets for BEV-based 3D object detection

RQR3D:基于鸟瞰图的3D目标检测的回归目标重新参数化

Ozsel Kilinc, Cem Tarhan

机构 * Amazon Lab 126(亚马逊126实验室) Togg/Trutek AI Team(Togg/Trutek人工智能团队)

AI总结 本文提出RQR3D方法,通过重新参数化回归目标将旋转目标检测转化为关键点回归任务,实现高效且准确的3D目标检测,适用于自动驾驶场景。

Comments To appear in proceedings of CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08637 2026-04-10 cs.CV cs.AI cs.LG

DMin: Scalable Training Data Influence Estimation for Diffusion Models

DMin:用于扩散模型的可扩展训练数据影响估计

Huawei Lin, Yingjie Lao, Weijie Zhao

机构 * Rochester Institute of Technology(罗切斯特理工学院) Tufts University(塔夫茨大学)

AI总结 本文提出DMin框架,用于高效估计扩散模型中每个训练样本对生成图像的影响,解决了传统方法在大规模模型上的计算限制问题,实现了存储和计算效率的显著提升。

Comments Accepted to CVPR 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07097 2026-04-09 cs.CV

Novel Anomaly Detection Scenarios and Evaluation Metrics to Address the Ambiguity in the Definition of Normal Samples

新颖的异常检测场景和评估指标以解决正常样本定义的模糊性

Reiji Saito, Satoshi Kamiya, Kazuhiro Hotta

机构 * Meijo University(名城大学)

AI总结 本文提出新颖的异常检测场景和评估指标,以应对实际应用中正常样本定义的模糊性,并通过RePaste方法提升学习效果,实验证明其在MVTec AD基准上的优越性能。

Comments Accepted by CVPR 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06830 2026-04-09 cs.CV cs.RO

VGGT-SLAM++

VGGT-SLAM++:基于视觉几何基础变换器的视觉SLAM系统

Avilasha Mandal, Rajesh Kumar, Sudarshan Sunil Harithas, Chetan Arora

机构 * Indian Institute of Technology Delhi(印度理工学院德里分校) Addverb Technologies Brown University(布朗大学)

AI总结 VGGT-SLAM++结合视觉几何基础变换器的几何丰富输出,通过空间校正后端实现高频率局部捆绑调整,提升大规模映射精度与内存效率。

Comments 8 pages (main paper) + supplementary material. Accepted at CVPR 2026 Workshop (VOCVALC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06824 2026-04-09 cs.CV

Generate, Analyze, and Refine: Training-Free Sound Source Localization via MLLM Meta-Reasoning

生成、分析与优化:基于MLLM元推理的无训练声源定位

Subin Park, Jung Uk Kim

机构 * Kyung Hee University(庆熙大学)

AI总结 本文提出无训练的声源定位框架,利用多模态大语言模型的推理能力,通过生成-分析-优化流程实现声源定位,实验表明在单源和多源基准上表现优异。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06795 2026-04-09 cs.CV cs.AI

FedDAP: Domain-Aware Prototype Learning for Federated Learning under Domain Shift

FedDAP: 面向领域偏移的联邦学习中的领域感知原型学习

Huy Q. Le, Loc X. Nguyen, Yu Qiao, Seong Tae Kim, Eui-Nam Huh, Choong Seon Hong

机构 * G-LAMP NEXUS Institute, Kyung Hee University(庆熙大学G-LAMP NEXUS研究所) Kyung Hee University(庆熙大学)

AI总结 FedDAP通过构建领域特定的全局原型,解决联邦学习中因领域偏移导致的模型性能下降问题,通过领域感知的原型对齐提升本地学习和全局泛化能力。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06662 2026-04-09 cs.CV cs.LG

Towards Robust Content Watermarking Against Removal and Forgery Attacks

面向对抗性移除与伪造攻击的鲁棒内容水印技术

Yifan Zhu, Yihan Wang, Xiao-Shan Gao

机构 * Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) University of Chinese Academy of Sciences(中国科学院大学) University of Waterloo(滑铁卢大学)

AI总结 本文提出Instance-Specific watermarking with Two-Sided detection方法,通过动态控制水印注入时间和模式提升鲁棒性,有效对抗移除和伪造攻击。

Comments 14 pages, 5 figures, CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06631 2026-04-09 cs.LG cs.AI cs.CV

SubFLOT: Submodel Extraction for Efficient and Personalized Federated Learning via Optimal Transport

SubFLOT:通过最优传输实现高效且个性化的联邦学习子模型提取

Zheng Jiang, Nan He, Yiming Chen, Lifeng Sun

机构 * Tsinghua University(清华大学) Beijing University of Technology(北京工业大学) Key Laboratory of Pervasive Computing, Ministry of Education(普适计算教育部重点实验室)

AI总结 SubFLOT通过最优传输增强剪枝模块生成定制化子模型,结合缩放适应正则化模块缓解参数分歧,实现高效个性化联邦学习。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06467 2026-04-09 cs.CV

PhysHead: Simulation-Ready Gaussian Head Avatars

PhysHead: 可模拟的高斯头部化身

Berna Kabadayi, Vanessa Sklyarova, Wojciech Zielonka, Justus Thies, Gerard Pons-Moll

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ETH Zürich(苏黎世联邦理工学院) University of Tübingen(图宾根大学) Technical University of Darmstadt(达姆施塔特工业大学) Tübingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所)

AI总结 本文提出PhysHead,一种结合3D参数网格和发丝的混合表示方法,用于生成具有真实发丝动态的可动画头部化身,通过多视角视频学习实现逼真发丝运动。

Comments Project Page: see https://phys-head.github.io/; Youtube Video: see https://www.youtube.com/watch?v=k68fsSSwzc0; Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06349 2026-04-09 cs.LG cs.AI cs.CV

Bi-Level Optimization for Single Domain Generalization

双层优化用于单一领域泛化

Marzi Heidari, Hanping Zhang, Hao Yan, Yuhong Guo

机构 * School of Computer Science, Carleton University(卡尔顿大学计算机科学学院) Amii(阿尔伯塔机器智能研究所)

AI总结 本文提出BiSDG框架,通过双层优化分离任务学习与领域建模,利用模拟分布偏移的替代领域提升泛化能力,实验表明在单一领域泛化任务中优于现有方法。

Comments CVPR Findings Track, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06245 2026-04-09 cs.CV

CraterBench-R: Instance-Level Crater Retrieval for Planetary Scale

CraterBench-R: 行为级陨石坑检索用于行星尺度

Jichao Fang, Lei Zhang, Michael Phillips, Wei Luo

机构 * Northern Illinois University(北伊利诺伊大学) University of Arizona(亚利桑那大学)

AI总结 本文提出CraterBench-R,通过实例级图像检索解决行星表面陨石坑分析问题,展示自监督Vision Transformers在陨石坑检索中的优势,并提出实例-令牌聚合方法提升效率。

Comments Accepted at the EarthVision 2026 Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05743 2026-04-09 cs.CV cs.AI

On the Robustness of Diffusion-Based Image Compression to Bit-Flip Errors

扩散基图像压缩对位翻转错误的鲁棒性

Amit Vaisman, Gal Pomerants, Raz Lapid

机构 * Technion - Israel Institute of Technology(以色列理工学院) Deepkeep

AI总结 研究探讨了基于扩散的图像压缩在位翻转错误下的鲁棒性,提出更稳健的Turbo-DDCM变体,改进鲁棒性的同时保持率-失真-感知权衡。

Comments Accepted at AIGENS @ CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05584 2026-04-09 cs.CV

Purify-then-Align: Towards Robust Human Sensing under Modality Missing with Knowledge Distillation from Noisy Multimodal Teacher

在模态缺失情况下通过知识蒸馏从噪声多模态教师中实现鲁棒的人体感知:Purify-then-Align

Pengcheng Weng, Yanyu Qian, Yangxin Xu, Fei Wang

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) Institute of Computer Science, Universität Bern(伯尔尼大学计算机科学研究所) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 本文提出PTA框架,通过元学习和知识扩散解决多模态人体感知中模态缺失问题,通过净化知识源和对齐模态提升单模态模型鲁棒性。

Comments Accepted by CVPR 2026 Workshop On Any-to-Any Multimodal Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26588 2026-04-09 cs.CV cs.LG

From Synthetic Data to Real Restorations: Diffusion Model for Patient-specific Dental Crown Completion

从合成数据到真实修复:一种针对患者特定牙齿冠的扩散模型

Dávid Pukanec, Tibor Kubík, Michal Španěl

机构 * Department of Computer Graphics and Multimedia, Brno University of Technology, Czechia(捷克布尔诺科技大学计算机图形与多媒体系)

AI总结 本文提出ToothCraft模型,通过合成数据生成患者特定的牙齿冠修复,解决训练数据不足问题,实验显示其在IoU和CD指标上的优异表现。

Comments VISAPP 2026 Conference / CVPR Workshop GenRecon3D

详情

展开后加载摘要…

URL PDF HTML 收藏