arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-04-10 至 2026-04-10 共收录 43
2603.16570 2026-04-10 cs.CV

Face2Scene: Using Facial Degradation as an Oracle for Diffusion-Based Scene Restoration

Face2Scene:利用面部退化作为扩散基于场景恢复的 oracle

Amirhossein Kazerouni, Maitreya Suin, Tristan Aumentado-Armstrong, Sina Honari, Amanpreet Walia, Iqbal Mohomed, Konstantinos G. Derpanis, Babak Taati, Alex Levinshtein

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) AI Center–Toronto, Samsung Electronics(三星电子多伦多AI中心) University Health Network(大学健康网络) York University(约克大学)

AI总结 本文提出Face2Scene框架,通过面部作为感知oracle估计退化并指导全图恢复,有效恢复身体和背景。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22683 2026-04-10 cs.CV cs.AI

SUPERGLASSES: Benchmarking Vision Language Models as Intelligent Agents for AI Smart Glasses

SUPERGLASSES:基于智能眼镜的视觉语言模型智能体基准测试

Zhuohang Jiang, Xu Yuan, Haohao Qu, Shanru Lin, Kanglong Liu, Wenqi Fan, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学)

AI总结 本文提出SUPERGLASSES基准,通过真实世界数据评估智能眼镜的多模态交互能力,提出SUPERLENS模型在VQA任务中超越GPT-4o,揭示了任务特定解决方案的重要性。

Journal ref 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition- FINDINGS Track (CVPRF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20223 2026-04-10 cs.LG cs.AI

MultiModalPFN: Extending Prior-Data Fitted Networks for Multimodal Tabular Learning

多模态PFN:扩展先验数据拟合网络以进行多模态表格学习

Wall Kim, Chaeyoung Song, Hanul Kim

机构 * Samsung Electronics(三星电子) Seoul National University of Science and Technology(首尔科学技术大学)

AI总结 本文提出MMPFN,通过引入多头门控MLP和跨注意力池化器,扩展TabPFN以处理表格和非表格模态,实验证明其在医疗和通用多模态数据集上优于现有方法。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20524 2026-04-10 cs.CV

AnomalyVFM -- Transforming Vision Foundation Models into Zero-Shot Anomaly Detectors

AnomalyVFM -- 将视觉基础模型转变为零样本异常检测器

Matic Fučka, Vitjan Zavrtanik, Danijel Skočaj

机构 * University of Ljubljana, Faculty of Computer and Information Science(卢布尔雅那大学计算机与信息科学学院)

AI总结 本文提出AnomalyVFM框架,通过合成数据生成与参数高效适应机制,使视觉基础模型在零样本异常检测中表现更优,实测在9个数据集上达到94.1%的AUROC。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18662 2026-04-10 cs.RO cs.CV

Pseudo-Expert Regularized Offline RL for End-to-End Autonomous Driving in Photorealistic Closed-Loop Environments

伪专家正则化离线强化学习用于逼真闭环环境中的端到端自动驾驶

Chihiro Noguchi, Takaki Yamamoto

机构 * InfoTech, Toyota Motor Corporation(丰田汽车公司 InfoTech)

AI总结 本文提出一种基于摄像头的端到端离线强化学习框架,通过伪地面真实轨迹正则化提升自动驾驶安全性与效率,实验表明在nuScenes数据集上显著降低碰撞率并提高路线完成度。

Comments Accepted to CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01236 2026-04-10 cs.CV

PSR: Scaling Multi-Subject Personalized Image Generation with Pairwise Subject-Consistency Rewards

PSR: 通过成对主体一致性奖励实现多主体个性化图像生成的扩展

Shulei Wang, Longhui Wei, Xin He, Jianbo Ouyang, Hui Lu, Zhou Zhao, Qi Tian

机构 * Zhejiang University(浙江大学) Huawei Inc.(华为技术有限公司)

AI总结 本文提出PSR框架,通过多主体数据生成管道和强化学习策略,提升多主体个性化图像生成的性能和一致性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18787 2026-04-10 cs.CV cs.LG

Understanding Task Transfer in Vision-Language Models

理解视觉-语言模型中的任务迁移

Bhuvan Sachdeva, Karan Uppal, Abhinav Java, Vineeth N. Balasubramanian

机构 * Microsoft Research India(微软研究院印度)

AI总结 本文研究视觉-语言模型中任务迁移的系统性影响,提出PGF指标衡量任务迁移对性能的影响,揭示任务间的正负迁移关系,指导更高效的模型训练。

Comments CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08016 2026-04-10 cs.CV cs.LG

Video Parallel Scaling: Aggregating Diverse Frame Subsets for VideoLLMs

视频并行扩展:聚合多样化的帧子集用于VideoLLMs

Hyungjin Chung, Hyelin Nam, Jiyeon Kim, Hyojun Go, Byeongjun Park, Junho Kim, Joonseok Lee, Seongsu Ha, Byung-Hoon Kim

机构 * EverEx University of Michigan(密歇根大学) KAIST(韩国科学技术院) ETH Zürich(苏黎世联邦理工学院) UNC Chapel Hill(北卡罗来纳大学教堂山分校) Yonsei University(延世大学)

AI总结 本文提出Video Parallel Scaling方法,通过并行处理不同帧子集提升VideoLLMs的时序推理能力,实验表明其在不同模型架构和规模上均显著提升性能,且比其他并行方法更高效。

Comments CVPR Findings 2026; code: https://github.com/hyungjin-chung/VPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04678 2026-04-10 cs.CV

ChangeBridge: Spatiotemporal Image Generation with Multimodal Controls for Remote Sensing

ChangeBridge: 多模态控制下的遥感时空图像生成

Zhenghui Zhao, Chen Wu, Xiangyong Cao, Di Wang, Hongruixuan Chen, Datao Tang, Liangpei Zhang, Zhuo Zheng

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Academy(中关村学院) Graduate School of Frontier Sciences, The University of Tokyo(东京大学新领域创成科学研究科) Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

AI总结 本文提出ChangeBridge模型,通过多模态事件控制生成时空一致的遥感图像,解决了现有方法在跨时间变化建模上的不足,提升了土地利用规划和变化检测任务的数据生成能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05398 2026-04-10 cs.GR

2ndMatch: Finetuning Pruned Diffusion Models via Second-Order Jacobian Matching

2ndMatch: 通过二阶雅可比匹配进行剪枝扩散模型的微调

Caleb Zheng, Eli Shlizerman

AI总结 本文提出2ndMatch框架,通过二阶雅可比匹配损失提升剪枝扩散模型性能,实验表明其能显著改善输出质量。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24499 2026-04-10 cs.CV

Reason-SVG: Enhancing Structured Reasoning for Vector Graphics Generation with Reinforcement Learning

Reason-SVG:通过强化学习增强向量图形生成的结构化推理

Ximing Xing, Ziteng Xue, Yandong Guan, Jing Zhang, Dong Xu, Qian Yu

机构 * Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

AI总结 Reason-SVG通过引入Drawing-with-Thought范式和混合奖励机制,提升大语言模型生成高质量SVG的能力,实现结构化推理与视觉一致性。

Comments Accepted by CVPR 2026. 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17732 2026-04-10 cs.CV cs.AI cs.LG

RQR3D: Reparametrizing the regression targets for BEV-based 3D object detection

RQR3D:基于鸟瞰图的3D目标检测的回归目标重新参数化

Ozsel Kilinc, Cem Tarhan

机构 * Amazon Lab 126(亚马逊126实验室) Togg/Trutek AI Team(Togg/Trutek人工智能团队)

AI总结 本文提出RQR3D方法,通过重新参数化回归目标将旋转目标检测转化为关键点回归任务,实现高效且准确的3D目标检测,适用于自动驾驶场景。

Comments To appear in proceedings of CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08637 2026-04-10 cs.CV cs.AI cs.LG

DMin: Scalable Training Data Influence Estimation for Diffusion Models

DMin:用于扩散模型的可扩展训练数据影响估计

Huawei Lin, Yingjie Lao, Weijie Zhao

机构 * Rochester Institute of Technology(罗切斯特理工学院) Tufts University(塔夫茨大学)

AI总结 本文提出DMin框架,用于高效估计扩散模型中每个训练样本对生成图像的影响,解决了传统方法在大规模模型上的计算限制问题,实现了存储和计算效率的显著提升。

Comments Accepted to CVPR 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏