arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

共收录 11871
2605.24893 2026-05-26 cs.CV

BED-SAM2: Boundary-Enhanced-Depth SAM2 via Monocular Geometric Priors

BED-SAM2: 通过单目几何先验增强边界的深度SAM2

Tyler Rust, Dara McNally, Kyle O'Donnell, Colin Kelly, Chandra Kambhamettu

机构 * University of Delaware(德克萨斯大学) University of South Florida(佛罗里达州立大学) DEVCOM Army Research Laboratory(国防部陆军研究实验室)

AI总结 本研究通过修改SAM2编码器以直接编码单目深度信息,提出BED-SAM2模型,在少量训练周期内实现显著和伪装物体检测的竞争性能。

Comments 9 pages, 5 figures, 5 tables. Presented as a poster at the CVPR 2026 Workshop on Computer Vision in the Wild (CVinW). Code available at https://github.com/TylerRust-1/BED-SAM2

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24797 2026-05-26 cs.CV

HCL-FF: Hierarchical and Contrastive Learning for Forward-Forward Algorithm

HCL-FF:用于前向-前向算法的分层对比学习

Jie-En Yao, Hong-En Chen, C. -C. Jay Kuo

机构 * University of Southern California(南加州大学)

AI总结 针对前向-前向算法缺乏分层协调和特征语义模糊的问题,提出HCL-FF框架,通过粗到细的分层学习策略和监督对比学习目标,在CIFAR-10等数据集上取得FF方法最佳性能。

Comments Accepted by CVPR 2026. Code: https://github.com/JNNNNYao/HCL-FF

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24762 2026-05-26 cs.CV

4KLSDB: A Large-Scale Dataset for 4K Image Restoration and Generation

4KLSDB:用于4K图像恢复与生成的大规模数据集

Zihao Zhu, Kuan-Ru Huang, Zhaoming Xu, Renjie Li, Bo Wu, Ruizheng Bai, Mingyang Wu, Sayak Paul, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯A&M大学) Hugging Face

AI总结 为解决现有数据集缺乏原生4K分辨率和规模的问题,提出包含129,484张4K图像的大规模数据集4KLSDB,并通过多阶段自动过滤和标注确保质量,实验证明其在超分辨率和扩散模型训练中能显著提升4K基准性能。

Comments Accepted to the DataCV Workshop at CVPR 2026; 10 pages, 4 figures, 7 tables; Our project page is available at: https://4klsdb.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24753 2026-05-26 cs.CV

Ghosts in the Point Clouds: De-glaring LiDAR in the Transient Domain

点云中的鬼影:瞬态域中的LiDAR去眩光

Avery Gump, Connor Henley, Sungjin Cheong, Akarsh Prabhakara, Mohit Gupta

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 针对固态LiDAR内部多径眩光导致的伪影问题,提出基于瞬态眩光扩散函数(TGSF)的物理模型和无训练算法,在点云形成前抑制眩光,保留真实场景结构。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24531 2026-05-26 cs.CV

NudgeVAD: Language-Nudged End-to-End Driving via FiLM Residuals

NudgeVAD: 通过FiLM残差的语言引导端到端驾驶

Chieh-Chi Yang, Yu-Hsiang Chen, Yi-Ting Chen

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

AI总结 提出NudgeVAD框架,利用语言作为校准的微调信号,通过恒等初始化的FiLM和零初始化残差头,在命令不可靠时显著提升驾驶轨迹预测性能。

Comments Technical report for the doScenes Instructed Driving Challenge, CVPR 2026 DriveX Workshop. 1st place in the Ablation track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17268 2026-05-26 cs.AI cs.CV cs.RO

Is VLA Reasoning Faithful? Probing Safety of Chain-of-Causation in Autonomous Driving Models

VLA 推理是否忠实?自动驾驶模型中因果链的安全性探究

Nicanor Mayumu, Xiaoheng Deng, Patrick Mukala

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Central South University(中南大学) School of Computer Science(计算机科学学院) University of Wollongong in Dubai(迪拜大学)

AI总结 通过分析300次VLA推理,发现输出推理与轨迹的忠实度仅42.5%,存在大量漏检行人、轨迹脆弱及推理-动作不一致问题,并提出了信息论忠实度形式化定义与安全架构。

Comments Accept (Poster), CVPR 2026 Workshop DriveX NonArchival Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01512 2026-05-26 cs.CV

Two-Pass Zero-Shot Temporal-Spatial Grounding of Rare Traffic Events in Surveillance Video

监控视频中罕见交通事件的两次通过零样本时空定位

Jiantang Huang

AI总结 提出一种无需微调的管道,通过粗到细的两遍分解和专家角色分配,利用冻结视觉语言模型实现罕见交通事件在时间、空间和碰撞类型上的联合定位。

Comments Accepted at CVPR 2026 AUTOPILOT Workshop (Non-Archival Track). 7 pages (4 main + references + appendix), 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16100 2026-05-26 cs.CV

Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP

重新评估CLIP中的模态内错位假设

Jonas Herzog, Yue Wang

机构 * Zhejiang University(浙江大学)

AI总结 本文质疑CLIP的模态内错位假设,通过理论分析和实验证明图像嵌入距离不存在所谓的自由度,且模态内任务性能差异主要源于任务歧义而非错位。

Comments Accepted for CVPR'26. Project Page: https://vision-kek.github.io/Is-CLIP-Really-Misaligned/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10548 2026-05-26 cs.CV

Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding

Blink: 动态视觉令牌分辨率增强多模态理解

Yuchen Feng, Zhenyu Zhang, Naibin Gu, Yilong Chen, Peng Fu, Zheng Lin, Shuohuan Wang, Yu Sun, Hua Wu, Weiping Wang, Haifeng Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Baidu Inc(百度公司)

AI总结 提出Blink框架,通过注意力引导的令牌超分辨率和动态丢弃机制,在单次前向传播中模拟人类眨眼式扫描,提升多模态大语言模型的视觉感知能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15407 2026-05-26 cs.AI cs.CV cs.LG

IPR-1: Interactive Physical Reasoner

IPR-1:交互式物理推理器

Mingyu Zhang, Lifeng Zhuo, Tianxi Tan, Guocan Xie, Xian Nie, Yan Li, Renjie Zhao, Zizhu He, Ziyu Wang, Jiting Cai, Yong-Lu Li

机构 * CARNEGIE MELLON UNIVERSITY(卡内基梅隆大学)

AI总结 提出IPR模型,通过世界模型滚动评分和强化VLM策略,结合物理中心动作代码PhysCode,在1000+异构游戏基准上实现鲁棒的物理推理,性能超越GPT-5并零样本迁移至未见游戏。

Comments Accepted by CVPR 2026. 13 pages of main text and 20 pages of appendices. Project page: https://mybearyzhang.github.io/ipr-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25339 2026-05-26 cs.CV cs.AI cs.LG eess.IV

VisualOverload: Probing Visual Understanding of VLMs in Really Dense Scenes

VisualOverload: 在真正密集场景中探测VLM的视觉理解

Paul Gavrikov, Wei Lin, M. Jehanzeb Mirza, Soumya Jahagirdar, Muhammad Huzaifa, Sivan Doveh, Serena Yeung-Levy, James Glass, Hilde Kuehne

机构 * Independent Researcher(独立研究者) JKU Linz(林茨JKU) MIT CSAIL Tübingen AI Center(图宾根人工智能中心) Stanford(斯坦福) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

AI总结 提出VisualOverload基准,通过密集场景中的简单视觉任务测试VLM,发现最佳模型仅达69.5%准确率,揭示计数、OCR和逻辑一致性等关键缺陷。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19117 2026-05-26 cs.CV

PrITTI: Primitive-based Generation of Controllable and Editable 3D Semantic Urban Scenes

PrITTI: 基于基元的可控可编辑3D语义城市场景生成

Christina Ourania Tze, Daniel Dauner, Yiyi Liao, Dzmitry Tsishkou, Andreas Geiger

机构 * University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Zhejiang University(浙江大学) Noah’s Ark Lab, Huawei(华为诺亚实验室) KE:SAI - Kyutai ELLIS Scalable Autonomous Intelligence(KE:SAI - 韩国ELLIS可扩展自主智能)

AI总结 提出PrITTI,一种利用矢量化对象基元和栅格化地面表面的混合表示,通过潜在扩散模型实现高质量、可控且可编辑的3D语义城市场景生成。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03631 2026-05-26 cs.CV

Generalizable Video Quality Assessment via Weak-to-Strong Learning

通过弱到强学习实现可泛化的视频质量评估

Linhan Cao, Wei Sun, Xiangyang Zhu, Kaiwei Zhang, Jun Jia, Yicong Peng, Dandan Zhu, Guangtao Zhai, Xiongkuo Min

机构 * Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 提出弱到强学习框架,结合同质/异质监督信号和迭代训练,无需人工标注即可提升视频质量评估的泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23670 2026-05-26 cs.CV

Learning Bijective Surface Parameterization for Inferring Signed Distance Functions from Sparse Point Clouds with Grid Deformation

学习双射曲面参数化以通过网格变形从稀疏点云推断符号距离函数

Takeshi Noda, Chao Chen, Junsheng Zhou, Weiqi Zhang, Yu-Shen Liu, Zhizhong Han

机构 * School of Software, Tsinghua University, Beijing, China(清华大学软件学院,北京,中国) Department of Computer Science, Wayne State University, Detroit, USA(韦恩州立大学计算机科学系,底特律,美国)

AI总结 提出一种动态变形网络结合双射曲面参数化和网格变形优化的方法,从稀疏点云端到端预测符号距离函数,显著优于现有方法。

Comments Accepted by Conference on Computer Vision and Pattern Recognition (CVPR) 2025. Project page:https://takeshie.github.io/Bijective-SDF

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24403 2026-05-26 cs.CV

Artiverse: A Diverse and Physically Grounded Dataset for Articulated Objects

Artiverse:一个多样且物理基础扎实的铰接物体数据集

Denys Iliash, Jiayi Liu, Egor Fokin, Qirui Wu, Ali Mahdavi-Amiri, Manolis Savva, Angel X. Chang

机构 * Simon Fraser University(西蒙 Fraser大学) Canada-CIFAR AI Chair, Amii(加拿大- CIFAR人工智能主席,Amii)

AI总结 提出Artiverse数据集,包含5.4K个高质量铰接3D物体,通过半自动标注管道结合少样本分割、几何推理和多阶段人工验证,实现高效标注,并展示其在部件运动分析、铰接物体生成和基于物理的交互中的价值。

Comments CVPR camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24398 2026-05-26 cs.CV cs.AI cs.GR

VectorArk: Learning Practical Image Vectorization with Rounded Polygon Representation

VectorArk: 学习基于圆角多边形表示的实际图像矢量化

Tarun Gehlaut, Difan Liu, Charu Bansal, Krutik Malani, Souymodip Chakraborty, Ankit Phogat, Matthew Fisher, Vineet Batra

机构 * Adobe

AI总结 提出VectorArk模型,采用圆角多边形表示和退化模型,实现鲁棒且实用的图像矢量化,在多个数据集上取得优越的几何完整性和伪影抑制效果。

Comments CVPR 2026. Project page: https://vectorark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24322 2026-05-26 cs.CV

Causal Physics Steering in Video World Models via Concept Activation Vectors

通过概念激活向量在视频世界模型中进行因果物理引导

Nahid Alam

机构 * Oreon Labs(Oreon实验室) Cohere Labs Community(Cohere实验室社区)

AI总结 提出一种无需训练的方法,利用物理涌现区(PEZ)的概念激活向量(CAV)在推理时引导视频模型的物理期望,无需修改模型权重。

Comments In proceedings of CVPR 2026 workshop on Video World Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24098 2026-05-26 cs.CV

D2-V2X: Depth-Driven Cooperative V2X Reasoning for Autonomous Driving

D2-V2X: 面向自动驾驶的深度驱动协同V2X推理

Kevin Richard, Alphin Varghese, Colin Pham, David Oh, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳州立大学)

AI总结 针对单车辆视觉语言模型受传感器遮挡限制的问题,提出D2-V2X基准和基线模型,通过融合3D LiDAR特征与VLM潜空间,利用链式思维推理实现遮挡目标识别和空间估计,在识别遮挡危险和降低空间估计误差上取得显著提升。

Comments Accepted to the DriveX Workshop at CVPR 2026 (Non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24047 2026-05-26 cs.CV

EMMA: Extracting Multiple physical parameters from Multimodal Data

EMMA: 从多模态数据中提取多个物理参数

Farhat Shaikh, Ayan Banerjee, Sandeep Gupta

机构 * IMPACT Lab, School of Computing & Augmented Intelligence (SCAI)(IMPACT实验室,计算与增强智能学院) Arizona State University, Tempe, AZ(亚利桑那州立大学,Tempe)

AI总结 提出EMMA框架,利用物理信息多模态融合和LTC网络,从原始视频、音频和图像时间序列中联合推断系统动力学参数,无需先验条件或专用传感器,在100+场景中优于单模态方法。

Comments Accepted at CVPR 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22809 2026-05-26 cs.CV

Sensor2Sensor: Cross-Embodiment Sensor Conversion for Autonomous Driving

Sensor2Sensor: 自动驾驶的跨本体传感器转换

Jiahao Wang, Bo Sun, Yijing Bai, Vincent Casser, Songyou Peng, Zehao Zhu, Meng-Li Shih, Xander Masotto, Shih-Yang Su, Kanaad V Parvate, Tiancheng Ge, Linn Bieske, Dragomir Anguelov, Mingxing Tan, Chiyu Max Jiang

机构 * Waymo Johns Hopkins University(约翰霍普金斯大学) Google DeepMind(谷歌DeepMind) University of Washington(华盛顿大学)

AI总结 提出Sensor2Sensor生成模型,将单目行车记录仪视频转换为多模态传感器数据(多视角相机图像和LiDAR点云),通过4D高斯泼溅重建和扩散架构解决无配对数据问题,为自动驾驶开发解锁外部数据源。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19846 2026-05-26 cs.CV cs.AI cs.CL

FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding

FineBench: 细粒度人类活动理解的视觉-语言模型基准测试与增强

Gueter Josmy Faure, Min-Hung Chen, Jia-Fong Yeh, Hung-Ting Su, Winston H. Hsu

机构 * National Taiwan University(国立台湾大学) Google(谷歌) Independent Researcher(独立研究员)

AI总结 针对视觉-语言模型在细粒度人类活动理解上的不足,提出包含密集标注的长视频问答基准FineBench和增强框架FineAgent。

Comments CVPR'26 (Workshop on Video Large Language Models). Project Page: https://joslefaure.github.io/assets/html/finebench.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08011 2026-05-26 cs.CV

It's Time to Get It Right: Improving Analog Clock Reading and Clock-Hand Spatial Reasoning in Vision-Language Models

是时候正确了:提升视觉语言模型中的模拟时钟读取和指针空间推理能力

Jaeha Choi, Jin Won Lee, Siwoo You, Jangho Lee

机构 * Incheon National University(延世国立大学) McGill University(麦吉尔大学)

AI总结 针对视觉语言模型在真实环境中读取模拟时钟的挑战,提出TickTockVQA数据集和Swap-DPO微调框架,显著提升时钟读取准确性和鲁棒性。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03134 2026-05-26 eess.SP cs.CV

Controllable Radar Simulation with Waveform Parameter Embedding

具有波形参数嵌入的可控雷达仿真

Weiqing Xiao, Hao Huang, Chonghao Zhong, Yujie Lin, Nan Wang, Xiaoxue Chen, Zhaoxi Chen, Saining Zhang, Shuocheng Yang, Pierre Merriaux, Lei Lei, Hao Zhao

机构 * NJU(南京大学) BJTU(北京理工大学) BIT(北京理工大学) AIR, THU(空气科技,清华大学) NTU(国立台湾大学) SVM, THU(SVM,清华大学) Lightwheel AI LeddarTech

AI总结 提出Ctrl-RS框架,通过环境反射张量、波形参数抽象和WARP-Net网络,实现可控的雷达立方体仿真,在2D/3D检测和语义分割任务中性能接近或超越真实雷达。

Comments CVPR 2026 Findings: Code: https://github.com/zhuxing0/SA-Radar Project page: https://zhuxing0.github.io/projects/SA-Radar

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23845 2026-05-25 cs.CV

Learning a Particle Dynamics Model with Real-world Videos

利用真实世界视频学习粒子动力学模型

Chanho Kim, Suhas V. Sumukh, Li Fuxin

机构 * Oregon State University(俄勒冈州立大学)

AI总结 提出一种从无标签真实视频直接训练神经物体动力学模型的框架,结合高斯溅射技术,通过渲染监督学习粒子位置和旋转变化,避免对合成数据的依赖。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23602 2026-05-25 cs.CV

GlowGS: Generative Semantic Feature Learning for 3D Gaussian Splatting in Nighttime Glow Scenes

GlowGS: 夜间发光场景中用于3D高斯溅射的生成式语义特征学习

Beibei Lin, Xiao Cao, Jingyuan Guo, Robby T. Tan

机构 * National University of Singapore(新加坡国立大学)

AI总结 针对夜间发光场景中3D高斯溅射因缺乏纹理和边缘等结构特征而难以渲染高质量新视图的问题,提出GlowGS方法,利用扩散模型和视觉基础模型生成语义特征作为隐式结构线索,并通过新视图语义学习实现无真实标签的优化,显著提升渲染质量。

Comments Accepted by CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23482 2026-05-25 cs.CV cs.AI

Multimodal Distribution Matching for Vision-Language Dataset Distillation

多模态分布匹配用于视觉-语言数据集蒸馏

Jongoh Jeong, Hoyong Kwon, Minseok Kim, Kuk-Jin Yoon

机构 * Visual Intelligence Lab., KAIST(韩国科学技术院视觉智能实验室)

AI总结 提出多模态分布匹配(MDM)框架,通过数据、模型和损失层面的几何感知组件,高效压缩视觉-语言数据集并保持跨模态对齐。

Comments Accepted for publication at CVPR 2026. Project Page: https://andyj1.github.io/mdm

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23472 2026-05-25 cs.CV

Rethinking Transfer Learning for Industrial Inspection: DINOv3 vs. ImageNet Pretraining Across RGB and X-ray Tasks

重新思考工业检测的迁移学习:DINOv3与ImageNet预训练在RGB和X射线任务上的对比

Mehdi Gharbage, Céline Teulière, Pierre Bouges, Thierry Chateau

机构 * Michelin Tyres Manufacturer(米其林轮胎制造商) Université Clermont Auvergne, CNRS, Institut Pascal(克莱蒙特-奥弗涅大学,CNRS,帕西尔研究所)

AI总结 本研究通过对比ConvNeXt骨干网络在监督ImageNet分类和DINOv3蒸馏预训练下的表现,评估了现代自监督预训练在工业视觉检测中的有效性,发现DINOv3在RGB任务微调后表现更优,但在X射线模态下监督预训练仍更有效。

Comments Accepted to the CVPR 2026 Workshop on Vision Foundation Models for Industrial Inspection (VISION'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23381 2026-05-25 cs.CV

VDE: Training-Free Accelerating Rectified Flow Model via Velocity Decomposition and Estimation

VDE: 通过速度分解与估计实现无训练加速整流流模型

Junwen Tan, Jinglin Liang, Hongyuan Chen, Shuangping Huang

机构 * South China University of Technology(华南理工大学)

AI总结 提出速度分解与估计(VDE)方法,通过将模型速度分解为平行和正交分量并利用其时间可预测性和方向稳定性进行输入自适应估计,无需训练即可加速整流流模型,在图像和视频生成任务中实现显著加速且视觉质量损失极小。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23203 2026-05-25 cs.CV cs.AI cs.LG cs.RO

Lipschitz Optimization for Formal Verification of Homographies

单应性矩阵形式化验证的Lipschitz优化

Jean-Guillaume Durand, Panagiotis Kouvaros, Maxime Gariel, Alessio Lomuscio

机构 * Joby Aviation(Joby航空) Safe Intelligence

AI总结 提出一种利用Lipschitz优化和分段连续性对单应性矩阵进行形式化验证的方法,首次实现对投影几何变换的鲁棒性验证,在基准测试中取得最高89%加速和7%更紧的边界。

Comments 18 pages, 13 figures, 6 tables, to be published at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23165 2026-05-25 cs.RO cs.AI cs.CL

Autonomous Frontier-Based Exploration with VLM Guidance

基于自主前沿探索与VLM引导

Aarush Aitha, Avideh Zakhor

机构 * EECS Department, University of California(加州大学EECS系)

AI总结 提出利用视觉语言模型进行高层战略决策,替代几何启发式,通过多模态提示选择最优前沿,在模拟环境中将地图覆盖率提升高达24%。

Comments 8 pages, 10 figures, CVPR 2026: 2nd Workshop on 3D-LLM/VLA: Bridging Language, Vision and Action in 3D Environments

详情

展开后加载摘要…

URL PDF HTML 收藏