arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-05-26 至 2026-05-26 共收录 39
2605.24403 2026-05-26 cs.CV

Artiverse: A Diverse and Physically Grounded Dataset for Articulated Objects

Artiverse:一个多样且物理基础扎实的铰接物体数据集

Denys Iliash, Jiayi Liu, Egor Fokin, Qirui Wu, Ali Mahdavi-Amiri, Manolis Savva, Angel X. Chang

机构 * Simon Fraser University(西蒙 Fraser大学) Canada-CIFAR AI Chair, Amii(加拿大- CIFAR人工智能主席,Amii)

AI总结 提出Artiverse数据集,包含5.4K个高质量铰接3D物体,通过半自动标注管道结合少样本分割、几何推理和多阶段人工验证,实现高效标注,并展示其在部件运动分析、铰接物体生成和基于物理的交互中的价值。

Comments CVPR camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24398 2026-05-26 cs.CV cs.AI cs.GR

VectorArk: Learning Practical Image Vectorization with Rounded Polygon Representation

VectorArk: 学习基于圆角多边形表示的实际图像矢量化

Tarun Gehlaut, Difan Liu, Charu Bansal, Krutik Malani, Souymodip Chakraborty, Ankit Phogat, Matthew Fisher, Vineet Batra

机构 * Adobe

AI总结 提出VectorArk模型,采用圆角多边形表示和退化模型,实现鲁棒且实用的图像矢量化,在多个数据集上取得优越的几何完整性和伪影抑制效果。

Comments CVPR 2026. Project page: https://vectorark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24322 2026-05-26 cs.CV

Causal Physics Steering in Video World Models via Concept Activation Vectors

通过概念激活向量在视频世界模型中进行因果物理引导

Nahid Alam

机构 * Oreon Labs(Oreon实验室) Cohere Labs Community(Cohere实验室社区)

AI总结 提出一种无需训练的方法,利用物理涌现区(PEZ)的概念激活向量(CAV)在推理时引导视频模型的物理期望,无需修改模型权重。

Comments In proceedings of CVPR 2026 workshop on Video World Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24098 2026-05-26 cs.CV

D2-V2X: Depth-Driven Cooperative V2X Reasoning for Autonomous Driving

D2-V2X: 面向自动驾驶的深度驱动协同V2X推理

Kevin Richard, Alphin Varghese, Colin Pham, David Oh, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳州立大学)

AI总结 针对单车辆视觉语言模型受传感器遮挡限制的问题,提出D2-V2X基准和基线模型,通过融合3D LiDAR特征与VLM潜空间,利用链式思维推理实现遮挡目标识别和空间估计,在识别遮挡危险和降低空间估计误差上取得显著提升。

Comments Accepted to the DriveX Workshop at CVPR 2026 (Non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24047 2026-05-26 cs.CV

EMMA: Extracting Multiple physical parameters from Multimodal Data

EMMA: 从多模态数据中提取多个物理参数

Farhat Shaikh, Ayan Banerjee, Sandeep Gupta

机构 * IMPACT Lab, School of Computing & Augmented Intelligence (SCAI)(IMPACT实验室,计算与增强智能学院) Arizona State University, Tempe, AZ(亚利桑那州立大学,Tempe)

AI总结 提出EMMA框架,利用物理信息多模态融合和LTC网络,从原始视频、音频和图像时间序列中联合推断系统动力学参数,无需先验条件或专用传感器,在100+场景中优于单模态方法。

Comments Accepted at CVPR 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22809 2026-05-26 cs.CV

Sensor2Sensor: Cross-Embodiment Sensor Conversion for Autonomous Driving

Sensor2Sensor: 自动驾驶的跨本体传感器转换

Jiahao Wang, Bo Sun, Yijing Bai, Vincent Casser, Songyou Peng, Zehao Zhu, Meng-Li Shih, Xander Masotto, Shih-Yang Su, Kanaad V Parvate, Tiancheng Ge, Linn Bieske, Dragomir Anguelov, Mingxing Tan, Chiyu Max Jiang

机构 * Waymo Johns Hopkins University(约翰霍普金斯大学) Google DeepMind(谷歌DeepMind) University of Washington(华盛顿大学)

AI总结 提出Sensor2Sensor生成模型,将单目行车记录仪视频转换为多模态传感器数据(多视角相机图像和LiDAR点云),通过4D高斯泼溅重建和扩散架构解决无配对数据问题,为自动驾驶开发解锁外部数据源。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19846 2026-05-26 cs.CV cs.AI cs.CL

FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding

FineBench: 细粒度人类活动理解的视觉-语言模型基准测试与增强

Gueter Josmy Faure, Min-Hung Chen, Jia-Fong Yeh, Hung-Ting Su, Winston H. Hsu

机构 * National Taiwan University(国立台湾大学) Google(谷歌) Independent Researcher(独立研究员)

AI总结 针对视觉-语言模型在细粒度人类活动理解上的不足,提出包含密集标注的长视频问答基准FineBench和增强框架FineAgent。

Comments CVPR'26 (Workshop on Video Large Language Models). Project Page: https://joslefaure.github.io/assets/html/finebench.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08011 2026-05-26 cs.CV

It's Time to Get It Right: Improving Analog Clock Reading and Clock-Hand Spatial Reasoning in Vision-Language Models

是时候正确了:提升视觉语言模型中的模拟时钟读取和指针空间推理能力

Jaeha Choi, Jin Won Lee, Siwoo You, Jangho Lee

机构 * Incheon National University(延世国立大学) McGill University(麦吉尔大学)

AI总结 针对视觉语言模型在真实环境中读取模拟时钟的挑战,提出TickTockVQA数据集和Swap-DPO微调框架,显著提升时钟读取准确性和鲁棒性。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03134 2026-05-26 eess.SP cs.CV

Controllable Radar Simulation with Waveform Parameter Embedding

具有波形参数嵌入的可控雷达仿真

Weiqing Xiao, Hao Huang, Chonghao Zhong, Yujie Lin, Nan Wang, Xiaoxue Chen, Zhaoxi Chen, Saining Zhang, Shuocheng Yang, Pierre Merriaux, Lei Lei, Hao Zhao

机构 * NJU(南京大学) BJTU(北京理工大学) BIT(北京理工大学) AIR, THU(空气科技,清华大学) NTU(国立台湾大学) SVM, THU(SVM,清华大学) Lightwheel AI LeddarTech

AI总结 提出Ctrl-RS框架,通过环境反射张量、波形参数抽象和WARP-Net网络,实现可控的雷达立方体仿真,在2D/3D检测和语义分割任务中性能接近或超越真实雷达。

Comments CVPR 2026 Findings: Code: https://github.com/zhuxing0/SA-Radar Project page: https://zhuxing0.github.io/projects/SA-Radar

详情

展开后加载摘要…

URL PDF HTML 收藏