arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

期刊&会议

Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision

2026-03-24 至 2026-03-24 共收录 70
2512.00422 2026-03-24 cs.CV

PhysGen: Physically Grounded 3D Shape Generation for Industrial Design

PhysGen:面向工业设计的物理引导的3D形状生成

Yingxuan You, Chen Zhao, Hantao Zhang, Ming Xu, Pascal Fua

机构 * CVLab, EPFL(EPFL计算机视觉实验室)

AI总结 PhysGen提出一种结合物理引导的3D形状生成方法,通过物理感知正则化项和变分自编码器提升形状真实感,实验表明其优于单纯视觉合理性。

Comments Accepted to CVPR 2026. 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16407 2026-03-24 cs.RO

LAOF: Robust Latent Action Learning with Optical Flow Constraints

LAOF:基于光流约束的鲁棒潜在动作学习

Xizhou Bu, Jiexi Lyu, Fulei Sun, Ruichen Yang, Zhiqiang Ma, Wei Li

机构 * Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学)

AI总结 本文提出LAOF方法,通过利用光流作为动作驱动信号,学习鲁棒的潜在动作表示,以应对动作无关的干扰。实验表明,LAOF在下游模仿学习和强化学习任务中表现优异,尤其在标注稀缺条件下效果显著。

Comments CVPR 2026; Project page: https://github.com/XizoB/LAOF

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15130 2026-03-24 cs.GR cs.AI cs.CV

Taming Video Models for 3D and 4D Generation via Zero-Shot Camera Control

通过零样本相机控制驯服视频模型以实现3D和4D生成

Chenxi Song, Yanming Yang, Tong Zhao, Ruibo Li, Chi Zhang

机构 * AGI Lab, Westlake University(西溪大学AGI实验室) Nanyang Technological University(南洋理工大学)

AI总结 本文提出WorldForge框架,通过推理时的三重组件实现零样本3D/4D生成,解决视频扩散模型在空间任务中的控制不足问题,提升视觉真实性与轨迹一致性。

Comments Accepted to CVPR 2026. Project Webpage: https://worldforge-agi.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13677 2026-03-24 cs.CV cs.AI cs.LG cs.MM

HeCoFuse: Cross-Modal Complementary V2X Cooperative Perception with Heterogeneous Sensors

HeCoFuse: 跨模态互补V2X协作感知与异构传感器

Chuheng Wei, Ziye Qin, Walter Zimmer, Guoyuan Wu, Matthew J. Barth

机构 * College of Engineering, Center for Environmental Research and Technology, University of California at Riverside(加州大学河滨分校工程学院、环境研究与技术中心) School of Transportation and Logistics, Southwest Jiaotong University(西南交通大学交通运输与物流学院) Chair of Robotics, Artificial Intelligence and Real-time Systems, TUM School of Computation, Information and Technology, Technical University of Munich(慕尼黑技术大学计算机、信息与技术学院机器人、人工智能与实时系统教授职位)

AI总结 HeCoFuse提出一种统一框架,通过通道和空间注意力机制实现异构传感器下的跨模态特征融合,提升协作感知的可靠性与性能,实验显示其在TUMTraf-V2X数据集上达到43.22%的3D mAP,优于基线方法。

Comments Ranked first in CVPR DriveX workshop TUM-Traf V2X challenge. Accepted by ITSC2025

Journal ref Proceedings of the 2025 IEEE 28th International Conference on Intelligent Transportation Systems (ITSC), pp. 1214-1221, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23495 2026-03-24 cs.CV

Embedding Shift Dissection on CLIP: Effects of Augmentations on VLM's Representation Learning

在CLIP上嵌入位移分析:不同增强对VLM表示学习的影响

Ashim Dahal, Saydul Akbar Murad, Nick Rahimi

机构 * University of Southern Mississippi(密西西比大学)

AI总结 研究分析不同增强技术对CLIP嵌入位移的影响,探讨增强对视觉语言模型表示学习的机械可解释性影响。

Comments accepted at MIV at CVPR 2025

Journal ref 2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20470 2026-03-24 cs.AI

DiffGraph: An Automated Agent-driven Model Merging Framework for In-the-Wild Text-to-Image Generation

DiffGraph: 一种自动化代理驱动的模型融合框架用于真实场景的文本到图像生成

Zhuoling Li, Hossein Rahmani, Jiarui Zhang, Yu Xue, Majid Mirmehdi, Jason Kuen, Jiuxiang Gu, Jun Liu

机构 * Lancaster University(兰卡斯特大学) University of Bristol(布里斯托大学) Adobe Research(Adobe研究院)

AI总结 DiffGraph通过自动化整合在线专家资源,灵活融合不同模型以满足多样化的真实用户需求,提升了文本到图像生成的效能。

Comments CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20448 2026-03-24 cs.CV eess.IV

Thermal is Always Wild: Characterizing and Addressing Challenges in Thermal-Only Novel View Synthesis

热总是野性:在仅热成像的新型视角合成中的特征刻画与挑战应对

M. Kerem Aydin, Vishwanath Saragadam, Emma Alexander

机构 * Northwestern University(西北大学) University of California, Riverside(加州大学河滨分校)

AI总结 本文针对热成像在新型视角合成中的难点,提出轻量预处理与溅射流程,提升动态范围并稳定光照度,实现先进性能。

Comments To be published at CVPR, 2026. 15 Pages, 29 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20403 2026-03-24 cs.CV

FAAR: Efficient Frequency-Aware Multi-Task Fine-Tuning via Automatic Rank Selection

FAAR:通过自动排名选择实现高效的频率感知多任务微调

Maxime Fontana, Michael Spratling, Miaojing Shi

机构 * King’s College London(伦敦国王学院) University of Luxembourg(卢森堡大学) Tongji University(同济大学)

AI总结 本文提出FAAR方法,通过性能驱动的排名缩减和任务频谱金字塔解码器,在多任务学习中提升准确性和效率,相比传统方法减少参数达9倍。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20323 2026-03-24 cs.CV

NCSTR: Node-Centric Decoupled Spatio-Temporal Reasoning for Video-based Human Pose Estimation

NCSTR:基于节点的解耦时空推理用于视频人体姿态估计

Quang Dang Huynh, Xuefei Yin, Andrew Busch, Hugo G. Espinosa, Alan Wee-Chung Liew, Matthew T. O. Worsey, Yanming Zhu

机构 * Griffith University(格里菲斯大学)

AI总结 本文提出NCSTR框架,通过融合视觉、时间和结构推理,解决视频人体姿态估计中的模糊、遮挡和复杂时空动态问题,通过双分支解耦时空注意力图和节点空间专家融合模块提升姿态估计精度。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17487 2026-03-24 cs.CV

Downscaling Intelligence: Exploring Perception and Reasoning Bottlenecks in Small Multimodal Models

智能下放:探索小型多模态模型中感知与推理的瓶颈

Mark Endo, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学)

AI总结 本文研究小型多模态模型中感知与推理能力的瓶颈,通过分析LLM容量下降对多模态能力的影响,提出视觉提取调优方法,提升效率与性能。

Comments CVPR 2026, website at https://web.stanford.edu/~markendo/projects/downscaling_intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏