arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-16 至 2026-04-16 共收录 1 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1 篇

2604.13581 2026-04-16 cs.CV 57%

SocialMirror: Reconstructing 3D Human Interaction Behaviors from Monocular Videos with Semantic and Geometric Guidance

SocialMirror: 从单目视频中利用语义和几何引导重建3D人体交互行为

Qi Xia, Peishan Cong, Ziyi Wang, Yujing Sun, Qin Sun, Xinge Zhu, Mao Ye, Ruigang Yang, Yuexin Ma

机构 * ShanghaiTech University(上海科技大学) Nanyang Technological University(南洋理工大学) Guangzhou Institute of Energy Conversion, CAS(广州能源研究所,中国科学院) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) Inceptio Technology(Inceptio科技) Shanghai Jiao Tong University(上海交通大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文提出SocialMirror框架,通过语义和几何引导解决单目视频中人体重建的挑战,实现高精度交互行为重建,展现强大的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏