Scene and Human in One World: Reconstruction in a Feedforward Pass
场景与人类共处一世界:前馈式重建
机构 * University of Pennsylvania(宾夕法尼亚大学)
AI总结 提出SHOW框架,通过统一度量空间中的前馈3D场景重建与人体网格恢复,利用人体语义和尺度先验实现尺度感知的场景重建,并利用场景几何约束优化人体定位,解决动态单目视频中的人-场景对齐和遮挡问题。
高校专区
场景与人类共处一世界:前馈式重建
机构 * University of Pennsylvania(宾夕法尼亚大学)
AI总结 提出SHOW框架,通过统一度量空间中的前馈3D场景重建与人体网格恢复,利用人体语义和尺度先验实现尺度感知的场景重建,并利用场景几何约束优化人体定位,解决动态单目视频中的人-场景对齐和遮挡问题。
LLMs能否进行注意力推理?多模态课堂行为的零样本分析
机构 * Virginia Tech(弗吉尼亚理工大学) ; University of Virginia(弗吉尼亚大学) ; University of Pennsylvania(宾夕法尼亚大学)
AI总结 本文提出一个隐私保护的分析流程,利用OpenPose和Gaze-LLE提取学生注意力信息,并通过QwQ-32B-Reasoning进行零样本分析,探讨LLMs在多模态行为理解中的潜力与局限。
Comments 8 pages, 2 figures. Preprint