2506.09919 2026-07-01 cs.CV 版本更新 MetricHMSR:Metric Human Mesh and Scene Recovery from Monocular Images MetricHMSR:基于单目图像的度量人体网格与场景恢复框架 Chentao Song, He Zhang, Haolei Yuan, Haozhe Lin, Jianhua Tao, Hongwen Zhang, Tao Yu 机构 * Tsinghua University(清华大学) ; Beijing Normal University(北京师范大学) ; Beihang University(北京航空航天大学) 纠错 AI总结 本文提出MetricHMSR框架,通过引入bounding camera ray map和HumanMoE模型,实现人体网格和场景的度量恢复,提升单目深度估计的准确性。 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2603.25399 2026-07-01 cs.CV cs.RO 版本更新 LaMP: Learning Vision-Language-Action Policy with 3D Scene Flow as Latent Motion Prior LaMP: 以3D场景流作为潜在运动先验的视觉-语言-动作策略学习 Xinkai Wang, Chenyi Wang, Yifu Xu, Mingzhe Ye, Fucheng Zhang, Jialin Tian, Xinyu Zhan, Lifeng Zhu, Cewu Lu, Lixin Yang 机构 * Southeast University(东南大学) ; School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) ; Zhejiang University(浙江大学) ; Beihang University(北京航空航天大学) ; Shanghai Innovation Institute(上海创新研究院) 纠错 AI总结 提出LaMP框架,通过门控融合将3D场景流作为潜在运动先验,对齐运动专家与动作专家,提升VLA策略在复杂空间交互中的鲁棒性,在LIBERO等基准上取得最高平均成功率。 Comments Accepted to ECCV2026 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2512.24561 2026-07-01 cs.CV 版本更新 RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios RGBT-GroundBench: 超越RGB的复杂真实世界场景中的视觉定位 Tianyi Zhao, Jiawen Xi, Linhui Xiao, Junnan Li, Xue Yang, Maoxun Yuan, Xingxing Wei 机构 * Institute of Artificial Intelligence, State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学人工智能研究院、虚拟现实技术与系统国家重点实验室) ; Pengcheng Laboratory(鹏城实验室) ; Shanghai Jiao Tong University(上海交通大学) 纠错 AI总结 提出首个大规模RGB-热红外视觉定位基准RGBT-GroundBench,包含4万+图像和3级细粒度标注,统一评估协议支持RGB/热红外/融合输入,揭示低照度下性能显著下降,并引入参考基线RGBT-VGNet。 Comments 40pages, 9figures 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图