arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Beihang University(北京航空航天大学)

2026-07-01 至 2026-07-01 共收录 3
2506.09919 2026-07-01 cs.CV 版本更新

MetricHMSR:Metric Human Mesh and Scene Recovery from Monocular Images

MetricHMSR:基于单目图像的度量人体网格与场景恢复框架

Chentao Song, He Zhang, Haolei Yuan, Haozhe Lin, Jianhua Tao, Hongwen Zhang, Tao Yu

机构 * Tsinghua University(清华大学) Beijing Normal University(北京师范大学) Beihang University(北京航空航天大学)

AI总结 本文提出MetricHMSR框架,通过引入bounding camera ray map和HumanMoE模型,实现人体网格和场景的度量恢复,提升单目深度估计的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25399 2026-07-01 cs.CV cs.RO 版本更新

LaMP: Learning Vision-Language-Action Policy with 3D Scene Flow as Latent Motion Prior

LaMP: 以3D场景流作为潜在运动先验的视觉-语言-动作策略学习

Xinkai Wang, Chenyi Wang, Yifu Xu, Mingzhe Ye, Fucheng Zhang, Jialin Tian, Xinyu Zhan, Lifeng Zhu, Cewu Lu, Lixin Yang

机构 * Southeast University(东南大学) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 提出LaMP框架,通过门控融合将3D场景流作为潜在运动先验,对齐运动专家与动作专家,提升VLA策略在复杂空间交互中的鲁棒性,在LIBERO等基准上取得最高平均成功率。

Comments Accepted to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24561 2026-07-01 cs.CV 版本更新

RGBT-GroundBench: Visual Grounding Beyond RGB in Complex Real-World Scenarios

RGBT-GroundBench: 超越RGB的复杂真实世界场景中的视觉定位

Tianyi Zhao, Jiawen Xi, Linhui Xiao, Junnan Li, Xue Yang, Maoxun Yuan, Xingxing Wei

机构 * Institute of Artificial Intelligence, State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学人工智能研究院、虚拟现实技术与系统国家重点实验室) Pengcheng Laboratory(鹏城实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出首个大规模RGB-热红外视觉定位基准RGBT-GroundBench,包含4万+图像和3级细粒度标注,统一评估协议支持RGB/热红外/融合输入,揭示低照度下性能显著下降,并引入参考基线RGBT-VGNet。

Comments 40pages, 9figures

详情

展开后加载摘要…

URL PDF HTML 收藏