arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-04-06 至 2026-04-06 共收录 1 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 音视频/视觉语言融合 1 篇

2506.03198 2026-04-06 cs.CV cs.AI 57%

FLEX: A Largescale Multimodal, Multiview Dataset for Learning Structured Representations for Fitness Action Quality Assessment

FLEX:一个大规模多模态、多视角数据集,用于学习结构化表示以评估健身动作质量

Hao Yin, Lijun Gu, Paritosh Parmar, Lin Xu, Tianxiao Guo, Xiujin Liu, Weiwei Fu, Yang Zhang, Tianyou Zheng

机构 * School of Biomedical Engineering (Suzhou), USTC(中国科学技术大学苏州生物医学工程学院) Suzhou Institute of Biomedical Engineering and Technology, CAS(中国科学院苏州生物医学工程技术研究所) Institute of High-Performance Computing, A*STAR, Singapore(新加坡科技研究局高性能计算研究所) School of Psychology, Beijing Sports University(北京体育大学心理学院) School of Competitive Sports, Beijing Sports University(北京体育大学竞技体育学院) Department of Robotics, University of Michigan(密歇根大学机器人系)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 FLEX数据集通过多模态融合和结构化知识图谱提升健身动作质量评估的准确性与解释性,支持跨模态预测和生物力学导向的表示学习。

Comments Dataset and code are available at https://github.com/HaoYin116/FLEX . Link to Project page https://haoyin116.github.io/FLEX_Dataset

详情

展开后加载摘要…

URL PDF HTML 收藏