arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-07-16 至 2026-07-16 共收录 2 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 机器人多传感器融合 1 篇

2604.21400 2026-07-16 cs.CV 版本更新 70%

You Only Gaussian Once: Controllable 3D Gaussian Splatting for Ultra-Densely Sampled Scenes

你只需一次高斯:用于超密集采样场景的可控3D高斯点划法

Jinrang Jia, Zhenjia Li, Yifeng Shi

机构 * Ke Holdings Inc.(凯控股有限公司)

专题命中 机器人多传感器融合 :sensor fusion(abstract);multi-sensor fusion(abstract);分类 cs.CV

AI总结 本文提出YOGO框架,通过确定性预算均衡解决3DGS在工业应用中的资源消耗问题,并引入Immersion v1.0数据集提升重建精度。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音视频/视觉语言融合 1 篇

2603.22372 2026-07-16 cs.LG cs.AI 版本更新 71%

Rethinking Multimodal Fusion for Time Series: Text Modalities Need Constrained Fusion

重新思考时间序列的多模态融合:文本模态需要受约束的融合

Seunghan Lee, Jun Seo, Jaehoon Lee, Sungdong Yoo, Minjae Kim, Tae Yoon Lim, Dongwan Kang, Hwanil Choi, SoonYoung Lee, Wonbin Ahn

机构 * LG AI Research(LG人工智能研究)

专题命中 音视频/视觉语言融合 :multimodal fusion(title)

AI总结 针对多模态时间序列预测中朴素融合方法效果不佳的问题,提出受约束融合方法及受控融合适配器(CFA),通过低秩适配器过滤无关文本信息,在多种数据集和模型上验证了有效性。

Comments KDD Workshop on Mining and Learning from Time Series 2026 (Oral presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏