arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-03-12 至 2026-03-12 共收录 3 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 融合架构与评测 3 篇

2603.09689 2026-03-12 cs.CV cs.AI 57%

AutoViVQA: A Large-Scale Automatically Constructed Dataset for Vietnamese Visual Question Answering

AutoViVQA:一个大规模自动构建的数据集用于越南语视觉问答

Nguyen Anh Tuong, Phan Ba Duc, Nguyen Trung Quoc, Tran Dac Thinh, Dang Duy Lan, Nguyen Quoc Thinh, Tung Le

机构 * Faculty of Information Technology, University of Science, VNU-HCM(越南国家大学胡志明市分校信息科技学院) Vietnam National University, Ho Chi Minh City(越南国家大学胡志明市分校)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出AutoViVQA数据集,利用变压器架构进行越南语视觉问答,结合文本和视觉预训练,并在多语言环境下系统比较自动评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10623 2026-03-12 eess.AS cs.LG cs.SD 50%

Geo-ATBench: A Benchmark for Geospatial Audio Tagging with Geospatial Semantic Context

Geo-ATBench: 一个具有地理语义上下文的地理音频标签基准

Yuanbo Hou, Yanru Wu, Qiaoqiao Ren, Shengchen Li, Stephen Roberts, Dick Botteldooren

专题命中 融合架构与评测 :decision-level fusion(abstract)

AI总结 Geo-ATBench通过引入地理语义上下文提升音频标签任务的性能,提供了一个可重复的地理音频融合框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12192 2026-03-12 cs.GR 50%

SDGraph: Multi-Level Sketch Representation Learning by Sparse-Dense Graph Architecture

SDGraph:通过稀疏-密集图架构进行多级草图表示学习

Xi Cheng, Pingfa Feng, Mingyu Fan, Zhichao Liao, Hang Cheng, Long Zeng

专题命中 融合架构与评测 :information fusion(abstract)

AI总结 SDGraph通过稀疏-密集图架构实现多级草图表示学习,提升草图分类、检索和生成任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏