arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-07-21 至 2026-07-21 共收录 2 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 音视频/视觉语言融合 2 篇

2607.16327 2026-07-21 cs.CV 新提交 70%

Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation

用于文本引导医学图像分割的定位注入视觉语言语义融合

Songyue Han, Mingye Zou, Shuchang Ye, Lei Bi, Mingyuan Meng

机构 * Air Force Engineering University(空军工程大学) Harbin Institute of Technology(哈尔滨工业大学) University of Sydney(悉尼大学) Institute of Translational Medicine, Shanghai Jiao Tong University(上海交通大学转化医学研究院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

专题命中 音视频/视觉语言融合 :information fusion(abstract);feature-level fusion(abstract);分类 cs.CV

AI总结 研究针对文本引导医学图像分割,提出LoG框架,通过联合执行多尺度目标定位任务,实现三级定位注入语义融合,在三个基准数据集实验中表现出色,优于现有医学图像分割方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16980 2026-07-21 eess.SP cs.SD 新提交 57%

Efficient Audio-Visual Event Recognition via Knowledge Distillation and Dynamic INT8 Quantization of a Hybrid Cross-Attention Network

通过混合交叉注意力网络的知识蒸馏和动态 INT8 量化实现高效视听事件识别

Parinaz Binandeh Dehaghani, Danilo Pena, A. Pedro Aguiar

机构 * University of Porto, Porto, Portugal(葡萄牙波尔图大学) ResoSight, Montreal, Canada(ResoSight公司)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 eess.SP

AI总结 研究针对视听事件识别模型在边缘设备部署的难题,提出结合架构压缩、知识蒸馏和动态 INT8 量化的框架。构建教师与学生模型,经知识蒸馏训练学生模型,再用动态量化减小模型大小。实验表明该框架有效平衡准确率与效率,利于在资源受限平台部署。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏