Rethinking Few-Shot Image Fusion: Granular Ball Priors Enable General-Purpose Deep Fusion
重新思考少样本图像融合:粒度球先验使通用深度融合成为可能
专题命中 通用Image Fusion :image fusion(title,abstract);分类 cs.CV、eess.IV
AI总结 本文提出粒度球先验方法,通过自适应损失函数实现少样本图像融合,提升融合质量和模型效率。
视觉与机器人
面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。
重新思考少样本图像融合:粒度球先验使通用深度融合成为可能
专题命中 通用Image Fusion :image fusion(title,abstract);分类 cs.CV、eess.IV
AI总结 本文提出粒度球先验方法,通过自适应损失函数实现少样本图像融合,提升融合质量和模型效率。
GroundCount: 通过目标检测对视觉语言模型进行接地以缓解计数幻觉
专题命中 音视频/视觉语言融合 :feature-level fusion(abstract);分类 cs.CV
AI总结 GroundCount通过目标检测提供空间接地,缓解视觉语言模型计数幻觉,提升准确率并减少推理时间。
鲁棒的音频视觉目标说话人提取与情感感知多注册融合
机构 * School of Computer Science, Wuhan University, Wuhan, China(1 武汉大学计算机学院,武汉,中国) ; School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(2 香港中文大学(深圳)人工智能学院,中国) ; School of Artificial Intelligence, Wuhan University, Wuhan, China(3 武汉大学人工智能学院,武汉,中国) ; School of Cyber Science and Engineering, Wuhan University, Wuhan, China(4 武汉大学网络科学与工程学院,武汉,中国) ; Digital Innovation Research Center, Duke Kunshan University, Kunshan, China(5 香港中文大学(深圳)数字创新研究中心,中国) ; AI Center, OPPO, Beijing, China(6 OPPO人工智能中心,北京,中国)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 本文提出一种鲁棒的音频视觉目标说话人提取方法,通过情感感知的多注册融合技术,在模态缺失情况下提升提取性能和鲁棒性。
Comments submitted to Interspeech 2026
AutoViVQA:一个大规模自动构建的数据集用于越南语视觉问答
机构 * Faculty of Information Technology, University of Science, VNU-HCM(越南国家大学胡志明市分校信息科技学院) ; Vietnam National University, Ho Chi Minh City(越南国家大学胡志明市分校)
专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV
AI总结 本文提出AutoViVQA数据集,利用变压器架构进行越南语视觉问答,结合文本和视觉预训练,并在多语言环境下系统比较自动评估指标。
Geo-ATBench: 一个具有地理语义上下文的地理音频标签基准
专题命中 融合架构与评测 :decision-level fusion(abstract)
AI总结 Geo-ATBench通过引入地理语义上下文提升音频标签任务的性能,提供了一个可重复的地理音频融合框架。
SDGraph:通过稀疏-密集图架构进行多级草图表示学习
专题命中 融合架构与评测 :information fusion(abstract)
AI总结 SDGraph通过稀疏-密集图架构实现多级草图表示学习,提升草图分类、检索和生成任务的性能。