ASR-Agnostic Multimodal Spectrotemporal Modeling for Early Dementia Detection
ASR无关的多模态谱时建模用于早期痴呆检测
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 提出一种不依赖语音识别的框架,直接从梅尔频谱图中提取谱时位移场作为数字生物标志物,结合CNN-ConvGRU声学嵌入和交叉注意力融合,在三种语言语料库上验证了多模态融合的语料依赖性。
视觉与机器人
面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。
ASR无关的多模态谱时建模用于早期痴呆检测
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 提出一种不依赖语音识别的框架,直接从梅尔频谱图中提取谱时位移场作为数字生物标志物,结合CNN-ConvGRU声学嵌入和交叉注意力融合,在三种语言语料库上验证了多模态融合的语料依赖性。
协同零样本跨语言阿尔茨海默检测与语言不变多模态双几何对抗学习
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 提出ORBIT框架,通过跨注意力融合、多语言对抗和球面-双曲几何学习实现零样本跨语言阿尔茨海默病检测,多模态融合优于单模态基线。
Comments Accepted to INTERSPEECH 2026
基于数据驱动的Russell情感环状模型解码
机构 * Alten ; CentraleSupélec IETR UMR CNRS 6164(中央理工-高等电力学院 IETR CNRS 6164 联合研究单位) ; Inria at Univ. Grenoble Alpes, CNRS, LJK(法国国家信息与自动化研究所,格勒诺布尔阿尔卑斯大学,CNRS,LJK)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 本文研究Transformer嵌入是否恢复Russell环状模型的几何规律,通过文本和语音模型实验,发现多模态融合完美对齐情感排序,零样本下细粒度情感词接近人类映射坐标。
Comments This work has been submitted to the IEEE for possible publication