MLLM-based Speech Recognition: When and How is Multimodality Beneficial?
机构 * Worcester Polytechnic Institute(沃斯特理工学院)
专题命中 其他VLM :MLLM(title)
Journal ref IEEE Transactions on Multimedia, 2026
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Worcester Polytechnic Institute(沃斯特理工学院)
专题命中 其他VLM :MLLM(title)
Journal ref IEEE Transactions on Multimedia, 2026
用于细粒度视频表情识别的基于能量缓存的在线个性化测试时自适应
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
AI总结 针对视频FER的测试时自适应难题,提出EB-CaP方法,通过轻量级能量模型结合CLIP生成个性化缓存,在低开销下优于现有SOTA方法。
一致性存在可计算的盲区:视觉-语言图表阅读的无标签可靠性交换理论
专题命中 其他VLM :vision-language model(abstract);分类 cs.LG
AI总结 该研究提出视觉-语言图表阅读的无标签可靠性交换理论,构建无标签、无需训练的检测器,发布REND-EQUIV数据集,揭示一致性盲区可计算,循环重标记可提升性能,解释排序反转现象。