Towards Visually Grounded Multimodal Summarization via Cross-Modal Transformer and Gated Attention
迈向基于视觉的多模态摘要:通过跨模态Transformer和门控注意力
机构 * School of Computing, Macquarie University(麦考瑞大学计算机学院)
专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(title,abstract);分类 cs.AI
AI总结 本文提出SPeCTrA-Sum框架,通过深度视觉处理器和轻量视觉相关性预测器实现文本摘要与图像选择,提升多模态摘要的视觉连贯性与准确性。
Comments Accepted to Findings of ACL 2026