Video-Only ToM: Enhancing Theory of Mind in Multimodal Large Language Models
视频-only ToM:增强多模态大语言模型的理论思维
机构 * University of Science and Technology Beijing(北京科技大学)
专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
AI总结 本文提出VisionToM框架,通过视觉干预增强多模态大语言模型的理论思维能力,改进模型在多模态任务中的推理和问答性能。
Comments 20 pages, 7 figures, accepted at CVPR 2026, project page: see https://founce.github.io/VisionToM