Video-Only ToM: Enhancing Theory of Mind in Multimodal Large Language Models
视频-only ToM:增强多模态大语言模型的理论思维
机构 * University of Science and Technology Beijing(北京科技大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出VisionToM框架,通过视觉干预增强多模态大语言模型的理论思维能力,改进模型在多模态任务中的推理和问答性能。
Comments 20 pages, 7 figures, accepted at CVPR 2026, project page: see https://founce.github.io/VisionToM