Multiplication in Multimodal LLMs: Computation with Text, Image, and Audio Inputs
多模态大语言模型中的乘法:文本、图像和音频输入的计算
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) ; National University of Singapore (NUS)(新加坡国立大学)
AI总结 研究多模态大语言模型在处理不同模态下的多数字乘法时的局限性,提出一个受控的多模态乘法基准,通过因子变化数字长度、稀疏性、表示形式和模态,定义算术负载作为总和和非零数字计数的乘积,揭示模型性能与算术负载的关系。
Comments To appear in ACL Findings (2026)