What We are Missing in Multimodal LLM Evaluation?
我们在多模态大语言模型评估中缺失了什么?
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 本文分析现有多模态大语言模型评估基准的不足,识别出时空连贯性、物理世界理解、多模态一致性和选择性注意等关键缺失,强调填补这些空白对衡量多模态智能真实进展的重要性。
高校专区
我们在多模态大语言模型评估中缺失了什么?
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 本文分析现有多模态大语言模型评估基准的不足,识别出时空连贯性、物理世界理解、多模态一致性和选择性注意等关键缺失,强调填补这些空白对衡量多模态智能真实进展的重要性。
从自我未来学习:面向扩散LLM的在线自蒸馏
机构 * Tsinghua University(清华大学) ; Technical University of Munich(慕尼黑工业大学) ; Nanyang Technological University(南洋理工大学) ; University of British Columbia(不列颠哥伦比亚大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; ELLIS Institute Tubingen(ELLIS蒂宾根研究所) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; Tubingen AI Center(蒂宾根人工智能中心)
AI总结 提出首个面向扩散大语言模型的在线自蒸馏框架d-OPSD,通过自我生成答案作为后缀条件实现从自我未来经验学习,并将监督从词元级转向步骤级,在推理基准上以约10%的优化步骤超越RLVR和SFT基线。
Comments Preprint