What We are Missing in Multimodal LLM Evaluation?
我们在多模态大语言模型评估中缺失了什么?
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 本文分析现有多模态大语言模型评估基准的不足,识别出时空连贯性、物理世界理解、多模态一致性和选择性注意等关键缺失,强调填补这些空白对衡量多模态智能真实进展的重要性。
高校专区
我们在多模态大语言模型评估中缺失了什么?
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 本文分析现有多模态大语言模型评估基准的不足,识别出时空连贯性、物理世界理解、多模态一致性和选择性注意等关键缺失,强调填补这些空白对衡量多模态智能真实进展的重要性。
从自我未来学习:面向扩散LLM的在线自蒸馏
机构 * Tsinghua University(清华大学) ; Technical University of Munich(慕尼黑工业大学) ; Nanyang Technological University(南洋理工大学) ; University of British Columbia(不列颠哥伦比亚大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; ELLIS Institute Tubingen(ELLIS蒂宾根研究所) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; Tubingen AI Center(蒂宾根人工智能中心)
AI总结 提出首个面向扩散大语言模型的在线自蒸馏框架d-OPSD,通过自我生成答案作为后缀条件实现从自我未来经验学习,并将监督从词元级转向步骤级,在推理基准上以约10%的优化步骤超越RLVR和SFT基线。
Comments Preprint
玻色子高斯酉算子的高效学习
机构 * Inria(法国国家信息与自动化技术研究所) ; Télécom Paris - LTCI(巴黎电信学院 - LTCI) ; Institut Polytechnique de Paris(巴黎理工学院) ; Department of Computer Science, The University of Texas at Austin(德克萨斯大学奥斯汀分校计算机科学系) ; Institute of Computer Technology, Seoul National University(首尔国立大学计算机技术研究所) ; Dahlem Center for Complex Quantum Systems, Freie Universitat Berlin(柏林自由大学复杂量子系统中心) ; NEST, Scuola Normale Superiore and Istituto Nanoscienze(NEST、巴黎高等科学研究所和纳米科学研究所)
AI总结 提出首个高效算法学习玻色子高斯酉算子,使用相干和压缩探针、被动线性光学及外差/零差检测,通过辛正则化后处理实现多项式时间复杂度和高精度。
GO: 大户外多模态数据集
机构 * Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University, College Station, TX, USA(迈克·沃克66机械工程系,德克萨斯A&M大学,学院站,德克萨斯州,美国) ; DEVCOM Army Research Laboratory, Adelphi, MD, USA(陆军研究实验室,阿德菲,马里兰州,美国) ; University of Texas at Austin Center for Autonomy, Austin, TX, USA(德克萨斯大学奥斯汀分校自主性中心,奥斯汀,德克萨斯州,美国)
AI总结 针对非结构化环境中地面机器人研究,提出包含六种互补传感器模态的大规模多模态越野数据集,支持语义分割、目标检测和SLAM等任务,以提升退化条件下的鲁棒性。
Comments 7 pages, 7 figures, accepted at IV 2026