Improving Visual Token Reduction via Rectifying Distortions for Efficient Multimodal LLM Inference
通过纠正失真改进视觉令牌减少以实现高效多模态大语言模型推理
机构 * KAIST(韩国科学技术院)
AI总结 提出RESTORE框架,通过校准位置和注意力失真来改进视觉令牌减少,在保持效率的同时提升多模态大语言模型性能。
Comments Accepted to ICML 2026
高校专区
通过纠正失真改进视觉令牌减少以实现高效多模态大语言模型推理
机构 * KAIST(韩国科学技术院)
AI总结 提出RESTORE框架,通过校准位置和注意力失真来改进视觉令牌减少,在保持效率的同时提升多模态大语言模型性能。
Comments Accepted to ICML 2026
DexSynRefine:合成与精炼人-物交互运动以实现物理可行的灵巧机器人动作
机构 * Korea Institute of Science and Technology(韩国科学技术院) ; KAIST(韩国科学技术院) ; Hanyang University(翰阳大学)
AI总结 提出DexSynRefine框架,通过HOI-MMFP运动先验合成手-物轨迹,结合任务空间残差强化学习和接触动力学适应,将人-物交互数据转化为物理可行的灵巧操作,在五个任务上成功率提升50-70个百分点。
Comments Project page: https://dexsynrefine.github.io/
PosterForest: 用于科学海报生成的分层多智能体协作
机构 * Graduate School of Artificial Intelligence, KAIST(韩国釜山国立大学人工智能研究生院) ; School of Integrated Technology, Yonsei University(延世大学整合技术学院)
AI总结 提出PosterForest,一种无需训练的科学海报生成框架,通过Poster Tree分层表示文档结构,并利用内容与布局智能体进行分层推理与递归优化,实现内容与布局的联合优化,提升语义连贯性、逻辑流畅性和视觉平衡。
Comments ACL 2026
PolyBench:多声部音频中组合推理的基准测试
机构 * Harbin University of Science and Technology(哈尔滨理工大学) ; The University of Melbourne(墨尔本大学) ; KAIST(韩国成均馆大学) ; University of Surrey(萨里大学)
AI总结 针对多声部音频中组合推理评估缺失的问题,提出PolyBench基准,包含计数、分类、检测、并发和时长估计五个子集,评估发现现有大音频语言模型在多声部场景下性能持续下降。
Comments Accepted by INTERSPEECH 2026
环境声音深度伪造检测挑战赛:鲁棒性、评估与洞察的基准测试
机构 * School of Electrical Engineering, KAIST, Daejeon, Republic of Korea(韩国成均馆大学电气工程学院) ; University of Melbourne, Australia(墨尔本大学) ; Fortemedia Singapore, Singapore(新加坡Fortemedia公司) ; Xi’an University of Posts & Telecommunications, Xi’an, China(西安邮电大学) ; Xi'an Lianfeng Acoustic Technologies Co., Ltd., China(西安联丰声学技术有限公司)
AI总结 本文介绍了环境声音深度伪造检测挑战赛,探讨了鲁棒性评估、系统架构及未来研究方向,提出了环境声音深度伪造检测的关键挑战与机遇。
Comments Accepted by Interspeech 2026