Semantic Generative Tuning for Unified Multimodal Models
语义生成微调用于统一多模态模型
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tencent ARCLab(腾讯ARCLab)
AI总结 本文提出语义生成微调(SGT)方法,通过将高阶语义任务作为生成代理,统一多模态模型的感知与生成能力,提升多模态理解和生成质量。
Comments 14 pages, 13 figures
高校专区
语义生成微调用于统一多模态模型
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tencent ARCLab(腾讯ARCLab)
AI总结 本文提出语义生成微调(SGT)方法,通过将高阶语义任务作为生成代理,统一多模态模型的感知与生成能力,提升多模态理解和生成质量。
Comments 14 pages, 13 figures
MedPruner: 面向高效3D医学图像理解的免训练层次化令牌剪枝框架
机构 * Chinese University of Hong Kong(香港中文大学) ; Westlake University(西湖大学) ; Southern Medical University(南方医科大学) ; Jiangnan University(江南大学) ; Dalian University of Technology(大连理工大学) ; Shanghai Jiao Tong University(上海交通大学) ; University of Copenhagen(哥本哈根大学)
AI总结 提出MedPruner,一种免训练、模型无关的层次化令牌剪枝框架,通过帧间锚点过滤和动态信息核选择,在保留不到5%视觉令牌时保持甚至提升模型性能,显著降低计算开销。
Comments 11 pages
VisNec: 衡量和利用视觉必要性进行多模态指令微调
机构 * SJTU(上海交通大学) ; Universiti Malaya(马来亚大学) ; CMU(卡内基梅隆大学) ; MBZUAI(穆萨台普大学人工智能研究所) ; KIT(卡尔斯鲁厄理工学院) ; KAUST(王国立阿联酋科学技术大学)
AI总结 提出VisNec分数衡量视觉输入在多模态指令微调中的边际贡献,结合语义聚类选择高必要性样本,在15%数据上达到全数据性能的100.2%。
Comments Accepted at ECCV 2026. Project Page: https://dmk041218.github.io/VisNec/
通过扩散驱动选择实现一致且高效的数据集蒸馏
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Shanghai Jiao Tong University(上海交通大学) ; Pengcheng Laboratory(鹏城实验室)
AI总结 提出利用扩散先验进行补丁选择而非生成的新框架,通过噪声预测和损失差异识别图像中独特区域,结合类内聚类和排序实现单步蒸馏,在多种指标和设置下优于现有方法。
Comments Accepted by ECCV 2026