arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

2026-06-26 至 2026-06-26 共收录 4
2605.18714 2026-06-26 cs.CV cs.AI 版本更新

Semantic Generative Tuning for Unified Multimodal Models

语义生成微调用于统一多模态模型

Songsong Yu, Yuxin Chen, Ying Shan, Yanwei Li

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent ARCLab(腾讯ARCLab)

AI总结 本文提出语义生成微调(SGT)方法,通过将高阶语义任务作为生成代理,统一多模态模型的感知与生成能力,提升多模态理解和生成质量。

Comments 14 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11625 2026-06-26 cs.CV cs.AI 版本更新

MedPruner: Training-Free Hierarchical Token Pruning for Efficient 3D Medical Image Understanding in Vision-Language Models

MedPruner: 面向高效3D医学图像理解的免训练层次化令牌剪枝框架

Shengyuan Liu, Zanting Ye, Yunrui Lin, Chen Hu, Wanting Geng, Xu Han, Bulat Ibragimov, Yefeng Zheng, Yixuan Yuan

机构 * Chinese University of Hong Kong(香港中文大学) Westlake University(西湖大学) Southern Medical University(南方医科大学) Jiangnan University(江南大学) Dalian University of Technology(大连理工大学) Shanghai Jiao Tong University(上海交通大学) University of Copenhagen(哥本哈根大学)

AI总结 提出MedPruner,一种免训练、模型无关的层次化令牌剪枝框架,通过帧间锚点过滤和动态信息核选择,在保留不到5%视觉令牌时保持甚至提升模型性能,显著降低计算开销。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01195 2026-06-26 cs.CV cs.AI 版本更新

VisNec: Measuring and Leveraging Visual Necessity for Multimodal Instruction Tuning

VisNec: 衡量和利用视觉必要性进行多模态指令微调

Mingkang Dong, Hongyi Cai, Jie Li, Sifan Zhou, Bin Ren, Kunyu Peng, Yuqian Fu

机构 * SJTU(上海交通大学) Universiti Malaya(马来亚大学) CMU(卡内基梅隆大学) MBZUAI(穆萨台普大学人工智能研究所) KIT(卡尔斯鲁厄理工学院) KAUST(王国立阿联酋科学技术大学)

AI总结 提出VisNec分数衡量视觉输入在多模态指令微调中的边际贡献,结合语义聚类选择高必要性样本,在15%数据上达到全数据性能的100.2%。

Comments Accepted at ECCV 2026. Project Page: https://dmk041218.github.io/VisNec/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09959 2026-06-26 cs.CV 版本更新

Towards Consistent and Efficient Dataset Distillation via Diffusion-Driven Selection

通过扩散驱动选择实现一致且高效的数据集蒸馏

Xinhao Zhong, Shuoyang Sun, Zhaoyang Xu, Xulin Gu, Bin Chen, Min Zhang, Yaowei Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学) Pengcheng Laboratory(鹏城实验室)

AI总结 提出利用扩散先验进行补丁选择而非生成的新框架,通过噪声预测和损失差异识别图像中独特区域,结合类内聚类和排序实现单步蒸馏,在多种指标和设置下优于现有方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏