Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey
专题命中 其他VLM :multimodal large language model(title);分类 cs.CV
Comments 52 pages
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 其他VLM :multimodal large language model(title);分类 cs.CV
Comments 52 pages
专题命中 其他VLM :vision-language model(title);分类 cs.CV
专题命中 其他VLM :visual language model(title);分类 cs.CV
专题命中 其他VLM :vision-language model(title);分类 cs.CV
Comments Preprint, manuscript under-review
专题命中 其他VLM :vision-language model(title);分类 cs.CV
专题命中 其他VLM :vision-language model(title);分类 cs.CV
Comments Accepted at SPAICE Conference, ECSAT, UK, 2024
专题命中 其他VLM :MLLM(title);分类 cs.CV
Comments https://liuxinyv.github.io/HiPrompt/
专题命中 其他VLM :vision-language model(title);分类 cs.CV
Comments 8 pages, 4 figures
专题命中 其他VLM :vision-language model(title);分类 cs.AI
Comments ICLR 2024
专题命中 其他VLM :vision-language model(title);分类 cs.CV
Comments CVPR 2024. Code: https://github.com/jusiro/CLAP
专题命中 其他VLM :vision-language model(title);分类 cs.CV
专题命中 其他VLM :vision-language model(title);分类 cs.CV
Comments Accepted to CVPR2024
专题命中 其他VLM :vision-language model(title);分类 cs.CV
Comments Project Page: https://github.com/Qi-Zhangyang/Gemini-vs-GPT4V. arXiv admin note: substantial text overlap with arXiv:2309.17421
专题命中 其他VLM :vision-language model(title);分类 cs.CV
Comments AAAI2024
专题命中 其他VLM :multimodal large language model(title);分类 cs.AI
Comments IEEE BigData 2023. 10 pages
专题命中 其他VLM :vision-language model(title);分类 cs.CV
Comments Accepted by ICCV 2023
专题命中 其他VLM :vision-language model(title);分类 cs.AI
专题命中 其他VLM :vision-language model(title);分类 cs.CV
揭示通用多模态嵌入中的视觉身份
机构 * Shanghai Jiao Tong University(上海交通大学) ; Alibaba Group(阿里巴巴集团)
专题命中 其他VLM :multimodal large language model(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 该研究针对通用多模态嵌入缺乏视觉身份判别能力的问题,提出视觉身份判别统一形式化,构建MVEB基准,设计身份感知采样的学习框架,提升了UMEs的身份判别能力。
Comments Accepted to CVPR 2026
Oracle剪枝真的是真正的Oracle吗?
机构 * Westlake University(西湖大学) ; Nankai University(南开大学) ; ENCODE Lab, Westlake University(西湖大学ENCODE实验室)
专题命中 其他VLM :MLLM(abstract,abstract_cn);分类 cs.CV、cs.LG
AI总结 本文通过大规模实验(37K模型)发现,对于中等规模以上的深度学习模型,Oracle剪枝选择的权重在重训练后性能与重训练前几乎无关,质疑了Oracle剪枝作为剪枝方法基础的有效性。
Comments TMLR, Webpage: https://fscdc.github.io/Oracle-Pruning-Sanity-Check/
ReefNet:一个大规模数据集和基准,用于细粒度珊瑚礁识别
机构 * King Abdullah University of Science and Technology (KAUST)(国王阿卜杜勒·阿齐兹科技大学) ; Massachusetts Institute of Technology (MIT)(麻省理工学院)
专题命中 其他VLM :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出ReefNet,一个大规模珊瑚礁图像数据集,用于细粒度识别。通过专家验证和过滤,构建了高置信度基准子集,揭示了多模态模型在生物多样性监测中的挑战。
GazeQwen: 轻量级 gaze-条件 LLM 调制用于流视频理解
机构 * University of Arkansas(阿肯色大学) ; University of Houston(休斯顿大学)
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 GazeQwen 通过隐藏状态调制使开源 MLLM 获得 gaze 意识,采用紧凑的 gaze resampler 和可选 LoRA 调整,在 StreamGaze 基准上达到 63.9% 准确率,优于其他模型。
微小推理时间缩放与潜在验证器
机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) ; University of Pisa(比萨大学)
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 本文提出VHS验证器,直接在扩散变换器单步生成器的中间隐藏表示上操作,减少验证成本并提升性能,实现更高效的推理时间缩放。
Comments Findings of CVPR 2026 - Code at: https://aimagelab.github.io/VHS/
MCIE: 多模态大语言模型驱动的复杂指令图像编辑与空间引导
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 MCIE通过空间引导和背景一致性模块,提升复杂指令图像编辑的指令合规性,实现23.96%的性能提升。
Comments Accepted by AAAI2026
扩展到现实:3D环境中的提示注入
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 研究提出PI3D攻击,通过在3D环境中放置带文本的物理物体来注入提示,挑战多模态大语言模型的安全性。
多智能体机器人系统(MARS)挑战的进展与创新
机构 * SJTU(上海交通大学) ; Oxford(牛津大学) ; USTC(中国科学技术大学) ; Shanghai AI Lab(上海人工智能实验室) ; CMU(卡内基梅隆大学) ; HKU(香港大学) ; Tongji(同济大学) ; UC San Diego(南加州大学) ; CUHK-SZ(香港中文大学(深圳)) ; SYSU(华南理工大学) ; Harvard(哈佛大学)
专题命中 其他VLM :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 MARS挑战通过多智能体具身规划与控制任务,推动多智能体协作AI系统的发展。
Comments MARS Challenge @ NeurIPS 2025 Workshop on Space in Vision, Language, and Embodied AI. Challenge page: https://mars-eai.github.io/MARS-Challenge-Webpage/
NeuroABench: 一种多模态评估基准,用于神经外科解剖识别
机构 * Hong Kong Institute of Science and Innovation(香港科学与创新研究院) ; The University of Hong Kong-Shenzhen Hospital(香港大学深圳医院) ; Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系)
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 NeuroABench是首个用于评估神经外科领域解剖理解的多模态基准,通过实验揭示了MLLMs在解剖识别任务中的局限性,并展示了人类表现与模型之间的差距。
Comments Accepted by IEEE ICIA 2025
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Guangdong Provincial Key Laboratory of Novel Security Intelligence Technologies(广东省新型安全智能技术重点实验室)
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG
Comments EMNLP 2025 Main Conference
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG
Comments NeurIPS 2025; 27 pages, 6 figures
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI