Cross-Modal Adapter: Parameter-Efficient Transfer Learning Approach for Vision-Language Models
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG
Comments This paper is accepted to ICME 2024
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG
Comments This paper is accepted to ICME 2024
专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);分类 cs.CV、cs.LG
Comments CVPR 2024. The feedback datasets are released at: https://huggingface.co/datasets/YangyiYY/LVLM_NLF
专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV、cs.AI
Comments Preprint
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI
Comments In Peer Review
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI
Comments Accepted by NeurIPS 2023. The manuscript will be further revised based on the reviews
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG
Comments preprint
专题命中 VLM训练与架构 :vision language model(title,abstract);分类 cs.CV、cs.AI
Comments Accepted to ACL 2023 Main Conference
专题命中 VLM训练与架构 :vision language model(title);visual language model(abstract);分类 cs.CV、cs.LG
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI
专题命中 VLM训练与架构 :grounding(title,abstract);分类 cs.CV、cs.LG
Comments Accepted at ICDM 2022 FOMO-VL workshop
Journal ref 2022 IEEE International Conference on Data Mining Workshops (ICDMW), Orlando, FL, USA, 2022, pp. 958-966
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI
Journal ref 2021 International Conference on Natural Language Processing
用于从视频理解复杂装配动作的组合上下文微调视觉语言模型
机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) ; The University of Auckland(奥克兰大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV;vision language model(comments)
AI总结 针对装配动作理解难题,提出组合上下文微调方法及层划分交替训练方法,将动作分解为语义元素并微调视觉语言模型,创建相关数据集,实验证明该方法优于基线且能提供可解释预测,助力人机协作装配。
Comments Accepted by ICRA 2026. Video Understanding; Vision Language Model; Multi-modal LLM; Action Recognition; Assembly
机构 * School of Computer Science, The University of Manchester, Manchester, UK(曼彻斯特大学计算机科学学院)
专题命中 VLM训练与架构 :vision language model(title);VLM(abstract,comments);分类 cs.CV
Comments VLM/LLM Learning Notes
机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) ; BUPT(北京邮电大学) ; ByteDance(字节跳动)
专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV
Comments Project page: https://llava-vl.github.io/blog/2024-09-30-llava-video/; Accepted at TMLR
机构 * The University of Hong Kong(香港大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV
Comments Project page: https://zcmax.github.io/projects/LLaVA-3D/
专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV
Comments Accepted by CVPR 2025; Project Page: https://llava-vl.github.io/blog/2024-10-03-llava-critic
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV;VLM(comments)
Comments Project page: https://cece-vlm.github.io/
专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.CV
Comments NeurIPS-2024. Project page: https://lxtgh.github.io/project/omg_llava/
专题命中 VLM训练与架构 :LLaVA(title,abstract);分类 cs.AI
Comments CVPR 2024, MMFM workshop. Authors 1 and 2 contributed equally. Models available at https://huggingface.co/intel/llava-gemma-2b/ and https://huggingface.co/intel/llava-gemma-7b/ Training code at https://github.com/IntelLabs/multimodal_cognitive_ai/tree/main/LLaVA-Gemma
用于视频游戏数据标注的视觉语言模型(VLMs)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 该研究针对VLMs在视频游戏应用受限的问题,探究其用于游戏帧序列奖励信号标注的可行性,分析其在游戏问答中的不足并提出应对措施,还研究了输入参数对标注质量的影响。
RoboProcessBench:视觉语言机器人操作中的过程感知理解基准测试
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Zhejiang University(浙江大学) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学) ; China University of Mining Technology(中国矿业大学)
专题命中 VLM训练与架构 :InternVL(abstract,abstract_cn);vision-language model(abstract);VLM(abstract_cn)
AI总结 提出RoboProcessBench基准,通过静态监控和动态推理两个维度、12个诊断问题家族,评估视觉语言模型在机器人操作中的过程感知理解能力,并基于58k问答对数据集验证了当前模型的局限性及后训练的有效性。
面向电商图像生成的元素感知组学习
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 针对电商图像生成中GRPO仅在完整提示层面分配信用的缺陷,提出EAGLE-GRPO,通过分解奖励并推导闭式解实现元素级信用分配,提升提示质量与生成图像性能。
MOON2.0:动态模态平衡多模态表示学习用于电商产品理解
机构 * Alibaba Group(阿里巴巴集团)
专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 MOON2.0通过动态模态平衡框架解决电商多模态数据中的模态不平衡、信息对齐不足和噪声处理问题,提出MoE、双层对齐和图像-文本共增强策略,提升零样本性能和多模态对齐质量。
Comments Accepted by the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2026. 11 pages, 7 figures
FOCAL:过滤的本地连续活动日志用于高效的个人桌面摘要
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);visual reasoning(abstract)
AI总结 FOCAL通过多代理系统实现高效的本地桌面流摘要,减少资源消耗并提升任务召回率。
用于少样本工业视觉的小视觉语言模型的答案条件思维链蒸馏
机构 * Entropy AI Research Labs Private Limited(熵人工智能研究实验室私人有限公司)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 针对制造业视觉检测难题,提出答案条件思维链蒸馏法,利用最少标注数据让小型视觉语言模型适应新工业任务,经实验验证该方法在多任务中优于直接微调,提升了推理质量和模型性能。
Comments 11 pages, 5 figures, 8 tables
用于PET引导的全身MRI转换的异质性自适应扩散薛定谔桥
机构 * The University of Sydney(悉尼大学) ; Fudan University Shanghai Cancer Center(复旦大学附属上海肿瘤医院) ; Beijing Normal University(北京师范大学)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 针对PET-MR扫描时间长的问题,提出异质性自适应扩散薛定谔桥(HA-DSB)框架,通过整合视觉语言模型嵌入及PET先验,利用双阶段引导机制,实现全身MRI转换,提升不同区域尤其是病变区域的转换质量。
Comments Accepted at MICCAI 2026