IAA: Inner-Adaptor Architecture Empowers Frozen Large Language Model with Multimodal Capabilities
专题命中 VLM训练与架构 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG
Comments AAAI 2025
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG
Comments AAAI 2025
专题命中 VLM训练与架构 :vision language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.AI
Comments Accepted by CVPR 2025
专题命中 VLM训练与架构 :visual language model(abstract);LLaVA(abstract);InternVL(abstract);分类 cs.CV、cs.AI
专题命中 VLM训练与架构 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments Accepted by ICLR2025
专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments 9 pages, 6 figures
专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments 27 pages, NeurIPS 2024
Journal ref NeurIPS 2024
专题命中 VLM训练与架构 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG
专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments Accepted at ACL 2024 (Main, Short)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);visual language model(abstract);分类 cs.CV、cs.AI
Comments Accepted by the Montreal AI Symposium conference in 2022
MammoWise:多模型本地RAG流水线用于乳腺X线摄影报告生成
机构 * University of California, Davis(加州大学戴维斯分校)
专题命中 VLM训练与架构 :LLaVA(abstract,comments);vision language model(abstract);VLM(abstract);分类 cs.CV
AI总结 MammoWise是一种本地多模型流水线,通过多任务分类和检索增强生成技术,实现乳腺X线摄影报告的高准确度生成与分类。
Comments arXiv preprint (submitted 25 Feb 2026). Local multi-model pipeline for mammography report generation + classification using prompting, multimodal RAG (ChromaDB), and QLoRA fine-tuning; evaluates MedGemma, LLaVA-Med, Qwen2.5-VL on VinDr-Mammo and DMID; reports BERTScore/ROUGE-L and classification metrics
超越令牌:大型语言与视觉-语言模型的解码方法综述
机构 * Emory University(埃默里大学) ; Illinois Institute of Technology(伊利诺伊理工大学) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校)
专题命中 VLM训练与架构 :vision-language model(title,abstract)
AI总结 该综述针对LLMs与LVLMs,梳理其解码方法的三种新兴范式,强调解码方法在确保模型输出与用户意图一致上的高效性,同时指出挑战并展望未来方向。
Comments ACM SIGKDD Explorations Newsletter, Volume 28, Issue 1
从语义到读出:时间音频接地微调后音频令牌的机制理解
专题命中 VLM训练与架构 :grounding(title,abstract)
AI总结 研究大型音频语言模型中音频令牌在微调后的机制,通过四种分析研究其分层语义等,发现微调前已有潜在证据,微调后解码器更易访问事件信息,支持从语义到读出的解释,有助于解码器连接时间输出。
BUSTR:用于乳腺超声报告生成的描述符感知视觉语言学习
机构 * University of Nevada, Las Vegas(内华达大学拉斯维加斯分校)
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI、cs.LG
AI总结 针对公共BUS数据集缺乏配对报告限制模型发展的问题,提出BUSTR框架,利用结构化病变信息,通过构建描述符派生报告、训练多头编码器及双重目标指导训练,提升了乳腺超声报告生成的相似性和描述符恢复能力。
Comments 17 pages, 2 figures, 8 tables
MedLayBench-V:面向医学视觉语言模型中专家与普通人语义对齐的大规模基准
机构 * Seoul National University(首尔国立大学) ; Seoul National University College of Medicine(首尔国立大学医学院) ; Department of Radiology, Seoul National University Hospital(首尔国立大学医院放射科) ; Healthcare AI Research Institute, Seoul National University Hospital(首尔国立大学医院健康人工智能研究所) ; The Advanced Imaging and Computational Neuroimaging (AICON) Laboratory(先进影像与计算神经影像实验室)
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract)
AI总结 提出首个大规模多模态基准MedLayBench-V,通过结构化概念基础精炼管道实现专家-普通人语义对齐,用于训练和评估能弥合医患沟通鸿沟的医学视觉语言模型。
Comments Findings of ACL 2026. 9 pages, 5 figures, 11 tables, plus appendix
Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 18375-18394
多语言视觉-语言模型:综述
机构 * Faculty of Mathematics and Physics, Charles University, V Holešovičkách 747/2, Prague, Czech Republic(数学与物理系,查尔斯大学,V Holešovičkách 747/2,布拉格,捷克共和国)
专题命中 VLM训练与架构 :vision-language model(title,abstract)
AI总结 本文综述了处理多语言文本和图像的视觉-语言模型,分析了语言中立性与文化意识之间的矛盾,指出对比学习在训练中的主导地位及文化适应性的数据依赖性。
VEGA:面向空间感知的视觉编码器对齐用于视觉-语言-动作模型
机构 * Peking University(北京大学) ; Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)
专题命中 VLM训练与架构 :grounding(title,abstract)
AI总结 VEGA通过直接对齐视觉编码器输出与空间感知特征,提升视觉-语言-动作模型的空间意识,实现更可解释的对齐目标。
大型视觉语言模型的结构剪枝:对剪枝动态、恢复和数据效率的全面研究
机构 * Technical University of Munich, Germany(慕尼黑技术大学,德国) ; Munich Center for Machine Learning, Germany(慕尼黑机器学习中心,德国) ; Helmholtz Munich, Germany(海德堡-慕尼黑赫尔姆霍尔茨研究中心,德国) ; University of Tübingen, Tübingen AI Center, Germany(图宾根大学,图宾根人工智能中心,德国) ; University of Trento, Italy(特伦托大学,意大利) ; Beijing University of Posts and Telecommunications, China(北京邮电大学,中国)
专题命中 VLM训练与架构 :vision language model(title,abstract)
AI总结 本文研究了通过结构化剪枝压缩现有大型视觉语言模型的方法,发现宽度剪枝在低资源环境下表现更优,结合监督微调和隐藏状态蒸馏可实现高效恢复,仅需5%的数据即可保持95%性能。
Comments Accepted at International Journal of Computer Vision (IJCV) 2026
大型视觉语言模型的结构和解耦适应用于多模态推荐
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract)
AI总结 本文提出SDA框架,通过跨模态结构对齐和模态解耦适应,解决多模态推荐中表示不一致和梯度冲突问题,实验显示在三个Amazon数据集上提升了推荐性能。
Comments Accepted to SIGIR '26
MNAFT:多模态大语言模型的模态神经感知微调用于图像翻译
机构 * School of Computer Science and Technology, Tianjin University, Tianjin, China(天津大学计算机科学与技术学院) ; School of Software, Tsinghua University, Beijing, China(清华大学软件学院) ; School of Information Resource Management, Renmin University of China,Beijing, China(中国人民大学信息资源管理学院) ; School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院) ; Baidu Inc., Beijing, China(百度公司)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract)
AI总结 本文提出MNAFT,通过识别视觉和语言模块中语言无关和语言特定的神经元,改进多模态大语言模型在图像翻译中的表现,实验表明其优于现有方法。
Comments Accepted by SCIS (SCIENCE CHINA Information Science)
大型视觉-语言模型高效推理:瓶颈、技术与前景
机构 * The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) ; Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高科技区(滨江)区块链与数据安全研究院)
专题命中 VLM训练与架构 :vision-language model(title,abstract)
AI总结 本文系统分析了大型视觉-语言模型推理中的效率瓶颈,提出基于推理生命周期的分类技术,探讨了信息密度、长上下文注意力管理和内存限制的平衡,并展望了未来四个前沿方向。
Comments Accepted to ACL 2026 Findings
通过显式语言-动作对齐实现层次化视觉-语言-动作模型的 grounding
机构 * The University of Manchester(曼彻斯特大学)
专题命中 VLM训练与架构 :grounding(title,abstract)
AI总结 本文提出通过显式语言-动作对齐训练框架,提升视觉-语言-动作模型的 grounding 能力,基于 LanguageTable 数据集验证了多模态 grounding 表示的有效性,并建立强基线性能。
基于多模态大语言模型的波束预测
专题命中 VLM训练与架构 :multimodal large language model(title,abstract)
AI总结 本文提出基于多模态大语言模型的波束预测框架,通过融合RGB图像和LiDAR点云等异构数据,提升动态环境下波束预测精度与通信性能,实验表明其在波束准确性和通信性能上优于现有方法。
熵与信道感知的自适应速率语义通信 with MLLM辅助特征补偿
专题命中 VLM训练与架构 :MLLM(title);multimodal large language model(abstract)
AI总结 本文提出一种基于熵与信道感知的自适应速率语义通信框架,利用MLLM辅助特征补偿提升通信效率。
HOICraft:基于VLM的现场手-物体交互设计VR部分级作者工具
专题命中 VLM训练与架构 :VLM(title,abstract)
AI总结 HOICraft是一种基于VLM的VR手-物体交互设计工具,通过推荐可交互元素、自定义属性和映射手部运动,提升VR中HOI设计效率。
Comments 25 pages, 15 figures, Presented at ACM CHI 2026
grounded concreteness: 人类-like 的 concreteness 敏感性在 vision-language 模型中
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 VLM训练与架构 :vision-language model(title);grounding(abstract)
AI总结 本文研究了视觉语言模型在纯文本提示下对concreteness的敏感性,并发现其在更具体的输入上表现更优,具有更清晰的表示和更符合人类规范的判断。
DistTrain: 通过解耦训练解决多模态大语言模型中的模型与数据异质性
专题命中 VLM训练与架构 :multimodal large language model(title,abstract)
AI总结 DistTrain通过解耦模型编排和数据预处理,提升多模态大语言模型的训练效率和资源利用率。
Comments SIGCOMM 2025 (https://dl.acm.org/doi/10.1145/3718958.3750472)
Journal ref SIGCOMM'25: Proceedings of the ACM SIGCOMM 2025 Conference Pages 24-38
专题命中 VLM训练与架构 :multimodal large language model(title,abstract)
Comments 12 pages, 5 figures
专题命中 VLM训练与架构 :multimodal large language model(title,abstract)
专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract)