arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5003 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5003 篇

2505.17726 2026-05-20 cs.CV cs.AI 91%

Slot-MLLM: Object-Centric Visual Tokenization for Multimodal LLM

Slot-MLLM: 多模态大语言模型中的面向对象视觉标记化

Donghwan Chi, Hyomin Kim, Yoonjin Oh, Yongjin Kim, Donghoon Lee, Daejin Jo, Jongmin Kim, Junyeob Baek, Sungjin Ahn, Sungwoong Kim

机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系) Kakao Corp(Kakao公司) School of Computing, KAIST(韩国科学技术院计算机学院)

专题命中 VLM训练与架构 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种面向对象的视觉标记化方法Slot-MLLM,通过基于Slot Attention的标记器,有效编码局部视觉细节并保持高层语义,从而提升多模态大语言模型在视觉内容理解和生成中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18150 2026-05-19 cs.LG cs.AI 91%

Improving MLLM Training Efficiency via Stage-Aware Sparsity

通过阶段感知稀疏性提升MLLM训练效率

Kean Shi, Liang Chen, Haozhe Zhao, Baobao Chang

机构 * Peking University(北京大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 VLM训练与架构 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于稀疏表示的高效训练框架STS,通过阶段感知设计适应不同训练阶段的冗余,采用视觉标记压缩器和层动态跳过器来减少计算开销,验证了其在多种MLLM架构上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01325 2026-05-05 cs.CV cs.LG 91%

Rethinking Model Selection in VLM Through the Lens of Gromov-Wasserstein Distance

通过格罗莫夫-瓦瑟斯坦距离重新思考VLM中的模型选择

Muyang Li, Yucheng Liu, Jianbo Ma, Elliot Osborne, Bo Han, Tongliang Liu

机构 * Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) Dolby Laboratories(杜比实验室) TMLR Group, Hong Kong Baptist University(香港 Baptist 大学 TMLR 团体)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文通过系统实验探讨视觉编码器选择的关键因素,发现模态间结构相似性通过格罗莫夫-瓦瑟斯坦距离衡量能提升VLM性能预测。

Comments Accepted as Highlight publication for CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01024 2026-05-05 cs.CV cs.AI 91%

EmoMM: Benchmarking and Steering MLLM for Multimodal Emotion Recognition under Conflict and Missingness

EmoMM:针对冲突和缺失性下的多模态情绪识别的MLLM基准测试与引导

Yueru Sun, Yimeng Zhang, Haoyu Gu, Nuo Chen, Dong She, Xianrong Yao, Yang Gao, Zhanpeng Jin

机构 * School of Future Technology, South China University of Technology(华南理工大学未来技术学院)

专题命中 VLM训练与架构 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出EmoMM基准,用于研究多模态情绪识别中模态冲突和缺失性下的MLLM决策机制,发现视频贡献崩溃现象,并提出CHASE机制减轻决策偏差,提升模型在复杂情感场景中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05067 2026-04-21 cs.CV cs.AI 91%

LLaVA-Octopus: Unlocking Instruction-Driven Adaptive Projector Fusion for Video Understanding

LLaVA-Octopus:解锁指令驱动的自适应投影器融合用于视频理解

Boyuan Sun, Jiaxing Zhao, Xiang Chen, Xihan Wei, Qibin Hou

机构 * VCIP, CS, Nankai University(南开大学计算机科学与技术学院) Tongyi Group, Alibaba(阿里巴巴通义集团)

专题命中 VLM训练与架构 :LLaVA(title,title_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 LLaVA-Octopus通过根据用户指令动态调整不同视觉投影器的特征权重,提升视频理解任务的性能,实验表明其在多个基准测试中表现优异。

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15628 2026-04-20 cs.CV cs.CL cs.IR cs.LG cs.MM 91%

SIMMER: Cross-Modal Food Image--Recipe Retrieval via MLLM-Based Embedding

SIMMER:通过基于MLLM的嵌入进行跨模态食物图像-食谱检索

Keisuke Gomi, Keiji Yanai

机构 * The University of Electro-Communications(电通大学)

专题命中 VLM训练与架构 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出SIMMER,利用基于MLLM的嵌入模型VLM2Vec,通过统一编码器处理食物图像和食谱文本,设计定制化提示模板和数据增强策略,实现跨模态检索的高精度。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02134 2026-08-04 cs.CV 新提交 91%

Messages, Not Tokens: Grounded Coresets for Faithful VLM Compression

消息而非令牌:用于忠实VLM压缩的基础核心集

Long Qian, Jiaqi Wei, Bingke Zhu, Yingying Chen, Jinqiao Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Wuhan AI Research(武汉人工智能研究院) Cardiff University(卡迪夫大学)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision language model(abstract);分类 cs.CV

AI总结 该研究针对VLM视觉令牌压缩的现有缺陷,提出无需训练的GMC方法,通过联合分配多维度证据支持并传输被丢弃状态,在大幅减少视觉令牌的同时保持VLM性能,经多基准实验验证有效。

Comments 32 pages, 6 figures, 18 tables, including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29367 2026-08-03 cs.CV 新提交 91%

SatEdit: Mask-Conditioned Image Editing via VLM-Guided Segment Annotation

SatEdit:基于VLM引导的区域标注的掩码条件卫星图像编辑

Muhammad Talha, Muhammad Ahmed Amer

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 SatEdit是基于VLM引导区域标注的卫星图像编辑框架,通过未标注图像构建监督信号,经LoRA微调后在对比中实现最高掩码区域语义对齐,为卫星图像编辑提供了数据高效的可行方案。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15592 2026-07-20 cs.AI 新提交 91%

MGDT: MLLM-Guided Diffusion Transformer with Relation-Adaptive Mixture-of-Experts for Multimodal Knowledge Graph Completion

MGDT:具有关系自适应专家混合的MLLM引导扩散变压器用于多模态知识图谱补全

Xu Hou, Meiyu Liang, Wei Huang, Yawen Li, Zhe Xue, Wu Liu, Guanhua Ye, Lei Shi, Kangkang Lu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) Communication University of China(中国传媒大学)

专题命中 VLM训练与架构 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 研究多模态知识图谱补全问题,提出MGDT框架,先通过RASR-MoE模块选路径、抑干扰,再用MLLM对齐表示,最后KGDT去噪生成,实验证明该框架在三个基准数据集上性能优于基线。

Comments 8pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04311 2026-07-08 cs.CV 新提交 91%

Aura: Consistent Multi-Subject Video Generation via VLM-Grounded Semantic Alignment

Aura:通过基于VLM的语义对齐实现一致的多主体视频生成

Zixiang Zhou, Zhentao Yu, Yifeng Ma, Hongmei Wang, Wenqing Yu, Cong Wang, Zilin Yang, Rui Chen, Jiarong Ou, Yezhou Liu, Yuan Zhou, Qinglin Lu

机构 * Tencent Hunyuan(腾讯混元)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出Aura框架用于高保真和身份一致的视频生成,引入AI导演级字幕、利用VLM提取多模态语义特征,设计对齐策略,采用多种机制减少伪影,在多主体视频生成上达先进性能。

Comments Project page: https://aura-project-page.github.io/ Code: https://github.com/Camellia997/Aura

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27161 2026-06-26 cs.AI 新提交 91%

TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference

TOPS:通过构建令牌最优保留集实现高效多模态大语言模型推理的第一性原理视觉令牌剪枝

Tinghao Wang, Yichen Guo, Rui Huang, Zheng Lu, Qizhe Zhang, Chenxi Li, Yuan Zhang, Jiajun Cao, Zhirong Shen, Yaosong Du, Guangyan Gan, Wenya Wang, Lin William Cong, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院)

专题命中 VLM训练与架构 :MLLM(title,abstract);LLaVA(summary_cn,abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 提出TOPS方法,基于信息论分析确立任务相关性、信息覆盖和语义多样性三大原则,无训练且模型无关地剪枝视觉令牌,在LLaVA-NeXT上剪除77.8%令牌仍保持甚至提升性能。

Comments 27 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22918 2026-06-23 cs.CV cs.GT 新提交 91%

Each Judge Its Own Yardstick: Discovering Per-VLM Taxonomies for Physical Video Evaluation

各有所尺:发现用于物理视频评估的每VLM分类体系

Yu Cao, Ziquan Liu, Zhensong Zhang, Jiankang Deng, Shaogang Gong, Jifei Song

机构 * Queen Mary University of London(伦敦玛丽女王大学) Huawei Darwin Research Center(华为达尔文研究中心) Imperial College London(伦敦帝国理工学院)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出JudgeFit方法,通过迭代优化为每个视觉语言模型发现其专属的物理视频评估分类体系,在16个VLM上平均相对提升约32%,并揭示模型特定盲点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21358 2026-06-23 cs.CV 新提交 91%

LEViL: Label-Efficient Video Learning via Zero-Shot Distillation over VLM-Generated Pseudo-Label Spaces

LEViL: 通过VLM生成的伪标签空间上的零样本蒸馏实现标签高效视频学习

Aslı Çelik

机构 * Kocaeli University(科贾埃利大学)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出一种无需标注的视频预训练与目标标签集感知微调结合的标签高效视频学习框架,利用VLM生成伪标签空间进行零样本蒸馏,在有限标签下优于半监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13312 2026-06-23 cs.MM cs.LG 版本更新 91%

Design-MLLM: A Reinforcement Alignment Framework for Verifiable and Aesthetic Interior Design

Design-MLLM:一种用于可验证且美观的室内设计的强化对齐框架

Yuxuan Yang, Xiaotong Mao, Jingyao Wang

机构 * National Jiangsu University of Finance(江苏财经大学) University of Lorraine(洛林大学) Institute of Electronics and Information Technology, Chinese Academy of Sciences(中国科学院电子信息技术研究所) Tsinghua University(清华大学)

专题命中 VLM训练与架构 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.LG

AI总结 提出Design-MLLM框架,通过双分支美学导向奖励的强化对齐,解决室内设计中空间可行性硬约束与美学偏好软约束的矛盾,生成既可行又美观的设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20795 2026-06-11 cs.CV 版本更新 91%

What Semantics Survive the Connector? Diagnosing VLM-to-DiT Alignment in Video Editing

什么语义能经受住连接器的考验?视频编辑中VLM到DiT对齐的诊断

Hangyu Lin, Chao Wen, Chengming Xu, Jianxiong Gao, Jiangning Zhang, Xiaobin Hu, Yanwei Fu

机构 * HKUST(香港理工大学) FDU(福建大学) ZJU(浙江大学) NUS(新加坡国立大学)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 本研究探讨了视频生成模型中VLM与DiT对齐过程中的语义瓶颈问题,通过提出TRACE-Edit数据集和诊断协议,发现连接器模块会导致细粒度结构语义的严重退化,挑战了原有假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05544 2026-06-05 cs.CL cs.LG 91%

Activation-Informed Pareto-Guided Low-Rank Compression for Efficient LLM/VLM

基于激活信息的帕累托引导低秩压缩用于高效LLM/VLM

Ryan Solgi, Parsa Madinei, Jiayi Tian, Rupak Swaminathan, Jing Liu, Nathan Susanj, Zheng Zhang

机构 * University of California-Santa Barbara(加州大学圣芭芭拉分校) Amazon(亚马逊)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract);分类 cs.LG

AI总结 本文提出了一种基于激活信息的帕累托引导低秩压缩方法,通过理论分析和算法设计,在保持模型精度的同时提升LLM和VLM的压缩效率和推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28995 2026-06-02 cs.CV 91%

GAP3D: Generative Alignment of VLM Latents to Patch-Level Embeddings for 3D Generation

GAP3D: 将VLM潜在表示与补丁级嵌入进行生成式对齐以实现3D生成

Polytimi Anna Gkotsi, Andrii Zadaianchuk, Mohammad Mahdi Derakhshani

机构 * Polytimi Anna Gkotsi Andrii Zadaianchuk Mohammad Mahdi Derakhshani

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出GAP3D,一种基于扩散的模块化方法,将VLM生成的潜在表示直接对齐到预训练图像编码器的完整补丁级特征空间,使冻结的下游生成模型能够利用VLM作为提示编码器,同时保持空间结构化的条件信号,在3D资产生成中无需大规模3D数据训练,并展现出多模态提示的零样本能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30257 2026-05-29 cs.CV 91%

Stable-Layers: Fine-Tuning Image Layer Decomposition Models with VLM-Scored Reinforcement Learning

Stable-Layers: 使用VLM评分强化学习微调图像层分解模型

Ciara Rowles, Reshinth Adithyan, Nikhil Pinnaparaju, Vikram Voleti, Mark Boss

机构 * Stability AI

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出Stable-Layers框架,通过强化学习(Flow-GRPO)和视觉语言模型(VLM)评分,无需配对监督即可微调预训练层分解模型,解决评分信号方差不足问题,提升层分离质量和重建精度。

Comments 25 pages, 8 figures, 4 tables. Project page: https://stability-ai.github.io/stable-layers.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27452 2026-05-28 cs.CV 91%

Fine-Tuning Vision-Language Models for Understanding Current Damage and Scoring Priority with Quality Guard Agent

微调视觉语言模型以理解当前损伤并使用质量卫士代理进行优先级评分

Takato Yasuno

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文通过微调LLaVA-1.5-7B视觉语言模型,结合规则引擎和质量卫士代理,实现了桥梁损伤自动理解与修复优先级评分,有效降低了评分变异并提升了效率。

Comments 23 pages, 11 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21692 2026-05-25 cs.AI 91%

TCAP: Tri-Component Attention Profiling for Unsupervised Backdoor Detection in MLLM Fine-Tuning

TCAP: 面向MLLM微调中无监督后门检测的三组件注意力分析

Mingzu Liu, Hao Fang, Runmin Cong

机构 * School of Control Science and Engineering, Shandong University, Jinan, China(控制科学与工程学院,山东大学,济南,中国) Key Laboratory of Industrial Intelligent Systems, Shandong Province, China(山东省工业智能系统重点实验室,中国)

专题命中 VLM训练与架构 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 针对微调即服务中的后门攻击,提出基于三组件注意力分布差异的无监督防御框架TCAP,通过高斯混合模型和EM投票聚合检测中毒样本。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19219 2026-05-20 cs.AI 91%

SimGym: A Framework for A/B Test Simulation in E-Commerce with Traffic-Grounded VLM Agents

SimGym:一种用于电子商务A/B测试模拟的框架,使用基于流量的VLM代理

Han Li, Vibhor Malik, Zahra Zanjani Foumani, Alberto Castelo, Shuang Xie, Ailin Fan, Keat Yang Koay, Yuanzheng Zhu, Meysam Feghhi, Ronie Uliana, Zhaoyu Zhang, Angelo Ocana Martins, Mingyu Zhao, Francis Pelland, Jonathan Faerman, Nikolas LeBlanc, Aaron Glazer, Andrew McNamara, Zhong Wu, Lingyun Wang

机构 * Shopify

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract);分类 cs.AI

AI总结 本文提出SimGym框架,通过基于流量的VLM代理模拟电子商务A/B测试,解决真实测试周期长、风险高等问题,验证结果显示其能快速准确预测用户行为变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05909 2026-05-08 cs.AI 91%

Null Space Constrained Contrastive Visual Forgetting for MLLM Unlearning

空域约束对比遗忘用于MLLM反学习

Yuhang Wang, Zhenxing Niu, Haoxuan Ji, Guangyu He, Linlin Zhang, Haichang Gao

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Xi’an Jiaotong University(西安交通大学)

专题命中 VLM训练与架构 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出一种MLLM反学习方法,通过冻结LLM主干并微调视觉模块,在保留非目标视觉知识和全部文本知识的同时,有效遗忘目标视觉知识。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17912 2024-07-19 cs.CL cs.AI cs.LG 91%

SERPENT-VLM : Self-Refining Radiology Report Generation Using Vision Language Models

Manav Nitin Kapadnis, Sohan Patnaik, Abhilash Nandy, Sourjyadip Ray, Pawan Goyal, Debdoot Sheet

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(title,abstract);LLaVA(abstract);MLLM(abstract)

Comments 8 pages, 3 figures, 4 tables, Accepted as oral at Clinical NLP workshop at NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00945 2026-08-12 cs.HC 版本更新 90%

Sighted by Default: Addressing Implicit Vision Assumptions in Real-Time VLM Assistance for BLV Users

默认以视觉为中心:解决面向盲人和低视力(BLV)用户的实时视觉语言模型(VLM)辅助中的隐含视觉假设问题

Yi Zhao, Siqi Wang, Qiqun Geng, Erxin Yu, Jing Li

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract)

AI总结 针对现有面向BLV用户的实时VLM辅助工具存在的以视觉为中心的默认偏见问题,提出VIA-Agent模型,其在保持与Doubao相当成功率的同时,缩短了任务时间并减少了对话轮次,提升了用户信任度。

Comments Accepted to UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05954 2026-08-07 cs.AI cs.CV cs.LG 新提交 90%

Training a Conditioned Video Game Agent on a VLM Annotated Dataset

基于VLM标注数据集训练条件化电子游戏智能体

Katrin Schmid, Iuri Frosio

专题命中 VLM训练与架构 :VLM(title,title_cn);vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 该研究针对电子游戏强化学习中奖励获取、加权及稀疏性等问题,提出用VLM标注数据集,结合离线RL训练条件化智能体,并分析实验中的困难与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26175 2026-06-26 cs.RO 新提交 90%

RMTL: Reinforced Micro-task Learning for Long-Horizon Manipulation with VLM Rewards

RMTL: 基于强化微任务学习与VLM奖励的长时域操作

Anıl Can Ateş, Orhan Kahraman, Cihan Topal

机构 * Istanbul Technical University(伊斯坦布尔理工大学)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract)

AI总结 针对长时域操作中单提示VLM奖励信号稀疏的问题,提出RMTL方法,将任务分解为语言描述的微任务,通过多视角VLM奖励和反向课程学习加速训练,并学习层次化策略切换微任务。

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16445 2026-04-16 cs.RO 90%

FiLM-Nav: Efficient and Generalizable Navigation via VLM Fine-tuning

FiLM-Nav:通过VLM微调实现高效且通用的导航

Naoki Yokoyama, Sehoon Ha

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract)

AI总结 本文提出FiLM-Nav,通过微调预训练VLM作为导航策略,直接利用视觉轨迹历史和导航目标进行探索决策,实现复杂环境中的高效导航与物体定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07487 2025-09-26 cs.CV 90%

LLaVA-RadZ: Can Multimodal Large Language Models Effectively Tackle Zero-shot Radiology Recognition?

Bangyan Li, Wenxuan Huang, Zhenkun Gao, Yeqiang Wang, Yunhang Shen, Jingzhong Lin, Ling You, Yuxiang Shen, Shaohui Lin, Wanli Ouyang, Yuling Sun

机构 * East China Normal University(华东师范大学) The Chinese University of Hong Kong(香港中文大学) Northwest A&F University(西北农林科技大学) Tencent Youtu Lab(腾讯优图实验室) Xiamen University(厦门大学)

专题命中 VLM训练与架构 :LLaVA(title,abstract);multimodal large language model(title,abstract);visual question answering(abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10440 2025-07-22 cs.CV 90%

LLaVA-CoT: Let Vision Language Models Reason Step-by-Step

Guowei Xu, Peng Jin, Ziang Wu, Hao Li, Yibing Song, Lichao Sun, Li Yuan

专题命中 VLM训练与架构 :LLaVA(title,abstract);vision language model(title);vision-language model(abstract);VLM(abstract)

Comments 17 pages, ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08282 2025-06-03 cs.CV 90%

LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding

Hongyu Li, Jinyu Chen, Ziyu Wei, Shaofei Huang, Tianrui Hui, Jialin Gao, Xiaoming Wei, Si Liu

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Meituan(美团)

专题命中 VLM训练与架构 :LLaVA(title,abstract);multimodal large language model(title,abstract);grounding(abstract);MLLM(abstract)

Comments Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏