arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1565 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1565 篇

2603.14989 2026-03-17 cs.CV 79%

MMSpec: Benchmarking Speculative Decoding for Vision-Language Models

MMSpec:用于视觉-语言模型的推测解码基准测试

Hui Shen, Xin Wang, Ping Zhang, Yunta Hsieh, Qi Han, Zhongwei Wan, Ziheng Zhang, Jingxuan Zhang, Jing Xiong, Ziyuan Liu, Yifan Zhang, Hangrui Cao, Chenyang Zhao, Mi Zhang

机构 * University of Michigan(密歇根大学) The Ohio State University(俄亥俄州立大学) Independent(独立) Indiana University(印第安纳大学) The University of Hong Kong(香港大学) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) LMSYS Org(LMSYS组织)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出MMSpec基准,评估视觉-语言模型中的推测解码方法,发现文本模型在多模态场景下表现下降,视觉意识在大批次中更关键,且吞吐量提升不等于延迟降低,提出ViSkip方法实现最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12998 2026-03-16 cs.CV 79%

A Closed-Form Solution for Debiasing Vision-Language Models with Utility Guarantees Across Modalities and Tasks

为跨模态和任务提供具有实用保障的视觉-语言模型去偏方法

Tangzheng Lian, Guanyu Hu, Yijing Ren, Dimitrios Kollias, Oya Celiktutan

机构 * King’s College London(伦敦国王学院) Queen Mary University of London(伦敦女王学院)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出一种无需标注数据的训练自由去偏方法,在跨模态空间中获得帕累托最优公平性,同时保持有限的实用性损失,实验显示其在多种公平度量和任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16722 2026-03-11 cs.CV 79%

Active Prompt Learning with Vision-Language Model Priors

基于视觉-语言模型先验的主动提示学习

Hoyoung Kim, Seokhee Jin, Changhwan Sung, Jaechang Kim, Jungseul Ok

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于视觉-语言模型先验的主动提示学习框架,通过类引导聚类和自适应阈值筛选,提升主动学习效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04800 2026-03-06 cs.CV 79%

MASQuant: Modality-Aware Smoothing Quantization for Multimodal Large Language Models

MASQuant: 多模态大语言模型的模态感知平滑量化

Lulu Hu, Wenhu Xiao, Xin Chen, Xinhua Xu, Bowen Xu, Kun Li, Yongliang Tao

机构 * Alibaba Cloud Computing, Alibaba Group(阿里巴巴云 computing,阿里巴巴集团)

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV

AI总结 MASQuant通过模态感知平滑和跨模态补偿技术,解决多模态大语言模型的量化问题,实现稳定且高效的量化性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02959 2026-03-04 cs.CV 79%

Semi-Supervised Few-Shot Adaptation of Vision-Language Models

视觉-语言模型的半监督少样本适应

Julio Silva-Rodríguez, Ender Konukoglu

机构 * Computer Vision Lab, ETH Zurich, Zurich, Switzerland(苏黎世联邦理工学院计算机视觉实验室)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出一种半监督方法,通过传播文本引导的伪标签来提升视觉-语言模型在极低样本情况下的适应性能,减少标注工作量超过50%。

Comments Code: https://github.com/jusiro/SS-Text-U

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19496 2026-03-03 cs.CR cs.AI 79%

Multi-PA: A Multi-perspective Benchmark on Privacy Assessment for Large Vision-Language Models

多视角:面向大视觉-语言模型隐私评估的基准测试

Jie Zhang, Xiangkui Cao, Zhouyu Han, Shiguang Shan, Xilin Chen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.AI

AI总结 Multi-PA是一个多视角的隐私评估基准,用于评估大视觉-语言模型在隐私意识和泄露方面的保护能力,揭示了当前模型在隐私保护方面的风险和漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23980 2026-03-02 cs.CV 79%

Venus: Benchmarking and Empowering Multimodal Large Language Models for Aesthetic Guidance and Cropping

Venus: 多模态大语言模型在审美指导与裁剪中的基准测试与赋能

Tianxiang Du, Hulingxiao He, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究所)

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV

AI总结 Venus通过两阶段框架提升多模态大语言模型的审美指导与裁剪能力,实现可解释的审美优化。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24597 2026-02-27 cs.CL cs.LG 79%

Inducing Dyslexia in Vision Language Models

在视觉语言模型中诱发失读症

Melika Honarmand, Ayati Sharma, Badr AlKhamissi, Johannes Mehrer, Martin Schrimpf

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院(EPFL))

专题命中 其他VLM :vision language model(title);vision-language model(abstract);分类 cs.LG

AI总结 本研究通过视觉语言模型模拟失读症,揭示了视觉词形处理与阅读障碍的关系,并建立了研究脑部疾病的计算框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06619 2026-02-09 cs.CV 79%

CauCLIP: Bridging the Sim-to-Real Gap in Surgical Video Understanding via Causality-Inspired Vision-Language Modeling

CauCLIP:通过因果启发的视觉-语言模型弥合手术视频理解的仿真到现实差距

Yuxin He, An Li, Cheng Xue

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 CauCLIP通过因果启发的视觉-语言模型,在不访问目标领域数据的情况下,提升手术视频理解的领域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21610 2026-02-05 cs.CV 79%

WMVLM: Evaluating Diffusion Model Image Watermarking via Vision-Language Models

WMVLM:通过视觉-语言模型评估扩散模型图像水印

Zijin Yang, Yu Sun, Kejiang Chen, Jiawei Zhao, Jun Jiang, Weiming Zhang, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室) National University of Singapore(新加坡国立大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 WMVLM通过视觉-语言模型提出首个统一且可解释的扩散模型图像水印评估框架,重新定义了残差和语义水印的评估指标,并通过三阶段训练策略提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12340 2026-02-05 cs.CV cs.CR 79%

Image Corruption-Inspired Membership Inference Attacks against Large Vision-Language Models

基于图像退化启发的对抗大视觉-语言模型的成员推断攻击

Zongyu Wu, Minhua Lin, Zhiwei Zhang, Fali Wang, Xianren Zhang, Xiang Zhang, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出基于图像退化启发的成员推断攻击方法,用于检测目标图像是否被用于训练大视觉-语言模型,通过图像退化和文本嵌入相似性进行攻击。

Comments Accepted by EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00068 2026-02-03 cs.CV 79%

Towards Artwork Explanation in Large-scale Vision Language Models

迈向大规模视觉语言模型中的艺术作品解释

Kazuki Hayashi, Yusuke Sakai, Hidetaka Kamigaito, Katsuhiko Hayashi, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技术大学) The University of Tokyo(东京大学)

专题命中 其他VLM :vision language model(title);vision-language model(abstract);分类 cs.CV

AI总结 本文提出艺术作品解释生成任务,评估大规模视觉语言模型在整合语言和视觉信息以及从图像中获取知识的能力。

Comments Accepted to ACL 2024 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21794 2026-01-30 cs.LG 79%

Knowledge Vector Weakening: Efficient Training-free Unlearning for Large Vision-Language Models

知识向量削弱:高效无训练卸载方法用于大视觉-语言模型

Yejin Kim, Dongjun Hwang, Sungmin Cha, Junsuk Choe

机构 * Sogang University(ソガン大学) New York University(纽约大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.LG

AI总结 KVW提出了一种无需训练的高效卸载方法,通过削弱模型中被激活的知识向量,有效防止模型利用有害知识,提升计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03803 2026-01-30 cs.CV 79%

Causality-guided Prompt Learning for Vision-language Models via Visual Granulation

基于视觉粒化的因果引导提示学习用于视觉语言模型

Mengyu Gao, Qiulei Dong

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出CaPL方法,通过视觉粒化和因果推理提升细粒度识别性能,实验表明其在细粒度数据集上表现优异。

Comments Updated version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18346 2026-01-27 cs.CV 79%

Q-Bench-Portrait: Benchmarking Multimodal Large Language Models on Portrait Image Quality Perception

Q-Bench-Portrait:多模态大语言模型在肖像图像质量感知上的基准测试

Sijing Wu, Yunhao Li, Zicheng Zhang, Qi Jia, Xinyue Li, Huiyu Duan, Xiongkuo Min, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV

AI总结 Q-Bench-Portrait首次提出用于评估多模态大语言模型在肖像图像质量感知上的能力,包含2765个三元组,涵盖多种图像来源和质量维度,评估20个模型后发现其表现有限,与人类判断存在差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15406 2026-01-23 cs.CV 79%

Evaluating Multimodal Large Language Models for Heterogeneous Face Recognition

评估多模态大语言模型用于异构人脸识别

Hatef Otroshi Shahreza, Anjith George, Sébastien Marcel

机构 * Idiap Research Institute(日内瓦研究所)

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV

AI总结 本文评估了多模态大语言模型在异构人脸识别中的性能,发现其在跨模态条件下表现欠佳,凸显了当前模型的局限性及生物识别评估的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08871 2026-01-15 cs.SD cs.AI eess.AS 79%

Semantic visually-guided acoustic highlighting with large vision-language models

语义视觉引导的音频突出与大型视觉-语言模型

Junhua Huang, Chao Huang, Chenliang Xu

机构 * University of Rochester(罗切斯特大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.AI

AI总结 本文提出利用大型视觉-语言模型提取视觉-语义特征,以提升音频混音质量,发现摄像机焦点、语气和场景背景对感知混音质量提升最显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06843 2026-01-13 cs.CV cs.CL 79%

Speak While Watching: Unleashing TRUE Real-Time Video Understanding Capability of Multimodal Large Language Models

边看边说:解锁多模态大语言模型的实时视频理解能力

Junyan Lin, Junlong Tong, Hao Wu, Jialiang Zhang, Jinming Liu, Xin Jin, Xiaoyu Shen

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Institute of Digital Twin, EIT(宁波空间智能与数字衍生关键实验室,数字孪生研究院,EIT) Shanghai Jiao Tong University(上海交通大学) Ocean University of China(中国海洋大学)

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV

AI总结 本文提出并行流式框架,通过三种设计解决多模态大语言模型在实时视频理解中的位置连续性约束问题,实现边看边说的实时交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06372 2026-01-06 cs.SD cs.AI 79%

SpeakerLM: End-to-End Versatile Speaker Diarization and Recognition with Multimodal Large Language Models

SpeakerLM:基于多模态大语言模型的端到端多功能说话人辨识与识别

Han Yin, Yafeng Chen, Chong Deng, Luyao Cheng, Hui Wang, Chao-Hong Tan, Qian Chen, Wen Wang, Xiangang Li

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.AI

AI总结 SpeakerLM通过多模态大语言模型实现端到端的说话人辨识与识别,结合灵活的说话人注册机制,提升多说话人场景下的识别性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23070 2025-12-23 cs.CV 79%

Vocabulary-free Fine-grained Visual Recognition via Enriched Contextually Grounded Vision-Language Model

无需词汇的细粒度视觉识别 via 增强的上下文感知视觉语言模型

Dmitry Demidov, Zaigham Zaheer, Omkar Thawakar, Salman Khan, Fahad Shahbaz Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出E-FineR方法,无需词汇实现细粒度视觉识别,提供高可解释性和在零样本和少样本分类中的高性能。

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12268 2025-12-16 cs.CV 79%

MetaTPT: Meta Test-time Prompt Tuning for Vision-Language Models

MetaTPT: 用于视觉-语言模型的元测试时间提示微调

Yuqing Lei, Yingjun Du, Yawen Huang, Xiantong Zhen, Ling Shao

机构 * UCAS-Terminus AI Lab, University of Chinese Academic of Sciences(中国科学院大学Terminus AI实验室,中国科学院大学) AIM Lab, University of Amsterdam(阿姆斯特丹大学AIM实验室) Jarvis Research Center, Tencent Youtu Lab(腾讯优图实验室 Jarvis 研究中心) Central Research Institue, United Imaging Healthcare Co., Ltd(联合影像医疗科技有限公司中央研究所)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 MetaTPT通过元学习框架结合自监督任务和提示微调,提升视觉-语言模型在领域偏移下的测试时间适应性,实现领域泛化和跨数据集的高性能表现。

Comments NeurIPS 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15871 2025-12-16 cs.CV 79%

Visual symbolic mechanisms: Emergent symbol processing in vision language models

视觉符号机制:视觉语言模型中的涌现符号处理

Rim Assouel, Declan Campbell, Yoshua Bengio, Taylor Webb

专题命中 其他VLM :vision language model(title,abstract);分类 cs.CV

AI总结 研究揭示了视觉语言模型中通过内容无关空间索引实现的新兴符号机制,用于解决视觉绑定问题并减少模型错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10867 2025-12-15 cs.CV 79%

From Macro to Micro: Benchmarking Microscopic Spatial Intelligence on Molecules via Vision-Language Models

从宏观到微观:通过视觉-语言模型在分子上基准测试微观空间智能

Zongzhao Li, Xiangzhe Kong, Jiahui Su, Zongyang Ma, Mingze Li, Songyou Li, Yuelin Zhang, Yu Rong, Tingyang Xu, Deli Zhao, Wenbing Huang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程研究中心) Dept. of Comp. Sci. & Tech., Tsinghua University(清华大学计算机科学与技术系) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) SKL-ESPC & SEPKL-AERM, College of Environmental Sciences and Engineering, Peking University(环境科学与工程学院,北京大学) MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) DAMO Academy, Alibaba Group, Hangzhou, China(阿里巴巴集团 DAMO Academy,中国杭州) Hupan Lab, Hangzhou, China(杭州实验室)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出MiSI-Bench基准测试框架,评估视觉-语言模型在分子微观空间智能任务中的表现,发现微调模型在空间转换任务上超越人类,但需整合领域知识以推动科学AGI发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00725 2025-12-02 cs.LG 79%

ESMC: MLLM-Based Embedding Selection for Explainable Multiple Clustering

ESMC: 基于多模态大语言模型的可解释多聚类嵌入选择

Xinyue Wang, Yuheng Jia, Hui Liu, Junhui Hou

专题命中 其他VLM :MLLM(title,abstract);分类 cs.LG

AI总结 ESMC利用多模态大语言模型实现用户驱动的可解释多聚类,通过嵌入选择和伪标签学习提升聚类准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03657 2025-12-02 cs.CV 79%

Dynamic Multimodal Prototype Learning in Vision-Language Models

视觉-语言模型中的动态多模态原型学习

Xingyu Zhu, Shuo Wang, Beier Zhu, Miaoge Li, Yunfan Li, Junfeng Fang, Zhicai Wang, Dongsheng Wang, Hanwang Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学) The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学) National University of Singapore(新加坡国立大学) Shenzhen University(深圳大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出ProtoMM框架,通过动态更新视觉粒子和多模态原型学习,提升视觉-语言模型在测试时的适应性能。

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22943 2025-12-01 cs.CL cs.CV 79%

Visual Puns from Idioms: An Iterative LLM-T2IM-MLLM Framework

基于成语的视觉双关:一个迭代的LLM-T2IM-MLLM框架

Kelaiti Xiao, Liang Yang, Dongyu Zhang, Paerhati Tulajiang, Hongfei Lin

机构 * Dalian University of Technology(大连理工大学) Xinjiang Normal University(新疆师范大学)

专题命中 其他VLM :MLLM(title,abstract);分类 cs.CV

AI总结 本文提出一个迭代框架,结合LLM、T2IM和MLLM,实现基于成语的视觉双关的自动生成与评估,实验表明MLLM选择对性能影响最大。

Comments Submitted to ICASSP 2026 (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10624 2025-12-01 cs.CV 79%

Configurable Fairness: Direct Optimization of Parity Metrics via Vision-Language Models

可配置公平性:通过视觉-语言模型直接优化平衡度指标

Miao Zhang, Rumi Chunara

机构 * New York University(纽约大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出通过视觉-语言模型直接优化平衡度量指标的方法,无需群体标签,提升图像识别的公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17727 2025-11-25 cs.CV 79%

The Potential and Limitations of Vision-Language Models for Human Motion Understanding: A Case Study in Data-Driven Stroke Rehabilitation

视觉-语言模型在人类运动理解中的潜力与局限性:数据驱动中风康复的案例研究

Victor Li, Naveenraj Kamalakannan, Avinash Parnandi, Heidi Schambra, Carlos Fernandez-Granda

机构 * Center for Data Science(数据科学中心) Tandon School of Engineering(工程学院) VitalConnect(VitalConnect公司) Department of Neurology(神经病学部) Department of Rehabilitation Medicine(康复医学部) Courant Institute of Mathematical Sciences(数学科学研究所)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 本文研究了视觉-语言模型在数据驱动中风康复中的应用,发现其在运动识别和剂量估计方面存在局限性,但通过优化提示和后处理可实现中等准确性的活动分类和运动检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17425 2025-11-21 cs.AI 79%

Evaluating Multimodal Large Language Models with Daily Composite Tasks in Home Environments

在家庭环境中评估多模态大语言模型的日常复合任务

Zhenliang Zhang, Yuxi Wang, Hongzhao Xie, Shiyun Zhao, Mingyuan Liu, Yujie Lu, Xinyi He, Zhenku Cheng, Yujia Peng

机构 * State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence(通用人工智能国家重点实验室、北京通用人工智能研究院) School of Psychological and Cognitive Sciences and Beijing Key Laboratory of Behavior and Mental Health, Key Laboratory of Machine Perception (Ministry of Education), Peking University(心理与认知科学学院及北京行为与心理健康重点实验室、机器感知重点实验室(教育部)) School of Intelligence Science and Technology, Peking University(智能科学与技术学院)

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.AI

AI总结 本研究在家庭环境中评估了多模态大语言模型在日常复合任务中的表现,发现其在物体理解、空间智能和社会活动领域存在显著差距,为具身MLLMs的发展提供了初步评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13476 2025-11-18 cs.AI 79%

Multi-Agent Multimodal Large Language Model Framework for Automated Interpretation of Fuel Efficiency Analytics in Public Transportation

Zhipeng Ma, Ali Rida Bahja, Andreas Burgdorf, André Pomp, Tobias Meisen, Bo Nørregaard Jørgensen, Zheng Grace Ma

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.AI

Journal ref Applied Sciences, 2025, 15(21), 11619

详情

展开后加载摘要…

URL PDF HTML 收藏