arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1562 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1562 篇

2503.05899 2025-03-11 cs.HC cs.AI 83%

Towards Understanding the Use of MLLM-Enabled Applications for Visual Interpretation by Blind and Low Vision People

Ricardo E. Gonzalez Penuela, Ruiying Hu, Sharon Lin, Tanisha Shende, Shiri Azenkot

专题命中 其他VLM :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI

Comments 8 pages, 1 figure, 4 tables, to appear at CHI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13904 2025-02-14 cs.LG 83%

Privacy-Preserving Personalized Federated Prompt Learning for Multimodal Large Language Models

Linh Tran, Wei Sun, Stacy Patterson, Ana Milanova

专题命中 其他VLM :multimodal large language model(title,abstract);vision-language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05081 2025-01-10 cs.LG 83%

DriVLM: Domain Adaptation of Vision-Language Models in Autonomous Driving

Xuran Zheng, Chang D. Yoo

专题命中 其他VLM :vision-language model(title);multimodal large language model(abstract);MLLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00330 2025-01-03 cs.CL cs.AI cs.IR 83%

Exploring the Implicit Semantic Ability of Multimodal Large Language Models: A Pilot Study on Entity Set Expansion

Hebin Wang, Yangning Li, Yinghui Li, Hai-Tao Zheng, Wenhao Jiang, Hong-Gee Kim

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

Comments ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04317 2024-12-06 cs.CV 83%

FlashSloth: Lightning Multimodal Large Language Models via Embedded Visual Compression

Bo Tong, Bokai Lai, Yiyi Zhou, Gen Luo, Yunhang Shen, Ke Li, Xiaoshuai Sun, Rongrong Ji

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01059 2024-12-02 cs.CV 83%

VIP: Versatile Image Outpainting Empowered by Multimodal Large Language Model

Jinze Yang, Haoran Wang, Zining Zhu, Chenglong Liu, Meng Wymond Wu, Mingming Sun

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by ACCV-2025, Our source code is available at: https://github.com/ucasyjz/VIP, 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17304 2024-11-22 cs.CL cs.AI 83%

Probing Multimodal Large Language Models for Global and Local Semantic Representations

Mingxu Tao, Quzhe Huang, Kun Xu, Liwei Chen, Yansong Feng, Dongyan Zhao

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

Comments Accepted by LREC-COLING 2024 as a short paper. ACL Anthology URL: [https://aclanthology.org/2024.lrec-main.1142/]

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02608 2024-09-05 cs.CV 83%

A Medical Multimodal Large Language Model for Pediatric Pneumonia

Weiwei Tian, Xinyu Huang, Tianhao Cheng, Wen He, Jinwu Fang, Rui Feng, Daoying Geng, Xiaobo Zhang

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05264 2024-08-13 cs.CR cs.CV 83%

Unbridled Icarus: A Survey of the Potential Perils of Image Inputs in Multimodal Large Language Model Security

Yihe Fan, Yuxin Cao, Ziyu Zhao, Ziyao Liu, Shaofeng Li

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments 8 pages, 1 figure. Accepted to 2024 IEEE International Conference on Systems, Man, and Cybernetics

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01319 2024-08-05 cs.AI 83%

A Comprehensive Review of Multimodal Large Language Models: Performance and Challenges Across Different Tasks

Jiaqi Wang, Hanqi Jiang, Yiheng Liu, Chong Ma, Xu Zhang, Yi Pan, Mengyuan Liu, Peiran Gu, Sichen Xia, Wenjun Li, Yutong Zhang, Zihao Wu, Zhengliang Liu, Tianyang Zhong, Bao Ge, Tuo Zhang, Ning Qiang, Xintao Hu, Xi Jiang, Xin Zhang, Wei Zhang, Dinggang Shen, Tianming Liu, Shu Zhang

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16790 2024-04-26 cs.CV 83%

SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension

Bohao Li, Yuying Ge, Yi Chen, Yixiao Ge, Ruimao Zhang, Ying Shan

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17092 2023-11-30 cs.CV 83%

SEED-Bench-2: Benchmarking Multimodal Large Language Models

Bohao Li, Yuying Ge, Yixiao Ge, Guangzhi Wang, Rui Wang, Ruimao Zhang, Ying Shan

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments Project released at: https://github.com/AILab-CVC/SEED-Bench. arXiv admin note: text overlap with arXiv:2307.16125

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12320 2023-11-22 cs.AI 83%

A Survey on Multimodal Large Language Models for Autonomous Driving

Can Cui, Yunsheng Ma, Xu Cao, Wenqian Ye, Yang Zhou, Kaizhao Liang, Jintai Chen, Juanwu Lu, Zichong Yang, Kuei-Da Liao, Tianren Gao, Erlong Li, Kun Tang, Zhipeng Cao, Tong Zhou, Ao Liu, Xinrui Yan, Shuqi Mei, Jianguo Cao, Ziran Wang, Chao Zheng

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18991 2025-12-09 cs.CL 83%

Surveying the MLLM Landscape: A Meta-Review of Current Surveys

测绘MLLM景观:当前调研的元综述

Ming Li, Keyu Chen, Ziqian Bi, Ming Liu, Xinyuan Song, Zekun Jiang, Tianyang Wang, Benji Peng, Qian Niu, Junyu Liu, Jinlang Wang, Sen Zhang, Xuanhe Pan, Jiawei Xu, Pohsun Feng

机构 * Georgia Institute of Technology(佐治亚理工学院) Indiana University(印第安纳大学) Purdue University(普渡大学) Emory University(埃默里大学) Sichuan University(四川大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) AppCubic Kyoto University(京都大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Rutgers University(罗格斯大学) National Taiwan Normal University(台湾师范大学)

专题命中 其他VLM :MLLM(title,abstract);multimodal large language model(abstract,comments)

AI总结 本文通过系统回顾现有调研,全面分析MLLMs的评估方法、挑战与趋势,为研究者提供当前评估现状的深入理解。

Comments The article consists of 22 pages, including 2 figures and 108 references. The paper provides a meta-review of surveys on Multimodal Large Language Models (MLLMs), categorizing findings into key areas such as evaluation, applications, security, and future directions

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08415 2026-06-11 cs.CV cs.AI 版本更新 82%

CoVEBench: Can Video Editing Models Handle Complex Instructions?

CoVEBench: 视频编辑模型能处理复杂指令吗?

Jiangtao Wu, Jiaming Wang, Yiwen He, Yuanxing Zhang, Shihao Li, Dunyuan Liu, Xuedong Zhao, Jialu Chen, Zekun Moore Wang, Jiaheng Liu

机构 * Nanjing University(南京大学) Kuaishou Technology(快手科技)

专题命中 其他VLM :MLLM(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 提出CoVEBench基准,包含416个源视频和626条多点编辑指令,通过MLLM评估指令遵循度和保真度,揭示当前模型在组合编辑中常遗漏编辑或破坏保留约束。

Comments 34 pages, 11 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07032 2026-06-08 cs.CV cs.AI 新提交 82%

Never Seen Before: Benchmarking Genuine Zero-Shot Composed Image Retrieval with Consistent Video-Sourced Datasets

前所未见:基于一致视频源数据集的真正零样本组合图像检索基准测试

Zhenyu Yang, Zemin Du, Shengsheng Qian, Changsheng Xu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他VLM :MLLM(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 针对现有零样本组合图像检索数据集存在参考与目标图像不相关、非真正零样本的问题,提出ZeroSight基准,包含来自视频的一致参考-目标对和训练无关的MLLM驱动方法SC4CIR,通过三重对称一致性检查识别难负样本,实验表明现有方法性能被高估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00906 2026-05-05 cs.CV cs.AI cs.LG 82%

Generalized Category Discovery under Domain Shifts: From Vision to Vision-Language Models

在域偏移下进行广义类别发现:从视觉模型到视觉-语言模型

Hongjun Wang, Po Hu, Kai Han

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文研究在域偏移下的广义类别发现问题,提出三种适应基础模型的框架,从自监督视觉模型到视觉-语言模型,通过多级特征提取和互信息最小化等方法提升性能。

Comments Submission to TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02541 2026-04-21 cs.LG cs.AI cs.CV 82%

Rethinking Post-Unlearning Behavior of Large Vision-Language Models

重新思考大型视觉-语言模型的后反遗忘行为

Minsung Kim, Nakyeong Yang, Kyomin Jung

机构 * Seoul National University(首尔国立大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出新的反遗忘任务和PUBG方法,旨在生成隐私保护且信息丰富的后反遗忘响应,解决现有方法导致的退化、幻觉或过度拒绝问题。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07148 2026-04-14 eess.IV 82%

Q-Agent: Quality-Driven Chain-of-Thought Image Restoration Agent through Robust Multimodal Large Language Model

Q-Agent:通过鲁棒多模态大语言模型实现质量驱动的推理图像修复代理

Yingjie Zhou, Jiezhang Cao, Farong Wen, Zicheng Zhang, Yu Zhou, Yue Shi, Xiaohong Liu, Radu Timofte, Luc Van Gool, Guangtao Zhai

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract)

AI总结 本文提出Q-Agent,通过Chain-of-Thought方法提升图像修复性能,结合鲁棒多模态大语言模型和客观图像质量评估,实现更高效的多退化处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19744 2026-03-23 cs.CL 82%

Rethinking Ground Truth: A Case Study on Human Label Variation in MLLM Benchmarking

重新审视真实标签:在大语言模型基准测试中的人类标签变异案例研究

Tomas Ruiz, Tanalp Agustoslu, Carsten Schwemmer

机构 * Bavarian Research Institute for Digital Transformation(巴伐利亚数字转型研究所)

专题命中 其他VLM :MLLM(title,abstract);multimodal large language model(abstract)

AI总结 研究探讨了人类标注差异对大语言模型基准测试的影响,发现大模型在高一致性子集表现最佳,但在高分歧情况下表现不佳,表明参数数量不决定对模糊性和主观性的敏感度。

Comments 6 pages, 3 tables, 1 figure

Journal ref 2025 IEEE International Conference on Big Data (BigData), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22171 2026-03-03 cs.HC 82%

A Taxonomy of Human--MLLM Interaction in Early-Stage Sketch-Based Design Ideation

早期阶段基于草图的设计构想中人类与大语言模型交互的分类

Weiyan Shi, Kenny Tsu Wei Choo

专题命中 其他VLM :MLLM(title,abstract);multimodal large language model(abstract)

AI总结 本文提出了一种分类方法,用于描述人类与大语言模型在早期阶段基于草图的设计构想中的交互模式,揭示了人类与AI角色的动态变化。

Comments Accepted at CHI 2026 Posters

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13715 2026-02-17 cs.IR 82%

DMESR: Dual-view MLLM-based Enhancing Framework for Multimodal Sequential Recommendation

DMESR: 基于双视角的多模态序列推荐增强框架

Mingyao Huang, Qidong Liu, Wenxuan Yang, Moranxin Wang, Yuqi Sun, Haiping Zhu, Feng Tian, Yan Chen

专题命中 其他VLM :MLLM(title,abstract);multimodal large language model(abstract)

AI总结 DMESR通过双视角机制解决多模态序列推荐中的语义对齐和细粒度语义丢失问题,提升推荐效果。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21424 2025-11-18 cs.CL cs.AI cs.CV cs.LG 82%

Vision Language Models for Dynamic Human Activity Recognition in Healthcare Settings

Abderrazek Abid, Thanh-Cong Ho, Fakhri Karray

机构 * MBZUAI University of Waterloo(滑铁卢大学)

专题命中 其他VLM :vision language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

Journal ref In: Rojas I., Ortuño F., Rojas Ruiz F., Herrera L.J., Valenzuela O., Escobar J.J. (eds) Bioinformatics and Biomedical Engineering. IWBBIO 2026. Lecture Notes in Bioinformatics, vol 15561. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13845 2025-10-17 q-bio.NC 82%

Embodiment in multimodal large language models

Akila Kadambi, Lisa Aziz-Zadeh, Antonio Damasio, Marco Iacoboni, Srini Narayanan

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00883 2025-10-07 cs.CL 82%

Improve MLLM Benchmark Efficiency through Interview

Farong Wen, Yijin Guo, Junying Wang, Jiaohao Xiao, Yingjie Zhou, Ye Shen, Qi Jia, Chunyi Li, Zicheng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 其他VLM :MLLM(title,abstract);multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23625 2025-09-30 cs.CV cs.AI cs.CL cs.LG 82%

RIV: Recursive Introspection Mask Diffusion Vision Language Model

YuQian Li, Limeng Qiao, Lin Ma

机构 * Meituan(美团)

专题命中 其他VLM :vision language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10016 2025-08-21 cs.CR cs.SD eess.AS 82%

The Man Behind the Sound: Demystifying Audio Private Attribute Profiling via Multimodal Large Language Model Agents

Lixu Wang, Kaixiang Yao, Xinfeng Li, Dong Yang, Haoyang Li, Xiaofeng Wang, Wei Dong

机构 * Nanyang Technological University(南洋理工大学) The University of Tokyo(东京大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract)

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15910 2025-07-24 cs.CL 82%

Modality-Aware Neuron Pruning for Unlearning in Multimodal Large Language Models

Zheyuan Liu, Guangyao Dou, Xiangchi Yuan, Chunhui Zhang, Zhaoxuan Tan, Meng Jiang

机构 * University of Notre Dame(诺丁汉大学) University of Pennsylvania(宾夕法尼亚大学) Georgia Institute of Technology(佐治亚理工学院) Dartmouth College(达特茅斯学院)

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract)

Comments ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02406 2025-05-29 cs.CV cs.AI cs.DC cs.LG 82%

LV-XAttn: Distributed Cross-Attention for Long Visual Inputs in Multimodal Large Language Models

Tzu-Tao Chang, Shivaram Venkataraman

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16566 2025-05-08 cs.HC 82%

AffectGPT: A New Dataset, Model, and Benchmark for Emotion Understanding with Multimodal Large Language Models

Zheng Lian, Haoyu Chen, Lan Chen, Haiyang Sun, Licai Sun, Yong Ren, Zebang Cheng, Bin Liu, Rui Liu, Xiaojiang Peng, Jiangyan Yi, Jianhua Tao

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏