arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1562 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1562 篇

2407.18999 2024-07-30 cs.CV cs.LG 84%

Graph-based Unsupervised Disentangled Representation Learning via Multimodal Large Language Models

Baao Xie, Qiuyu Chen, Yunnan Wang, Zequn Zhang, Xin Jin, Wenjun Zeng

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.LG

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.04788 2024-06-12 cs.CL cs.AI cs.CV 84%

MLLM-as-a-Judge: Assessing Multimodal LLM-as-a-Judge with Vision-Language Benchmark

Dongping Chen, Ruoxi Chen, Shilin Zhang, Yinuo Liu, Yaochen Wang, Huichi Zhou, Qihui Zhang, Yao Wan, Pan Zhou, Lichao Sun

专题命中 其他VLM :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments ICML 2024 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14859 2024-06-04 cs.CR cs.AI cs.CY cs.LG 84%

The Wolf Within: Covert Injection of Malice into MLLM Societies via an MLLM Operative

Zhen Tan, Chengshuai Zhao, Raha Moraffah, Yifan Li, Yu Kong, Tianlong Chen, Huan Liu

专题命中 其他VLM :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI、cs.LG

Comments Accepted to workshop on ReGenAI@CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.17102 2024-02-06 cs.CV 84%

Guiding Instruction-based Image Editing via Multimodal Large Language Models

Tsu-Jui Fu, Wenze Hu, Xianzhi Du, William Yang Wang, Yinfei Yang, Zhe Gan

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract,comments);分类 cs.CV

Comments ICLR'24 (Spotlight) ; Project at https://mllm-ie.github.io ; Code at https://github.com/tsujuifu/pytorch_mgie

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25901 2026-07-29 cs.IR 新提交 83%

RecoReward: Recommender-Guided Multimodal Description Generation for Recommendation

RecoReward:用于推荐的推荐器引导多模态描述生成

Guohong Mu, Yueyang Liu, Jiangxia Cao, Changxin Lao, Zijie Zhuang, Yuhui Zhang, Jiaqi Feng, Ruochen Yang, Shuang Yang, Zhaojie Liu, Qibin Hou

专题命中 其他VLM :MLLM(summary_cn,abstract);multimodal large language model(abstract)

AI总结 研究针对多模态推荐中传统方法不足,提出RecoReward,训练时用行为衍生奖励,保留仅内容推理。在直播推荐中利用用户历史等估计亲和力,通过推荐器亲和力分数提供反馈,实验表明该方法能提升MLLM性能,利于下游推荐且保留内容服务。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22603 2026-07-28 cs.AI 新提交 83%

Group Preference Collapse in Personalized Multimodal Large Language Models

个性化多模态大语言模型中的群体偏好崩溃

Fan Lyu, Wenqi Zhang, Joost van de Weijer

机构 * Computer Vision Center, Universitat Autònoma de Barcelona(计算机视觉中心,巴塞罗那自治大学)

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 研究个性化多模态大语言模型中群体偏好崩溃问题,提出PrefMoE框架,它分离配置文件信息与偏好表示,分解偏好,保留个性化残差并通过单独路径路由因素,实验表明该框架能改善偏好敏感个性化并减少偏好崩溃。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04424 2026-04-28 cs.CL cs.AI 83%

EmoBench-M: Benchmarking Emotional Intelligence for Multimodal Large Language Models

EmoBench-M:多模态大语言模型情感智能评估基准

He Hu, Lianzhong You, Hongbo Xu, Qianning Wang, Fei Richard Yu, Fei Ma, Zebang Cheng, Zheng Lian, Yucheng Zhou, Laizhong Cui

机构 * Shenzhen University(深圳大学) Guangdong Laboratory of Artificial Intelligence(广东人工智能与数字经济实验室) Auckland University of Technology(奥克兰理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) SKL-IOTSC, CIS, University of Macau(澳门科学技术大学SKL-IOTSC、CIS)

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出EmoBench-M,通过建立心理理论基础,评估多模态大语言模型在13种场景中的情感识别、理解及社会复杂情感分析能力,揭示模型在情感智能方面的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18610 2026-04-22 cs.NE cs.AI 83%

SpikeMLLM: Spike-based Multimodal Large Language Models via Modality-Specific Temporal Scales and Temporal Compression

基于脉冲的多模态大语言模型:通过模态特定的时间尺度和时间压缩

Han Xu, Zhiyong Qin, Di Shang, Jiahong Zhang, Xuerui Qiu, Bo Lei, Tiejun Huang, Bo Xu, Guoqi Li

机构 * 1 Institute of Automation, Chinese Academy of Sciences 2 University of Chinese Academy of Sciences 3 Beijing Academy of Artificial Intelligence 4 Zhongguancun Academy 5 Peking University 6 Key Laboratory of Brain Cognition Brain-inspired Intelligence Technology 7 Spiking Intelligence Lab, Tianqiao \& Chrissy Chen Institute [0.5em] Equal contribution Corresponding authors

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract_cn);分类 cs.AI

AI总结 本文提出SpikeMLLM,首个基于脉冲的多模态大语言模型框架,通过模态特定时间尺度和时间压缩技术,在减少时间步数的同时保持高性能,实验显示其在多个基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08050 2026-04-10 cs.CV 83%

ABMAMBA: Multimodal Large Language Model with Aligned Hierarchical Bidirectional Scan for Efficient Video Captioning

ABMAMBA: 多模态大语言模型中的对齐层次双向扫描用于高效的视频描述

Daichi Yashima, Shuhei Kurita, Yusuke Oda, Shuntaro Suzuki, Seitaro Otsuki, Komei Sugiura

机构 * Keio University(庆应义塾大学) National Institute of Informatics(国立信息学研究所) National Institute of Informatics Research and Development Center for Large Language Models(国立信息学研究所大型语言模型研发中心)

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出ABMamba,一种具有线性计算复杂度的多模态大语言模型,通过替代二次注意力机制,实现视频序列的高效处理,在视频描述任务中表现出色。

Comments Accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04482 2026-04-07 cs.AI 83%

Scalable and Explainable Learner-Video Interaction Prediction using Multimodal Large Language Models

基于多模态大语言模型的可扩展且可解释的学习者-视频交互预测

Dominik Glandorf, Fares Fawzi, Tanja Käser

机构 * EPFL(瑞士联邦理工学院洛桑)

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出利用多模态大语言模型预测学习者观看、暂停、跳过和回放行为,以评估视频内容的认知负荷,通过7700万次视频控制事件验证了模型的可扩展性和解释性。

Comments Accepted as long paper to the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13978 2026-03-17 cs.CV 83%

When Visual Privacy Protection Meets Multimodal Large Language Models

当视觉隐私保护与多模态大语言模型相遇

Xiaofei Hui, Qian Wu, Haoxuan Qu, Majid Mirmehdi, Hossein Rahmani, Jun Liu

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文研究多模态大语言模型在提供便利性的同时如何保护视觉隐私,提出基于黑盒模型的优化框架,通过帕累托最优和关键历史增强优化实现隐私与性能的平衡。

Journal ref Int J Comput Vis (IJCV) 134, 167 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23830 2026-03-13 cs.DC cs.AI 83%

OrchMLLM: Orchestrate Multimodal Data with Batch Post-Balancing to Accelerate Multimodal Large Language Model Training

OrchMLLM: 通过批量后平衡 orchestrate 多模态数据以加速多模态大语言模型训练

Yijie Zheng, Bangjun Xiao, Lei Shi, Xiaoyang Li, Faming Wu, Tianyu Li, Xuefeng Xiao, Yang Zhang, Yuxuan Wang, Shouda Liu

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 OrchMLLM通过批量后平衡调度器和全局协调器解决多模态数据训练中的模态不一致问题,提升训练效率和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08069 2026-03-10 cs.CV 83%

Synthetic Defect Image Generation for Power Line Insulator Inspection Using Multimodal Large Language Models

利用多模态大语言模型生成合成缺陷图像用于电力线路绝缘子检测

Xuesong Wang, Caisheng Wang

机构 * Department of Electrical and Computer Engineering, Wayne State University(电气与计算机工程系,韦恩州立大学)

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 利用多模态大语言模型生成合成缺陷图像,提升电力线路绝缘子缺陷识别的准确率和数据效率。

Comments Submitted to Engineering Applications of Artificial Intelligence, Feb. 16, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09396 2026-03-05 cs.CL cs.AI 83%

Multimodal Large Language Models for Low-Resource Languages: A Case Study for Basque

多模态大语言模型用于低资源语言:巴斯克语的案例研究

Lukas Arana, Julen Etxaniz, Ander Salaberria, Gorka Azkune

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 本文通过开发巴斯克语多模态大语言模型,证明低比例多模态数据即可获得良好性能,且无需巴斯克语指导的LLM即可实现强模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00426 2026-03-03 cs.CL cs.CV 83%

LLM-Bootstrapped Targeted Finding Guidance for Factual MLLM-based Medical Report Generation

基于大语言模型的引导式目标发现指导:用于基于事实的多模态大语言模型医疗报告生成

Cunyuan Yang, Dejuan Song, Xiaotao Pang, Qianqian Shen, Wenjie Nie, Yifan Huang, Lei Wu, Wei Han, Haishuai Wang, Jiajun Bu

机构 * Zhejiang University(浙江大学) The Second Affiliated Hospital Zhejiang University School of Medicine(浙江大学医学院附属第二医院) Hangzhou Pu Jian Medical Technology Co., Ltd.(杭州普健医疗科技有限公司)

专题命中 其他VLM :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出Fact-Flow框架,通过引导大语言模型生成事实准确的医疗报告,利用LLM自动生成标注数据集,提升医疗报告生成的事实准确性。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20972 2026-02-25 cs.CV 83%

Are Multimodal Large Language Models Good Annotators for Image Tagging?

多模态大语言模型在图像标签任务中是好的标注者吗?

Ming-Kun Xie, Jia-Hao Xiao, Zhiqiang Kou, Zhongnian Li, Gang Niu, Masashi Sugiyama

机构 * RIKEN Center for Advanced Intelligence Project, Japan(日本先进人工智能研究中心) The University of Tokyo, Japan(东京大学) Southeast University, China(东南大学) China University of Mining(中国矿业大学)

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出TagLLM框架,通过候选生成和标签歧义消除方法,有效缩小多模态大语言模型生成标注与人工标注之间的差距,提升图像标签任务的效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13469 2026-02-20 cs.HC cs.AI 83%

How Multimodal Large Language Models Support Access to Visual Information: A Diary Study With Blind and Low Vision People

多模态大语言模型如何支持视障人士获取视觉信息:一项与盲人和低视力人士的日记研究

Ricardo E. Gonzalez Penuela, Crescentia Jung, Sharon Y Lin, Ruiying Hu, Shiri Azenkot

机构 * Cornell University(康奈尔大学)

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 本研究探讨了多模态大语言模型如何通过视觉助手技能支持视障人士获取视觉信息,并发现其在实际应用中的表现及改进方向。

Comments 24 pages, 17 figures, 7 tables, appendix section, to appear main track CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12641 2026-02-16 cs.NI cs.AI cs.HC cs.MM 83%

Artic: AI-oriented Real-time Communication for MLLM Video Assistant

Artic: 面向AI的实时通信用于多模态大语言模型视频助手

Jiangkai Wu, Zhiyuan Ren, Junquan Zhong, Liming Liu, Xinggong Zhang

机构 * Peking University(北京大学)

专题命中 其他VLM :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 Artic提出了一种面向AI的实时通信框架,通过自适应比特率、上下文感知流式传输和退化视频理解基准提升多模态大语言模型视频助手的准确性和降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11341 2026-02-10 cs.CV 83%

InternSVG: Towards Unified SVG Tasks with Multimodal Large Language Models

InternSVG:通过多模态大语言模型实现统一的SVG任务

Haomin Wang, Jinhui Yin, Qi Wei, Wenguang Zeng, Lixin Gu, Shenglong Ye, Zhangwei Gao, Yaohui Wang, Yanting Zhang, Yuanqi Li, Yanwen Guo, Wenhai Wang, Kai Chen, Yu Qiao, Hongjie Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Donghua University(东华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 InternSVG通过多模态大语言模型实现统一的SVG任务建模,结合大规模数据集和两阶段训练策略,提升SVG理解、编辑和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07850 2026-01-14 cs.MM cs.CV 83%

MLLM-VADStory: Domain Knowledge-Driven Multimodal LLMs for Video Ad Storyline Insights

MLLM-VADStory: 基于领域知识的多模态大语言模型用于视频广告剧情洞察

Jasmine Yang, Poppy Zhang, Shawndra Hill

机构 * Meta

专题命中 其他VLM :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 MLLM-VADStory通过领域知识引导多模态大语言模型,系统量化和生成视频广告剧情洞察,提升视频广告创意效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09143 2025-12-17 cs.CV 83%

Exo2Ego: Exocentric Knowledge Guided MLLM for Egocentric Video Understanding

Exo2Ego:基于外部知识引导的多模态大语言模型用于第一人称视频理解

Haoyu Zhang, Qiaohui Chu, Meng Liu, Haoxiang Shi, Yaowei Wang, Liqiang Nie

专题命中 其他VLM :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 Exo2Ego通过迁移学习提升内向视频理解能力,利用外向知识增强模型性能。

Comments This paper is accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14885 2025-12-10 cs.CV cs.CL 83%

You May Speak Freely: Improving the Fine-Grained Visual Recognition Capabilities of Multimodal Large Language Models with Answer Extraction

你可能可以自由发言:通过答案提取提升多模态大语言模型的细粒度视觉识别能力

Logan Lawrence, Oindrila Saha, Megan Wei, Chen Sun, Subhransu Maji, Grant Van Horn

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿姆赫斯特分校) Brown University(布朗大学)

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出nlg2choice方法,通过两阶段策略提升多模态大语言模型在细粒度视觉识别任务中的表现,通过开放性问题和受限解码提高检索效率。

Comments Accepted to WACV26. 12 pages, 8 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07166 2025-12-09 cs.CV 83%

When Privacy Meets Recovery: The Overlooked Half of Surrogate-Driven Privacy Preservation for MLLM Editing

当隐私与恢复相遇: surrogate驱动的隐私保护在MLLM编辑中的被忽视的一半

Siyuan Xu, Yibing Liu, Peilin Chen, Yung-Hui Li, Shiqi Wang, Sam Kwong

专题命中 其他VLM :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出SPPE数据集和统一方法,通过引导生成任务实现隐私恢复,平衡隐私保护与MLLM可用性。

Comments 9 pages,7figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.13394 2025-10-27 cs.CV 83%

MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models

Chaoyou Fu, Peixian Chen, Yunhang Shen, Yulei Qin, Mengdan Zhang, Xu Lin, Jinrui Yang, Xiawu Zheng, Ke Li, Xing Sun, Yunsheng Wu, Rongrong Ji, Caifeng Shan, Ran He

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Tencent Youtu Lab(腾讯优图实验室) Xiamen University(厦门大学) CASIA(中国科学院自动化研究所)

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments NeurIPS DB 2025 Spotlight, Project Page: https://github.com/BradyFU/Awesome-Multimodal-Large-Language-Models/tree/Evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18304 2025-10-22 cs.CV cs.CL 83%

The Impact of Image Resolution on Biomedical Multimodal Large Language Models

Liangyu Chen, James Burgess, Jeffrey J Nirschl, Orr Zohar, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学) Institute for Computational and Mathematical Engineering (ICME)(计算与数学工程研究所)

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments Proceedings of the 10th Machine Learning for Healthcare Conference, PMLR 298, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00063 2025-10-22 astro-ph.IM cs.AI 83%

AstroMMBench: A Benchmark for Evaluating Multimodal Large Language Models Capabilities in Astronomy

Jinghang Shi, Xiaoyu Tang, Yang Huang, Yuyang Li, Xiao Kong, Yanxia Zhang, Caizhan Yue

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01960 2025-09-23 cs.LG 83%

MPIC: Position-Independent Multimodal Context Caching System for Efficient MLLM Serving

Shiju Zhao, Junhao Hu, Rongxiao Huang, Jiaqi Zheng, Guihai Chen

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) Nanjing University(南京大学) School of Computer Science(计算机学院)

专题命中 其他VLM :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.LG

Comments 17 pages, 13 figures, the second version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12893 2025-09-17 cs.CV 83%

MEJO: MLLM-Engaged Surgical Triplet Recognition via Inter- and Intra-Task Joint Optimization

Yiyi Zhang, Yuchen Yuan, Ying Zheng, Jialun Pei, Jinpeng Li, Zheng Li, Pheng-Ann Heng

专题命中 其他VLM :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12591 2025-08-19 cs.CL cs.AI cs.SD 83%

Beyond Modality Limitations: A Unified MLLM Approach to Automated Speaking Assessment with Effective Curriculum Learning

Yu-Hsuan Fang, Tien-Hong Lo, Yao-Ting Sung, Berlin Chen

机构 * National Taiwan Normal University(台湾国立正常大学)

专题命中 其他VLM :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI

Comments Accepted at IEEE ASRU 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11916 2025-05-21 cs.CL cs.AI 83%

EssayJudge: A Multi-Granular Benchmark for Assessing Automated Essay Scoring Capabilities of Multimodal Large Language Models

Jiamin Su, Yibo Yan, Fangteng Fu, Han Zhang, Jingheng Ye, Xiang Liu, Jiahao Huo, Huiyu Zhou, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beijing Future Brain Education Technology Co., Ltd.(北京未来脑教育科技有限公司) The Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) Guangxi Zhuang Autonomous Region Big Data Research Institute(广西壮族自治区大数据研究院)

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

Comments Accepted by ACL Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏