arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46073 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4651 篇

2504.02821 2025-12-01 cs.CV cs.AI cs.LG 62%

Sparse Autoencoders Learn Monosemantic Features in Vision-Language Models

稀疏自编码器在视觉-语言模型中学习单义特征

Mateusz Pach, Shyamgopal Karthik, Quentin Bouniot, Serge Belongie, Zeynep Akata

机构 * Technical University of Munich(慕尼黑技术大学) Helmholtz Munich(亥姆霍兹慕尼黑) Munich Center for Machine Learning(慕尼黑机器学习中心) Munich Data Science Institute(慕尼黑数据科学研究所) University of Tübingen(图宾根大学) University of Copenhagen(哥本哈根大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究通过稀疏自编码器提升视觉-语言模型中神经元的单义性,展示其在增强模型可解释性和可控性方面的有效性。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20531 2025-11-26 cs.AI cs.CV cs.LG 62%

Beyond Generation: Multi-Hop Reasoning for Factual Accuracy in Vision-Language Models

超越生成:面向视觉语言模型事实准确性的多跳推理

Shamima Hossain

机构 * Department of Computer Science, Brac University(布鲁尔大学计算机科学系) bKash Limited(bKash公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种基于知识图谱的多跳推理框架,提升视觉语言模型在事实准确性上的表现,通过多步骤推理增强模型的逻辑推理能力。

Comments Accepted as poster at NewInML Workshop ICML, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19641 2025-11-26 cs.CV cs.AI 62%

On the Utility of Foundation Models for Fast MRI: Vision-Language-Guided Image Reconstruction

在快速MRI中基础模型的效用:基于视觉-语言的图像重建

Ruimin Feng, Xingxin He, Ronald Mercer, Zachary Stewart, Fang Liu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出利用视觉-语言基础模型通过语义空间优化提升欠采样MRI重建效果,实验表明其在保留解剖结构和提升感知质量方面优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19518 2025-11-26 cs.CV cs.AI cs.IT cs.LG math.IT 62%

Towards Efficient VLMs: Information-Theoretic Driven Compression via Adaptive Structural Pruning

迈向高效的VLMs:通过自适应结构压缩的信息论驱动压缩

Zhaoqi Xu, Yingying Zhang, Jian Li, Jianwei Guo, Qiannan Zhu, Hua Huang

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Zhongtai Securities Institute for Financial Studies, Shandong University(山东大学中泰证券金融研究学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出InfoPrune框架,通过信息论驱动的自适应结构压缩方法,在保持性能的同时显著提升视觉语言模型的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17967 2025-11-26 cs.LG cs.AI cs.CV 62%

Adapting Vision-Language Models for Evaluating World Models

为世界模型评估适应视觉-语言模型

Mariya Hendriksen, Tabish Rashid, David Bignell, Raluca Georgescu, Abdelhak Lemkhenter, Katja Hofmann, Sam Devlin, Sarah Parisot

机构 * University of Oxford(牛津大学) Microsoft Research(微软研究院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出UNIVERSE,一种基于视觉-语言模型的视频世界模型评估器,通过适应不同任务格式和数据约束,实现了细粒度、时间敏感的评估,与任务特定检查点性能相当,并在多种环境中验证了其与人类判断的一致性。

Comments NeurIPS LAW 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17405 2025-11-25 cs.CL cs.AI 62%

Beyond Multiple Choice: Verifiable OpenQA for Robust Vision-Language RFT

超越多项选择:可验证的开放问答用于鲁棒的视觉-语言 RFT

Yesheng Liu, Hao Li, Haiyu Xu, Baoqi Pei, Jiahao Wang, Mingxuan Zhao, Jingshu Zheng, Zheqi He, JG Yao, Bowen Qin, Xi Yang, Jiajun Zhang

机构 * Institute of Automation, CAS(中国科学院自动化研究所) School of Artificial Intelligence, UCAS(中国科学技术大学人工智能学院) BAAI FlagEval Team(百度AI旗评团队) BUAA(北京航空航天大学) PKU(北京大学) ZJU(浙江大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 ReVeL通过重写和验证多项选择问题为开放式问题,提升视觉-语言模型在鲁棒性与数据效率上的表现。

Comments Project url: https://flageval-baai.github.io/ReVeL/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17886 2025-11-25 cs.CV cs.CL 62%

When Better Teachers Don't Make Better Students: Revisiting Knowledge Distillation for CLIP Models in VQA

当更好的教师不培养更好的学生:重新审视用于CLIP模型的KL知识蒸馏在视觉问答中的应用

Pume Tuchinda, Parinthapat Pengpun, Romrawin Chumpu, Sarana Nutanong, Peerat Limkonchotiwat

机构 * VISTEC Bangkok Christian International School(巴吞普林国际学校) AI Singapore(AI新加坡)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文重新审视了CLIP模型在视觉问答中的知识蒸馏,发现更强教师不必然产生更好学生,揭示了现有蒸馏框架的局限性,并指明了参数高效多模态模型的设计新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16671 2025-11-25 cs.CV cs.CL 62%

Demystifying CLIP Data

解开CLIP数据之谜

Hu Xu, Saining Xie, Xiaoqing Ellen Tan, Po-Yao Huang, Russell Howes, Vasu Sharma, Shang-Wen Li, Gargi Ghosh, Luke Zettlemoyer, Christoph Feichtenhofer

机构 * FAIR, Meta AI(FAIR,Meta AI) New York University(纽约大学) University of Washington(华盛顿大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL

AI总结 MetaCLIP通过优化数据整理方法,提升CLIP在图像分类任务中的性能。

Comments 17 pages. arXiv admin note: text overlap with arXiv:2103.00020 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17036 2025-11-24 cs.CL cs.CV 62%

Do Vision-Language Models Understand Visual Persuasiveness?

视觉-语言模型理解视觉说服力吗?

Gyuwon Park

机构 * Department of Computer Science and Engineering, UNIST(计算机科学与工程系,UNIST)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文研究视觉-语言模型对视觉说服力的理解,发现模型在链接说服对象与沟通意图方面存在局限。

Comments 8 pages (except for reference and appendix), 5 figures, 7 tables, to be published in NeurIPS 2025 Workshop: VLM4RWD

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16423 2025-11-21 cs.AI cs.CL 62%

TOFA: Training-Free One-Shot Federated Adaptation for Vision-Language Models

TOFA: 无需训练的一次性联邦适应用于视觉-语言模型

Li Zhang, Zhongxuan Han, XiaoHua Feng, Jiaming Zhang, Yuyuan Li, Linbo Jiang, Jianan Lin, Chaochao Chen

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 TOFA提出一种无需训练的一次性联邦适应方法,通过视觉和文本管道提取任务相关表示,以高效适应视觉-语言模型在联邦学习中的应用。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07463 2025-11-19 cs.RO cs.AI cs.CV 62%

DepthVision: Enabling Robust Vision-Language Models with GAN-Based LiDAR-to-RGB Synthesis for Autonomous Driving

Sven Kirchner, Nils Purschke, Ross Greer, Alois C. Knoll

机构 * Chair of Robotics, Artificial Intelligence and Real-time Systems, Technical University of Munich(机器人学、人工智能与实时系统教授会,慕尼黑技术大学) Computer Science and Engineering Department, University of California Merced(计算机科学与工程系,加州大学默塞德分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13458 2025-11-18 cs.HC cs.AI cs.CV 62%

Trust in Vision-Language Models: Insights from a Participatory User Workshop

Agnese Chiatti, Lara Piccolo, Sara Bernardini, Matteo Matteucci, Viola Schiaffonati

机构 * University of Oxford, UK(牛津大学) CODE University of Applied Sciences, Germany(应用科学学院)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Journal ref Proceedings of the The European Workshop on Trustworthy AI (Trust-AI) at ECAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20630 2025-11-18 cs.CV cs.AI 62%

TransPrune: Token Transition Pruning for Efficient Large Vision-Language Model

Ao Li, Yuxiang Duan, Jinghui Zhang, Congbo Ma, Yutong Xie, Gustavo Carneiro, Mohammad Yaqub, Hu Wang

机构 * Shandong University(山东大学) MBZUAI New York University Abu Dhabi(纽约大学阿布扎赫分校) University of Surrey(塞雷尔大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12693 2025-11-18 cs.CV cs.AI 62%

HEDGE: Hallucination Estimation via Dense Geometric Entropy for VQA with Vision-Language Models

Sushant Gautam, Michael A. Riegler, Pål Halvorsen

机构 * Simula Metropolitan Center for Digital Engineering (SimulaMet)(Simula数字工程研究中心) Oslo Metropolitan University (OsloMet)(奥斯陆 Metropolitan 大学) Simula Research Laboratory(Simula研究实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10390 2025-11-18 cs.CV cs.AI 62%

MonkeyOCR v1.5 Technical Report: Unlocking Robust Document Parsing for Complex Patterns

Jiarui Zhang, Yuliang Liu, Zijun Wu, Guosheng Pang, Zhili Ye, Yupei Zhong, Junteng Ma, Tao Wei, Haiyang Xu, Weikai Chen, Zeen Wang, Qiangjun Ji, Fanxi Zhou, Qi Zhang, Yuanrui Hu, Jiahao Liu, Zhang Li, Ziyang Zhang, Qiang Liu, Xiang Bai

机构 * KingSoft Office Zhuiguang AI Lab(金山办公紫光人工智能实验室) Huazhong University of Science and Technology(华中科技大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00537 2025-11-18 cs.CV cs.AI cs.LG 62%

Not All Attention Heads Are What You Need: Refining CLIP's Image Representation with Attention Ablation

Feng Lin, Marco Chen, Haokui Zhang, Xiaotian Yu, Guangming Lu, Rong Xiao

机构 * Intellifusion Inc.(Intellifusion公司) Northwest Polytechnical University(西北工业大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11690 2025-11-18 cs.LG cs.AI cs.CV 62%

Doubly Debiased Test-Time Prompt Tuning for Vision-Language Models

Fei Song, Yi Li, Rui Wang, Jiahuan Zhou, Changwen Zheng, Jiangmeng Li

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09973 2025-11-14 cs.CV cs.AI 62%

Difference Vector Equalization for Robust Fine-tuning of Vision-Language Models

Satoshi Suzuki, Shin'ya Yamaguchi, Shoichiro Takeda, Taiga Yamane, Naoki Makishima, Naotaka Kawata, Mana Ihori, Tomohiro Tanaka, Shota Orihashi, Ryo Masumura

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21348 2025-11-13 cs.CL cs.AI 62%

Large Language Model Benchmarks in Medical Tasks

Lawrence K. Q. Yan, Qian Niu, Ming Li, Yichao Zhang, Caitlyn Heqi Yin, Cheng Fei, Benji Peng, Ziqian Bi, Pohsun Feng, Keyu Chen, Tianyang Wang, Yunze Wang, Silin Chen, Ming Liu, Junyu Liu, Xinyuan Song, Riyang Bao, Zekun Jiang, Ziyuan Qin

机构 * Hong Kong University of Science and Technology(香港科技大学) Kyoto University(京都大学) Georgia Institute of Technology(佐治亚理工学院) The University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Cornell University(康奈尔大学) Indiana University(印第安纳大学) National Taiwan Normal University(台湾师范大学) University of Liverpool(利物浦大学) University of Edinburgh(爱丁堡大学) Zhejiang University(浙江大学) Purdue University(普渡大学) Emory University(埃默里大学) West China Biomedical Big Data Center, West China Hospital, Sichuan University(西京生物大数据中心,西京医院,四川大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

Comments 25 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18711 2025-11-12 cs.CV cs.AI 62%

RSVG-ZeroOV: Exploring a Training-Free Framework for Zero-Shot Open-Vocabulary Visual Grounding in Remote Sensing Images

Ke Li, Di Wang, Ting Wang, Fuyu Dong, Yiming Zhang, Luyao Zhang, Xiangyu Wang, Shaofeng Li, Quan Wang

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

Comments This work is accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17352 2025-11-12 cs.CV cs.CL 62%

OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles

Yihe Deng, Hritik Bansal, Fan Yin, Nanyun Peng, Wei Wang, Kai-Wei Chang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments 23 pages, 11 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07171 2025-11-11 cs.CV cs.AI cs.LG 62%

Federated Learning for Video Violence Detection: Complementary Roles of Lightweight CNNs and Vision-Language Models for Energy-Efficient Use

Sébastien Thuau, Siba Haidar, Rachid Chelouah

机构 * esieaLab, ETIS Laboratory(esiea实验室,ETIS实验室) ESIEA, University of CY Cergy(ESIEA,CY塞克大学) ETIS Laboratory, CNR1S, UMR8051(ETIS实验室,CNR1S,UMR8051)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 5 pages, 3 figures, ICTAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06908 2025-11-11 cs.CV cs.MM 62%

Mono3DVG-EnSD: Enhanced Spatial-aware and Dimension-decoupled Text Encoding for Monocular 3D Visual Grounding

Yuzhen Li, Min Liu, Zhaoyang Li, Yuan Bian, Xueping Wang, Erbo Zhai, Yaonan Wang

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.MM

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15052 2025-11-11 cs.CL cs.AI 62%

Brotherhood at WMT 2024: Leveraging LLM-Generated Contextual Conversations for Cross-Lingual Image Captioning

Siddharth Betala, Ishan Chokshi

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

Comments Accepted at the Ninth Conference on Machine Translation (WMT24), co-located with EMNLP 2024

Journal ref https://aclanthology.org/2024.wmt-1.81/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04247 2025-11-10 cs.MM cs.AI cs.IR 62%

On the Brittleness of CLIP Text Encoders

Allie Tran, Luca Rossetto

机构 * Dublin City University(都柏林城市大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI、cs.MM

Comments Accepted for publication at MMM'26. Analysis code can be found here: https://github.com/allie-tran/clip-brittleness

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07416 2025-11-07 cs.CV cs.CL cs.LG 62%

RadZero: Similarity-Based Cross-Attention for Explainable Vision-Language Alignment in Chest X-ray with Zero-Shot Multi-Task Capability

Jonggwon Park, Byungmu Yoon, Soobum Kim, Kyoyun Choi

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27164 2025-11-03 cs.CV cs.AI 62%

Generating Accurate and Detailed Captions for High-Resolution Images

Hankyeol Lee, Gawon Seo, Kyounggyu Lee, Dogun Kim, Kyungwoo Song, Jiyoung Jung

机构 * Department of Artificial Intelligence, University of Seoul(首尔大学人工智能系) Department of Computer Science and Engineering, POSTECH(POSTECH计算机科学与工程系) Department of Applied Statistics, Yonsei University(延世大学应用统计系)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Work conducted in 2024; released for archival purposes

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25164 2025-11-03 eess.IV cs.AI cs.CV 62%

Transformers in Medicine: Improving Vision-Language Alignment for Medical Image Captioning

Yogesh Thakku Suresh, Vishwajeet Shivaji Hogale, Luca-Alexandru Zamfira, Anandavardhana Hegde

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments This work is to appear in the Proceedings of MICAD 2025, the 6th International Conference on Medical Imaging and Computer-Aided Diagnosis

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24446 2025-10-29 cs.CL cs.CV 62%

SPARTA: Evaluating Reasoning Segmentation Robustness through Black-Box Adversarial Paraphrasing in Text Autoencoder Latent Space

Viktoriia Zinkovich, Anton Antonov, Andrei Spiridonov, Denis Shepelev, Andrey Moskalenko, Daria Pugacheva, Elena Tutubalina, Andrey Kuznetsov, Vlad Shakhuro

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24321 2025-10-29 cs.CV cs.AI 62%

Few-Shot Remote Sensing Image Scene Classification with CLIP and Prompt Learning

Ivica Dimitrovski, Vlatko Spasev, Ivan Kitanovski

机构 * Faculty of Computer Science and Engineering(计算机科学与工程学院) University Ss Cyril and Methodius(西里尔与美多西乌斯大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏