arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 45986 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4644 篇

2606.30698 2026-07-01 cs.RO 新提交 75%

Vision-Language Procedural Reasoning for Context-Aware Reward Modeling of Robotic Endovascular Guidewire Navigation

面向机器人血管内导丝导航的视觉-语言程序化推理与上下文感知奖励建模

Wentong Tian, Jiyuan Zhao, Tianliang Yao, Yuxiang Fan, Zhengyu Shi, Dong Liu, Peng Qi

机构 * Department of Control Science and Engineering, College of Electronic and Information Engineering, and Shanghai Institute of Intelligent Science and Technology, Tongji University(同济大学电子与信息工程学院控制科学与工程系,以及上海智能科学与技术研究院) Department of Electronic Engineering, Faculty of Engineering, The Chinese University of Hong Kong(香港中文大学工程学院电子工程系) Shanghai Operation Robot Co., Ltd.(上海微创医疗机器人(集团)股份有限公司)

专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract)

AI总结 提出视觉-语言程序化推理框架,利用多模态大模型实时理解视觉上下文,动态调整奖励权重,实现单策略适应复杂血管导航任务,提升可靠性与效率。

Comments This paper has been accepted by IEEE/RSJ IROS 2026. 7 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07172 2026-06-08 cs.CV cs.AI cs.CL cs.LG 新提交 75%

Textual Supervision Enhances Geospatial Representations in Vision-Language Models

文本监督增强视觉-语言模型中的地理空间表示

Marcelo Sartori Locatelli, Fernando Tonucci, Jea Kwon, Luiz Felipe Vecchietti, Bryan Nathanael Wijaya, Cheng Yaw Low, Virgilio Almeida, Meeyoung Cha

机构 * University of São Paulo(圣保罗大学) National University of Singapore(新加坡国立大学)

专题命中 图文多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究视觉、视觉-语言及多模态模型的地理空间表示能力,发现文本监督能有效提升空间编码,推动地理空间AI发展。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17249 2026-06-05 cs.RO 75%

SEDualVLN: A Spatially-Enhanced Dual-System for Vision-Language Navigation

SEDualVLN:一种空间增强的双系统用于视觉语言导航

Jingzhi Huang, Junkai Huang, Wenxuan Song, Haoyang Yang, Hailong Huang, Haoang Li, Yi Wang

机构 * Hong Kong Polytechnic University(香港理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract)

AI总结 本文提出SEDualVLN,一种空间增强的双系统框架,用于解决视觉语言导航中的长距离导航和动态推理问题,通过两个系统协同工作实现高效导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22655 2026-05-28 cs.AI cs.CV cs.MM 75%

Text-Only Data Synthesis for Vision Language Model Training

仅文本数据合成用于视觉语言模型训练

Xiaomin Yu, Wenjie Zhang, Ziyue Qiao, Chengwei Qin, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Great Bay University(大湾大学)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 提出一个跨集成的三阶段多模态数据合成框架,仅从文本生成高质量多模态训练数据,用于视觉语言模型的预训练和指令微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17499 2026-05-19 cs.LG 75%

t-gems: text-guided exit modules for decreasing clip image encoder

t-gems: 基于文本引导的退出模块用于减少clip图像编码器

Alberto Presta, Grzegorz Stefanski, Michal Byra, Krzysztof Arendt

机构 * Samsung AI Center Warsaw(三星AI中心华沙) Institute of Fundamental Technological Research, PAS, Warsaw(基础技术研究所,波兰科学院,华沙)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract)

AI总结 本文提出t-gems文本引导退出模块,通过利用编码器中间层的语义内容分布,减少clip图像编码器的计算成本,同时保持跨模态理解性能。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08942 2026-04-14 cs.CV cs.AI cs.CL cs.LG 75%

BiCLIP: Domain Canonicalization via Structured Geometric Transformation

BiCLIP:通过结构几何变换实现领域规范化

Pranav Mantini, Shishir K. Shah

机构 * University of Houston(休斯顿大学) The University of Oklahoma(俄克拉荷马大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 BiCLIP通过结构几何变换提升跨模态对齐,利用少量锚点样本实现领域规范化,实验表明其在11个基准测试中均取得最优性能。

Comments Accepted at Domain Generalization: Evolution, Breakthroughs, and Future Horizons Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15372 2026-01-16 cs.IR cs.AI cs.CV cs.LG cs.MM 75%

Image Complexity-Aware Adaptive Retrieval for Efficient Vision-Language Models

面向高效视觉-语言模型的图像复杂度感知自适应检索

Mikel Williams-Lekuona, Georgina Cosma

机构 * Computer Science, Loughborough University, Loughborough, UK(计算机科学,洛桑大学,洛桑,英国)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 ICAR通过自适应计算方法提升视觉-语言模型效率,实现高效图像-文本匹配与复杂度评估。

Comments Camera-ready version for ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20387 2026-01-14 cs.AI cs.CL cs.CV 75%

Generative Digital Twins: Vision-Language Simulation Models for Executable Industrial Systems

生成数字孪生:用于可执行工业系统的视觉-语言模拟模型

YuChe Hsu, AnJui Wang, TsaiChing Ni, YuanFu Yang

机构 * Institute of Artificial Intelligence Innovation(人工智能创新研究所)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出视觉-语言模拟模型VLSM,通过统一视觉与文本理解,实现从布局草图和自然语言提示生成可执行的工业模拟代码,建立首个大规模生成数字孪生数据集并提出三个专用评估指标。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12845 2025-10-16 cs.CL cs.AI cs.CV cs.RO 75%

VLURes: Benchmarking VLM Visual and Linguistic Understanding in Low-Resource Languages

Jesse Atuhurra, Iqra Ali, Tomoya Iwakura, Hidetaka Kamigaito, Tatsuya Hiraoka

专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10075 2025-08-26 cs.CV cs.AI cs.LG cs.MM 75%

Robust Change Captioning in Remote Sensing: SECOND-CC Dataset and MModalCC Framework

Ali Can Karaca, M. Enes Ozelbas, Saadettin Berber, Orkhan Karimli, Turabi Yildirim, M. Fatih Amasyali

机构 * Department of Computer Engineering, Yildiz Technical University(计算机工程系,伊兹密尔技术大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments This work has been submitted to the IEEE Transactions on Geoscience and Remote Sensing journal for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09199 2025-08-14 cs.CV cs.AI cs.CL 75%

$Δ$-AttnMask: Attention-Guided Masked Hidden States for Efficient Data Selection and Augmentation

Jucheng Hu, Suorong Yang, Dongzhan Zhou

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14908 2025-07-18 cs.CV cs.AI cs.CL cs.LG 75%

SegSub: Evaluating Robustness to Knowledge Conflicts and Hallucinations in Vision-Language Models

Peter Carragher, Nikitha Rao, Abhinand Jha, R Raghav, Kathleen M. Carley

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Journal ref MisD 2025: 1st Workshop on Misinformation Detection in the Era of LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.13155 2025-06-19 cs.CV cs.CL cs.MM 75%

Bi-VLDoc: Bidirectional Vision-Language Modeling for Visually-Rich Document Understanding

Chuwei Luo, Guozhi Tang, Qi Zheng, Cong Yao, Lianwen Jin, Chenliang Li, Yang Xue, Luo Si

机构 * Alibaba Group(阿里巴巴集团) School of Electronic and Information Engineering(电子与信息工程学院) South China University of Technology(华南理工大学)

专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.MM

Comments IJDAR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11073 2025-06-16 cs.CL cs.AI cs.CV 75%

CLAIM: Mitigating Multilingual Object Hallucination in Large Vision-Language Models with Cross-Lingual Attention Intervention

Zekai Ye, Qiming Li, Xiaocheng Feng, Libo Qin, Yichong Huang, Baohang Li, Kui Jiang, Yang Xiang, Zhirui Zhang, Yunfei Lu, Duyu Tang, Dandan Tu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Central South University(中南大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments ACL2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10997 2025-06-10 cs.CL cs.AI cs.CV 75%

RONA: Pragmatically Diverse Image Captioning with Coherence Relations

Aashish Anantha Ramakrishnan, Aadarsh Anantha Ramakrishnan, Dongwon Lee

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) National Institute of Technology, Tiruchirappalli(特里奇里帕利理工学院)

专题命中 图文多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted in the NAACL Fourth Workshop on Intelligent and Interactive Writing Assistants (In2Writing), Albuquerque, New Mexico, May 2025, https://in2writing.glitch.me

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23083 2025-06-02 cs.CV cs.AI cs.CL 75%

Efficient Adaptation For Remote Sensing Visual Grounding

Hasan Moughnieh, Mohamad Chalhoub, Hasan Nasrallah, Cristiano Nattero, Paolo Campanella, Giovanni Nico, Ali J. Ghandour

机构 * American University of Beirut(贝鲁特美国大学) Lebanese University(黎巴嫩大学) RASID SARL WASDI Institute for Applied Mathematics, CNR Bari(应用数学研究所,CNR巴里) National Center for Remote Sensing, CNRS(遥感国家中心,CNRS)

专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12661 2025-04-24 cs.AI cs.CL cs.CV 75%

MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants

Hritik Bansal, Daniel Israel, Siyan Zhao, Shufan Li, Tung Nguyen, Aditya Grover

机构 * University of California Los Angeles(加州大学洛杉矶分校)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01814 2025-03-27 cs.CV cs.AI cs.CL cs.LG 75%

COSMOS: Cross-Modality Self-Distillation for Vision Language Pre-training

Sanghwan Kim, Rui Xiao, Mariana-Iuliana Georgescu, Stephan Alaniz, Zeynep Akata

专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03871 2025-03-24 cs.CV cs.AI cs.ET cs.IR cs.MM 75%

CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance

Chu Myaet Thwal, Ye Lin Tun, Minh N. H. Nguyen, Eui-Nam Huh, Choong Seon Hong

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI、cs.MM

Comments 14 pages, 5 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03987 2025-03-07 cs.CV cs.AI cs.CL cs.LG 75%

RetinalGPT: A Retinal Clinical Preference Conversational Assistant Powered by Large Vision-Language Models

Wenhui Zhu, Xin Li, Xiwen Chen, Peijie Qiu, Vamsi Krishna Vasa, Xuanzhao Dong, Yanxi Chen, Natasha Lepore, Oana Dumitrascu, Yi Su, Yalin Wang

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15481 2025-02-24 cs.ET eess.SP 75%

FaultGPT: Industrial Fault Diagnosis Question Answering System by Vision Language Models

Jiao Chen, Ruyi Huang, Zuohong Lv, Jianhua Tang, Weihua Li

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00437 2025-01-03 cs.CV cs.CL cs.LG cs.MM 75%

Unleashing Text-to-Image Diffusion Prior for Zero-Shot Image Captioning

Jianjie Luo, Jingwen Chen, Yehao Li, Yingwei Pan, Jianlin Feng, Hongyang Chao, Ting Yao

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.MM

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15207 2024-11-26 cs.CV cs.AI cs.CL cs.LG 75%

Uni-Mlip: Unified Self-supervision for Medical Vision Language Pre-training

Ameera Bawazir, Kebin Wu, Wenbin Li

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 15 pages, 2 figures, accepted by BMVC'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00997 2024-11-05 cs.CV cs.AI cs.CL cs.CY 75%

Identifying Implicit Social Biases in Vision-Language Models

Kimia Hamidieh, Haoran Zhang, Walter Gerych, Thomas Hartvigsen, Marzyeh Ghassemi

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16244 2024-07-24 cs.CV cs.AI cs.MM 75%

HSVLT: Hierarchical Scale-Aware Vision-Language Transformer for Multi-Label Image Classification

Shuyi Ouyang, Hongyi Wang, Ziwei Niu, Zhenjia Bai, Shiao Xie, Yingying Xu, Ruofeng Tong, Yen-Wei Chen, Lanfen Lin

专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments 10 pages, 6 figures

Journal ref Proceedings of the 31st ACM International Conference on Multimedia. 2023: 4768-4777

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09454 2024-06-17 cs.CL cs.AI cs.CV q-bio.QM 75%

Advancing High Resolution Vision-Language Models in Biomedicine

Zekai Chen, Arda Pekis, Kevin Brown

专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03744 2024-05-17 cs.CV cs.AI cs.CL cs.LG 75%

Improved Baselines with Visual Instruction Tuning

Haotian Liu, Chunyuan Li, Yuheng Li, Yong Jae Lee

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Camera ready, CVPR 2024 (highlight). LLaVA project page: https://llava-vl.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12973 2024-05-07 cs.CV cs.AI cs.CL cs.LG 75%

Frozen Transformers in Language Models Are Effective Visual Encoder Layers

Ziqi Pang, Ziyang Xie, Yunze Man, Yu-Xiong Wang

专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments ICLR 2024 Spotlight. 23 pages, 13 figures. Code at https://github.com/ziqipang/LM4VisualEncoding

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11490 2024-03-19 cs.CV cs.AI cs.CL cs.LG 75%

LLM-CXR: Instruction-Finetuned LLM for CXR Image Understanding and Generation

Suhyeon Lee, Won Jun Kim, Jinho Chang, Jong Chul Ye

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 21 pages, 8 figures; ICLR 2024 (poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11971 2024-03-04 cs.CV cs.CL cs.LG cs.MM 75%

EVE: Efficient Vision-Language Pre-training with Masked Prediction and Modality-Aware MoE

Junyi Chen, Longteng Guo, Jia Sun, Shuai Shao, Zehuan Yuan, Liang Lin, Dongyu Zhang

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.MM

Comments Accepted by AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏