arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 45832 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4634 篇

2504.19443 2025-04-29 cs.CV cs.AI 81%

CLIP-KOA: Enhancing Knee Osteoarthritis Diagnosis with Multi-Modal Learning and Symmetry-Aware Loss Functions

Yejin Jeong, Donghun Lee

机构 * Department of Mathematics, Korea University(数学系,韩国大学)

专题命中 图文多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19127 2025-04-29 cs.CV cs.MM 81%

DeepSPG: Exploring Deep Semantic Prior Guidance for Low-light Image Enhancement with Multimodal Learning

Jialang Lu, Huayu Zhao, Huiyu Zhai, Xingxing Yang, Shini Han

机构 * School of Cyber Science and Technology, Hubei University(湖北大学计算机科学与技术学院) Department of Electrical Automation Design, Beijing Shougang International Engineering Technology(北京首钢国际工程技术部) School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学部) School of Computer Science and Technology, Harbin University of Science and Technology(哈尔滨理工大学计算机科学与技术学院)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM

Comments Accepted by ICMR 2025 Main track. Code is available at https://github.com/Wenyuzhy/DeepSPG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17826 2025-04-28 cs.CV cs.AI 81%

FashionM3: Multimodal, Multitask, and Multiround Fashion Assistant based on Unified Vision-Language Model

Kaicheng Pang, Xingxing Zou, Waikeung Wong

机构 * Laboratory for Artificial Intelligence in Design(人工智能设计实验室) School of Fashion and Textiles(时尚与纺织学院)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18203 2025-04-24 cs.CV cs.CL 81%

Critic-V: VLM Critics Help Catch VLM Errors in Multimodal Reasoning

Di Zhang, Junxian Li, Jingdi Lei, Xunzhi Wang, Yujie Liu, Zonglin Yang, Jiatong Li, Weida Wang, Suorong Yang, Jianbo Wu, Peng Ye, Wanli Ouyang, Dongzhan Zhou

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) Nankai University(南开大学) Shanghai University(上海大学) Nanyang Technological University(南洋理工大学) Hong Kong Polytechnic University(香港理工大学) Tongji University(同济大学) Nanjing University(南京大学) University of California, Merced(加州大学梅德福分校) Chinese University of Hong Kong(香港中文大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13351 2025-04-21 cs.RO cs.AI cs.HC cs.LG cs.MM 81%

Chain-of-Modality: Learning Manipulation Programs from Multimodal Human Videos with Vision-Language-Models

Chen Wang, Fei Xia, Wenhao Yu, Tingnan Zhang, Ruohan Zhang, C. Karen Liu, Li Fei-Fei, Jie Tan, Jacky Liang

机构 * Google DeepMind(谷歌DeepMind) Stanford University(斯坦福大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI、cs.MM

Comments ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07521 2025-04-18 cs.AI cs.MM 81%

Why We Feel: Breaking Boundaries in Emotional Reasoning with Multimodal Large Language Models

Yuxiang Lin, Jingdong Sun, Zhi-Qi Cheng, Jue Wang, Haomin Liang, Zebang Cheng, Yifei Dong, Jun-Yan He, Xiaojiang Peng, Xian-Sheng Hua

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI、cs.MM

Comments Accepted at CVPR Workshop NEXD 2025. 21 pages, Project: https://github.com/Lum1104/EIBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12879 2025-04-17 cs.CL cs.AI cs.LG 81%

Large Visual-Language Models Are Also Good Classifiers: A Study of In-Context Multimodal Fake News Detection

Ye Jiang, Yimin Wang

专题命中 图文多模态 :multimodal(title);cross-modal(abstract);分类 cs.CL、cs.AI

Comments Withdraw for new experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07643 2025-04-11 cs.IR cs.CL cs.CV 81%

CollEX -- A Multimodal Agentic RAG System Enabling Interactive Exploration of Scientific Collections

Florian Schneider, Narges Baba Ahmadi, Niloufar Baba Ahmadi, Iris Vogel, Martin Semmann, Chris Biemann

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04903 2025-04-09 cs.CV cs.AI 81%

Lumina-OmniLV: A Unified Multimodal Framework for General Low-Level Vision

Yuandong Pu, Le Zhuo, Kaiwen Zhu, Liangbin Xie, Wenlong Zhang, Xiangyu Chen, Peng Gao, Yu Qiao, Chao Dong, Yihao Liu

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05299 2025-04-08 cs.AI cs.CV 81%

SmolVLM: Redefining small and efficient multimodal models

Andrés Marafioti, Orr Zohar, Miquel Farré, Merve Noyan, Elie Bakouch, Pedro Cuenca, Cyril Zakka, Loubna Ben Allal, Anton Lozhkov, Nouamane Tazi, Vaibhav Srivastav, Joshua Lochner, Hugo Larcher, Mathieu Morlon, Lewis Tunstall, Leandro von Werra, Thomas Wolf

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14538 2025-04-02 eess.IV cs.AI cs.CV cs.LG 81%

Vision-Language Models for Acute Tuberculosis Diagnosis: A Multimodal Approach Combining Imaging and Clinical Data

Ananya Ganapthy, Praveen Shastry, Naveen Kumarasami, Anandakumar D, Keerthana R, Mounigasri M, Varshinipriya M, Kishore Prasath Venkatesh, Bargava Subramanian, Kalyan Sivasailam

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14694 2025-03-20 cs.CL cs.CV 81%

HaploVL: A Single-Transformer Baseline for Multi-Modal Understanding

Rui Yang, Lin Song, Yicheng Xiao, Runhui Huang, Yixiao Ge, Ying Shan, Hengshuang Zhao

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12446 2025-03-18 cs.CV cs.AI 81%

BREEN: Bridge Data-Efficient Encoder-Free Multimodal Learning with Learnable Queries

Tianle Li, Yongming Rao, Winston Hu, Yu Cheng

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06232 2025-03-18 cs.CL cs.CV 81%

Integrating Chain-of-Thought for Multimodal Alignment: A Study on 3D Vision-Language Learning

Yanjun Chen, Yirong Sun, Xinghao Chen, Jian Wang, Xiaoyu Shen, Wenjie Li, Wei Zhang

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08967 2025-03-18 cs.CV cs.AI 81%

PathM3: A Multimodal Multi-Task Multiple Instance Learning Framework for Whole Slide Image Classification and Captioning

Qifeng Zhou, Wenliang Zhong, Yuzhi Guo, Michael Xiao, Hehuan Ma, Junzhou Huang

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06486 2025-03-11 cs.CV cs.AI 81%

PerturboLLaVA: Reducing Multimodal Hallucinations with Perturbative Visual Training

Cong Chen, Mingyu Liu, Chenchen Jing, Yizhou Zhou, Fengyun Rao, Hao Chen, Bo Zhang, Chunhua Shen

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12932 2025-03-11 cs.CV cs.AI 81%

CoMT: A Novel Benchmark for Chain of Multi-modal Thought on Large Vision-Language Models

Zihui Cheng, Qiguang Chen, Jin Zhang, Hao Fei, Xiaocheng Feng, Wanxiang Che, Min Li, Libo Qin

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI

Comments Accepted at AAAI 2025; Project Page: https://github.com/czhhzc/CoMT

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11176 2025-03-11 cs.CV cs.CL 81%

Quality-Aware Image-Text Alignment for Opinion-Unaware Image Quality Assessment

Lorenzo Agnolucci, Leonardo Galteri, Marco Bertini

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03321 2025-03-06 cs.CV cs.AI 81%

See What You Are Told: Visual Attention Sink in Large Multimodal Models

Seil Kang, Jinyeong Kim, Junhyeok Kim, Seong Jae Hwang

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20420 2025-03-03 cs.CL cs.CV 81%

Chitranuvad: Adapting Multi-Lingual LLMs for Multimodal Translation

Shaharukh Khan, Ayush Tarun, Ali Faraz, Palash Kamble, Vivek Dahiya, Praveen Pokala, Ashish Kulkarni, Chandra Khatri, Abhinav Ravi, Shubham Agarwal

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Journal ref https://aclanthology.org/2024.wmt-1.80/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14906 2025-02-24 cs.CL cs.AI 81%

Beyond Words: Exploring Cultural Value Sensitivity in Multimodal Models

Srishti Yadav, Zhi Zhang, Daniel Hershcovich, Ekaterina Shutova

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

Journal ref NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17237 2025-02-20 cs.CV cs.CL 81%

MVAM: Multi-View Attention Method for Fine-grained Image-Text Matching

Wanqing Cui, Rui Cheng, Jiafeng Guo, Xueqi Cheng

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.CL

Comments Published as a conference paper at ECIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11288 2025-02-18 cs.CL cs.CV 81%

MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models

Shengkang Wang, Hongzhan Lin, Ziyang Luo, Zhen Ye, Guang Chen, Jing Ma

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

Comments 28 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10642 2025-02-18 cs.AI cs.CV 81%

Demographic User Modeling for Social Robotics with Multimodal Pre-trained Models

Hamed Rahimi, Mouad Abrini, Mahdi Khoramshahi, Mohamed Chetouani

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11403 2025-02-03 cs.CL cs.IR cs.MM 81%

Verifying Cross-modal Entity Consistency in News using Vision-language Models

Sahar Tahmasebi, David Ernst, Eric Müller-Budack, Ralph Ewerth

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CL、cs.MM

Comments Accepted for publication in: European Conference on Information Retrieval (ECIR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17654 2025-01-30 cs.CL cs.AI 81%

Exploring Vision Language Models for Multimodal and Multilingual Stance Detection

Jake Vasilakes, Carolina Scarton, Zhixue Zhao

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments Submitted to the International AAAI Conference on Web and Social Media (ICWSM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17759 2024-12-24 cs.AI cs.CV cs.LG 81%

Survey of Large Multimodal Model Datasets, Application Categories and Taxonomy

Priyaranjan Pattnayak, Hitesh Laxmichand Patel, Bhargava Kumar, Amit Agarwal, Ishan Banerjee, Srikant Panda, Tejaswini Kumar

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13702 2024-12-20 cs.CL cs.AI 81%

Typhoon 2: A Family of Open Text and Multimodal Thai Large Language Models

Kunat Pipatanakul, Potsawee Manakul, Natapong Nitarach, Warit Sirichotedumrong, Surapon Nonesung, Teetouch Jaknamon, Parinthapat Pengpun, Pittawat Taveekitworachai, Adisai Na-Thalang, Sittipong Sripaisarnmongkol, Krisanapong Jirayoot, Kasima Tharnpipitchai

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments technical report, 55 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13794 2024-12-19 cs.CL cs.AI cs.CY 81%

MATCHED: Multimodal Authorship-Attribution To Combat Human Trafficking in Escort-Advertisement Data

Vageesh Saxena, Benjamin Bashpole, Gijs Van Dijck, Gerasimos Spanakis

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10707 2024-12-17 cs.CV cs.MM 81%

MambaPro: Multi-Modal Object Re-Identification with Mamba Aggregation and Synergistic Prompt

Yuhao Wang, Xuehu Liu, Tianyu Yan, Yang Liu, Aihua Zheng, Pingping Zhang, Huchuan Lu

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV、cs.MM

Comments This work is accepted by AAAI2025. More modifications may be performed

详情

展开后加载摘要…

URL PDF HTML 收藏