arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 45832 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4634 篇

2605.11959 2026-05-13 cs.CV cs.CL 84%

Multimodal Abstractive Summarization of Instructional Videos with Vision-Language Models

基于视觉语言模型的指令视频多模态抽象摘要

Maham Nazir, Muhammad Aqeel, Richong Zhang, Francesco Setti

机构 * Beihang University, Beijing, China(北航大学,北京,中国) University of Verona, Italy(威尼斯大学,意大利)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL

AI总结 本文提出ClipSum框架,利用冻结的CLIP视觉语言特征进行指令视频摘要,通过显式时间建模和维度自适应融合,实现视觉与语言的语义对齐,实验显示其在YouCook2数据集上表现优于传统方法。

Comments Accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14044 2026-05-01 cs.CV cs.AI 84%

OmniDrive-R1: Reinforcement-driven Interleaved Multi-modal Chain-of-Thought for Trustworthy Vision-Language Autonomous Driving

OmniDrive-R1: 基于强化学习的交错多模态链式推理用于可信的视觉-语言自动驾驶

Zhenguo Zhang, Haohan Zheng, Yishen Wang, Le Xu, Tianchen Deng, Xuefeng Chen, Qu Chen, Bo Zhang, Wuxiong Huang

机构 * ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) MEGVII Technology(美科维七科技) AFARI

专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出OmniDrive-R1,通过交错多模态链式推理机制统一感知与推理,引入强化驱动的视觉 grounding 能力,提升自动驾驶中的推理准确性和稳定性,实验显示其在DriveLMM-o1数据集上的表现显著优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27712 2026-05-01 cs.CV cs.CL 84%

Linguistically Informed Multimodal Fusion for Vietnamese Scene-Text Image Captioning: Dataset, Graph Framework, and Phonological Attention

具有语言信息的多模态融合用于越南语场景文本图像描述:数据集、图框架和语音注意力

Nhi Ngoc-Yen Nguyen, Anh-Duc Nguyen, Nghia Hieu Nguyen, Kiet Van Nguyen, Ngan Luu-Thuy Nguyen

机构 * Faculty of Information Science and Engineering(信息科学与工程学院) University of Information Technology(信息技术大学) Vietnam National University(越南国家大学)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出HSTFG和PhonoSTFG框架,通过图拓扑分析发现跨模态边对场景文本融合有害,并构建首个大规模越南语场景文本描述数据集ViTextCaps,揭示52.8%词汇存在声调符号冲突风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07605 2026-04-28 cs.CV cs.AI 84%

Fine-R1: Make Multi-modal LLMs Excel in Fine-Grained Visual Recognition by Chain-of-Thought Reasoning

Fine-R1: 通过链式推理使多模态大语言模型在细粒度视觉识别中脱颖而出

Hulingxiao He, Zijun Geng, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology(王轩计算机技术研究所)

专题命中 图文多模态 :multi-modal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 Fine-R1通过链式推理监督微调和三元组增强策略优化,提升多模态大语言模型在细粒度视觉识别中的表现,仅用4次训练即超越现有模型。

Comments Published as a conference paper at ICLR 2026. The models are available at https://huggingface.co/collections/StevenHH2000/fine-r1

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18757 2026-04-22 cs.CV cs.AI 84%

REVEAL: Multimodal Vision-Language Alignment of Retinal Morphometry and Clinical Risks for Incident AD and Dementia Prediction

REVEAL:多模态视图-语言对齐的视网膜形态学与临床风险预测

Seowung Leem, Lin Gu, Chenyu You, Kuang Gong, Ruogu Fang

机构 * J. Crayton Pruitt Family Department of Biomedical Engineering, University of Florida(佛罗里达大学J. Crayton Pruitt家族生物医学工程系) Research Institute of Electrical Communication, Tohoku University(东北大学电气通信研究所) Department of Applied Mathematics & Statistics, Stony Brook University(石溪大学应用数学与统计学系) Department of Computer Science, Stony Brook University(石溪大学计算机科学系)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 REVEAL通过多模态对齐视网膜形态学与临床风险因素,提前8年预测阿尔茨海默病和痴呆症,优于现有模型。

Comments Accepted for publication a MIDL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16979 2026-04-21 cs.CV cs.CL 84%

DOSE: Data Selection for Multi-Modal LLMs via Off-the-Shelf Models

DOSE: 通过现成模型进行多模态大语言模型的数据选择

Biao Wu, Yiwu Zhong, Meng Fang, Ling Chen

机构 * Australian Artificial Intelligence Institute(澳大利亚人工智能研究所) Peking University(北京大学) University of Liverpool(利物浦大学)

专题命中 图文多模态 :multi-modal(title);multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL

AI总结 本文提出DOSE方法,利用现成预训练模型筛选多模态数据,提升数据质量和对齐性,减少计算成本,增强数据多样性,使模型在标准VQA和数学基准测试中表现优异。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08261 2026-04-16 cs.CV cs.AI 84%

DBMF: A Dual-Branch Multimodal Framework for Out-of-Distribution Detection

DBMF:一种用于分布外检测的双分支多模态框架

Jiangbei Yue, Darren Treanor, Venkataraman Subramanian, Sharib Ali

机构 * University of Leeds(利兹大学)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DBMF框架,通过双分支利用多模态信息提升分布外检测性能,实验表明其在不同模型架构下鲁棒性强,性能提升达24.84%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12537 2026-04-15 cs.CV cs.AI 84%

MODIX: A Training-Free Multimodal Information-Driven Positional Index Scaling for Vision-Language Models

MODIX:一种无需训练的多模态信息驱动的位置索引缩放

Ruoxiang Huang, Zhen Yuan

机构 * Peking University(北京大学)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 MODIX通过动态调整位置步长,基于模态特定贡献优化多模态模型的位置编码,提升多模态推理能力。

Comments Accepted by CVPR 2026 (Highlight). 10 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10460 2026-04-14 cs.CV cs.AI cs.CR cs.ET 84%

Toward Accountable AI-Generated Content on Social Platforms: Steganographic Attribution and Multimodal Harm Detection

迈向社交平台可问责的AI生成内容:隐写术溯源与多模态危害检测

Xinlei Guan, David Arosemena, Tejaswi Dhandu, Kuan Huang, Meng Xu, Miles Q. Li, Bingyu Shen, Ruiyang Qin, Umamaheswara Rao Tida, Boyang Li

机构 * Kean University(基恩大学) North Dakota State University(北达科他州立大学) McGill University(麦吉尔大学) Villanova University(维拉诺瓦大学) University of Notre Dame(圣母大学)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种隐写术溯源框架,结合多模态危害检测,用于追踪AI生成图像的有害部署,提升合成媒体环境中的问责能力。

Comments 12 pages, 31 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05930 2026-04-08 cs.CL cs.AI 84%

"I See What You Did There": Can Large Vision-Language Models Understand Multimodal Puns?

我看出你在那儿:大型视觉-语言模型能否理解多模态双关语?

Naen Xu, Jiayi Sheng, Changjiang Li, Chunyi Zhou, Yuyuan Li, Tianyu Du, Jun Wang, Zhihui Fu, Jinbao Li, Shouling Ji

机构 * Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Palo Alto Networks Hangzhou Dianzi University(杭州电子科技大学) Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心) OPPO Research Institute(OPPO研究院) Qilu University of Technology(齐鲁工业大学)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大型视觉-语言模型理解多模态双关语的能力,提出多模态双关语生成流程和MultiPun数据集,通过评估发现模型在区分真实双关语与干扰项上表现不足,并提出提示级和模型级策略提升理解性能。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20089 2026-03-03 cs.CV cs.AI 84%

StructXLIP: Enhancing Vision-language Models with Multimodal Structural Cues

StructXLIP: 通过多模态结构线索增强视觉-语言模型

Zanxi Ruan, Songqun Gao, Qiuyu Kong, Yiming Wang, Marco Cristani

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 StructXLIP通过引入多模态结构线索提升视觉-语言模型的跨模态检索性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23863 2026-03-02 cs.CV cs.CL 84%

NAU-QMUL: Utilizing BERT and CLIP for Multi-modal AI-Generated Image Detection

NAU-QMUL: 利用BERT和CLIP进行多模态AI生成图像检测

Xiaoyu Guo, Arkaitz Zubiaga

机构 * School of Accounting, Nanjing Audit University (NAU), Nanjing, Jiangsu, China(会计学院,南京审计大学(NAU)) School of Electronic Engineering and Computer Science, Queen Mary University of London (QMUL), London, UK(电子工程与计算机科学学院,女王玛丽大学(QMUL))

专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 NAU-QMUL利用BERT和CLIP进行多模态AI生成图像检测,通过跨模态特征融合和多任务损失函数提升检测性能,在竞赛中取得佳绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23588 2026-03-02 cs.CV cs.AI cs.LG 84%

Hyperdimensional Cross-Modal Alignment of Frozen Language and Image Models for Efficient Image Captioning

高维跨模态对齐冻结语言和图像模型以实现高效的图像描述生成

Abhishek Dalvi, Vasant Honavar

机构 * Artificial Intelligence Research Laboratory(人工智能研究实验室) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 图文多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 HDFLIM通过冻结语言和图像模型的高维计算实现高效的图像描述生成,无需参数调优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22678 2026-02-27 cs.CV cs.AI 84%

ViCLIP-OT: The First Foundation Vision-Language Model for Vietnamese Image-Text Retrieval with Optimal Transport

ViCLIP-OT:首个面向越南语图像-文本检索的视觉-语言基础模型,结合最优传输

Quoc-Khang Tran, Minh-Thien Nguyen, Nguyen-Khang Pham

机构 * Can Tho University(金兰大学)

专题命中 图文多模态 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 ViCLIP-OT通过整合CLIP对比学习与SIGROT损失,提升越南语图像-文本检索性能,实现域内和零样本设置下的显著改进。

Comments Preprint submitted to Expert Systems with Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20330 2026-02-25 cs.CV cs.AI cs.LG 84%

Circuit Tracing in Vision-Language Models: Understanding the Internal Mechanisms of Multimodal Thinking

视觉-语言模型中的电路追踪:理解多模态思维的内部机制

Jingcheng Yang, Tianhu Xiong, Shengyi Qian, Klara Nahrstedt, Mingyuan Wu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出首个透明电路追踪框架,用于分析视觉-语言模型的多模态推理机制,揭示不同视觉特征电路在数学推理和跨模态关联中的作用。

Comments To appear in the Findings of CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15690 2026-02-24 cs.CV cs.CL 84%

MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping

通过动态专家跳过加速混合专家多模态大语言模型

Yushi Huang, Zining Wang, Zhihang Yuan, Yifu Ding, Ruihao Gong, Jinyang Guo, Xianglong Liu, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学) Beihang University(北航) Peking University(北京大学)

专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 MoDES通过动态专家跳过机制提升多模态大语言模型的推理效率和准确性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00662 2026-01-27 cs.CV cs.CL cs.LG 84%

Mitigating the Modality Gap: Few-Shot Out-of-Distribution Detection with Multi-modal Prototypes and Image Bias Estimation

弥合模态差距:基于多模态原型和图像偏差估计的少样本分布外检测

Yimu Wang, Evelien Riddell, Adrian Chow, Sean Sedwards, Krzysztof Czarnecki

机构 * University of Waterloo(滑铁卢大学)

专题命中 图文多模态 :multi-modal(title);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL

AI总结 本文提出SUPREME框架,通过引入多模态原型和图像偏差估计,有效缓解图像与文本之间的模态差距,提升少样本分布外检测性能。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20114 2026-01-19 cs.IR cs.AI cs.CV 84%

FiCo-ITR: bridging fine-grained and coarse-grained image-text retrieval for comparative performance analysis

FiCo-ITR:弥合细粒度与粗粒度图像-文本检索以进行性能比较分析

Mikel Williams-Lekuona, Georgina Cosma

专题命中 图文多模态 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 FiCo-ITR通过标准化评估方法,对比细粒度与粗粒度图像-文本检索模型的性能与效率权衡,为模型选择和混合系统研究提供依据。

Comments Published at the International Journal of Multimedia Information Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06566 2026-01-13 cs.CV cs.AI 84%

QCaption: Video Captioning and Q&A through Fusion of Large Multimodal Models

QCaption: 通过融合大多模态模型实现视频描述与问答

Jiale Wang, Gee Wah Ng, Lee Onn Mak, Randall Cher, Ng Ding Hei Ryan, Davis Wang

机构 * Department of Computer Science and Engineering, Nanyang Technological University, Singapore(南洋理工大学计算机科学与工程系)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 QCaption通过融合关键帧提取、多模态模型和语言模型,提升视频描述和问答任务的性能,实现44.2%和48.9%的改进。

Journal ref Proceedings of the 27th International Conference on Information Fusion (FUSION), 2024, pp. 1-8

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04777 2026-01-09 cs.CV cs.AI 84%

GeM-VG: Towards Generalized Multi-image Visual Grounding with Multimodal Large Language Models

GeM-VG:迈向通用多图像视觉 grounding 的多模态大语言模型

Shurong Zheng, Yousong Zhu, Hongyin Zhao, Fan Yang, Yufei Zhan, Ming Tang, Jinqiao Wang

专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 GeM-VG通过引入MG-Data-240K数据集和混合强化微调策略,提升多图像视觉 grounding 和通用多图像理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18747 2025-12-23 cs.CV cs.AI 84%

IPCV: Information-Preserving Compression for MLLM Visual Encoders

IPCV:信息保留的多模态大语言模型视觉编码器压缩

Yuan Chen, Zichen Wen, Yuzhou Wu, Xuyang Liu, Shuang Chen, Junpeng Ma, Weijia Li, Conghui He, Linfeng Zhang

机构 * EPIC Lab, SJTU(上海交通大学EPIC实验室) CityU(城市大学) Shanghai AI Laboratory(上海人工智能实验室) University of Sheffield(谢菲尔德大学) SCU(上海科技大学) FDU(福建大学) SYSU(南方科技大学)

专题命中 图文多模态 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 IPCV通过邻居引导重建和注意力稳定化技术,实现无需训练的多模态大语言模型视觉编码器高效压缩,有效降低计算成本并提升性能。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18660 2025-12-23 cs.CV cs.LG cs.MM 84%

PMPGuard: Catching Pseudo-Matched Pairs in Remote Sensing Image-Text Retrieval

PMPGuard: 捕获遥感图像-文本检索中的伪匹配对

Pengxiang Ouyang, Qing Ma, Zheng Wang, Cong Bai

专题命中 图文多模态 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 PMPGuard通过跨模态门控注意力和正负意识注意力机制,有效捕捉遥感图像-文本检索中的伪匹配对,提升跨模态对齐的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03542 2025-12-04 cs.CV cs.AI 84%

V-ITI: Mitigating Hallucinations in Multimodal Large Language Models via Visual Inference-Time Intervention

V-ITI: 通过视觉推理时间干预缓解多模态大语言模型中的幻觉

Nan Sun, Zhenyu Zhang, Xixun Lin, Kun Wang, Yanmin Shang, Naibin Gu, Shuohuan Wang, Yu Sun, Hua Wu, Haifeng Wang, Yanan Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Baidu Inc.(百度公司)

专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 V-ITI通过视觉推理时间干预框架,有效缓解多模态大语言模型中的视觉相关幻觉问题,同时保持任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21002 2025-11-27 cs.CV cs.AI 84%

Knowledge Completes the Vision: A Multimodal Entity-aware Retrieval-Augmented Generation Framework for News Image Captioning

知识完善视觉:一种多模态实体感知检索增强生成框架用于新闻图像描述

Xiaoxing You, Qiang Huang, Lingyu Li, Chi Zhang, Xiaopeng Liu, Min Zhang, Jun Yu

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 MERGE提出了一种多模态实体感知检索增强生成框架,通过构建实体中心知识库和改进跨模态对齐,提升新闻图像描述质量和命名实体识别性能。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12972 2025-11-24 cs.CV cs.AI 84%

Aligning Vision to Language: Annotation-Free Multimodal Knowledge Graph Construction for Enhanced LLMs Reasoning

对齐视觉与语言:无需注释的多模态知识图谱构建以增强大语言模型推理

Junming Liu, Siyuan Meng, Yanting Gao, Song Mao, Pinlong Cai, Guohang Yan, Yirong Chen, Zilin Bian, Ding Wang, Botian Shi

机构 * Tongji University(同济大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) Stanford University(斯坦福大学) New York University(纽约大学)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出 VaLiK 方法,通过跨模态信息补充构建无需注释的多模态知识图谱,提升大语言模型推理能力。

Comments 14 pages, 7 figures, 6 tables; Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13005 2025-11-18 cs.CV cs.AI 84%

SAGE: Spuriousness-Aware Guided Prompt Exploration for Mitigating Multimodal Bias

Wenqian Ye, Di Wang, Guangtao Zheng, Bohan Liu, Aidong Zhang

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08971 2025-11-13 cs.HC cs.CV cs.MM 84%

Plug-and-Play Clarifier: A Zero-Shot Multimodal Framework for Egocentric Intent Disambiguation

Sicheng Yang, Yukai Huang, Weitong Cai, Shitong Sun, You He, Jiankang Deng, Hang Zhang, Jifei Song, Zhensong Zhang

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM

Comments 16 pages, 9 figures, AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07080 2025-11-11 cs.CL cs.AI 84%

Wasm: A Pipeline for Constructing Structured Arabic Interleaved Multimodal Corpora

Khalil Hennara, Ahmad Bastati, Muhammad Hreden, Mohamed Motasim Hamed, Zeina Aldallal, Sara Chrouf, Safwan AlModhayan

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00427 2025-11-04 cs.CV cs.AI 84%

Leveraging Hierarchical Image-Text Misalignment for Universal Fake Image Detection

Daichi Zhang, Tong Zhang, Jianmin Bao, Shiming Ge, Sabine Süsstrunk

机构 * School of Computer and Communication Sciences, EPFL(瑞士联邦理工学院计算机与通信科学学院) Microsoft Research Asia(微软亚洲研究院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 图文多模态 :image-text(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04448 2025-10-31 cs.CV cs.MM 84%

TRUST-VL: An Explainable News Assistant for General Multimodal Misinformation Detection

Zehong Yan, Peng Qi, Wynne Hsu, Mong Li Lee

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM

Comments EMNLP 2025 Oral; Project Homepage: https://yanzehong.github.io/trust-vl/

详情

展开后加载摘要…

URL PDF HTML 收藏