arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9080 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9080 篇

2606.06538 2026-06-08 cs.CV 新提交 87%

WorldBench: A Challenging and Visually Diverse Multimodal Reasoning Benchmark

WorldBench: 一个具有挑战性且视觉多样的多模态推理基准

Yida Yin, Harish Krishnakumar, Chung Peng Lee, Boya Zeng, Wenhao Chai, Shengbang Tong, Wenhu Chen, Hu Xu, Xingyu Fu, Gabriel Sarch, Aleksandra Korolova, Zhuang Liu

机构 * Princeton University(普林斯顿大学) NYU(纽约大学) University of Waterloo(滑铁卢大学) Meta, FAIR(Meta和FAIR)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(summary_cn,abstract_cn);分类 cs.CV

AI总结 提出WorldBench,通过构建多领域视觉概念分类法并收集多样化图像,设计前沿MLLM难以回答的问题,以评估多模态大语言模型的视觉理解能力,揭示其弱点。

Comments Project page: https://worldbench-vl.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03890 2026-06-03 cs.CV 87%

OVO-S-Bench: A Hierarchical Benchmark for Streaming Spatial Intelligence in Multimodal LLMs

OVO-S-Bench:多模态大语言模型中流式空间智能的分层基准

Yifei Li, Pengyiang Liu, Yuhang Zang, Zhongyue Shi, Qi Fu, Hongye Hao, Jiwen Lu

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(summary_cn,abstract_cn);分类 cs.CV

AI总结 提出OVO-S-Bench,一个完全人工标注的流式空间智能基准,包含1680个问题,涵盖四个抽象层次,评估38个MLLM,发现Gemini-3.1-Pro落后人类专家27分,流式空间微调MLLM表现不如其骨干模型。

Comments 48 pages, 12 figures, 15 tables. Project page: https://internlm.github.io/OVO-S-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07470 2025-08-22 cs.CV 87%

AURA: A Fine-Grained Benchmark and Decomposed Metric for Audio-Visual Reasoning

Siminfar Samakoush Galougah, Rishie Raj, Sanjoy Chowdhury, Sayan Nag, Ramani Duraiswami

专题命中 多模态评测 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);omni-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16983 2024-10-23 cs.AI 87%

Order Matters: Exploring Order Sensitivity in Multimodal Large Language Models

Zhijie Tan, Xu Chu, Weiping Li, Tong Mo

专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);MLLM(abstract);image-text(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05560 2026-08-07 cs.CV cs.CL 新提交 87%

From Sports to Safety: Benchmarking Proactive Risk Inference in MLLMs

从运动到安全:多模态大语言模型(MLLM)主动风险推理基准测试

Jiawei Qiu, Yichen Xu, Jianzhe Ma, Mingyang Yu, Wenbin Zhu, Yang Han, Pinzheng Lv, Wenxuan Wang

机构 * School of Information, Renmin University of China(中国人民大学信息学院)

专题命中 多模态评测 :MLLM(title_cn,summary_cn);分类 cs.CV、cs.CL

AI总结 该研究构建了运动主动风险推理基准SPRINT,评估发现当前MLLM危险感知率高但原因识别率低,仅具备表层主动安全能力,缺乏稳定的基于原因的早期预警。

Comments Preprints

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00012 2026-08-04 cs.CL cs.AI cs.CY cs.LG 新提交 87%

Obshazard-bench: Benchmarking Multimodal Foundation Models for Real-Time Disaster Intelligence from Raw Earth Observation Streams

Obshazard-bench:面向原始地球观测流的实时灾害情报多模态基础模型基准测试

Fengxiang Wang, Qiuyang Yu, Yueying Li, Mingshuo Chen, Chengchi Fei, Kaiyi Xu, Lixin Gu, Wangxu Wei, Junchao Gong, Lipeng Ma, Jiong Wang, Fenghua Ling, Wenlong Zhang, Xue Yang, Wenjing Yang, Ben Fei, Long Lan

机构 * National University of Defense Technology(国防科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title);分类 cs.CL、cs.AI

AI总结 本研究推出Obshazard-bench基准测试,评估多模态基础模型的实时灾害情报能力,发现现有模型在将原始多通道物理观测转化为符合决策需求的灾害推理方面存在显著局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03644 2026-07-07 cs.CV cs.AI 新提交 87%

Moonstone: A Multimodal Foundation Model and Benchmark for Lunar Remote Sensing

月光石:用于月球遥感的多模态基础模型及基准

Ayush Prasad, Swarnalee Mazumder

机构 * Space and Earth Observation Centre, Finnish Meteorological Institute(芬兰气象研究所空间与地球观测中心) German Climate Computing Centre(德国气候计算中心)

专题命中 多模态评测 :multimodal(title);multimodal foundation model(title);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对月球多模态遥感数据分散且无评估机器学习基准的问题,引入月光石基准。贡献包括构建全球月球预训练数据集,提出MG-MAE模型,创建涵盖多任务的基准,其预训练特征在各任务中表现出色。

Comments Accepted for publication in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18745 2025-12-23 cs.CV cs.CL cs.LG 87%

InSight-o3: Empowering Multimodal Foundation Models with Generalized Visual Search

InSight-o3: 通过通用视觉搜索增强多模态基础模型

Kaican Li, Lewei Yao, Jiannan Wu, Tiezheng Yu, Jierun Chen, Haoli Bai, Lu Hou, Lanqing Hong, Wei Zhang, Nevin L. Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学) Huawei(华为)

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title);分类 cs.CV、cs.CL

AI总结 InSight-o3通过通用视觉搜索任务提升多模态基础模型的推理能力,解决复杂视觉信息整合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08777 2025-09-11 cs.CV cs.CL 87%

Calibrating MLLM-as-a-judge via Multimodal Bayesian Prompt Ensembles

Eric Slyman, Mehrab Tanjim, Kushal Kafle, Stefan Lee

机构 * Adobe(Adobe公司) Oregon State University(俄勒冈州立大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(title);分类 cs.CV、cs.CL

Comments 17 pages, 8 figures, Accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15763 2025-08-26 cs.LG cs.CL cs.CV 87%

Intern-S1: A Scientific Multimodal Foundation Model

Lei Bai, Zhongrui Cai, Yuhang Cao, Maosong Cao, Weihan Cao, Chiyu Chen, Haojiong Chen, Kai Chen, Pengcheng Chen, Ying Chen, Yongkang Chen, Yu Cheng, Pei Chu, Tao Chu, Erfei Cui, Ganqu Cui, Long Cui, Ziyun Cui, Nianchen Deng, Ning Ding, Nanqing Dong, Peijie Dong, Shihan Dou, Sinan Du, Haodong Duan, Caihua Fan, Ben Gao, Changjiang Gao, Jianfei Gao, Songyang Gao, Yang Gao, Zhangwei Gao, Jiaye Ge, Qiming Ge, Lixin Gu, Yuzhe Gu, Aijia Guo, Qipeng Guo, Xu Guo, Conghui He, Junjun He, Yili Hong, Siyuan Hou, Caiyu Hu, Hanglei Hu, Jucheng Hu, Ming Hu, Zhouqi Hua, Haian Huang, Junhao Huang, Xu Huang, Zixian Huang, Zhe Jiang, Lingkai Kong, Linyang Li, Peiji Li, Pengze Li, Shuaibin Li, Tianbin Li, Wei Li, Yuqiang Li, Dahua Lin, Junyao Lin, Tianyi Lin, Zhishan Lin, Hongwei Liu, Jiangning Liu, Jiyao Liu, Junnan Liu, Kai Liu, Kaiwen Liu, Kuikun Liu, Shichun Liu, Shudong Liu, Wei Liu, Xinyao Liu, Yuhong Liu, Zhan Liu, Yinquan Lu, Haijun Lv, Hongxia Lv, Huijie Lv, Qitan Lv, Ying Lv, Chengqi Lyu, Chenglong Ma, Jianpeng Ma, Ren Ma, Runmin Ma, Runyuan Ma, Xinzhu Ma, Yichuan Ma, Zihan Ma, Sixuan Mi, Junzhi Ning, Wenchang Ning, Xinle Pang, Jiahui Peng, Runyu Peng, Yu Qiao, Jiantao Qiu, Xiaoye Qu, Yuan Qu, Yuchen Ren, Fukai Shang, Wenqi Shao, Junhao Shen, Shuaike Shen, Chunfeng Song, Demin Song, Diping Song, Chenlin Su, Weijie Su, Weigao Sun, Yu Sun, Qian Tan, Cheng Tang, Huanze Tang, Kexian Tang, Shixiang Tang, Jian Tong, Aoran Wang, Bin Wang, Dong Wang, Lintao Wang, Rui Wang, Weiyun Wang, Wenhai Wang, Jiaqi Wang, Yi Wang, Ziyi Wang, Ling-I Wu, Wen Wu, Yue Wu, Zijian Wu, Linchen Xiao, Shuhao Xing, Chao Xu, Huihui Xu, Jun Xu, Ruiliang Xu, Wanghan Xu, GanLin Yang, Yuming Yang, Haochen Ye, Jin Ye, Shenglong Ye, Jia Yu, Jiashuo Yu, Jing Yu, Fei Yuan, Yuhang Zang, Bo Zhang, Chao Zhang, Chen Zhang, Hongjie Zhang, Jin Zhang, Qiaosheng Zhang, Qiuyinzhe Zhang, Songyang Zhang, Taolin Zhang, Wenlong Zhang, Wenwei Zhang, Yechen Zhang, Ziyang Zhang, Haiteng Zhao, Qian Zhao, Xiangyu Zhao, Xiangyu Zhao, Bowen Zhou, Dongzhan Zhou, Peiheng Zhou, Yuhao Zhou, Yunhua Zhou, Dongsheng Zhu, Lin Zhu, Yicheng Zou

机构 * Intern-S1 Team(Intern-S1团队)

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13051 2025-06-17 cs.CV cond-mat.mtrl-sci cs.CL cs.LG 87%

Stress-Testing Multimodal Foundation Models for Crystallographic Reasoning

Can Polat, Hasan Kurban, Erchin Serpedin, Mustafa Kurban

机构 * Dept. of Electrical and Computer Engineering, Texas A&M University(电气与计算机工程系,德克萨斯A&M大学) College of Science and Engineering, Hamad Bin Khalifa University(科学与工程学院,哈马德·本·卡西姆大学) Dept. of Electrical and Computer Engineering, Texas A&M University at Qatar(电气与计算机工程系,德克萨斯A&M大学(卡塔尔)) Dept. of Prosthetics and Orthotics, Ankara University(假肢与矫形系,安卡拉大学)

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10179 2025-04-15 cs.AI cs.CL cs.ET 87%

The Future of MLLM Prompting is Adaptive: A Comprehensive Experimental Evaluation of Prompt Engineering Methods for Robust Multimodal Performance

Anwesha Mohanty, Venkatesh Balavadhani Parthasarathy, Arsalan Shahid

专题命中 多模态评测 :multimodal(title,abstract);MLLM(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14225 2025-03-25 cs.CL cs.AI 87%

Few-Shot Joint Multimodal Entity-Relation Extraction via Knowledge-Enhanced Cross-modal Prompt Model

Li Yuan, Yi Cai, Junsheng Huang

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(title);分类 cs.CL、cs.AI

Comments accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.04448 2021-09-10 cs.CL cs.CV 87%

Vision-and-Language or Vision-for-Language? On Cross-Modal Influence in Multimodal Transformers

Stella Frank, Emanuele Bugliarello, Desmond Elliott

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(title);分类 cs.CV、cs.CL

Comments EMNLP 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.02598 2020-09-08 eess.AS cs.MM cs.SD 87%

Semi-supervised Multi-modal Emotion Recognition with Cross-Modal Distribution Matching

Jingjun Liang, Ruichen Li, Qin Jin

专题命中 多模态评测 :multi-modal(title,abstract);cross-modal(title);分类 cs.MM、eess.AS

Comments 10 pages, 5 figures, to be published on ACM Multimedia 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15743 2026-06-16 cs.LG 新提交 87%

Unsupervised Learning for Missing Modalities in Multimodal Learning

多模态学习中缺失模态的无监督学习

Hassan Ismkhan, Hamid Bouchahcia

机构 * Bournemouth University(伯恩茅斯大学)

专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);cross-modal(abstract)

AI总结 提出UL4M4框架,通过无监督聚类和迭代插补处理任意缺失模态,实现跨模态结构保持和尺度不变性,在超过50%模态缺失时仍稳定达到F1-Micro>0.7。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14697 2026-06-15 cs.CV cs.AI cs.CL 新提交 87%

ClinHallu: A Benchmark for Diagnosing Stage-Wise Hallucinations in Medical MLLM Reasoning

ClinHallu: 用于诊断医学多模态大语言模型推理中阶段式幻觉的基准

Sicheng Yang, Hangjie Yuan, Wenjun Zhang, Jinwang Wang, Yichen Qian, Weihua Chen, Fan Wang, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DAMO Academy, Alibaba Group(阿里巴巴达摩院) Hupan Lab(湖畔实验室) Zhejiang University(浙江大学)

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出ClinHallu基准,包含7031个实例,每个实例带有结构化推理轨迹(视觉识别、知识回忆、推理整合),通过阶段替换干预和轨迹监督微调,实现细粒度幻觉诊断与缓解。

Comments Code and datasets: https://github.com/alibaba-damo-academy/ClinHallu

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05970 2026-04-28 cs.CV cs.AI cs.CL 87%

PDF-WuKong: A Large Multimodal Model for Efficient Long PDF Reading with End-to-End Sparse Sampling

PDF-WuKong:一种用于高效长PDF阅读的大型多模态模型,采用端到端稀疏采样

Xudong Xie, Hao Yan, Liang Yin, Yang Liu, Jing Ding, Minghui Liao, Yuliang Liu, Wei Chen, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Inc.(华为公司)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出PDF-WuKong,一种针对长PDF文档的多模态大语言模型,通过端到端稀疏采样提升多模态问答效率,实验表明其在长文档理解任务中优于其他模型,F1得分平均高出8.6%。

Comments Accepted by International Journal of Computer Vision (IJCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06073 2025-10-21 cs.CL cs.AI cs.CV 87%

GEM: Empowering MLLM for Grounded ECG Understanding with Time Series and Images

Xiang Lan, Feng Wu, Kai He, Qinghao Zhao, Shenda Hong, Mengling Feng

机构 * National University of Singapore(新加坡国立大学) Peking University People’s Hospital(北京大学人民医院) Peking University(北京大学)

专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments NeurIPS 2025 Camera-Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03173 2025-10-16 cs.CL cs.AI cs.CV 87%

MULTI: Multimodal Understanding Leaderboard with Text and Images

Zichen Zhu, Yang Xu, Lu Chen, Jingkai Yang, Yichuan Ma, Yiming Sun, Hailin Wen, Jiaqi Liu, Jinyu Cai, Yingzi Ma, Situo Zhang, Zihan Zhao, Liangtai Sun, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Key Laboratory of Artificial Intelligence\ of Education, Shanghai Jiao Tong University, Shanghai 200240 , China Jiangsu Key Lab of Language Computing, Suzhou 215123 , China College of Computing Data Science, Nanyang Technological University, Singapore 639798 , Singapore Suzhou Laboratory, Suzhou 215123 , China

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 24 pages, 19 figures, 10 tables. Details and access are available at: https://OpenDFM.github.io/MULTI-Benchmark/

Journal ref Sci. China Inf. Sci. 68, 200107 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02995 2024-01-09 cs.CL cs.AI cs.CV eess.IV 87%

CANAMRF: An Attention-Based Model for Multimodal Depression Detection

Yuntao Wei, Yuzhe Zhang, Shuyang Zhang, Hong Zhang

专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 6 pages, 3 figures. Pacific Rim International Conference on Artificial Intelligence. Singapore: Springer Nature Singapore, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15800 2026-03-18 cs.CV cs.CL cs.CR 87%

Evolving Contextual Safety in Multi-Modal Large Language Models via Inference-Time Self-Reflective Memory

通过推理时的自我反思记忆在多模态大语言模型中实现上下文安全演化

Ce Zhang, Jinxi He, Junyi He, Katia Sycara, Yaqi Xie

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 多模态评测 :multi-modal(title,abstract);MLLM(abstract,comments);image-text(abstract);分类 cs.CV、cs.CL

AI总结 本文提出MM-SafetyBench++基准和EchoSafe框架,通过自反思记忆实现多模态大语言模型的上下文安全演化,实验表明其在安全性能上表现优异。

Comments Accepted at CVPR 2026. Project page: https://echosafe-mllm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12781 2026-08-14 cs.CV 新提交 86%

Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs

超越正确性:混合思维多模态大语言模型(MLLM)的响应行为基准测试与对齐

Xinming Wang, Weinong Wang, Hongming Yang, Yansong Lin, Zheng Ruan, Shangpin Peng, Qiming Peng, Nan Qiao, Fengyuan Lu, Guoqing Ma, Marito Li, Songyang Zhang, Saiyong Yang, Han Hu, Yonglong Tian, Xu-Yao Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Large Language Model Department, Tencent(腾讯大语言模型部) University of Electronic Science and Technology of China(电子科技大学) Hong Kong University of Science and Technology(香港科技大学) Zhongguancun Academy(中关村学院)

专题命中 多模态评测 :MLLM(title_cn,summary_cn);multimodal(abstract);分类 cs.CV

AI总结 该研究针对混合思维 MLLM 的思维与非思维模式响应错位问题,构建 PatternEval 基准并开发 PatternRL 方法,可减轻跨模式错位且任务性能损失极小。

Comments 8 tables and 6figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23786 2026-07-20 cs.AI cs.LG 版本更新 86%

FAIR_XAI: Improving Multimodal Foundation Model Fairness via Explainability for Wellbeing Assessment

FAIR_XAI: 通过可解释性提升多模态基础模型公平性以用于幸福感评估

Sophie Chiang, Tom Brennan, Fethiye Irmak Dogan, Jiaee Cheong, Hatice Gunes

机构 * Department of Computer Science & Technology, University of Cambridge(计算机科学与技术系,剑桥大学) Harvard University(哈佛大学)

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title);分类 cs.AI

AI总结 本文研究了多模态基础模型在幸福感评估中的公平性问题,通过可解释性干预框架改善诊断可靠性与公平性,发现不同模型在不同数据集上表现差异显著,且存在性别和种族偏见。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07482 2026-07-15 eess.SP cs.AI 86%

VSLLaVA: a pipeline of large multimodal foundation model for industrial vibration signal analysis

VSLLaVA:一种用于工业振动信号分析的大型多模态基础模型流水线

Qi Li, Xinran Zhang, Jinfeng Huang, Hongliang He, Feibin Zhang, Zhaoye Qin, Fulei Chu

机构 * State Key Laboratory of Tribology, Department of Mechanical Engineering, Tsinghua University(摩擦学国家重点实验室,清华大学机械工程系) Department of Statistics and Data Science, Yale University(耶鲁大学统计与数据科学系)

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title);分类 cs.AI

AI总结 VSLLaVA通过专家知识引导的指令微调和双模式评估框架,提升工业振动信号分析的端到端多模态模型性能。

Journal ref Advanced Engineering Informatics 76 (2026): 105023

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26320 2026-05-27 cs.LG cs.CL 86%

MULTISEISMO: A Multimodal Seismic Dataset and Model for Cross-Modal Seismic Understanding

MULTISEISMO: 面向跨模态地震理解的多模态地震数据集与模型

Sai Munikoti, Ian Stewart, Chengping Chai, Lisa Linville, Scott Vasquez, Sameera Horawalavithana, Karl Pazdernik

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室) Oak Ridge National Laboratory(橡树岭国家实验室) Sandia National Laboratory(桑迪亚国家实验室) North Carolina State University(北卡罗来纳州立大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(title);分类 cs.CL

AI总结 针对地震学中多模态数据整合的缺失,构建了包含超过1.6万次地震事件的结构化多模态数据集MultiSeismo,并开发了专用多模态模型SeisModal,在跨模态地震推理任务上取得了优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08783 2025-10-13 cs.HC cs.AI 86%

MLLM as a UI Judge: Benchmarking Multimodal LLMs for Predicting Human Perception of User Interfaces

Reuben A. Luera, Ryan Rossi, Franck Dernoncourt, Samyadeep Basu, Sungchul Kim, Subhojyoti Mukherjee, Puneet Mathur, Ruiyi Zhang, Jihyung Kil, Nedim Lipka, Seunghyun Yoon, Jiuxiang Gu, Zichao Wang, Cindy Xiong Bearfield, Branislav Kveton

机构 * University of California, Berkeley(加州大学伯克利分校) Adobe Research(Adobe研究) Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08900 2025-09-30 cs.CV 86%

MIRAGE: Multimodal foundation model and benchmark for comprehensive retinal OCT image analysis

José Morano, Botond Fazekas, Emese Sükei, Ronald Fecso, Taha Emre, Markus Gumpinger, Georg Faustmann, Marzieh Oghbaie, Ursula Schmidt-Erfurth, Hrvoje Bogunović

机构 * Christian Doppler Laboratory for Artificial Intelligence in Retina(人工智能视网膜实验室) Institute of Artificial Intelligence(人工智能研究所) Center for Medical Data Science(医学数据科学中心) Medical University of Vienna(维也纳医学大学) Comprehensive Center for AI in Medicine(医学人工智能综合中心) OPTIMA Lab(OPTIMA实验室) Department of Ophthalmology(眼科学系)

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title);分类 cs.CV

Comments Accepted for publication in npj Digital Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06034 2025-06-09 cs.CL 86%

MATP-BENCH: Can MLLM Be a Good Automated Theorem Prover for Multimodal Problems?

Zhitao He, Zongwei Lyu, Dazhong Chen, Dadi Guo, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港理工大学) Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

专题命中 多模态评测 :multimodal(title,abstract);MLLM(title);分类 cs.CL

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24238 2025-06-03 cs.CV cs.LG 86%

MIRAGE: Assessing Hallucination in Multimodal Reasoning Chains of MLLM

Bowen Dong, Minheng Ni, Zitong Huang, Guanglei Yang, Wangmeng Zuo, Lei Zhang

机构 * Harbin Institute of Technology(哈尔滨工业大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏