arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 9133 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9133 篇

2604.23799 2026-04-28 cs.CV 79%

VitaminP: cross-modal learning enables whole-cell segmentation from routine histology

VitaminP: 跨模态学习实现常规组织学图像的全细胞分割

Yasin Shokrollahi, Karina B. Pinao Gonzales, Elizve N. Barrientos Toro, Paul Acosta, Patient Mosaic Team, Pingjun Chen, Yinyin Yuan, Xiaoxi Pan

机构 * Department of Translational Molecular Pathology, Division of Pathology and Laboratory Medicine, The University of Texas MD Anderson Cancer Center(转化分子病理学部门,病理与实验室医学分会,德克萨斯大学MD安德森癌症中心) Institute for Data Science in Oncology, The University of Texas MD Anderson Cancer Center(肿瘤数据科学研究所,德克萨斯大学MD安德森癌症中心) The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心)

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV

AI总结 VitaminP通过跨模态学习从常规H&E图像实现全细胞分割,利用配对的H&E-mIF数据迁移分子边界信息以克服H&E的细胞质对比度限制,构建了跨模态监督策略,并在14个公开数据集上训练,超越了四种最新方法并在未见数据集上泛化。

Comments 44 pages, 10 figures. Code and models available

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10047 2026-04-28 cs.CV 79%

MuSc-V2: Zero-Shot Multimodal Industrial Anomaly Classification and Segmentation with Mutual Scoring of Unlabeled Samples

MuSc-V2:基于未标记样本互评分的零样本多模态工业异常分类与分割

Xurui Li, Feng Xue, Yu Zhou

机构 * Huazhong University of Science and Technology(华中科技大学) University of Trento(特伦特大学)

专题命中 多模态评测 :multimodal(title);cross-modal(abstract);分类 cs.CV

AI总结 本文提出MuSc-V2框架,通过改进3D表示、融合多尺度特征及互评分机制,实现零样本多模态工业异常检测,提升MVTec 3D-AD和Eyecandies数据集性能。

Comments TPAMI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06667 2026-04-28 cs.CV cs.LG eess.IV 79%

Flood-DamageSense: Multimodal Mamba with Multitask Learning for Building Flood Damage Assessment using SAR Remote Sensing Imagery

Flood-DamageSense: 多模态Mamba与多任务学习用于基于SAR遥感图像的建筑物洪水损害评估

Yu-Hsuan Ho, Ali Mostafavi

机构 * Urban Resilience.AI Lab(城市韧性人工智能实验室) Zachry Department of Civil and Environmental Engineering(扎克里土木与环境工程系) Texas A&M University(德克萨斯A&M大学) College Station, TX(学院站, 德克萨斯)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出Flood-DamageSense模型,结合多模态Mamba架构与多任务学习,利用SAR遥感图像实现建筑物洪水损害评估,通过融合前后事件影像与洪水风险层,提升洪水损害识别精度,实验显示在Hurricane Harvey数据集上F1值提升显著。

Journal ref Comput. Aided Civ. Infrastruct. Eng. 40.26 (2025) 4401-4424

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05231 2026-04-27 cs.RO cs.AI 79%

Kaiwu: A Multimodal Manipulation Dataset and Framework for Robot Learning and Human-Robot Interaction

Kaiwu:一种用于机器人学习和人机交互的多模态操控数据集和框架

Shuo Jiang, Haonan Li, Ruochen Ren, Yanmin Zhou, Zhipeng Wang, Bin He

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Kaiwu多模态数据集,解决复杂装配场景中缺失的真实同步多模态数据问题,通过20名受试者和30个交互对象,记录11,664个整合动作实例,支持机器人学习、精细操作、人类意图研究和人机协作。

Comments 8 pages, 5 figures, Submitted to IEEE Robotics and Automation Letters (RAL)

Journal ref IEEE Robotics and Automation Letters, vol. 10, no. 11, pp. 11482-11489, Nov. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21575 2026-04-24 cs.CV cs.GR 79%

OmniFit: Multi-modal 3D Body Fitting via Scale-agnostic Dense Landmark Prediction

OmniFit:通过尺度无关密集地标预测实现多模态3D身体拟合

Zeyu Cai, Yuliang Xiu, Renke Wang, Zhijing Shao, Xiaoben Li, Siyuan Yu, Chao Xu, Yang Liu, Baigui Sun, Jian Yang, Zhenyu Zhang

机构 * Nanjing University(南京大学) Westlake University(西湖大学) iROOTECH Nanjing University of Science and Technology(南京理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 OmniFit通过尺度无关的密集地标预测,实现对多模态输入(如完整扫描、部分深度观测和图像)的无缝处理,首次在日常和宽松服装场景中超越多视图优化基线,达到毫米级精度。

Comments Project Page: https://zcai0612.github.io/OmniFit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21508 2026-04-24 cs.AI q-bio.BM 79%

BioMiner: A Multi-modal System for Automated Mining of Protein-Ligand Bioactivity Data from Literature

BioMiner:一种用于从文献中自动挖掘蛋白质-配体生物活性数据的多模态系统

Jiaxian Yan, Jintao Zhu, Yuhang Yang, Qi Liu, Kai Zhang, Zaixi Zhang, Xukai Liu, Boyan Zhang, Kaiyuan Gao, Jinchuan Xiao, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学认知智能国家重点实验室) Princeton University(普林斯顿大学) Huazhong University of Science and Technology(华中科技大学) Infinite Intelligence Pharma(无限智能制药)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 BioMiner通过多模态框架提取生物活性数据,解决手动整理与文献增长不匹配的问题,其核心方法结合直接推理和化学结构解析,实现生物活性三元组的高准确率提取。

Comments 20 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20263 2026-04-23 q-bio.QM cs.AI cs.LG 79%

AROMA: Augmented Reasoning Over a Multimodal Architecture for Virtual Cell Genetic Perturbation Modeling

AROMA:增强的多模态架构下虚拟细胞基因扰动建模推理

Zhenyu Wang, Geyan Ye, Wei Liu, Man Tat Alexander Ng

机构 * AI for Life Sciences Lab, Tencent(腾讯AI生命科学实验室) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 AROMA通过整合文本证据、图拓扑信息和蛋白质序列特征,提升虚拟细胞基因扰动预测的准确性和可解释性,构建了包含498k样本的 PerturbReason 数据集,实验表明其在多个细胞系中表现优异。

Comments Accepted to ACL 2026 as a Findings paper. Zhenyu Wang and Geyan Ye are equal contributors; Geyan Ye is the corresponding author and project lead

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13232 2026-04-23 cs.AI cs.SE 79%

PlotChain: Deterministic Checkpointed Evaluation of Multimodal LLMs on Engineering Plot Reading

PlotChain: 多模态大语言模型在工程图表阅读中的确定性检查点评估

Mayank Ravishankara

机构 * Independent Researcher, San Francisco, CA, USA(独立研究者,美国加州旧金山)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 PlotChain提出了一种确定性的基于生成器的评估基准,用于评估多模态大语言模型在工程图表阅读中的性能,通过检查点实现子技能诊断和故障定位,展示了不同模型在图表阅读任务中的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19567 2026-04-22 cs.AI 79%

Multi-modal Reasoning with LLMs for Visual Semantic Arithmetic

基于LLM的多模态推理用于视觉语义算术

Chuou Xu, Liya Ji, Qifeng Chen

专题命中 多模态评测 :multi-modal(title);cross-modal(abstract);分类 cs.AI

AI总结 本文提出两种新型任务和IRPD数据集,通过SAri-RFT方法提升大视觉语言模型的跨模态关系推理能力,实现视觉语义算术的突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02384 2026-04-22 cs.CV 79%

SMART-Ship: A Comprehensive Synchronized Multi-modal Aligned Remote Sensing Targets Dataset and Benchmark for Berthed Ships Analysis

SMART-Ship:一个综合的同步多模对齐遥感目标数据集和基准,用于靠泊船舶分析

Chen-Chen Fan, Peiyao Guo, Linping Zhang, Kehan Qi, Haolin Huang, Yong-Qiang Mao, Yuxi Suo, Zhizhuo Jiang, Yu Liu, You He

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出SMART-Ship数据集,包含多模遥感图像,用于靠泊船舶分析,通过精细标注支持多模遥感任务,并评估了代表性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00993 2026-04-22 cs.CV 79%

PhotoFramer: Multi-modal Image Composition Instruction

PhotoFramer:多模态图像构图指令

Zhiyuan You, Ke Wang, He Zhang, Xin Cai, Jinjin Gu, Tianfan Xue, Chao Dong, Zhoutong Zhang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Adobe NextCam Adobe Research Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(InnoHK下的CPII) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 PhotoFramer通过多模态框架为用户提供图像构图指导,通过自然语言描述改进方法并生成示例图像,结合文本与图像生成模型提升日常用户构图能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18224 2026-04-21 cs.SE cs.AI 79%

WebCompass: Towards Multimodal Web Coding Evaluation for Code Language Models

WebCompass:迈向多模态网络编码评估的代码语言模型

Xinping Lei, Xinyu Che, Junqi Xiong, Chenchen Zhang, Yukai Huang, Chenyu Zhou, Haoyang Huang, Minghao Liu, Letian Zhu, Hongyi Ye, Jinhua Hao, Ken Deng, Zizheng Zhan, Han Li, Dailin Li, Yifan Yao, Ming Sun, Zhaoxiang Zhang, Jiaheng Liu

机构 * Nanjing University(南京大学) Kuaishou Technology(快手科技)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 WebCompass提出一个多模态基准测试,用于评估代码语言模型在网络工程中的能力,涵盖生成、编辑和修复三种任务类型,通过多阶段人机协作流程,发现闭源模型在编辑和修复方面表现更优,但美学仍是开放源模型的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04509 2026-04-21 cs.CL 79%

ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection

ErrorRadar:通过错误检测基准测试多模态大语言模型的复杂数学推理能力

Yibo Yan, Shen Wang, Jiahao Huo, Hang Li, Boyan Li, Jiamin Su, Xiong Gao, Yi-Fan Zhang, Tianlong Xu, Zhendong Chu, Aoxiao Zhong, Kun Wang, Hui Xiong, Philip S. Yu, Xuming Hu, Qingsong Wen

机构 * Squirrel AI HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) MSU(密歇根州立大学) UCAS(中国科学技术大学) University of Illinois at Chicago(伊利诺伊大学香槟分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 ErrorRadar通过错误检测任务评估多模态大语言模型在复杂数学推理中的能力,包含2500个高质量K-12数学问题,实验显示GPT-4o仍比人类评价差10%。

Comments Accepted by The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026, Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03191 2026-04-21 cs.CV 79%

CORP: A Multi-Modal Dataset for Campus-Oriented Roadside Perception Tasks

CORP:面向校园道路感知任务的多模态数据集

Beibei Wang, Zijian Yu, Lu Zhang, Jingjing Huang, Yao Li, Haojie Ren, Yuxuan Xiao, Yuru Peng, Jianmin Ji, Yu Zhang, Yanyong Zhang

机构 * Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出CORP数据集,首个针对校园场景的多模态道路感知任务基准数据集,包含205k张图像和102k点云,用于提升校园区域的3D跟踪和实例分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17065 2026-04-21 cs.CV 79%

BasketHAR: A Multimodal Dataset for Human Activity Recognition and Sport Analysis in Basketball Training Scenarios

BasketHAR:一种用于篮球训练场景中的人体活动识别和运动分析的多模态数据集

Xian Gao, Haoyue Zhang, Zongyun Zhang, Jiacheng Ruan, Ting Liu, Yuzhuo Fu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出BasketHAR数据集,用于解决现有HAR数据集在体育分析应用中的不足,通过多模态数据包括运动传感器和视频记录,提供先进的HAR任务研究资源。

Comments 7 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17037 2026-04-21 cs.CL 79%

Dynamic Emotion and Personality Profiling for Multimodal Deception Detection

动态情绪与人格画像用于多模态欺骗检测

Li Zheng, Yanyi Luo, Hao Fei, Yuzhe Ding, Yujie Huang, Fei Li, Chong Teng, Donghong Ji

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University(航天信息安全部门与可信计算教育部重点实验室,网络安全科学与工程学院,武汉大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出多模型多提示标注方案和严格标签质量评估标准,建立多模态联合检测数据集DDEP,提出Rel-DDEP框架,通过高维高斯分布空间量化不确定性,实现欺骗、情绪和人格的联合检测。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16980 2026-04-21 cs.LG cs.AI 79%

Evaluating Multimodal LLMs for Inpatient Diagnosis: Real-World Performance, Safety, and Cost Across Ten Frontier Models

评估多模态大语言模型在住院诊断中的表现:在十个前沿模型上的真实世界性能、安全性和成本

Bruce A. Bassett, Amy Rouillard, Sitwala Mundia, Michael Cameron Gramanie, Linda Camara, Ziyaad Dangor, Shabir A. Madhi, Kajal Morar, Marlvin T. Ncube, Ismail Kalla, Haroon Saloojee

机构 * School of Computer Science and Applied Mathematics, University of the Witwatersrand(沃斯兰大学计算机科学与应用数学学院) Wits MIND Institute, University of the Witwatersrand(沃斯兰大学Wits MIND研究所) Grai Labs, Cape Town, South Africa(南非开普敦Grai实验室) Faculty of Health Sciences, University of the Witwatersrand(沃斯兰大学健康科学学院) South African Medical Research Council Vaccines and Infectious Diseases Analytics Research Unit, Faculty of Health Sciences, University of the Witwatersrand(南非医学研究委员会疫苗与传染病分析研究单位,沃斯兰大学健康科学学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文评估了十个前沿多模态大语言模型在住院诊断中的真实世界性能,发现尽管成本差异大,模型表现紧密聚集,且在安全性和诊断准确性上均优于常规护理。

Comments 17 pages, 11 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01306 2026-04-21 cs.CL 79%

M2-Verify: A Large-Scale Multidomain Benchmark for Checking Multimodal Claim Consistency

M2-Verify:一个大规模多领域基准用于检查多模态声明一致性

Abolfazl Ansari, Delvin Ce Zhang, Zhuoyang Zou, Wenpeng Yin, Dongwon Lee

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Sheffield(谢菲尔德大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出M2-Verify基准,用于评估多模态科学声明与证据之间的一致性。该数据集包含16个领域46.9万实例,通过专家审核验证,揭示了现有模型在复杂挑战中的表现不足。

Comments Preprint. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17932 2026-04-21 cs.SE cs.AI 79%

From Charts to Code: A Hierarchical Benchmark for Multimodal Models

从图表到代码:一个多模态模型的分层基准

Jiahao Tang, Henry Hengyuan Zhao, Lijian Wu, Zijian Zhang, Yifei Tao, Dongxing Mao, Yang Wan, Jingru Tan, Min Zeng, Min Li, Alex Jinpeng Wang

机构 * CSU-JPG, Central South University(中南大学CSU-JPG) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Chart2Code基准,用于评估大多模态模型的图表理解和代码生成能力,包含三个层级任务,涵盖图表复现、编辑和长表转图表生成,测试了25种最先进的LMMs,结果显示GPT-5在编辑任务中表现不佳,凸显了该基准的挑战性。

Comments This work has been accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16214 2026-04-20 cs.CV 79%

GAViD: A Large-Scale Multimodal Dataset for Context-Aware Group Affect Recognition from Videos

GAViD:一个大规模多模态数据集,用于视频中基于情境的群体情感识别

Deepak Kumar, Abhishek Pratap Singh, Puneet Kumar, Xiaobai Li, Balasubramanian Raman

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Roorkee(计算机科学与工程系,印度理工学院Roorkee分校) Indian Institute of Technology Ropar(印度理工学院Ropar分校) Zhejiang University(浙江大学) University of Oulu(奥卢大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出GAViD数据集和CAGNet网络,用于视频中基于情境的群体情感识别,通过多模态数据和上下文信息提升识别性能,测试准确率达63.20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20214 2026-04-17 cs.AI 79%

When Slower Isn't Truer: Inverse Scaling Law of Truthfulness in Multimodal Reasoning

当慢并非真:多模态推理中真理性的反比例定律

Sitong Fang, Wenjing Cao, Jiahao Li, Xuyao Wang, Juntao Dai, Chi-Min Chan, Sirui Han, Yike Guo, Yaodong Yang, Jiaming Ji

机构 * Institute for AI(人工智能研究院) Peking University(北京大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 研究探讨了多模态推理中慢思考模式的反比例定律,发现慢思考模型在面对不完整或误导性视觉输入时更易生成虚假细节,揭示了推理模型在处理模糊输入时的脆弱性。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13142 2026-04-16 cs.RO cs.CV cs.DB 79%

Multi-modal panoramic 3D outdoor datasets for place categorization

多模态全景三维户外数据集用于场所分类

Hojung Jung, Yuki Oto, Oscar M. Mozos, Yumi Iwashita, Ryo Kurazume

机构 * Graduate School of Information Science and Electrical Engineering, Kyushu University(九州大学信息科学与电子工程研究生院) Polytechnic University of Cartagena (UPCT)(卡塔赫纳理工学院) Faculty of Information Science and Electrical Engineering, Kyushu University(九州大学信息科学与电子工程学系)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出两个多模态全景三维户外数据集,用于语义场所分类,包含森林、海岸、住宅区、城市区及室内外停车场六类,通过激光扫描和同步图像获取数据,并比较了多种分类方法,取得高准确率。

Comments This is the authors' manuscript. The final published article was presented at IROS 2026, and it is available at https://doi.org/10.1109/IROS.2016.7759669

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21652 2026-04-15 eess.IV cs.AI physics.med-ph 79%

Enabling Ultra-Fast Cardiovascular Imaging Across Heterogeneous Clinical Environments with A Generalist Foundation Model and Multimodal Database

通过通用基础模型和多模态数据库实现跨异构临床环境的超快速心血管成像

Zi Wang, Mingkai Huang, Zhang Shi, Hongjie Hu, Lan Lan, Hui Zhang, Yan Li, Xi Hu, Qing Lu, Zongming Zhu, Qiong Yao, Yuxiang Dai, Fanwen Wang, Yinzhe Wu, Jun Lyu, Qianqian Gao, Guangming Xu, Zhenxuan Zhang, Haosen Zhang, Qing Li, Guangming Wang, Tianxing He, Lizhen Lan, Siyue Li, Le Xue, Mengting Sun, Yuntong Lyu, Junpu Hu, Jiayu Zhu, Rizwan Ahmad, Zhengyu Bu, Xianling Qian, Guanke Cai, Ruiyu Cao, Weirui Cai, Chang Xu, Yuyang Ren, Feidan Yu, Siying Ma, Ziqiang Xu, Xinran Chen, Sha Hua, Daniel Kim, Yajing Zhang, Chen Ouyang, Wenjia Bai, Jing Qin, Yucheng Yang, Daniel Rueckert, He Wang, Qian Tao, Claudia Prieto, Michael Markl, Alistair Young, Lianming Wu, Shuo Wang, Chen Qin, Mengsu Zeng, Xihong Hu, Haibo Xu, Xiaobo Qu, Hao Li, Guang Yang, Chengyan Wang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出CardioMM模型,通过统一语义理解和物理约束数据一致性,实现跨不同扫描仪、协议和患者情况的稳健重建,验证了24倍加速仍能保持关键心脏表型和诊断图像质量。

Comments Github: https://github.com/wangziblake/CardioMM_MMCMR-427K

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11709 2026-04-14 cs.AI 79%

A Mamba-Based Multimodal Network for Multiscale Blast-Induced Rapid Structural Damage Assessment

基于Mamba的多模态网络用于多尺度爆炸诱导快速结构损伤评估

Wanli Ma, Sivasakthy Selvakumaran, Dain G. Farrimond, Adam A. Dennis, Samuel E. Rigby

机构 * School of Mechanical, Aerospace

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出基于Mamba的多模态网络,整合多尺度爆炸载荷信息与光学遥感图像,提升爆炸后结构损伤评估的准确性和速度,通过2020年贝鲁特爆炸案例验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11307 2026-04-14 cs.AI 79%

PaperScope: A Multi-Modal Multi-Document Benchmark for Agentic Deep Research Across Massive Scientific Papers

PaperScope:一种多模态多文档基准,用于跨大规模科学论文的智能深度研究

Lei Xiong, Huaying Yuan, Zheng Liu, Zhao Cao, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 PaperScope提出一个多模态多文档基准,用于评估智能深度研究能力,包含2000多个跨领域问题,验证了现有系统在长上下文检索和多源推理中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09249 2026-04-14 cs.CV cs.IR 79%

FashionStylist: An Expert Knowledge-enhanced Multimodal Dataset for Fashion Understanding

FashionStylist: 一个增强专家知识的多模态数据集用于时尚理解

Kaidong Feng, Zhuoxuan Huang, Huizhong Guo, Yuting Jin, Xinyu Chen, Yue Liang, Yifei Gai, Li Zhou, Yunshan Ma, Zhu Sun

机构 * Yanshan University(燕山大学) Central South University(中南大学) Zhejiang University(浙江大学) Southwest University(西南大学) Singapore Management University(新加坡管理大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 多模态评测 :multimodal(title);MLLM(abstract);分类 cs.CV

AI总结 本文提出FashionStylist,一个专家标注的多任务时尚理解基准,支持服装到物品定位、服装补全和评估任务,提升多模态时尚系统的语义理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18073 2026-04-14 cs.CV 79%

FPBench: A Comprehensive Benchmark of Multimodal Large Language Models for Fingerprint Analysis

FPBench: 多模态大语言模型在指纹分析中的综合基准测试

Ekta Gavas, Sudipta Banerjee, Chinmay Hegde, Nasir Memon

机构 * New York University(纽约大学) University of Wyoming(怀俄明大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出FPBench基准测试,评估20种多模态大语言模型在7个真实和合成数据集上的8项生物识别任务,发现微调视觉和语言编码器可提升性能7%-39%。

Comments Revised version with additional experiments and code release

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21998 2026-04-14 cs.CV 79%

Can Multi-Modal LLMs Provide Live Step-by-Step Task Guidance?

多模态大语言模型能否提供实时逐步任务指导?

Apratim Bhattacharyya, Bicheng Xu, Sanjay Haresh, Reza Pourreza, Litian Liu, Sunny Panchal, Pulkit Madan, Leonid Sigal, Roland Memisevic

机构 * Qualcomm AI Research(高通人工智能研究院) University of British Columbia(不列颠哥伦比亚大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出Qualcomm Interactive Cooking基准和数据集,用于评估多模态大语言模型在实时任务指导中的能力,引入LiveMamba作为新的基线模型。

Comments Accepted to NeurIPS 2025 (Project page: https://apratimbh.github.io/livecook)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09596 2026-04-14 cs.AI cs.MA 79%

DERM-3R: A Resource-Efficient Multimodal Agents Framework for Dermatologic Diagnosis and Treatment in Real-World Clinical Settings

DERM-3R:一种资源高效的多模态代理框架,用于皮肤病诊断和治疗的现实世界临床应用

Ziwen Chen, Zhendong Wang, Chongjing Wang, Yurui Dong, Luozhijie Jin, Jihao Gu, Kui Chen, Jiaxi Yang, Bingjie Lu, Zhou Zhang, Jirui Dai, Changyong Luo, Xiameng Gai, Haibing Lan, Zhi Liu

机构 * School of Pharmacy, Nanjing University of Chinese Medicine(南京中医药大学药学院) Department of Dermatology, the Gulou Hospital of Traditional Chinese Medicine of Beijing(北京鼓楼中医医院皮肤科) Infectious disease department, Dongfang Hospital, Beijing University of Chinese Medicine(北京中医药大学东方医院感染科) College of Art and Science, university of Washington(华盛顿大学文理学院) Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Fudan Unversity(复旦大学) Zhejiang Lab(之江实验室) University College London(伦敦大学学院) Department of Dermatology, Inner Mongolia Hospital of Traditional Chinese Medicine(内蒙古自治区中医医院皮肤科) International Campus of Zhejiang University(浙江大学国际校区)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出DERM-3R框架,通过三个协作代理解决皮肤病诊断中的细粒度病变识别、多视角病变表示和综合推理问题,展示了其在资源受限下的高效性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08896 2026-04-13 cs.CV 79%

GeoMMBench and GeoMMAgent: Toward Expert-Level Multimodal Intelligence in Geoscience and Remote Sensing

GeoMMBench 和 GeoMMAgent:迈向地质科学和遥感领域的专家级多模态智能

Aoran Xiao, Shihao Cheng, Yonghao Xu, Yexian Ren, Hongruixuan Chen, Naoto Yokoya

机构 * RIKEN AIP(日本理化学研究所革新智能研究中心) Wuhan University(武汉大学) Linköping University(林雪平大学) University of Tokyo(东京大学) Nanjing University of Information Science and Technology(南京信息工程大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出 GeoMMBench 和 GeoMMAgent,通过综合多模态问答基准和多智能体框架,解决地质科学和遥感领域知识广、传感器异构、任务碎片化等挑战,提升专家级空间解释能力。

Comments CVPR 2026 Highlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏