arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-08 至 2026-04-08 共收录 21 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 21 篇

2604.05171 2026-04-08 cs.CV cs.AI 84%

Modality-Aware and Anatomical Vector-Quantized Autoencoding for Multimodal Brain MRI

多模态脑MRI的模态感知与解剖矢量量化自编码

Mingjie Li, Edward Kim, Yue Zhao, Ehsan Adeli, Kilian M. Pohl

机构 * Stanford University(斯坦福大学)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出NeuroQuant,一种基于模态感知和解剖学的3D矢量量化自编码器,用于多模态脑MRI重建,通过共享潜在表示和双流编码提升重建精度。

Comments CVPR Fingdings track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05873 2026-04-08 cs.MM 83%

Learning Shared Sentiment Prototypes for Adaptive Multimodal Sentiment Analysis

学习共享情感原型以实现自适应多模态情感分析

Chen Su, Yuanhe Tian, Yan Song

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 本文提出PRISM框架,通过共享原型空间实现多模态证据的结构化比较与自适应融合,动态调整模态权重以提升多模态情感分析性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05831 2026-04-08 cs.LG cs.AI 83%

HeartcareGPT: A Unified Multimodal ECG Suite for Dual Signal-Image Modeling and Understanding

HeartcareGPT:一种统一的多模态ECG套件,用于双信号-图像建模与理解

Yihan Xie, Sijing Li, Tianwei Lin, Zhuonan Wang, Chenglin Yang, Yu Zhong, Wenjie Yan, Wenqiao Zhang, Xiaogang Guo, Jun Xiao, Yueting Zhuang, Beng Chin Ooi

机构 * Zhejiang University(浙江大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出HeartcareGPT,通过Dual Stream Projection Alignment机制,实现ECG信号与图像的统一建模,提升多视角ECG理解能力,并建立医学多模态大语言模型向生理信号领域扩展的方法论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02949 2026-04-08 cs.CL cs.CV 81%

ProMQA-Assembly: Multimodal Procedural QA Dataset on Assembly

ProMQA-Assembly:多模态装配任务问答数据集

Kimihiro Hasegawa, Wiradee Imrattanatrai, Masaki Asada, Susan Holm, Yuran Wang, Vincent Zhou, Ken Fukuda, Teruko Mitamura

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) National Institute of Advanced Industrial Science and Technology (AIST)(国立研究开发法人产业技术综合研究所(AIST))

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出ProMQA-Assembly数据集,包含646个多模态问答对,用于评估装配任务中的人机交互系统,通过半自动化标注方法生成问题并结合细粒度动作标签提升多样性,验证了推理模型在复杂多模态任务中的表现。

Comments LREC 2026. Code and data: https://github.com/kimihiroh/promqa-assembly

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05674 2026-04-08 cs.CR cs.AI 79%

From Incomplete Architecture to Quantified Risk: Multimodal LLM-Driven Security Assessment for Cyber-Physical Systems

从不完整架构到量化风险:面向网络物理系统的多模态LLM驱动安全评估

Shaofei Huang, Christopher M. Poskitt, Lwin Khin Shar

机构 * Singapore Management University(新加坡管理大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出ASTRAL方法,利用多模态LLM重构和分析网络物理系统架构,通过提示链、少样本学习和架构推理实现安全威胁识别和风险量化评估。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05558 2026-04-08 cs.CV 79%

Evaluation Before Generation: A Paradigm for Robust Multimodal Sentiment Analysis with Missing Modalities

在生成前评估:一种用于缺失模态的鲁棒多模态情感分析的范式

Rongfei Chen, Tingting Zhang, Xiaoyu Shen, Wei Zhang

机构 * School of Computer Science and Technology, Eastern Institute of Technology, Ningbo, China(东部理工学院计算机科学与技术学院) School of Mechatronic Engineering and Automation, Shanghai University, China(上海大学机电工程与自动化学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种在生成前评估的框架,通过动态评估缺失模态的重要性,分解共享提示为模态特定的私有提示,并动态调整提示权重,以提升多模态情感分析的鲁棒性与稳定性。

Comments 6 pages, 3 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05557 2026-04-08 cs.CL 79%

EpiBench: Benchmarking Multi-turn Research Workflows for Multimodal Agents

EpiBench:多轮研究工作流的多模态代理基准测试

Xuan Dong, Huanyang Zheng, Tianhao Niu, Zhe Han, Pengzhan Li, Bofei Liu, Zhengyang Liu, Guancheng Li, Qingfu Zhu, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 EpiBench通过多轮多模态任务评估代理在文献检索、证据整合和跨论文比较中的能力,揭示现有基准在多证据整合和持续证据使用方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05545 2026-04-08 eess.AS 79%

Multimodal Deep Learning Method for Real-Time Spatial Room Impulse Response Computing

多模态深度学习方法用于实时空间房间脉冲响应计算

Zhiyu Li, Xinwen Yue, Shenghui Zhao, Jing Wang

专题命中 多模态评测 :multimodal(title,abstract);分类 eess.AS

AI总结 本文提出一种多模态深度学习模型,用于VR混响生成实时空间房间脉冲响应,通过几何声学计算低阶反射,提升计算效率与个性化声学感知重建能力。

Comments This work was accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10287 2026-04-08 cs.LG cs.CL 79%

OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models

OutSafe-Bench:一种用于大型语言模型多模态攻击内容检测的基准测试

Yuping Yan, Yuhan Xie, Yuanshuai Li, Yingchao Yu, Lingjuan Lyu, Yaochu Jin

机构 * School of Engineering, Westlake University(西湖大学工学院) Sony AI(索尼人工智能)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出OutSafe-Bench,首个多模态时代内容安全评估测试套件,包含四类模态大规模数据集及多维交叉风险评分指标,评估九种内容风险类别,揭示九种先进MLLM的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07388 2026-04-08 cs.CL 79%

Recent Advances in Multimodal Affective Computing: An NLP Perspective

多模态情感计算近期进展:自然语言处理视角

Guimin Hu, Weimin Lyu, Chang Sun, Zhihong Zhu, Lin Gui, Ruichu Cai, Erik Cambria, Hasti Seifi

机构 * Guangdong University of Technology(广东工业大学) Stony Brook University(石溪大学) University of Bologna(博洛尼亚大学) Peking University(北京大学) Nanyang Technological University(南洋理工大学) Arizona State University(亚利桑那州立大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文从自然语言处理视角系统回顾了多模态情感计算的最新进展,聚焦于多模态情感分析、对话中多模态情绪识别、基于方面的多模态情感分析及多标签情绪识别等四个任务,提出统一视角并探讨相关方向与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04997 2026-04-08 cs.IR cs.AI cs.CL cs.CV cs.LG 67%

Evaluation of Embedding-Based and Generative Methods for LLM-Driven Document Classification: Opportunities and Challenges

嵌入式与生成方法在LLM驱动文档分类中的评估:机遇与挑战

Rong Lu, Hao Liu, Song Hou

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文比较了基于嵌入和生成模型在地学技术文档分类中的表现,发现增强的生成视觉-语言模型在零样本准确率上表现更优,但监督微调对训练数据不平衡敏感。

Comments Accepted at the IMAGE'25 Workshop (PCW-11), Society of Exploration Geophysicists (SEG). Published version available at https://doi.org/10.1190/image2025-w11-03.1

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12705 2026-04-08 cs.CL cs.AI cs.CV eess.IV 67%

MedXIAOHE: A Comprehensive Recipe for Building Medical MLLMs

MedXIAOHE:构建医疗多模态大语言模型的全面指南

Baorong Shi, Bo Cui, Boyuan Jiang, Deli Yu, Fang Qian, Haihua Yang, Huichao Wang, Jiale Chen, Jianfei Pan, Jieqiong Cao, Jinghao Lin, Kai Wu, Lin Yang, Shengsheng Yao, Tao Chen, Xiaojun Xiao, Xiaozhong Ji, Xu Wang, Yijun He, Zhixiong Yang

机构 * ByteDance XiaoHe Medical AI(字节跳动小荷医疗AI)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 MedXIAOHE通过实体感知持续预训练框架和强化学习提升医疗理解与推理,实现医疗多模态大模型的突破性进展。

Comments XIAOHE Medical AI team. See paper for full author list. Currently, the model is exclusively available on XIAOHE AI Doctor, accessible via both the App Store and the Douyin Mini Program. Updated to improve the layout

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06079 2026-04-08 cs.CV cs.AI 62%

Scientific Graphics Program Synthesis via Dual Self-Consistency Reinforcement Learning

通过双自一致性强化学习实现科学图形程序合成

Juekai Lin, Yun Zhu, Honglin Lin, Sijing Li, Tianwei Lin, Zheng Liu, Xiaoyang Wang, Wenqiao Zhang, Lijun Wu

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出双自一致性强化学习框架,结合高质量数据集和多维基准,提升科学图形到可编辑TikZ代码的转换能力,实现视觉与结构的高精度优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05620 2026-04-08 cs.CV cs.AI 62%

Semantic-Topological Graph Reasoning for Language-Guided Pulmonary Screening

语义-拓扑图推理用于语言引导的肺部筛查

Chenyu Xue, Yiran Liu, Mian Zhou, Jionglong Su, Zhixiang Lu

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学) University College London(伦敦大学学院) University of Liverpool(利物浦大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出语义-拓扑图推理框架,结合大语言模型与视觉基础模型,解决临床报告语义模糊和低对比度扫描的解歧问题,实现高精度肺部筛查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04638 2026-04-08 cs.AI cs.CL cs.IR 62%

Advancing AI Research Assistants with Expert-Involved Learning

通过专家参与学习推进AI研究助手

Tianyu Liu, Simeng Han, Hanchen Wang, Xiao Luo, Pan Lu, Biqing Zhu, Yuge Wang, Keyi Li, Jiapeng Chen, Rihao Qu, Yufeng Liu, Xinyue Cui, Aviv Yaish, Yuhang Chen, Minsheng Hao, Chuhan Li, Kexing Li, Yinsheng Lu, Xinyu Wei, Qinzhe Xing, Antonia Panescu, Mengbo Wang, Vibha Annaswamy, Alicia Sanchez, Jack Cloherty, Arman Cohan, Hua Xu, Mark Gerstein, James Zou, Hongyu Zhao

机构 * Yale University(耶鲁大学) Broad Institute of MIT and Harvard(麻省理工学院-哈佛大学博德研究所) Google DeepMind(谷歌DeepMind) Stanford University(斯坦福大学) Genentech(基因泰克) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Cornell University(康奈尔大学) Harvard University(哈佛大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ARIEL框架,通过专家验证任务评估大语言模型和多模态模型在生物医学领域的表现,发现提示工程和轻量级微调能提升文本覆盖,计算扩展策略增强视觉问答能力,构建了集成文本和视觉线索的AI助手,提出可检验的机理假设。

Comments 43 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05273 2026-04-08 cs.CL 57%

Beneath the Surface: Investigating LLMs' Capabilities for Communicating with Subtext

表层之下:研究LLMs在使用隐喻沟通中的能力

Kabir Ahuja, Yuxuan Li, Andrew Kyle Lampinen

机构 * Google DeepMind(谷歌DeepMind) University of Washington(华盛顿大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL

AI总结 本文研究语言模型是否能利用隐喻进行沟通,并引入四个新评估套件。发现前沿模型倾向于过于直白的沟通,但在某些情况下能通过共同基础减少直白线索,但难以推断隐含的共同基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05210 2026-04-08 cs.CV 57%

Integration of Object Detection and Small VLMs for Construction Safety Hazard Identification

对象检测与小型视觉语言模型的整合用于建筑安全危险识别

Muhammad Adil, Mehmood Ahmed, Muhammad Aqib, Vicente A. Gonzalez, Gaang Lee, Qipei Mei

机构 * Infrastructure Human Tech (IHT) Lab, Department of Civil and Environmental Engineering, University of Alberta, Edmonton, Alberta, Canada(基础设施人类技术(IHT)实验室,土木与环境工程系,阿尔伯塔大学,埃德蒙顿,阿尔伯塔,加拿大)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种结合对象检测与多模态推理的轻量级框架,以提高建筑工地安全危险识别的准确性和效率,实验表明该方法在多个小型视觉语言模型上均提升了检测性能和解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24536 2026-04-08 cs.CL cs.HC 57%

Robust Multilingual Text-to-Pictogram Mapping for Scalable Reading Rehabilitation

鲁棒多语言文本到图示映射以实现可扩展的阅读康复

Soufiane Jhilal, Martina Galletti

机构 * Sony Computer Sciences Laboratories(索尼计算机科学实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出一种多语言AI界面,通过自动增强文本并映射相关图示,帮助特殊教育需求儿童提高阅读理解能力,经过五种语言评估显示系统在语义安全性和可用性方面具有技术可行性。

Comments Accepted at IEEE ICALT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14998 2026-04-08 cs.CV 57%

FinCriticalED: A Visual Benchmark for Financial Fact-Level OCR

FinCriticalED:一个用于金融事实级OCR的视觉基准

Yueru He, Xueqing Peng, Yupeng Cao, Yan Wang, Lingfei Qian, Haohang Li, Yi Han, Shuyao Wang, Ruoyu Xiang, Fan Zhang, Zhuohan Xie, Mingquan Lin, Prayag Tiwari, Jimin Huang, Guojun Xiong, Sophia Ananiadou

机构 * Columbia University(哥伦比亚大学) Stevens Institute of Technology(史蒂文斯理工学院) Georgia Institute of Technology(佐治亚理工学院) New York University(纽约大学) University of Minnesota(明尼苏达大学) Halmstad University(哈尔姆斯塔德大学) Harvard University(哈佛大学) University of Manchester(曼彻斯特大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出FinCriticalED基准,用于评估OCR和视觉语言模型在金融关键证据上的保真度,发现数值和货币单位是最脆弱的事实类型,揭示了词汇准确性和事实可靠性之间的差距。

Comments Xueqing Peng: Corresponding-Author

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21210 2026-04-08 cs.CV 57%

Toward Generalizable Forgery Detection and Reasoning

朝通用伪造检测与推理方向发展

Yueying Gao, Dongliang Chang, Bingyao Yu, Haotian Qin, Muxi Diao, Lei Chen, Kongming Liang, Zhanyu Ma

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出FDR-Task任务,利用多模态大语言模型实现伪造检测与推理,通过MMFR数据集和FakeReasoning框架提升检测与推理性能。

Comments Accepted to IEEE TIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05366 2026-04-08 cs.CV 57%

The DeepSpeak Dataset

DeepSpeak 数据集

Sarah Barrington, Maty Bohacek, Hany Farid

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出DeepSpeak数据集,包含超过100小时的真实和深度伪造音频视频内容,旨在解决复杂的说话人头像场景。通过提供高质量的真实数据和生成的深度伪造数据,以及基于嵌入的身份匹配方法,提升深度伪造检测的鲁棒性。

Comments https://github.com/hfaridlab/deepspeak

Journal ref Published in CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏