arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-23 至 2026-04-23 共收录 15 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 15 篇

2604.19759 2026-04-23 cs.AI cs.CL 81%

Automated Detection of Dosing Errors in Clinical Trial Narratives: A Multi-Modal Feature Engineering Approach with LightGBM

临床试验叙述中剂量错误自动检测:基于LightGBM的多模态特征工程方法

Mohammad AL-Smadi

机构 * Qatar University(卡塔尔大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于LightGBM的多模态特征工程方法,用于自动检测临床试验叙述中的剂量错误,通过结合多种特征提取方法提升模型性能,克服类别不平衡问题。

Comments Accepted for CL4Health 2026, LREC26 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20263 2026-04-23 q-bio.QM cs.AI cs.LG 79%

AROMA: Augmented Reasoning Over a Multimodal Architecture for Virtual Cell Genetic Perturbation Modeling

AROMA:增强的多模态架构下虚拟细胞基因扰动建模推理

Zhenyu Wang, Geyan Ye, Wei Liu, Man Tat Alexander Ng

机构 * AI for Life Sciences Lab, Tencent(腾讯AI生命科学实验室) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 AROMA通过整合文本证据、图拓扑信息和蛋白质序列特征,提升虚拟细胞基因扰动预测的准确性和可解释性,构建了包含498k样本的 PerturbReason 数据集,实验表明其在多个细胞系中表现优异。

Comments Accepted to ACL 2026 as a Findings paper. Zhenyu Wang and Geyan Ye are equal contributors; Geyan Ye is the corresponding author and project lead

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13232 2026-04-23 cs.AI cs.SE 79%

PlotChain: Deterministic Checkpointed Evaluation of Multimodal LLMs on Engineering Plot Reading

PlotChain: 多模态大语言模型在工程图表阅读中的确定性检查点评估

Mayank Ravishankara

机构 * Independent Researcher, San Francisco, CA, USA(独立研究者,美国加州旧金山)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 PlotChain提出了一种确定性的基于生成器的评估基准,用于评估多模态大语言模型在工程图表阅读中的性能,通过检查点实现子技能诊断和故障定位,展示了不同模型在图表阅读任务中的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00979 2026-04-23 cs.CV cs.AI 79%

IVY-FAKE: A Unified Explainable Framework and Benchmark for Image and Video AIGC Detection

IVY-FAKE:图像和视频AIGC检测的统一可解释框架和基准

Changjiang Jiang, Wenhui Dong, Zhonghao Zhang, Fengchang Yu, Wei Peng, Xinbin Yuan, Yifei Bi, Ming Zhao, Zian Zhou, Chenyang Si, Caifeng Shan

机构 * Nanjing University+(南京大学+)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出IVY-FAKE,首个大规模多模态可解释AIGC检测基准,包含106000+丰富标注样本和5000个手动验证示例,通过GRPO强化学习模型实现可解释推理,提升多基准检测性能,显著优于现有方法。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20319 2026-04-23 cs.CV 77%

SurgCoT: Advancing Spatiotemporal Reasoning in Surgical Videos through a Chain-of-Thought Benchmark

SurgCoT:通过链式推理基准提升手术视频中的时空推理

Gui Wang, YongSong Zhou, Kaijun Deng, Wooi Ping Cheah, Rong Qu, Jianfeng Ren, Linlin Shen

机构 * School of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) University of Nottingham(诺丁汉大学) School of AI, Shenzhen University(深圳大学人工智能学院) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(广东省智能信息处理重点实验室)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multi-modal(abstract);分类 cs.CV

AI总结 SurgCoT通过统一的链式推理框架评估多模态大语言模型在7个外科领域35种手术中的时空推理能力,揭示了商业模型在手术推理中的优势及现有模型的不足。

Comments Accept by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20190 2026-04-23 cs.CV cs.LG 77%

WildFireVQA: A Large-Scale Radiometric Thermal VQA Benchmark for Aerial Wildfire Monitoring

WildFireVQA: 一种大规模的辐射热视觉问答基准用于空中 wildfire 监测

Mobin Habibpour, Niloufar Alipour Talemi, John Spodnik, Camren J. Khoury, Fatemeh Afghah

机构 * Clemson University(克莱姆森大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出WildFireVQA基准,整合RGB影像与辐射热数据,包含6097个样本及207298个问题,评估多模态推理能力,揭示RGB和检索增强热上下文在 wildfire 监测中的表现差异。

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR-W 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20306 2026-04-23 cs.CV cs.AI 73%

Dual Causal Inference: Integrating Backdoor Adjustment and Instrumental Variable Learning for Medical VQA

双重因果推断:整合后门调整与工具变量学习用于医疗视觉问答

Zibo Xu, Qiang Li, Ke Lu, Jin Wang, Weizhi Nie, Yuting Su

机构 * School of Microelectronics, Tianjin University(天津大学微电子学院) Department of Orthopedics, Affiliated Kunshan Hospital of Jiangsu University(江苏大学附属昆山医院骨科部) Department of Clinical Laboratory, The Third Central Hospital of Tianjin(天津第三中心医院临床实验室) School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出双重因果推断框架,通过整合后门调整和工具变量学习,解决医疗视觉问答中多模态数据中的内在偏见问题,提升模型的诊断推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20350 2026-04-23 cs.CV 70%

X-PCR: A Benchmark for Cross-modality Progressive Clinical Reasoning in Ophthalmic Diagnosis

X-PCR:眼科诊断中跨模态渐进临床推理的基准测试

Gui Wang, Zehao Zhong, YongSong Zhou, Yudong Li, Ende Wu, Wooi Ping Cheah, Rong Qu, Jianfeng Ren, Linlin Shen

机构 * School of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Tsinghua University(清华大学) University of Nottingham(诺丁汉大学) School of AI, Shenzhen University(深圳大学人工智能学院) Wenzhou Medical University(温州医科大学) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(广东省智能信息处理重点实验室)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出X-PCR基准测试,通过完整眼科诊断流程评估多模态大语言模型的渐进推理和跨模态整合能力,包含26,415张图像和177,868个专家验证的VQA对,评估21个模型揭示其在渐进推理和跨模态整合方面的不足。

Comments Accept by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20511 2026-04-23 cs.LG cs.AI cs.CL cs.CV cs.CY 67%

CHASM: Unveiling Covert Advertisements on Chinese Social Media

CHASM:揭示中国社交媒体上的隐蔽广告

Jingyi Zheng, Tianyi Hu, Yule Liu, Zhen Sun, Zongmin Zhang, Zifan Peng, Wenhan Dong, Xinlei He

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出CHASM数据集,用于评估多模态大语言模型在检测社交媒体隐蔽广告的能力,揭示当前模型在识别隐蔽广告中的不足及改进方向。

Comments NeuIPS 2025 (Datasets and Benchmarks Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19888 2026-04-23 cs.CV 57%

SGAP-Gaze: Scene Grid Attention Based Point-of-Gaze Estimation Network for Driver Gaze

SGAP-Gaze:基于场景网格注意力的驾驶员注视点估计网络

Pavan Kumar Sharma, Pranamesh Chakraborty

机构 * Department of Civil Engineering, Indian Institute of Technology Kanpur(印度理工学院坎浦尔分校土木工程系)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出SGAP-Gaze网络,结合面部和场景信息,通过Transformer注意力机制提升驾驶员注视点估计精度,实验显示在UD-FSG和LBW数据集上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01233 2026-04-23 cs.CV cs.GR cs.HC 57%

Towards Reliable Human Evaluations in Gesture Generation: Insights from a Community-Driven State-of-the-Art Benchmark

迈向可靠的 gesture 生成人类评估:来自社区驱动的最新基准的见解

Rajmund Nagy, Hendric Voss, Thanh Hoang-Minh, Mihail Tsakov, Teodor Nikolov, Zeyi Zhang, Tenglong Ao, Sicheng Yang, Shaoli Huang, Yongkang Cheng, M. Hamza Mughal, Rishabh Dabral, Kiran Chhatre, Christian Theobalt, Libin Liu, Stefan Kopp, Rachel McDonnell, Michael Neff, Taras Kucherenko, Youngwoo Yoon, Gustav Eje Henter

机构 * KTH Royal Institute of Technology(皇家理工学院) Bielefeld University(比勒菲尔德大学) University of Science – VNUHCM(越南胡志明市国家大学) Independent Researcher(独立研究者) Motorica AB(Motorica AB公司) Peking University(北京大学) Tsinghua University(清华大学) Astribot(Astribot公司) Max-Planck Institute for Informatics, SIC(马克斯·普朗克信息研究所,SIC) Trinity College Dublin(都柏林大学) University of California, Davis(加州大学戴维斯分校) SEED – Electronic Arts(SEED–电子艺界) Electronics and Telecommunications Research Institute (ETRI)(电子电信研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文通过社区驱动的基准测试,揭示了 gesture 生成中人类评估的标准化问题,指出 motion 实际和语音-手势对齐的评估结果存在争议,强调需采用解耦的评估方法以提升基准测试的准确性。

Comments Accepted to CVPR 2026, Findings Track. 23 pages, 10 figures. The last two authors made equal contributions

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20570 2026-04-23 cs.CV 57%

Exploring Spatial Intelligence from a Generative Perspective

从生成视角探索空间智能

Muzhi Zhu, Shunyao Jiang, Huanyi Zheng, Zekai Luo, Hao Zhong, Anzhou Li, Kaijun Wang, Jintao Rong, Yang Liu, Hao Chen, Tao Lin, Chunhua Shen

机构 * Zhejiang University(浙江大学) State Key Laboratory of CAD & CG(计算机辅助设计与图形学国家重点实验室) Ant Group(蚂蚁集团) Westlake University(西湖大学) Zhejiang University of Technology(浙江工业大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出GSI-Bench,首个评估生成空间智能的基准,通过空间 grounded 图像编辑量化空间合规性与编辑保真度,实验表明生成训练可提升空间推理能力。

Comments Accepted by CVPR 2026. Project page: https://aim-uofa.github.io/GSI-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14785 2026-04-23 cs.AI 57%

MirrorBench: Evaluating Self-centric Intelligence in MLLMs by Introducing a Mirror

MirrorBench: 通过引入镜像评估多模态大语言模型中的自中心智能

Shengyu Guo, Tongrui Ye, Jianbo Zhang, Zicheng Zhang, Chunyi Li, Guangtao Zhai

机构 * Shanghai AI Lab(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 MirrorBench通过引入镜像测试,系统评估多模态大语言模型的自中心智能,揭示其在基础视觉感知到高级自我表征方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18236 2026-04-23 cs.CV 57%

Human-like Content Analysis for Generative AI with Language-Grounded Sparse Encoders

具有语言基础的稀疏编码的生成AI内容分析

Yiming Tang, Arash Lagzian, Srinivas Anumasa, Qiran Zou, Yingtao Zhu, Ye Zhang, Trang Nguyen, Yih-Chung Tham, Ehsan Adeli, Ching-Yu Cheng, Yilun Du, Dianbo Liu

机构 * National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) Stanford University(斯坦福大学) Harvard University(哈佛大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出LanSE工具,通过自然语言描述将图像分解为可解释的视觉模式,实现了对生成AI内容的细粒度分析,提升了物理合理性评估并扩展至医学影像领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20423 2026-04-23 cs.RO 50%

OVPD: A Virtual-Physical Fusion Testing Dataset of OnSite Auton-omous Driving Challenge

OVPD:OnSite自动驾驶挑战赛的虚拟-物理融合测试数据集

Yuhang Zhang, Jiarui Zhang, Bowen Jian, Xin Zhou, Zhichao Lv, Peng Hang, Rongjie Yu, Ye Tian, Jian Sun

机构 * College of Transportation, Tongji University, Shanghai 201804, China(同济大学交通运输学院,上海201804,中国)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 OVPD数据集通过融合虚拟背景交通与车辆-基础设施感知,构建可控互动闭环测试环境,提供多模态数据用于长期规划与决策验证,支持安全、效率等多维度评估。

Comments 11 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏