arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-04 至 2026-05-04 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 10 篇

2605.00156 2026-05-04 cs.MM cs.CR 83%

RoboKA: KAN Informed Multimodal Learning for RoboCall Surveillance System

RoboKA:基于KAN的多模态学习用于RoboCall监控系统

Nitin Choudhury, Nikhil Kumar, Aditya Kumar Sinha, Abhijeet Anand, Hossein Salemi, Orchid Chetia Phukan, Hemant Purohit, Arun Balaji Buduru

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 本文提出RoboKA,一种基于KAN的多模态融合框架,用于建模音频和语言线索之间的非线性交互,以提高RoboCall监控的召回率和F1分数。

Comments Accepted to the International Conference on Multimedia & Expo (ICME) 2026, 7th International Workshop on Surveillance Data Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00184 2026-05-04 cs.LG cs.HC 78%

Introducing WARM-VR: Benchmark Dataset for Multimodal Wearable Affect Recognition in Virtual Reality

引入WARM-VR:多模态可穿戴情感识别基准数据集

Karim Alghoul, Faisal Mohd, Fedwa Laamarti, Hussein Al Osman, Abdulmotaleb El Saddik

机构 * School of Electrical Engineering and Computer Science, University of Ottawa(Ottawa 大学电气工程与计算机科学学院) Computer Science, University of Ottawa(Ottawa 大学计算机科学系) Computer Vision Department, Mohamed bin Zayed University of Artificial Intelligence(摩根·bin·扎耶德人工智能大学计算机视觉部门)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出WARM-VR数据集,用于多感官沉浸环境中可穿戴设备的情感识别,通过生理信号和多模态刺激评估情感状态,并利用CNN和Transformer模型验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21199 2026-05-04 cs.LG cs.CV 70%

ARFBench: Benchmarking Time Series Question Answering Ability for Software Incident Response

ARFBench: 用于软件事件响应的时间序列问题回答能力基准测试

Stephan Xie, Ben Cohen, Mononito Goswami, Junhong Shen, Emaad Khwaja, Chenghao Liu, David Asker, Othmane Abou-Amal, Ameet Talwalkar

机构 * Machine Learning Department, Carnegie Mellon University(卡内基梅隆大学机器学习系) Datadog AI Research(Datadog AI研究) Amazon Web Services(亚马逊网络服务)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 本文提出ARFBench基准测试,评估多模态基础模型对软件事件数据中时间序列异常的理解能力,发现前沿VLM表现优异,提出混合模型并建立模型-专家 oracle,达到超人类水平。

Comments Updated author affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07630 2026-05-04 cs.CL cs.AI cs.CV 67%

InterChart: Benchmarking Visual Reasoning Across Decomposed and Distributed Chart Information

InterChart:跨分解与分布式图表信息的基准测试

Anirudh Iyengar Kaniyar Narayana Iyengar, Srija Mukhopadhyay, Adnan Qidwai, Shubhankar Singh, Dan Roth, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) IIIT, Hyderabad(海得拉巴印度理工学院) Mercer Mettl University(梅森-梅特尔大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 InterChart通过评估视觉语言模型在多图表间推理的能力,揭示了模型在复杂图表集成中的局限性,推动多模态推理的发展。

Comments 22 pages, 8 figures, 14 tables. Accepted at IJCNLP-AACL 2025

Journal ref Proceedings of the 14th International Joint Conference on Natural Language Processing and the 4th Conference of the Asia-Pacific Chapter of the Association for Computational Linguistics 2025, 2046-2067

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13305 2026-05-04 cs.CV cs.AI 62%

WildfireVLM: AI-powered Analysis for Early Wildfire Detection and Risk Assessment Using Satellite Imagery

WildfireVLM:基于卫星影像的AI分析用于早期野火检测与风险评估

Aydin Ayanzadeh, Prakhar Dixit, Sadia Kamal, Milton Halem

机构 * Department of Computer Science and Electrical Engineering(计算机科学与电气工程系) University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 WildfireVLM结合卫星影像检测与语言驱动的风险评估,利用YOLOv12检测火区与烟雾,并通过多模态大语言模型生成风险评估和应急响应建议,验证其有效性并实现实时处理与长期追踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00070 2026-05-04 eess.IV cs.AI cs.CV 62%

Brain MR Image Synthesis with 3D Multi-Contrast Self-Attention GAN

利用3D多对比自注意GAN进行脑部MRI图像合成

Zaid A. Abod, Furqan Aziz

机构 * School of Computing and Mathematical Sciences, University of Leicester(利兹大学计算与数学科学学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出3D-MC-SAGAN框架,通过单张T2w图像生成高保真多对比MRI图像,保留肿瘤特征,结合多种损失函数提升全局真实感和肿瘤结构保真度。

Comments Note: This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20823 2026-05-04 cs.LG cs.AI cs.CV 62%

CaTS-Bench: Can Language Models Describe Time Series?

CaTS-Bench:语言模型能否描述时间序列?

Luca Zhou, Pratham Yashwante, Marshall Fisher, Alessio Sampieri, Zihao Zhou, Fabio Galasso, Rose Yu

机构 * Sapienza University of Rome(罗马大学) UC San Diego(圣地亚哥大学) ItalAI Labs(意大利AI实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CaTS-Bench,一个涵盖11个领域的时间序列推理基准,通过1746个人工重写描述进行评估,揭示语言模型在时间序列描述中的不足,并提出合成数据生成方法以提升性能。

Comments 9 pages, 6 figures, 4 tables in the main paper. Many more in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00764 2026-05-04 cs.CV cs.HC 57%

Modeling Subjective Urban Perception with Human Gaze

用人类注视建模主观城市感知

Lin Che, Xi Wang, Marc Pollefeys, Konrad Schindler, Martin Raubal, Peter Kiefer

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于注视行为的城市感知框架,通过结合注视数据与场景表示,提升对主观城市感知的预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00224 2026-05-04 cs.AI 57%

TUR-DPO: Topology- and Uncertainty-Aware Direct Preference Optimization

TUR-DPO:基于拓扑和不确定性的直接偏好优化

Abdulhady Abas Abdullah, Fatemeh Daneshfar, Seyedali Mirjalili, Mourad Oussalah

机构 * Artificial Intelligence and Innovation Centre, University of Kurdistan, Erbil, Iraq(人工智能与创新中心,乌尔米耶大学,伊拉克) Department of Computer Engineering, University of Kurdistan, Iran(计算机工程系,乌尔米耶大学,伊朗) Centre for Artificial Intelligence Research and Optimisation, Torrens University Australia, Brisbane, Australia(人工智能研究与优化中心,塔伦斯大学澳大利亚,布里斯班,澳大利亚) Research and Innovation Center, Obuda University, Budapest 1034, Hungary(研究与创新中心,奥布达大学,布达佩斯1034,匈牙利) Center for Machine Vision and Signal Analysis (CMVS), University of Oulu, Finland(机器视觉与信号分析中心(CMVS),奥卢大学,芬兰)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 TUR-DPO通过引入轻量级推理拓扑和结合语义忠实度、效用和拓扑质量,提升偏好对齐的稳定性与鲁棒性,同时保持训练简洁性和无需在线回滚。

Comments Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00800 2026-05-04 cs.LG 50%

Generating Statistical Charts with Validation-Driven LLM Workflows

通过验证驱动的LLM工作流生成统计图表

Pavlin G. Poličar, Andraž Pevcin, Blaž Zupan

机构 * University of Ljubljana Faculty of Computer and Information Science(卢布尔雅那大学计算机与信息科学系)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出一种结构化的LLM工作流,通过验证输出来生成多样且易读的统计图表,解决可视化特有的失败模式,如可读性和语义不匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏