arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-10 至 2026-06-10 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 10 篇

2606.10194 2026-06-10 cs.LG cs.AI 新提交 83%

MMClima: A Framework for Multimodal Climate Science Data and Evaluation

MMClima:多模态气候科学数据与评估框架

Muhammad Umer Sheikh, Hassan Abid, Khawar Shehzad, Ufaq Khan, Muhammad Haris Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Missouri(密苏里大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出MMClima,一个包含10万+专家验证问答对的多模态气候问答框架,覆盖文本、视频和图表,用于评估多模态语言模型在气候科学中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05913 2026-06-10 cs.CV 版本更新 83%

A fine-grained attention and geometric correspondence model for musculoskeletal risk classification in athletes using multimodal visual and skeletal features

基于多模态视觉和骨骼特征的运动员肌肉骨骼风险分类的细粒度注意力与几何对应模型

Md. Abdur Rahman, Mohaimenul Azam Khan Raiaan, Tamanna Shermin, Md Rafiqul Islam, Mukhtar Hussain, Sami Azam

机构 * Department of Computer Science and Engineering, United International University(计算机科学与工程系,国际联合大学) Department of Data Science and Artificial Intelligence, Monash University(数据科学与人工智能系,墨尔本大学) Faculty of Science and Technology, Charles Darwin University(科学与技术学院,查尔斯达尔文大学) Applied Artificial Intelligence and Intelligent Systems (AAIINS) Laboratory, Dhaka(应用人工智能与智能系统实验室,达卡)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出ViSK-GAT多模态框架,融合图像和骨骼坐标特征,通过细粒度注意力模块和几何对应模块实现运动员肌肉骨骼风险八级分类,关键指标超93%。

Comments Published in Computers and Electrical Engineering

Journal ref Computers and Electrical Engineering, Vol. 138, 111281, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10790 2026-06-10 cs.CV 新提交 79%

A Multimodal RGB and Events Dataset for Hand Detection in First-Person View

第一人称视角下用于手部检测的多模态RGB和事件数据集

Bharghav Kota, Yulia Sandamirskaya

机构 * Zurich University of Applied Sciences(苏黎世应用科技大学)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 针对移动机器人系统中传统相机在暗光下运动模糊的问题,提出利用事件相机与RGB相机结合的多模态手部检测方法,并通过合成事件数据集实现与现有方法相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09882 2026-06-10 cs.CV cs.LG 新提交 79%

WHU-Infra3D: A Full-stack Multi-modal Dataset and Benchmark for 3D Roadside Infrastructure Inventory

WHU-Infra3D:面向3D路边基础设施清单的全栈多模态数据集与基准

Chong Liu, Luxuan Fu, Xuyu Feng, Zhen Dong, Bisheng Yang

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS)(信息工程测绘遥感国家重点实验室) Wuhan University(武汉大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出WHU-Infra3D多模态基准数据集,覆盖三城市53.8公里,融合全景图像与LiDAR点云,提供2D-3D实例关联和跨帧跟踪,支持基础设施状态诊断与属性识别,填补自动化维护数据集空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09925 2026-06-10 cs.SD 新提交 67%

AudioProcessBench: Benchmark for Identifying Process Errors in Audio-Grounded Reasoning

AudioProcessBench: 音频基础推理中过程错误识别的基准

Xiangyu Zhao, Junyu Yan, Yaling Shen, Zimu Wang, Yiwen Jiang, Stephanie Fong, Qingyang Xu, Jiahe Liu, Dominic Dwyer, Zongyuan Ge

机构 * Monash University(墨尔本大学) Xi’an Jiaotong-Liverpool University(西安交通大学-利物浦大学) Orygen(Orygen研究所) University of Melbourne(墨尔本大学)

专题命中 多模态评测 :multi-modal(abstract);omni-modal(abstract)

AI总结 提出AudioProcessBench基准,用于评估音频-语言模型在推理步骤中的过程错误识别能力,涵盖步骤正确性、错误类型检测和链级聚合三种范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07415 2026-06-10 cs.CV cs.CL 版本更新 62%

ChartREG++: Towards Benchmarking and Improving Chart Referring Expression Grounding under Diverse referring clues and Multi-Target Referring

ChartREG++:面向多样化指代线索和多目标指代的图表指代表达式定位基准与改进

Tianhao Niu, Ziyu Han, Xuan Dong, Qingfu Zhu, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 针对现有图表指代表达式定位基准的局限,提出支持多种定位形式、多目标指代、多样化线索和图表类型的基准,并利用代码驱动合成流水线生成像素级实例掩码,训练实例分割模型集成到多模态定位框架,显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10833 2026-06-10 cs.AI 新提交 57%

Do VLMs Reason Like Engineers? A Benchmark and a Stage-wise Evaluation

视觉语言模型像工程师一样推理吗?一个基准测试与分阶段评估

Syed Wasiq, Syed Mohamad Tawseeq, Yashwant Pravinrao Bangde, Debaditya Roy

机构 * Indian Institute of Technology Kharagpur(印度理工学院卡哈拉格普尔分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 提出工程视觉问答基准EngVQA和8阶段自动评估框架,揭示当前视觉语言模型在工程推理中的显著局限,并验证了自动化评估与人工评分的高度一致性。

Comments 9 pages (main text), 4 figures, 2 tables; 50 pages total including appendix. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09924 2026-06-10 cs.LG cs.AI 新提交 57%

Sigma-Branch: Hierarchical Single-Path Network Reconstruction for Dynamic Inference with Reduced Active Parameters

Sigma-Branch: 用于动态推理的分层单路径网络重构,减少活跃参数

Kohga Tanaka, Hiroaki Nishi

机构 * Graduate School of Science and Technology, Keio University(Keio大学理工学院)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.AI

AI总结 提出Sigma-Branch框架,通过分层二叉树结构将预训练密集网络重构为共享主干、分层路由器和专用叶子,利用激活聚类初始化并微调,推理时仅执行单一路径,在CIFAR-100/ResNet-50等任务上减少58-60%活跃参数,性能损失小于1.72个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20048 2026-06-10 cs.CL cs.CY 版本更新 57%

Culturally uneven urban perception in large language models

大型语言模型通过文化不平等的基线感知城市

Rong Zhao, Wanqi Liu, Zhizhou Sha, Nanxi Su, Yecheng Zhang, Ying Long

机构 * Centre for Advanced Spatial Analysis (CASA), UCL, London, UK(高级空间分析中心(CASA),伦敦大学学院,英国) School of Architecture, Tsinghua University, Beijing, China(清华大学建筑学院,北京,中国) Department of Computer Science, UT Austin, Austin, TX, USA(得克萨斯大学奥斯汀分校计算机科学系,奥斯汀,德克萨斯,美国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本研究通过全球平衡的街景样本测试前沿LLM的城市感知,发现中性提示实际上偏向欧美文化,且文化提示能改变情感评价但无法恢复人类语义多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12306 2026-06-10 cs.LG cs.AI 版本更新 57%

GCA Framework: A GCC Countries-Grounded Dataset and Agentic Pipeline for Climate Decision Support

GCA框架:面向海湾合作委员会国家的数据集与气候决策支持智能体管道

Muhammad Umer Sheikh, Khawar Shehzad, Salman Khan, Fahad Shahbaz Khan, Muhammad Haris Khan

机构 * Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(莫扎德人工智能大学) University of Missouri(密苏里大学) Australian National University(澳大利亚国立大学) Linköping University(林肯大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 提出GCA框架,包含GCC国家多模态数据集GCA-DS和工具增强型智能体GCA,通过领域微调和工具集成提升气候决策可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏