arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-10 至 2026-07-10 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 9 篇

2607.08267 2026-07-10 cs.CV 新提交 83%

UniRef-UAV: A Multimodal Benchmark for Universal Referring in UAV Imagery

UniRef-UAV:无人机图像通用指称的多模态基准测试

Haibin Tian, Huichao Xie, Xuelin Qian, Ruitao Lu, Junwei Han, Dingwen Zhang

机构 * School of Automation, Northwestern Polytechnical University(自动化学院,西北工业大学) College of Missile Engineering, Rocket Force University of Engineering(导弹工程学院,火箭兵工程大学) School of Artificial Intelligence, Chongqing University of Posts and Telecommunications(人工智能学院,重庆邮电大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 该研究针对无人机视觉定位面临的问题,引入通用指称任务,构建UniRef-UAV多模态基准测试,提出UAV-URNet检测式基线方法。实验表明该基线稳定可重复,多模态查询能减少模糊性,相关资源将公开助力可重复研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08215 2026-07-10 cs.DC 新提交 78%

On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend

论非 GPU 人工智能加速器在大模型推理中的局限性:基于华为昇腾的 MoE 和多模态服务的实地研究

Zheng Yu

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究非 GPU 人工智能加速器在大模型推理中的局限性,通过在华为昇腾系统上部署两个大型推理工作负载进行实地研究,总结平台八类限制及原因,量化相关指标,为评估或操作此类加速器的团队提供可重复参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08317 2026-07-10 cs.AI 新提交 74%

Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models

盲点基准:评估多模态模型中的盲点

Matteo Santelmo, Xiuying Wei, Israa Fakih, Felix Bauer, Juan Garcia Giraldo, Chengkun Li, Etienne Bamas, Emmanuel Abbé

机构 * École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

AI总结 研究旨在评估多模态模型盲点,引入盲点基准,收集学生原始问题并标注,提出任务分类法和自动评分管道。分析发现闭源前沿模型超越开源模型,各模型在不同任务类型表现各异,凸显该基准对识别模型弱点的价值。

Comments 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08191 2026-07-10 cs.CV 新提交 70%

Dual-Correlation Hypergraph Network for Unaligned RGBT Video Object Detection and A Large-scale Benchmark

用于未对齐RGBT视频目标检测的双相关超图网络及大规模基准数据集

Qishun Wang, Yapeng Li, Bin Luo, Zhengzheng Tu, Chenglong Li

机构 * Anhui Provincial Key Laboratory of Multimodal Cognitive Computation(安徽省多模态认知计算重点实验室) School of Computer Science and Technology(计算机科学与技术学院) Anhui University(安徽大学) School of Artificial Intelligence(人工智能学院)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对RGBT视频目标检测中图像对空间未对齐问题,提出双相关超图网络DHNet,通过设计PSAM和DHFM模块捕获互补信息,还构建DVT-VOD1000数据集,实验表明该网络检测精度达最优,数据集和代码将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08489 2026-07-10 cs.CV cs.AI cs.HC 新提交 62%

VEGAS: Human-Aligned Video Caption Evaluation via Gaze

VEGAS:通过注视进行与人类对齐的视频字幕评估

Shenghui Chen, Po-han Li, Ximeng Sun, Shijia Yang, Emad Barsoum, Zicheng Liu, Sandeep Chinchali, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) AMD(超威半导体公司)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对视觉语言模型视频字幕忽视观众注意力问题,提出VEGAS无需训练的度量标准,利用注视采样个性化文本,通过拒绝采样选字幕,实验表明其能使字幕更好对齐人类焦点,提升下游检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08768 2026-07-10 cs.CL 新提交 57%

UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks

UniClawBench:面向实际任务中主动智能体的通用基准测试

Zhekai Chen, Chengqi Duan, Kaiyue Sun, Bohao Li, Yuqing Wang, Manyuan Zhang, Xihui Liu

机构 * HKU MMLab(香港大学多媒体实验室) Meituan(美团)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 针对现有基准测试难以评估主动智能体的问题,提出UniClawBench,基于五项基础模型能力设计400个双语现实任务,采用实时评估和闭环评估策略,通过多模型框架对比展示基础模型能力和框架设计对性能的影响,还公开了基准测试和代码。

Comments Project Page: https://uniclawbench.github.io | GitHub Repo: https://github.com/HKU-MMLab/UniClawBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08711 2026-07-10 cs.CV cs.LG 新提交 57%

LTM: Large-scale Terrain Model for Wildfire-prone Landscapes

LTM:适用于易发生野火地区的大规模地形模型

Xiao Fu, Yue Hu, Meida Chen, Peter Anthony Beerel, Barath Raghavan

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 针对易发生野火地区传统地形重建方法不足,提出利用过时DEM的多模态重建框架,通过物理像素对齐降低计算复杂度,经大型地形模拟器验证,相比现有技术显著提升了重建精度与计算效率,为野火应对提供可扩展方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07758 2026-07-10 cs.LG 新提交 50%

Scalable and Trustworthy Earth Observation Foundation Models

可扩展且可信的地球观测基础模型

Syed Usama Imtiaz, Mitra Nasr Azadani, Nasrin Alamdari

机构 * Department of Civil and Environmental Engineering, Florida State University(土木与环境工程系,佛罗里达州立大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 研究地球观测基础模型,指出其因数据特性需特定领域适配。回顾相关设计原则,综合模型格局等内容,纳入基准证据说明评估问题,通过案例展示实践原则,提出应从多方面评估下一代遥感基础模型。

Comments (Preprint, in review) Elsevier Book Chapter: Next-Generation Remote Sensing Methods

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07960 2026-07-10 astro-ph.GA astro-ph.IM 新提交 50%

Enhancing Photometric Redshift Estimation for LSST with a Hybrid LSTM-Mixture Density Network

用混合长短期记忆网络-混合密度网络增强大型综合巡天望远镜的测光红移估计

Zhijian Luo, Yangyang Li, Xinyu Luo, Hubing Xiao, Wei Fang, Shaohua Zhang, Chenggang Shu

专题命中 多模态评测 :multimodal(abstract)

AI总结 研究针对大型综合巡天望远镜测光红移估计问题,提出LSTM-MDNz架构,结合长短期记忆网络与混合密度网络,在HSC数据集上评估性能,相比贝叶斯神经网络基线,提高点估计精度,降低异常值率,实现良好概率校准并能构建高纯度目录。

详情

展开后加载摘要…

URL PDF HTML 收藏