arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-04 至 2026-05-04 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 5 篇

2604.23455 2026-05-04 cs.SE 82%

CUJBench: Benchmarking LLM-Agent on Cross-Modal Failure Diagnosis from Browser to Backend

CUJBench:跨模态故障诊断的LLM-代理基准测试

Haoming Meng

专题命中 多模态Agent :cross-modal(title,abstract);multi-modal(abstract)

AI总结 CUJBench是首个结合浏览器可见故障证据与后端可观测性的跨模态故障诊断基准测试,通过LLM辅助生成管道降低标注成本,评估六种前沿模型发现跨模态综合是主要瓶颈。

Comments 10 pages, 1 figure; updated source code url

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10887 2026-05-04 cs.AI 79%

InfantAgent-Next: A Multimodal Generalist Agent for Automated Computer Interaction

InfantAgent-Next:一种用于自动化计算机交互的多模态通用代理

Bin Lei, Weitai Kang, Zijian Zhang, Winson Chen, Xi Xie, Shan Zuo, Mimi Xie, Ali Payani, Mingyi Hong, Yan Yan, Caiwen Ding

机构 * University of Minnesota(明尼苏达大学) University of Illinois Chicago(伊利诺伊大学香槟分校) University of Connecticut(康涅狄格大学) The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) Cisco Research(思科研究)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出InfantAgent-Next,一种多模态通用代理,能够通过文本、图像、音频和视频与计算机交互。该代理结合工具型和纯视觉代理,在高度模块化架构中协同解决解耦任务。在OSWorld等基准上取得7.27%准确率,超越Claude-Computer-Use。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14093 2026-05-04 cs.RO cs.CL cs.CV 62%

A Survey on Vision-Language-Action Models for Embodied AI

具身人工智能中视觉-语言-动作模型的综述

Yueen Ma, Zixing Song, Yuzheng Zhuang, Jianye Hao, Irwin King

机构 * Chinese University of Hong Kong(香港中文大学) University of Bristol(布里斯托大学) Huawei Noah’s Ark Laboratory(华为诺亚实验室)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文综述了具身人工智能中视觉-语言-动作模型的发展,探讨了其在机器人任务中的应用,分类了三种主要研究方向,并讨论了面临的挑战与未来方向。

Comments Project page: https://github.com/yueen-ma/Awesome-VLA

Journal ref IEEE Transactions on Neural Networks and Learning Systems (Early Access), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00708 2026-05-04 cs.LG 50%

Deep Kernel Learning for Stratifying Glaucoma Trajectories

基于深度核学习的青光眼轨迹分层

Bruce Rushing, Angela Danquah, Alireza Namazi, Arjun Dirghangi, Heman Shakeri

机构 * Research Computing(研究计算中心) University of Virginia(弗吉尼亚大学) School of Data Science(数据科学学院) School of Medicine(医学院)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出一种深度核学习方法,利用高斯过程后端对多模态电子健康记录数据建模,识别青光眼患者不同亚群,区分疾病进展与当前严重程度,为临床决策提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13007 2026-05-04 cs.LG cs.CE 50%

Latent Generative Modeling of Random Fields from Limited Training Data

从有限训练数据中学习随机场的潜在生成建模

James E. Warner, Tristan A. Shah, Patrick E. Leser, Geoffrey F. Bomarito, Joshua D. Pribe, Michael C. Stanley

机构 * NASA Langley Research Center(美国国家航空航天局兰利研究中心) Texas Tech. University(德克萨斯技术大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出一种结合领域知识的潜在空间生成模型,用于在数据有限时建模随机场,通过约束-aware VAE和函数解码器学习紧凑的潜在表示,提升生成质量与鲁棒性。

Comments 24 pages plus references and appendices, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏