arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-04 至 2026-05-04 共收录 47 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 10 篇

2509.20823 2026-05-04 cs.LG cs.AI cs.CV 62%

CaTS-Bench: Can Language Models Describe Time Series?

CaTS-Bench:语言模型能否描述时间序列?

Luca Zhou, Pratham Yashwante, Marshall Fisher, Alessio Sampieri, Zihao Zhou, Fabio Galasso, Rose Yu

机构 * Sapienza University of Rome(罗马大学) UC San Diego(圣地亚哥大学) ItalAI Labs(意大利AI实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CaTS-Bench,一个涵盖11个领域的时间序列推理基准,通过1746个人工重写描述进行评估,揭示语言模型在时间序列描述中的不足,并提出合成数据生成方法以提升性能。

Comments 9 pages, 6 figures, 4 tables in the main paper. Many more in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00764 2026-05-04 cs.CV cs.HC 57%

Modeling Subjective Urban Perception with Human Gaze

用人类注视建模主观城市感知

Lin Che, Xi Wang, Marc Pollefeys, Konrad Schindler, Martin Raubal, Peter Kiefer

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于注视行为的城市感知框架,通过结合注视数据与场景表示,提升对主观城市感知的预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00224 2026-05-04 cs.AI 57%

TUR-DPO: Topology- and Uncertainty-Aware Direct Preference Optimization

TUR-DPO:基于拓扑和不确定性的直接偏好优化

Abdulhady Abas Abdullah, Fatemeh Daneshfar, Seyedali Mirjalili, Mourad Oussalah

机构 * Artificial Intelligence and Innovation Centre, University of Kurdistan, Erbil, Iraq(人工智能与创新中心,乌尔米耶大学,伊拉克) Department of Computer Engineering, University of Kurdistan, Iran(计算机工程系,乌尔米耶大学,伊朗) Centre for Artificial Intelligence Research and Optimisation, Torrens University Australia, Brisbane, Australia(人工智能研究与优化中心,塔伦斯大学澳大利亚,布里斯班,澳大利亚) Research and Innovation Center, Obuda University, Budapest 1034, Hungary(研究与创新中心,奥布达大学,布达佩斯1034,匈牙利) Center for Machine Vision and Signal Analysis (CMVS), University of Oulu, Finland(机器视觉与信号分析中心(CMVS),奥卢大学,芬兰)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 TUR-DPO通过引入轻量级推理拓扑和结合语义忠实度、效用和拓扑质量,提升偏好对齐的稳定性与鲁棒性,同时保持训练简洁性和无需在线回滚。

Comments Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00800 2026-05-04 cs.LG 50%

Generating Statistical Charts with Validation-Driven LLM Workflows

通过验证驱动的LLM工作流生成统计图表

Pavlin G. Poličar, Andraž Pevcin, Blaž Zupan

机构 * University of Ljubljana Faculty of Computer and Information Science(卢布尔雅那大学计算机与信息科学系)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出一种结构化的LLM工作流,通过验证输出来生成多样且易读的统计图表,解决可视化特有的失败模式,如可读性和语义不匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 5 篇

2604.23455 2026-05-04 cs.SE 82%

CUJBench: Benchmarking LLM-Agent on Cross-Modal Failure Diagnosis from Browser to Backend

CUJBench:跨模态故障诊断的LLM-代理基准测试

Haoming Meng

专题命中 多模态Agent :cross-modal(title,abstract);multi-modal(abstract)

AI总结 CUJBench是首个结合浏览器可见故障证据与后端可观测性的跨模态故障诊断基准测试,通过LLM辅助生成管道降低标注成本,评估六种前沿模型发现跨模态综合是主要瓶颈。

Comments 10 pages, 1 figure; updated source code url

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10887 2026-05-04 cs.AI 79%

InfantAgent-Next: A Multimodal Generalist Agent for Automated Computer Interaction

InfantAgent-Next:一种用于自动化计算机交互的多模态通用代理

Bin Lei, Weitai Kang, Zijian Zhang, Winson Chen, Xi Xie, Shan Zuo, Mimi Xie, Ali Payani, Mingyi Hong, Yan Yan, Caiwen Ding

机构 * University of Minnesota(明尼苏达大学) University of Illinois Chicago(伊利诺伊大学香槟分校) University of Connecticut(康涅狄格大学) The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) Cisco Research(思科研究)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出InfantAgent-Next,一种多模态通用代理,能够通过文本、图像、音频和视频与计算机交互。该代理结合工具型和纯视觉代理,在高度模块化架构中协同解决解耦任务。在OSWorld等基准上取得7.27%准确率,超越Claude-Computer-Use。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14093 2026-05-04 cs.RO cs.CL cs.CV 62%

A Survey on Vision-Language-Action Models for Embodied AI

具身人工智能中视觉-语言-动作模型的综述

Yueen Ma, Zixing Song, Yuzheng Zhuang, Jianye Hao, Irwin King

机构 * Chinese University of Hong Kong(香港中文大学) University of Bristol(布里斯托大学) Huawei Noah’s Ark Laboratory(华为诺亚实验室)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文综述了具身人工智能中视觉-语言-动作模型的发展,探讨了其在机器人任务中的应用,分类了三种主要研究方向,并讨论了面临的挑战与未来方向。

Comments Project page: https://github.com/yueen-ma/Awesome-VLA

Journal ref IEEE Transactions on Neural Networks and Learning Systems (Early Access), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00708 2026-05-04 cs.LG 50%

Deep Kernel Learning for Stratifying Glaucoma Trajectories

基于深度核学习的青光眼轨迹分层

Bruce Rushing, Angela Danquah, Alireza Namazi, Arjun Dirghangi, Heman Shakeri

机构 * Research Computing(研究计算中心) University of Virginia(弗吉尼亚大学) School of Data Science(数据科学学院) School of Medicine(医学院)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出一种深度核学习方法,利用高斯过程后端对多模态电子健康记录数据建模,识别青光眼患者不同亚群,区分疾病进展与当前严重程度,为临床决策提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13007 2026-05-04 cs.LG cs.CE 50%

Latent Generative Modeling of Random Fields from Limited Training Data

从有限训练数据中学习随机场的潜在生成建模

James E. Warner, Tristan A. Shah, Patrick E. Leser, Geoffrey F. Bomarito, Joshua D. Pribe, Michael C. Stanley

机构 * NASA Langley Research Center(美国国家航空航天局兰利研究中心) Texas Tech. University(德克萨斯技术大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出一种结合领域知识的潜在空间生成模型,用于在数据有限时建模随机场,通过约束-aware VAE和函数解码器学习紧凑的潜在表示,提升生成质量与鲁棒性。

Comments 24 pages plus references and appendices, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 7 篇

2506.11991 2026-05-04 cs.CV cs.AI cs.CL 83%

VGR: Visual Grounded Reasoning

VGR:视觉基础推理

Jiacong Wang, Zijian Kang, Haochen Wang, Haiyong Jiang, Jiawen Li, Bohong Wu, Ya Wang, Jiao Ran, Xiao Liang, Chao Feng, Jun Xiao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ByteDance Inc.(字节跳动公司)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出VGR,一种增强视觉感知的多模态大语言模型,通过图像区域检测与回放提升多模态推理能力,在多个基准测试中表现优异。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00434 2026-05-04 cs.CV 83%

LIMSSR: LLM-Driven Sequence-to-Score Reasoning under Training-Time Incomplete Multimodal Observations

LIMSSR:基于大语言模型的训练时不完整多模态观察下的序列到评分推理

Huangbiao Xu, Huanqi Wu, Xiao Ke, Yuxin Peng

机构 * Fujian Provincial Key Laboratory of Networking Computing(网络计算与智能信息处理福建省重点实验室) Intelligent Information Processing, College of Computer(智能信息处理学院) Data Science, Fuzhou University(数据科学,福州大学) Engineering Research Center of Big Data Intelligence, Ministry of Education(大数据智能工程研究中心,教育部) Wangxuan Institute of Computer Technology, Peking University(王宣计算机技术研究所,北京大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出LIMSSR框架,通过提示引导的上下文感知模态补全和多维表示融合,解决训练时不完整多模态数据下的序列到评分推理问题,并在三个动作质量评估数据集上验证了其有效性。

Comments ICML 2026 [Spotlight]

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26181 2026-05-04 cs.LG 82%

SWAN: World-Aware Adaptive Multimodal Networks for Runtime Variations

SWAN:面向运行时变化的世界感知自适应多模态网络

Jason Wu, Shir-Kang Scott Jin, Yuyang Yuan, Maggie Wigness, Lance M. Kaplan, Hang Qiu, Mani Srivastava

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of California, Riverside(加州大学河滨分校) U.S. Army DEVCOM Army Research Laboratory(美国陆军 DEVCOM 军事研究实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 SWAN是一种新型多模态网络,通过动态资源分配和效率优化,在自动驾驶中实现复杂3D检测任务,减少49%的FLOPs并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04465 2026-05-04 cs.AI 79%

The Topology of Multimodal Fusion: Why Current Architectures Fail at Creative Cognition

多模态融合的拓扑学:为何当前架构在创造性认知上失败

Xiujiang Tan

机构 * Guangzhou Academy of Fine Arts(广州美术学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文指出当前多模态AI架构存在拓扑限制而非参数限制,通过哲学、认知科学和数学三个支柱提出多模态融合的拓扑学框架,提出UOO实现、ANALOGY-MM基准和META-TOP三阶基准,通过实验路线验证拓扑同构性。

Comments Expanded 11 technical improvements; 5 reference corrections; Appendix B pseudocode added. ~43 pages, 5 figures. Chinese philosophical terms romanized. Companion monograph available separately

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00357 2026-05-04 cs.GR cs.HC cs.MM 74%

Towards Interactive Multimodal Representation of ML Functions for Human Understanding of ML

面向人类理解的机器学习函数多模态交互表示

Bokang Wang, Yingxuan Liao, Leah Lee, Jack Wesson, Anlan Yang, Ruizi Wang, Yigang Wen

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.MM

AI总结 本文通过交互式可视化增强对机器学习的理解,旨在通过透明数据集探索提升对ML的积极态度,鼓励更多人探索该领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08156 2026-05-04 cs.CV 70%

LandSegmenter: Towards a Flexible Foundation Model for Land Use and Land Cover Mapping

LandSegmenter:面向土地利用与覆盖制图的灵活基础模型

Chenying Liu, Wei Huang, Xiao Xiang Zhu

机构 * Chair of Data Science in Earth Observation, Technical University of Munich(地球观测数据科学教授职位,慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出LandSegmenter框架,解决土地利用与覆盖制图中数据需求高、模型泛化性差的问题,通过多模态数据集、跨模态特征提取和置信度引导融合策略提升模型性能。

Comments Accepted by ISPRS for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16767 2026-05-04 cs.LG 50%

When Structure Doesn't Help: LLMs Do Not Read Text-Attributed Graphs as Effectively as We Expected

结构无助时:LLM在文本属性图上表现不如我们预期

Haotian Xu, Yuning You, Tengfei Ma

机构 * Stony Brook University(石溪大学) California Institute of Technology(加州理工学院)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 研究发现,LLM在仅依赖节点文本描述时已能高效处理文本属性图,而多数结构编码策略效果有限,挑战了传统图学习范式,推动语义驱动的新方法。

Comments LoG 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 1 篇

2605.00644 2026-05-04 cs.LG cs.AI 79%

Learning Multimodal Energy-Based Model with Multimodal Variational Auto-Encoder via MCMC Revision

通过MCMC修订学习多模态能量模型与多模态变分自编码器

Jiali Cui, Zhiqiang Lao, Heather Yu

机构 * Futurewei Technologies Inc(未来联合技术公司)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出通过MCMC修订将多模态EBM、共享潜在生成器和联合推断模型的学习过程交织,提升多模态数据生成的质量与一致性。

Comments Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏