arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-04 至 2026-05-04 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 7 篇

2506.11991 2026-05-04 cs.CV cs.AI cs.CL 83%

VGR: Visual Grounded Reasoning

VGR:视觉基础推理

Jiacong Wang, Zijian Kang, Haochen Wang, Haiyong Jiang, Jiawen Li, Bohong Wu, Ya Wang, Jiao Ran, Xiao Liang, Chao Feng, Jun Xiao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ByteDance Inc.(字节跳动公司)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出VGR,一种增强视觉感知的多模态大语言模型,通过图像区域检测与回放提升多模态推理能力,在多个基准测试中表现优异。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00434 2026-05-04 cs.CV 83%

LIMSSR: LLM-Driven Sequence-to-Score Reasoning under Training-Time Incomplete Multimodal Observations

LIMSSR:基于大语言模型的训练时不完整多模态观察下的序列到评分推理

Huangbiao Xu, Huanqi Wu, Xiao Ke, Yuxin Peng

机构 * Fujian Provincial Key Laboratory of Networking Computing(网络计算与智能信息处理福建省重点实验室) Intelligent Information Processing, College of Computer(智能信息处理学院) Data Science, Fuzhou University(数据科学,福州大学) Engineering Research Center of Big Data Intelligence, Ministry of Education(大数据智能工程研究中心,教育部) Wangxuan Institute of Computer Technology, Peking University(王宣计算机技术研究所,北京大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出LIMSSR框架,通过提示引导的上下文感知模态补全和多维表示融合,解决训练时不完整多模态数据下的序列到评分推理问题,并在三个动作质量评估数据集上验证了其有效性。

Comments ICML 2026 [Spotlight]

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26181 2026-05-04 cs.LG 82%

SWAN: World-Aware Adaptive Multimodal Networks for Runtime Variations

SWAN:面向运行时变化的世界感知自适应多模态网络

Jason Wu, Shir-Kang Scott Jin, Yuyang Yuan, Maggie Wigness, Lance M. Kaplan, Hang Qiu, Mani Srivastava

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of California, Riverside(加州大学河滨分校) U.S. Army DEVCOM Army Research Laboratory(美国陆军 DEVCOM 军事研究实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 SWAN是一种新型多模态网络,通过动态资源分配和效率优化,在自动驾驶中实现复杂3D检测任务,减少49%的FLOPs并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04465 2026-05-04 cs.AI 79%

The Topology of Multimodal Fusion: Why Current Architectures Fail at Creative Cognition

多模态融合的拓扑学:为何当前架构在创造性认知上失败

Xiujiang Tan

机构 * Guangzhou Academy of Fine Arts(广州美术学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文指出当前多模态AI架构存在拓扑限制而非参数限制,通过哲学、认知科学和数学三个支柱提出多模态融合的拓扑学框架,提出UOO实现、ANALOGY-MM基准和META-TOP三阶基准,通过实验路线验证拓扑同构性。

Comments Expanded 11 technical improvements; 5 reference corrections; Appendix B pseudocode added. ~43 pages, 5 figures. Chinese philosophical terms romanized. Companion monograph available separately

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00357 2026-05-04 cs.GR cs.HC cs.MM 74%

Towards Interactive Multimodal Representation of ML Functions for Human Understanding of ML

面向人类理解的机器学习函数多模态交互表示

Bokang Wang, Yingxuan Liao, Leah Lee, Jack Wesson, Anlan Yang, Ruizi Wang, Yigang Wen

专题命中 多模态训练与对齐 :multimodal(title);分类 cs.MM

AI总结 本文通过交互式可视化增强对机器学习的理解,旨在通过透明数据集探索提升对ML的积极态度,鼓励更多人探索该领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08156 2026-05-04 cs.CV 70%

LandSegmenter: Towards a Flexible Foundation Model for Land Use and Land Cover Mapping

LandSegmenter:面向土地利用与覆盖制图的灵活基础模型

Chenying Liu, Wei Huang, Xiao Xiang Zhu

机构 * Chair of Data Science in Earth Observation, Technical University of Munich(地球观测数据科学教授职位,慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出LandSegmenter框架,解决土地利用与覆盖制图中数据需求高、模型泛化性差的问题,通过多模态数据集、跨模态特征提取和置信度引导融合策略提升模型性能。

Comments Accepted by ISPRS for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16767 2026-05-04 cs.LG 50%

When Structure Doesn't Help: LLMs Do Not Read Text-Attributed Graphs as Effectively as We Expected

结构无助时:LLM在文本属性图上表现不如我们预期

Haotian Xu, Yuning You, Tengfei Ma

机构 * Stony Brook University(石溪大学) California Institute of Technology(加州理工学院)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 研究发现,LLM在仅依赖节点文本描述时已能高效处理文本属性图,而多数结构编码策略效果有限,挑战了传统图学习范式,推动语义驱动的新方法。

Comments LoG 2025

详情

展开后加载摘要…

URL PDF HTML 收藏