arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-05 至 2026-03-05 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 8 篇

2511.09396 2026-03-05 cs.CL cs.AI 86%

Multimodal Large Language Models for Low-Resource Languages: A Case Study for Basque

多模态大语言模型用于低资源语言:巴斯克语的案例研究

Lukas Arana, Julen Etxaniz, Ander Salaberria, Gorka Azkune

专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CL、cs.AI

AI总结 本文通过开发巴斯克语多模态大语言模型,证明低比例多模态数据即可获得良好性能,且无需巴斯克语指导的LLM即可实现强模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03380 2026-03-05 cs.RO cs.AI 79%

LiteVLA-Edge: Quantized On-Device Multimodal Control for Embedded Robotics

LiteVLA-Edge: 量化在设备上多模态控制用于嵌入式机器人

Justin Williams, Kishor Datta Gupta, Roy George, Mrinmoy Sarkar

机构 * Clark Atlanta University(克拉克阿特兰大学) Siemens Corporation(西门子公司)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 LiteVLA-Edge通过量化和GPU加速,在嵌入式机器人中实现低延迟的多模态控制,提供模块化本地执行方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00251 2026-03-05 cs.SE cs.AI cs.SY eess.SY 74%

GENAI WORKBENCH: AI-Assisted Analysis and Synthesis of Engineering Systems from Multimodal Engineering Data

GenAI Workbench: 人工智能辅助从多模态工程数据中分析和合成工程系统

H. Sinan Bank, Daniel R. Herber

机构 * Colorado State University(科罗拉多州立大学)

专题命中 图文多模态 :multimodal(title);分类 cs.AI

AI总结 GenAI Workbench通过整合AI技术,实现从多模态工程数据中辅助分析和合成工程系统,促进更集成和数据驱动的工程设计方法。

Comments 7 pages, 3 figures, accepted to be presented at IISE Annual Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25541 2026-03-05 cs.CV cs.AI 62%

Vision-Zero: Scalable VLM Self-Improvement via Strategic Gamified Self-Play

Vision-Zero: 通过战略化游戏化自play实现可扩展的VLM自改进

Qinsi Wang, Bo Liu, Tianyi Zhou, Jing Shi, Yueqian Lin, Yiran Chen, Hai Helen Li, Kun Wan, Wentian Zhao

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Vision-Zero通过战略化游戏化自play框架,实现无标注数据下的多模态模型自改进,提升推理与跨领域任务性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03580 2026-03-05 cs.CV 57%

An Effective Data Augmentation Method by Asking Questions about Scene Text Images

通过提问场景文本图像来实现有效的数据增强方法

Xu Yao, Lei Kang

机构 * Computer Vision Center, Barcelona, Spain(巴塞罗那计算机视觉中心)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出了一种基于问答的场景文本数据增强方法,通过生成字符级问题提升OCR模型的推理能力,实验表明在WordArt和Esposalles数据集上有效降低了CER和WER。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03942 2026-03-05 cs.RO 50%

Lightweight Visual Reasoning for Socially-Aware Robots

轻量级视觉推理用于社交感知机器人

Alessio Galatolo, Ronald Cumbal, Alexandros Rouchitsas, Katie Winkle, Didem Gürdür Broo, Ginevra Castellano

机构 * Department of Information Technology, Uppsala University(信息科技系,乌普萨拉大学)

专题命中 图文多模态 :multimodal(abstract)

AI总结 本研究提出了一种轻量级视觉推理模块,用于提升社交感知机器人在复杂人机交互中的表现,通过闭环反馈机制增强机器人对动态人类行为的理解和响应能力。

Comments ICRA26

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25191 2026-03-05 cs.RO 50%

SoraNav: Adaptive UAV Task-Centric Navigation via Zeroshot VLM Reasoning

SoraNav: 通过零样本VLM推理实现适应性无人机任务导向导航

Hongyu Song, Rishabh Dev Yadav, Cheng Guo, Wei Pan

机构 * Department of Computer Science, The University of Manchester(计算机科学系,曼彻斯特大学)

专题命中 图文多模态 :multi-modal(abstract)

AI总结 SoraNav通过零样本VLM推理实现无人机任务导向导航,解决空间-语义差距问题,提升导航成功率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03527 2026-03-05 cs.LG 50%

Logit-Level Uncertainty Quantification in Vision-Language Models for Histopathology Image Analysis

视觉-语言模型在病理图像分析中的logit级不确定性量化

Betul Yurdem, Ferhat Ozgur Catak, Murat Kuzlu, Mehmet Kemal Gullu

机构 * Department of Electrical and Electronics Engineering, Izmir Bakircay University(电气与电子工程系,伊兹密尔巴克伊大学) Department of Electrical Engineering and Computer Science, University of Stavanger(电气工程与计算机科学系,斯塔万格大学) Batten College of Engineering and Technology, Old Dominion University(工程与技术学院,老奥布良大学)

专题命中 图文多模态 :multimodal(abstract)

AI总结 本研究提出了一种基于VLMs的logit级不确定性量化框架,用于评估病理图像分析中模型的可靠性与安全性。

Comments 10 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏