arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-10 至 2026-03-10 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 5 篇

2603.08069 2026-03-10 cs.CV 83%

Synthetic Defect Image Generation for Power Line Insulator Inspection Using Multimodal Large Language Models

利用多模态大语言模型生成合成缺陷图像用于电力线路绝缘子检测

Xuesong Wang, Caisheng Wang

机构 * Department of Electrical and Computer Engineering, Wayne State University(电气与计算机工程系,韦恩州立大学)

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 利用多模态大语言模型生成合成缺陷图像,提升电力线路绝缘子缺陷识别的准确率和数据效率。

Comments Submitted to Engineering Applications of Artificial Intelligence, Feb. 16, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14613 2026-03-10 cs.CL cs.AI cs.CV 81%

Multi-modal, Multi-task, Multi-criteria Automatic Evaluation with Vision Language Models

多模态、多任务、多标准自动评估与视觉语言模型

Masanari Ohi, Masahiro Kaneko, Naoaki Okazaki, Nakamasa Inoue

机构 * Institute of Science Tokyo(东京科学研究所) MBZUAI NII LLMC(日本国立信息与通信技术研究所语言模型中心)

专题命中 其他VLM :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HarmonicEval,一种无需参考的多任务多标准自动评估指标,通过聚合标准评分提升与人类判断的相关性,并构建MMHE基准测试多任务场景下的评估泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08668 2026-03-10 cs.RO 78%

Exp-Force: Experience-Conditioned Pre-Grasp Force Selection with Vision-Language Models

Exp-Force:基于视觉-语言模型的经验条件预抓取力选择

Siqi Shang, Minchao Huang, Bill Fan, Lillian Chin

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 其他VLM :vision-language model(title,abstract)

AI总结 Exp-Force通过经验条件框架利用视觉-语言模型实现基于单张图像的预抓取力选择,显著提升了抓取力的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06991 2026-03-10 cs.SD cs.LG 70%

Adaptive Discovery of Interpretable Audio Attributes with Multimodal LLMs for Low-Resource Classification

基于多模态大语言模型的低资源音频分类中可解释属性的自适应发现

Kosuke Yoshimura, Hisashi Kashima

机构 * Kyoto University(京都大学)

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.LG

AI总结 本文提出利用多模态大语言模型自适应发现可解释音频属性,提升低资源音频分类的效率和准确性。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08060 2026-03-10 cs.HC 50%

CinemaWorld: Generative Augmented Reality with LLMs and 3D Scene Generation for Movie Augmentation

CinemaWorld: 基于 LLM 和 3D 场景生成的生成增强现实用于电影增强

Keiichi Ihara, DaeHo Lee, Manato Abe, Hye-Young Jo, Ryo Suzuki

专题命中 其他VLM :multimodal large language model(abstract)

AI总结 CinemaWorld 利用 LLM 和 3D 场景生成技术,通过增强现实将电影内容与现实环境结合,提升观影沉浸感和娱乐性。

Comments 13 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏