arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-01 至 2026-04-01 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 3 篇

2603.29252 2026-04-01 cs.CV cs.AI 81%

Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism

通过视觉记忆机制扩展多模态大语言模型的长视频理解

Tao Chen, Kun Zhang, Qiong Wu, Xiao Chen, Chao Chang, Xiaoshuai Sun, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) National University of Defense Technology(国防科技大学)

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出FlexMem方法,通过视觉记忆机制实现长视频理解,有效提升多模态大语言模型处理无限长视频的能力,实验显示其在单块3090 GPU上能处理超1000帧视频并优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29592 2026-04-01 cs.GR cs.CV 57%

Bioinspired123D: Generative 3D Modeling System for Bioinspired Structures

生物启发123D:用于生物启发结构的生成3D建模系统

Rachel K. Luu, Markus J. Buehler

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文提出Bioinspired123D,一种轻量级模块化代码-几何管道,通过参数化程序直接生成可制造的3D结构,而非密集视觉表示。系统基于生物启发3D模型,结合多模态检索增强生成和视觉-语言模型批评者,实现了高效的文本到3D生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22150 2026-04-01 cs.CV 57%

Do VLMs Perceive or Recall? Probing Visual Perception vs. Memory with Classic Visual Illusions

视觉语言模型是感知还是记忆?通过经典视觉错觉探测视觉感知与记忆

Xiaoxiao Sun, Mingyang Li, Kun Yuan, Min Woo Sun, Mark Endo, Shengguang Wu, Changlin Li, Yuhui Zhang, Zeyu Wang, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学) University of Strasbourg(斯特拉斯堡大学) Technical University of Munich(慕尼黑工业大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文通过经典视觉错觉研究视觉语言模型的感知与记忆机制,提出VI-Probe框架,揭示不同模型对视觉变化的响应来源,挑战单一原因观点。

Comments 26 pages, 31 figures, 13 tables. Project Page: https://sites.google.com/view/vi-probe/

详情

展开后加载摘要…

URL PDF HTML 收藏