arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-27 至 2026-03-27 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 2 篇

2603.25195 2026-03-27 cs.HC 78%

On-Demand Instructional Material Providing Agent Based on MLLM for Tutoring Support

基于MLLM的按需教学材料提供代理用于辅导支持

Takumi Kato, Masato Kikuchi, Tadachika Ozono

专题命中 其他VLM :MLLM(title);multimodal large language model(abstract)

AI总结 本文提出基于多模态大语言模型的代理,用于在一对一辅导中按需提供教学材料,通过分析对话自动检索相关图片,实验显示检索时间减少44.4秒,85.7%的试次提供可接受质量的图片。

Comments The 20th International Conference on E-Service and Knowledge Management (ESKM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03361 2026-03-27 cs.AI cs.NE 61%

Concepts Learned Visually by Infants Can Contribute to Visual Learning and Understanding in AI Models

婴儿通过视觉学习的概念可以促进AI模型中的视觉学习和理解

Shify Treger, Shimon Ullman

专题命中 其他VLM :vision-language model(abstract,comments);分类 cs.AI

AI总结 研究探讨婴儿早期视觉学习概念如何促进AI模型学习,通过比较早期概念与标准深度网络模型,发现早期概念提升学习准确性和效率,改善模型表征和泛化能力。

Comments Significantly extended version of earlier work, with additional experiments, expanded discussion and related work, new experiments with human participants, and broader evaluation across multiple vision-language models

详情

展开后加载摘要…

URL PDF HTML 收藏