arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1566 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1566 篇

2404.07612 2024-04-12 cs.CY 50%

Measuring Geographic Diversity of Foundation Models with a Natural Language--based Geo-guessing Experiment on GPT-4

Zilong Liu, Krzysztof Janowicz, Kitty Currier, Meilin Shi

专题命中 其他VLM :multimodal large language model(abstract)

Comments Short paper accepted by AGILE 2024 conference (https://agile-gi.eu/conference-2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06659 2024-02-21 cs.CL 50%

WisdoM: Improving Multimodal Sentiment Analysis by Fusing Contextual World Knowledge

Wenbin Wang, Liang Ding, Li Shen, Yong Luo, Han Hu, Dacheng Tao

专题命中 其他VLM :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10085 2024-01-19 cs.RO 50%

CLIP feature-based randomized control using images and text for multiple tasks and robots

Kazuki Shibata, Hideki Deguchi, Shun Taguchi

专题命中 其他VLM :vision language model(abstract)

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04471 2024-01-10 cs.CL 50%

TransportationGames: Benchmarking Transportation Knowledge of (Multimodal) Large Language Models

Xue Zhang, Xiangyu Shi, Xinyue Lou, Rui Qi, Yufeng Chen, Jinan Xu, Wenjuan Han

专题命中 其他VLM :multimodal large language model(abstract)

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.07589 2023-07-24 cs.HC 50%

GenAssist: Making Image Generation Accessible

Mina Huh, Yi-Hao Peng, Amy Pavel

专题命中 其他VLM :vision-language model(abstract)

Comments For accessibility tagged pdf, please refer to the ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.01582 2023-02-06 cs.CL 50%

Controlling for Stereotypes in Multimodal Language Model Evaluation

Manuj Malik, Richard Johansson

专题命中 其他VLM :vision language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏