arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-31 至 2026-07-31 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 2 篇

2607.27938 2026-07-31 cs.HC 新提交 67%

VizPilot: Automated Onboarding for SVG-based Composite Visualizations using Multimodal LLMs

VizPilot:基于多模态大语言模型的SVG复合可视化自动引导系统

Nishaanthini Gnanavel, Yong Wang

专题命中 其他VLM :multimodal large language model(abstract,abstract_cn)

AI总结 VizPilot是基于多模态大语言模型的SVG复合可视化自动引导工具,通过双模块实现自动生成交互式引导,经评估可降低创作工作量并减轻用户认知负荷,提升复合可视化可用性。

Comments Accepted by IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28269 2026-07-31 cs.CV cs.AI cs.MM 新提交 62%

Theia: Large-Scale Multimodal Captioning and Automated Validation of the Incidents1M Dataset for Data-Free Distillation

Theia:用于无数据蒸馏的Incidents1M数据集的大规模多模态字幕生成与自动验证

Simone Giano, Lorenzo Severini, Alessandro Galdelli, Adriano Mancini

机构 * Università Politecnica delle Marche(马尔凯理工大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究针对灾害领域多模态数据集的缺陷,提出方法构建并自动验证Incidents1M数据集,生成高保真字幕,其语义一致性达78.65/100,为跨模态知识蒸馏提供了可扩展框架。

详情

展开后加载摘要…

URL PDF HTML 收藏