AnnoBench: A Benchmark for Visualization Annotation Generation
AnnoBench:可视化标注生成基准测试
专题命中 文档图表理解 :VLM(summary_cn,abstract);分类 cs.AI
AI总结 介绍AnnoBench可视化标注基准测试,它将可视化与标注任务配对,通过VLM评判执行,经多因素实验评估对标注质量的影响,为推进标注自动化等提供基础。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
AnnoBench:可视化标注生成基准测试
专题命中 文档图表理解 :VLM(summary_cn,abstract);分类 cs.AI
AI总结 介绍AnnoBench可视化标注基准测试,它将可视化与标注任务配对,通过VLM评判执行,经多因素实验评估对标注质量的影响,为推进标注自动化等提供基础。
NEXT:通过视觉语言模型进行推理驱动的视频推荐
专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV、cs.LG
AI总结 研究提出推理驱动的视频推荐框架NEXT,通过对用户已观看视频推理推断其下一个意图来检索后续视频。训练NEXT-8B视觉语言模型,在DocVQA性能上表现出色,在特定评估中提升下一个意图逻辑质量,部署后带来生产收益,证明其可作为实用推理引擎。
Comments 13 pages, 2 figures, 5 tables
图表支持还是模型提供?审视多模态大语言模型生成的可访问可视化声明
专题命中 文档图表理解 :MLLM(title);multimodal large language model(abstract);分类 cs.AI
AI总结 研究多模态大语言模型生成可视化声明的证据基础,通过对多种来源、模型及输入条件的探索性研究,分析模型标签与数值一致性,发现可访问图表上下文有作用,添加图像及无上下文提示效果不佳,推动可区分证据支持声明与模型解释的描述系统发展。
Comments Submitted to the 3rd Workshop on Accessible Data Visualization, IEEE VIS 2026
DocAnnot——利用生成式人工智能驱动的自动注释加速关键信息提取数据集的创建
专题命中 文档图表理解 :vision language model(abstract);分类 cs.CV、cs.AI
AI总结 研究针对关键信息提取中训练数据集创建耗时的问题,提出DocAnnot框架,利用大型视觉语言模型、OCR及SICM算法,在基准测试中自动生成注释有一定F1分数,还能用于微调下游模型,大幅节省时间成本,减少人工依赖但未完全消除人工干预。
Comments 15 pages, 2 figures
Journal ref Proc. ICDAR 2025, Lecture Notes in Computer Science, vol 16025, Part III, pp. 563-576
使用开源语言模型进行科学文档理解的多模态混合检索增强生成
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.AI
AI总结 针对科学文档理解中大型语言模型的问题,提出多模态混合检索增强生成系统。利用开源视觉语言模型生成摘要,结合多种检索方法并优化,采用查询压缩器确保连贯性。经评估,该系统提高了检索质量,验证了开源模型与先进策略结合的竞争力。
Comments 7 pages, 1 figure, 4 tables
HOLODECK 2.0:基于视觉-语言的3D世界生成与编辑
机构 * University of Pennsylvania(宾夕法尼亚大学) ; Cornell University(康奈尔大学)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV
AI总结 HOLODECK 2.0通过视觉-语言模型生成高质量3D场景并支持交互式编辑,提升游戏设计效率。