arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-19 至 2026-05-19 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 3 篇

2605.17447 2026-05-19 cs.CV cs.CL 57%

FastOCR: Dynamic Visual Fixation via KV Cache Pruning for Efficient Document Parsing

FastOCR: 通过KV缓存剪枝实现高效的动态视觉聚焦文档解析

Zihan Tang, Leqi Shen, Hui Chen, Ao Wang, Ben Wan, Yan Feng, Ke Zhang, Sicheng Zhao, Tongxuan Liu, Guiguang Ding

机构 * Tsinghua University(清华大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出FastOCR,一种无需训练的框架,通过动态视觉聚焦技术解决文档解析中的高效KV缓存剪枝问题,显著提升处理速度和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17356 2026-05-19 cs.CV 57%

UniPPTBench: A Unified Benchmark for Presentation Generation Across Diverse Input Settings

UniPPTBench: 一种统一的演示生成基准,适用于多样化的输入设置

Bo Zhao, Maosheng Pang, Chen Zhang, Huan Yang, Yixin Cao, Wei Ji

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

AI总结 本文提出UniPPTBench,一个统一的演示生成基准,针对四种代表性的输入设置:模糊提示、长文档、多模态文档和多源生成,同时引入UniPPTEval评估协议,结合跨设置比较的共享指标和针对每个设置核心需求的定制指标,以提供更准确的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16274 2026-05-19 cs.HC cs.AI 57%

ChartDesign: Towards LLM Designer of Data Visualization

ChartDesign: 向数据可视化设计的LLM设计师迈进

Mohammed Afaan Ansari, Aniruddh Bansal, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 文档图表理解 :vision language model(abstract);分类 cs.AI

AI总结 本文提出ChartDesign,利用大语言模型生成数据可视化设计属性,提升图表设计性能,实现84%的准确率,并在未见领域中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏