arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-21 至 2026-07-21 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 3 篇

2607.16203 2026-07-21 cs.LG cs.AI cs.CL 新提交 85%

DocOCR-Eval: A Correction-Based Framework for OCR Tool Selection Without Ground Truth

DocOCR-Eval:一种无需真实标签的基于校正的OCR工具选择框架

Zihan Xu, Puzhen Wu, Lawrence Chun Man Lau, Wei Liu, Sirui Li, Yifan Peng, Yihao Ding

专题命中 文档图表理解 :MLLM(summary_cn,abstract_cn);visual question answering(abstract);multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 针对文档解析中OCR工具选择难题,尤其是标签稀缺情况,提出无标注评估框架DocOCR-Eval。它采用三阶段校正和排序策略,通过跨多个MLLM聚合改善与基于标注排名的对齐,能在现实有限标签设置中实现可靠OCR工具选择并提供实用指导。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17251 2026-07-21 cs.CV 新提交 57%

VecFontLLM: Anchor-Guided Direct Synthesis of Chinese Vector Fonts

VecFontLLM:基于锚点引导的中文矢量字体直接合成

Hao Yuan, Yuxuan Luo, Xing Chen, Zhouhui Lian

机构 * Fuzhou University(福州大学) Peking University(北京大学)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

AI总结 研究旨在解决直接生成中文矢量字体的难题,提出VecFontLLM这一基于锚点引导的多模态大语言模型,通过锚点预测、细化及贝塞尔控制点完成来合成矢量字形,实现高质量少样本合成,实验显示其相比现有方法有显著优势。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17122 2026-07-21 cs.CL 新提交 50%

Scope3Trace: Evidence-Based Identification and Extraction of Scope 3 GHG Emissions from Sustainability Reports

Scope3Trace:基于证据的可持续发展报告中范围三温室气体排放识别与提取

Siyuan Zheng, Yifan Duan, Chao Xue, Flora D. Salim

机构 * UNSW Sydney(新南威尔士大学悉尼分校)

专题命中 文档图表理解 :grounding(abstract)

AI总结 研究针对范围三温室气体排放分析难题,提出Scope3Trace框架,集成多种技术从ESG和可持续发展报告中提取相关信息,并构建多模态数据集,实现了异构可持续发展披露信息可靠提取与透明整合,且提取精度高。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏