arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-10 至 2026-03-10 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 5 篇

2603.07936 2026-03-10 cs.CV 70%

Text to Automata Diagrams: Comparing TikZ Code Generation with Direct Image Synthesis

文本到自动机图:比较TikZ代码生成与直接图像合成

Ethan Young, Zichun Wang, Aiden Taylor, Chance Jewell, Julian Myers, Satya Sri Rajiteswari Nimmagadda, Anthony White, Aniruddha Maiti, Ananya Jana

机构 * Marshall University(马歇尔大学) West Virginia State University(西弗吉尼亚州立大学)

专题命中 文档图表理解 :vision-language model(abstract);vision language model(abstract);分类 cs.CV

AI总结 本研究比较了通过视觉-语言模型生成TikZ代码与直接图像合成在生成自动机图描述中的效果,发现人工修正能显著提高生成准确性。

Comments Accepted to ASEE North Central Section 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08274 2026-03-10 cs.CL cs.AI 57%

How Much Do LLMs Hallucinate in Document Q&A Scenarios? A 172-Billion-Token Study Across Temperatures, Context Lengths, and Hardware Platforms

在文档问答场景中,大型语言模型会有多大的幻觉?一项跨温度、上下文长度和硬件平台的1720亿token研究

JV Roig

机构 * Kamiwaza AI

专题命中 文档图表理解 :grounding(abstract);分类 cs.AI

AI总结 研究通过大规模评估揭示了大型语言模型在文档问答中幻觉率与温度、上下文长度及硬件平台的关系,发现模型选择和温度设置显著影响准确性与伪造率。

Comments 18 pages, 12 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07494 2026-03-10 cs.CV 57%

DocCogito: Aligning Layout Cognition and Step-Level Grounded Reasoning for Document Understanding

DocCogito: 对齐布局认知与分步 grounded 推理以实现文档理解

Yuchuan Wu, Minghan Zhuo, Teng Fu, Mengyang Zhao, Bin Li, Xiangyang Xue

机构 * Fudan University(复旦大学)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

AI总结 DocCogito通过整合布局感知与结构化推理,提升文档理解的准确性和推理过程的系统性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07119 2026-03-10 cs.CV 57%

TIQA: Human-Aligned Text Quality Assessment in Generated Images

TIQA: 生成图像中的人工对齐文本质量评估

Kirill Koltsov, Aleksandr Gushchin, Dmitriy Vatolin, Anastasia Antsiferova

机构 * Lomonosov Moscow State University(洛蒙诺索夫莫斯科国立大学) ISP RAS Research Center for Trusted Artificial Intelligence(俄罗斯科学院信息与系统研究所在可信人工智能领域研究中心) MSU Institute for Artificial Intelligence(莫斯科大学人工智能研究所)

专题命中 文档图表理解 :VLM(abstract);分类 cs.CV

AI总结 TIQA通过ANTIQA方法提升生成图像中文本质量评估的准确性,有效提高文本生成任务的过滤与重排序性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06958 2026-03-10 cs.LG cs.CL 57%

Chart-RL: Generalized Chart Comprehension via Reinforcement Learning with Verifiable Rewards

Chart-RL: 通过可验证奖励的强化学习实现通用图表理解

Xin Zhang, Xingyu Li, Rongguang Wang, Ruizhong Miao, Zheng Wang, Dan Roth, Chenyang Li

机构 * Oracle AI

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.LG

AI总结 Chart-RL通过可验证奖励的强化学习提升图表理解能力,在多个基准测试中超越监督微调,展现强大的泛化和迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏