arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-06 至 2026-08-06 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 5 篇

2607.29677 2026-08-06 cs.AI 版本更新 70%

ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction

ExtractBench:模式引导的企业文档抽取基准

Boyang Zhang, Adrian Lyjak, Eli Stewart, Zhaoqi Li, Simon Suo

专题命中 文档图表理解 :VLM(abstract_cn);grounding(abstract);分类 cs.AI

AI总结 研究针对企业文档模式引导抽取的评估需求,构建首个同时评估值准确率等多指标的基准ExtractBench,发现LlamaExtract Agentic Plus在成本远低于编码智能体的情况下,准确率可与之媲美。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04452 2026-08-06 cs.CV cs.AI cs.CL 新提交 62%

Q-CueGraph: Query-Conditioned Visual Evidence Graphs for Multimodal Reasoning

Q-CueGraph:用于多模态推理的查询条件化视觉证据图

Pengcheng Pan, Xinfang Zhang

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 Q-CueGraph是一种用于多模态推理的查询条件化视觉证据图,它为冻结读取器生成受预算约束的坐标级观测,在多个基准测试中显著提升了推理性能,尤其适用于证据可定位、问题能区分位置且分辨率受限的场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04832 2026-08-06 cs.CV cs.GR cs.LG 版本更新 62%

BIM-Native Tokenization for Constraint-Aware Room Layout Synthesis

基于标记的建筑:一种用于布局合成的Transformer

Manuel Ladron de Guevara, Jinmo Rhee, Ardavan Bidgoli, Vaidas Razgaitis, Michael Bergin

机构 * Higharc University of Calgary(卡尔加里大学)

专题命中 文档图表理解 :VLM(abstract_cn);分类 cs.CV、cs.LG

AI总结 本文提出SBM模型,通过统一建筑元素的异质特征集生成布局合成的Transformer架构,实现高保真房间嵌入和功能布局生成。

Comments 7 pages, 2 page References, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16060 2026-08-06 cs.CV 版本更新 57%

ArtChart: Faithful Artistic Chart Generation with Integrated Text Rendering

ArtChart:一个用于忠实生成艺术图表并集成文本渲染的基准测试

Meijia Huang, Yingjie Yin, Shihao Wang, Chenguang Ma

机构 * Ant Group(蚂蚁集团)

专题命中 文档图表理解 :VLM(abstract);分类 cs.CV

AI总结 研究旨在解决艺术图表生成难题,提出ArtChart框架,含特定即插即用模块及强化学习等策略,构建基准测试和评估套件,实验证明该框架能生成兼具美观与数学准确性的图表,优于开源基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05087 2026-08-06 cs.CL cs.IR 版本更新 50%

Document Optimization for Black-Box Retrieval via Reinforcement Learning

基于强化学习的黑盒检索文档优化

Omri Uzan, Ron Polonsky, Douwe Kiela, Christopher Potts

机构 * Stanford University(斯坦福大学) ContextualAI

专题命中 文档图表理解 :vision language model(abstract)

AI总结 提出通过强化学习(GRPO)优化文档表示,使其与目标检索器的查询分布对齐,仅需黑盒访问检索排名,在代码和视觉文档检索任务中提升性能,使小模型超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏