SynthDocBench: Controlled Benchmark for Long-Context Visual Document Understanding
SynthDocBench:用于长上下文视觉文档理解的可控基准测试
专题命中 文档图表理解 :vision language model(abstract);分类 cs.CV、cs.AI
AI总结 研究针对视觉语言模型在现实文档理解中归因失败原因困难的问题,引入SynthDocBench基准测试,通过组合设计控制多因素,端到端生成多样长文档,评估模型发现三种现有基准未暴露的失败模式,揭示模型或过度拟合基准工件。
Comments 29 Pages, 27 Tables, 13 Figures, Accepted at COLM 2026