arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 45 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 45 篇

2512.05098 2026-08-11 cs.CV cs.AI 版本更新 62%

Beyond Pixels: Benchmarking and Reward-Based Assessing Framework for Visual Spatial Aesthetics

SA-IQA: 重新定义空间美学的图像质量评估:多维奖励

Yuan Gao, Jin Song, Yiyun Fei, Gongzhe Li, Ruigao Yang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 SA-IQA通过多维奖励框架系统评估室内场景的美学质量,利用SA-BENCH基准提升AIGC生成流程和图像质量。

Comments Accepted to CVPRW 2026. Code: https://github.com/AlibabaResearch/SA-IQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04832 2026-08-06 cs.CV cs.GR cs.LG 版本更新 62%

BIM-Native Tokenization for Constraint-Aware Room Layout Synthesis

基于标记的建筑:一种用于布局合成的Transformer

Manuel Ladron de Guevara, Jinmo Rhee, Ardavan Bidgoli, Vaidas Razgaitis, Michael Bergin

机构 * Higharc University of Calgary(卡尔加里大学)

专题命中 文档图表理解 :VLM(abstract_cn);分类 cs.CV、cs.LG

AI总结 本文提出SBM模型,通过统一建筑元素的异质特征集生成布局合成的Transformer架构,实现高保真房间嵌入和功能布局生成。

Comments 7 pages, 2 page References, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19259 2026-07-28 cs.CV cs.AI 版本更新 62%

TextRich: A Multi-Domain Benchmark for Detecting AI-Generated Text-Rich Images from GPT-Image-2

一个用于检测 GPT-Image-2 生成的含丰富文本图像的多领域基准

Yijin Wang, Shuyi Wang, Wenhan Zhang, Yuqi Ouyang

机构 * College of Computer Science(计算机科学学院)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对现有基准缺乏文本丰富图像检测的问题,构建了包含8602张图像、覆盖6个类别的多领域基准,评估5种检测器,发现性能高度依赖领域且易受JPEG压缩影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13376 2026-07-10 cs.CV cs.AI cs.CL 版本更新 62%

An Online Reference-Free Evaluation Framework for Flowchart Image-to-Code Generation

用于流程图图像到代码生成的在线无参考评估框架

Giang Son Nguyen, Zi Pong Lim, Sarthak Ketanbhai Modi, Yon Shin Teo, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学) AUMOVIO Singapore(AUMOVIO新加坡) VinUniversity(文理大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对流程图图像到代码生成在生产中无真实代码难以评估输出质量的问题,提出无参考评估框架,通过RecallOCR和PrecisionVE两个指标及调和均值F1OCR-VE监测生成质量,在FlowVQA数据集验证了其可靠性。

Comments This manuscript was inadvertently made publicly available before all necessary internal review processes had been completed. The authors are withdrawing the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19662 2026-06-09 cs.AI cs.CV 版本更新 62%

FieldWorkArena: Agentic AI Benchmark for Real Field Work Tasks

FieldWorkArena:面向真实作业任务的代理AI基准测试

Jun Takahashi, Atsunori Moteki, Akiyoshi Uchida, Shoichi Masui, Fan Yang, Kanji Uchino, Yueqi Song, Yonatan Bisk, Graham Neubig, Ikuo Kusajima, Yasuto Watanabe, Hiroyuki Ishida, Koki Nakagawa, Shan Jiang

机构 * Fujitsu Limited(富士通株式会社) Fujitsu Research of America(富士通美国研究部) Carnegie Mellon University(卡内基梅隆大学) Master’s Student, The University of Tokyo(东京大学硕士研究生) Agent Research Collective(代理研究集体)

专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FieldWorkArena,用于评估代理AI在真实制造业和零售环境中的性能,通过现场采集的数据和实地访谈设计任务,验证多模态大语言模型的评估可行性。

Comments 27 pages, 10 figures, 7 tables [ICPR 2026 Accepted] Changes from previous version: added supplemental material

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25220 2026-08-10 cs.AI 版本更新 57%

DATAREEL: Automated Data-Driven Video Story Generation with Animations

DATAREEL:基于动画的自动化数据驱动视频故事生成

Ridwan Mahbub, Syem Aziz, Mizanur Rahman, Mahir Ahmed, Shadikur Rahman, Shafiq Joty, Enamul Hoque

机构 * York University(约克大学) Bangladesh University of Business and Technology(孟加拉国商业与技术大学) RBC, Canada(加拿大RBC) Nanyang Technological University(南洋理工大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出DataReel基准,通过328个真实故事评估模型生成动画数据视频故事的能力,采用多智能体框架提升自动化生成效果。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16060 2026-08-06 cs.CV 版本更新 57%

ArtChart: Faithful Artistic Chart Generation with Integrated Text Rendering

ArtChart:一个用于忠实生成艺术图表并集成文本渲染的基准测试

Meijia Huang, Yingjie Yin, Shihao Wang, Chenguang Ma

机构 * Ant Group(蚂蚁集团)

专题命中 文档图表理解 :VLM(abstract);分类 cs.CV

AI总结 研究旨在解决艺术图表生成难题,提出ArtChart框架,含特定即插即用模块及强化学习等策略,构建基准测试和评估套件,实验证明该框架能生成兼具美观与数学准确性的图表,优于开源基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05899 2026-07-29 cs.CV cs.GR 版本更新 57%

HOLODECK 2.0: Vision-Language-Guided 3D World Generation with Editing

HOLODECK 2.0:基于视觉-语言的3D世界生成与编辑

Zixuan Bian, Ruohan Ren, Yue Yang, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学) Cornell University(康奈尔大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 HOLODECK 2.0通过视觉-语言模型生成高质量3D场景并支持交互式编辑,提升游戏设计效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11192 2026-07-16 cs.CV 版本更新 57%

GDP.pdf: Benchmarking Grounded Multimodal Reasoning over Professional PDF Documents

GDP.pdf:针对专业PDF文档的基础多模态推理基准测试

Suhaas Garre, Emily Ritchie, Sushant Mehta, Edwin Chen

机构 * Surge AI

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

AI总结 该研究针对专业PDF文档构建多模态推理基准测试GDP.pdf,由专业人员编写问题-文档对,通过严格筛选保留问题,有详细评分标准和能力分类。评估七个前沿模型,发现多数错误源于特定模式,公开了完整基准测试。

Comments 9 pages. v2: results updated to July 2026 leaderboard (17 models). Accepted at the 2nd Workshop on Knowledge-Intensive Multimodal Reasoning (KnowledgeMR) at CVPR 2026 (non-archival), under the former title "PDFParse: A Benchmark for Grounded Multimodal Reasoning over Professional PDF Documents". Dataset: https://huggingface.co/datasets/surgeai/GDP.pdf ; Code: https://github.com/surge-ai/gdp-pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19632 2026-07-15 cs.CV 版本更新 57%

CreatiParser: Generative Image Parsing of Raster Graphic Designs into Editable Layers

CreatiParser: 从位图图形设计生成可编辑的图层

Weidong Chen, Dexiang Hong, Zhendong Mao, Yutao Cheng, Xinyan Liu, Lei Zhang, Yongdong Zhang

机构 * School of Information Science and Technology, University of Science and Technology of China(科学技术大学信息科学与技术学院) ByteDance Intelligent Creation(字节跳动智能创作) School of Computer Science and Technology, Harbin Institute of Technology (Weihai)(哈尔滨工业大学(威海)计算机科学与技术学院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出CreatiParser框架,将位图图形设计分解为可编辑的文本、背景和贴纸图层,结合视觉语言模型和多分支扩散架构,提升生成质量与编辑灵活性,实验显示在Parser-40K和Crello数据集上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21095 2026-07-14 cs.CV 版本更新 57%

UniRec-0.1B: Unified Text and Formula Recognition with 0.1B Parameters

UniRec-0.1B:具有1亿参数的统一文本和公式识别

Yongkun Du, Zhineng Chen, Yazhen Xie, Weikang Bai, Hao Feng, Wei Shi, Yuchen Su, Can Huang, Yu-Gang Jiang

机构 * Fudan University(复旦大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 研究旨在实现文本和公式的统一识别,提出含1亿参数的UniRec-0.1B模型。通过构建大规模数据集,应对层次结构变异性和语义纠缠等挑战,引入分层监督训练和语义解耦分词器。实验证明该模型优于同类,且速度大幅提升,有效且高效。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11644 2026-08-14 cs.DB 版本更新 50%

Guided Table Retrieval for Structured Data Search

面向结构化数据搜索的引导式表格检索

Alekh Jindal, Jyoti Pandey, Christina Pavlopoulou, Ronith PR, Sharath Prakash, Shi Qiao, Shivani Tripathi, Wangda Zhang

专题命中 文档图表理解 :grounding(abstract)

AI总结 该研究针对结构化数据库自然语言问答任务,提出四阶段引导式表格检索流程,在BIRD-DEV和BEAVER基准上取得优于基线的准确率与F1值,生成的精确连接树可直接供下游查询编译器使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05087 2026-08-06 cs.CL cs.IR 版本更新 50%

Document Optimization for Black-Box Retrieval via Reinforcement Learning

基于强化学习的黑盒检索文档优化

Omri Uzan, Ron Polonsky, Douwe Kiela, Christopher Potts

机构 * Stanford University(斯坦福大学) ContextualAI

专题命中 文档图表理解 :vision language model(abstract)

AI总结 提出通过强化学习(GRPO)优化文档表示,使其与目标检索器的查询分布对齐,仅需黑盒访问检索排名,在代码和视觉文档检索任务中提升性能,使小模型超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16134 2026-08-03 cs.DB 版本更新 50%

Benchmarking Table Extraction from Heterogeneous Scientific PDF Documents

对异构科学提取文档中表格提取的基准测试

Marijan Soric, Cécile Gracianne, Ioana Manolescu, Pierre Senellart

专题命中 文档图表理解 :vision language model(abstract)

AI总结 本文提出了一种新的基准测试,用于评估端到端表格提取方法,通过分析评估指标和设计严谨的评估流程,揭示了当前方法在异构数据下的局限性。

Comments Extended version, with appendices, of a paper published at KDD '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26615 2026-06-08 cs.CL 版本更新 50%

SlideAgent: Hierarchical Agentic Framework for Multi-Page Visual Document Understanding

SlideAgent:用于多页视觉文档理解的分层代理框架

Yiqiao Jin, Rachneet Kaur, Zhen Zeng, Sumitra Ganesh, Srijan Kumar

机构 * Georgia Institute of Technology(佐治亚理工学院) J.P. Morgan AI Research(摩根大通AI研究)

专题命中 文档图表理解 :multimodal large language model(abstract)

AI总结 提出SlideAgent,一种用于多模态多页文档(如幻灯片)理解的分层代理框架,通过全局、页面和元素三级推理构建结构化表示,在专有和开源模型上分别提升7.9%和9.8%的准确率。

Comments ACL 2026 Main Conference. https://slideagent.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏