arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 656 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 656 篇

2607.24799 2026-07-29 cs.IR cs.AI 新提交 57%

Multimodal Hybrid Retrieval-Augmented Generation for Scientific Document Understanding using Open-Source SLMs

使用开源语言模型进行科学文档理解的多模态混合检索增强生成

Alexandru-Andrei Saucă, Ana-Luiza Rusnac

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.AI

AI总结 针对科学文档理解中大型语言模型的问题,提出多模态混合检索增强生成系统。利用开源视觉语言模型生成摘要,结合多种检索方法并优化,采用查询压缩器确保连贯性。经评估,该系统提高了检索质量,验证了开源模型与先进策略结合的竞争力。

Comments 7 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05899 2026-07-29 cs.CV cs.GR 版本更新 57%

HOLODECK 2.0: Vision-Language-Guided 3D World Generation with Editing

HOLODECK 2.0:基于视觉-语言的3D世界生成与编辑

Zixuan Bian, Ruohan Ren, Yue Yang, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学) Cornell University(康奈尔大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 HOLODECK 2.0通过视觉-语言模型生成高质量3D场景并支持交互式编辑,提升游戏设计效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24651 2026-07-28 cs.CV cs.CL cs.IR 新提交 57%

Evidence Attribution in Visual Document Understanding without Coordinates or Region Labels

无坐标或区域标签的视觉文档理解中的证据归因

Zhuchenyang Liu, Yao Zhang, Yu Xiao

机构 * Aalto University(阿尔托大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 研究视觉文档理解中无坐标或区域标签时的证据归因问题,通过对比坐标与语言接口,发现语言接口能提升证据召回率、降低幻觉率。基于此用引述和检索管道作训练框架,引入GRPO方法,提高了模型严格归因准确率,找到改善归因的实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17251 2026-07-21 cs.CV 新提交 57%

VecFontLLM: Anchor-Guided Direct Synthesis of Chinese Vector Fonts

VecFontLLM:基于锚点引导的中文矢量字体直接合成

Hao Yuan, Yuxuan Luo, Xing Chen, Zhouhui Lian

机构 * Fuzhou University(福州大学) Peking University(北京大学)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

AI总结 研究旨在解决直接生成中文矢量字体的难题,提出VecFontLLM这一基于锚点引导的多模态大语言模型,通过锚点预测、细化及贝塞尔控制点完成来合成矢量字形,实现高质量少样本合成,实验显示其相比现有方法有显著优势。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14557 2026-07-17 cs.AI 新提交 57%

Seeing the End at Step Zero: Accelerating Diffusion MLLMs via MLP Sparsity-Aware Truncation

从零步洞察终点:通过MLP稀疏感知截断加速扩散多模态大语言模型

Qicheng Zhao, Qi Sun, Zheyu Yan

机构 * Zhejiang University(浙江大学)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI

AI总结 研究针对扩散多模态大语言模型推理效率受固定长度生成约束影响的问题,提出Seer框架,利用MLP激活稀疏性变化检测有效语义边界,进行冗余截断及采用混合执行策略,实验表明其可加速吞吐量并维持性能甚至提升复杂视觉任务准确性。

Comments Accepted to ACM Multimedia (ACM MM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11192 2026-07-16 cs.CV 版本更新 57%

GDP.pdf: Benchmarking Grounded Multimodal Reasoning over Professional PDF Documents

GDP.pdf:针对专业PDF文档的基础多模态推理基准测试

Suhaas Garre, Emily Ritchie, Sushant Mehta, Edwin Chen

机构 * Surge AI

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

AI总结 该研究针对专业PDF文档构建多模态推理基准测试GDP.pdf,由专业人员编写问题-文档对,通过严格筛选保留问题,有详细评分标准和能力分类。评估七个前沿模型,发现多数错误源于特定模式,公开了完整基准测试。

Comments 9 pages. v2: results updated to July 2026 leaderboard (17 models). Accepted at the 2nd Workshop on Knowledge-Intensive Multimodal Reasoning (KnowledgeMR) at CVPR 2026 (non-archival), under the former title "PDFParse: A Benchmark for Grounded Multimodal Reasoning over Professional PDF Documents". Dataset: https://huggingface.co/datasets/surgeai/GDP.pdf ; Code: https://github.com/surge-ai/gdp-pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19632 2026-07-15 cs.CV 版本更新 57%

CreatiParser: Generative Image Parsing of Raster Graphic Designs into Editable Layers

CreatiParser: 从位图图形设计生成可编辑的图层

Weidong Chen, Dexiang Hong, Zhendong Mao, Yutao Cheng, Xinyan Liu, Lei Zhang, Yongdong Zhang

机构 * School of Information Science and Technology, University of Science and Technology of China(科学技术大学信息科学与技术学院) ByteDance Intelligent Creation(字节跳动智能创作) School of Computer Science and Technology, Harbin Institute of Technology (Weihai)(哈尔滨工业大学(威海)计算机科学与技术学院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出CreatiParser框架,将位图图形设计分解为可编辑的文本、背景和贴纸图层,结合视觉语言模型和多分支扩散架构,提升生成质量与编辑灵活性,实验显示在Parser-40K和Crello数据集上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11562 2026-07-14 cs.CV 新提交 57%

MonkeyOCRv2: A Visual-Text Foundation Model for Document AI

MonkeyOCRv2:用于文档人工智能的视觉-文本基础模型

Yuliang Liu, Zhang Li, Ziyang Zhang, Shuo Zhang, Qiang Liu, Jiajun Song, Zidun Guo, Xinhan Wang, Handong Zheng, Yang Liu, Dongliang Luo, Zhiyin Ma, Jiarui Zhang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Kingsoft Office(金山办公软件)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

AI总结 研究针对主流视觉编码器难以应用于文档图像的问题,提出MonkeyOCRv2模型。通过构建大型文档图像预训练语料库及采用联合预训练策略,在多个文档分析任务中提升性能,并验证其作为视觉编码器在文档解析和理解任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10301 2026-07-14 cs.CV cs.CL 新提交 57%

ChartSync: A Benchmark for Visuo-Logical Cascading Chart Editing

ChartSync:视觉逻辑级联图表编辑的基准测试

Jiakang Yu, Yixuan Chai, Tianci Wang, Rihui Jin, Guangkai Xu, Hongtao Deng, Xun Zhu, Wang Gao, Xinrun Guo, Haipang Wu

机构 * Jianghan University(江汉大学) HiThink Research(海思睿研) University of Science and Technology of China(中国科学技术大学) Southeast University(东南大学) Zhejiang University(浙江大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 研究针对生成式图像编辑模型处理结构化统计图的困难,提出视觉逻辑级联编辑任务。引入ChartSync基准测试,含多种图表类别和任务类型。通过两层框架评估模型,发现开源与专有模型能力差距,分析误差以指导多模态架构发展,数据集和代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21095 2026-07-14 cs.CV 版本更新 57%

UniRec-0.1B: Unified Text and Formula Recognition with 0.1B Parameters

UniRec-0.1B:具有1亿参数的统一文本和公式识别

Yongkun Du, Zhineng Chen, Yazhen Xie, Weikang Bai, Hao Feng, Wei Shi, Yuchen Su, Can Huang, Yu-Gang Jiang

机构 * Fudan University(复旦大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 研究旨在实现文本和公式的统一识别,提出含1亿参数的UniRec-0.1B模型。通过构建大规模数据集,应对层次结构变异性和语义纠缠等挑战,引入分层监督训练和语义解耦分词器。实验证明该模型优于同类,且速度大幅提升,有效且高效。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05290 2026-07-07 cs.CV 新提交 57%

ChatImage: Navigating Long-Form LLM Answers through Interactive Images

ChatImage:通过交互式图像导航大语言模型的长文本回答

Wencan Jiang, Jiangning Zhang, Yong Liu

机构 * Zhejiang University(浙江大学)

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

AI总结 针对LLM长文本答案难以细粒度浏览的问题,ChatImage将其转为带点击热点的交互图像,支持局部查询,提升内容与交互区域的一致性,还开源实现并发布多格式评测基准。

Comments Project:https://wencanjiang.github.io/ChatImage

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04612 2026-07-07 cs.GR cs.CV 新提交 57%

StructuredEdit: Constraint-Aware Graphic Design Editing via Differentiable Parameter Propagation

StructuredEdit:通过可微参数传播实现约束感知的平面设计编辑

Veeramanohar Avudaiappan, Ritwik Murali

机构 * Department of Electrical and Electronics Engineering, Amrita School of Engineering, Coimbatore, Amrita Vishwa Vidyapeetham India(电子与电子工程系,阿米特拉工程学院,科伊巴托尔,阿米特拉世界学院,印度) Department of Computer Science and Engineering, Amrita School of Computing, Coimbatore, Amrita Vishwa Vidyapeetham India(计算机科学与工程系,阿米特拉计算学院,科伊巴托尔,阿米特拉世界学院,印度)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 研究针对平面设计编辑在严格约束下操作难的问题,提出StructuredEdit将设计编辑转为参数操作,核心方法是可微参数传播,贡献是提升了约束满意度等指标,还减少了用户编辑时间和校正迭代次数。

Comments 3 page poster short paper.2 Figures, 2 Tables. Planned to submit to SIGGRAPH Asia

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02956 2026-07-07 cs.CV cs.CL 新提交 57%

MORE: A Multilingual Document Parsing Benchmark and Evaluation

MORE:一个多语言文档解析基准和评估

Long Xu, Binghong Wu, Tinghao Yu, Hao Feng, Zhenyu Huang, Haoqing Jiang, Yunhao Wang, Shuo Huang, Feng Zhang

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 研究针对多语言文档解析,现有基准侧重高资源语言。为此引入MORE基准,其具规模大、结构复杂、数据真实的特点,用它评估模型,为长尾语言建性能基线并验证基准有效性。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026). 22 pages, 11 figures. Code and dataset available at https://github.com/zimoqingfeng/MORE

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31388 2026-07-01 cs.CV 新提交 57%

One Video, One World: Turning Monocular Video into Physical 4D Scenes

一视频一世界:将单目视频转化为物理4D场景

Junhao Chen, Boran Zhang, Mingjin Chen, Henghaofan Zhang, Saining Zhang, Congcong Zhu, Hao Zhao, Ruqi Huang, Zhihao Li, Yufei Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) SparcAI Inc(SparcAI公司) University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 提出OVOW,首个无需训练的系统,从单目视频重建实例级、可仿真的4D网格场景,通过视觉语言模型发现实例、类别感知重建、迭代优化恢复尺度与位姿、物理装配确保接触支撑,并建立结构化视频到4D评估基准。

Comments Accepted by ECCV 2026. Project Page: https://OneVideoOneWorld.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29808 2026-06-30 cs.HC cs.AI 57%

Making Multimodal LLMs Reliable Chart Data Extractors: A Benchmark and Training Framework

使多模态大语言模型成为可靠的图表数据提取器:一个基准和训练框架

Yuchen He, Peizhi Ying, Liqi Cheng, Kuilin Peng, Yuan Tian, Dazhen Deng, Yingcai Wu

机构 * Zhejiang University(浙江大学) Guangdong University of Technology(广东工业大学)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI

AI总结 针对多模态大语言模型在图表数据提取中数值精度不足的问题,提出渐进式学习训练框架,显著提升7B参数模型的准确率,达到最优性能。

Comments Accepted at CHI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24484 2026-06-24 cs.CV 新提交 57%

Advancing WordArt-Oriented Scene Text Recognition: Datasets and Methods

推进面向艺术字的场景文本识别:数据集与方法

Xingsong Ye, Yongkun Du, Jiaxin Zhang, Haojie Zhang, Chong Sun, Chen Li, Jing Lyu, Zhineng Chen

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Key Laboratory of Multimodal Embodied AI, Fudan University(复旦大学上海市多模态具身人工智能重点实验室) WeChat Vision, Tencent Inc.(腾讯微信视觉团队) South China University of Technology(华南理工大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 针对艺术字场景文本识别(WATER)的挑战,构建了百万级合成数据集WATER-S,并提出支持任意形状输入和自回归解码的WATERec模型,在WordArt-Bench上达到90.40%准确率。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20869 2026-06-18 cs.SE cs.AI cs.IR 57%

Engineering RAG Systems for Real-World Applications: Design, Development, and Evaluation

为现实应用工程化RAG系统:设计、开发与评估

Md Toufique Hasan, Muhammad Waseem, Kai-Kristian Kemell, Ayman Asad Khan, Mika Saari, Pekka Abrahamsson

机构 * Faculty of Information Technology and Communication Sciences, Tampere University(信息科技与通讯科学学院,塔尔皮耶大学)

专题命中 文档图表理解 :grounding(abstract);分类 cs.AI

AI总结 本文介绍了五个领域特定的RAG应用,涵盖治理、网络安全、农业、工业研究和医疗诊断,通过多语言OCR、语义向量检索和领域适应LLM,评估六个维度并总结十二项关键经验教训。

Comments Published in the Proceedings of the 51st Euromicro Conference on Software Engineering and Advanced Applications, SEAA 2025. Lecture Notes in Computer Science, volume 16082, pages 143-158. Springer, 2026

Journal ref LNCS 16082, 143-158, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10640 2026-06-10 cs.CV 新提交 57%

ChartLens: A Dual-Branch Framework for Chart Data Correction and Factual Summary Refinement

ChartLens:用于图表数据校正和事实性摘要精炼的双分支框架

Hao Liu, Ruping Cao, Kun Wang, Zhiran Li, Fan Liu, Yupeng Hu, Liqiang Nie

机构 * Shandong University(山东大学) Southeast University(东南大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

AI总结 提出ChartLens双分支框架,通过结构感知CSV验证校正和文本保留引导的摘要精炼,提升图表数据恢复与摘要事实性,在DataMFM挑战赛Track 2中获第一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09788 2026-06-09 cs.CV 新提交 57%

POTATR: A Lightweight Image-to-Graph Model for Page-Level Table Extraction

POTATR: 一种用于页面级表格提取的轻量级图像到图模型

Brandon Smock, Libin Liang, Max Sokolov, Amrit Ramesh, Valerie Faucon-Morin, Tayyibah Khanam, Maury Courtland

机构 * Kensho Technologies

专题命中 文档图表理解 :MLLM(abstract_cn);分类 cs.CV

AI总结 提出轻量级图像到图模型POTATR(29M参数),在页面级表格提取任务上以130倍速度和300倍低成本超越前沿模型,GriTS_Con达0.964,输出空间可解释。

Comments 16 pages, split from PubTables-v2 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04231 2026-06-04 cs.CL cs.AI 57%

MM-BizRAG: Rethinking Multimodal Retrieval-Augmented Generation for General Purpose Enterprise Q&A

MM-BizRAG:面向通用企业问答的多模态检索增强生成再思考

Hanoz Bhathena, Parin Rajesh Jhaveri, Rohan Mittal, Prateek Singh, Aymen Kallala, Rachneet Kaur, Yiqiao Jin, Zhen Zeng, Adwait Ratnaparkhi, Denis Kochedykov

机构 * JPMorgan Chase & Co.(摩根大通公司) Georgia Institute of Technology(佐治亚理工学院)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.AI

AI总结 提出MM-BizRAG框架,通过文档结构感知分割和布局感知解析,结合统一LLM驱动的工件转换与推理时多模态组装,无需微调即可提升企业文档问答性能,在异构企业数据集和两个公开基准上超越基线最多32个百分点。

Comments Accepted at ACL 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03264 2026-06-03 cs.CV 57%

PaddleOCR-VL-1.6: Expanding the Frontier of Document Parsing with Under-Optimized Region Refinement and Progressive Post-Training

PaddleOCR-VL-1.6:通过欠优化区域精炼和渐进式后训练扩展文档解析前沿

Zelun Zhang, Hongen Liu, Suyin Liang, Yubo Zhang, Yiqing Xiang, Jiaxuan Liu, Ting Sun, Manhui Lin, Yue Zhang, Changda Zhou, Tingquan Gao, Cheng Cui, Yi Liu, Dianhai Yu, Yanjun Ma

机构 * PaddlePaddle Team, Baidu Inc.(百度公司PaddlePaddle团队)

专题命中 文档图表理解 :VLM(abstract_cn);分类 cs.CV

AI总结 提出PaddleOCR-VL-1.6,通过区域感知数据优化框架识别并增强前代模型的薄弱区域,结合渐进式后训练策略,在OmniDocBench v1.6上达到96.33%的新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02288 2026-05-29 cs.CV 57%

LabBuilder: Protocol-Grounded 3D Layout Generation for Interactable and Safe Laboratory

LabBuilder: 基于协议的可交互且安全的3D实验室布局生成

Jianbao Cao, Zhangrui Zhao, Bohan Feng, Zixuan Hu, Rui Li, Haiyuan Wan, Chenxi Li, Jingyuan Li, Wenzhe Cai, Lei Bai, Wanli Ouyang, Lingyu Duan, Di Huang, Minting Pan, Sha Zhang, Xinzhu Ma, Shixiang Tang, Dongzhan Zhou

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Wuhan University(武汉大学) Beihang University(北航) Peking University(北京大学) Tsinghua University(清华大学) Shanghai Jiaotong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

AI总结 提出LabBuilder系统,通过协议引导和约束感知优化,从文本描述生成安全且可执行的3D实验室布局,显著优于现有方法。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27978 2026-05-28 cs.CV 57%

ABot-OCR Technical Report

ABot-OCR 技术报告

Kaitao Jiang, Ruiyan Gong, Xiaolong Cheng, Kangning Niu, Tianlun Li, Mu Xu

机构 * AMAP CV Lab(AMAP视觉实验室)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 提出端到端视觉语言模型ABot-OCR,通过单次前向传播将页面图像直接转录为干净Markdown,并采用解耦异构文档优化的强化学习方法提升文本准确性和标记格式正确性,在OmniDocBench基准上达到最先进水平。

Comments 21 pages, 11 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18359 2026-05-27 cs.CV 57%

RAVE: Re-Allocating Visual Attention in Large Multimodal Models

RAVE: 重新分配大型多模态模型中的视觉注意力

Xi Leng, Xinhong Ma, Ziqiang Dong, Feng Zhang, Xiaoying Tang, Yang Yang, Guanjun Jiang

机构 * Qwen Business Unit of Alibaba(阿里巴巴文勤业务部) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Beijing Institute of Technology(北京理工大学)

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

AI总结 针对大型多模态模型中标准注意力机制存在的跨模态误分配和视觉内不平衡问题,提出轻量级成对门控机制RAVE,通过学习查询-键偏置重新分配视觉注意力,在多个多模态基准上平均提升3个百分点,尤其对感知密集型任务效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25326 2026-05-26 cs.CV 57%

Perceive-then-Plan: Layout-as-Policy for Monocular 3D Scene Layout Estimation

感知-然后-规划:以布局为策略的单目3D场景布局估计

Junwei Zhou, Yu-Wing Tai

机构 * Department of Computer Science(计算机科学系) Dartmouth College(达特茅斯学院)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 提出Perceive-then-Plan框架,通过视觉语言模型将单目3D布局估计转化为感知与迭代规划问题,以布局为策略(LaP)学习动作序列逐步优化场景假设,生成更物理一致且与观测对齐的3D布局。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21090 2026-05-21 cs.CV 57%

TextSculptor: Training and Benchmarking Scene Text Editing

TextSculptor: 训练和评估场景文本编辑

Yiheng Lin, Siyu Jiao, Xiaohan Lan, Wei Zhou, Qi She, Fei Yu, Heyun Chen, Zhengwei Wang, Jinghuan Chen, Moran Li, Yingchen Yu, Zijian Feng, Yao Zhao, Yunchao Wei, Yujie Zhong

机构 * Beijing Jiaotong University(北京交通大学) Bytedance(字节跳动)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出TextSculptor框架,通过构建大规模数据集和基准测试,解决场景文本编辑中高质量训练数据稀缺和缺乏标准化评估的问题,提升开源模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17447 2026-05-19 cs.CV cs.CL 57%

FastOCR: Dynamic Visual Fixation via KV Cache Pruning for Efficient Document Parsing

FastOCR: 通过KV缓存剪枝实现高效的动态视觉聚焦文档解析

Zihan Tang, Leqi Shen, Hui Chen, Ao Wang, Ben Wan, Yan Feng, Ke Zhang, Sicheng Zhao, Tongxuan Liu, Guiguang Ding

机构 * Tsinghua University(清华大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出FastOCR,一种无需训练的框架,通过动态视觉聚焦技术解决文档解析中的高效KV缓存剪枝问题,显著提升处理速度和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17356 2026-05-19 cs.CV 57%

UniPPTBench: A Unified Benchmark for Presentation Generation Across Diverse Input Settings

UniPPTBench: 一种统一的演示生成基准,适用于多样化的输入设置

Bo Zhao, Maosheng Pang, Chen Zhang, Huan Yang, Yixin Cao, Wei Ji

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

AI总结 本文提出UniPPTBench,一个统一的演示生成基准,针对四种代表性的输入设置:模糊提示、长文档、多模态文档和多源生成,同时引入UniPPTEval评估协议,结合跨设置比较的共享指标和针对每个设置核心需求的定制指标,以提供更准确的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16274 2026-05-19 cs.HC cs.AI 57%

ChartDesign: Towards LLM Designer of Data Visualization

ChartDesign: 向数据可视化设计的LLM设计师迈进

Mohammed Afaan Ansari, Aniruddh Bansal, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 文档图表理解 :vision language model(abstract);分类 cs.AI

AI总结 本文提出ChartDesign,利用大语言模型生成数据可视化设计属性,提升图表设计性能,实现84%的准确率,并在未见领域中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06021 2026-05-08 cs.CV cs.DL 57%

PlotPick: AI-powered batch extraction of numerical data from scientific figures

PlotPick: 基于AI的科学图表中数值数据批量提取工具

Tommy Carstensen

机构 * Copenhagen Research Centre for Biological and Precision Psychiatry(哥本哈根生物与精准精神病学研究中心) Mental Health Centre Copenhagen(哥本哈根心理健康中心) Copenhagen University Hospital(哥本哈根大学医院)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 PlotPick利用视觉语言模型批量提取科学图表中的结构化表格数据,六个VLMs在ChartX和PlotQA基准测试中均优于专用模型DePlot,尤其在未包含在训练数据中的图表类型上表现更佳。

Comments 7 pages, 2 figures, 2 tables. Software available at https://plotpick.streamlit.app and https://github.com/tommycarstensen/plotpick

详情

展开后加载摘要…

URL PDF HTML 收藏