arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 656 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 656 篇

2501.15558 2025-01-28 cs.CV 83%

Ocean-OCR: Towards General OCR Application via a Vision-Language Model

Song Chen, Xinyu Guo, Yadong Li, Tao Zhang, Mingan Lin, Dongdong Kuang, Youwei Zhang, Lingfeng Ming, Fengyu Zhang, Yuran Wang, Jianhua Xu, Zenan Zhou, Weipeng Chen

专题命中 文档图表理解 :vision-language model(title);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06109 2023-12-12 cs.CV 83%

Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models

Haoran Wei, Lingyu Kong, Jinyue Chen, Liang Zhao, Zheng Ge, Jinrong Yang, Jianjian Sun, Chunrui Han, Xiangyu Zhang

专题命中 文档图表理解 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21850 2026-07-27 cs.CV cs.AI 新提交 82%

SCALE: Self-Supervised Constraint-Aware Layout GEneration for Local P&R DRV Fixing at Advanced Nodes

SCALE:用于先进节点局部布局与布线设计规则违规修复的自监督约束感知布局生成

Chia-Tung Ho, Haoyu Yang, Guanglei Zhou, Yoshi Nishi, Yaguang Li, Walker Turner, Cunxi Yu, Yiran Chen, Brucek Khailany

机构 * NVIDIA(英伟达) Duke University(杜克大学)

专题命中 文档图表理解 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 针对先进节点局部P&R DRV修复难题,提出SCALE框架,通过自监督布局生成、利用自然语言规则约束和高温采样等方法,生成DRC注释布局违规对微调DRC-VLM,有效提升了最先进代理的修复解决率。

Comments 8 pages, 5 Figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06390 2026-06-05 cs.CV cs.AI 82%

HomeWorld: A Unified Floorplan-to-Furnished Framework for Generating Controllable, Densely Interactive Whole-Home Scenes

HomeWorld:一个统一的从平面图到家具的框架,用于生成可控、密集交互的全屋场景

Wenbo Li, Xiaoliang Ju, Zipeng Qin, Rongyao Fang, Hongsheng Li

机构 * Ace Robotics(Ace机器人公司) CUHK MMLab(香港大学多模态实验室) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 文档图表理解 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 提出一个统一的分层框架,通过大规模真实平面图数据集训练大语言模型生成全屋平面图,结合图像生成模型和VLM优化器生成家具及小物体布局,并附加物理属性和纹理光照,实现可控、高真实感的全屋场景生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02747 2026-06-03 cs.CV cs.AI 82%

Plan2Map: A Multimodal Benchmark for Document-Grounded Geospatial Boundary Reconstruction from Planning Records

Plan2Map: 基于规划记录的文档驱动地理空间边界重建的多模态基准

Fabian Degen, Oishi Deb, Jindong Gu, Junchi Yu, Samuele Marro, Philip Torr, Jialin Yu

专题命中 文档图表理解 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 提出Plan2Map基准和GeoPlanAgent系统,通过文档证据提取、定位、地图配准、边界分割等步骤,从英国规划记录中重建地理空间边界,显著优于直接VLM方法。

Comments Project page: https://odeb1.github.io/Plan2Map_Project_Page/. Fabian Degen and Oishi Deb Contributed Equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09153 2026-06-02 cs.RO cs.AI cs.CV cs.GR 82%

SceneSmith: Agentic Generation of Simulation-Ready Indoor Scenes

SceneSmith: 面向仿真就绪室内场景的智能体生成

Nicholas Pfaff, Thomas Cohn, Sergey Zakharov, Rick Cory, Russ Tedrake

机构 * Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学)

专题命中 文档图表理解 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 提出层次化智能体框架SceneSmith,通过VLM智能体协作从自然语言生成仿真就绪的室内场景,相比先前方法生成3-6倍物体且碰撞率低于2%。

Comments ICML 2026 Spotlight; Project page: https://scenesmith.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12809 2026-05-27 cs.CV cs.AI cs.LG 82%

Left-Right Symmetry Breaking in CLIP-style Vision-Language Models Trained on Synthetic Spatial-Relation Data

CLIP风格视觉语言模型在合成空间关系数据训练中的左右对称性破缺

Takaki Yamamoto, Chihiro Noguchi, Toshihiro Tanizawa

机构 * InfoTech, Toyota Motor Corporation(丰田汽车公司信息科技部门)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 通过可控一维图像文本测试平台,研究基于Transformer的视觉语言编码器在CLIP风格对比学习下如何通过位置与标记嵌入交互产生左右关系理解,并发现标签多样性比布局多样性更关键。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14722 2026-01-22 cs.CL 82%

Typhoon OCR: Open Vision-Language Model For Thai Document Extraction

台风OCR:面向泰语文档提取的开放视觉-语言模型

Surapon Nonesung, Natapong Nitarach, Teetouch Jaknamon, Pittawat Taveekitworachai, Kunat Pipatanakul

机构 * Typhoon, SCB 10X(Typhoon,SCB 10X)

专题命中 文档图表理解 :vision-language model(title,abstract);VLM(abstract)

AI总结 Typhoon OCR 是一个专为泰语文档提取设计的开放视觉-语言模型,通过多阶段数据构建管道训练,实现文本转录、布局重构和结构一致性,性能媲美专有模型且计算成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01897 2026-01-06 cs.IR 82%

A Hybrid Architecture for Multi-Stage Claim Document Understanding: Combining Vision-Language Models and Machine Learning for Real-Time Processing

多阶段索赔文档理解的混合架构:结合视觉语言模型和机器学习实现实时处理

Lilu Cheng, Jingjun Lu, Yi Xuan Chan, Quoc Khai Nguyen, John Bi, Sean Ho

专题命中 文档图表理解 :vision-language model(title,abstract);VLM(abstract)

AI总结 本文提出一种混合架构,结合OCR、逻辑回归和视觉语言模型,实现高效准确的索赔文档处理,提升自动化效率300倍。

Comments 19 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15804 2025-12-19 cs.SE 82%

XBIDetective: Leveraging Vision Language Models for Identifying Cross-Browser Visual Inconsistencies

XBIDetective: 利用视觉语言模型识别跨浏览器视觉不一致

Balreet Grewal, James Graham, Jeff Muizelaar, Jan Honza Odvarko, Suhaib Mujahid, Marco Castelluccio, Cor-Paul Bezemer

专题命中 文档图表理解 :vision language model(title,abstract);VLM(abstract)

AI总结 XBIDetective利用视觉语言模型识别跨浏览器视觉不一致,通过自动截图和分析检测渲染错误,准确率高达79%

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05718 2025-11-10 cs.HC 82%

Do Vision-Language Models See Visualizations Like Humans? Alignment in Chart Categorization

Péter Ferenc Gyarmati, Manfred Klaffenböck, Laura Koesten, Torsten Möller

专题命中 文档图表理解 :vision-language model(title,abstract);VLM(abstract)

Comments 2 pages, 2 figures. Accepted submission to the poster track of IEEE VIS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10376 2025-06-13 cs.SE cs.HC 82%

MLLM-Based UI2Code Automation Guided by UI Layout Information

Fan Wu, Cuiyun Gao, Shuqing Li, Xin-Cheng Wen, Qing Liao

专题命中 文档图表理解 :MLLM(title,abstract);multimodal large language model(abstract)

Comments Accepted by the 34th International Symposium on Software Testing and Analysis (ISSTA 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19091 2025-05-27 cs.CL cs.AI cs.CV cs.LG 82%

ReadBench: Measuring the Dense Text Visual Reading Ability of Vision-Language Models

Benjamin Clavié, Florian Brand

机构 * Artificial Intelligence and Intelligent Information Systems, University of Trier(人工智能与智能信息系统,特里尔大学) German Research Center for Artificial Intelligence (DFKI), Trier(德国人工智能研究中心(DFKI),特里尔)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23707 2025-04-01 cs.GR 82%

From Geometry to Culture: An Iterative VLM Layout Framework for Placing Objects in Complex 3D Scene Contexts

Yuto Asano, Naruya Kondo, Tatsuki Fushimi, Yoichi Ochiai

专题命中 文档图表理解 :VLM(title,abstract);vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17589 2025-02-26 cs.CL 82%

End-to-End Chart Summarization via Visual Chain-of-Thought in Vision-Language Models

Raymond Choi, Frank Burns, Chase Lawrence

专题命中 文档图表理解 :vision-language model(title,abstract);visual reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09236 2025-01-17 cs.SE 82%

Exploring the Capabilities of Vision-Language Models to Detect Visual Bugs in HTML5 <canvas> Applications

Finlay Macklon, Cor-Paul Bezemer

专题命中 文档图表理解 :vision-language model(title,abstract);VLM(abstract)

Comments Submitted to Empirical Software Engineering (EMSE) journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13611 2024-10-18 cs.CV cs.AI cs.CL cs.LG 82%

H2OVL-Mississippi Vision Language Models Technical Report

Shaikat Galib, Shanshan Wang, Guanshuo Xu, Pascal Pfeiffer, Ryan Chesler, Mark Landry, Sri Satish Ambati

专题命中 文档图表理解 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07527 2026-08-11 cs.CL cs.AI 新提交 81%

DocAtlas: Long-Document Understanding as Mutable-State Interaction

DocAtlas:将长文档理解视为可变状态交互

Hongchen Wei, Yuanzhe Wang, Bei Liu, Yifan Yang, Qi Dai, Kai Qiu, Yunsheng Li, Dongdong Chen, Chong Luo, Zhenzhong Chen, Baining Guo

专题命中 文档图表理解 :VLM(summary_cn,abstract);分类 cs.AI

AI总结 本研究提出DocAtlas系统,将长文档理解视为可变状态交互,通过可变文档工具结合自改进检索等技术,在MMLongBench-Doc上用GPT-5.4达71.4%,还可提升紧凑型VLM智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03357 2026-08-05 cs.CV 新提交 81%

Can Text-to-Image Models Draw from the Right Frame of Reference?

文本到图像模型能否从正确的参考框架中生成图像?

Zheyuan Gu, Ruihang Li, Yong Huang, Yiqian Zhang, XIangzhao Hao, Jiaxin Niu, Jiahao Hu, Zhenyu Zhang

专题命中 文档图表理解 :VLM(summary_cn,abstract);分类 cs.CV

AI总结 该研究引入FoR-T2I基准,发现现有22个T2I模型在参考框架提示下的布局理解准确率远低于相机视图提示,还提出VLM门控重写方法提升了参考框架下的生成准确率。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25911 2026-07-29 cs.HC cs.AI 新提交 81%

AnnoBench: A Benchmark for Visualization Annotation Generation

AnnoBench:可视化标注生成基准测试

Md Rahat-uz-Zaman, Md Dilshadur Rahman, Andrew McNutt, Paul Rosen

专题命中 文档图表理解 :VLM(summary_cn,abstract);分类 cs.AI

AI总结 介绍AnnoBench可视化标注基准测试,它将可视化与标注任务配对,通过VLM评判执行,经多因素实验评估对标注质量的影响,为推进标注自动化等提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18217 2026-07-22 cs.CV 版本更新 81%

HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enhancement

HOMIE:通过多模态智能增强实现以人为对象的视频个性化

Yiyang Cai, Nan Chen, Rongchang Xie, Junwen Pan, Chunyang Jiang, Cheng Chen, Wen Zhou, Zhenbang Sun, Wei Xue, Wenhan Luo, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 文档图表理解 :MLLM(summary_cn,abstract);分类 cs.CV

AI总结 研究以人为对象的视频个性化问题,提出HOMIE框架,统一处理主体间和主体内输入设置。通过更好的MLLM集成策略、自注意力中的全局多模态引导及模态参考嵌入,在多任务中达最优性能。

Comments 28 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13108 2026-06-12 cs.CV 新提交 81%

PP-OCRv6: From 1.5M to 34.5M Parameters, Surpassing Billion-Scale VLMs on OCR Tasks

PP-OCRv6: 从1.5M到34.5M参数,在OCR任务上超越十亿级视觉语言模型

Yubo Zhang, Xueqing Wang, Manhui Lin, Yue Zhang, Penglongyi Deng, Ting Sun, Tingquan Gao, Zelun Zhang, Jiaxuan Liu, Changda Zhou, Hongen Liu, Suyin Liang, Cheng Cui, Yi Liu, Dianhai Yu, Yanjun Ma

机构 * PaddlePaddle Team, Baidu Inc.(百度公司飞桨团队)

专题命中 文档图表理解 :VLM(summary_cn,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出轻量级OCR系统PP-OCRv6,通过统一MetaFormer架构和结构化重参数化,在服务器到边缘设备上以少数量级参数超越十亿级VLM,中模型识别准确率83.2%,检测Hmean 86.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30819 2026-06-05 cs.CV cs.GR 81%

Function2Scene: 3D Indoor Scene Layout from Functional Specifications

Function2Scene: 基于功能规范的3D室内场景布局

Ruiqi Wang, Qimin Chen, Daniel Ritchie, Angel X. Chang, Manolis Savva, Kai Wang, Hao Zhang

机构 * Simon Fraser University(西蒙弗雷泽大学) Brown University(布朗大学)

专题命中 文档图表理解 :VLM(summary_cn,abstract);分类 cs.CV

AI总结 提出Function2Scene框架,通过解析自然语言设计简报中的用户角色和活动,从17个功能约束准则生成布局,并利用LLM和VLM的迭代检查-修复循环优化,在30个专业案例中94.3%的成对比较优于基线方法。

Comments project page: https://function2scene.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12882 2026-05-14 cs.CL cs.CV 81%

CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document Intelligence

CiteVQA:可信赖文档智能的证据归因基准测试

Dongsheng Ma, Jiayu Li, Zhengren Wang, Yijie Wang, Jiahao Kong, Weijun Zeng, Jutao Xiao, Jie Yang, Wentao Zhang, Bin Wang, Conghui He

机构 * Peking University(北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 文档图表理解 :MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 CiteVQA通过要求模型返回元素级边界框引用,评估文档理解中的证据归因,揭示了现有评估方法的可靠性缺口,主要贡献是引入Strict Attributed Accuracy指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24789 2026-07-29 cs.IR cs.CV cs.LG cs.MM 新提交 81%

NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model

NEXT:通过视觉语言模型进行推理驱动的视频推荐

Yuming Liu, Hongye Yang, Harrison Zhao, Ellie Zhu, Bokai Cao, Lei Huang, Lizhu Zhang, Xiangjun Fan

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 研究提出推理驱动的视频推荐框架NEXT,通过对用户已观看视频推理推断其下一个意图来检索后续视频。训练NEXT-8B视觉语言模型,在DocVQA性能上表现出色,在特定评估中提升下一个意图逻辑质量,部署后带来生产收益,证明其可作为实用推理引擎。

Comments 13 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18160 2026-06-03 cs.CV cs.AI 81%

Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models

Vision Inference Former:在多模态大语言模型中维持视觉一致性

Xinpeng Dong, Min Zhang, Kairong Han, Xu Tan, Fei Wu, Kun Kuang

机构 * Zhejiang University(浙江大学) East China Normal University(华东师范大学) Zhejiang University of Science and Technology(浙江理工大学)

专题命中 文档图表理解 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型中视觉信息被弱化的问题,提出Vision Inference Former(VIF)轻量模块,在推理解码阶段持续注入视觉语义,提升生成内容与视觉的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28554 2026-04-21 cs.CV cs.AI cs.IR 81%

Hydra: Unifying Document Retrieval and Generation in a Single Vision-Language Model

Hydra:在单一视觉-语言模型中统一文档检索与生成

Athos Georgiou

机构 * Independent Researcher(独立研究者)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 Hydra通过单一视觉-语言模型实现文档检索与生成的统一,减少内存和系统复杂性,通过LoRA适配器在推理时切换,提升效率并保持生成质量。

Comments 21 pages, 4 figures, 10 tables, 1 algorithm. v3: two-scale release (4B, 0.8B); bitwise generation-equivalence (426/426 LM tensors at 4B); peak VRAM -62.7% at 4B, -59.1% at 0.8B; GritLM joint-training ablation; Qwen2.5-Omni-3B omni extension. Models: huggingface.co/collections/athrael-soju/hydra-dual-head-retrieval-and-generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06912 2026-04-09 cs.CV cs.AI 81%

Q-Zoom: Query-Aware Adaptive Perception for Efficient Multimodal Large Language Models

Q-Zoom:基于查询的自适应感知以实现高效多模态大语言模型

Yuheng Shi, Xiaohuan Pei, Linfeng Wen, Minjing Dong, Chang Xu

机构 * University of Sydney(悉尼大学) Sun Yat-sen University(中山大学) City University of Hong Kong(香港城市大学)

专题命中 文档图表理解 :multimodal large language model(title);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 Q-Zoom通过高效粗到细的框架优化多模态大语言模型的高分辨率感知,提升推理速度并保持精度,实验表明其在文档识别和高分辨率场景中表现优异。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07642 2026-02-10 cs.AI cs.LG 81%

Efficient Table Retrieval and Understanding with Multimodal Large Language Models

基于多模态大语言模型的高效表格检索与理解

Zhuoyan Xu, Haoyang Fang, Boran Han, Bonan Min, Bernie Wang, Cuixiong Hu, Shuai Zhang

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) AWS(亚马逊网络服务)

专题命中 文档图表理解 :multimodal large language model(title,abstract);分类 cs.AI、cs.LG

AI总结 TabRAG通过多模态大语言模型实现高效表格检索与理解,显著提升检索召回率和答案准确率。

Comments Published at EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22754 2026-02-02 cs.CV cs.AI 81%

Procedural Knowledge Extraction from Industrial Troubleshooting Guides Using Vision Language Models

从工业故障排除指南中提取程序性知识:使用视觉语言模型

Guillermo Gil de Avalle, Laura Maruster, Christos Emmanouilidis

机构 * University of Groningen(Groningen大学)

专题命中 文档图表理解 :vision language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究如何利用视觉语言模型从工业故障排除指南中提取结构化知识,通过对比两种提示策略评估模型性能,揭示布局敏感性与语义稳健性的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏