Ocean-OCR: Towards General OCR Application via a Vision-Language Model
专题命中 文档图表理解 :vision-language model(title);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 文档图表理解 :vision-language model(title);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 文档图表理解 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV
SCALE:用于先进节点局部布局与布线设计规则违规修复的自监督约束感知布局生成
机构 * NVIDIA(英伟达) ; Duke University(杜克大学)
专题命中 文档图表理解 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI
AI总结 针对先进节点局部P&R DRV修复难题,提出SCALE框架,通过自监督布局生成、利用自然语言规则约束和高温采样等方法,生成DRC注释布局违规对微调DRC-VLM,有效提升了最先进代理的修复解决率。
Comments 8 pages, 5 Figures, 6 Tables
HomeWorld:一个统一的从平面图到家具的框架,用于生成可控、密集交互的全屋场景
机构 * Ace Robotics(Ace机器人公司) ; CUHK MMLab(香港大学多模态实验室) ; Shenzhen Loop Area Institute(深圳河套学院)
专题命中 文档图表理解 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI
AI总结 提出一个统一的分层框架,通过大规模真实平面图数据集训练大语言模型生成全屋平面图,结合图像生成模型和VLM优化器生成家具及小物体布局,并附加物理属性和纹理光照,实现可控、高真实感的全屋场景生成。
Plan2Map: 基于规划记录的文档驱动地理空间边界重建的多模态基准
专题命中 文档图表理解 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI
AI总结 提出Plan2Map基准和GeoPlanAgent系统,通过文档证据提取、定位、地图配准、边界分割等步骤,从英国规划记录中重建地理空间边界,显著优于直接VLM方法。
Comments Project page: https://odeb1.github.io/Plan2Map_Project_Page/. Fabian Degen and Oishi Deb Contributed Equally
SceneSmith: 面向仿真就绪室内场景的智能体生成
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Harvard University(哈佛大学)
专题命中 文档图表理解 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI
AI总结 提出层次化智能体框架SceneSmith,通过VLM智能体协作从自然语言生成仿真就绪的室内场景,相比先前方法生成3-6倍物体且碰撞率低于2%。
Comments ICML 2026 Spotlight; Project page: https://scenesmith.github.io/
CLIP风格视觉语言模型在合成空间关系数据训练中的左右对称性破缺
机构 * InfoTech, Toyota Motor Corporation(丰田汽车公司信息科技部门)
专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 通过可控一维图像文本测试平台,研究基于Transformer的视觉语言编码器在CLIP风格对比学习下如何通过位置与标记嵌入交互产生左右关系理解,并发现标签多样性比布局多样性更关键。
Comments Accepted at ICML 2026
台风OCR:面向泰语文档提取的开放视觉-语言模型
机构 * Typhoon, SCB 10X(Typhoon,SCB 10X)
专题命中 文档图表理解 :vision-language model(title,abstract);VLM(abstract)
AI总结 Typhoon OCR 是一个专为泰语文档提取设计的开放视觉-语言模型,通过多阶段数据构建管道训练,实现文本转录、布局重构和结构一致性,性能媲美专有模型且计算成本更低。
多阶段索赔文档理解的混合架构:结合视觉语言模型和机器学习实现实时处理
专题命中 文档图表理解 :vision-language model(title,abstract);VLM(abstract)
AI总结 本文提出一种混合架构,结合OCR、逻辑回归和视觉语言模型,实现高效准确的索赔文档处理,提升自动化效率300倍。
Comments 19 pages, 3 figures, 3 tables
XBIDetective: 利用视觉语言模型识别跨浏览器视觉不一致
专题命中 文档图表理解 :vision language model(title,abstract);VLM(abstract)
AI总结 XBIDetective利用视觉语言模型识别跨浏览器视觉不一致,通过自动截图和分析检测渲染错误,准确率高达79%
专题命中 文档图表理解 :vision-language model(title,abstract);VLM(abstract)
Comments 2 pages, 2 figures. Accepted submission to the poster track of IEEE VIS 2025
专题命中 文档图表理解 :MLLM(title,abstract);multimodal large language model(abstract)
Comments Accepted by the 34th International Symposium on Software Testing and Analysis (ISSTA 2025)
机构 * Artificial Intelligence and Intelligent Information Systems, University of Trier(人工智能与智能信息系统,特里尔大学) ; German Research Center for Artificial Intelligence (DFKI), Trier(德国人工智能研究中心(DFKI),特里尔)
专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 文档图表理解 :VLM(title,abstract);vision-language model(abstract)
专题命中 文档图表理解 :vision-language model(title,abstract);visual reasoning(abstract)
专题命中 文档图表理解 :vision-language model(title,abstract);VLM(abstract)
Comments Submitted to Empirical Software Engineering (EMSE) journal
专题命中 文档图表理解 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
DocAtlas:将长文档理解视为可变状态交互
专题命中 文档图表理解 :VLM(summary_cn,abstract);分类 cs.AI
AI总结 本研究提出DocAtlas系统,将长文档理解视为可变状态交互,通过可变文档工具结合自改进检索等技术,在MMLongBench-Doc上用GPT-5.4达71.4%,还可提升紧凑型VLM智能体性能。
文本到图像模型能否从正确的参考框架中生成图像?
专题命中 文档图表理解 :VLM(summary_cn,abstract);分类 cs.CV
AI总结 该研究引入FoR-T2I基准,发现现有22个T2I模型在参考框架提示下的布局理解准确率远低于相机视图提示,还提出VLM门控重写方法提升了参考框架下的生成准确率。
Comments 9 pages, 3 figures
AnnoBench:可视化标注生成基准测试
专题命中 文档图表理解 :VLM(summary_cn,abstract);分类 cs.AI
AI总结 介绍AnnoBench可视化标注基准测试,它将可视化与标注任务配对,通过VLM评判执行,经多因素实验评估对标注质量的影响,为推进标注自动化等提供基础。
HOMIE:通过多模态智能增强实现以人为对象的视频个性化
机构 * Hong Kong University of Science and Technology(香港科技大学)
专题命中 文档图表理解 :MLLM(summary_cn,abstract);分类 cs.CV
AI总结 研究以人为对象的视频个性化问题,提出HOMIE框架,统一处理主体间和主体内输入设置。通过更好的MLLM集成策略、自注意力中的全局多模态引导及模态参考嵌入,在多任务中达最优性能。
Comments 28 pages, 14 figures
PP-OCRv6: 从1.5M到34.5M参数,在OCR任务上超越十亿级视觉语言模型
机构 * PaddlePaddle Team, Baidu Inc.(百度公司飞桨团队)
专题命中 文档图表理解 :VLM(summary_cn,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 提出轻量级OCR系统PP-OCRv6,通过统一MetaFormer架构和结构化重参数化,在服务器到边缘设备上以少数量级参数超越十亿级VLM,中模型识别准确率83.2%,检测Hmean 86.2%。
Function2Scene: 基于功能规范的3D室内场景布局
机构 * Simon Fraser University(西蒙弗雷泽大学) ; Brown University(布朗大学)
专题命中 文档图表理解 :VLM(summary_cn,abstract);分类 cs.CV
AI总结 提出Function2Scene框架,通过解析自然语言设计简报中的用户角色和活动,从17个功能约束准则生成布局,并利用LLM和VLM的迭代检查-修复循环优化,在30个专业案例中94.3%的成对比较优于基线方法。
Comments project page: https://function2scene.github.io/
CiteVQA:可信赖文档智能的证据归因基准测试
机构 * Peking University(北京大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 文档图表理解 :MLLM(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 CiteVQA通过要求模型返回元素级边界框引用,评估文档理解中的证据归因,揭示了现有评估方法的可靠性缺口,主要贡献是引入Strict Attributed Accuracy指标。
NEXT:通过视觉语言模型进行推理驱动的视频推荐
专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV、cs.LG
AI总结 研究提出推理驱动的视频推荐框架NEXT,通过对用户已观看视频推理推断其下一个意图来检索后续视频。训练NEXT-8B视觉语言模型,在DocVQA性能上表现出色,在特定评估中提升下一个意图逻辑质量,部署后带来生产收益,证明其可作为实用推理引擎。
Comments 13 pages, 2 figures, 5 tables
Vision Inference Former:在多模态大语言模型中维持视觉一致性
机构 * Zhejiang University(浙江大学) ; East China Normal University(华东师范大学) ; Zhejiang University of Science and Technology(浙江理工大学)
专题命中 文档图表理解 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI
AI总结 针对多模态大语言模型中视觉信息被弱化的问题,提出Vision Inference Former(VIF)轻量模块,在推理解码阶段持续注入视觉语义,提升生成内容与视觉的一致性。
Hydra:在单一视觉-语言模型中统一文档检索与生成
机构 * Independent Researcher(独立研究者)
专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 Hydra通过单一视觉-语言模型实现文档检索与生成的统一,减少内存和系统复杂性,通过LoRA适配器在推理时切换,提升效率并保持生成质量。
Comments 21 pages, 4 figures, 10 tables, 1 algorithm. v3: two-scale release (4B, 0.8B); bitwise generation-equivalence (426/426 LM tensors at 4B); peak VRAM -62.7% at 4B, -59.1% at 0.8B; GritLM joint-training ablation; Qwen2.5-Omni-3B omni extension. Models: huggingface.co/collections/athrael-soju/hydra-dual-head-retrieval-and-generation
Q-Zoom:基于查询的自适应感知以实现高效多模态大语言模型
机构 * University of Sydney(悉尼大学) ; Sun Yat-sen University(中山大学) ; City University of Hong Kong(香港城市大学)
专题命中 文档图表理解 :multimodal large language model(title);LLaVA(abstract);分类 cs.CV、cs.AI
AI总结 Q-Zoom通过高效粗到细的框架优化多模态大语言模型的高分辨率感知,提升推理速度并保持精度,实验表明其在文档识别和高分辨率场景中表现优异。
Comments 16 pages, 9 figures
基于多模态大语言模型的高效表格检索与理解
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; AWS(亚马逊网络服务)
专题命中 文档图表理解 :multimodal large language model(title,abstract);分类 cs.AI、cs.LG
AI总结 TabRAG通过多模态大语言模型实现高效表格检索与理解,显著提升检索召回率和答案准确率。
Comments Published at EACL 2026 Findings
从工业故障排除指南中提取程序性知识:使用视觉语言模型
机构 * University of Groningen(Groningen大学)
专题命中 文档图表理解 :vision language model(title,abstract);分类 cs.CV、cs.AI
AI总结 本文研究如何利用视觉语言模型从工业故障排除指南中提取结构化知识,通过对比两种提示策略评估模型性能,揭示布局敏感性与语义稳健性的权衡。