Qianfan-VL: Domain-Enhanced Universal Vision-Language Models
机构 * Qianfan Team, Baidu AI Cloud(百度AI云团队)
专题命中 文档图表理解 :vision-language model(title);multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments 12 pages
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Qianfan Team, Baidu AI Cloud(百度AI云团队)
专题命中 文档图表理解 :vision-language model(title);multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments 12 pages
机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; State Key Laboratory of Cognitive Intelligence, iFLYTEK(认知智能国家重点实验室)
专题命中 文档图表理解 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI
机构 * Beijing Digital Native Digital City Research Center(北京数字原生数字城市研究中心) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 文档图表理解 :vision-language model(title);MLLM(abstract);分类 cs.CV、cs.AI
Comments Accepted by ICME2025
机构 * Southeast University, China(东南大学) ; University of California, Merced, USA(加州大学默塞德分校) ; National University of Singapore, Singapore(新加坡国立大学) ; The University of Queensland, Australia(昆士兰大学)
专题命中 文档图表理解 :visual language model(title,abstract);分类 cs.CV、cs.LG
Comments Accepted to COLM 2025
专题命中 文档图表理解 :MLLM(title);multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments Accepted by ACL 2025 Findings
机构 * NAMAA ; KAND CA Corp. ; Prince Sultan University
专题命中 文档图表理解 :multimodal large language model(title);vision-language model(abstract);分类 cs.CV、cs.AI
机构 * Zhejiang University(浙江大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Xiaohongshu Inc.(小红书公司) ; East China Normal University(华东师范大学)
专题命中 文档图表理解 :MLLM(title,abstract);分类 cs.AI、cs.LG
Comments Work in progress
机构 * Salesforce AI Research(Salesforce AI研究院) ; UCLA(加州大学洛杉矶分校)
专题命中 文档图表理解 :vision language model(title,abstract);分类 cs.CV、cs.AI
Comments Code and data are available at https://github.com/SalesforceAIResearch/CogAlign
机构 * Institution1(机构1) ; Institution2(机构2)
专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.AI、cs.LG
Comments 12 pages, 5 figures, 5 Tables
机构 * Zhejiang University(浙江大学) ; Taobao & Tmall Group of Alibaba(阿里巴巴集团) ; USTC(中国科学技术大学)
专题命中 文档图表理解 :vision language model(title);multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments 9 pages, 4 figures, accepted to ICLR 2025 workshop
机构 * Huawei Translation Service Center(华为翻译服务中心)
专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV、cs.AI
Comments 7 pages, 1 figures, 2 tables
专题命中 文档图表理解 :vision language model(title,abstract);分类 cs.CV、cs.AI
专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV、cs.AI
Comments CVPR 2025, project website: https://ai.stanford.edu/~sunfanyun/layoutvlm/
专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV、cs.AI
Comments Under review
专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.AI、cs.LG
Comments Accepted at EMNLP 2023 (Main, long); 9 pages, 5 figures
ICU-Bench: 多模态大语言模型持续反学习基准测试
机构 * School of Computer Science and Technology(计算机科学与技术学院)
专题命中 文档图表理解 :multimodal large language model(title,abstract);分类 cs.AI
AI总结 本文提出ICU-Bench,用于评估多模态大语言模型在持续隐私删除中的性能,包含1000个敏感资料和9500张图像,引入新指标分析遗忘效果与稳定性,揭示现有方法在持续场景下的局限。
Comments 21 pages, 11 figures, and 9 tables
图表支持还是模型提供?审视多模态大语言模型生成的可访问可视化声明
专题命中 文档图表理解 :MLLM(title);multimodal large language model(abstract);分类 cs.AI
AI总结 研究多模态大语言模型生成可视化声明的证据基础,通过对多种来源、模型及输入条件的探索性研究,分析模型标签与数值一致性,发现可访问图表上下文有作用,添加图像及无上下文提示效果不佳,推动可区分证据支持声明与模型解释的描述系统发展。
Comments Submitted to the 3rd Workshop on Accessible Data Visualization, IEEE VIS 2026
通过分类引导的大型视觉语言模型从文档中提取视觉信息
机构 * China Mobile Information Technology Co., Ltd.(中国移动信息技术有限公司) ; School of Information Science and Engineering, NingboTech University(宁波诺丁汉大学信息科学与工程学院)
专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV
AI总结 研究从视觉丰富文档提取视觉信息的挑战,提出分类引导大型视觉语言模型框架,通过解耦分类与提取、运用动态提示工程实现零样本推理,在真实数据集上性能超监督基线,为办公自动化文档理解提供高效方案。
Comments 14 pages, 3 figures
Journal ref Scientific Reports 16, 14158 (2026)
视觉语言模型是读取还是重写?论视觉语言模型中的转录忠实性
专题命中 文档图表理解 :vision-language model(title);vision language model(abstract);分类 cs.AI
AI总结 研究视觉语言模型在文档理解中是否忠实转录。引入FaithC4基准,评估通用、OCR专用VLMs及传统OCR管道。发现通用VLMs受扰WER降4.5分,OCR专用降0.2 - 2分,传统OCR降不到0.6分。还揭示重写与FFN表示及单词长度的关系。
Comments 15 pages, 6 figures
通过信息过载对大型视觉语言模型进行越狱攻击
机构 * National University of Singapore(新加坡国立大学) ; Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)
专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV
AI总结 研究大型视觉语言模型易受越狱攻击问题,提出基于递归图像排版布局的信息过载方法,含大量文本和多维图像攻击,大幅提升攻击成功率,凸显此为现实部署安全风险。
视觉语言模型在UML图解释中的先验偏差
机构 * Dept. of Computer Science(计算机科学系) ; William & Mary, USA(威廉玛丽学院)
专题命中 文档图表理解 :vision language model(title,abstract);分类 cs.CV
AI总结 研究视觉语言模型在UML图解释时是依据先验知识还是真正理解图表。通过引入对比基准测试,评估多个模型,发现反转关系箭头会降低开源模型关系方向准确率,不同模型表现有差异,揭示先验驱动的理解故障。
Comments 16 pages, 14 figures, 2 tables
视觉-语言模型将头部方向误认为注视方向:非语言对话线索
机构 * Brown University(布朗大学) ; Columbia University(哥伦比亚大学) ; Emory University(埃默里大学) ; Johns Hopkins University(约翰霍普金斯大学) ; University of Washington(华盛顿大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Michigan(密歇根大学) ; UC San Diego(圣地亚哥大学)
专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV
AI总结 本研究通过控制头部方向的实验发现,视觉-语言模型(VLMs)在推断注视目标时主要依赖头部方向而非眼睛外观,导致与人类存在显著性能差距,并指出数据偏差是主要原因。
Comments Accepted by ACL 2026. Project page at https://zoryzhang.github.io/gaze/
使用视觉-语言模型进行意大利议会演讲的转录与识别
机构 * Università degli Studi di Milano(米兰大学) ; Department of Social and Political Sciences(社会科学系) ; Department of Literary Studies, Philology and Linguistics(文学研究、语言学与语言学系) ; Department of Computer Science(计算机科学系)
专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.AI
AI总结 本文提出基于视觉-语言模型的 pipeline,用于自动转录、语义分割和实体链接意大利议会演讲,提升转录质量和发言者标注。
Comments to be published in: ParlaCLARIN V: Interoperability, Multilinguality, and Multimodality in Parliamentary Corpora, organized within the 15th Language Resource and Evaluation Conference (2026)
OmniParser V2:结构化思维点用于统一的视觉文本解析及其在多模态大语言模型中的通用性
机构 * School of Information Science and Engineering, East China University of Science and Technology(东华大学信息科学与工程学院) ; School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) ; School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) ; School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) ; Alibaba Group(阿里巴巴集团)
专题命中 文档图表理解 :multimodal large language model(title,abstract);分类 cs.CV
AI总结 本文提出OmniParser V2,通过结构化思维点提示方案统一视觉文本解析任务,简化流程并提升性能,在多个数据集上取得最佳结果,并验证其在多模态大语言模型中的通用性。
Comments Accepted by IEEE TPAMI
HOG-Layout:通过视觉-语言模型实现层次化3D场景生成、优化与编辑
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Beijing Institute of Technology(北京理工大学)
专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV
AI总结 HOG-Layout利用大语言模型和视觉-语言模型实现文本驱动的层次化3D场景生成、优化与实时编辑,通过检索增强生成技术提升语义一致性,结合优化模块增强物理一致性,实现高效场景编辑。
Comments CVPR 2026
BodhiPromptShield: 预推理提示调解用于抑制LLM/VLM代理中的隐私传播
机构 * Auckland University of Technology(奥克兰理工大学) ; University of Chile(智利大学)
专题命中 文档图表理解 :VLM(title,abstract);分类 cs.CV
AI总结 本文提出BodhiPromptShield框架,通过检测敏感片段、路由和延迟恢复来抑制LLM/VLM代理中的跨阶段隐私传播,实验显示在控制提示隐私基准(CPPB)上效果显著。
重新审视视觉-语言模型中的多模态位置编码
机构 * Qwen Team, Alibaba Group(Qwen团队,阿里巴巴集团) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV
AI总结 本文分析了多模态Rotary Positional Embedding的核心组件,提出MHRoPE和MRoPE-Interleave两种改进方法,在多种基准测试中表现优异,提升了多模态理解能力。
Comments 16 pages
PaddleOCR-VL-1.5:迈向一个鲁棒的多任务0.9B视觉语言模型用于野外文档解析
机构 * PaddlePaddle Team, Baidu Inc.(百度公司PaddlePaddle团队)
专题命中 文档图表理解 :VLM(title,abstract);分类 cs.CV
AI总结 PaddleOCR-VL-1.5通过引入Real5-OmniDocBench基准测试,在文档解析任务中达到94.5%的SOTA准确率,并扩展了密封识别和文本定位任务,同时保持0.9B超紧凑模型的高效性。
AltChart: 通过多预训练任务增强基于视觉语言模型的图表摘要
专题命中 文档图表理解 :VLM(title);vision-language model(abstract);分类 cs.CV
AI总结 本文提出AltChart数据集和方法,通过多预训练任务提升VLM在图表摘要中的表现,评估四种主流模型的可访问性。
Comments Concerns about reproducibility of the train results and dataset availability
PP-OCRv5:一个专门针对OCR任务的500万参数模型,其性能可与百亿参数的视觉-语言模型相抗衡
机构 * PaddlePaddle Team(PaddlePaddle团队) ; Baidu Inc(百度公司)
专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV
AI总结 本文提出PP-OCRv5,一个轻量级OCR系统,通过数据驱动的方法在OCR基准上实现了与百亿参数VLMs相当的性能,同时提升了文本定位精度并减少了幻觉。