arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-17 至 2026-03-17 共收录 9 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 9 篇

2603.13349 2026-03-17 cs.CV cs.AI 76%

MURE: Hierarchical Multi-Resolution Encoding via Vision-Language Models for Visual Document Retrieval

MURE:基于视觉-语言模型的多分辨率编码框架用于视觉文档检索

Fengbin Zhu, Zijing Cai, Yuzhe Wang, Pengyang Shao, Wenjie Wang, Fuli Feng, Richang Hong, Tat-Seng Chua

机构 * National University of Singapore, Singapore(新加坡国立大学) University of Science and Technology of China, China(中国科学技术大学) Hefei University of Technology, China(合肥工业大学)

专题命中 文档图表理解 :vision-language model(title);分类 cs.CV、cs.AI

AI总结 本文提出MURE框架,通过多分辨率采样编码、跨粒度特征融合和语义感知聚类机制,提升视觉文档检索效率与效果,实验表明其优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15020 2026-03-17 cs.CV cs.CL 70%

MER-Bench: A Comprehensive Benchmark for Multimodal Meme Reappraisal

MER-Bench:多模态表情包再解释的综合基准

Yiqi Nie, Fei Wang, Junjie Chen, Kun Li, Yudi Cai, Dan Guo, Chenglong Li, Meng Wang

机构 * School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) College of Information Technology, United Arab Emirates University(阿拉伯联合酋长国大学信息学院) Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院)

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出MER-Bench,一个用于多模态表情包再解释的综合基准,通过多模态大语言模型评估结构保持、语义一致性和情感转换,揭示现有系统在约束满足上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13398 2026-03-17 cs.CV 70%

Qianfan-OCR: A Unified End-to-End Model for Document Intelligence

千帆OCR:一种统一的端到端模型用于文档智能

Daxiang Dong, Mingming Zheng, Dong Xu, Chunhua Luo, Bairong Zhuang, Yuxuan Li, Ruoyun He, Haoran Wang, Wenyu Zhang, Wenbo Wang, Yicheng Wang, Xue Xiong, Ayong Zheng, Xiaoying Zuo, Ziwei Ou, Jingnan Gu, Quanhao Guo, Jianmin Wu, Dawei Yin, Dou Shen

机构 * Baidu Qianfan Team(百度千帆团队)

专题命中 文档图表理解 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 千帆OCR是一种端到端视觉-语言模型,整合文档解析、布局分析和文档理解,支持图像到Markdown转换及多种提示驱动任务,通过Layout-as-Thought机制提升复杂布局的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13238 2026-03-17 cs.CV cs.CL 70%

KazakhOCR: A Synthetic Benchmark for Evaluating Multimodal Models in Low-Resource Kazakh Script OCR

KazakhOCR: 一种用于评估多模态模型在低资源库尔德语手写体OCR中的合成基准

Henry Gagnier, Sophie Gagnier, Ashwin Kirubakaran

机构 * Pittsford Sutherland High School(皮茨福德萨瑟兰高中) Edison Academy Magnet School(埃德ison学院磁性学校)

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文构建了包含7219张图像的合成OCR数据集,用于评估多模态大语言模型在低资源库尔德语手写体OCR和语言识别中的性能,发现传统OCR在字符错误率上优于MLLMs。

Comments Accepted to AbjadNLP @ EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13587 2026-03-17 cs.AI cs.CV 62%

Breaking the SFT Plateau: Multimodal Structured Reinforcement Learning for Chart-to-Code Generation

突破SFT平台:面向图表到代码生成的多模态结构强化学习

Lei Chen, Xuanle Zhao, Zhixiong Zeng, Jing Huang, Liming Zheng, Yufeng Zhong, Lin Ma

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出多模态结构强化学习(MSRL)以突破SFT平台,通过大规模实验构建最大训练语料库,并采用双阶段课程训练策略,提升图表到代码生成的高阶指标。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00782 2026-03-17 cs.GR cs.AI cs.CV cs.MM cs.SD eess.AS 62%

SpA2V: Harnessing Spatial Auditory Cues for Audio-driven Spatially-aware Video Generation

SpA2V: 利用空间听觉线索进行音频驱动的空间感知视频生成

Kien T. Pham, Yingqing He, Yazhou Xing, Qifeng Chen, Long Chen

专题命中 文档图表理解 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 SpA2V通过利用空间听觉线索生成与输入音频在语义和空间上一致的视频,改进了现有方法对语义信息的依赖,提出两阶段框架实现视频场景布局生成与生成。

Comments The 33rd ACM Multimedia Conference (MM '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15509 2026-03-17 cs.AI cs.CV 62%

Chart-R1: Chain-of-Thought Supervision and Reinforcement for Advanced Chart Reasoner

Chart-R1: 链式推理监督与强化学习用于高级图表推理器

Lei Chen, Xuanle Zhao, Zhixiong Zeng, Jing Huang, Yufeng Zhong, Lin Ma

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Chart-R1,通过链式推理监督和强化学习提升图表推理能力,通过程序化数据合成和两阶段训练策略,在图表领域取得显著性能提升。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15206 2026-03-17 cs.CL cs.CV 57%

Efficient Document Parsing via Parallel Token Prediction

通过并行标记预测实现高效的文档解析

Lei Li, Ze Zhao, Meng Li, Zhongwang Lun, Yi Yuan, Xingjing Lu, Zheng Wei, Jiang Bian, Zang Li

机构 * Platform and Content Group, Tencent(腾讯平台与内容组) Renmin University of China(中国人民大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出并行标记预测方法,通过在输入序列中插入可学习标记并设计训练目标,使VLM在文档解析中实现并行解码,提升解析速度并减少模型幻觉。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18333 2026-03-17 cs.CV 57%

ConsistCompose: Unified Multimodal Layout Control for Image Composition

ConsistCompose:统一的多模态布局控制用于图像合成

Xuanke Shi, Boxuan Li, Xiaoyang Han, Zhongang Cai, Lei Yang, Quan Wang, Dahua Lin

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

AI总结 ConsistCompose通过将布局坐标直接嵌入语言提示,实现布局可控的多实例图像生成,并构建了3.4M的多实例生成数据集,提升了布局控制的精度和多模态理解能力。

Comments Accepted to CVPR 2026; 23 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏