arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-04 至 2026-03-04 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 2 篇

2603.02789 2026-03-04 cs.CL cs.AI 70%

OCR or Not? Rethinking Document Information Extraction in the MLLMs Era with Real-World Large-Scale Datasets

OCR 或不是?在 MLLMs 时代重新思考文档信息提取:基于真实世界的大规模数据集

Jiyuan Shen, Peiyue Yuan, Atin Ghosh, Yifan Mai, Daniel Dahlmeier

机构 * SAP(SAP公司) Stanford University(斯坦福大学)

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

AI总结 本文探讨了在 MLLMs 时代是否仍需 OCR,通过大规模数据集评估发现,仅图像输入可达到与 OCR 增强方法相当的性能,并展示了通过精心设计的模式、示例和指示可进一步提升 MLLMs 的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19892 2026-03-04 cs.AI 70%

OptMerge: Unifying Multimodal LLM Capabilities and Modalities via Model Merging

OptMerge: 通过模型融合统一多模态大语言模型的能力与模态

Yongxian Wei, Runxi Cheng, Weike Jin, Enneng Yang, Li Shen, Lu Hou, Sinan Du, Chun Yuan, Xiaochun Cao, Dacheng Tao

机构 * Tsinghua University(清华大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学)

专题命中 文档图表理解 :grounding(abstract);MLLM(abstract);分类 cs.AI

AI总结 OptMerge通过模型融合统一多模态大语言模型的能力与模态,提出基准和算法提升性能2.48%

详情

展开后加载摘要…

URL PDF HTML 收藏