arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-22 至 2026-07-22 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 4 篇

2607.15176 2026-07-22 cs.AI cs.CL cs.HC 版本更新 83%

Benchmarking Multimodal Large Language Models for Scientific Visualization Literacy

用于科学可视化素养的多模态大语言模型基准测试

Patrick Phuoc Do, Chau M. Ta, Chaoli Wang

机构 * University of Notre Dame(圣母大学)

专题命中 文档图表理解 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 研究对六个多模态大语言模型进行科学可视化素养基准测试,涵盖多种技术和任务类型。通过封闭世界协议评估闭源和开源模型,与人类参与者数据对比。发现模型表现不均,Gemini最强,开源模型低于人类基线,明确SciVis素养对评估多模态AI系统的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18217 2026-07-22 cs.CV 版本更新 81%

HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enhancement

HOMIE:通过多模态智能增强实现以人为对象的视频个性化

Yiyang Cai, Nan Chen, Rongchang Xie, Junwen Pan, Chunyang Jiang, Cheng Chen, Wen Zhou, Zhenbang Sun, Wei Xue, Wenhan Luo, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 文档图表理解 :MLLM(summary_cn,abstract);分类 cs.CV

AI总结 研究以人为对象的视频个性化问题,提出HOMIE框架,统一处理主体间和主体内输入设置。通过更好的MLLM集成策略、自注意力中的全局多模态引导及模态参考嵌入,在多任务中达最优性能。

Comments 28 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18839 2026-07-22 cs.CL 新提交 75%

HPD-Parsing: Hierarchical Parallel Document Parsing

HPD解析:分层并行文档解析

Shu Wei, Jingjing Wu, Lingshu Zhang, Qunyi Xie, Hao Zou, Le Xiang, Xu Fan, Yangliu Xu, Manhui Lin, Xiaolong Ma, Cheng Cui, Tengyu Du, YY

专题命中 文档图表理解 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 研究基于统一视觉语言模型的文档解析器顺序瓶颈问题,提出HPD解析,采用分层并行解码范式,含主要布局分支和P-MTP,实验显示其吞吐量高且精度有竞争力,为高效统一文档解析开辟新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18997 2026-07-22 cs.CV cs.CE cs.LG 新提交 62%

Benchmarking Deep Learning Approaches for AEC Engineering Drawing Layout Detection and Information Extraction

用于AEC工程图纸布局检测和信息提取的深度学习方法基准测试

Tianyang Huang, Alessio Lombardi, Ahmed Elnagar, Ahmed Zalouk, George Paul, Sepehr Najjarpour, Arvid Sigurdsson, Khalid Ismail, Mohamed Ragab, Edlira Vakaj

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 研究针对AEC图纸信息提取难题,构建特定数据集,对五种深度学习架构进行基准测试,RF-DETR和Qwen3-VL表现出色,而通用预训练模型有域干扰,为AEC自动化信息提取奠定技术基础。

Comments 2026 European Conference of Computing in Construction (EC3 2026), 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏