arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-14 至 2026-04-14 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 8 篇

2604.10772 2026-04-14 cs.CV 79%

HOG-Layout: Hierarchical 3D Scene Generation, Optimization and Editing via Vision-Language Models

HOG-Layout:通过视觉-语言模型实现层次化3D场景生成、优化与编辑

Haiyan Jiang, Deyu Zhang, Dongdong Weng, Weitao Song, Henry Been-Lirn Duh

机构 * The Hong Kong Polytechnic University(香港理工大学) Beijing Institute of Technology(北京理工大学)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

AI总结 HOG-Layout利用大语言模型和视觉-语言模型实现文本驱动的层次化3D场景生成、优化与实时编辑,通过检索增强生成技术提升语义一致性,结合优化模块增强物理一致性,实现高效场景编辑。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03926 2026-04-14 cs.CL 78%

Doc-PP: Document Policy Preservation Benchmark for Large Vision-Language Models

Doc-PP:大型视觉-语言模型文档政策保护基准

Haeun Jang, Hwan Chang, Hwanhee Lee

机构 * Chung-Ang University(中央大学)

专题命中 文档图表理解 :vision-language model(title,abstract)

AI总结 本文提出Doc-PP基准,用于评估大型视觉-语言模型在严格非披露政策下对文档的理解能力,揭示了推理诱导的安全差距,并提出DVA框架提升政策合规性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08538 2026-04-14 cs.CV 70%

ParseBench: A Document Parsing Benchmark for AI Agents

ParseBench:面向AI代理的文档解析基准测试

Boyang Zhang, Sebastián G. Acosta, Preston Carlson, Sacha Bron, Pierre-Loïc Doulcet, Daniel B. Ospina, Simon Suo

专题命中 文档图表理解 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出ParseBench,一个包含2000多页企业文档的基准测试,涵盖表格、图表、内容忠实度、语义格式和视觉关联五大能力维度,揭示了当前系统在这些方面的能力缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17188 2026-04-14 cs.AI 70%

PosterGen: Aesthetic-Aware Multi-Modal Paper-to-Poster Generation via Multi-Agent LLMs

PosterGen:基于多智能体LLM的美观化论文到海报生成

Zhilin Zhang, Xiang Zhang, Jiaqi Wei, Yiwei Xu, Chenyu You

机构 * Stony Brook University(石溪大学) New York University(纽约大学) University of British Columbia(不列颠哥伦比亚大学) Zhejiang University(浙江大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 PosterGen通过多智能体LLM实现论文到海报的美观化生成,包含四个协作专业代理,提升设计质量和视觉吸引力。

Comments Project Website: https://Y-Research-SBU.github.io/PosterGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11307 2026-04-14 cs.AI 57%

PaperScope: A Multi-Modal Multi-Document Benchmark for Agentic Deep Research Across Massive Scientific Papers

PaperScope:一种多模态多文档基准,用于跨大规模科学论文的智能深度研究

Lei Xiong, Huaying Yuan, Zheng Liu, Zhao Cao, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 文档图表理解 :grounding(abstract);分类 cs.AI

AI总结 PaperScope提出一个多模态多文档基准,用于评估智能深度研究能力,包含2000多个跨领域问题,验证了现有系统在长上下文检索和多源推理中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11042 2026-04-14 cs.CV 57%

Improving Layout Representation Learning Across Inconsistently Annotated Datasets via Agentic Harmonization

通过代理和谐化提升跨不一致标注数据集的布局表示学习

Renyu Li, Vladimir Kirilenko, Yao You, Crag Wolfe

机构 * Unstructured Technologies

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出利用视觉-语言模型在异质数据源中协调类别语义和边界框粒度,提升文档布局检测的准确性与一致性。

Comments 12 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10918 2026-04-14 cs.AI 57%

CSPO: Alleviating Reward Ambiguity for Structured Table-to-LaTeX Generation

CSPO:缓解结构化表格到LaTeX生成中的奖励模糊性

Yunfan Yang, Cuiling Lan, Jitao Sang, Yan Lu

机构 * Beijing Jiaotong University(北京交通大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出CSPO框架,通过分离LaTeX表格组件的优化,缓解奖励模糊性,提升结构化生成的可靠性。

Comments Accepted by ACL2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16644 2026-04-14 cs.CV 57%

CountLoop: Training-Free High-Instance Image Generation via Iterative Agent Guidance

CountLoop:通过迭代代理指导实现无训练的高实例图像生成

Anindya Mondal, Ayan Banerjee, Sauradip Nag, Josep Llados, Xiatian Zhu, Anjan Dutta

机构 * University of Surrey(萨里大学) Universitat Autònoma de Barcelona(巴塞罗那自治大学) Simon Fraser University(西蒙菲莎大学)

专题命中 文档图表理解 :VLM(abstract);分类 cs.CV

AI总结 CountLoop通过迭代反馈机制实现高密度场景下的精确实例控制,结合视觉语言模型生成布局和评估反馈,减少计数误差并提升空间质量。

详情

展开后加载摘要…

URL PDF HTML 收藏