arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-09 至 2026-04-09 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 文档图表理解 2 篇

2604.06912 2026-04-09 cs.CV cs.AI 81%

Q-Zoom: Query-Aware Adaptive Perception for Efficient Multimodal Large Language Models

Q-Zoom:基于查询的自适应感知以实现高效多模态大语言模型

Yuheng Shi, Xiaohuan Pei, Linfeng Wen, Minjing Dong, Chang Xu

机构 * University of Sydney(悉尼大学) Sun Yat-sen University(中山大学) City University of Hong Kong(香港城市大学)

专题命中 文档图表理解 :multimodal large language model(title);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 Q-Zoom通过高效粗到细的框架优化多模态大语言模型的高分辨率感知,提升推理速度并保持精度,实验表明其在文档识别和高分辨率场景中表现优异。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01972 2026-04-09 cs.CV 57%

SDesc3D: Towards Layout-Aware 3D Indoor Scene Generation from Short Descriptions

SDesc3D:面向布局感知的短描述驱动的3D室内场景生成

Jie Feng, Jiawei Shen, Junjia Huang, Junpeng Zhang, Mingtao Feng, Weisheng Dong, Guanbin Li

机构 * Xidian University(西安电子科技大学) Sun Yat-sen University(中山大学)

专题命中 文档图表理解 :grounding(abstract);分类 cs.CV

AI总结 本文提出SDesc3D框架,通过多视角结构先验和区域功能暗示实现短描述驱动的3D室内场景生成,提升物理合理性和细节丰富度。

详情

展开后加载摘要…

URL PDF HTML 收藏