arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-13 至 2026-07-13 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 2 篇

2607.09029 2026-07-13 cs.CV 新提交 79%

MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models

MOSAIC:用于高效异构视觉语言模型的自适应层间组合

Yuncheng Yang, Feiyang Ye, Shixian Luo, Yinna Zhu, Lianlei Shan, Wangcai Zhao, Kuo Zhang, Yan Chen, Yong Wu, Yan Xie

机构 * LiAuto Inc.(理想汽车公司)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 研究针对视觉语言模型中异构结构依赖手工静态混合模式的问题,提出硬件感知搜索方法MOSAIC,通过多目标混合整数规划确定最优配置,并引入两阶段参数恢复过程,提升了模型推理效率且降低训练成本。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20730 2026-07-13 cs.CV 版本更新 57%

Render-in-the-Loop: Vector Graphics Generation via Visual Self-Feedback

循环渲染:通过视觉自反馈生成矢量图形

Guotao Liang, Zhangcheng Wang, Juncheng Hu, Haitao Zhou, Ziteng Xue, Jing Zhang, Dong Xu, Qian Yu

机构 * School of Software, Beihang University(北航软件学院) Department of Computer Science, The University of Hong Kong(香港大学计算机科学系) Paradigm(4Paradigm)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出Render-in-the-Loop方法,通过视觉上下文引导矢量图形生成,提升模型对视觉信息的利用效率,实现更高效的SVG生成。

详情

展开后加载摘要…

URL PDF HTML 收藏