arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-18 至 2026-03-18 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 2 篇

2603.14610 2026-03-18 cs.CV eess.IV 57%

Make it SING: Analyzing Semantic Invariants in Classifiers

使分类器具备语义不变性:分析分类器中的语义不变性

Harel Yadid, Meir Yossef Levi, Roy Betser, Guy Gilboa

机构 * Viterbi Faculty of Electrical and Computer Engineering(电气与计算机工程学院)

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

AI总结 本文提出SING方法,通过构建等价图像并赋予语义解释,揭示分类器中语义不变性,分析不同模型在保持语义方面的差异。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21435 2026-03-18 cs.CV 57%

Synergizing Understanding and Generation with Interleaved Analyzing-Drafting Thinking

融合理解与生成的交错分析-草稿思维

Shengqiong Wu, Bobo Li, Xinkai Wang, Xiangtai Li, Lei Cui, Furu Wei, Shuicheng Yan, Hao Fei, Tat-seng Chua

机构 * National University of Singapore(国立新加坡大学) University of Oxford(牛津大学) Nanyang Technological University(南洋理工大学) Microsoft Research(微软研究院)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文提出AD-Loop机制,通过交错分析与草稿操作提升视觉语言模型的理解与生成能力,实验表明其在多个基准测试中表现优异,具备良好的迁移性。

Comments 28 pages, 17 figures, 6 tables, ICLR conference

详情

展开后加载摘要…

URL PDF HTML 收藏