arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-26 至 2026-03-26 共收录 65 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 13 篇

2603.19775 2026-03-26 cs.CV 57%

Evaluating Image Editing with LLMs: A Comprehensive Benchmark and Intermediate-Layer Probing Approach

基于大语言模型的图像编辑评估:一个全面的基准和中间层探针方法

Shiqi Gao, Zitong Xu, Kang Fu, Huiyu Duan, Xiongkuo Min, Jia wang

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(图像通信与网络工程研究所,上海交通大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出TIEdit基准和EditProbe方法,通过5120张编辑图像和专家评分,评估文本引导图像编辑方法的感知质量、对齐性和内容保真度,同时利用大语言模型中间层探针提升评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16212 2026-03-26 cs.RO 50%

Point Bridge: 3D Representations for Cross Domain Policy Learning

点桥:跨领域策略学习的3D表示

Siddhant Haldar, Lars Johannsmeier, Lerrel Pinto, Abhishek Gupta, Dieter Fox, Yashraj Narang, Ajay Mandlekar

机构 * NVIDIA New York University(纽约大学) University of Washington(华盛顿大学)

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 点桥通过统一的点表示实现跨领域策略学习,利用视觉语言模型提取点表示,结合Transformer策略学习,无需显式视觉或物体对齐,提升仿真到现实的零样本迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 3 篇

2603.22492 2026-03-26 cs.CV cs.AI cs.MM 73%

Tiny Inference-Time Scaling with Latent Verifiers

微小推理时间缩放与潜在验证器

Davide Bucciarelli, Evelyn Turri, Lorenzo Baraldi, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学)

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VHS验证器,直接在扩散变换器单步生成器的中间隐藏表示上操作,减少验证成本并提升性能,实现更高效的推理时间缩放。

Comments Findings of CVPR 2026 - Code at: https://aimagelab.github.io/VHS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23627 2026-03-26 cs.CV cs.AI 62%

Ukrainian Visual Word Sense Disambiguation Benchmark

乌克兰视觉词义消歧基准

Yurii Laba, Yaryna Mohytych, Ivanna Rohulia, Halyna Kyryleyza, Hanna Dydyk-Meush, Oles Dobosevych, Rostyslav Hryniv

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一个评估乌克兰视觉词义消歧任务的基准,通过八种多语言大模型测试,发现乌克兰与英语在该任务上存在显著性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24275 2026-03-26 cs.LG 57%

Language-Assisted Image Clustering Guided by Discriminative Relational Signals and Adaptive Semantic Centers

基于判别关系信号和自适应语义中心的语言辅助图像聚类

Jun Ma, Xu Zhang, Zhengxing Jiao, Yaxin Hou, Hui Liu, Junhui Hou, Yuheng Jia

机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院) School of Computing Information Sciences, Saint Francis University, Hong Kong, China(圣弗朗西斯大学计算信息科学学院) Department of Computer Science, City University of Hong Kong, Hong Kong, China(香港城市大学计算机科学系)

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

AI总结 本文提出一种新的语言辅助图像聚类框架,通过跨模态关系生成更判别的自监督信号,并利用提示学习学习类别连续语义中心,提升聚类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏