arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-30 至 2026-06-30 共收录 132 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 26 篇

2412.15632 2026-06-30 cs.CV 57%

A New Method to Capturing Compositional Knowledge in Linguistic Space

一种在语言空间中捕获组合知识的新方法

Jiahe Wan

机构 * School of Computer Science(计算机科学学院) South-Central Minzu University(西南民族大学)

专题命中 VLM训练与架构 :visual language model(abstract);分类 cs.CV

AI总结 提出YUKINO方法,通过文本反转和“no”逻辑正则化,在无需硬负样本的情况下提升视觉语言模型的组合理解能力,在SugarCREPE基准上超越现有多模态SOTA模型8%以上。

Journal ref Neurocomputing, 2026: 133150

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28561 2026-06-30 cs.RO cs.AI 57%

Fine-Tuning Large Language Models for Cooperative Tactical Deconfliction of Small Unmanned Aerial Systems

为小型无人机系统合作战术解冲突进行大型语言模型微调

Iman Sharifi, Alex Zongo, Peng Wei

机构 * George Washington University(乔治华盛顿大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文研究了利用微调策略使大型语言模型在合作多智能体战术解冲突中做出决策,通过模拟生成数据提升决策准确性与一致性。

Comments 15 pages, 6 figures, to be published in CVPR 2026 Workshop Proceedings

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 1067-1076

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06891 2026-06-30 cs.CV 57%

CLIMP: Contrastive Language-Image Mamba Pretraining

CLIMP:对比语言-图像Mamba预训练

Nimrod Shabtay, Itamar Zimerman, Eli Schwartz, Raja Giryes

机构 * Tel-Aviv University(特拉维夫大学) IBM Research(IBM研究院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 CLIMP是首个全Mamba架构的对比视觉语言模型,通过Mamba替代视觉和文本编码器,提升跨模态检索和鲁棒性,优于CLIP-ViT-B 7.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16413 2026-06-30 cs.CV 57%

BrepLLM: Enabling Large Language Models to Understand Boundary Representations

BrepLLM: 使大语言模型能够理解边界表示

Liyuan Deng, Hao Guo, Yongkang Dai, Yunpeng Bai, Yifan Zhu, Yuanyuan Gao, Huaxi Huang, Yilei Shi

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 BrepLLM通过双阶段训练管道,将B-rep数据转化为图表示并进行语义对齐,实现3D语言生成,展示了在3D物体分类和描述任务中的最佳性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08774 2026-06-30 cs.IR cs.AI 57%

Multimodal Representation Alignment for Cross-modal Information Retrieval

多模态表示对齐用于跨模态信息检索

Fan Xu, Luis A. Leiva

机构 * University of Luxembourg(卢森堡大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 本文研究多模态表示对齐对跨模态检索的影响,通过对比不同度量标准和嵌入空间,发现余弦相似度在对齐任务中表现最佳,同时 Wasserstein 距离提供了分布差异的补充视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30518 2026-06-30 cs.CL 50%

Regime-Aware Peer Specialization for Robust RAG under Heterogeneous Knowledge Conflicts

基于体制感知的同行专业化方法,用于在异构知识冲突下实现稳健的检索增强生成

Bo Wang, Heyan Huang, Yaolin Li, Yanghao Zhou, Jiahao Teng, Ziyi Yang, Ge Shi, Chong Feng

机构 * School of Computer Science, Beijing Institute of Technology(北京理工大学计算机科学学院)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 提出RAPS-DA框架,通过样本级三体制划分(接地、仲裁、抵抗)和token级双选择器,解决RAG中异构知识冲突问题,在固定模型规模下超越多种基线。

Comments Working in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30093 2026-06-30 cs.CL cs.IR 50%

Efficient Retrieval-Augmented Generation via Token Co-occurrence Graphs

基于Token共现图的高效检索增强生成

Gianluca Bonifazi, Christopher Buratti, Michele Marchetti, Federica Parlapiano, Giulia Quaglieri, Davide Traini, Domenico Ursino, Luca Virgili

机构 * Università Politecnica delle Marche(波尔蒂纳拉理工大学) Università di Modena e Reggio Emilia(摩德纳和雷焦艾米利亚大学)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 提出TIGRAG框架,利用滑动窗口共现统计构建Token共现知识图谱,结合图语义扩展和神经重排序实现多跳推理,在三个QA基准上优于稠密检索和图RAG方法,同时降低索引和推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29660 2026-06-30 physics.hist-ph astro-ph.CO hep-ph hep-th 50%

What Naturalness Measures: Fine-Tuning and Informational Invariants in Cosmology and Dark Matter

自然性衡量什么:宇宙学和暗物质中的微调与信息不变量

Stefano Profumo

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本文论证自然性不是客观概率或审美偏好,而是参数到可观测量映射的普适类,构成信息不变量;通过引力与暗物质候选者分析,展示微调追踪丰度映射的解析结构而非候选者性质。

Comments Follows companion papers 2606.21586 (Cosmology as Representation: Informational Invariance and the Limits of Scientific Realism) and 2606.12775 (Are Primordial Black Holes a Natural Dark Matter Candidate?). Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 4 篇

2506.05121 2026-06-30 cs.CL cs.SD eess.AS 67%

The NTNU System at the S&I Challenge 2025 SLA Open Track

NTNU系统在S&I挑战2025 SLA开放赛道中的表现

Hong-Yun Lin, Tien-Hong Lo, Yu-Hsuan Fang, Jhen-Ke Lin, Chung-Chun Wang, Hao-Chien Lu, Berlin Chen

机构 * National Taiwan Normal University(国立台湾师范大学) Department of Computer Science and Information Engineering(计算机科学与信息工程系) Institute of AI Interdisciplinary Applied Technology(人工智能跨学科应用技术研究所)

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract)

AI总结 本文提出整合W2V与Phi-4多模态大语言模型的系统,通过分数融合策略提升SLA评估性能,在Speak & Improve Challenge 2025中取得第二名,RMSE为0.375。

Comments submitted to the ISCA SLaTE-2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29888 2026-06-30 cs.LG cs.CV 62%

Same Concept, Different Directions: Cross-Modal Feature Heterogeneity in Sparse Autoencoders

同一概念,不同方向:稀疏自编码器中的跨模态特征异质性

Chungpa Lee, Jihoon Kwon, Kyle Min, Jy-yong Sohn

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 发现视觉-语言模型中同一概念在不同模态下的特征方向不一致(跨模态特征异质性),并提出训练模态特定稀疏自编码器后对齐对应特征的方法,提升重建保真度和跨模态检索与概念引导性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12282 2026-06-30 cs.CV cs.AI 62%

CytoCLIP: Learning Cytoarchitectural Characteristics in Developing Human Brain Using Contrastive Language Image Pre-Training

CytoCLIP:利用对比语言图像预训练学习发育人类大脑的细胞架构特征

Pralaypati Ta, Sriram Venkatesaperumal, Keerthi Ram, Mohanasankar Sivaprakasam

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 CytoCLIP通过对比语言图像预训练框架学习人类大脑细胞架构特征,通过低分辨率和高分辨率模型变体实现区域分类和跨模态检索,实验表明其在整体区域和高分辨率图像分类中表现优异。

Journal ref Neuroinformatics, Volume 24, article number 38 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28697 2026-06-30 cs.CV cs.CL 57%

Mitigating Batch Effects in Histopathology via Language-Mediated Robust Embedding Generation

通过语言介导的鲁棒嵌入生成减轻组织病理学中的批次效应

Yishu Zhang, Shushan Wu, Zhenzhong Zhang, Didong Li, Huaxiu Yao, Yun Li, Iain Carmichael, Katherine A. Hoadley, Hongtu Zhu, Di Wu, Daiwei Zhang

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 提出GLMP框架,利用通用多模态大语言模型将组织学图像转化为文本表示,再生成数值嵌入,有效抑制批次效应,提升跨机构泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏