arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-02 至 2026-06-02 共收录 39 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 39 篇

2606.00909 2026-06-02 cs.CL cs.AI 94%

MLLM-Microscope: Unlocking Hidden Structure Within Multimodal Large Language Models

MLLM-Microscope:解锁多模态大语言模型中的隐藏结构

Ravil Mussabayev, Rustam Mussabayev

机构 * Satbayev University(萨特拜耶夫大学)

专题命中 VLM训练与架构 :MLLM(title,title_cn);LLaVA(summary_cn,abstract);multimodal large language model(title,abstract);分类 cs.AI

AI总结 提出MLLM-Microscope系统,通过分析线性度、内在维度和各向异性,揭示多模态大语言模型中隐藏的表示结构,并基于ScienceQA数据集评估LLaVA-NeXT和OmniFusion,发现模态融合方式显著影响模型内部工作机理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28995 2026-06-02 cs.CV 91%

GAP3D: Generative Alignment of VLM Latents to Patch-Level Embeddings for 3D Generation

GAP3D: 将VLM潜在表示与补丁级嵌入进行生成式对齐以实现3D生成

Polytimi Anna Gkotsi, Andrii Zadaianchuk, Mohammad Mahdi Derakhshani

机构 * Polytimi Anna Gkotsi Andrii Zadaianchuk Mohammad Mahdi Derakhshani

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出GAP3D,一种基于扩散的模块化方法,将VLM生成的潜在表示直接对齐到预训练图像编码器的完整补丁级特征空间,使冻结的下游生成模型能够利用VLM作为提示编码器,同时保持空间结构化的条件信号,在3D资产生成中无需大规模3D数据训练,并展现出多模态提示的零样本能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11832 2026-06-02 cs.AI cs.LG 90%

Safety Mirage: How Spurious Correlations Undermine VLM Safety Fine-Tuning and Can Be Mitigated by Machine Unlearning

安全幻象:虚假相关性如何破坏VLM安全微调及通过机器遗忘缓解

Yiwei Chen, Yuguang Yao, Yihua Zhang, Bingquan Shen, Gaowen Liu, Sijia Liu

机构 * Michigan State University(密歇根州立大学) National University of Singapore(新加坡国立大学) Cisco Research(思科研究)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision language model(abstract);分类 cs.AI、cs.LG

AI总结 本文发现视觉语言模型(VLM)的安全微调存在“安全幻象”,即虚假相关性导致脆弱性,并提出机器遗忘作为替代方案,显著降低攻击成功率和不必要拒绝。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02276 2026-06-02 cs.CV cs.AI cs.CL cs.LG 89%

Cross-modal linkage risk in clinical vision-language models

临床视觉-语言模型中的跨模态链接风险

Soroosh Tayebi Arasteh, Mahshad Lotfinia, Sven Nebelung, Daniel Truhn

机构 * Lab for AI in Medicine(医学人工智能实验室) RWTH Aachen University(亚琛工业大学) Department of Diagnostic and Interventional Radiology(诊断与介入放射学部门)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 研究临床视觉-语言模型(VLM)在图像与报告分离场景下通过余弦相似度实现跨模态重链接的风险,并采用仅对投影头进行差分隐私微调的方法在保持图像效用同时显著降低重链接率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01756 2026-06-02 cs.CV 89%

EvoCut: Multi-Layer Evolution-Aware Visual Token Compression for Efficient Large Vision-Language Models

EvoCut:面向高效大型视觉语言模型的多层演化感知视觉标记压缩

Hongyu Lu, Feng Zhang, Wenwei Jin, Huanling Hu, Pengfei Zhang, Yao Hu, Jiawei Li, Shikai Jiang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Xiaohongshu(小红书) Fudan University(复旦大学)

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV

AI总结 提出一种无需训练和注意力的视觉标记压缩方法EvoCut,通过分析多层演化偏差估计标记重要性,在LLaVA-1.5-7B上仅保留11.1%的视觉标记即可保持94.4%的平均性能。

Comments Preprint. 12 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13178 2026-06-02 cs.CV cs.AI 88%

CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models

CLIP Tricks You: 面向大型视觉-语言模型中高效像素定位的无训练令牌剪枝

Sangin Lee, Yukyung Choi

机构 * KAIST(韩国科学技术院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 提出LiteLVLM,一种无需训练、文本引导的令牌剪枝策略,通过反转CLIP视觉-文本相似度排序,保留指代区域令牌并恢复上下文令牌,实现高效像素定位推理,在多种令牌预算下性能提升超5%,保持90%原始性能同时加速22%并减少2.3倍内存。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04509 2026-06-02 cs.CL 88%

Model-Dowser: Data-Free Importance Probing to Mitigate Catastrophic Forgetting in Multimodal Large Language Models

Model-Dowser:无数据重要性探测以缓解多模态大语言模型中的灾难性遗忘

Hyeontaek Hwang, Nguyen Dinh Son, Daeyoung Kim

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);multimodal large language model(title,abstract)

AI总结 提出Model-Dowser,一种基于重要性评分的稀疏微调方法,通过联合考虑权重幅度、输入激活和输出敏感性来缓解多模态大语言模型微调中的灾难性遗忘,在LLaVA和NVILA上优于现有方法。

Comments Accepted at ICML 2026. Code link: https://model-dowser.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19496 2026-06-02 cs.CV cs.AI cs.LG 86%

CARES: Context-Aware Resolution Selector for VLMs

CARES: 面向视觉语言模型的上下文感知分辨率选择器

Moshe Kimhi, Nimrod Shabtay, Raja Giryes, Chaim Baskin, Eli Schwartz

机构 * Technion(技术ion大学) IBM Research(IBM研究院) Tel-Aviv University(特拉维夫大学) Ben-Gurion University(本· Gurion大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出CARES轻量级预处理模块,通过紧凑型VLM预测图像-查询对的最小足够分辨率,在保持任务性能的同时最多减少80%计算量。

Comments Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) Accepted to ACL 2026 (Oral presentation). Code available at https://github.com/mkimhi/CARES

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03403 2026-06-02 cs.CV cs.LG 84%

GRPO-TTA: Test-Time Visual Tuning for Vision-Language Models via GRPO-Driven Reinforcement Learning

GRPO-TTA:基于GRPO驱动的强化学习进行视觉语言模型的测试时视觉调优

Yujun Li, Hongyuan Zhang, Yuan Yuan

机构 * School of Artificial Intelligence, Optics and Electronics (iOPEN), Northwestern Polytechnical University(人工智能、光学与电子学院(iOPEN),西北工业大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);vision language model(abstract);分类 cs.CV、cs.LG

AI总结 提出GRPO-TTA方法,将GRPO应用于测试时适应,通过将类特定提示预测重构为组策略优化问题,并设计对齐奖励和分散奖励,在多种基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00871 2026-06-02 cs.CV cs.AI 84%

Benchmarks for Vision-Language Models in Urban Perception Should Be Reliability-Aware and Negotiated

城市感知中的视觉语言模型基准应具备可靠性意识且可协商

Rashid Mushkani

机构 * Rashid Mushkani

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出,用于城市感知的视觉语言模型基准应将分歧和弃权视为测量结果,报告标注者间信度,并将标签空间和评分策略视为可协商的产物。

Comments To appear in the Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30877 2026-06-02 cs.RO 83%

Wall-OSS-0.5 Technical Report

Wall-OSS-0.5 技术报告

Ryan Yu, Pushi Zhang, Starrick Liu, Brae Liu, Miracle Kang, Shalfun Li, Lights Shi, Ellie Ma, Ping Yang, Chris Pan, Jerry Chen, Dongxiu Liu, Rain Sun, Miles Guo, Byron Zhang, Hugo Zhou, Zach Xu, Vincent Chen, Harrison Huang, James Wang, Dance Kuzi, Andy Zhai, Hang Su, Roy Gan, Lucy Liang, Hao Wang, Qian Wang

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);grounding(abstract)

AI总结 本文提出Wall-OSS-0.5,一个基于3B VLM骨干网络并增强动作生成组件的4B开源VLA模型,通过梯度桥接联合训练策略,在超过20个实体上预训练,实现零样本真实机器人行为,并在微调后超越π_0.5,证明VLA预训练本身即可产生可执行的机器人能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02580 2026-06-02 cs.CV 83%

Thinking in Blender: Staged Executable Inverse Graphics with Vision-Language Models

在Blender中思考:基于视觉语言模型的分阶段可执行逆向图形

Guangzhao He, Rundong Luo, Wei-Chiu Ma, Hadar Averbuch-Elor

机构 * Cornell University(康奈尔大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出分阶段可执行逆向图形(SEIG)框架,利用预训练视觉语言模型直接从单张图像重建可编辑的Blender程序,无需专用基础模型或可微渲染,通过逐步细化几何、材质、组合和光照提升重建保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02273 2026-06-02 cs.CV 83%

Vision-language Models for Driver Monitoring Systems: A Driver Activity Description Dataset

用于驾驶员监控系统的视觉语言模型:一个驾驶员活动描述数据集

David J. Lerch, Sarath Mulugurthi, Manuel Martin, Frederik Diederichs, Rainer Stiefelhagen

机构 * Fraunhofer IOSB(弗劳恩霍夫智能系统研究所) Technische Hochschule Ingolstadt(图林根工业大学) Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院)

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文通过创建Drive&Act数据集的详细自然语言版本,评估并微调视觉语言模型,以提升对驾驶员细微动作的识别能力,微调后的模型在跨数据集评估中表现更优。

Comments Accepted at IEEE ITSC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00415 2026-06-02 astro-ph.GA astro-ph.IM 82%

Vision-Language Model Ensembles Achieve Human-Expert Accuracy for Galaxy Merger Classification

视觉-语言模型集成达到人类专家精度的星系合并分类

Marco Chiaberge, Elias Stengel-Eskin, Massimo Stiavelli, Colin Norman

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract,abstract_cn)

AI总结 本研究通过贝叶斯统计框架集成15种视觉-语言模型配置,在星系合并形态分类中达到与训练有素的人类专家相当的准确率(83.3%),并恢复了合并分数。

Comments This work used LLMs as research assistants for code development, statistical analysis, and drafting under close human supervision; the workflow is described in Appendix A. Submitted to the Astronomical Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26292 2026-06-02 cs.CV cs.CL 79%

Evi-Steer: Learning to Steer Biomedical Vision-Language Models through Efficient and Generalizable Evidential Tuning

Evi-Steer:通过高效且可泛化的证据调优学习引导生物医学视觉-语言模型

Taha Koleilat, Hassan Rivaz, Yiming Xiao

机构 * Concordia University(康科迪亚大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 提出Evi-Steer框架,通过证据跨模态低维引导实现BiomedCLIP的不确定性感知参数高效微调,仅更新0.11%参数,在15个生物医学数据集上少样本学习和域泛化设置中优于现有方法。

Comments MICCAI 2026 Early Accept; Project Page: https://tahakoleilat.github.io/Evi-Steer. This preprint has not undergone peer review or any post-submission improvements or corrections. The Version of Record of this contribution will be published as part of the MICCAI 2026 proceedings in October

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22276 2026-06-02 cs.CV cs.CL 79%

WAON: A Large-Scale Japanese Image-Text Dataset for Cultural Adaptation in Contrastive Vision-Language Models

WAON:用于对比视觉语言模型文化适应的大规模日语图像-文本数据集

Issa Sugiura, Shuhei Kurita, Yusuke Oda, Daisuke Kawahara, Yasuo Okabe, Naoaki Okazaki

机构 * Kyoto University(京都大学) NII LLMC(日本国家研究所语言模型中心) NII(日本国家研究所) Waseda University(早稻田大学) Institute of Science Tokyo(东京科学研究所)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 提出WAON,一个从Common Crawl构建的包含约1.55亿样本的最大公开原生日语图像-文本数据集,并通过微调实验证明其在日语文化基准上优于翻译数据。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06033 2026-06-02 cs.LG 79%

Can Vision Language Models Learn Intuitive Physics from Interaction?

视觉语言模型能否从交互中学习直观物理?

Luca M. Schulze Buschoff, Konstantinos Voudouris, Can Demircan, Eric Schulz

专题命中 VLM训练与架构 :vision language model(title,abstract);分类 cs.LG

AI总结 研究通过强化学习与环境交互训练视觉语言模型,发现交互学习能提升任务内性能,但无法产生可泛化的物理直觉。

Comments Updated accepted version for ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07617 2026-06-02 cs.CV 79%

Scaling Pre-training to One Hundred Billion Data for Vision Language Models

将视觉语言模型的预训练扩展到一千亿数据

Xiao Wang, Ibrahim Alabdulmohsin, Daniel Salz, Zhe Li, Keran Rong, Xiaohua Zhai

机构 * Google DeepMind(谷歌DeepMind)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.CV

AI总结 本文通过实验探究将视觉语言模型预训练数据扩展到一千亿规模的效果,发现传统基准性能饱和,但文化多样性任务和低资源语言受益显著,并指出质量过滤可能减少文化多样性。

Comments v2: CVPR Findings'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01710 2026-06-02 cs.CV cs.LG 79%

Density-Aware Translation of Spurious Correlations in Zero-Shot VLMs

零样本VLM中虚假相关性的密度感知转换

Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie, Sarah Erfani

机构 * School of Computing and Information Systems, The University of Melbourne, Victoria, Australia(计算与信息系统学院,墨尔本大学,维多利亚,澳大利亚)

专题命中 VLM训练与架构 :VLM(title_cn);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 提出密度感知转换(DAT)方法,利用局部几何密度项修正图像-文本相似度,以缓解CLIP等视觉语言模型在零样本分类中因虚假相关性导致的性能下降。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01503 2026-06-02 cs.CV cs.AI cs.CL 79%

On the Limits of Token Reduction for Efficient Unified Vision Language Training

论高效统一视觉语言训练中令牌缩减的极限

Siyi Chen, Weiming Zhuang, Jingtao Li, Lingjuan Lv

机构 * University of Michigan(密歇根大学) Sony AI(索尼人工智能)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文通过分析层注意力分配,发现视觉理解与视觉生成在令牌冗余上存在不对称性,设计任务特定加速器,但统一训练中任务特定令牌丢弃导致协同损失,表明高效统一建模需保留共享跨任务结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00390 2026-06-02 cs.CV cs.AI 79%

Zamba2-VL Technical Report

Zamba2-VL 技术报告

Hassan Shapourian, Kasra Hejazi, Olabode M. Sule, Beren Millidge

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Washington(华盛顿大学) University of Toronto(多伦多大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出基于混合架构Zamba2的视觉语言模型Zamba2-VL,在图像理解等基准上媲美Transformer模型,且首次令牌延迟降低约一个数量级。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04094 2026-06-02 cs.CV 77%

VideoBrain: Learning Adaptive Frame Sampling for Long Video Understanding

VideoBrain: 学习自适应帧采样以理解长视频

Junbo Zou, Ziheng Huang, Shengjie Zhang, Liwen Zhang, Weining Shen

机构 * Stanford University(斯坦福大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出VideoBrain框架,通过CLIP和均匀采样双智能体策略,使视觉语言模型自适应获取关键帧,在减少30-40%帧数的同时提升长视频理解准确率3.5%-9.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14134 2026-06-02 cs.CV cs.AI cs.LG 75%

DenseMLLM: Standard Multimodal LLMs for Dense Prediction

DenseMLLM:用于密集预测的标准多模态大语言模型

Yi Li, Hongze Shen, Lexiang Tang, Xin Li, Xinpeng Ding, Yinsong Liu, Deqiang Jiang, Xing Sun, Xiaomeng Li

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology, Hong Kong, China(香港科技大学电子与计算机工程系) Tencent, Youtu-Lab, China(腾讯优图实验室)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出DenseMLLM,通过标准多模态大语言模型架构和视觉令牌监督策略,无需任务特定解码器即可实现语义分割、深度估计等密集预测任务,在多个基准上取得竞争性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02161 2026-06-02 cs.CV cs.CL 70%

InfoMerge: Information-aware Token Compression for Efficient Video Large Language Models

InfoMerge: 信息感知的令牌压缩用于高效视频大语言模型

Xinxin Liu, Shiwei Gan, Xiao Liu, Yafeng Yin, Lei Xie, Sanglu Lu

机构 * State Key Laboratory of Novel Software Technology(新型软件技术国家重点实验室)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.CV

AI总结 提出InfoMerge,一种无需训练的视觉令牌压缩方法,通过鲁棒冗余估计和内容感知预算分配,在减少85%视觉令牌的同时保持98.8%性能,实现4.24倍预填充加速。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00535 2026-06-02 cs.LG 70%

DREAM-S: Speculative Decoding with Searchable Drafting and Target-Aware Refinement for Multimodal Generation

DREAM-S: 基于可搜索草稿与目标感知精炼的推测解码用于多模态生成

Zining Liu, Yunhai Hu, Tianhua Xia, Bo Bao, Eric Sather, Vithursan Thangarasa, Sai Qian Zhang

机构 * New York University(纽约大学) Cerebras Systems Inc.(Cerebras Systems公司) University of Pennsylvania(宾夕法尼亚大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.LG

AI总结 提出DREAM-S框架,通过神经架构搜索和目标感知超网训练自动优化草稿模型架构与交互策略,结合注意力熵引导的自适应中间特征蒸馏,实现视觉语言模型的高效推测解码,加速比达3.85倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20861 2026-06-02 cs.IR cs.AI 70%

Deep Interest Mining for Intent-Enriched Semantic IDs in Multimodal Generative Recommendation

面向多模态生成式推荐中意图增强语义ID的深度兴趣挖掘

Yangchen Zeng, Jinze Wang

机构 * Amazon(亚马逊)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出DeepInterestGR框架,通过视觉线索和意图描述符丰富量化前的物品表示,并结合相关性门控语义奖励,提升基于语义ID的生成式推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18340 2026-06-02 cs.CV 70%

Beyond Rigid: Benchmarking Non-Rigid Video Editing

超越刚性:非刚性视频编辑基准测试

Bingzheng Qu, Xuefeng Bai, Kehai Chen, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳))

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出NRVBench诊断基准,通过物理感知评估框架揭示传统指标在非刚性视频编辑中的不足,并引入VM-Edit基线分析稳定性-可塑性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01901 2026-06-02 cs.CV cs.AI cs.CL 62%

The Image Reconstruction Game: Drawing Common Ground Through Iterative Multimodal Dialogue

图像重建游戏:通过迭代多模态对话建立共同基础

Sherzod Hakimov, Mattia D'Agostini, Ivan Samodelkin, David Schlangen

机构 * Computational Linguistics, Department of Linguistics University of Potsdam(波恩大学语言学系计算语言学部) German Research Center for Artificial Intelligence (DFKI), Berlin(德国人工智能研究中心(DFKI)柏林)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出图像重建游戏基准,通过多轮迭代中视觉语言模型向图像生成器发出纠正指令,使累积的共同基础直接可视化为重建图像,发现描述器是重建质量的主导因素,而生成器决定迭代改进的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01207 2026-06-02 cs.CV cs.LG 62%

Feature Alignment Determines Fusion Strategy: A Comparative Study of Cross-Attention and Concatenation in Multimodal Learning

特征对齐决定融合策略:多模态学习中交叉注意力与拼接的比较研究

Zhiqiang Zhou, Xuezhen Xie

机构 * Hunan Chemical Industry Vocational and Technical College(湖南化学工业职业技术学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 通过实验和理论分析,证明特征对齐质量而非数据规模是决定多模态融合策略优劣的关键因素,当特征预对齐时拼接优于交叉注意力。

Comments 8 pages,6 figures,4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02997 2026-06-02 cs.LG cs.CV 62%

From Memorization to Creativity: LLM as a Designer of Novel Neural Architectures

从记忆到创造:LLM作为新型神经架构的设计者

Waleed Khalid, Dmitry Ignatov, Radu Timofte

机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg, Germany(计算机视觉实验室,CAIDAS与IFI,乌尔姆大学,德国)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出NNGPT框架,通过闭环架构合成流水线,利用代码型LLM的监督微调循环,结合MinHash-Jaccard新颖性过滤和低保真性能信号,迭代提升生成架构的有效性、性能和多样性,实现从记忆到创造的转变。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), pp. 3252-3261, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏