arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-06 至 2026-08-06 共收录 14 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 14 篇

2608.04548 2026-08-06 cs.LG cs.AI 新提交 91%

A Model Merging Approach for Continual MLLM Unlearning

面向持续多模态大语言模型(MLLM)遗忘的模型合并方法

Yuhang Wang, Linlin Zhang, Haoxuan Ji, Xianmin Ye, Zhenxing Niu, Haichang Gao

专题命中 VLM训练与架构 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 针对现有MLLM遗忘方法无法应对持续场景的问题,本文提出MCU方法,通过动态合并遗忘适配器缓解跨任务依赖的干扰,在多个基准测试中实现了更优的遗忘效果与知识保留。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04454 2026-08-06 cs.CV cs.LG 新提交 89%

Beyond Global Routing Aggregation: Phase-Aware Expert Merging for MoE Vision-Language Models

超越全局路由聚合:面向MoE视觉-语言模型的阶段感知专家合并

Hongyu Zhang, Cheng Yan, Xiang Xia, Wuyang Zhang

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 针对MoE-VLM全局路由聚合导致专家角色混淆的问题,提出无需训练的RoleMerge方法,通过阶段归一化路由统计合并专家,在匹配专家保留比例下性能优于现有方法,六任务宏平均相对提升最高9.6%。

Comments 17 pages, 3 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04791 2026-08-06 cs.CV 新提交 89%

On the Effectiveness of Adaptation Strategies for VLM-Based Federated Learning in Remote Sensing

遥感领域基于视觉语言模型的联邦学习中适配策略的有效性研究

Simon Lösche, Barış Büyüktaş, Mathis Adler, Angelos Zavras, Ioannis Papoutsis, Begüm Demir

机构 * BIFOLD - Berlin Institute for the Foundations of Learning and Data(BIFOLD - 柏林学习与数据基础研究所) Technische Universität Berlin(柏林工业大学) National Technical University of Athens(雅典国家技术大学) National Observatory of Athens(雅典国家天文台) Harokopio University of Athens(哈罗科皮奥雅典大学)

专题命中 VLM训练与架构 :VLM(title,summary_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文针对遥感图像分类场景,首次对比全微调、LoRA等四种VLM适配策略在联邦学习中的表现,给出不同约束下的策略选择指南。

Comments Accepted at the SPIE Artificial Intelligence and Image and Signal Processing for Remote Sensing, Edinburgh, Scotland, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04504 2026-08-06 cs.CV cs.AI 新提交 86%

GeoReward: Mitigating Contextual Variable Overestimation in Vision-Language Models for Cross-Market Preference Prediction

GeoReward:缓解跨市场偏好预测的视觉语言模型中的上下文变量高估问题

Shuo Liu, Huixiang Cai, Weiru Zhang, Xiaoyi Zeng

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本研究针对视觉语言模型的上下文变量高估问题,提出GeoReward奖励模型,通过三种机制缓解该偏差,在跨市场广告偏好预测任务中性能优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04132 2026-08-06 cs.CV 新提交 84%

RUTA: Principled Visual Token Allocation via Rate-Utility Optimization

RUTA:基于率-效用优化的原则性视觉令牌分配方法

Jian Zou, Xiaoyu Xu, Zhihua Wang, Yilin Wang, Balu Adsumilli, Kede Ma

机构 * City University of Hong Kong(香港城市大学) Google Inc.(谷歌公司)

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 针对视觉语言模型因长视觉令牌序列导致的LLM侧计算和内存成本过高问题,提出RUTA方法,仅用2.0%、4.2%的视觉令牌,分别在LLaVA-NeXT-7B、Qwen3-VL-8B上保留88.2%、94.4%的任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00684 2026-08-06 cs.LG 版本更新 83%

AdaBoosting Text Prompts for Vision-Language Models

AdaBoosting 文本提示用于视觉-语言模型

Seokhee Jin, Changhwan Sung, Sunung Mun, Hoyoung Kim, Jungseul Ok

机构 * KT Corporation(KT公司) Pohang University of Science and Technology (POSTECH)(浦项科技大学) National AI Research Lab(国家人工智能研究实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.LG

AI总结 提出文本提示提升(TPB)框架,通过AdaBoost策略将每个文本提示分类器视为弱学习器,顺序集成以聚焦难分类样本,提升少样本分类精度并实现跨模型迁移。

Comments Accepted to ECCV 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04496 2026-08-06 cs.CV cs.LG 新提交 81%

DIVE: Dynamic Iterative Visual Evidence Construction for Efficient Vision-Language Models

DIVE:面向高效视觉-语言模型的动态迭代视觉证据构建

Chen Zhong, Xiao An, Zijie Wang, Jiepan Li, Guangyi Yang, Wei He

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本研究针对视觉-语言模型中视觉token导致的推理瓶颈,提出无需训练的DIVE框架,通过动态迭代构建视觉证据,在减少88.9%视觉token的同时保留98.2%的平均性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01207 2026-08-06 cs.CV cs.AI 版本更新 79%

It's the Decoding Format, Not the Perturbation: Auditing Consistency-Based Selection for Vision-Language Test-Time Scaling

是解码格式,而非扰动:审计视觉语言模型测试时扩展的基于一致性的选择

Puzhuo Zheng, Hasan Kurban

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究发现视觉语言模型测试时的选择效果由解码格式而非扰动决定,提出的扰动基选择(Pgs)在控制格式后无显著收益,说明其无法作为有效选择信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04554 2026-08-06 cs.CL cs.CV 新提交 77%

Representing Visual Evidence for Item Difficulty Prediction: Visual Textualization and Image-Native Modeling

为题目难度预测表征视觉证据:视觉文本化与原生图像建模

Han Chen, Ming Li, Hong Jiao, Tianyi Zhou

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Maryland(马里兰大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文针对题目难度预测的视觉证据表征问题,对比仅用文本、视觉文本化与原生图像建模三种方式,发现原生图像建模是有竞争力的替代方案,其有效性取决于VLMs的适配方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21343 2026-08-06 cs.CV 版本更新 70%

Latent Denoising Improves Visual Alignment in Large Multimodal Models

潜在去噪提升大多模态模型的视觉对齐

Dhruv Parikh, Jacob Fein-Ashley, Rajgopal Kannan, Viktor Prasanna

机构 * University of Southern California(南加州大学) DEVCOM ARL Army Research Office(DEVCOM ARL陆军研究办公室)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出通过潜在去噪框架改进大多模态模型的内部视觉特征对齐和多模态理解,采用掩码和高斯噪声混合腐蚀视觉token,并利用解码器恢复教师特征,提升模型在分布偏移下的鲁棒性。

Comments ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04610 2026-08-06 cs.CV 新提交 57%

HiSC: Hierarchical Spatial Clustering Token Compression for Efficient 3D Scene Understanding

HiSC:用于高效3D场景理解的分层空间聚类令牌压缩

Jiuhe Qu, Yingping Liang, Ying Fu

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出无训练框架HiSC,通过SGraM策略和SCluP范式实现3D VLMs的分层空间聚类令牌压缩,在高剪枝率下实现超90%令牌减少且性能下降极小,验证了其有效性。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04483 2026-08-06 cs.CV 新提交 57%

Not All Redundant Tokens Are Alike: Analyzing Visual Token Pruning through Token Roles

并非所有冗余视觉标记都相同:通过标记角色分析视觉标记剪枝

Hyeonyu Kim, Sehwan Lim, Youngwon Choi, Taeyoun Kwon, Jaejin Kim

机构 * Maum AI Inc.(Maum AI公司)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本研究针对视觉-语言模型(VLMs)的视觉标记剪枝问题,通过EmbedLens分析标记角色,发现代表性剪枝方法存在标记角色偏差但与下游性能无直接关联,优化角色分配后表明保留非活跃标记可维持或提升性能,为剪枝方法优化提供了新视角。

Comments Accepted to ECCV 2026 workshop, UniWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04351 2026-08-06 cs.SD cs.AI 新提交 57%

HyPASE: Hyperbolic Geometry for Parameter-Efficient Speech Emotion Fine-Tuning Framework for Large Audio-Language Models

HyPASE:用于大音频语言模型的参数高效语音情感微调框架的双曲几何方法

Tian Jin, Ruikang Zhang, Zefeng Zhao, Ding Luo, Jin Zeng

机构 * Tongji University(同济大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出HyPASE双曲PEFT框架,利用庞加莱球模型及HGA、EMCA组件,在MELD、IEMOCAP等数据集上优于欧氏PEFT基线,实现高效的大音频语言模型语音情感微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06024 2026-08-06 q-bio.QM cs.AI 交叉投稿 57%

TourSynbio-Search: A Large Language Model Driven Agent Framework for Unified Search Method for Protein Engineering

TourSynbio-Search:一种用于蛋白质工程的统一搜索方法的大语言模型驱动智能体框架

Yungeng Liu, Zan Chen, Yu Guang Wang, Yiqing Shen

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

AI总结 TourSynbio-Search是TourSynbio-7B驱动的双模块搜索智能体框架,可跨多平台检索文献与蛋白质数据,降低技术门槛,提升蛋白质工程研究的信息检索效率与生产力

详情

展开后加载摘要…

URL PDF HTML 收藏