arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-24 至 2026-03-24 共收录 16 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 16 篇

2603.21584 2026-03-24 cs.LG cs.CV 84%

SSAM: Singular Subspace Alignment for Merging Multimodal Large Language Models

SSAM:奇异子空间对齐用于融合多模态大语言模型

Md Kaykobad Reza, Ameya Patil, Edward Ayrapetian, M. Salman Asif

机构 * University of California Riverside(加州大学河滨分校) Amazon(亚马逊)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.LG

AI总结 SSAM通过参数空间对齐融合多模态大语言模型,无需训练数据实现跨模态统一,提升性能并降低资源消耗。

Comments 25 Pages, 9 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21105 2026-03-24 cs.LG 83%

ResPrune: Text-Conditioned Subspace Reconstruction for Visual Token Pruning in Large Vision-Language Models

ResPrune:基于文本的子空间重建用于大视觉-语言模型中的视觉令牌修剪

Xu Li, Yi Zheng, Yuxuan Liang, Zhe Liu, Xiaolei Chen, Haotian Chen, Rui Zhu, Xiangyang Xue

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.LG

AI总结 ResPrune通过子空间重建方法实现视觉令牌修剪,结合文本相关性选择信息量大的令牌,提升大视觉-语言模型推理效率,减少计算和内存开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16065 2026-03-24 cs.RO cs.AI 79%

Large Reward Models: Generalizable Online Robot Reward Generation with Vision-Language Models

大奖励模型:基于视觉-语言模型的通用在线机器人奖励生成

Yanru Wu, Weiduo Yuan, Ang Qi, Vitor Guizilini, Jiageng Mao, Yue Wang

机构 * USC Physical Superintelligence Lab(USC物理超智能实验室) Toyota Research Institute(丰田研究院)

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract);分类 cs.AI

AI总结 本文提出利用视觉-语言模型生成通用在线机器人奖励,通过零样本方式提升策略学习效率,实验显示在30次迭代内显著提高初始策略成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15093 2026-03-24 eess.SP cs.IT math.IT 78%

Beam Prediction Based on Multimodal Large Language Models

基于多模态大语言模型的波束预测

Tianhao Mao, Le Liang, Jie Yang, Xiao Li, Shi Jin, Geoffrey Ye Li

专题命中 VLM训练与架构 :multimodal large language model(title,abstract)

AI总结 本文提出基于多模态大语言模型的波束预测框架,通过融合RGB图像和LiDAR点云等异构数据,提升动态环境下波束预测精度与通信性能,实验表明其在波束准确性和通信性能上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20697 2026-03-24 cs.CV cs.AI 73%

Satellite-to-Street: Synthesizing Post-Disaster Views from Satellite Imagery via Generative Vision Models

卫星到街道:通过生成视觉模型从卫星图像合成灾害后视角

Yifan Yang, Lei Zou, Wendy Jepson

机构 * Department of Geography Texas A\&M University(地理系德克萨斯农工大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过生成视觉模型从卫星图像合成灾害后街道视角的方法,对比了基于VLM和MoE的生成策略,揭示了高现实感生成与结构信息保留之间的平衡问题。

Comments Accepted for presentation at IGARSS 2026 (IEEE International Geoscience and Remote Sensing Symposium)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20422 2026-03-24 cs.CV cs.AI cs.IR 73%

PEARL: Personalized Streaming Video Understanding Model

PEARL:个性化流视频理解模型

Yuanhong Zheng, Ruichuan An, Xiaopeng Lin, Yuxing Liu, Sihan Yang, Huanyu Zhang, Haodong Li, Qintong Zhang, Renrui Zhang, Guopeng Li, Yifan Zhang, Yuheng Li, Wentao Zhang

机构 * Peking University(北京大学) Adobe CASIA Stepfun CUHK(香港中文大学) Zhongguancun Academy(中关村学院)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出个性化流视频理解任务PSVU,并引入PEARL-Bench基准测试,通过帧级和视频级两种模式评估模型对个性化概念的响应能力,提出无需训练的PEARL策略,实现先进性能。

Comments Arxiv Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22165 2026-03-24 cs.CV 70%

ACPO: Counteracting Likelihood Displacement in Vision-Language Alignment with Asymmetric Constraints

ACPO: 通过不对称约束对抗视觉-语言对齐中的似然位移

Kaili Huang, Hongming Zhang, Rui Shen, Linjun Dai, Jiahao Wang, Hanming Deng, Lewei Lu

机构 * SenseTime Research(商汤科技研究院)

专题命中 VLM训练与架构 :vision-language model(abstract);InternVL(abstract);分类 cs.CV

AI总结 ACPO通过动态目标导向缩放解决视觉-语言对齐中的似然位移问题,通过不对称抑制拒绝项梯度流,防止视觉锚点坍塌,提升多模态任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13232 2026-03-24 cs.CV cs.AI 62%

What "Not" to Detect: Negation-Aware VLMs via Structured Reasoning and Token Merging

不应检测什么:通过结构化推理和标记合并的否定意识VLMs

Inha Kang, Youngsun Lim, Seonho Lee, Jiho Choi, Junsuk Choe, Hyunjung Shim

机构 * KAIST AI(韩国科学技术院人工智能实验室) Boston University(波士顿大学) Sogang University(成均馆大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CoVAND数据集和NegToMe模块,通过结构化推理和标记合并解决VLMs的否定理解问题,提升检测任务的准确率和泛化能力。

Comments 56 pages

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21232 2026-03-24 cs.CV cs.AI 62%

QMoP: Query Guided Mixture-of-Projector for Efficient Visual Token Compression

QMoP:基于查询的混合投影器用于高效的视觉令牌压缩

Zhongyang Li, Yaqian Li, Faming Fang, Rinyoichi Takezoe, Zi-Hao Bo, Cheng Qian, Mo Guang, Guixu Zhang, Kaiwen Long

机构 * East China Normal University(华东师范大学) Li Auto Inc(Li汽车公司)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出QMoP框架,通过三种协作分支实现视觉令牌的自适应压缩,结合查询引导路由和专家融合机制,提升效率并减少资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17655 2026-03-24 cs.CV cs.AI 62%

Interpretable Cross-Domain Few-Shot Learning with Rectified Target-Domain Local Alignment

可解释的跨领域少样本学习与修正的目标域局部对齐

Yaze Zhao, Yixiong Zou, Yuhua Li, Ruixuan Li

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CC-CDFSL方法,通过循环一致性解决CLIP-based CDFSL中的局部对齐问题,提升局部视觉语言对齐和可解释性,实现SOTA性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22276 2026-03-24 cs.LG stat.ML 57%

Scaling DoRA: High-Rank Adaptation via Factored Norms and Fused Kernels

DoRA的扩展:通过因子范数和融合内核进行高秩适应

Alexandra Zelenin, Alexandra Zhuravlyova

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

AI总结 本文提出通过因子范数和融合内核实现高秩适应,减少内存占用并提升计算效率,适用于大规模视觉-语言模型。

Comments 30 pages, 15 figures, 15 tables, including appendices. Code and data at https://github.com/sockeye44/dorafactors

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21504 2026-03-24 cs.CV 57%

Parameter-efficient Prompt Tuning and Hierarchical Textual Guidance for Few-shot Whole Slide Image Classification

高效参数提示调优与层次文本引导在少样本整张滑片图像分类中的应用

Jayanie Bogahawatte, Sachith Seneviratne, Saman Halgamuge

机构 * AI, Optimization and Pattern Recognition Research Group(人工智能、优化与模式识别研究组) Dept. of Mechanical Eng., University of Melbourne, Australia(墨尔本大学机械工程系,澳大利亚)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出高效参数提示调优和层次文本引导方法,以解决少样本整张滑片图像分类中的计算成本和信息损失问题,实验显示在乳腺、肺癌和卵巢癌数据集上均取得显著提升。

Comments Accepted for publication at CVPR 2026 Workshop on Medical Reasoning with Vision Language Foundation Models (Med-Reasoner)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19610 2026-03-24 cs.CV 57%

ParallelVLM: Lossless Video-LLM Acceleration with Visual Alignment Aware Parallel Speculative Decoding

ParallelVLM: 无损视频-大语言模型加速与视觉对齐感知并行推测解码

Quan Kong, Yuhao Shen, Yicheng Ji, Huan Li, Cong Wang

机构 * Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

AI总结 ParallelVLM通过并行化阶段和无偏验证器引导剪枝策略,有效提升视频理解任务的解码效率,实现3.36倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21010 2026-03-24 cs.CV 57%

SkinCLIP-VL: Consistency-Aware Vision-Language Learning for Multimodal Skin Cancer Diagnosis

SkinCLIP-VL: 一种面向多模态皮肤癌诊断的一致性感知视觉-语言学习框架

Zhixiang Lu, Shijie Xu, Kaicheng Yan, Xuyue Cai, Chong Zhang, Yulong Li, Angelos Stefanidis, Anh Nguyen, Jionglong Su

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) University of Liverpool(利物浦大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出SkinCLIP-VL,通过冻结感知与自适应推理范式,结合CLIP编码器与轻量量化Qwen2.5-VL,引入一致性聚焦对齐损失,实现高效皮肤癌诊断,优于13B参数基线模型,参数更少且临床信任度更高。

Comments Accepted by 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20731 2026-03-24 cs.CV 57%

VSD-MOT: End-to-End Multi-Object Tracking in Low-Quality Video Scenes Guided by Visual Semantic Distillation

VSD-MOT: 低质量视频场景中基于视觉语义蒸馏的端到端多目标跟踪

Jun Du

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出VSD-MOT框架,通过视觉语义蒸馏提升低质量视频中多目标跟踪性能,设计双约束语义蒸馏和动态语义权重调节模块,实验证明其在低质量场景和常规场景中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20492 2026-03-24 cs.LG cs.CL 57%

AE-LLM: Adaptive Efficiency Optimization for Large Language Models

AE-LLM:面向大语言模型的自适应效率优化

Kaito Tanaka, Masato Ito, Yuji Nishimura, Keisuke Matsuda, Aya Nakayama

机构 * SANNO University(SANNO大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

AI总结 本文提出AE-LLM框架,通过自适应选择和组合最优效率技术,提升大语言模型在不同部署场景下的效率,实验显示在15种模型和10种任务中,效率提升达2.8倍,精度保持在基线1.2%以内。

详情

展开后加载摘要…

URL PDF HTML 收藏