arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5009 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5009 篇

2511.16107 2026-07-22 cs.CV cs.AI 版本更新 85%

T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs

T2T-VICL:通过隐式文本驱动的视觉语言模型进行跨任务视觉上下文学习

Shao-Jun Xia, Huixin Zhang, Zhengzhong Tu

机构 * Duke University(杜克大学) Texas A&M University(德克萨斯农工大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究跨任务视觉上下文学习问题,提出T2T-VICL协作式提示转移框架,通过大教师VLM生成结构化描述构建数据集,提炼能力到轻量级学生VLM,实验表明该框架能改进任务感知对齐,揭示跨任务VICL的潜力与局限。

Comments 22 pages, 6 figures, under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18237 2026-07-21 cs.CV cs.LG 新提交 85%

The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric

视觉相似性的多种意义:一种文本提示的图像感知度量

Sheng-Yu Wang, Yotam Nitzan, Aaron Hertzmann, Jun-Yan Zhu, Eli Shechtman, Alexei A. Efros, Richard Zhang

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 研究人类视觉相似性判断的上下文依赖问题,通过引入大规模数据集微调VLM,产生能捕捉多种视觉相似性意义的TPIPS度量,该度量与人类感知更契合,还在多种任务中开启新功能。

Comments Project Webpage: https://peterwang512.github.io/TPIPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12999 2026-07-10 cs.CV cs.AI 版本更新 85%

Concept-as-Tree: A Controllable Synthetic Data Framework Makes Stronger Personalized VLMs

概念树:一个可控的合成数据框架助力更强的个性化视觉语言模型

Ruichuan An, Kai Zeng, Ming Lu, Sihan Yang, Renrui Zhang, Huitong Ji, Hao Liang, Wentao Zhang

机构 * Peking University(北京大学) CUHK MMLab(香港中文大学MMLab) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security(北京数据智能与安全重点实验室)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究提升VLM个性化能力问题,提出概念树(CaT)框架,以树结构表示概念生成多样正负样本,经数据过滤策略确保质量,实验证明该框架显著增强VLM在个性化基准测试中的能力,是首个可控合成数据管道。

Comments ECCV26 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01709 2026-07-03 cs.AI cs.LG 新提交 85%

COMFYCLAW: Self-Evolving Skill Harnesses for Image Generation Workflows

COMFYCLAW:面向图像生成工作流的自进化技能工具包

Zongxia Li, Dawei Liu, Fuxiao Liu, Yuhang Zhou, Xiyang Wu, Jingxi Chen, Jing Xie, Xiaomin Wu, Lichao Sun

机构 * University of Maryland(马里兰大学) University of Pennsylvania(宾夕法尼亚大学) Nvidia(英伟达) Lehigh University(里海大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 提出COMFYCLAW框架,通过类型化图编辑、区域级VLM验证器和渐进式技能库进化,提升ComfyUI工作流构建的代理可靠性和性能,在多个基准上取得最佳平均评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15382 2026-05-29 cs.CL cs.CV cs.LG 85%

The Vision Wormhole: Latent-Space Communication in Heterogeneous Multi-Agent Systems

视觉虫洞:异构多智能体系统中的潜在空间通信

Xiaoze Liu, Ruowang Zhang, Weichen Yu, Siheng Xiong, Liu He, Feijie Wu, Hoin Jung, Matt Fredrikson, Xiaoqian Wang, Jing Gao

机构 * Purdue University(普渡大学) Contextual AI(情境人工智能) Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 提出Vision Wormhole框架,通过通用视觉编解码器将推理轨迹映射到共享连续空间,实现异构VLM间的潜在状态传输,无需配对翻译器,降低对齐复杂度并提升效率。

Comments Preprint. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24019 2026-05-26 cs.CV cs.LG 85%

MGVQ: Synergizing Multi-dimensional Sensitivity-Aware and Gradient-Hessian Fusion for Vector Quantization

MGVQ:协同多维敏感度感知与梯度-海森融合的向量量化

Zhong Wang, Zukang Xu, Xing Hu, Dawei Yang

机构 * Bauman Moscow State Technical University(巴甫洛夫莫斯科国立技术大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);LLaVA(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 提出MGVQ框架,通过敏感度引导的结构化混合精度量化和梯度感知的二阶误差补偿,实现视觉-语言模型的超低位向量量化,在2-bit量化下最高提升4.9个点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00876 2026-05-05 cs.LG cs.CV 85%

GAZE: Grounded Agentic Zero-shot Evaluation with Viewer-Level Tools and Literature Retrieval on Rare Brain MRI

GAZE:基于视图级工具和文献检索的 grounded 零样本评估

Duaa Alim, Mogtaba Alim, Liam Chalcroft

机构 * Imperial College London, UK(伦敦帝国学院) University of Toronto, Canada(多伦多大学) University College London, UK(伦敦大学学院)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 GAZE框架通过调用视图级工具和文献检索工具,使医学VLM在迭代方式下工作,实现对罕见脑MRI的零样本评估,提升病变定位和诊断准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05195 2025-07-23 cs.LG cs.CL cs.CV 85%

Exploring How Generative MLLMs Perceive More Than CLIP with the Same Vision Encoder

Siting Li, Pang Wei Koh, Simon Shaolei Du

机构 * University of Washington(华盛顿大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);grounding(abstract)

Comments ACL 2025; 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16375 2025-01-22 cs.CV cs.AI cs.CL 85%

List Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMs

An Yan, Zhengyuan Yang, Junda Wu, Wanrong Zhu, Jianwei Yang, Linjie Li, Kevin Lin, Jianfeng Wang, Julian McAuley, Jianfeng Gao, Lijuan Wang

专题命中 VLM训练与架构 :LLaVA(abstract);visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract)

Comments published at COLM-2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28132 2026-05-28 cs.CV 85%

Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models

哪种预训练范式更有利于空间智能?视觉-语言模型与视频生成模型的实证比较

Haozhan Shen, Tiancheng Zhao, Kangjia Zhao, Jianwei Yin

机构 * Zhejiang University(浙江大学) Om AI Research(Om人工智能研究) Binjiang Institute of Zhejiang University(浙江大学滨江研究院)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文通过冻结特征探测研究,系统比较了视觉-语言模型(VLM)和视频生成模型(VGM)在语义标注、实例分组和3D几何预测三个空间智能维度上的表现,发现两者互补且简单融合可提升整体性能。

Comments Code is here: \href{https://github.com/om-ai-lab/Probing-VLM-VGM}{https://github.com/om-ai-lab/Probing-VLM-VGM}

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07279 2026-08-10 eess.SP 新提交 85%

Token Communication for Multimodal Large Language Model

多模态大语言模型的令牌通信

Jingkai Ying, Zhijin Qin, Yuan Shen, Khaled B. Letaief

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn)

AI总结 本文针对多模态大语言模型(MLLMs)的令牌传输问题,提出适配MLLMs的令牌通信框架,通过集成神经编解码器、两阶段语义对齐训练及自适应适配器,在相同传输数据量下实现更优任务性能。

Comments 13 pages, 11 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12112 2026-07-15 cs.LG cs.AI cs.CV cs.DC 新提交 85%

Continual Learning with Elastic Regularization and Synthetic Replay for Federated MLLM Fine-Tuning

用于联邦多模态大语言模型微调的弹性正则化和合成重放持续学习

Jing Liu, Chenxuanyin Zou, Jiayang Ren, Gaoyun Fang, Chengfang Li, Yan Wang, Zhenchao Ma, Bo Hu

机构 * The University of British Columbia(英属哥伦比亚大学) Fudan University(复旦大学) Royal College of Science, Imperial College London(伦敦帝国理工学院皇家科学学院) Dyson School of Design Engineering(戴森设计工程学院) Suzhou Institute of Biomedical Engineering and Technology (SIBET), Chinese Academy of Sciences(中国科学院苏州生物医学工程技术研究所) East China Normal University(华东师范大学)

专题命中 VLM训练与架构 :MLLM(title,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 研究针对联邦多模态大语言模型微调中灾难性遗忘问题,提出FedCMM框架,在参数、数据、聚合三个层面嵌入持续学习保障,经实验验证该框架在准确性和反向迁移上优于基线,能实现跨异构网络AI部署的稳健进化适应。

Comments submitted to IEEE JSTSP

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24182 2026-07-07 cs.RO 版本更新 85%

$M^2$-VLA: Boosting Vision-Language Models for Generalizable Manipulation via Layer Mixture and Meta-Skills

$M^2$-VLA:通过层混合与元技能提升视觉语言模型的通用操控能力

Siyao Xiao, Yuhong Zhang, Zhifang Liu, Zihan Gao, Jingye Zhang, Sinwai Choo, Dake Zhong, Mengzhe Wang, Xiao Lin, Xianfeng Zhou, Jia Jia, Haoqian Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国) College of Intelligent Robotics and Advanced Manufacturing, Fudan University, Shanghai, China(智能机器人与先进制造学院,复旦大学,上海,中国) Synapath

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn)

AI总结 本文提出$M^2$-VLA,通过层混合和元技能模块提升视觉语言模型在机器人操控中的泛化能力,实验验证了其在模拟和现实环境中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00685 2026-07-02 cs.MA 新提交 85%

M2Note: Continual Evolution of Vision Language Models via Mistake Notebook Learning

M2Note: 通过错误笔记本学习实现视觉语言模型的持续演化

Haiwen Li, Jing Tang, Rui Chen, Lei Sun, Xiangxiang Chu

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract,abstract_cn)

AI总结 提出M2Note,一种无需训练的持续演化框架,通过将失败轨迹转化为可编辑的笔记,利用多模态检索增强生成在推理时引导模型,避免重复错误,并在多个基准上提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24771 2026-05-26 cs.CV cs.AI cs.LG 85%

From Theory to Decision Rule: Calibrating the Noisy-Label Crossover for Vision-Language Model Weak Supervision Across Three Medical-Imaging Benchmarks

从理论到决策规则:校准视觉-语言模型弱监督的噪声标签交叉点——基于三个医学影像基准

Bruce Changlong Xu, Jose James, Alexander Ryu

机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 通过三个医学影像基准校准理论预测的噪声标签交叉点,提出基于少量金标标签的决策规则。

Comments 5 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11367 2026-05-26 cs.DC 85%

Efficient Distributed MLLM Training with Cornstarch

使用Cornstarch高效分布式多模态大语言模型训练

Insu Jang, Runyu Lu, Nikhil Bansal, Ang Chen, Mosharaf Chowdhury

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract)

AI总结 提出Cornstarch框架,通过冻结感知流水线并行和令牌工作负载平衡的上下文并行,解决多模态大语言模型训练中的异构性问题,平均吞吐量提升2.26倍。

Comments ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10108 2026-05-19 cs.HC 85%

JARVIS: A Just-in-Time Augmented Reality VLM-Powered Instruction System for Cross-Reality Task Guidance

JARVIS:一种基于视觉语言模型的即时增强现实指令系统,用于跨现实任务指导

Yusi Sun, Ying Jiang, Jiayin Lu, Yin yang, Yong-Hong Kuo, Chenfanfu Jiang

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract)

AI总结 JARVIS通过视觉语言模型生成上下文相关的分步指导,实现实时状态验证和自适应视觉反馈,提升跨现实任务的可用性、工作负荷、成功率和可视化效果。

Comments 14 pages, 11 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02812 2026-05-18 cs.RO 85%

Learning Structured Robot Policies from Vision-Language Models via Synthetic Neuro-Symbolic Supervision

通过合成神经符号监督学习结构化机器人策略

Alessandro Adami, Tommaso Tubaldo, Marco Todescato, Ruggero Carli, Pietro Falco

机构 * University of Padova, Dept. of Information Engineering(帕多瓦大学信息工程系) Fraunhofer Italia Research(弗劳恩霍夫意大利研究所) Polytechnic of Bari Dept. of Electrical and Information Engineering(巴里理工学院电气与信息工程系)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn)

AI总结 本文提出通过合成神经符号监督方法,利用视觉语言模型生成结构化机器人策略,结合多模态感知与符号控制,实现高维学习与符号控制的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07522 2026-05-11 cs.CL 85%

WeatherSyn: An Instruction Tuning MLLM For Weather Forecasting Report Generation

WeatherSyn: 一种用于天气预报报告生成的指令微调MLLM

Zinan Zheng, Yang Liu, Nuo Chen, Juepeng Zheng, Hong Cheng, Jia Li

机构 * Hong Kong University of Science(香港科学大学) HY Foundation Model Team, Tencent(腾讯HY基础模型团队) The Chinese University of Hong Kong(香港中文大学) Sun Yat-Sen University(中山大学) National Supercomputing Center in Shenzhen(深圳国家超算中心)

专题命中 VLM训练与架构 :MLLM(title,title_cn);multimodal large language model(abstract)

AI总结 本文提出WeatherForecastingReport任务,构建首个指令微调数据集,开发首个专为生成天气预报报告设计的模型,验证其在多地区和多天气方面的优越性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07490 2026-05-11 cs.CR 85%

Cross-Modal Backdoors in Multimodal Large Language Models

多模态模型中的跨模态后门

Runhe Wang, Li Bai, Haibo Hu, Songze Li

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn)

AI总结 研究提出一种利用轻量级连接器漏洞的跨模态后门攻击,通过污染连接器实现跨模态后门激活,展示攻击的有效性和可迁移性,揭示多模态对齐中的基本漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25844 2026-04-23 cs.CL cs.HC 85%

Believing without Seeing: Quality Scores for Contextualizing Vision-Language Model Explanations

相信而不看:为视觉语言模型解释提供质量评分

Keyu He, Tejas Srinivasan, Brihi Joshi, Xiang Ren, Jesse Thomason, Swabha Swayamdipta

机构 * University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn)

AI总结 本文提出通过两种质量评分函数评估视觉语言模型解释的视觉忠实度和对比性,以减少对模型预测的过度依赖,实验显示质量评分能显著提升用户判断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17241 2026-04-21 cs.RO 85%

GaLa: Hypergraph-Guided Visual Language Models for Procedural Planning

GaLa:基于超图的视觉语言模型用于程序规划

Kun Wang, Yiming Li, Mingcheng Qu, Aqiang Zhang, Guang Yang, Tonghua Su

机构 * Harbin Institute of Technology(哈尔滨工业大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳)) Chongqing Research Institute of HIT(重庆哈尔滨工业大学研究院)

专题命中 VLM训练与架构 :visual language model(title);VLM(abstract,abstract_cn);vision language model(abstract)

AI总结 GaLa通过超图表示学习,有效捕捉物体间的隐含语义关系和功能区域的层次结构,提升多模态程序规划的性能。

Comments 14pages, 7figures

Journal ref ACL 2026(Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08120 2026-04-10 cs.CV cs.AI cs.CL cs.LG 85%

Small Vision-Language Models are Smart Compressors for Long Video Understanding

小视觉-语言模型是长视频理解的智能压缩器

Junjie Fei, Jun Chen, Zechun Liu, Yunyang Xiong, Chong Zhou, Wei Wen, Junlin Han, Mingchen Zhuge, Saksham Suri, Qi Qian, Shuming Liu, Lemeng Wu, Raghuraman Krishnamoorthi, Vikas Chandra, Mohamed Elhoseiny, Chenchen Zhu

机构 * Meta AI King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出Tempo框架,利用小视觉-语言模型压缩长视频,通过自适应令牌分配实现高效压缩,实验显示其在极端长视频任务中表现优异。

Comments Project page and demo are available at https://FeiElysia.github.io/tempo-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07965 2026-04-10 cs.CV cs.AI cs.LG 85%

DSCA: Dynamic Subspace Concept Alignment for Lifelong VLM Editing

DSCA: 动态子空间概念对齐用于终身视觉语言模型编辑

Gyanendra Das, Sai Satyam Jena

机构 * Zynix AI, FL, USA(Zynix AI(美国佛罗里达州))

专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 DSCA通过动态子空间对齐技术,在视觉语言模型中实现精准非干扰编辑,提升终身学习的稳定性与知识保留能力。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14971 2026-04-08 cs.CV cs.AI cs.CL cs.LG 85%

Sim-CLIP: Unsupervised Siamese Adversarial Fine-Tuning for Robust and Semantically-Rich Vision-Language Models

Sim-CLIP: 无监督的孪生对抗微调用于鲁棒且语义丰富的视觉-语言模型

Md Zarif Hossain, Ahmed Imteaj

机构 * Florida Atlantic University(佛罗里达大西洋大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 Sim-CLIP通过无监督对抗微调提升CLIP视觉编码器的鲁棒性,同时保持语义表示。采用孪生架构和余弦相似度目标,避免大批次对比学习和额外动量编码器,实现低计算开销的鲁棒训练。

Comments Accepted at IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04467 2026-03-17 cs.CV cs.AI cs.CL cs.LG 85%

VisionZip: Longer is Better but Not Necessary in Vision Language Models

VisionZip: 更长并非必要,但在视觉语言模型中更优

Senqiao Yang, Yukang Chen, Zhuotao Tian, Chengyao Wang, Jingyao Li, Bei Yu, Jiaya Jia

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出VisionZip方法,通过选择信息性视觉token提升效率并保持性能,实验显示在多种设置下性能提升至少5%,同时显著加快推理速度。

Comments Code: https://github.com/dvlab-research/VisionZip

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00296 2026-03-10 cs.RO cs.AI cs.CV cs.LG 85%

From Pixels to Predicates: Learning Symbolic World Models via Pretrained Vision-Language Models

从像素到谓词:通过预训练视觉-语言模型学习符号世界模型

Ashay Athalye, Nishanth Kumar, Tom Silver, Yichao Liang, Jiuguang Wang, Tomás Lozano-Pérez, Leslie Pack Kaelbling

机构 * MIT(麻省理工学院) Princeton University(普林斯顿大学) University of Cambridge(剑桥大学) RAI Institute(RAI研究院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 通过预训练视觉-语言模型学习符号世界模型,以实现复杂机器人领域中长周期决策制定的零样本泛化。

Comments A version of this paper appears in the official proceedings of RA-L, Volume 11, Issue 4

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11999 2026-03-03 cs.CV cs.AI cs.IR cs.LG 85%

MOON: Generative MLLM-based Multimodal Representation Learning for E-commerce Product Understanding

MOON: 基于生成式多模态大语言模型的电商产品理解多模态表示学习

Daoze Zhang, Chenghan Fu, Zhanheng Nie, Jianyu Liu, Wanxian Guan, Yuan Gao, Jun Song, Pengjie Wang, Jian Xu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 MOON通过生成式多模态大语言模型改进电商产品理解的多模态表示学习,引入引导的MoE模块、核心语义区域检测和负采样策略,提升零样本性能和泛化能力。

Comments Accepted by WSDM 2026 (oral). 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14236 2026-02-17 cs.CV cs.AI cs.LG cs.PF 85%

Dual-Signal Adaptive KV-Cache Optimization for Long-Form Video Understanding in Vision-Language Models

双信号自适应KV缓存优化用于视觉-语言模型中长形式视频理解

Vishnu Sai, Dheeraj Sai, Srinath B, Girish Varma, Priyesh Shukla

机构 * International Institute of Information Technology(国际信息研究所)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 Sali-Cache通过双信号自适应缓存优化,提升视觉-语言模型处理长形式视频的内存效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07013 2026-02-10 cs.CV cs.AI cs.LG 85%

Steering to Say No: Configurable Refusal via Activation Steering in Vision Language Models

转向说不:通过激活转向实现可配置拒绝在视觉语言模型中

Jiaxi Yang, Shicheng Liu, Yuchen Yang, Dongwon Lee

机构 * The Pennsylvania State University, USA(宾夕法尼亚州立大学)

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出CR-VLM,通过激活转向实现视觉语言模型中的可配置拒绝,解决现有拒绝策略无法适应多样化需求的问题,提升模型的安全性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏