Representing Online Handwriting for Recognition in Large Vision-Language Models
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract)
Comments 9 pages, 3 figures, 4 tables
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 18 pages, 9 figures, 7 tables
Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision 2023 (pp. 15395-15404)
从理解到参与:通过视觉语言模型(VLMs)生成个性化药学视频片段
机构 * Roche(罗氏) ; Accenture(埃森哲) ; Involead
专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract,comments);分类 cs.CV、cs.LG
AI总结 本文提出基于视觉语言模型和音频语言模型的个性化药学视频片段生成方法,通过剪切合并算法和个性化机制提升生成效率与质量,实现制药行业内容处理的高效自动化。
Comments Contributed original research to top tier conference in VLM; currently undergoing peer review
专题命中 VLM训练与架构 :LLaVA(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments Project Page: https://face-llava.github.io
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract,comments);分类 cs.CV、cs.LG
Comments Preprint. Our code and model are publicly available at https://github.com/gordonhu608/MQT-LLaVA
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,comments);分类 cs.CV、cs.LG
Comments Published at CVPR 2024. Project site: https://llm-can-optimize-vlm.github.io/
LIRA:面向视觉-语言-动作解码的局部跨层信息路由
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV
AI总结 LIRA是面向VLA模型的局部跨层信息路由机制,通过深度感知路由VLM特征,在多机器人操作基准及真实场景中提升了动作预测性能与分布偏移下的鲁棒性。
Comments 9 pages, 4 figures. Code and model checkpoints will be released upon acceptance of the paper
VisCo:利用大语言模型作为视觉令牌压缩的内在编码器
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV
AI总结 研究针对视觉语言模型处理视觉令牌时的高成本问题,提出训练高效的自压缩框架VisCo,将预训练VLM用作内在压缩器,通过参数共享自动编码器压缩视觉信息,实验证明其在压缩率上超先前方法,还能捕获互补表示改进基础模型。
Comments Accepted by ACM MM 2026
RUTA:基于率-效用优化的原则性视觉令牌分配方法
机构 * City University of Hong Kong(香港城市大学) ; Google Inc.(谷歌公司)
专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);vision-language model(abstract);分类 cs.CV
AI总结 针对视觉语言模型因长视觉令牌序列导致的LLM侧计算和内存成本过高问题,提出RUTA方法,仅用2.0%、4.2%的视觉令牌,分别在LLaVA-NeXT-7B、Qwen3-VL-8B上保留88.2%、94.4%的任务性能。
驯服隐式:面向持续多模态后训练的双通道风险感知强化微调
专题命中 VLM训练与架构 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.AI
AI总结 针对持续多模态后训练中RFT算法在任务分布偏移下遗忘加剧的问题,提出双通道风险感知强化微调框架RAPO,通过策略与数据通道的风险管控降低遗忘,在MLLM-CL基准上使遗忘减少79.8%且保留新任务竞争力。
MIEScore:面向多源图像编辑的人类对齐评估方法
专题命中 VLM训练与架构 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 针对多源图像编辑(MIE)缺乏人类对齐评估基准的问题,研究构建了首个MIE基准MIE-Bench,并提出基于MLLM的评估模型MIEScore,其对齐人类偏好性能最优且泛化性良好。
MoRoute:面向上下文多模态视频生成的动态路由
机构 * Sun Yat-sen University(中山大学) ; HUJING Digital Media & Entertainment Group(沪景数字媒体娱乐集团) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV
AI总结 MoRoute是采用动态层路由连接VLM与视频DiT的多模态视频生成框架,在三个基准数据集上均优于现有最优方法,提升了视频生成与编辑的性能。
Comments Project page: https://orange-3dv-team.github.io/MoRoute/
WorldDiT:用于世界和动作建模的统一扩散架构
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.LG
AI总结 研究提出WorldDiT统一扩散架构,结合动作生成与视觉世界建模,不依赖大型预训练VLM动作主干,在四个LIBERO模拟套件中表现出色,处于帕累托前沿,为未来扩展研究提供了低于十亿参数的基线。
Comments 9 pages, 4 figures
通过目标感知数据对齐实现细粒度食品图像理解
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV
AI总结 研究针对细粒度食品图像理解,提出以数据为中心的多模态对齐方法,先选视觉相关训练子集,再细化字幕,训练互补检索专家并融合决策,提升了检索性能,完整方法检索分数超纯VLM检索两倍且更高效。
BLUE:用于高效视觉语言监控分析的语义保留视频压缩
机构 * KGraph AI Solutions Pvt. Ltd.(KGraph AI解决方案私人有限公司)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV
AI总结 研究持续监控视频给企业视频分析系统带来的负担问题,提出BLUE固定摄像头监控压缩方法,在VIRAT和CHAD数据集上实验,结果表明该方法能在保留VLM语义性能时降低带宽和推理成本。
Comments 17 pages, 10 figures, 6 tables
随机元遗忘:连接语言主干与多模态遗忘
机构 * UNC at Chapel Hill(北卡罗来纳大学教堂山分校) ; Cisco Research(思科研究院) ; Michigan State University(密歇根州立大学)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.LG
AI总结 研究视觉语言模型的机器遗忘问题,提出随机元遗忘框架,利用VLM级反馈学习初始化,经内、外循环更新语言主干,实验证明该方法在遗忘-保留权衡上表现最佳,能提升准确率且可迁移。
Comments 15 pages
SAMPLe:基于SAM的视觉语言模型提示学习优化器
机构 * Clemson University(克莱姆森大学) ; Siemens Energy (AI Lab)(西门子能源(人工智能实验室)) ; University of Arizona(亚利桑那大学)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV
AI总结 研究VLM提示学习中性能与泛化的困境,提出SAMPLe优化器,通过考虑损失曲面锐度平衡探索与利用,减少过拟合,提升泛对未见能力,在多种提示学习框架中表现出色,优于现有优化器。
Comments The manuscript has been accepted to ECCV and will be presented at the conference and published in the main proceedings
QSVideo:用于视频理解的查询条件语义时间检索
机构 * Michigan State University(密歇根州立大学)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV
AI总结 针对视频理解中视觉语言模型性能随视频时长下降问题,提出QSVideo框架,通过查询条件语义排序器、联合优化相关性和多样性及时间对齐策略,提升视频VLM性能。
Comments ECCV 2026
自然语言相机运动理解
机构 * Boston University(波士顿大学) ; Pixocial Technology(皮克索西尔科技公司)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV
AI总结 研究自然语言相机运动理解问题,指出现有视觉语言模型在此任务上的不足。核心方法是建立分类法、基准和训练集。主要贡献是微调的VLM - 8B在基准测试中性能优于Gemini 3.1 Pro。
Comments Accepted to ECCV 2026
通过本体感知进行思考:用于VLA策略的状态基础视觉令牌选择
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Eastern Institute of Technology(东区技术研究所) ; Great Bay University(大湾大学) ; Northeast Forestry University(东北林业大学) ; National University of Singapore(新加坡国立大学)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);grounding(abstract);分类 cs.CV
AI总结 研究VLA模型中本体感知应用问题,提出ThinkProprio方法,将本体感知离散化为视觉语言模型(VLM)词汇令牌,与指令共同作用在VLM计算前选视觉补丁,贡献是提升性能、降低延迟。
UniDrive-WM:面向自动驾驶的统一理解、规划和生成世界模型
机构 * Bosch Research North America & Bosch Center for Artificial Intelligence (BCAI)(博世北美研究院与博世人工智能中心) ; Washington University in St. Louis(圣路易斯华盛顿大学) ; Arizona State University(亚利桑那州立大学) ; Case Western Reserve University(凯斯西储大学)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV
AI总结 提出UniDrive-WM,一个基于VLM的统一世界模型,联合执行场景理解、轨迹规划和未来图像生成,在Bench2Drive上轨迹误差降低7.3%,碰撞率降低10.4%。
Comments Accepted to ECCV 2026. Project Page: https://unidrive-wm.github.io/UniDrive-WM
理解多模态大语言模型如何通过Token激活图描述艺术品
机构 * University of Bari Aldo Moro(巴里阿尔多莫罗大学) ; University of Zurich(苏黎世大学)
专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract)
AI总结 使用Token激活图(TAM)分析MLLMs在描述艺术品时对视觉区域的依赖,发现不同语义类别的token在视觉基础上有显著差异,并比较了TAM与SAM~3开放词汇分割。
Comments Accepted at PRESTIGE workshop at ICPR 2026
探索多模态大语言模型与两阶段微调在时尚图像检索中的应用
机构 * University of Science, VNU-HCM(胡志明市国家大学下属理科大学) ; Vietnam National University, Ho Chi Minh(胡志明市国家大学)
专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);vision-language model(abstract);分类 cs.CV
AI总结 提出融合多模态大语言模型(LLaVA)生成属性感知三元组,并采用两阶段微调策略增强对比学习,以解决时尚图像检索中标注数据稀缺和负采样简单的问题。
Comments SOICT 2025
多模态大语言模型赋能的通用行人重识别重排序
机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息与电子工程学院)
专题命中 VLM训练与架构 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 提出利用多模态大语言模型(MLLM)的泛化能力,通过微调MLLM并计算μ-距离来改进推理阶段的重排序,从而提升领域泛化行人重识别的性能。
CPS4: 基于类别提示的半监督脊柱分割与类别特定一致性约束
机构 * School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院) ; Department of Nuclear Medicine, Shengjing Hospital of China Medical University(中国医科大学附属盛京医院核医学科) ; Department of Computer and Data Science, Case Western Reserve University(凯斯西储大学计算机与数据科学系) ; Department of Biomedical Engineering, Case Western Reserve University(凯斯西储大学生物医学工程系)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision language model(abstract);分类 cs.CV
AI总结 提出CPS4,首个利用文本类别提示增强伪标签质量的半监督脊柱分割网络,通过两阶段训练(VLM预训练和半监督分割)实现,仅用5%标注数据即达80.44% Dice。
从内容到知识:基于神经知识表示的闪电般快速长视频理解
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV
AI总结 提出将长视频编码为神经知识表示(NKR),通过智能体知识蒸馏(AKD)自动合成描述和问答对,将视频知识嵌入VLM骨干网络的少量权重中,实现轻量级、可复用的视频理解,推理时无需重新加载视频,大幅降低延迟。
DB-3DME:从数据集到基准测试,实现与人类对齐的自动3D网格评估
机构 * University of California, Berkeley(加州大学伯克利分校) ; Roblox Corporation(Roblox公司)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV
AI总结 提出DB-3DME数据集与基准,包含2619个合成3D网格及其人类评分,通过微调视觉编码器优化VLM评估性能,显著超越现有模型。
Comments CVPR 2026 workshop paper. 10 pages, 3 figures, 6 tables. Dataset available at GitHub and Hugging Face
视觉语言模型能否感知传感器所感?一种可扩展的专家引导设计用于从街景评估轮椅可达性
机构 * University of Florida(佛罗里达大学) ; University of South Florida(南佛罗里达大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV
AI总结 本文提出专家引导的检索增强框架,利用视觉语言模型从谷歌街景图像识别轮椅可达性障碍,通过GPS轮椅停留行为验证,表明VLM评分与移动摩擦部分一致,但细粒度障碍识别有限。
多模态大语言模型感知情感
机构 * Universidade Tecnológica Federal do Paraná(联邦技术大学帕拉纳州大学) ; University of Toronto(多伦多大学)
专题命中 VLM训练与架构 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 本文通过系统评估研究,探讨多模态大语言模型在图像情感分析中的三种方法,发现基于MLLM描述的两阶段流水线在微调后性能显著优于传统基线。
Comments 24 pages, 7 figures