Enhancing Vision-Language Models Generalization via Diversity-Driven Novel Feature Synthesis
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
专题命中 VLM训练与架构 :LLaVA(title);分类 cs.CV
Comments Project page: https://github.com/yfzhang114/SliME
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
Comments Accepted by TMLR; Code and models are available at https://github.com/jihaonew/UTA
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
Comments Accepted at CVPR 2024 LIMIT, 12 pages, 8 Tables, 2 Figures
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
Comments We find that the statistical information in Figure 2 neglect the statistics for tSOS, so we make corrections. Additionally, we change the statistical samples to those where CLIP misidentify, but prompt tuning identify correctly. At the same time, we also revise some of the descriptions. The changes to the supplementary materials will be updated shortly. arXiv admin note: text overlap with arXiv:2307.06948 by other authors
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
Comments Accepted by NeurIPS 2023
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
专题命中 VLM训练与架构 :visual language model(title);分类 cs.CV
Comments Accepted by EMNLP 2023's demo track; Code, Pretrained Model, and Dataset: https://github.com/DAMO-NLP-SG/Video-LLaMA
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
Comments NA
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
Comments Accepted by AAAI-2023. Camera Ready Version
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
Comments CVPR 2023
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
Comments preprints
专题命中 VLM训练与架构 :VLM(title);分类 cs.CV
Comments 9 pages, ACL Findings 2021
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
聚焦图像:用于胸部X光诊断与报告生成的注视监督多模态学习
机构 * Department of Computer Science and Engineering, Brac University(计算机科学与工程系,布拉克大学)
专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.LG
AI总结 本研究基于MIMIC-Eye数据集构建两阶段多模态框架,引入注视监督提升胸部X光诊断准确率与报告空间可解释性,为该领域提供了可复现的新基准。
受损多模态语言模型再现失语症患者的图片命名模式
专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 研究未针对临床模拟设计的通用语言模型能否再现失语症患者图片命名错误模式,通过对多模态语言模型进行扰动配置,建立定量框架再现个体失语症错误模式,表明语言模型或可成为中风后失语症患者数字替身。
Comments 15 pages, 8 figures; supplementary materials (18 pages, 6 sections) included
用于基于文本的行人异常检索的、带分歧感知重排序的异构视觉语言集成方法
机构 * Hanoi University of Science and Technology(河内科技大学) ; University of Information Technology, VNU-HCM(胡志明市国家大学信息技术大学) ; Vietnam National University, Ho Chi Minh City(胡志明市国家大学) ; VinUniversity ; Vietnamese-German University(越南德国大学)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 该研究针对大规模基于文本的行人异常检索难题,提出带分歧感知重排序的异构视觉语言集成方法,在PAB基准上取得90.92% mAP等优异指标,验证了方案有效性。
Comments Accepted at the ECCV 2026 Workshop
并非所有视觉 token 都可安全移除:后果敏感型视觉 token 压缩
机构 * The University of Sydney(悉尼大学) ; Tongji University(同济大学) ; University of Surrey(萨里大学) ; Nankai University(南开大学) ; Cornell University(康奈尔大学) ; City University of Hong Kong(香港城市大学)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 该研究针对视觉语言模型提出后果敏感型视觉 token 压缩方法,可在相同总 token 预算下降低高风险错误,还能减少代价加权错误并降低延迟,泛化性良好。
NormGuard: 流匹配强化学习中保持奖励的范数约束
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Kuaishou Technology(快手科技) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.LG
AI总结 针对流生成器强化学习后训练中感知质量下降的问题,提出NormGuard方法,通过铰链惩罚约束速度范数,在保持奖励的同时提升图像质量和真实性。
Comments v5: Fixed PDF rendering compatibility issue affecting Apple PDFKit (macOS Preview/iOS PDF viewer). No changes to technical content compared to v4
注意力对字母大小写敏感
专题命中 VLM训练与架构 :vision-language model(abstract,abstract_cn);分类 cs.CV、cs.LG
AI总结 该研究发现LLMs和VLMs存在大小写效应,即文本中目标信息采用特定大小写格式会调节注意力分配,但该效应不一定提升任务准确率,推理模型的思考阶段可缓解此效应,且该效应可部分迁移至VLMs。
Comments Accepted at ECCV 2026
VLAFlow:通过协同训练和未来潜在对齐的视觉-语言-动作模型统一训练框架
机构 * Li Auto Inc.(理想汽车) ; School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 提出VLAFlow统一框架,比较四种训练范式,发现语言监督保持视觉-语言泛化,未来潜在对齐改进状态转换建模,两者结合实现最佳迁移性能。
FusionRS: 用于双模态视觉-语言基础模型的大规模RGB-红外遥感数据集
机构 * China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区) ; University of Electronic Science and Technology of China(电子科技大学) ; Tianjin University(天津大学)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 针对遥感视觉-语言模型缺乏红外数据的问题,提出首个大规模RGB-红外-文本数据集FusionRS,通过翻译RGB图像为红外风格并配以红外感知描述,训练双模态基础模型,提升RGB-红外对齐和双模态字幕生成性能。
SciFigAlign:通过微调视觉内容与稿件证据的对齐来对科学图表进行评分
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 本文构建了含3857张科学图表的标注数据集,提出基于稿件证据的多模态评分器SciFigAlign,其在测试集上的MAE为0.3524,相对最佳LLM基准降低59%误差,证实需视觉与稿件证据的学习对齐。
阿格斯统一模型:迈向紧凑且经济的图像理解与生成统一模型
机构 * Sony AI(索尼人工智能公司)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 研究旨在统一图像理解与生成,提出阿格斯统一模型,利用预训练视觉语言模型,引入混合视觉令牌,分两阶段训练,以最少数据和低成本实现良好性能,达当前最优,可作统一模型开发基线。
EgoPlay:用于第一人称视角视频流的事件触发式视频编辑
机构 * Snap Inc.(Snap公司) ; King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 研究第一人称视角视频流编辑问题,提出EgoPlay,通过微调预训练模型,在单个端到端模型中联合学习事件识别等,构建数据集训练双向视频扩散编辑器,在Ego4D基准测试中表现出色,优于现有基线。
Comments Accepted to SIGGRAPH Asia 2026 as a Conference Paper. Project page: https://egoplay2026.github.io/egoplay
TOPReward: 令牌概率作为机器人学中的隐式零样本奖励
机构 * University of Washington(华盛顿大学) ; Allen Institute for AI(人工智能研究所) ; Amazon(亚马逊) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 TOPReward通过利用预训练视频视觉-语言模型的令牌概率,提供高效的零样本奖励估计,显著提升机器人任务进度评估的性能和泛化能力。
ViMax: 智能体视频生成
机构 * The University of Hong Kong(香港大学) ; South China University of Technology(华南理工大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 提出ViMax框架,通过多智能体协作实现长视频生成,利用分层叙事引擎和视觉一致性机制,保证叙事连贯性和视觉一致性。
Comments 20 pages, 13 figures