Reinforcement Learning from Diffusion Feedback: Q* for Image Search
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted for publication at NeurIPS 2023
专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Paper accepted at ICCV-W 2023. V2 contains additional comparisons with concurrent works
专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 VLM训练与架构 :visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG
Comments PhD Thesis, 152 pages, 32 figures, 6 tables
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted by ICCV 2021
专题命中 VLM训练与架构 :LLaVA(abstract,comments);分类 cs.CV、cs.AI
Comments The source code and trained weights are available at https://github.com/visresearch/LLaVA-STF
MR-IQA-2:通过细粒度信用分配实现真实的图像质量反映
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本研究针对现有盲图像质量评估(IQA)中推理真实性不足的问题,提出MR-IQA-2框架,通过解耦推理与评分的细粒度信用分配,在IQA基准上实现了与人类评分的竞争性对齐,还能提供更丰富的视觉理解。
PixRec: 利用视觉上下文进行序列推荐中的下一项预测
机构 * Department of Computer Science, Northwestern University(北western大学计算机科学系) ; Elmore Family School of Electrical and Computer Engineering(电气与计算机工程学院)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 PixRec通过整合视觉信息提升序列推荐的准确性,利用视觉-语言模型在电子商务中实现更精准的下一项预测。
Comments 9 pages, 2 figures
EgoGazeLite:面向 token 高效多模态大语言模型视频输入的设备内自我中心注视预测
机构 * Copenhagen Business School(哥本哈根商学院)
专题命中 VLM训练与架构 :MLLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 EgoGazeLite 是轻量双进程注视预测器,可在消费级硬件上实时运行,无需眼动追踪硬件即可实现 token 高效的自我中心视频理解,性能与真实注视裁剪无显著差异。
Comments 16 pages. Accepted at the WearableAI Workshop, ECCV 2026 (Archival Track)
廉价探针预测3D-CT视觉语言模型中的昂贵训练
机构 * University of Florida(佛罗里达大学)
专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV、cs.AI
AI总结 研究为3D-CT视觉语言模型选编码器及压缩方案时,候选组合多难比较。提出用廉价探针替代,构建含验证门限的探测基准,比较读出头并配对探针与下游任务,早期结果显示廉价探针排序与昂贵微调一致,有望快速筛选方案。
自然语言理解在基于多模态视频的登革热诊断中的作用
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本研究提出基于YOLO和CLIP的视觉-语言框架,从视频中分类未受感染与DENV2感染的蚊子,帧级准确率达98.54%、灵敏度达99.91%,证实该框架可用于分析感染相关生物行为。
宪法性在策略安全蒸馏
机构 * Institute of Trustworthy Embodied AI(可信具身人工智能研究院) ; Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Ant Group(蚂蚁集团) ; Zhejiang University(浙江大学) ; City University of Hong Kong(香港城市大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG
AI总结 针对在策略自蒸馏在安全对齐中因宪法条件导致教师分布收缩、表达能力下降的问题,提出宪法性在策略安全蒸馏(COPSD),通过交叉SFT冷启动校准教师分布,再进行宪法条件在策略蒸馏,在12个基准上实现了更优的安全-有用性权衡并降低安全税。
LookBack:通过视觉参考使用情况对LVLM响应进行评分的位置与方法
机构 * Yonsei University(延世大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 针对LVLM响应存在的图像相关幻觉问题,提出无需训练的LookBack评分方法,结合视觉回溯评分增强token似然,在四个基准和三个模型上提升了Best-of-$N$选择性能且开销极小。
Comments 19 pages, 10 figures. Code: https://github.com/bscho333/LookBack
低交互秩学习:统一乘法双编码器头
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出低交互秩学习框架,统一乘法双编码器头架构,解决其设计决策、可识别性等问题,经实验验证该框架可解释对比维度不可解释性并恢复真实模式。
动态上下文适配器:将历史信息高效注入视觉-语言模型
机构 * University of Liverpool(利物浦大学) ; National Tsinghua University(国立清华大学) ; Imperial College London(伦敦帝国学院) ; National Taiwan University(国立台湾大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 针对视觉-语言模型整合历史上下文时的计算与信息损失问题,提出动态上下文适配器(DCA),实现高效历史注入,降低注意力FLOPs超25%、内存13%,提升长时序任务性能。
解剖结构忠实但时间上盲目:超声心动图左心室射血分数估计的归因审核
机构 * School of Integrated Medicine, Yonsei University(延世大学统合医学院) ; Department of Radiology, Research Institute of Radiologic Science, Yonsei University College of Medicine(延世大学医学院放射科学研究所放射科)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 研究超声心动图左心室射血分数估计模型的归因,微调VideoMAE Transformer和R(2+1)D CNN两个回归器,用多指标审核发现模型空间忠实但时间盲目,强调空间忠实不代表时间忠实,警示XAI验证并呼吁时间感知训练评估。
Comments 12 pages, 4 figures. v2: the chance level is now measured rather than computed, which corrects the ratios reported in v1. Adds a composition-matched ablation with an equal-area control, a reliability estimate for it, an ablation-derived score to report alongside overlap, seed repetition, and pediatric validation
基于Token的视觉Transformer虚假相关性检测
机构 * Center for Biosystems and Biotech Data Science(生物系统与生物技术数据科学中心) ; Ghent University Global Campus(根特大学全球校区) ; State University of New York Korea(纽约州立大学韩国分校) ; Department of Mathematics(数学系) ; Université de Liège(列日大学) ; Department of Applied Mathematics, Computer Science and Statistics(应用数学、计算机科学与统计学系) ; Ghent University(根特大学) ; Department of Electronics and Information Systems(电子与信息系统系)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本研究提出基于Token的诊断流程,通过留一Token移除法检测视觉Transformer中的虚假相关性,经ImageNet等实验验证了方法的有效性,还探讨了虚假信号的来源及相关案例。
Comments Accepted for publication in Transactions on Machine Learning Research (TMLR)
分辨率与压缩结合:面向3D放射报告生成的高效视觉上下文
机构 * German Cancer Research Center (DKFZ)(德国癌症研究中心)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对3D放射报告生成中视觉序列的计算瓶颈,通过实验评估不同视觉编码器、投影器和LLM,提出解剖学引导的ROI裁剪等策略,在两个数据集上取得最先进的临床macro F1结果。
COMEX:用于可解释美学图像裁剪的基于构图的基准测试与学习框架
机构 * ZTE Corporation(中兴通讯)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 该研究提出基于构图的COMEX基准与SFT+GRPO两阶段框架,用于可解释美学图像裁剪,通过多组实验验证了框架的有效性与可迁移性。
IFCLoRA:用于参数高效微调的拓扑感知秩分配
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI、cs.LG
AI总结 研究针对LoRA方法中秩分配问题,提出IFCLoRA拓扑感知秩分配方法,利用小校准集和冻结模型构建交互图,结合全局拓扑先验与局部梯度敏感性计算得分来分配秩,在多场景下优于其他方法,还揭示了任务依赖的秩分布特点。
Comments 9 pages, 5 figures
UniVVT:用于高保真视频虚拟试穿的统一端到端框架
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 UniVVT是一种统一端到端视频虚拟试穿框架,以多模态大语言模型为核心,采用三阶段渐进训练策略,在多基准上实现了优于主流方法的高保真试穿效果。
Comments 17 pages,21 figures
MM-ISTS: 基于多模态视觉-文本大语言模型的不规则采样时间序列预测
机构 * East China Normal University Shanghai China ; Centre for Artificial Intelligence ; Robotics, Hong Kong Institute of Science \& Innovation, Chinese Academy of Sciences Hong Kong China ; Department of Computing, The Hong Kong Polytechnic University Hong Kong China ; East China Normal University ; Robotics, Hong Kong Institute of Science \& Innovation, Chinese Academy of Sciences ; Department of Computing, The Hong Kong Polytechnic University
专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV、cs.AI
AI总结 MM-ISTS利用多模态视觉-文本大语言模型,通过双阶段编码机制提升不规则采样时间序列预测的性能。
用于视频-语言模型高效推理的自适应两阶段视觉令牌剪枝
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 针对视频-语言模型推理延迟高的问题,提出两阶段自适应令牌剪枝策略,先剪去视频冗余帧,再根据视频内容自适应剪去保留帧中的冗余令牌,无需额外训练微调,在10%令牌保留率下提升准确率7%并降低95%计算量。
从生成器到嵌入器:通过构建零样本判别嵌入模型来利用多模态大语言模型的固有能力
机构 * Department of Artificial Intelligence(人工智能系)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种高效框架,通过构建零样本判别嵌入模型,利用多模态大语言模型的固有能力,提升多模态表示空间的鲁棒性和零样本嵌入能力。
Comments Accepted to IEEE Transactions on Multimedia (T-MM)
线性多时间尺度保留作为内存高效的视觉-语言桥梁
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对视觉-语言模型高分辨率图像处理的内存瓶颈,提出线性多时间尺度保留模块,兼具O(N)复杂度与上下文路由能力,在长序列任务、硬件效率及MME基准上均优于MLP基线。
裁决式字幕生成:用于严格零样本图像字幕生成的多智能体对齐评分与共识蒸馏束仲裁
机构 * AI Platform OneNexus, OneMount(OneMount AI平台OneNexus) ; School of Electronic Engineering, Soongsil University(崇实大学电子工程学院) ; MoAdata(MoAdata公司) ; University of Economics Ho Chi Minh City (UEH)(胡志明市经济大学)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 该研究提出裁决式字幕生成多智能体框架,通过多阶段对齐评分与共识蒸馏重排序,在不微调IFCap的情况下,显著提升COCO等数据集的零样本图像字幕生成性能,且可跨数据集迁移。