Follow My Eyes: Backdoor Attacks on Goal-Directed Scanpath Prediction
跟随我的眼睛:基于VLM的扫视路径预测的后门攻击
专题命中 VLM训练与架构 :VLM(title_cn,summary_cn)
AI总结 本文首次研究了针对基于VLM的扫视路径预测的后门攻击,通过设计两种可变输出攻击方法,展示了如何在不同触发模式下绕过检测,验证了边缘部署系统的实际威胁。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
跟随我的眼睛:基于VLM的扫视路径预测的后门攻击
专题命中 VLM训练与架构 :VLM(title_cn,summary_cn)
AI总结 本文首次研究了针对基于VLM的扫视路径预测的后门攻击,通过设计两种可变输出攻击方法,展示了如何在不同触发模式下绕过检测,验证了边缘部署系统的实际威胁。
解耦相似性用于大视觉-语言模型中的任务感知token剪枝
机构 * Wuhan University(武汉大学) ; University of Exeter(埃克塞特大学) ; Chinese Academy of Sciences(中国科学院) ; Xi'an University of Electronic Science and Technology(西安电子科技大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV
AI总结 本文提出DeSAP方法,通过解耦相似性实现精准任务感知token剪枝,提升大视觉-语言模型的效率与性能,实验表明在不同基准和架构上均优于现有方法。
Comments Accepted at ACM Multimedia 2026. Camera-ready version
AdaBoosting 文本提示用于视觉-语言模型
机构 * KT Corporation(KT公司) ; Pohang University of Science and Technology (POSTECH)(浦项科技大学) ; National AI Research Lab(国家人工智能研究实验室)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.LG
AI总结 提出文本提示提升(TPB)框架,通过AdaBoost策略将每个文本提示分类器视为弱学习器,顺序集成以聚焦难分类样本,提升少样本分类精度并实现跨模型迁移。
Comments Accepted to ECCV 2026 Spotlight
隐私感知的视觉语言模型
机构 * Socially-Intelligent Artificial Systems Group, University of Amsterdam(智能社会人工智能系统组,阿姆斯特丹大学) ; University of Amsterdam(阿姆斯特丹大学) ; Fundamental AI Lab, University of Technology Nuremberg(基础人工智能实验室,纽伦堡技术大学)
专题命中 VLM训练与架构 :visual language model(title,abstract);VLM(abstract_cn);分类 cs.CV
AI总结 针对视觉语言模型隐私理解不足的问题,构建高质量基准数据集PrivBench和指令微调数据集PrivTune,通过少量样本微调显著提升隐私敏感性,性能超越GPT-4。
Comments Accepted at Transactions on Machine Learning Research (TMLR)
基于置信度蒸馏的门控关系对齐用于高效视觉语言模型
机构 * Department of Information Technology(信息科技系) ; Electrical Engineering, ETH Zurich, Zurich, Switzerland(电气工程,苏黎世联邦理工学院,苏黎世,瑞士) ; Qualcomm AI Research, Amsterdam, the Netherlands(高通人工智能研究,阿姆斯特丹,荷兰) ; Department of Electrical, Electronic and Information Engineering(电气、电子与信息工程系) ; University of Bologna, Bologna, Italy(博洛尼亚大学,博洛尼亚,意大利) ; School of Electrical and Electronic Engineering(电气与电子工程学院)
专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 提出GRACE框架,通过信息瓶颈原理统一知识蒸馏与量化感知训练,使用置信度门控解耦蒸馏、关系中心核对齐和自适应控制器,在INT4量化下实现性能超越FP16基线并接近教师模型,同时显著降低内存和提升吞吐量。
Comments Accepted to the International Conference on Machine Learning (ICML 2026)
Ortho2CAD:使用视觉语言模型从正投影图生成3D CAD
专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract)
AI总结 研究旨在解决工程设计中从正投影图到3D CAD模型转换的问题,核心方法是利用视觉语言模型Ortho2CAD,通过监督微调与强化学习训练,借助绘图生成器实现大规模学习,主要贡献是代码有效率高且3D CAD精度超基线。
AutoNeural:为 NPU 推理协同设计视觉语言模型
机构 * Nexa AI ; Geely Auto
专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract,abstract_cn)
AI总结 研究针对 NPU 推理的视觉语言模型硬件与模型不匹配问题,提出 AutoNeural 架构,用深度可分离卷积骨干替换 ViT 编码器,结合状态空间模型与 Transformer 层,提升效率,降低量化误差与延迟,验证了在实际应用中的实时性能。
VisionSelector:用于高效多模态大语言模型的端到端可学习视觉令牌压缩
专题命中 VLM训练与架构 :multimodal large language model(abstract,abstract_cn);MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 针对多模态大语言模型的视觉令牌压缩瓶颈,提出端到端可学习的VisionSelector框架,通过可微Top-K与课程退火策略实现高效自适应令牌选择,在压缩时保持优异性能并提升预填充速度。
Comments Accepted by ACM Multimedia 2026
ETC: 通过任务感知的视觉信息蒸馏实现视觉语言模型中的极端令牌压缩
机构 * School of Remote Sensing and Information Engineering, Wuhan University(武汉大学遥感与信息工程学院)
专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);vision-language model(abstract);VLM(abstract_cn);分类 cs.CV
AI总结 提出ETC框架,基于变分信息蒸馏原理,在减少输入令牌数量时最小化任务损失,通过文本-图像交叉注意力加权视觉特征并引入变分信息蒸馏,实现单令牌压缩下仍保持强任务性能。
面向盲图像质量评估的统计与视觉-语言特征的失真感知融合
机构 * Northwestern Polytechnical University(西北工业大学)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 提出一种失真感知融合框架,通过乘法门控机制动态加权NSS统计特征与VLM嵌入,在三个基准上取得最优或竞争性能,并揭示NSS对不同失真的贡献差异。
ELF:无编码器心电图语言模型家族
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Allegheny Health Network(阿勒格尼医疗网络) ; University of California Los Angeles(加州大学洛杉矶分校) ; University of Colorado(科罗拉多大学) ; Allergy and Immunology(过敏与免疫学)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);multimodal large language model(abstract);分类 cs.AI
AI总结 提出三种无编码器架构的ECG语言模型ELF,简化架构和训练流程,在两个数据集上达到或超越现有最优模型。
Comments 34 pages, 12 figures; Accepted to MLHC 2026
AutoV:面向视觉提示检索的损失导向排名用于大视觉-语言模型
机构 * School of Computer Science, Peking University(北京大学计算机学院) ; ByteDance Inc.(字节跳动公司) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV
AI总结 AutoV通过损失导向的提示检索提升大视觉-语言模型在图像理解等任务中的性能。
Comments Accepted by ECCV 2026
超人:统一骨骼与视觉用于人体运动感知与生成
机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School(通用人工智能国家重点实验室,北京大学深圳研究生院) ; Sony R&D Center(索尼研发中心) ; Nanyang Technological University(南洋理工大学)
专题命中 VLM训练与架构 :MLLM(summary_cn,abstract);分类 cs.CV
AI总结 针对人体运动分析范式碎片化问题,提出Superman统一框架,通过视觉引导运动分词器创建跨模态运动词汇,训练单一MLLM架构处理多任务,实验表明该方法在运动任务中性能领先或具竞争力,为运动分析提供高效可扩展路径。
从一对一到多对多:面向深度视觉-语言融合的动态跨层注入
机构 * Tongji University(同济大学) ; Ant Group(蚂蚁集团) ; Shanghai Innovation Institute(上海创新研究院) ; Independent Researcher(独立研究者)
专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);vision-language model(abstract);VLM(abstract_cn);分类 cs.CV
AI总结 提出跨层注入框架,通过自适应多投影模块和自适应门控融合机制实现视觉层与LLM的动态多对多连接,显著提升多模态理解性能。
AIDEN:面向视障人士的AI助手设计与初步研究
机构 * Institute for Computer Research, University of Alicante(计算机研究所,阿利坎特大学) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);分类 cs.CV
AI总结 提出AIDEN系统,结合YOLO实时目标检测、LLaVA场景描述与OCR,以及基于盖革计数器隐喻的连续触觉引导,避免听觉过载并保护隐私,实验表明用户满意度高。
Journal ref IEEE Access 14 (2026) 80406-80420
GroundSet: 基于地籍数据的空间理解向量数据集
专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 针对多模态大模型在遥感精细空间理解上的不足,提出基于地籍矢量数据的大规模数据集,含510k高分辨率图像和380万标注对象,通过指令微调基准验证,标准架构可掌握细粒度空间定位。
超越线性可分上限:对齐视觉-语言模型中的表征
机构 * Applied Artificial Intelligence Group(应用人工智能小组) ; Tallinn University of Technology(塔林技术大学)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);分类 cs.CV
AI总结 提出线性可分上限(LSC)诊断框架,发现VLM存在对齐差距,并通过对比目标重塑视觉流形,使模型在抽象组合推理任务上显著超越LSC。
Comments Accepted TMLR
FrameOracle: 学习在视频中看什么以及看多少
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 提出FrameOracle轻量模块,预测相关帧及其数量,通过课程学习从弱代理信号到强监督,在多个VLM和基准上以更少帧数保持或提升精度。
Comments ICML 2026. Project page: https://people-robots.github.io/frameoracle/
ReMoT: 基于运动对比三元组的强化学习
机构 * Xi’an Jiaotong University(西安交通大学) ; Shenzhen University of Advanced Technology(深圳先进技术大学) ; DAMO Academy, Alibaba Group(阿里巴巴集团 DAMO 院)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);分类 cs.CV
AI总结 提出ReMoT统一训练范式,通过规则生成大规模运动对比数据集和组相对策略优化,解决VLM时空一致性问题,在时空推理任务上提升25.1%。
Comments CVPR 2026 Highlight
通用视觉语言模型(VLMs)能否在医疗领域超越专门化模型?基准测试与战略洞察
机构 * The Chinese University of Hong Kong(香港中文大学) ; The University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(向量研究所)
专题命中 VLM训练与架构 :vision language model(title,abstract);分类 cs.CV、cs.AI
AI总结 研究比较了通用与专门化医疗VLMs的性能,发现高效微调的通用模型在多数任务中表现可比或更优,尤其在处理未见医疗模态时。
Comments version 5
通过非线性多适配器的视觉-语言模型实现简单的效率增量学习框架
机构 * Faculty of Information Technology, University of Jyväskylä(信息科技学院,于韦斯屈耶大学) ; National University of Singapore(新加坡国立大学) ; Lab of Brain-Machine Intelligence, Zhejiang University(脑机智能实验室,浙江大学) ; School of Computer Science and Technology, Dalian University of Technology(计算机科学与技术学院,大连理工大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出SimE框架,利用视觉-语言模型与适配器提升增量学习效率,发现适配器连接数与模型能力呈非线性关系,实验表明在TinyImageNet和CIFAR-100上优于传统方法。
LookME:用于视觉语言模型层注入的基于查找的多模态嵌入
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 本文针对视觉语言模型在资源受限环境中部署的问题,提出LookME框架。通过分层两级查找方法和稀疏注入策略,实现基于查找的多模态嵌入增强,实验表明该方法优于仅文本的PLE风格方法,有效提升了模型性能。
超越注意力分数:基于SVD的视觉令牌修剪用于高效视觉-语言模型
机构 * anoncvlab(匿名计算机视觉实验室)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出SVD-Prune方法,通过SVD分解视觉令牌特征矩阵并利用统计杠杆分数选择顶级令牌,以在极端视觉令牌预算下保持高性能,优于现有修剪方法。
IWP:大型视觉语言模型中的隐式权重剪枝与令牌剪枝
机构 * KAIST(韩国科学技术院)
专题命中 VLM训练与架构 :vision language model(title,abstract);分类 cs.CV、cs.AI
AI总结 提出基于注意力对偶形式的无训练令牌剪枝框架,通过度量令牌的信息量和冗余度,结合渐进式分块最大边际相关性选择子集,在保持性能的同时提升效率。
语言覆盖视觉:视觉语言模型中的过度对齐与几何去偏
机构 * Indian Institute of Technology Dhanbad(印度理工学院丹巴德分校) ; National University of Singapore(新加坡国立大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 本文研究视觉语言模型中过度对齐导致的幻觉问题,提出几何去偏方法,通过投影消除文本子空间影响,减少幻觉并提升长文本生成性能。
视觉-语言模型是理解3D场景还是仅仅 catalogue 物体?
机构 * Deccan AI(德克南人工智能)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG
AI总结 本文通过一个包含3034个样本的人工整理基准,探讨了视觉-语言模型对空间理解的深度有序遮挡、光学几何推断和体积重新安排规划能力,发现模型在重新安排可见布局时表现优异,但在遮挡和反射推断上表现较差。
模态间隙驱动的子空间对齐训练范式用于多模态大语言模型
机构 * HKUST(GZ)(香港科技大学(广州)) ; NUS(新加坡国立大学) ; sh AILab ; SII ; Stanford(斯坦福大学) ; UCLA(加州大学洛杉矶分校) ; Yale(耶鲁大学) ; SJTU(上海交通大学) ; GBU(国防大学) ; PKU(北京大学)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI
AI总结 针对多模态对比学习中的模态间隙问题,提出固定帧模态间隙理论,并基于该理论设计无训练的对齐策略ReAlign和可扩展训练范式ReVision,利用无配对数据实现视觉与语言表示的高效对齐。
RoboProcessBench:视觉语言机器人操作中的过程感知理解基准测试
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Zhejiang University(浙江大学) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学) ; China University of Mining Technology(中国矿业大学)
专题命中 VLM训练与架构 :InternVL(abstract,abstract_cn);vision-language model(abstract);VLM(abstract_cn)
AI总结 提出RoboProcessBench基准,通过静态监控和动态推理两个维度、12个诊断问题家族,评估视觉语言模型在机器人操作中的过程感知理解能力,并基于58k问答对数据集验证了当前模型的局限性及后训练的有效性。
MOON2.0:动态模态平衡多模态表示学习用于电商产品理解
机构 * Alibaba Group(阿里巴巴集团)
专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 MOON2.0通过动态模态平衡框架解决电商多模态数据中的模态不平衡、信息对齐不足和噪声处理问题,提出MoE、双层对齐和图像-文本共增强策略,提升零样本性能和多模态对齐质量。
Comments Accepted by the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2026. 11 pages, 7 figures
FOCAL:过滤的本地连续活动日志用于高效的个人桌面摘要
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);visual reasoning(abstract)
AI总结 FOCAL通过多代理系统实现高效的本地桌面流摘要,减少资源消耗并提升任务召回率。