SLED: Scalable Location Encoding via Distillation
SLED:通过知识蒸馏实现可扩展位置编码
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 针对现有位置编码器计算成本高、扩展性差等问题,提出基于蒸馏的SLED,可灵活融入多模态地理空间数据,在19项基准任务上性能优于或媲美现有模型,大幅降低预训练成本。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
SLED:通过知识蒸馏实现可扩展位置编码
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 针对现有位置编码器计算成本高、扩展性差等问题,提出基于蒸馏的SLED,可灵活融入多模态地理空间数据,在19项基准任务上性能优于或媲美现有模型,大幅降低预训练成本。
GeoReward:缓解跨市场偏好预测的视觉语言模型中的上下文变量高估问题
机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本研究针对视觉语言模型的上下文变量高估问题,提出GeoReward奖励模型,通过三种机制缓解该偏差,在跨市场广告偏好预测任务中性能优于现有基线。
注意力对字母大小写敏感
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL
AI总结 该研究发现LLMs和VLMs存在大小写效应,即文本中目标信息采用特定大小写格式会调节注意力分配,但该效应不一定提升任务准确率,推理模型的思考阶段可缓解此效应,且该效应可部分迁移至VLMs。
Comments Accepted at ECCV 2026
测试时对齐大型视觉语言模型:一种轨迹引导的结构化采样方法
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 针对现有视觉语言模型测试时对齐方法资源密集、训练与推理分布不匹配的问题,提出轨迹引导结构化采样的测试时对齐方法,在多模态推理数据集上提升准确率且推理开销可控。
Déjà Cue:通过词汇相对坐标定位目标历史中的状态
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.MM
AI总结 该研究针对目标状态定位问题提出无需训练的 Déjà Cue 框架,通过词汇相对坐标系校准图像-文本相似度,在78个 VOST 序列上显著提升了 R@1 和 Top-1 tIoU 指标。
Comments Code available at https://github.com/HaofanCao/DejaCue
基于视觉定位的分割基础模型少样本概念提示学习
机构 * Advanced Technology Group(先进技术集团) ; GE HealthCare(GE医疗)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对分割基础模型在临床任务中表现不足的问题,提出FS-CPL方法,通过视觉定位学习概念提示,在四个医学影像基准上取得显著性能提升,且与骨干网络无关。
线性多时间尺度保留作为内存高效的视觉-语言桥梁
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对视觉-语言模型高分辨率图像处理的内存瓶颈,提出线性多时间尺度保留模块,兼具O(N)复杂度与上下文路由能力,在长序列任务、硬件效率及MME基准上均优于MLP基线。
零样本图像描述中合成监督的实体忠实修复
机构 * Guangxi University(广西大学) ; School of Computer, Electronics and Information(计算机与电子信息学院)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL
AI总结 针对零样本图像描述中合成监督的实体级错位问题,提出即插即用框架ReCap,通过实体级重对齐与自适应加权策略优化合成数据,在两类基准上实现最优性能。
Comments Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026). 16 pages, 7 figures
内部松弛,跨域平衡:面向视觉-语言混合专家模型的几何引导式负载均衡
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
AI总结 针对视觉-语言混合专家模型的负载不平衡问题,提出ReBA方法,通过引入图像和文本的独立路由项,在保持任务准确率的同时降低了不同场景下的负载。
Comments 22 pages, including appendices. Code available at https://github.com/ZiangWu-77/ReBA
TraceCLIP:从Patch-to-CLS贡献中恢复局部语义
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
AI总结 TraceCLIP是一种无训练视觉-语言框架,通过分离CLS注意力输出的Patch特定术语恢复局部语义,在8个零样本语义分割基准上较现有无训练方法平均mIoU提升1.3至4.5个点。
Comments 9 pages, 3 figures, 4 tables
阿格斯统一模型:迈向紧凑且经济的图像理解与生成统一模型
机构 * Sony AI(索尼人工智能公司)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究旨在统一图像理解与生成,提出阿格斯统一模型,利用预训练视觉语言模型,引入混合视觉令牌,分两阶段训练,以最少数据和低成本实现良好性能,达当前最优,可作统一模型开发基线。
ERUnderstand:在结构化实体关系图上评估视觉语言模型
机构 * Temple University(天普大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究针对实体关系图仅为图像限制AI辅助数据库工程的问题,引入ERUnderstand基准测试。通过对2960个图表及标准化表示评估视觉语言模型,发现常见元素恢复良好,但特定元素性能差,推理增强模型可提升性能,为评估多模态理解提供基准。
无坐标或区域标签的视觉文档理解中的证据归因
机构 * Aalto University(阿尔托大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 研究视觉文档理解中无坐标或区域标签时的证据归因问题,通过对比坐标与语言接口,发现语言接口能提升证据召回率、降低幻觉率。基于此用引述和检索管道作训练框架,引入GRPO方法,提高了模型严格归因准确率,找到改善归因的实用路径。
基于推理的防护栏何时效率不高?ResponseGuard:用于实时审核的快速视觉语言防护工具
机构 * POSTECH(浦项科技大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究视觉语言防护栏筛查回复是否需推理,提出无链式推理的ResponseGuard,通过对请求、回复和图像的单一合并表示一次前向传递读取有害裁决,在回复有害性检测上优于基于推理的防护栏,且时间成本低,还发现了差距原因及推理防护栏注意力问题。
Comments 8 pages, 6 figures, 3 tables. Project page: https://ndb796.github.io/ResponseGuard ; Code: https://github.com/ndb796/ResponseGuard
用于增强大型视觉语言模型鲁棒性的对偶对抗微调
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 针对大型视觉语言模型视觉输入易受攻击且现有防御方法缺乏通用性的问题,提出对偶对抗微调框架,通过联合优化视觉和语义监督信号增强模型鲁棒性,实验证明该方法在多任务对抗鲁棒性评估中表现优异。
Med-OPD:通过证据感知策略蒸馏改进医学视觉语言模型
机构 * National University of Singapore(新加坡国立大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究针对医学视觉语言模型依赖语言先验而非视觉证据推理的问题,提出Med-OPD框架,引入医学证据优势信号,在令牌和轨迹级别重新分配蒸馏信号,实验证明该方法能加强模型对关键视觉证据的依赖,提升多模态医学推理能力。
动作QFormer:视觉-语言-动作模型中动作监督下的结构化表示塑造
机构 * Shanghai Qizhi Institute(上海期智研究院) ; The Chinese University of Hong Kong(香港中文大学) ; Hong Kong Embodied AI Lab(香港具身人工智能实验室) ; Tsinghua University(清华大学) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究视觉-语言-动作模型中动作监督问题,提出动作QFormer,通过基于指令的查询重组多模态信息。在零样本模拟到真实导航中提升了任务成功率、动作生成正确性等,还改变动作监督塑造多模态表示的方式,为提高VLA性能提供新思路。
一眼识你:从面部推断表面人格
机构 * Institute of Automation, CAS(中国科学院自动化研究所) ; Institute of Information Engineering, CAS(中国科学院信息工程研究所) ; School of Cyber Security, UCAS(中国科学院大学网络空间安全学院) ; School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) ; Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science & Innovation, CAS(中国科学院香港创新研究院人工智能与机器人中心) ; School of Computer Science and Engineering, the Faculty of Innovation Engineering, M.U.S.T(澳门科技大学创新工程学院计算机科学与工程系)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究从面部图像推断表面人格,提出GlanceFace框架,利用视觉语言模型、语义增强模块及不确定性感知学习策略,在基于MBTI的基准测试中表现出色,揭示面部特征与人格特质关系,助力具身智能体交互策略。
Comments Accepted by The 9th Chinese Conference on Pattern Recognition and Computer Vision, PRCV2026
用于脑肿瘤视觉指令微调的多语言模型协作式MRI报告生成
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
AI总结 针对脑肿瘤缺乏配对3D成像 - 文本数据问题,提出用多语言模型协作创建3D图像 - 文本数据集,构建VLM将MRI扫描转换为令牌并与文本指令对齐,该方法在报告生成等任务中表现优于其他方法,有助于脑肿瘤诊断治疗。
在重要时刻思考:用于社交导航的基于RL策略的条件VLM推理
机构 * Institut des Systèmes Intelligents et de Robotique (ISIR)(智能系统与机器人研究所)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 研究社交机器人导航中强化学习策略缺乏语义推理能力的问题,提出HUMA混合架构,动态平衡RL策略与VLM的优势。在基准测试中任务成功率提高,减少碰撞,消融研究验证组件,实际部署证明方法可行。
Comments CoRL 2026 submission. 15 pages, 7 figures
检测人工智能生成的视频:视觉-语言双视角综述
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学中关村人工智能学院) ; Harvard University(哈佛大学)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL
AI总结 综述人工智能生成视频检测,将任务重定义为事实保真度验证,提出视觉-语言双视角分类法,基于对221篇论文回顾,综合生成范式、审视检测方法、回顾评估指标,讨论挑战并指出未来方向。
Comments 51 pages, accepted by ACL 2026
Journal ref Association for Computational Linguistics 2026 pages 32221 to 32255
WasteAssistant:用于智能垃圾分类与可持续管理的监管引导视觉问答框架
机构 * SVNIT(萨达尔·瓦拉巴伊·国家理工学院) ; NTNU(挪威科技大学) ; KIIT(卡林加工业技术学院)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对现有智能垃圾分类系统的不足,提出集成视觉语言模型和多模态大语言模型的框架,构建新数据集,经实验验证基于BLIP的模型效果更佳,提升了分类准确率,确保监管合规,推动多模态AI在垃圾管理中的应用。
Comments 12 Pages, 5 Figures
ALICE:从视觉、视觉语言和玻片级专家学习通用病理学基础模型
机构 * Institute of Biopharmaceutical and Health Engineering, Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学生物医药与健康工程研究院,清华大学深圳国际研究生院) ; Department of Engineering Science, University of Oxford(牛津大学工程科学系) ; Department of Pathology, The First Affiliated Hospital of Sun Yat-sen University(中山大学附属第一医院病理科) ; Medical Optical Technology R&D Center, Research Institute of Tsinghua, Pearl River Delta(清华珠三角研究院医学光学技术研发中心)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究提出通过多阶段凝聚蒸馏训练的ALICE统一基础模型,将多种教师模型知识整合到单个主干。它在大量图像上预训练,经多场景多任务评估,在任务匹配病理基础模型中平均排名最佳,证明凝聚蒸馏可整合能力用于广泛病理学应用。
基于连续元数据条件的参数高效视觉语言适配用于动物再识别
机构 * Department of Computer Science, University of Verona(维罗纳大学计算机科学系) ; Institute of Marine Research(海洋研究所) ; University of Agder, Centre for Coastal Research(阿格德大学海岸研究中心)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 针对动物再识别中适应纵向生态环境的挑战,提出基于连续元数据条件的参数高效CLIP适配框架,通过保留元数据连续结构,在训练中平滑调制嵌入空间,提升了对外观变化和分布偏移的鲁棒性,实现纯视觉推理管道。
Comments This is the author's version of the paper accepted for publication in Expert Systems with Applications. The final authenticated version will be available from the publisher
自动驾驶视觉问答:以事件为中心的行车记录仪理解视觉语言模型基准测试
机构 * University of Colorado Colorado Springs(科罗拉多大学科罗拉多斯普林斯分校) ; University of Michigan(密歇根大学) ; University of Notre Dame(圣母大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 针对评估视觉语言模型对安全关键事件推理能力的挑战,提出AUTOPILOT-VQA基准,通过围绕真实驾驶事件的结构化问题评估系统,涵盖多安全相关类别,推动向安全意识推理发展,为自动驾驶系统评估提供标准,助力相关视觉语言系统开发。
Comments CVPR Autopilot Workshop
语义概念空间中的可解释新类别发现
机构 * Department of Computer Science, University of South Dakota(南达科他大学计算机科学系) ; Department of Computer Science and Software Engineering, Auburn University(奥本大学计算机科学与软件工程系)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 提出xNCD框架,在结构化语义概念空间进行基于表示的发现和伪标签分配,通过视觉与语言先验对齐学习无标签概念表示,使发现类别可解释,实验证明其有强发现性能和内在解释。
IRIS:一种通过主题树和场景驱动的VQA生成用于眼表疾病的智能视觉语言系统
机构 * The Chinese University of Hong Kong(香港中文大学) ; Westlake University(西湖大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 针对眼表疾病领域缺乏多模态数据问题,引入IRIS系统。构建IRIS-120K数据集,提出协同数据生成范式,含主题发现树和场景驱动策略,使4B参数VLM性能达最优。
Comments 11 pages, 3 figures
标准条件上下文学习:评估视觉语言模型中的标准转移适应性
机构 * Megvii Technology Inc., Beijing, China(美科科技有限公司,北京,中国)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究提出标准条件上下文学习(CC-ICL)新设置,模型需从上下文推断潜在标准并据此调整预测。为此提出两个评估指标,构建CC-Bench基准。实验发现多数模型有边界偏差,简单多标准训练可改善。
Comments Accepted by ICML 2026
基于强化学习的视觉语言模型视觉接地自反思
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; New York University(纽约大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 提出VRRL框架,通过随机掩码轨迹前缀和缓冲回滚机制,增强视觉语言模型在分布外场景下的视觉接地自反思能力,显著提升准确率。
LeVLJEPA:无负样本的端到端视觉语言预训练
机构 * German Cancer Research Center(德国癌症研究中心) ; German Cancer Consortium(德国癌症联盟) ; Goethe University Frankfurt(法兰克福大学) ; Brown University(布朗大学)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 提出首个完全非对比的端到端视觉语言预训练方法LeVLJEPA,通过跨模态预测与分布正则化学习,无需负样本、温度参数等,生成更强的密集语义特征,在下游任务中优于对比基线。