Continual Learning for VLMs: A Survey and Taxonomy Beyond Forgetting
视觉语言模型的持续学习:超越遗忘的综述与分类
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文综述了视觉语言模型的持续学习挑战,提出四种核心范式以解决跨模态特征漂移和灾难性遗忘问题,强调零样本学习和智能体生态系统的发展。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
视觉语言模型的持续学习:超越遗忘的综述与分类
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文综述了视觉语言模型的持续学习挑战,提出四种核心范式以解决跨模态特征漂移和灾难性遗忘问题,强调零样本学习和智能体生态系统的发展。
Precise Shield:通过神经层面指导解释和对齐VLLM安全
机构 * Nanjing University of Science and Technology(南京理工大学) ; National University of Singapore(新加坡国立大学) ; Beihang University(北京航空航天大学) ; Nanjing Forestry University(南京林业大学)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出Precise Shield框架,通过对比有害与良性输入的激活模式识别安全神经元,并通过梯度掩码限制参数更新,提升VLLM安全性能并保持多语言多模态泛化能力。
MinerU-Popo:结构化文档解析的通用后处理模型
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 提出MinerU-Popo轻量级通用后处理框架,通过分解为文本/表格截断恢复、标题层级重建和图文关联四个子任务,并利用动态分块和重叠同步将OCR页面级结果重构为文档级逻辑结构,显著提升标题层级TEDS和RAG准确性。
Comments The code is available at https://github.com/opendatalab/MinerU-Popo
PathAgentBench:在全切片病理图像上对寻求证据的视觉语言模型进行基准测试
机构 * National University of Singapore(新加坡国立大学) ; PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) ; Peking Union Medical College Hospital(北京协和医院)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 研究针对全切片病理图像诊断中证据获取与整合问题,引入PathAgentBench基准,评估视觉语言模型的四项互补能力,包含多模型评估结果,揭示了证据推理与获取间的差距,为改进病理模型提供统一框架。
S-GRPO:面向大视觉语言模型的统一后训练方法
机构 * Tencent(腾讯)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 本文提出S-GRPO,结合模仿学习指导与偏好优化的多轨迹探索,通过条件真实轨迹注入机制解决SFT与RL的效率问题,提升收敛速度与领域适应能力。
基于28万份常规报告的肠镜报告驱动的视觉-语言基础模型
机构 * Digital Medical Research Center, School of Basic Medical Sciences, Fudan University(复旦大学基础医学院数字医学研究中心) ; Shanghai Collaborative Innovation Center of Endoscopy(上海内镜诊疗协同创新中心) ; Zhejiang University(浙江大学) ; Shanghai Institute for Advanced Study of Zhejiang University(浙江大学上海高等研究院) ; Alliance Manchester Business School, The University of Manchester(曼彻斯特大学联盟曼彻斯特商学院) ; Data Science Institute, Imperial College London(伦敦帝国理工学院数据科学研究所) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 图文多模态 :image-text(abstract);分类 cs.AI
AI总结 该研究开发了肠镜视觉-语言基础模型EndoCLIP,利用28万份常规肠镜记录恢复的图像-文本对训练,在多项任务中优于通用模型,良恶性分类性能接近专家,可实现临床目标的语言指定。
扩大视觉-语言模型规模不足以缓解偏见
机构 * Information Technologies Institute, CERTH(CERTH信息技术研究所)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 该研究通过对194个视觉-语言模型的大规模实证分析,发现扩大模型规模无法缓解偏见,训练数据属性对偏见鲁棒性更关键,架构选择效果依赖基准特性。
跨架构视觉语言模型中基于方向的推理时防御措施审计
专题命中 图文多模态 :multimodal(abstract);分类 cs.AI
AI总结 该研究审计了视觉语言模型中5种基于方向的推理时防御,发现其性能具架构特异性,部分防御间几何重叠,需按解码器家族单独校准。
通过语义-几何保持实现视觉-语言模型的持续学习
机构 * School of Information and Communication Engineering, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出SeGP-CL方法,通过构建对抗锚点和跨模态几何蒸馏,解决持续学习中的语义几何退化问题,提升模型稳定性和迁移能力。
Comments Accepted by IEEE TCSVT 2026