Continual Learning for VLMs: A Survey and Taxonomy Beyond Forgetting
视觉语言模型的持续学习:超越遗忘的综述与分类
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文综述了视觉语言模型的持续学习挑战,提出四种核心范式以解决跨模态特征漂移和灾难性遗忘问题,强调零样本学习和智能体生态系统的发展。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
视觉语言模型的持续学习:超越遗忘的综述与分类
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文综述了视觉语言模型的持续学习挑战,提出四种核心范式以解决跨模态特征漂移和灾难性遗忘问题,强调零样本学习和智能体生态系统的发展。
Precise Shield:通过神经层面指导解释和对齐VLLM安全
机构 * Nanjing University of Science and Technology(南京理工大学) ; National University of Singapore(新加坡国立大学) ; Beihang University(北京航空航天大学) ; Nanjing Forestry University(南京林业大学)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出Precise Shield框架,通过对比有害与良性输入的激活模式识别安全神经元,并通过梯度掩码限制参数更新,提升VLLM安全性能并保持多语言多模态泛化能力。
MinerU-Popo:结构化文档解析的通用后处理模型
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 提出MinerU-Popo轻量级通用后处理框架,通过分解为文本/表格截断恢复、标题层级重建和图文关联四个子任务,并利用动态分块和重叠同步将OCR页面级结果重构为文档级逻辑结构,显著提升标题层级TEDS和RAG准确性。
Comments The code is available at https://github.com/opendatalab/MinerU-Popo
PathAgentBench:在全切片病理图像上对寻求证据的视觉语言模型进行基准测试
机构 * National University of Singapore(新加坡国立大学) ; PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) ; Peking Union Medical College Hospital(北京协和医院)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 研究针对全切片病理图像诊断中证据获取与整合问题,引入PathAgentBench基准,评估视觉语言模型的四项互补能力,包含多模型评估结果,揭示了证据推理与获取间的差距,为改进病理模型提供统一框架。
S-GRPO:面向大视觉语言模型的统一后训练方法
机构 * Tencent(腾讯)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 本文提出S-GRPO,结合模仿学习指导与偏好优化的多轨迹探索,通过条件真实轨迹注入机制解决SFT与RL的效率问题,提升收敛速度与领域适应能力。
基于28万份常规报告的肠镜报告驱动的视觉-语言基础模型
机构 * Digital Medical Research Center, School of Basic Medical Sciences, Fudan University(复旦大学基础医学院数字医学研究中心) ; Shanghai Collaborative Innovation Center of Endoscopy(上海内镜诊疗协同创新中心) ; Zhejiang University(浙江大学) ; Shanghai Institute for Advanced Study of Zhejiang University(浙江大学上海高等研究院) ; Alliance Manchester Business School, The University of Manchester(曼彻斯特大学联盟曼彻斯特商学院) ; Data Science Institute, Imperial College London(伦敦帝国理工学院数据科学研究所) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 图文多模态 :image-text(abstract);分类 cs.AI
AI总结 该研究开发了肠镜视觉-语言基础模型EndoCLIP,利用28万份常规肠镜记录恢复的图像-文本对训练,在多项任务中优于通用模型,良恶性分类性能接近专家,可实现临床目标的语言指定。
扩大视觉-语言模型规模不足以缓解偏见
机构 * Information Technologies Institute, CERTH(CERTH信息技术研究所)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 该研究通过对194个视觉-语言模型的大规模实证分析,发现扩大模型规模无法缓解偏见,训练数据属性对偏见鲁棒性更关键,架构选择效果依赖基准特性。
跨架构视觉语言模型中基于方向的推理时防御措施审计
专题命中 图文多模态 :multimodal(abstract);分类 cs.AI
AI总结 该研究审计了视觉语言模型中5种基于方向的推理时防御,发现其性能具架构特异性,部分防御间几何重叠,需按解码器家族单独校准。
通过语义-几何保持实现视觉-语言模型的持续学习
机构 * School of Information and Communication Engineering, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出SeGP-CL方法,通过构建对抗锚点和跨模态几何蒸馏,解决持续学习中的语义几何退化问题,提升模型稳定性和迁移能力。
Comments Accepted by IEEE TCSVT 2026
基于凸特征嵌入学习的人脸与声音跨模态关联
专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CV
AI总结 本文提出结合跨模态注意力机制的凸特征嵌入方法,解决人脸与声音跨模态关联中的特征异质性问题,在VoxCeleb数据集的相关任务上较现有方法有显著提升。
Journal ref Multimedia Systems, vol. 31, no. 4, pp. 296, July 2025
Digital Harf:用于普及型阿拉伯语言语和语言治疗的临床整合多模态AI系统
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
AI总结 Digital Harf是专为阿拉伯语自闭症儿童设计的多模态AI治疗平台,其核心Agentic合成数据引擎解决阿拉伯语治疗内容短缺问题,获专家高接受率,为代表性语言环境构建AI治疗系统提供了思路。
SyncBreaker:面向音频驱动生成的多模态对抗攻击框架
机构 * University of Science and Technology of China(中国科学技术大学) ; Beijing University of Technology(北京工业大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV
AI总结 针对音频驱动生成中单模态防护不足的问题,提出SyncBreaker框架,通过多模态联合扰动提升防护效果,有效抑制唇同步和面部动态。
WeSep:面向目标说话人提取的模块化与线索可组合框架
专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS
AI总结 WeSep是将目标说话人提取重新表述为异质线索条件学习问题的统一框架,通过模块化设计提升灵活性,多模态实验验证其稳定性,工具包将公开。
Comments 6 pages, accepted by Interspeech 2026
HyperClaim:用于视频虚假信息检测的细粒度跨模态超图推理
专题命中 视频多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI、cs.MM
AI总结 HyperClaim是一种用于视频虚假信息检测的判别式时间超图框架,通过细粒度跨模态超图推理,在FactGuard协议下的三个数据集上准确率优于基线方法。
Comments 13 pages, including supplementary material
GIM-ENDO:用于胃肠化生形态与病理的多模态内镜图像和视频数据集
机构 * Gastroenterology and Liver Disease Research Center, Research Institute for Gastroenterology and Liver Diseases, Shahid Beheshti University of Medical Sciences(沙希德·贝赫什提医科大学胃肠病与肝病研究中心,胃肠病与肝病研究所) ; Iran University of Medical Sciences(伊朗医科大学) ; Shiraz University of Medical Sciences(设拉子医科大学) ; Gastroenterology Department, Amiralam Hospital, Tehran University of Medical Sciences(德黑兰医科大学阿米拉拉姆医院胃肠病科) ; Department of Computer Engineering, Science and Research Branch, Islamic Azad University(伊斯兰阿扎德大学科学与研究分校计算机工程系)
专题命中 视频多模态 :multimodal(title);分类 cs.CV
AI总结 针对胃黏膜肠化生(GIM)公开数据集缺失的问题,构建了包含多模态内镜图像、视频及病理标注的数据集GIM-ENDO,涵盖六种主要内镜征象和亚型分级,以促进AI辅助诊断。
超越帧选择:用于长视频理解的生成式潜在证据聚合
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Baidu Inc.(百度公司) ; Alibaba Group(阿里巴巴集团) ; Xidian University(西安电子科技大学)
专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 该研究针对长视频理解的帧选择局限,提出GenEvA框架,通过查询条件化分布聚合跨帧潜在证据,在四个基准和两个视频多模态大语言模型主干上显著提升性能且开销极低。
神经网络中的隐状态:从模型权重中恢复漂移数据的时间结构
机构 * Princeton University(普林斯顿大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 该研究通过对连续时间窗口分类器的对齐权重轨迹拟合HMM,从模型权重中恢复离散状态,在Fakeddit和Yelp数据集上验证了状态内迁移优势,且该优势与数据分布外的迁移结构相关。
StateScribe: 向现实世界重访中的可访问性变化意识迈进
专题命中 视频多模态 :multimodal(abstract)
AI总结 StateScribe通过双层记忆架构实现跨重访的现实变化感知,提高盲人和低视力用户对环境变化的认知能力,准确率达83.1%。
FiRE:利用细粒度上下文学习增强多模态大语言模型(MLLMs)以实现复杂图像检索
机构 * Shandong University(山东大学) ; City University of Hong Kong(香港城市大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Shandong Jianzhu University(山东建筑大学)
专题命中 跨模态检索 :multimodal(abstract,abstract_cn);MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 本研究针对MLLMs在复杂图像检索任务中细粒度建模不足的问题,提出自动化细粒度多模态五元组数据集构建流程与两阶段微调策略,在零样本设置下于五个数据集上取得优于现有方法的性能。
Journal ref Proceedings of the ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2025)
DualG-MRAG:面向多模态检索增强生成的宏观推理与微观匹配解耦框架
机构 * Beihang University(北京航空航天大学) ; SKLCCSE
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 针对多模态RAG在复杂多跳推理中存在的问题,本文提出DualG-MRAG框架,通过解耦宏观推理与微观匹配抑制检索噪声,经实验验证其在证据召回和问答准确率上优于基线。
Comments Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026). 12 pages
RRM:用于长周期多模态推理的经验驱动反思式检索记忆
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL
AI总结 该研究针对现有多模态长期智能体检索机制不足的问题,提出RRM框架,通过反思式经验记忆提炼跨任务检索策略,在多个多模态推理数据集上取得优于现有方法的性能。
学习多模态内容的稀疏表示以增强冷启动项目推荐
专题命中 跨模态检索 :multimodal(title,abstract)
AI总结 针对数字平台项目目录规模大及冷启动问题,提出利用稀疏嵌入优势,通过改进冷启动训练方法和设计预稀疏化激活技术,降低存储成本并提升冷启动推荐准确性,还展示了稀疏内容嵌入的可解释性与稳健性。
Comments Accepted at RecSys 2026
CXR-Retrieve:胸部X线摄影中的组合式文本到图像检索
机构 * Technion – Israel Institute of Technology(以色列理工学院) ; Ben-Gurion University of the Negev(内盖夫本-古里安大学)
专题命中 跨模态检索 :image-text(abstract);分类 cs.CV
AI总结 针对胸部X线检索的目标不匹配问题,提出CXR-Retrieve基准与标签感知对比微调方法,在双病理组合和否定查询的Precision@5上较CXR-CLIP分别提升8.5和22.0个百分点。
面向设备内上下文学习的无梯度任务条件检索
机构 * City University of Hong Kong(香港城市大学)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL
AI总结 该研究提出无梯度框架CoRA,实现设备内任务条件检索,无需检索器微调等操作,在多数据集及树莓派5部署中展现有效性。
Comments Under review
基于并行轨迹回火的能量基模型的均衡训练
机构 * Université Paris-Saclay(巴黎萨克雷大学) ; CNRS(法国国家科学研究中心) ; INRIA(法国国家信息与自动化研究所) ; Escuela Técnica Superior de Ingenieros Industriales(工业工程师高等技术学院) ; Universidad Politécnica de Madrid(马德里理工大学) ; Universidad Complutense de Madrid(马德里康普顿斯大学)
专题命中 跨模态检索 :multimodal(abstract)
AI总结 该研究提出基于并行轨迹回火(PTT)的 EBM 训练算法,结合水库采样与自适应优化,可稳定快速训练,性能优于现有方法,使 EBM 的均衡最大似然训练更实用高效。
Comments 11 pages, 7 figures
IndustryForge-27B:面向工业CAD的领域增强多模态基础模型
专题命中 多模态生成 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.AI
AI总结 该研究构建基于Qwen3.5-VL-27B的IndustryForge-27B多模态基础模型,整合6个工业CAD子语料库训练,在CAD基准测试中性能远超基础模型与GPT-5.4,可作为工业智能体的通用基础。
Comments 14 pages
RefineSVG:视觉反馈驱动的图像转SVG生成强化学习
机构 * Shenzhen University(深圳大学) ; Peking University(北京大学)
专题命中 多模态生成 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 RefineSVG是一种视觉反馈驱动的闭环框架,通过引入SVG语义词汇表和渐进式训练,使MLLM实现高保真图像转SVG生成,性能优于现有基线。
Comments 17 pages, 5 main-paper figures. Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026). Includes the complete supplementary material
通过多模态强化学习扩展医学影像报告生成
机构 * Microsoft Research(微软研究院)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL
AI总结 本文提出UniRG框架,通过多模态强化学习提升医学影像报告生成的性能和泛化能力,在CXR报告生成中取得新的SOTA成绩。
Chimera:设计与遵循Chinchilla缩放规律的混合视觉扩散Transformer
机构 * Adobe Research(奥多比研究院)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 Chimera是一款混合视觉扩散骨干网络,结合KDA、MLA等模块与HeteroP缩放方案,训练出11B参数(2B激活)的模型,在计算效率、视频泛化等方面优于基线,为长上下文扩散架构设计提供基础。
Comments 40 pages
一次思考足矣:面向高分辨率视觉问答的中间层证据路由
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 本文针对高分辨率视觉问答提出无需训练的Thinking-Once证据路由方法,通过利用中间层留存的细粒度证据,在多个基准上提升性能并降低内存与推理时间。