Continual Learning for VLMs: A Survey and Taxonomy Beyond Forgetting
视觉语言模型的持续学习:超越遗忘的综述与分类
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文综述了视觉语言模型的持续学习挑战,提出四种核心范式以解决跨模态特征漂移和灾难性遗忘问题,强调零样本学习和智能体生态系统的发展。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
视觉语言模型的持续学习:超越遗忘的综述与分类
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文综述了视觉语言模型的持续学习挑战,提出四种核心范式以解决跨模态特征漂移和灾难性遗忘问题,强调零样本学习和智能体生态系统的发展。
Precise Shield:通过神经层面指导解释和对齐VLLM安全
机构 * Nanjing University of Science and Technology(南京理工大学) ; National University of Singapore(新加坡国立大学) ; Beihang University(北京航空航天大学) ; Nanjing Forestry University(南京林业大学)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出Precise Shield框架,通过对比有害与良性输入的激活模式识别安全神经元,并通过梯度掩码限制参数更新,提升VLLM安全性能并保持多语言多模态泛化能力。
MinerU-Popo:结构化文档解析的通用后处理模型
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 提出MinerU-Popo轻量级通用后处理框架,通过分解为文本/表格截断恢复、标题层级重建和图文关联四个子任务,并利用动态分块和重叠同步将OCR页面级结果重构为文档级逻辑结构,显著提升标题层级TEDS和RAG准确性。
Comments The code is available at https://github.com/opendatalab/MinerU-Popo
PathAgentBench:在全切片病理图像上对寻求证据的视觉语言模型进行基准测试
机构 * National University of Singapore(新加坡国立大学) ; PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) ; Peking Union Medical College Hospital(北京协和医院)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 研究针对全切片病理图像诊断中证据获取与整合问题,引入PathAgentBench基准,评估视觉语言模型的四项互补能力,包含多模型评估结果,揭示了证据推理与获取间的差距,为改进病理模型提供统一框架。
S-GRPO:面向大视觉语言模型的统一后训练方法
机构 * Tencent(腾讯)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 本文提出S-GRPO,结合模仿学习指导与偏好优化的多轨迹探索,通过条件真实轨迹注入机制解决SFT与RL的效率问题,提升收敛速度与领域适应能力。
通过语义-几何保持实现视觉-语言模型的持续学习
机构 * School of Information and Communication Engineering, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出SeGP-CL方法,通过构建对抗锚点和跨模态几何蒸馏,解决持续学习中的语义几何退化问题,提升模型稳定性和迁移能力。
Comments Accepted by IEEE TCSVT 2026
SyncBreaker:面向音频驱动生成的多模态对抗攻击框架
机构 * University of Science and Technology of China(中国科学技术大学) ; Beijing University of Technology(北京工业大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV
AI总结 针对音频驱动生成中单模态防护不足的问题,提出SyncBreaker框架,通过多模态联合扰动提升防护效果,有效抑制唇同步和面部动态。
GIM-ENDO:用于胃肠化生形态与病理的多模态内镜图像和视频数据集
机构 * Gastroenterology and Liver Disease Research Center, Research Institute for Gastroenterology and Liver Diseases, Shahid Beheshti University of Medical Sciences(沙希德·贝赫什提医科大学胃肠病与肝病研究中心,胃肠病与肝病研究所) ; Iran University of Medical Sciences(伊朗医科大学) ; Shiraz University of Medical Sciences(设拉子医科大学) ; Gastroenterology Department, Amiralam Hospital, Tehran University of Medical Sciences(德黑兰医科大学阿米拉拉姆医院胃肠病科) ; Department of Computer Engineering, Science and Research Branch, Islamic Azad University(伊斯兰阿扎德大学科学与研究分校计算机工程系)
专题命中 视频多模态 :multimodal(title);分类 cs.CV
AI总结 针对胃黏膜肠化生(GIM)公开数据集缺失的问题,构建了包含多模态内镜图像、视频及病理标注的数据集GIM-ENDO,涵盖六种主要内镜征象和亚型分级,以促进AI辅助诊断。
StateScribe: 向现实世界重访中的可访问性变化意识迈进
专题命中 视频多模态 :multimodal(abstract)
AI总结 StateScribe通过双层记忆架构实现跨重访的现实变化感知,提高盲人和低视力用户对环境变化的认知能力,准确率达83.1%。
学习多模态内容的稀疏表示以增强冷启动项目推荐
专题命中 跨模态检索 :multimodal(title,abstract)
AI总结 针对数字平台项目目录规模大及冷启动问题,提出利用稀疏嵌入优势,通过改进冷启动训练方法和设计预稀疏化激活技术,降低存储成本并提升冷启动推荐准确性,还展示了稀疏内容嵌入的可解释性与稳健性。
Comments Accepted at RecSys 2026
通过多模态强化学习扩展医学影像报告生成
机构 * Microsoft Research(微软研究院)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL
AI总结 本文提出UniRG框架,通过多模态强化学习提升医学影像报告生成的性能和泛化能力,在CXR报告生成中取得新的SOTA成绩。
流形上加权测度的热核熵剖面与几何有效样本量
机构 * Baruch College(巴克尔学院)
专题命中 多模态生成 :multimodal(abstract)
AI总结 研究紧致流形上加权测度,引入热核熵剖面这一多尺度总结方法,通过内在热流扩散加权原子并跟踪尺度不均匀性,可计算二阶Rényi熵的几何有效样本量,实验表明其能揭示传统总结遗漏的结构。
SeedPolicy: 通过自进化扩散策略实现机器人操控的水平扩展
机构 * Sichuan University(四川大学) ; Dexmal Inc.(Dexmal公司) ; Independent Researcher(独立研究员) ; UESTC
专题命中 多模态生成 :multi-modal(abstract)
AI总结 本文提出SEGA模块,通过门控注意力机制提升扩散策略在长时域操控中的表现,实验表明其在RoboTwin 2.0基准上优于现有方法,具有更高的效率和性能。
Comments 17 pages, 13 figures
面向社交媒体中统一的多模态虚假信息检测:基准数据集与基线模型
机构 * School of Computer Science and Information Engineering, Hefei University of Technology(计算机科学与信息工程学院,合肥工业大学) ; School of Computer Science and Technology, Northwestern Polytechnical University(计算机科学与技术学院,西北工业大学)
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 该研究构建了含9.8万样本的OmniFake基准数据集,提出UMFDet框架,实现对人工与AI生成两类多模态虚假内容的统一检测,性能优于专用基线。
RetiBridge:用知识引导的多模态大语言模型连接定量视网膜生物标志物与定性诊断
机构 * University of Liverpool(利物浦大学) ; Institute of Life Course & Medical Sciences(生命课程与医学科学研究院) ; Department of Eye and Vision Sciences(眼科与视觉科学系) ; Computer Science Department(计算机科学系) ; Cardiovascular & Metabolic Medicine(心血管与代谢医学) ; Liverpool Centre for Cardiovascular Science(利物浦心血管科学中心)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.AI
AI总结 该研究提出RetiBridge模型,结合CFP、OCT数据与文本,通过知识引导微调学习定量到定性诊断路径,在眼科理解基准上表现优于开源基线及OpenAI o3,代码数据已公开。
Comments 10 pages, 4 figures, 3 table. Equal contribution: Zhuangzhi Gao and Hongyi Qin. Corresponding author: Yalin Zheng (yzheng@liverpool.ac.uk)
多模态空间推理的视觉信用审计
专题命中 多模态评测 :multimodal(title);MLLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 该研究提出视觉信用审计(VCA)方法,分解多模态空间推理基准的成功维度,发现部分模型决策正确但未获图像额外信用,验证了其在评估模型视觉关系响应上的有效性。
Comments 20 pages, 2 figures. Code: https://github.com/SouthWinter/VCA
从压缩CT学习:用于资源高效医学图像分析的特征注意力风格迁移和结构化因子化投影
机构 * Department of Electrical and Electronic Engineering, Bangladesh University of Engineering and Technology(电气电子工程系,孟加拉工程与技术大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 本文提出FAST和SFP方法,通过压缩CT体积进行胸腔异常检测,实现低资源部署和高效数据传输,实验表明CT-Lite在压缩输入下达到接近未压缩基线的AUROC性能。
通过协调智能体流关联异构数据以开展社交媒体分析
机构 * Zhejiang University(浙江大学) ; Department of Communication, Michigan State University(密歇根州立大学通讯系)
专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI
AI总结 本研究提出LLM智能体系统SIA,通过协调智能体流关联社交媒体异构多模态数据,采用阶段同步策略挖掘洞见,经评估可发现多样有意义的洞见,为社交媒体分析提供新方法。
MOON2.0:动态模态平衡多模态表示学习用于电商产品理解
机构 * Alibaba Group(阿里巴巴集团)
专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);image-text(abstract);分类 cs.CV、cs.AI
AI总结 MOON2.0通过动态模态平衡框架解决电商多模态数据中的模态不平衡、信息对齐不足和噪声处理问题,提出MoE、双层对齐和图像-文本共增强策略,提升零样本性能和多模态对齐质量。
Comments Accepted by the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2026. 11 pages, 7 figures
面向高效多模态序列推荐的态空间双重视角
专题命中 多模态训练与对齐 :multi-modal(title,abstract);multimodal(abstract);cross-modal(abstract)
AI总结 本文提出MMM4Rec模型,通过结合态空间双重视角和全局时间建模,提升多模态序列推荐的迁移效率与准确性,实验表明其在大规模下游数据集上收敛速度提升10倍。
面向口腔病变分类的患者感知多模态RGB-HSI融合:通过增量启发式元学习
机构 * 1 School of Medical Science \& Technology, IIT Kharagpur, India 2 Department of Electrical Engineering, IIT Kharagpur, India 3 Dr. B.C. Roy Multispeciality Medical Research Centre, IIT Kharagpur, India
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出了一种面向口腔病变分类的患者感知多模态RGB-HSI融合方法,结合深度学习、光谱分析和人口统计数据,通过增量启发式元学习提升诊断鲁棒性。
Comments Accepted at MICCAI MultiTab Workshop 2026
医学影像AI中的可扩展漂移监测
专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV
AI总结 本研究针对医学影像AI的模型漂移与可靠性问题,开发了基于CheXstray框架的增强型可扩展漂移监测框架MMC+,经真实世界数据验证可有效检测数据偏移并预警性能偏差,助力AI在临床场景的应用。
球面上加权经验测度的几何信息分解
专题命中 其他多模态 :multimodal(abstract)
AI总结 研究单位球面上加权概率测度的方向不确定性,传统方法用von Mises-Fisher分布不完整,引入几何信息分解(GID),通过球面特征拟合最大熵投影序列,证明相关性质,实验展示不同情况下GID作用。