Routing-Based Continual Learning for Multimodal Large Language Models
基于路由的多模态大语言模型持续学习
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种基于路由的持续学习方法,用于多模态大语言模型,有效缓解灾难性遗忘并提升跨模态迁移性能,同时保持训练效率。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
基于路由的多模态大语言模型持续学习
专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种基于路由的持续学习方法,用于多模态大语言模型,有效缓解灾难性遗忘并提升跨模态迁移性能,同时保持训练效率。
ForgeryGPT: 一种多模态大语言模型用于可解释的图像伪造检测与定位
机构 * University of Science and Technology of China(中国科学技术大学) ; Tsinghua University(清华大学)
专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)
AI总结 ForgeryGPT通过多模态大语言模型捕捉伪造图像的高阶取证知识关联,实现可解释的图像伪造检测与定位,提升检测精度和交互能力。
Comments 13 pages, 9 figures
通过KL优化微调控制多轮LLM生成的分布偏倚
机构 * University of Melbourne(墨尔本大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Oracle(甲骨文公司)
专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 本文提出通过KL优化微调结合语义对齐的方法,解决多轮LLM生成中分布控制问题,实验显示其在属性生成任务中表现优异。
Comments Accepted at ACL Main Conference
Sim-CLIP: 无监督的孪生对抗微调用于鲁棒且语义丰富的视觉-语言模型
机构 * Florida Atlantic University(佛罗里达大西洋大学)
专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Sim-CLIP通过无监督对抗微调提升CLIP视觉编码器的鲁棒性,同时保持语义表示。采用孪生架构和余弦相似度目标,避免大批次对比学习和额外动量编码器,实现低计算开销的鲁棒训练。
Comments Accepted at IJCNN 2026
LLM4CodeRE: 生成式AI用于代码反编译分析与逆向工程
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)
AI总结 本文提出LLM4CodeRE框架,通过双向代码逆向工程实现反编译与源码翻译,采用多适配器和序列到序列统一方法提升任务适应性,实验显示其在反编译任务中表现优异。
Schwartz 高阶值是否有助于句子层面的人类价值检测?对分层门控与校准的探讨
机构 * PRHLT Research Center, Universitat Politècnica de València(PRHLT研究中心,瓦伦西亚理工大学) ; School of Science, Engineering and Design, Universidad Europea de Valencia(瓦伦西亚欧洲大学科学、工程与设计学院) ; Valencian Graduate School and Research Network of Artificial Intelligence (ValgrAI)(瓦伦西亚人工智能研究生院与研究网络(ValgrAI))
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究Schwartz高阶类别在ValueEval'24/ValuesML数据集上对句子层面人类价值检测的帮助,通过比较不同模型和校准方法,发现校准和集成比硬门控更有效。
Comments Code: https://github.com/VictorMYeste/human-value-detection, models: https://huggingface.co/papers/2602.00913, 27 pages, 4 figures
轻量级多模态适应:为无人机热成像中的物种识别和栖息地上下文解释优化视觉语言模型
机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) ; University of Florida(佛罗里达大学) ; Auburn University(奥本大学)
专题命中 指令微调 :language model(title);prompting(abstract);分类 cs.AI
AI总结 本研究提出轻量级多模态适应框架,用于提升视觉语言模型在无人机热成像中的物种识别与栖息地上下文解释能力,通过热数据集优化模型性能,实现从RGB到热辐射的高效迁移。
NativQA框架:使LLMs和VLMs具备原生、本地和日常知识
机构 * Qatar Computing Research Institute, Qatar(卡塔尔计算研究所) ; University of Toronto, Canada(多伦多大学) ; UPES, India(印度UPES大学) ; Qatar University, Qatar(卡塔尔大学)
专题命中 指令微调 :large language model(abstract,comments);language model(abstract,comments);分类 cs.CL、cs.AI;foundation model(comments)
AI总结 本文提出NativQA框架,通过整合多模态数据,构建本地化问答数据集,提升不同语言和文化背景下的模型性能。
Comments LLMs, Native, Multilingual, Language Diversity, Contextual Understanding, Minority Languages, Culturally Informed, Foundation Models, Large Language Models
基于视觉引导的前端代码生成迭代精修
机构 * School of Mathematics, University of Bristol, UK(英国布里斯托大学数学学院) ; Amazon AGI(亚马逊AGI)
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出一种全自动的批评者循环框架,利用视觉语言模型提供结构化反馈以指导代码生成的迭代优化,实验证明其在前端开发中能显著提升代码质量。
Comments Accepted at ICLR 2026 Workshop on AI with Recursive Self-Improvement
跨模态指代对齐:在全模态大语言模型中实现可靠信息传输
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL
AI总结 研究提出跨模态指代对齐问题,通过CrossOmni数据集和两种方法提升全模态推理能力,揭示指代意识缺失是跨模态推理弱化的主要原因。
超越语法:面向应用代理的动作语义学习
机构 * University of Oxford(牛津大学) ; Queen Mary University of London(伦敦玛丽女王大学) ; Huawei Noah’s Ark Lab(华为诺亚方舟实验室) ; University College London(伦敦大学学院)
专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出动作语义学习框架ASL,通过捕捉地面真实动作的语义来提升应用代理的准确性和泛化能力,克服了传统语法学习在分布外鲁棒性上的不足。
LoRA适配器中后门的权重空间检测
机构 * Algoverse AI Research ; Independent(独立研究者)
专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出一种无需运行模型即可检测LoRA适配器后门的方法,通过分析权重矩阵的谱统计特征,利用逻辑回归分类器在三种模型家族上实现100%准确率。
什么模型知道,它知道得有多好:基于知识加权的微调方法用于学习何时说“我不知道”
机构 * NAVER CLOUD(NAVER云) ; Seoul National University(首尔国立大学) ; KAIST(韩国科学技术院)
专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出一种基于知识加权的微调方法,通过估计实例级知识评分来提升模型在知识不足时的不确定性表达能力,同时保持对已知问题的准确性。
Comments 8 pages
大语言模型如何遵循指令:技能协调,而非通用机制
机构 * Department of Computer Science, Università degli Studi di Milano(米兰大学计算机科学系)
专题命中 指令微调 :language model(abstract);instruction tuning(abstract);分类 cs.AI
AI总结 研究通过九种不同任务分析发现,大语言模型遵循指令并非依赖通用机制,而是通过协调多种语言能力实现,且存在任务间转移弱、依赖稀疏等特点。
不要盲目行动:通过动作-效果验证和自我修正实现鲁棒的GUI自动化
机构 * Beijing University of Technology(北京工业大学) ; Baidu Inc.(百度公司)
专题命中 指令微调 :language model(abstract);SFT(abstract);分类 cs.CL
AI总结 本文提出VeriGUI框架,通过动作-效果验证和自我修正机制,解决GUI自动化中环境噪声导致的失败问题,提升恢复性能。
Comments ACL 2026 Main Conference
PDF检索增强型问答
机构 * Saarland University(萨尔兰大学)
专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出基于检索增强生成框架的PDF多模态问答系统,通过整合非文本元素提升复杂查询的准确性与相关性。
MedGemma 技术报告
机构 * Google Research(谷歌研究) ; Google DeepMind(谷歌DeepMind)
专题命中 指令微调 :foundation model(abstract);分类 cs.CL、cs.AI
AI总结 MedGemma 是基于 Gemma 3 的医学视觉-语言基础模型,具备强大的医学理解和推理能力,在医疗多模态问答、胸部X光分类等任务中表现优异,同时保持通用能力,为医疗AI发展提供基础。
Comments Fix references
语音扰动揭示大语言模型中基于分词的安全漏洞
机构 * Université Paris-Saclay(巴黎-萨克雷大学) ; IIT Kharagpur(印度理工学院卡哈拉格普尔分校)
专题命中 指令微调 :SFT(abstract);分类 cs.CL、cs.AI
AI总结 研究通过CMP-RT探测器揭示LLMs因分词机制导致的安全漏洞,发现语音扰动使安全关键token分裂为无害子词,导致安全机制失效,且该漏洞能绕过标准防御并扩展至多种模型。
LoRM:学习旋转机械的语言以实现自监督的条件监测
机构 * University of Warwick(华威大学) ; Queen Mary University of London(伦敦玛丽女王大学) ; University of Sheffield(谢菲尔德大学) ; Advanced Manufacturing Research Centre, University of Sheffield(谢菲尔德大学先进制造研究中心) ; Tongji University(同济大学)
专题命中 指令微调 :language model(abstract);分类 cs.CL
AI总结 LoRM通过将旋转机械信号视为机器语言,利用预训练语言模型进行多模态信号分析,实现实时条件监测,展示了在工具状态监测中的有效性。
OmniDiagram:通过视觉 interrogation 奖励推进统一图代码生成
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Zhejiang University(浙江大学)
专题命中 指令微调 :SFT(abstract);分类 cs.AI
AI总结 本文提出OmniDiagram统一框架,结合多种图代码语言和任务定义,引入视觉反馈策略Viva,通过生成方法奖励视觉结构,无需人工标注数据,实验表明其在图代码生成基准上达到新状态。
Comments Accepted to ACL 2026 Findings
扰动与恢复:用于从CLIP中有效移除后门的微调
机构 * University of Tübingen & Tübingen AI Center(蒂宾根大学 & 蒂宾根人工智能中心) ; EPFL(瑞士联邦理工学院洛桑)
专题命中 指令微调 :language model(abstract);分类 cs.LG
AI总结 本文提出PAR机制,通过微调有效移除CLIP中的后门,实验表明其在不同编码器和攻击类型上均能保持良好性能,且无需真实训练数据。
Comments CVPR 2026 Findings
OmniFysics:通过多模态信号处理和网络优化实现物理智能进化
机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) ; Fysics AI
专题命中 指令微调 :instruction tuning(abstract)
AI总结 OmniFysics通过统一图像、音频、视频和文本的多模态信号处理,结合动态物理数据引擎和物理知识注入,实现网络化AI系统的自主优化,提升物理理解能力。
Comments This work has been submitted to the IEEE for possible publication
CrowdVLA: 一种用于情境感知人群模拟的具身视觉-语言-动作代理
专题命中 指令微调 :language model(abstract)
AI总结 CrowdVLA通过引入视觉-语言-动作代理,解决了人群模拟中监督不足、控制不稳定和数据偏差等问题,推动模拟从运动导向转向感知驱动的决策制定。
少样本语义分割遇见SAM3
机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) ; Institute of Information Science, Academia Sinica(中央研究院资讯科学研究所)
专题命中 指令微调 :foundation model(abstract)
AI总结 本文基于现代视觉基础模型重新审视少样本语义分割,利用SAM3的提示式概念分割能力,通过简单空间拼接策略实现无需训练的分割,实验表明其在PASCAL和COCO数据集上达到SOTA性能,并揭示负提示在少样本场景下的负面影响。
Comments 14 pages, 3 figures
Fast-dVLA:加速离散扩散VLA以实现实时性能
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; ShanghaiTech University(上海科技大学) ; Shanghai Institute of Technical Physics, CAS(中国科学院上海技术物理研究所) ; AIR, Tsinghua University(清华大学智能产业研究院) ; Westlake University(西湖大学) ; Zhejiang University(浙江大学)
专题命中 指令微调 :SFT(abstract)
AI总结 本文提出一种方法,通过分离辅助任务训练目标,在参数空间中提升通用能力与任务特定动作分布,从而在减少计算开销的同时提高性能。
实时VLA适应 via 测试时强化学习
机构 * University of Missouri–Kansas City(密苏里大学堪萨斯城分校) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; U. S. Naval Research Laboratory(美国海军研究实验室) ; Lamar University(拉马尔大学) ; Meta AI ; Rochester Institute of Technology(罗彻斯特理工学院)
专题命中 指令微调 :SFT(abstract)
AI总结 本文提出TT-VLA框架,通过测试时强化学习实现VLA模型的实时策略适应,提升机器人在动态环境中的适应性与稳定性。