Image Prompt Reconstruction Attacks on Distributed MLLM Inference Frameworks
分布式多模态大模型推理框架上的图像提示重建攻击
专题命中 VLM训练与架构 :MLLM(title,summary_cn)
AI总结 研究分布式MLLM推理中中间嵌入泄露图像提示的风险,提出两种被动黑盒攻击方法MPAA和IEDA,实现像素级和语义级图像重建。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
分布式多模态大模型推理框架上的图像提示重建攻击
专题命中 VLM训练与架构 :MLLM(title,summary_cn)
AI总结 研究分布式MLLM推理中中间嵌入泄露图像提示的风险,提出两种被动黑盒攻击方法MPAA和IEDA,实现像素级和语义级图像重建。
你还会称它为Dax吗?VLM与人类中的新颖视觉参照
机构 * McGill University(麦吉尔大学) ; Mila Quebec AI Institute(魁北克人工智能研究所) ; University of Michigan - Ann Arbor(密歇根大学安娜堡分校) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
专题命中 VLM训练与架构 :VLM(title_cn,summary_cn);vision-language model(abstract);分类 cs.CV
AI总结 提出新颖视觉参照数据集(NVRD),通过对比VLM和人类对新颖视觉概念的泛化能力,发现模型在矛盾先验知识时难以习得新概念,且过度泛化。
基于知识的分层多模态检索用于新闻图像描述生成
机构 * University of Science, VNU-HCM(越南国立大学胡志明市分校理学院) ; Vietnam National University, Ho Chi Minh City(越南国立大学胡志明市分校)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);分类 cs.CV
AI总结 提出分层多模态文章检索增强的图像描述框架,通过结构感知检索和上下文精炼,结合VLM和LLM生成富含上下文细节的描述,在EVENTA 2025挑战赛中获得第5名。
Comments SOICT 2025
超越线性可分上限:对齐视觉-语言模型中的表征
机构 * Applied Artificial Intelligence Group(应用人工智能小组) ; Tallinn University of Technology(塔林技术大学)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);分类 cs.CV
AI总结 提出线性可分上限(LSC)诊断框架,发现VLM存在对齐差距,并通过对比目标重塑视觉流形,使模型在抽象组合推理任务上显著超越LSC。
Comments Accepted TMLR
DREAM: 通过双目标编码扩展视觉-语言模型用于跨模态检索
机构 * Sejong University(世宗大学) ; Korea Advanced Institute of Science and Technology(韩国科学技术院) ; Ulsan National Institute of Science and Technology(乌山国立科学研究院)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
AI总结 提出DREAM模型,通过双路径表示增强与对齐,结合层级视觉编码器和混合语言建模,在视频检索任务中实现新SOTA。
APT: 用于因果视频语言理解的原子物理转变
机构 * Northwestern University(西北大学) ; Dolby Laboratories(杜比实验室)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI
AI总结 提出原子物理转变(APT)作为视频中因果状态变化的显式表示,并构建混合来源数据集,通过APT-Tune微调方法使VLM学习物理转变而不遗忘事件级知识。
SAMA:面向统一低资源多模态信息抽取的语义锚定对齐增强
机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)
专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 提出语义锚定对齐增强框架SAMA,通过构建结构化语义锚引导多专家多模态大模型生成高保真文本,并利用锚保留扩散机制合成图像,结合双约束过滤模块,在低资源多模态信息抽取任务中显著提升性能。
Comments Accepted by IEEE Transactions on Multimedia
超越当前观测:评估多模态大语言模型在可控非马尔可夫博弈中的表现
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Zhejiang University(浙江大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 VLM训练与架构 :multimodal large language model(title);分类 cs.CV
AI总结 提出RNG-Bench基准套件,通过配对记忆和3D迷宫两个博弈,评估多模态大模型在非马尔可夫环境中重建历史观测并据此行动的能力,发现主要错误源于遗忘而非决策,微调可提升性能。
通过正则化微调实现可域泛化的3D视觉-语言模型适应
机构 * Concordia University(康考迪亚大学)
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
AI总结 提出ReFine3D框架,通过选择性层调优、多视图一致性、同义词提示及点渲染视觉监督等正则化策略,提升3D大语言模型在域泛化中的性能。
Comments Accepted at Transactions on Machine Learning Research (TMLR)
Adv-TGD:面向人脸识别冒充攻击的对抗性文本引导扩散
机构 * University of South Florida, Bellini College of Artificial Intelligence, Cybersecurity and Computing(南佛罗里达大学贝利尼人工智能、网络安全与计算学院)
专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.CV、cs.LG
AI总结 提出Adv-TGD框架,利用Stable Diffusion和LoRA微调生成逼真对抗人脸,在保持视觉质量的同时实现高成功率身份冒充攻击,平均ASR达85.90%。
G-IdiomAlign:基于释义的跨语言习语对齐基准
机构 * NLP 2 CT Lab, Department of Computer and Information Science, University of Macau(NLP 2 CT实验室,计算机与信息科学系,澳门大学) ; Faculty of Arts and Humanities, University of Macau(人文学院,澳门大学)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
AI总结 提出G-IdiomAlign基准,通过维基词典释义锚定习语,构建高置信度对齐集,并设计多项选择等价测试和释义对比生成协议,揭示大语言模型在习语翻译中的字面翻译偏差。
Comments Accepted to ACL 2026
CAPRA: 使用多智能体LLM系统对软件架构交付物进行反馈扩展
机构 * Department of Information Engineering, University of Florence, Florence, Italy(信息工程系,佛罗伦萨大学,意大利佛罗伦萨)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
AI总结 提出CAPRA多智能体LLM系统,通过多模态文档提取、确定性证据锚定和一致性管理,自动生成软件架构交付物的个性化LaTeX反馈,在10份学生报告中满足88.8%的评估标准。
Comments Accepted for publication at the 38th International Conference on Software Engineering Education and Training
SpecAlign: 通过合成数据实现高效的大语言模型规范对齐
机构 * University of Notre Dame(圣母大学) ; Carnegie Mellon University(卡内基梅隆大学) ; LMU Munich(慕尼黑大学) ; University of Southern California(南加州大学)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
AI总结 提出规范对齐新范式,通过从规范文档合成数据(SpecAlign框架),结合结构化规则标注、可控规范实例化和多智能体对抗数据合成,生成细粒度偏好对,提升规则遵守度且不损害通用能力。
Comments 58 pages
通过纠正失真改进视觉令牌减少以实现高效多模态大语言模型推理
机构 * KAIST(韩国科学技术院)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
AI总结 提出RESTORE框架,通过校准位置和注意力失真来改进视觉令牌减少,在保持效率的同时提升多模态大语言模型性能。
Comments Accepted to ICML 2026
错误的正确:量化和定位大语言模型中的失调对齐
机构 * University of Michigan(密歇根大学) ; University of Cambridge(剑桥大学) ; University of Aberdeen(阿伯丁大学)
专题命中 VLM训练与架构 :grounding(abstract)
AI总结 本文提出VETO基准和失调对齐率(MAR)指标,发现所有LLM在刻板印象相关问题上均存在非平凡的失调对齐,且人类为0%,机制分析表明对齐诱导的线索会放大该现象。