Cross-Modal Backdoors in Multimodal Large Language Models
多模态模型中的跨模态后门
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(title,abstract);MLLM(abstract,abstract_cn)
AI总结 研究提出一种利用轻量级连接器漏洞的跨模态后门攻击,通过污染连接器实现跨模态后门激活,展示攻击的有效性和可迁移性,揭示多模态对齐中的基本漏洞。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
多模态模型中的跨模态后门
专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(title,abstract);MLLM(abstract,abstract_cn)
AI总结 研究提出一种利用轻量级连接器漏洞的跨模态后门攻击,通过污染连接器实现跨模态后门激活,展示攻击的有效性和可迁移性,揭示多模态对齐中的基本漏洞。
PRIMED: 通过偏见竞争实现适应性模态抑制的指引用视听分割
机构 * School of Information Science and Engineering, East China University of Science and Technology(信息科学与工程学院,东华大学)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 PRIMED通过偏见竞争理论,实现适应性模态抑制,提升指引用视听分割的准确性,通过模态先验解码器和token蒸馏器增强多模态融合,实验表明其在Ref-AVS基准上达到最优性能。
Comments 11 pages, 8 figures
TraceAV-Bench: 多跳轨迹推理长音频视频基准测试
机构 * University of Electronic Science and Technology of China(电子科学与技术大学) ; Peking University(北京大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Zhongguancun Academy(中关村学院)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV
AI总结 TraceAV-Bench首次评估多跳轨迹推理和多模态幻觉鲁棒性,包含2200道多选题,覆盖4个维度15个子任务,揭示多模态推理与幻觉鲁棒性脱节问题。
MIST:面向智能家居的多模态交互语音工具调用对话助手
机构 * Columbia University(哥伦比亚大学) ; Seoul National University(首尔国立大学)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI、cs.MM
AI总结 本文提出MIST数据集,用于研究具备物理世界约束推理能力的多模态语音助手,发现开放和闭源多模态LLM在该任务上存在显著差距。
Comments Project Page: https://billyzhang24kobe.github.io/mist-smarthome/
AudioFace: 基于语言的语音驱动面部动画与多模态语言模型
机构 * Westlake University(西湖大学) ; Zhejiang University(浙江大学) ; Tiangong University(天工大学) ; Hunan University(湖南大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出AudioFace框架,通过语言和发音信息指导语音驱动的面部动作生成,提升语音与面部运动的对应精度。