FATE: Frame-Level Audio-Visual Temporal Embedding
FATE:帧级视听时间嵌入
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM
AI总结 FATE是帧级视听时间嵌入模型,通过保留帧级序列与联合对比学习目标,在三项视听任务中优于基线,零样本事件定位性能接近全监督方法,与人类判断相关性最优。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
FATE:帧级视听时间嵌入
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM
AI总结 FATE是帧级视听时间嵌入模型,通过保留帧级序列与联合对比学习目标,在三项视听任务中优于基线,零样本事件定位性能接近全监督方法,与人类判断相关性最优。
InteracVid:基于直播聊天视频构建真实交互式视听响应数据集
机构 * College of AI, Tsinghua University(清华大学人工智能学院)
专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV
AI总结 该研究提出首个开源大规模交互式视听数据集InteracVid,解决现有生成模型监督信号缺失问题,实验证实其可提升多模态助手的交互规划与响应生成性能,为交互式多模态生成提供关键基础。
大型音频语言模型综述:通用性、可信度与展望
机构 * Nanyang Technological University(南洋理工大学) ; Independent Researcher(独立研究者) ; The University of Melbourne(墨尔本大学) ; North China Electric Power University(华北电力大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; University of Science and Technology of China(中国科学技术大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Shanghai AI Laboratory(上海人工智能实验室) ; Huazhong University of Science and Technology(华中科技大学) ; Tsinghua University(清华大学) ; Fortemedia Singapore(富媒体新加坡) ; Tencent(腾讯) ; Fudan University(复旦大学) ; Wuhan University(武汉大学) ; Chinese University of Hong Kong(香港中文大学) ; Chongqing University of Posts and Telecommunications(重庆邮电大学) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校)
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract)
AI总结 本文综述了大型音频语言模型的通用性、可信度及未来发展方向,探讨了其架构创新、对齐算法及安全风险,并提出了防御深入、因果音频世界建模等策略以提升音频智能的可信度。
声音画布:将算法嵌入网络化、具感官的声音艺术中
专题命中 音频语音多模态 :multimodal(abstract)
AI总结 本研究将算法嵌入声音艺术装置,通过离线视觉-声音映射与在线模型实现触摸响应的多模态交互,引发算法艺术相关问题。
Comments 23 pages, 7 figures
HorizonServe:面向全模态模型服务的请求调度与GPU共享协调系统
专题命中 音频语音多模态 :multimodal(abstract)
AI总结 HorizonServe是一款单GPU全模态模型服务系统,通过协调请求准入与GPU分配,提升了SLO达成率并降低了首响应延迟,解决了全模态模型统一部署的调度问题。