arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-04 至 2026-06-04 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4 篇

2512.03553 2026-06-04 cs.CV cs.AI 89%

Dynamic Content Moderation in Livestreams: Combining Supervised Classification with MLLM-Boosted Similarity Matching

直播中的动态内容审核:结合监督分类与MLLM增强的相似度匹配

Wei Chee Yew, Hailun Xu, Sanjay Saha, Xiaotian Fan, Hiok Hian Ong, David Yuchen Wang, Kanchan Sarkar, Zhenheng Yang, Danhui Guan

机构 * TikTok Singapore Singapore(TikTok新加坡) TikTok San Jose United States(TikTok旧金山美国) TikTok Shanghai China(TikTok上海中国)

专题命中 音频语音多模态 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出一种混合审核框架,结合监督分类和基于参考的相似度匹配,利用多模态大语言模型提升准确性,在保持轻量推理的同时实现大规模直播内容审核。

Comments To be published at KDD 2026 (ADS track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04205 2026-06-04 cs.MM cs.AI cs.CL cs.CV cs.LG cs.SD 70%

DetectZoo: A Unified Toolkit for AI-Generated Content Detection Across Text, Audio, and Image Modalities

DetectZoo:一个用于跨文本、音频和图像模态的AI生成内容检测的统一工具包

Sajad Ebrahimi, Nima Jamali, Bardia Shirsalimian, Kelly McConvey, Wentao Zhang, Jalehsadat Mahdavimoghaddam, Maksym Taranukhin, Maura Grossman, Vered Shwartz, Yuntian Deng, Ebrahim Bagheri

机构 * University of Toronto(多伦多大学) University of Waterloo(滑铁卢大学) Toronto Metropolitan University(多伦多 Metropolitan 大学) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出DetectZoo,一个首个统一的多模态AI生成内容检测工具包,通过标准化数据预处理、评估流程和集成61个检测器与22个基准数据集,实现公平可重复的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
1606.07347 2026-06-04 eess.SY cs.SY 67%

Dynamical Systems On Weighted Lattices: General Theory

带权晶格上的动力系统:一般理论

Petros Maragos

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract)

AI总结 本文提出了一种统一多种非线性离散时间动力系统的方法,这些系统满足加权最大或最小类型的叠加,研究了在带权晶格上的状态和输入输出信号演变,以及非线性卷积、非线性矩阵方程求解、稳定性与可控性等问题,并探讨了其在非线性滤波、动态规划、最短路径、模糊马尔可夫链及多模态信息流中显著事件跟踪等应用。

Comments 38 pages, 4 figures

Journal ref Math. Control Signals Syst. (2017) 29: 21

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04106 2026-06-04 cs.LG cs.AI 57%

Building The Ph(ysical)AI Layer Of Machine Intelligence

构建机器智能的物理AI层

Ulbert Jose Botero, Liam Smith, Brooks Olney, Pooya Khorrami, Steven Kusiak, Watson Jia, Sage Trudeau, Daniel Capecci

机构 * MIT Lincoln Laboratory(麻省理工学院林肯实验室)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI

AI总结 提出基于信号处理原理的基座模型,通过射频数据训练实现跨模态迁移,无需目标域微调,以1.99M参数在15个任务上平均准确率77.7%。

Comments 102 pages, 11 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏