arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-27 至 2026-03-27 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 3 篇

2603.25140 2026-03-27 cs.CV cs.AI cs.LG cs.MM cs.SD 87%

SAVe: Self-Supervised Audio-visual Deepfake Detection Exploiting Visual Artifacts and Audio-visual Misalignment

SAVe:利用视觉伪影和音视频不一致的自监督音频视觉深度伪造检测

Sahibzada Adil Shahzad, Ammarah Hashmi, Junichi Yamagishi, Yusuke Yasuda, Yu Tsao, Chia-Wen Lin, Yan-Tsung Peng, Hsin-Min Wang

机构 * Social Networks and Human-Centered Computing Program, Taiwan International Graduate Program, Institute of Information Science, Academia Sinica(中央研究院资讯科学研究所台湾国际研究生计划社交网络与人本计算项目) Department of Computer Science, National Chengchi University(国立政治大学资讯科学系) Institute of Information Systems and Applications, National Tsing Hua University(国立清华大学资讯系统与应用研究所) National Institute of Informatics(国立情报学研究所) Department of Electrical Engineering and the Institute of Communications Engineering, National Tsing Hua University(国立清华大学电机工程学系与通讯工程研究所) Research Center for Information Technology Innovation, Academia Sinica(中央研究院资讯科技创新研究中心) Institute of Information Science, Academia Sinica(中央研究院资讯科学研究所)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 SAVe通过自监督学习在真实视频上训练,生成伪篡改以学习互补的视觉线索,并通过音视频对齐组件捕捉跨模态证据,实现对深度伪造的高效检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24793 2026-03-27 cs.CV cs.MM cs.SD 81%

AVControl: Efficient Framework for Training Audio-Visual Controls

AVControl: 用于音频-视觉控制训练的高效框架

Matan Ben-Yosef, Tavi Halperin, Naomi Ken Korem, Mohammad Salama, Harel Cain, Asaf Joseph, Anthony Chen, Urska Jelercic, Ofir Bibi

机构 * Lightricks

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM

AI总结 AVControl通过轻量级框架实现多模态控制,无需架构改动,支持多种独立训练的模态,如深度、姿态、边缘、相机轨迹等,并在多个基准测试中表现优异。

Comments Project page: https://matanby.github.io/AVControl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25107 2026-03-27 cs.CV 79%

Label What Matters: Modality-Balanced and Difficulty-Aware Multimodal Active Learning

关键性标注:模态平衡与难度意识的多模态主动学习

Yuqiao Zeng, Xu Wang, Tengfei Liang, Yiqing Hao, Yi Jin, Hui Yu

机构 * Key Laboratory of Big Data and Artificial Intelligence in Transportation, Ministry of Education(北京交通大学计算机与信息技术学院;轨道交通控制与安全国家重点实验室;交通大数据与人工智能教育部重点实验室) State Key Laboratory of Advanced Rail Autonomous Operation(格拉斯哥大学心理与神经科学学院) School of Computer and Information Technology, Beijing Jiaotong University School of Psychology & Neuroscience, University of Glasgow

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出RL-MBA框架,通过强化学习实现多模态主动学习的模态平衡与难度意识,提升分类准确率和模态公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏