arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-18 至 2026-03-18 共收录 2 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 2 篇

2512.07209 2026-03-18 cs.MM cs.LG cs.SD 79%

Coherent Audio-Visual Editing via Conditional Audio Generation Following Video Edits

通过条件音频生成实现一致的音频视觉编辑

Masato Ishii, Akio Hayakawa, Takashi Shibuya, Yuki Mitsufuji

机构 * Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM

AI总结 本文提出一种联合音频视觉编辑 pipeline,通过条件音频生成实现视频编辑与音频的协调一致,实验表明其在保持音频视觉一致性方面优于现有方法。

Comments Source code: https://github.com/SonyResearch/CoherentAVEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16280 2026-03-18 cs.SD eess.AS 57%

CAST-TTS: A Simple Cross-Attention Framework for Unified Timbre Control in TTS

CAST-TTS: 一种用于语音合成中统一音色控制的跨注意力框架

Zihao Zheng, Wen Wu, Chao Zhang, Mengyue Wu, Xuenan Xu

机构 * Shanghai AI Lab(上海人工智能实验室) MoE Key Lab of Artificial Intelligence, X-LANCE Lab, Shanghai Jiao Tong University(人工智能大规模并行计算关键实验室,X-LANCE实验室,上海交通大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 本文提出CAST-TTS框架,通过统一语音和文本提示的音色控制,采用多阶段训练策略和单个跨注意力机制实现高效合成,实验表明其性能接近专用单输入模型。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏