MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model
MaineCoon: 追求实时音视频社交世界模型
机构 * Catnip AI Team(Catnip AI团队)
专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出MaineCoon,首个22B参数的实时音视频自回归模型,支持单GPU上高达47.5 FPS的流式生成和亚秒级交互,专为社交互动应用优化,引入自重采样、跨模态对齐、领域偏好优化和强化在线策略蒸馏等技术。
Comments 32 pages, 13 figures, 3 tables