Multimodal Relational Tensor Network for Sentiment and Emotion Classification
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CV
Comments To appear in: IEEE Computer Vision and Pattern Recognition (CVPR), 2018
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
Comments ICASSP 2018
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
Comments AKBC 2017 Workshop Paper
专题命中 音频语音多模态 :cross-modal(title,abstract);分类 eess.AS
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
Comments Robo-NLP workshop at ACL 2017. 9 pages, 5 figures, 6 tables
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
Comments 14 pages, 4 figures, 4 tables
Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, volume 38, number 12, 2402 - 2415, 2016
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI
Comments NIPS Workshop on Future of Interactive Learning Machines, 2016
专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI
Comments Appears in Proceedings of the Eighth Conference on Uncertainty in Artificial Intelligence (UAI1992)
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV
Journal ref IJCSI International Journal of Computer Science Issues, Vol. 8, Issue 6, No 2, 2011, 122-127
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI
Journal ref Journal Of Artificial Intelligence Research, Volume 27, pages 55-83, 2006
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.MM
Comments http://www.journalofcomputing.org
Journal ref Journal of Computing, Volume 2, Issue 5, May 2010
专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL
Comments 8 pages, Postscript file, UNIX compressed, uuencoded
超越表格数据的TabPFN:多模态嵌入的校准与准确性
专题命中 音频语音多模态 :multimodal(title,abstract)
AI总结 研究少样本多模态分类中轻量级头部校准不佳问题,核心方法是评估TabPFN作为即插即用分类头。贡献在于其在多数据集、多编码器和多模态评估中表现优异,能提升校准并保持准确率,为校准敏感多模态分类提供指导。
Comments 19 pages, 13 figures, 10 tables. Jingxiang Zhang and Lujia Zhong contributed equally. Code: https://github.com/Jingxiang-Zhang/tabpfn-multimodal-embeddings
FOCAL:多模态代理的新型基准测试技术
专题命中 音频语音多模态 :multi-modal(title,abstract)
AI总结 FOCAL提出了一种新型基准测试技术,用于评估多模态代理的端到端推理能力、误差传播及对话效果。
Comments We present a framework for evaluation of Multi-modal Agents consisting of Voice-to-voice model components viz. Text to Speech (TTS), Retrieval Augmented Generation (RAG) and Speech-to-text (STT)
Wan-Streamer v0.1: 端到端实时交互基础模型
机构 * Alibaba Group(阿里巴巴集团)
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI
AI总结 提出Wan-Streamer,一种原生流式、端到端的交互基础模型,通过单一Transformer联合建模语言、音频和视频,实现低延迟全双工音视频交互,无需外部模块。
Comments Website: https://wan-streamer.com
JAM-Flow:联合音频-运动合成与流匹配
机构 * Yonsei University(延世大学) ; CineLingo ; Seoul National University(首尔国立大学)
专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS
AI总结 本文提出JAM-Flow框架,通过流匹配和多模态扩散变压器架构,实现面部运动与语音的联合合成与条件生成,支持文本到说话人生成、音频驱动动画等多种任务。
Comments project page: https://joonghyuk.com/jamflow-web Under review. Preprint published on arXiv
保留音频无法表达的内容:面向多模态大语言模型的上下文保留令牌修剪
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI
AI总结 本文提出ContextGuard框架,通过保留音频-视觉上下文并去除跨模态冗余,实现多模态大语言模型的高效令牌修剪,实验表明其在多个基准测试中表现优异,能有效减少输入令牌数量。
面向连续情感估值的阶段自适应可靠性建模
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.AI、cs.MM
AI总结 本文提出SAGE框架,通过阶段自适应可靠性建模提升多模态环境下连续情感估值的稳定性与准确性。
Comments 8 pages, 3 figures, 2 pages
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.AI、eess.AS
Comments arXiv admin note: substantial text overlap with arXiv:2507.04845
机构 * University of California, Davis(加州大学戴维斯分校) ; The Ohio State University(俄亥俄州立大学)
专题命中 音频语音多模态 :multimodal(abstract);multi-modal(abstract);omni-modal(abstract);分类 cs.CV、cs.CL
机构 * National Taiwan University(国立台湾大学) ; Academia Sinica(中国学术.sinica) ; National Institute of Information and Communications Technology(信息与通信技术国家研究所)
专题命中 音频语音多模态 :multi-modal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.MM、eess.AS
机构 * University of Electronic Science and Technology of China(电子科学与技术大学)
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI
Comments 9 pages,ICMR accepted
机构 * School of Electrical Engineering, KAIST, South Korea(韩国延世大学电气工程学院) ; ETRI, South Korea(韩国电子技术研究院)
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);multimodal foundation model(abstract);分类 cs.CV、eess.AS
Comments Journal Extension of WACV 2024 paper (arXiv:2311.04066). Code is available at ACL-SSL" target="_blank" rel="noopener">https://github.com/swimmiing/ACL-SSL
专题命中 音频语音多模态 :multimodal(abstract);multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.MM
Comments Tech report
专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments Technical report, work in progress. Our project page is at https://panda-gpt.github.io/