arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-25 至 2026-06-25 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 8 篇

2606.25225 2026-06-25 cs.CV cs.LG 新提交 83%

MJEPA: A Simple and Scalable Joint-Embedding Predictive Architecture for Audio-Visual Learning

MJEPA:一种简单且可扩展的音频-视觉联合嵌入预测架构

Revant Teotia, Adrien Bardes, Michael Rabbat, Sumit Chopra, Matthew J. Muckley, Nicolas Ballas

机构 * FAIR at Meta(Meta AI研究实验室) New York University(纽约大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出MJEPA,使用统一编码器和单一预测目标进行跨模态预测,在音频分类任务上超越先前方法,并减少视频数据需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11933 2026-06-25 cs.CL 版本更新 79%

Cross-Modal Robustness Transfer (CMRT): Training Robust Speech Translation Models Using Adversarial Text

跨模态鲁棒性迁移(CMRT):利用对抗文本训练鲁棒的语音翻译模型

Abderrahmane Issam, Yusuf Can Semerci, Jan Scholtes, Gerasimos Spanakis

机构 * Department of Advanced Computing Sciences(先进计算科学系)

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CL

AI总结 提出跨模态鲁棒性迁移(CMRT)框架,将文本模态的对抗鲁棒性迁移到语音模态,无需生成对抗语音数据,在四个语言对上平均提升超过3个BLEU点。

Comments A shorter version has been accepted at INTERSPEECH2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25990 2026-06-25 cs.CL cs.AI cs.SD 新提交 73%

SpeechEQ: Benchmarking Emotional Intelligence Quotient in Socially Aware Voice Conversational Models

SpeechEQ: 社交感知语音对话模型的情商基准测试

Liang-Yuan Wu, Zih-Ching Chen, Tongshuang Wu, Chao-Han Huck Yang, Hua Shen

机构 * New York University(纽约大学) NVIDIA(英伟达) Carnegie Mellon University(卡内基梅隆大学) NYU Shanghai(上海纽约大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 提出SpeechEQ框架,基于EQ-i 2.0理论构建2265个对话数据集,通过口语情商(SEQ)评分评估语音语言模型在主动多轮对话中的副语言社交线索推理能力,揭示端到端模型存在模态捷径、安全陷阱和上下文遗忘等瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25444 2026-06-25 eess.AS cs.CL cs.SD 交叉投稿 62%

Does Translation-Enhanced Speech Encoder Pre-training Affect Speech LLMs?

翻译增强的语音编码器预训练是否影响语音大语言模型?

Tomoya Mizumoto, Yusuke Fujita

机构 * SB Intuitions

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、eess.AS

AI总结 研究翻译增强的语音编码器预训练对语音大语言模型的影响,通过实验证明该方法能改善跨模态整合并提升下游任务性能。

Comments Accepted to Interspeech2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24910 2026-06-25 eess.AS cs.AI cs.SD 交叉投稿 62%

End-to-End Voice Intent Recognition for Spontaneous Human-Drone Interaction with Naive Users

面向非专业用户自发人机交互的端到端语音意图识别

Allan Henry, Solange Rossato, Christian Graff, Sylvain Huet, Jose-Ernesto Gomez-Balderas

机构 * LIG, Univ. Grenoble Alpes, Grenoble, France(格勒诺布尔阿尔卑斯大学LIG实验室,法国格勒诺布尔) LPNC, Univ. Grenoble Alpes, Grenoble, France(格勒诺布尔阿尔卑斯大学LPNC实验室,法国格勒诺布尔) GIPSA-lab, Univ. Grenoble Alpes, Grenoble, France(格勒诺布尔阿尔卑斯大学GIPSA-lab实验室,法国格勒诺布尔)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、eess.AS

AI总结 提出端到端口语理解架构,结合冻结自监督学习编码器和轻量LSTM分类头,通过跨模态知识蒸馏提升鲁棒性,在自发语音测试集上达82%准确率,推理延迟仅7ms。

Comments This paper has been accepted for publication at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026), August 24-28, 2026, Kitakyushu, Japan

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24915 2026-06-25 cs.CL cs.AI cs.IR 新提交 62%

Error-Aware TF-IDF Retrieval-Augmented Generation for ASR Error Correction

错误感知的TF-IDF检索增强生成用于ASR错误纠正

Mohammad Aref Jafari-Raddani

机构 * Department of Computer Engineering, Qom University of Technology(库姆科技大学计算机工程系) Asa Electronic Akhtaran(阿萨电子阿赫塔兰公司)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 提出一种纯词法的错误感知检索增强生成框架,通过对称文本归一化和基于历史错误的稀疏对角惩罚矩阵,将FLEURS波斯语子集的错误感知命中率从53.7%提升至90.9%,最终词错误率从23.06%降至18.83%。

Comments 4 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10371 2026-06-25 eess.AS cs.CL 版本更新 62%

Speech Codec Probing from Semantic and Phonetic Perspectives

从语义和语音角度探测语音编解码器

Xuan Shi, Chang Zeng, Tiantian Feng, Shih-Heng Wang, Jianbo Ma, Shrikanth Narayanan

机构 * University of Southern California(南加州大学) Dolby Laboratories(杜比实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 本文通过三项任务系统分析多种语音分词器编码的信息,发现当前分词器主要捕获语音结构而非词汇语义,为下一代语音分词方法设计提供指导。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04109 2026-06-25 cs.HC cs.AI 版本更新 57%

Tinker Tales: A Tangible Dialogue System for Child-AI Co-Creative Storytelling

Tinker Tales:一个用于儿童与AI共同创意故事讲述的有形对话系统

Nayoung Choi, Jiseung Hong, Peace Cyebukayire, Ikseon Choi, Jinho D. Choi

机构 * Department of Computer Science, Emory University(埃默里大学计算机科学系) Department of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学系) School of Nursing, Emory University(埃默里大学护理学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出Tinker Tales有形对话系统,通过结合物理故事板、NFC玩具和移动应用,支持儿童与AI在四个叙事阶段进行协作故事创作,并发现提示框架影响儿童叙事贡献的形式和一致性。

Comments Accepted to SIGDIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏