arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-29 至 2026-04-29 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 7 篇

2512.06757 2026-04-29 cs.SD cs.CV 79%

XM-ALIGN: Unified Cross-Modal Embedding Alignment for Face-Voice Association

XM-ALIGN:面向人脸-语音关联的统一跨模态嵌入对齐框架

Zhihua Fang, Shumei Tao, Junxu Wang, Liang He

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Xinjiang Multimodal Information Technology Engineering Research Center(新疆多模态信息处理工程技术研究中心) Urumqi Branch, China Mobile Group Xinjiang Co., Ltd(中国移动新疆乌鲁木齐分公司) School of Intelligence Science and Technology, Xinjiang University(新疆大学智能科学与技术学院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出XM-ALIGN框架,通过显式与隐式对齐机制提升跨模态验证性能,采用共享分类器联合优化人脸与语音嵌入,并通过数据增强提升泛化能力。

Comments FAME 2026 Technical Report

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25255 2026-04-29 cs.CV 79%

Personalized Cross-Modal Emotional Correlation Learning for Speech-Preserving Facial Expression Manipulation

面向语音保留的面部表情操控的个性化跨模态情感相关学习

Tianshui Chen, Yujie Zhu, Jianman Lin, Zhijing Yang, Chunmei Qing, Feng Gao, Liang Lin

机构 * Guangdong University of Technology(广东工业大学) South China University of Technology(华南理工大学) Peking University(北京大学) Sun Yat-Sen University(中山大学)

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出PCMECL算法,通过个性化提示和特征差分提升跨模态对齐,解决面部表情操控中情感操控的监督问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18612 2026-04-29 cs.CR cs.CV 79%

Multimodal Privacy-Preserving Entity Resolution with Fully Homomorphic Encryption

多模态隐私保护实体解析与全同态加密

Susim Roy, Nalini Ratha

机构 * University at Buffalo, The State University of New York Department of Computer Science(布法罗大学计算机科学与工程系)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出多模态框架,利用政府和金融机构的数据集,解决数据量、匹配精度和隐私问题,通过全同态加密保障隐私,实现低误判率和高效计算。

Comments 5 pages, 3 figures, IEEE ICASSP'26

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25591 2026-04-29 eess.AS cs.AI cs.CL cs.LG cs.SD 67%

Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models

穿越不确定性:音频感知大语言模型不确定性估计的实证研究

Chun-Yi Kuan, Wei-Ping Huang, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taiwan(台湾大学通讯工程研究所) Artificial Intelligence Center of Research Excellence (AI-CoRE), National Taiwan University, Taiwan(台湾大学人工智能卓越研究中心)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文研究了音频感知大语言模型的不确定性估计,通过多种方法对比发现语义层面方法在通用音频推理中表现更优,且在可靠性导向任务中效果依赖模型和基准。

Comments Manuscript in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11110 2026-04-29 cs.SD 67%

Ti-Audio: The First Multi-Dialectal End-to-End Speech LLM for Tibetan

Ti-Audio:首个多方言端到端藏语语音大模型

Jialing Wang, Yue Zhao, Yuhao Zhang, Jing Yu, Shaosai Li, Zhanchen Dai, Benyou Wang, Haizhou Li

机构 * Minzu University of China(中国民族大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 本文提出Ti-Audio,首个多方言端到端藏语语音大模型,通过动态Q-Former适配器和温度采样策略解决低资源多方言环境下的语音识别与翻译问题,实验显示其在藏语基准测试中达到最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24179 2026-04-29 cs.CL cs.AI 62%

MemeScouts@LT-EDI 2026: Asking the Right Questions -- Prompted Weak Supervision for Meme Hate Speech Detection

MemeScouts@LT-EDI 2026:问对问题——针对弱监督的提示方法用于表情包仇恨言论检测

Ivo Bueno, Lea Hirlimann, Enkelejda Kasneci

机构 * Technical University of Munich(慕尼黑技术大学) LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种提示弱监督方法,通过分解表情包理解为基于问题的标注函数,提升多语言多模态仇恨言论检测效果,尤其在中文和印地语中表现突出。

Comments Accepted at Sixth Workshop on Language Technology for Equality, Diversity and Inclusion at ACL2026 (LT-EDI@ACL26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25383 2026-04-29 cs.SD cs.AI eess.AS 62%

ML-SAN: Multi-Level Speaker-Adaptive Network for Emotion Recognition in Conversations

ML-SAN:多级说话人自适应网络用于对话中的情绪识别

Kexue Wang, Yinfeng Yu, Liejun Wang

机构 * Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学具身智能联合研究实验室) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(丝绸之路多语种认知计算国际联合研究实验室) School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出ML-SAN多级说话人自适应网络,通过三级适应过程解决说话人身份信息混淆问题,提升多轮对话中情绪识别的准确性和鲁棒性。

Comments Main paper (12 pages). Accepted for publication by International Conference on Intelligent Computing 2026

详情

展开后加载摘要…

URL PDF HTML 收藏