arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-09 至 2026-07-09 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 7 篇

2607.07294 2026-07-09 cs.RO cs.AI cs.CL 新提交 84%

Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders

用于社交机器人对话轮次转换的多模态语音活动投影及与语音活动相关的预训练编码器

Antonio Cano, Guillermo Pérez, Luis Merino, Randy Gomez

机构 * i Intelligent Insights(4i智能洞察公司) Universidad de Sevilla(塞维利亚大学) Universidad Pablo de Olavide(巴勃罗·德奥拉维德大学) Honda Research Institute Japan(本田日本研究所)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CL、cs.AI

AI总结 研究社交机器人对话轮次转换,提出多模态语音活动投影框架,基于预训练视听主干并经低秩适应,结合说话人间注意力及语义一致性损失,实验表明该方法优于基线,适用于调解型人机交互。

Comments Accepted for presentation at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026). Acceptance notification date: 30 May 2026. Final published version pending

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06611 2026-07-09 cs.CL cs.AI cs.LG cs.SD 新提交 84%

Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts

通过生成的多语言转录本的蒸馏和跨模态集成进行音频情感分析

Andrei-George Durdun, Victor Constantinescu, Radu Tudor Ionescu

机构 * University of Bucharest(布加勒斯特大学) PPC Romania(罗马尼亚PPC)

专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 研究语音情感分析难题,提出通过跨模态变压器集成音频与文本信息的多模态方案,经自动语音识别生成转录本并翻译为多语言文本,还进行知识蒸馏,实验证明该方法能提升多模态情感分类性能及增强单模态音频模型。

Comments Accepted at KES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06892 2026-07-09 eess.AS 新提交 79%

UBG-Net: An Uncertainty-aware Bayesian Gating Network for Robust Audio-Visual Speech Recognition

UBG-Net:用于鲁棒视听语音识别的不确定性感知贝叶斯门控网络

Jinjie Fu, Hang Chen, Wu Guo, Zhijun Zhang, Kuiliang Li, Peng Gao

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

AI总结 针对视听语音识别系统在现实场景中的性能问题,提出UBG-Net框架,通过MUBF机制建模认知不确定性,用DUHV进行推理,实验表明其优于SOTA基线,消融研究证实相关机制增强了鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18360 2026-07-09 cs.SD cs.CL 版本更新 79%

Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval

Omni-Embed-Audio: 利用多模态大语言模型实现鲁棒的音频-文本检索

HaeJun Yoo, Yongseop Shin, Insung Lee, Myoung-Wan Koo, Du-Seong Chang

机构 * Sogang University(首尔大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 提出Omni-Embed-Audio(OEA)检索编码器,利用多模态大语言模型原生理解音频,并通过用户意图查询(UIQ)和硬负样本挖掘,在文本到音频检索中达到与M2D-CLAP相当的性能,同时在文本到文本检索和硬负样本判别上显著优于现有方法。

Comments Accepted at ACL 2026 Main Conference. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15685 2026-07-09 cs.MM cs.AI cs.CV cs.SD 版本更新 75%

DASH: Dynamic Audio-Driven Semantic Chunking for Efficient Omnimodal Token Compression

DASH:动态音频驱动的语义分块以实现高效的多模态令牌压缩

Bingzhou Li, Tao Huang

机构 * Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 DASH通过动态音频驱动的语义分块方法,有效压缩多模态令牌,提升推理效率,优于传统固定窗口分块和注意力剪枝方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04443 2026-07-09 cs.CV cs.AI cs.GR cs.LG 新提交 62%

Wan-Streamer v0.2: Higher Resolution, Same Latency

万流播器v0.2:更高分辨率,相同延迟

Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chen Liang, Cheng Yu, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zoubin Bi

机构 * Alibaba Group(阿里巴巴集团)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 介绍万流播器v0.2,它保持v0.1建模公式,将交互输出流分辨率提高,在保持低延迟下支持场景中景智能体。核心方法是优化架构,主要贡献是提升分辨率同时保持低延迟,集中硬件于视觉生成。

Comments Website: https://wan-streamer.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07430 2026-07-09 cs.RO cs.SY eess.SY 新提交 50%

Immersive Social Interaction with VR and LLM-Assisted Humanoids

通过虚拟现实和大语言模型辅助的人形机器人实现沉浸式社交互动

Niraj Pudasaini, Geeta Chandra Raju Bethala, Pranav Doma, Anthony Tzes, Yi Fang

机构 * Inspire Robotics(Inspire机器人公司)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 研究通过集成语音控制移动、VR操作和双向社交互动的框架实现人形机器人全身控制,利用苹果视觉专业版等,经大语言模型辅助语音控制等技术,在宇树H1人形机器人上评估,新手操作成功率可观,证明该方式在多方面应用的潜力。

Comments IEEE-RAS International Conference on Humanoid Robots - Workshop: Designing Interactive Humanoids

详情

展开后加载摘要…

URL PDF HTML 收藏