arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-14 至 2026-08-14 共收录 11 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 11 篇

2604.03314 2026-08-14 cs.CV cs.CL 版本更新 90%

CoLA: Cross-Modal Low-rank Adaptation for Multimodal Downstream Tasks

CoLA: 跨模态低秩适配用于多模态下游任务

Wish Suharitdamrong, Tony Alex, Muhammad Awais, Sara Atito

机构 * Centre for Vision, Speech and Signal Processing (CVSSP)(视觉、语音和信号处理中心) University of Surrey(塞维利亚大学) Surrey Institute for People-Centred AI(以人为本的人工智能研究所)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(title,abstract);audio-visual(abstract);分类 cs.CV、cs.CL

AI总结 提出CoLA框架,通过引入跨模态适配路径扩展LoRA,实现双流架构中单模态基础模型的高效多模态适配,在视觉-语言和音频-视觉任务上分别提升约3%和2%的相对性能。

Comments Accepted by ICML 2026, 17 pages, 6 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15086 2026-08-14 cs.MM cs.CV cs.SD 版本更新 86%

ControlFoley: Unified and Controllable Video-to-Audio Generation with Cross-Modal Conflict Handling

ControlFoley: 一种统一且可控的视频到音频生成方法,具有跨模态冲突处理

Jianxuan Yang, Xinyue Guo, Zhi Cheng, Kai Wang, Lipan Zhang, Jinjie Hu, Qiang Ji, Yihua Cao, Yihao Meng, Zhaoyue Cui, Mengmei Liu, Meng Meng, Jian Luan

机构 * MiLM Plus, Xiaomi Inc.(小米MiLM Plus) MiLM Plus, Xiaomi Inc. Wuhan University(小米MiLM Plus 武汉大学) Wuhan University(武汉大学)

专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM

AI总结 ControlFoley通过联合视觉编码和时域-音域解耦提升视频到音频生成的可控性与同步性,在多种任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13239 2026-08-14 cs.CV 新提交 85%

Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?

社会视听问答的推理:我们处于什么阶段?

Koen P. de Vries, Xavier Alameda-Pineda, Estefanía Talavera, Stéphane Lathuilière

机构 * Inria(法国国家信息与自动化研究所) Univ. Grenoble Alpes(格勒诺布尔大学) CNRS(法国国家科学研究中心) University of Twente(特文特大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract,abstract_cn);分类 cs.CV

AI总结 本文针对社会视听问答研究,发现IntentBench存在高噪声,Vanilla SFT基线性能优于现有推理方法,仅用文本模态即可实现与视频相当的性能,并发布了IntentBench-Prime等资源。

Comments Accepted at HCMIW ECCV workshop. Code available here: https://github.com/koenv759/VanillaSFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09001 2026-08-14 cs.SD eess.AS 版本更新 85%

Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition

基于最优传输的基于大语言模型的视听语音识别语义对齐

Xugang Lu, Peng Shen, Yu Tsao, Hisashi Kawai

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 eess.AS

AI总结 研究基于大语言模型的视听语音识别,提出基于最优传输的语义对齐框架,通过在多模态融合前对齐声学和视觉表征弥合模态差距,经实验验证该方法能有效提升性能,在多种条件下达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11752 2026-08-14 cs.CV cs.SD 版本更新 79%

UniSwap: Streaming Audio-Visual Identity Swapping for Talking Videos

UniSwap:用于说话视频的流音频-视觉身份交换

Yuxuan Zhang, Haozhong Xiong, Jiayi Song, Jinpeng Yu, Yang Shi, Jiaming Liu, Ruihua Huang, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Qwen Applications Business Group of Alibaba(阿里巴巴通义千问应用业务集团)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 UniSwap是首个流音频-视觉身份替换框架,通过多阶段适配技术解决现有方法音视频一致性差等问题,实现高效稳定的说话视频身份替换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11590 2026-08-14 cs.SD cs.LG 版本更新 78%

CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation

CookVoice:风格可控的多模态人声生成统一框架

Haowei Lou, Hye-Young Paik, Dai Jia, Kai Li, Lina Yao

机构 * UNSW Sydney(新南威尔士大学悉尼分校) Dolby Laboratories(杜比实验室)

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract)

AI总结 CookVoice是统一的多模态人声生成框架,分解人声为内容、韵律、风格,支持多任务,参数少、推理高效,可控性强且生成质量接近基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05543 2026-08-14 cs.IR 版本更新 71%

omni-macos: On-Device Omni-Modal Search on Apple Silicon

omni-macos:在Apple Silicon上运行的端侧全模态搜索系统

Han Xiao

专题命中 音频语音多模态 :omni-modal(title)

AI总结 omni-macos是一款在Apple Silicon端侧运行的全模态搜索系统,可在用户Mac设备上处理多模态数据搜索,数据不离开设备,适配不同硬件规格的Mac并优化内存使用。

Comments 18 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13101 2026-08-14 cs.CL eess.AS 新提交 62%

CASA: Content-Acoustic Speaking Assessment with Speech Encoder and Large Language Model

CASA:结合语音编码器与大语言模型的内容-语音口语评估

Nhan Phan, Ilona Lähteenmäki, Anna von Zansen, Olli-Pekka Pauna, Yaroslav Getman, Tamás Grósz, Mikko Kurimo

机构 * Aalto University(阿尔托大学) University of Helsinki(赫尔辛基大学) Walton Institute(沃尔顿研究所)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 该研究提出结合Whisper-medium与Qwen3.5-2B的CASA架构,在Speak & Improve Corpus 2025上RMSE达0.358,参数量减半,可分离语音表达与内容,还分析了声学与内容信息的贡献及性能稳定性。

Comments To be submitted to ICASSP 2027. Code is available at https://github.com/aalto-speech/casa

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08235 2026-08-14 eess.AS 版本更新 57%

SraVaani 1.0: Scaling Inclusive Speech Recognition for Indic Languages

SraVaani 1.0:面向印度语言的包容性自动语音识别规模化模型

Sujith Pulikodan, Agneedh Basu, Pavan Kumar J, Pranav D Bhat, Suryansh Shukla, Nihar Desai, Prasanta Kumar Ghosh

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文提出SraVaani 1.0,一款基于FastConformer架构的多语言ASR模型,覆盖65种印度语言,经三阶段训练后在8个基准上表现优异,是唯一支持多种低资源及部落印度语言转录的开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08874 2026-08-14 cs.CV 版本更新 57%

AeroReformer2: Spoken-Query Referring Segmentation for Aerial Images

AeroReformer2:面向航拍图像的语音查询指称分割

Rui Li, Chenxi Duan, Haoyang Yang

机构 * Massachusetts Institute of Technology(麻省理工学院) The University of Manchester(曼彻斯特大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文针对现有指称遥感图像分割基准仅支持书面表达的问题,构建了首个语音查询指称分割基准RISBench-S,并提出高效双边网络模型AeroReformer2,在相关任务上取得优于基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12615 2026-08-14 cs.SD cs.LG 新提交 50%

Drive-to-Music: Context-Aware Generative Audio for In-Vehicle Experiences

音乐驱动:面向车载体验的上下文感知生成音频

Cosmin Dragoiu, Nooshin Nabizadeh

机构 * Mercedes-Benz Research & Development North America(梅赛德斯-奔驰北美研发中心)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本研究提出Drive-to-Music系统,利用行车记录仪图像与车辆遥测数据,结合感知与生成组件实现低延迟实时上下文感知车载音乐生成,为个性化自适应车载音频体验奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏