arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-26 至 2026-06-26 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 6 篇

2606.26107 2026-06-26 cs.CL cs.AI 新提交 81%

Low Resource Multimodal Translation of Nepali Spoken Words into Emotion-Conditioned Sign Language Avatars

低资源场景下尼泊尔口语词汇到情感条件手语虚拟人物的多模态翻译

Jatin Bhusal, Salma Tamang

机构 * Center for Human Mobility and Communications, Prateek Innovations(普拉蒂克创新公司人类移动与通信中心) Sunway International Business School, Birmingham City University(双威国际商学院,伯明翰城市大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 提出NEST-V1框架,通过共享声学编码器实现语音识别与情感分类,生成情感条件尼泊尔手语虚拟人物,在低资源场景下验证了技术可行性。

Comments 15 pages, 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25041 2026-06-26 cs.CV cs.AI cs.GR cs.SD 新提交 79%

Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models

Wan-Streamer v0.1: 端到端实时交互基础模型

Lianghua Huang, Zhi-Fan Wu, Wei Wang, Yupeng Shi, Mengyang Feng, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chen Liang, Cheng Yu, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuzheng Wang, Zoubin Bi

机构 * Alibaba Group(阿里巴巴集团)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 提出Wan-Streamer,一种原生流式、端到端的交互基础模型,通过单一Transformer联合建模语言、音频和视频,实现低延迟全双工音视频交互,无需外部模块。

Comments Website: https://wan-streamer.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03762 2026-06-26 eess.AS cs.LG 版本更新 70%

Conditional Flow Matching for Visually-Guided Acoustic Highlighting

基于条件流匹配的视觉引导声学增强

Hugo Malard, Gael Le Lan, Daniel Wong, David Lou Alon, Yi-Chiao Wu, Sanjeel Parekh

机构 * LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信学院,巴黎理工学院) Meta

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 eess.AS

AI总结 提出条件流匹配生成框架解决视觉引导音频重混中的多对多映射问题,通过滚动损失和跨模态融合模块实现优于判别方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26793 2026-06-26 cs.CR cs.AI cs.LG 新提交 57%

MIRROR: Novelty-Constrained Memory-Guided MCTS Red-Teaming for Agentic RAG

MIRROR: 基于新颖性约束的记忆引导MCTS红队测试用于智能体RAG

Inderjeet Singh, Andrés Murillo, Motoyoshi Sekiya, Yuki Unno, Junichi Suga

机构 * Fujitsu Research of Europe, United Kingdom(欧洲富士通研究机构,英国) Fujitsu Limited, Japan(日本富士通有限公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出MIRROR框架,通过记忆引导蒙特卡洛树搜索和显式新颖性约束,在多模态智能体RAG系统的四个攻击面上实现高攻击成功率,并降低跨表面方差。

Comments 6 pages, 2 figures. Accepted at the 2026 International Joint Conference on Neural Networks (IJCNN 2026), IEEE WCCI 2026; presented as an oral talk. Code and ART-SafeBench benchmark: https://github.com/FujitsuResearch/mirror

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08660 2026-06-26 cs.CL 版本更新 57%

A Systematic Survey of Semantic Role Labeling in the Era of Pretrained Language Models

预训练语言模型时代语义角色标注的系统综述

Huiyao Chen, Meishan Zhang, Jing Li, Lilja Øvrelid, Jan Hajič, Hao Fei, Min Zhang

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute (SLAI)(深圳南山区研究院) University of Oslo(奥斯陆大学) Charles University(查尔斯大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 提出四维分类法系统综述SRL研究,分析句法特征的作用条件,首次系统处理大语言模型时代的SRL,并扩展至多模态设置。

Comments 54 pages, 9 figures, 9 tables. Accepted at Artificial Intelligence Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06080 2026-06-26 cs.CV cs.CY cs.HC 版本更新 57%

AIDEN: Design and Pilot Study of an AI Assistant for the Visually Impaired

AIDEN:面向视障人士的AI助手设计与初步研究

Luis Marquez-Carpintero, Francisco Gomez-Donoso, Zuria Bauer, Bessie Dominguez-Dager, Alvaro Belmonte-Baeza, Mónica Pina-Navarro, Francisco Morillas-Espejo, Felix Escalona, Miguel Cazorla

机构 * Institute for Computer Research, University of Alicante(计算机研究所,阿利坎特大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出AIDEN系统,结合YOLO实时目标检测、LLaVA场景描述与OCR,以及基于盖革计数器隐喻的连续触觉引导,避免听觉过载并保护隐私,实验表明用户满意度高。

Journal ref IEEE Access 14 (2026) 80406-80420

详情

展开后加载摘要…

URL PDF HTML 收藏