arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-23 至 2026-03-23 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 6 篇

2306.02393 2026-03-23 cs.RO cs.CV 79%

EgoSpot:Egocentric Multimodal Control for Hands-Free Mobile Manipulation

EgoSpot:面向无手移动操作的视角多模态控制

Ganlin Zhang, Deheng Zhang, Longteng Duan, Guo Han, Yuqian Fu, Danda Pani Paudel, Luc Van Gool, Eric Vollenweider

机构 * Technical University of Munich(慕尼黑技术大学) ETH Zurich(苏黎世联邦理工学院) SJTU(上海交通大学) Microsoft(微软公司)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种基于微软HoloLens 2混合现实头显的无手控制框架,通过眼动、头部动作和语音指令融合实现机器人移动和机械臂操作的实时控制,提升无障碍交互体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19831 2026-03-23 eess.AS cs.AI cs.MM 67%

Gesture2Speech: How Far Can Hand Movements Shape Expressive Speech?

Gesture2Speech: 手部动作能多大程度上塑造表现性语音?

Lokesh Kumar, Nirmesh Shah, Ashishkumar P. Gudmalwar, Pankaj Wasnik

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 本文提出Gesture2Speech框架,利用视觉手势线索调节合成语音的语调,通过多模态MoE架构动态融合语言内容和手势特征,提升语音自然度和手势与语调的同步性。

Comments Accepted at The 2nd International Workshop on Bodily Expressed Emotion Understanding (BEEU) at AAAI 2026 [non-archival]

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20165 2026-03-23 cs.SD eess.AS 57%

Audio Avatar Fingerprinting: An Approach for Authorized Use of Voice Cloning in the Era of Synthetic Audio

音频人像指纹:在合成音频时代授权使用语音克隆的方法

Candice R. Gerstner

机构 * Research Directorate and AI Security Center(研究部和人工智能安全中心)

专题命中 音频语音多模态 :audio-visual(abstract);分类 eess.AS

AI总结 本文提出音频人像指纹技术,用于验证合成语音是否由授权身份生成,通过扩展现有说话人验证模型并引入新数据集解决合成语音授权使用验证问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19468 2026-03-23 cs.SD eess.AS 57%

Listen First, Then Answer: Timestamp-Grounded Speech Reasoning

先听再回答:基于时间戳的语音推理

Jihoon Jeong, Pooneh Mousavi, Mirco Ravanelli, Cem Subakan

机构 * Mila-Quebec AI Institute(魁北克AI研究所) Université Laval(拉瓦尔大学) Concordia University(康科迪亚大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文提出基于强化学习的时间戳接地策略,使语音大模型在推理时更关注音频内容,提升多模态推理的准确性。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19279 2026-03-23 cs.CL 57%

Multilingual Hate Speech Detection and Counterspeech Generation: A Comprehensive Survey and Practical Guide

多语言仇恨言论检测与反仇恨言论生成:全面综述与实用指南

Zahra Safdari Fesaghandis, Suman Kalyan Maity

机构 * Bilkent University(比尔肯特大学) Missouri University of Science and Technology(密苏里科技大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文综述并指导多语言仇恨言论检测与反仇恨言论生成,分析单语言系统在非英语和混合语言环境中的不足,提出三阶段框架,整合最新NLP进展,强调数据稀缺、公平性与多模态解决方案。

Comments 29 pages, 7 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19350 2026-03-23 cs.CL 57%

Modeling Turn-Taking with Semantically Informed Gestures

通过语义引导的手势建模轮流交替

Varsha Suresh, M. Hamza Mughal, Christian Theobalt, Vera Demberg

机构 * Saarland University(萨尔兰大学) Max Planck Institute for Informatics(马克斯·普朗克信息研究所) Saarland Informatics Campus(萨尔兰信息学校区)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文通过引入DnD Gesture++数据集,结合文本、音频和手势的混合专家框架,研究语义引导的手势在多模态轮流交替建模中的作用。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏