arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 1439 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 122 篇

2607.06405 2026-07-16 cs.MM cs.SD 版本更新 79%

Precise Video-to-Audio Generation with Cross-Modal Alignment in Latent Space

在潜在空间中通过跨模态对齐实现精确的视频到音频生成

Thanh V. T. Tran, Ngoc-Son Nguyen, Luong Tran, Long-Khanh Pham, Paarth Neekhara, Shehzeen Hussain, Van Nguyen

机构 * FPT Software AI Center(FPT软件人工智能中心) NVIDIA Corporation(NVIDIA公司)

专题命中 音频语音多模态 :cross-modal(title);audio-visual(abstract);分类 cs.MM

AI总结 研究视频到音频生成问题,提出Flowley架构,结合视觉特征与文本提示,通过渐进软掩码交叉注意力实现视听同步,无额外计算成本,还提出SoundCap字幕,该方法在多个指标及零样本音频质量上达先进水平。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15886 2026-07-16 cs.CL 版本更新 79%

Linked Multi-Modal Data on Russian Domestic and Foreign Policy Speeches

连接多模型数据:俄罗斯国内与对外政策演讲

Daria Blinova, Gayathri Emuru, Rakesh Emuru, Kushagradheer Shridheer Srivastava, Mina Rulis, Sunita Chandrasekaran, Benjamin E. Bagozzi

机构 * University of Delaware, Department of Political Science & International Relations(德克萨斯大学,政治科学与国际关系系) University of Delaware, Masters of Science in Data Science Program(德克萨斯大学,数据科学硕士项目) University of Delaware, Department of Computer & Information Sciences(德克萨斯大学,计算机与信息科学系) University of Pennsylvania, Department of Political Science(宾夕法尼亚大学,政治科学系)

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract);分类 cs.CL

AI总结 本文介绍了一个连接多模态政治通讯的数据集,涵盖俄罗斯政府多个 decades 的官方演讲,提供俄语和英语文本、图像及注释,并通过 transformer 多模态模型进行主题标注,支持政治通讯的多模态分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29473 2026-07-14 cs.CV 版本更新 79%

MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control

MAVIN:具有叙事控制的多镜头视听生成

Kaiqi Liu, Yunyao Mao, Ziqi Cai, Zheng Geng, Jing Wang, Qiulin Wang, Xintao Wang, Pengfei Wan, Kun Gai, Shuchen Weng, Boxin Shi

机构 * Peking University(北京大学) Kling Team, Kuaishou Technology(快手团队) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Sun Yat-sen University(中山大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 提出MAVIN框架,通过边界感知注意力、ID感知传播和多智能体脚本管线,实现多镜头视听生成中的叙事控制,解决时间错位、可控性差和脚本不完整问题。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18360 2026-07-09 cs.SD cs.CL 版本更新 79%

Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval

Omni-Embed-Audio: 利用多模态大语言模型实现鲁棒的音频-文本检索

HaeJun Yoo, Yongseop Shin, Insung Lee, Myoung-Wan Koo, Du-Seong Chang

机构 * Sogang University(首尔大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 提出Omni-Embed-Audio(OEA)检索编码器,利用多模态大语言模型原生理解音频,并通过用户意图查询(UIQ)和硬负样本挖掘,在文本到音频检索中达到与M2D-CLAP相当的性能,同时在文本到文本检索和硬负样本判别上显著优于现有方法。

Comments Accepted at ACL 2026 Main Conference. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08711 2026-07-03 cs.CV 版本更新 79%

TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions

TimeChat-Captioner: 用时间感知和结构化的音视频字幕脚本化多场景视频

Linli Yao, Yuancheng Wei, Yaojie Zhang, Lei Li, Xinlong Chen, Feifan Song, Ziyue Wang, Kun Ouyang, Yuanxin Liu, Lingpeng Kong, Qi Liu, Pengfei Wan, Kun Gai, Yuanxing Zhang, Xu Sun

机构 * South China University of Technology(华南理工大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 提出Omni密集描述任务,通过六维结构模式生成带时间戳的类脚本描述,构建OmniDCBench基准和SodaM评估指标,训练TimeChat-Captioner-7B模型,在音视频推理和时间定位任务上超越Gemini-2.5-Pro。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12165 2026-07-02 cs.CV 版本更新 79%

Audio-Visual Camera Pose Estimation with Passive Scene Sounds and In-the-Wild Video

利用被动场景声音和真实世界视频进行音频-视觉相机姿态估计

Daniel Adebi, Sagnik Majumder, Kristen Grauman

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 本文提出一种结合方向到达谱和双耳嵌入的音频-视觉框架,用于真实世界视频中的相机姿态估计,在视觉信息受损时表现出鲁棒性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11933 2026-06-25 cs.CL 版本更新 79%

Cross-Modal Robustness Transfer (CMRT): Training Robust Speech Translation Models Using Adversarial Text

跨模态鲁棒性迁移(CMRT):利用对抗文本训练鲁棒的语音翻译模型

Abderrahmane Issam, Yusuf Can Semerci, Jan Scholtes, Gerasimos Spanakis

机构 * Department of Advanced Computing Sciences(先进计算科学系)

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CL

AI总结 提出跨模态鲁棒性迁移(CMRT)框架,将文本模态的对抗鲁棒性迁移到语音模态,无需生成对抗语音数据,在四个语言对上平均提升超过3个BLEU点。

Comments A shorter version has been accepted at INTERSPEECH2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16606 2026-06-19 cs.CL 版本更新 79%

Omnilingual SONAR: Cross-Lingual and Cross-Modal Sentence Embeddings Bridging Massively Multilingual Text and Speech

Omnilingual SONAR:跨语言与跨模态句子嵌入,连接大规模多语言文本与语音

Omnilingual SONAR Team, João Maria Janeiro, Pere-Lluís Huguet Cabot, Ioannis Tsiamas, Yen Meng, Vivek Iyer, Guillem Ramírez, Loic Barrault, Belen Alastruey, Xiang "Tony" Cao, Yu-An Chung, Marta R. Costa-Jussa, David Dale, Kevin Heffernan, Jaehyeong Jo, Artyom Kozhevnikov, Alexandre Mourachko, Christophe Ropers, Holger Schwenk, Paul-Ambroise Duquenne

机构 * FAIR at Meta(Meta的FAIR)

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CL

AI总结 提出OmniSONAR模型,通过渐进式训练和教师-学生蒸馏,在数千种语言上实现文本、语音、代码和数学表达式的统一语义嵌入,在跨语言检索和翻译任务上显著降低错误率,并支持零样本语音翻译。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01394 2026-06-16 eess.AS cs.LG cs.SD 版本更新 79%

SSNAPS: Audio-Visual Separation of Speech and Background Noise with Diffusion Inverse Sampling

SSNAPS: 基于扩散逆采样的语音与背景噪声视听分离

Yochai Yemini, Yoav Ellinson, Rami Ben-Ari, Sharon Gannot, Ethan Fetaya

机构 * Bar-Ilan University(巴伊兰大学) OriginAI

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

AI总结 提出一种无监督的视听语音分离方法,利用扩散先验和逆采样联合建模语音与噪声,在单麦克风场景下优于有监督基线,并支持离屏说话人分离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16975 2026-06-16 cs.SD eess.AS 版本更新 79%

Interpretable Audio Editing Evaluation via Chain-of-Thought Difference-Commonality Reasoning with Multimodal LLMs

基于多模态大语言模型的链式思维差异-共性推理的可解释音频编辑评估

Yuhang Jia, Xu Zhang, Yang Chen, Hui Wang, Enzhi Wang, Yong Qin

机构 * College of Computer Science, Nankai University, Tianjin, China(南开大学计算机科学学院,天津,中国) Academy for Advanced Interdisciplinary Studies, Nankai University, Tianjin, China(南开大学先进跨学科研究学院,天津,中国)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

AI总结 提出首个基于自然语言的音频编辑自动评估框架,利用Qwen2-Audio和链式思维推理策略,实现可解释且与人类判断高度一致的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13293 2026-06-11 cs.CL 版本更新 79%

Cross-modal Consistency Guidance for Robust Emotion Control in Auto-Regressive TTS Models

跨模态一致性引导用于自动回归TTS模型中的鲁棒情绪控制

Yizhou Peng, Yukun Ma, Chong Zhang, Yi-Wen Chao, Chongjia Ni, Bin Ma, Eng Siong Chng

机构 * Alibaba-NTU Global e-Sustainability CorpLab(阿里-国立大学全球可持续发展公司实验室) Nanyang Technological University(南洋理工大学) College of Computing and Data Science(计算与数据科学学院) Alibaba(阿里) Alibaba Inc.(阿里公司)

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CL

AI总结 本文提出了一种基于文本情绪与显式语音情绪不一致程度的动态尺度的跨模态一致性引导分类器免费引导方法(CCG-CFG),通过使用文本情绪替代dropout条件,并采用硬样本挖掘策略蒸馏CCG-CFG引导信号,从而提升TTS模型的情绪对齐能力。在五个情感语料库和两个TTS基准测试中,该方法在CosyVoice2上实现了情绪识别准确率提升12%,主观评分提升10%,优于基线模型HierSpeech++、Qwen3-TTS和原始CosyVoice2,同时保持可懂性、自然度和高质量。

Comments Accepted to Interspeech 2026, short paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15294 2026-06-10 cs.SD cs.MM 版本更新 79%

MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions

MeMo: 视觉受损条件下的实时视听目标说话人提取的注意力动量

Junjie Li, Wenxuan Wu, Shuai Wang, Zexu Pan, Kong Aik Lee, Helen Meng, Haizhou Li

机构 * Department of Electrical and Electronic Engineering, Faculty of Engineering, The Hong Kong Polytechnic University(电子工程系,工程学院,香港理工大学) Department of Systems Engineering and Engineering Management, The Chinese University of Hong Kong(系统工程与工程管理系,香港中文大学) School of Artificial Intelligence (SAI), The Chinese University of Hong Kong, Shenzhen(人工智能学院(SAI),香港中文大学深圳校区) School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院,南京大学) Tongyi Lab, Alibaba Group, Singapore(通义实验室,阿里巴巴集团,新加坡)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.MM

AI总结 提出MeMo框架,通过两个自适应记忆库存储注意力信息,在视觉线索缺失时维持注意力动量,实现实时目标说话人提取,SI-SNR提升至少2dB。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11007 2026-07-29 cs.LG 版本更新 79%

TabPFN beyond Tabular Data: Calibration and Accuracy on Multimodal Embeddings

超越表格数据的TabPFN:多模态嵌入的校准与准确性

Jingxiang Zhang, Lujia Zhong, Zijie Zhu, Shuo Huang, Yuang Xu

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 研究少样本多模态分类中轻量级头部校准不佳问题,核心方法是评估TabPFN作为即插即用分类头。贡献在于其在多数据集、多编码器和多模态评估中表现优异,能提升校准并保持准确率,为校准敏感多模态分类提供指导。

Comments 19 pages, 13 figures, 10 tables. Jingxiang Zhang and Lujia Zhong contributed equally. Code: https://github.com/Jingxiang-Zhang/tabpfn-multimodal-embeddings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11590 2026-08-14 cs.SD cs.LG 版本更新 78%

CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation

CookVoice:风格可控的多模态人声生成统一框架

Haowei Lou, Hye-Young Paik, Dai Jia, Kai Li, Lina Yao

机构 * UNSW Sydney(新南威尔士大学悉尼分校) Dolby Laboratories(杜比实验室)

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract)

AI总结 CookVoice是统一的多模态人声生成框架,分解人声为内容、韵律、风格,支持多任务,参数少、推理高效,可控性强且生成质量接近基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24445 2026-08-07 cs.RO 版本更新 78%

Legible and Intuitive Multi-modal Robot State and Intent Communication Validated in Online and Real-world Studies

可读且直观的多模态机器人状态与意图通信:在线和真实世界研究验证

Tim Schreiter, Jens V. Rüppel, Andrey Rudenko, Martin Magnusson, Achim J. Lilienthal

机构 * Chair of Perception for Intelligent Systems, Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich (TUM)(慕尼黑工业大学慕尼黑机器人与机器智能研究所智能系统感知教席) Centre for Applied Autonomous Sensor Systems (AASS), Örebro University(厄勒布鲁大学应用自主传感器系统中心) Robotics Institute Germany (RIG)(德国机器人研究所)

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract)

AI总结 针对移动非人形机器人,通过在线和真实世界实验,系统比较了低表达单模态LED与高表达多模态(凝视、手势、语音)通信策略,发现多模态更可读直观,且真实环境中可读性和信心下降。

Comments Accepted for publication at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28165 2026-08-03 cs.CR 版本更新 78%

Piggybacking on Perception: Stealthy Concurrent Audio Prompt Injections against Multimodal LLM Agents

利用感知能力:针对多模态大语言模型智能体的隐蔽并发音频提示注入攻击

Mingxiao Liu, Yitong Li, Haoren Zhao, Yaoxiang Bian, Jianan Ma, Jian Zhang, Jialuo Chen, Xinhao Deng, Zhen Wang

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 该研究针对多模态LLM智能体提出隐蔽并发音频提示注入攻击,构建首个相关基准并评估多款智能体,还提出CADV防御机制,经实验验证攻击有效且防御可靠。

Comments 19 pages, 8 figures, The code is publicly available at https://github.com/Limax666/AudioAgentSecurity

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03920 2026-07-21 cs.RO 版本更新 78%

LH-AVLN: A Benchmark for Long-Horizon Audio-Visual-Language Navigation

LH-AVLN:长距离视听语言导航基准测试

Rufeng Chen, Yue Chang, Zili Shao, Zhaofan Zhang, Li Chen, Hechang Chen, Hui Xiong, Sihong Xie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Jilin University(吉林大学)

专题命中 音频语音多模态 :audio-visual(title,abstract)

AI总结 介绍长距离视听语言导航基准LH-AVLN,结合多目标任务执行等。提出免训练参考智能体PAG-Nav,可维护语义地图并规划。实验表明现有智能体完成任务有困难,PAG-Nav提供更强诊断基线。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05782 2026-07-20 cs.SE 版本更新 78%

When Models Meet Users: An Empirical Study of Perceptions of General LLMs and Multimodal LLMs on Hugging Face

对Hugging Face上通用大语言模型和多模态大语言模型感知的实证研究

Yujian Liu, Xiao Yu, Jacky Keung, Xing Hu, Xin Xia, Xiaoxue Ma

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 本文通过分析Hugging Face上662条讨论帖,揭示用户对LLM的主要关注点,包括访问障碍、生成质量及部署复杂性,并提出改进LLM生态系统的建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15280 2026-07-17 cs.HC 版本更新 78%

Supporting Multimodal Data Interaction on Refreshable Tactile Displays: An Architecture to Combine Touch and Conversational AI

在可刷新触觉显示器上支持多模态数据交互:一种将触觉与对话式AI结合的架构

Samuel Reinders, Munazza Zaib, Matthew Butler, Bongshin Lee, Ingrid Zukerman, Lizhen Qu, Kim Marriott

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 本文提出了一种结合触觉与对话式AI的架构,用于在可刷新触觉显示器上实现多模态数据交互,通过融合触觉输入与语音语言,提升视障人士的数据可视化体验。

Comments Accepted to be presented at IEEE PacificVis 2026; Best Paper Award (VisNotes track); Replacement: external DOI added

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06121 2026-07-07 cs.RO 版本更新 78%

Glance-Say: Multimodal Human-Robot Collaboration and Intent Recognition via Sticky Glance

Glance-Say:通过粘性注视实现多模态人机协作与意图识别

Yuzhi Lai, Shenghai Yuan, Peizheng Li, Benjamin Kiefer, Andreas Zell

机构 * University of Tuebingen(图宾根大学) Nanyang Technological University(南洋理工大学) Mercedes-Benz(梅赛德斯-奔驰)

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 针对运动障碍者,本文提出多模态交互框架,用粘性注视算法稳定基于注视的意图,引入注视-语音交互范式及共享控制方案,实验表明其在目标跟踪、选择精度及任务时长上效果更佳。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11606 2026-07-03 cs.SD cs.LG eess.SP 版本更新 78%

Scaling to Multimodal and Multichannel Heart Sound Classification with Synthetic and Augmented Biosignals

利用合成与增强生物信号实现多模态和多通道心音分类的规模化

Milan Marocchi, Matthew Fynn, Kayapanda Mandana, Yue Rong

机构 * School of Electrical Engineering, Computing, and Mathematical Sciences (EECMS), Faculty of Science and Engineering, Curtin University, Bentley, WA 6102, Australia(电气工程、计算与数学科学学院(EECMS),科学与工程学院, Curtin 大学,Bentley,WA 6102,澳大利亚)

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 针对心音分类中同步和多通道数据集有限的问题,提出结合传统信号处理与去噪扩散模型生成增强数据,微调Wav2Vec 2.0分类器,在多个数据集上取得最优性能。

Comments 35 pages, 37 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19127 2026-07-01 cs.LG 版本更新 78%

On Optimizing Multimodal Jailbreaks for Spoken Language Models

关于优化口语语言模型的多模态越狱攻击

Aravind Krishnan, Karolina Stańczak, Dietrich Klakow

机构 * Saarland University(萨尔大学) DFKI GmbH(德国人工智能研究中心) ETH AI Center(ETH人工智能中心)

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 提出联合音频文本多模态攻击框架JAMA,通过梯度优化同时扰动语音和文本模态,在四个SLM上实现1.5至20倍于单模态的越狱成功率,并分析其运行机制。

Comments Accepted at INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21050 2026-06-23 cs.SD 版本更新 78%

ERM-MinMaxGAP: Benchmarking and Mitigating Gender Bias in Multilingual Multimodal Speech-LLM Emotion Recognition

ERM-MinMaxGAP:多语言多模态语音-LLM情感识别中的性别偏见基准测试与缓解

Zi Haur Pang, Xiaoxue Gao, Tatsuya Kawahara, Nancy F. Chen

机构 * Kyoto University, Japan(京都大学,日本) Agency for Science, Technology, and Research (A*STAR), Singapore(科技研究局(A*STAR),新加坡)

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 针对多语言语音大模型在情感识别中的性别偏见问题,提出基于MELD-ST的多语言多模态基准,并设计ERM-MinMaxGAP训练目标,通过自适应公平权重和MinMaxGAP正则化器,在英日德三种语言上提升性能并缩小性别差距。

Comments This paper has been accepted for presentation at INTERSPEECH 2026 and as non-archival paper at ICML 2026 Workshop on Machine Learning for Audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28642 2026-08-17 cs.AI 版本更新 77%

Parameter- and Bandwidth-Efficient Edge--cloud Many-to-Many Speech-to-Text Translation

带宽高效且隐私保护的边缘-云多对多语音翻译

Yexing Du, Kaiyuan Liu, Youcheng Pan, Bo Yang, Lei Chen, Ming Liu, Bing Qin, Yang Xiang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室)

专题命中 音频语音多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI

AI总结 提出边缘-云协同框架ESRT,通过分割推理架构压缩中间特征实现带宽降低10倍和语音隐私保护,并采用多任务加权课程学习策略实现45种语言的多对多语音翻译。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17889 2026-08-10 cs.CV 版本更新 77%

Identity as Presence: Towards Appearance and Voice Personalized Joint Audio-Video Generation

身份作为存在:迈向基于外观和声音的联合音频视频生成

Qin Chen, Yingjie Chen, Shilun Lin, Cai Xing, Binxin Yang, Long Zhou, Qixin Yan, Wenjing Wang, Dingming Liu, Hao Liu, Chen Li, Jing Lyu

机构 * Tencent Inc.(腾讯公司) Peking University(北京大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 本文提出一个统一的框架,实现身份感知的音频视频生成,通过数据整理管道和灵活的身份注入机制,提升生成内容的高保真度和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15685 2026-07-09 cs.MM cs.AI cs.CV cs.SD 版本更新 75%

DASH: Dynamic Audio-Driven Semantic Chunking for Efficient Omnimodal Token Compression

DASH:动态音频驱动的语义分块以实现高效的多模态令牌压缩

Bingzhou Li, Tao Huang

机构 * Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 DASH通过动态音频驱动的语义分块方法,有效压缩多模态令牌,提升推理效率,优于传统固定窗口分块和注意力剪枝方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05663 2026-08-10 cs.CV cs.SD 版本更新 74%

Vorch-Streamer: Extending Human Audio-Visual Generation to Real-Time Long-Form Streaming

Vorch-Streamer:将人类音视频生扩展至实时长格式流式生成

Menglin Han, Yang Ding, Yulei Lu, Haoran Yu, Xin Ma, Junyi Chen, Zhangkai Ni, Lin Ma, Yaohui Wang

机构 * Vorch Team(Vorch团队) Tongji University(同济大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学)

专题命中 音频语音多模态 :audio-visual(title);分类 cs.CV

AI总结 Vorch-Streamer是一款后训练框架,通过混合训练、自强制与DMD蒸馏等技术,实现了超24 FPS的实时长格式T2AV流式音视频生成,兼具音唇同步性与身份保留能力。

Comments Project page: https://vorch-project.github.io/Vorch-Streamer-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17576 2026-07-21 cs.CV 版本更新 74%

LoGSAM: Parameter-Efficient Cross-Modal Grounding for MRI Segmentation

LoGSAM: 用于MRI分割的参数高效跨模态接地

Mohammad Robaitul Islam Bhuiyan, Sheethal Bhat, Melika Qahqaie, Andreas Maier, Tri-Thien Nguyen, Paula Andrea Pérez-Toro, Tomás Arias-Vergara

机构 * Pattern Recognition Lab, Friedrich-Alexander-Universität, Erlangen, Germany(德国埃朗根-纽伦堡大学模式识别实验室) Siemens Healthineers, Erlangen, Germany(德国埃朗根西门子医疗)

专题命中 音频语音多模态 :cross-modal(title);分类 cs.CV

AI总结 LoGSAM通过将放射科医生的语音转录为文本提示,利用预训练基础模型实现MRI肿瘤的高效分割,采用LoRA微调提升领域适应性,达到80.32%的Dice分数。

Comments 10 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30256 2026-07-30 cs.CV cs.CL cs.HC 版本更新 73%

VideoFDB: Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents

VideoFDB: 评估对话代理中的全双工视觉-语音能力

Amrita Mazumdar, Seonwook Park, Rajarshi Roy, Nikhil Srihari, Shengze Wang, Yuhao Zhou, Julia Wang, Koki Nagano, Shalini De Mello

机构 * NVIDIA David AI

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL

AI总结 提出首个全双工视听到视听(AV2AV)对话基准VideoFDB,通过237个真实视频片段、感知与生成行为分类以及基于评分规则的LM评判框架,系统评估代理在非语言对话动态中的表现,发现现有系统存在字幕崩溃和视觉流忽视等缺陷。

Comments Project page: https://research.nvidia.com/labs/amri/projects/video-fdb/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21478 2026-06-23 cs.CL cs.LG eess.AS 版本更新 73%

TaigiSpeech: A Low-Resource Real-World Speech Intent Dataset and Preliminary Results with Scalable Data Mining In-the-Wild

TaigiSpeech: 一个低资源真实世界语音意图数据集及基于可扩展野外数据挖掘的初步结果

Kai-Wei Chang, Yi-Cheng Lin, Huang-Cheng Chou, Wenze Ren, Yu-Han Huang, Yun-Shao Tsai, Chien-Cheng Chen, Yu Tsao, Yuan-Fu Liao, Shrikanth Narayanan, James Glass, Hung-yi Lee

机构 * Massachusetts Institute of Technology, USA(麻省理工学院) National Taiwan University, Taipei, Taiwan(国立台湾大学) National Taiwan University Artificial Intelligence Center of Research Excellence, Taipei, Taiwan(国立台湾大学人工智能研究中心) Academia Sinica, Taiwan(台湾“中央”研究院) National Yang Ming Chiao Tung University, Taiwan(阳明交通大学) Signal Analysis and Interpretation Laboratory (SAIL), University of Southern California, USA(信号分析与解释实验室(SAIL),南加州大学)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CL、eess.AS

AI总结 针对低资源台语,构建包含21位老年人3000条话语的语音意图数据集,并探索关键词匹配与LLM伪标注、音视频框架两种数据挖掘策略,以解决标注数据稀缺问题。

Comments Interspeech 2026 long paper

详情

展开后加载摘要…

URL PDF HTML 收藏