arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-07 至 2026-04-07 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 8 篇

2604.03995 2026-04-07 cs.CV cs.SD 89%

A Systematic Study of Cross-Modal Typographic Attacks on Audio-Visual Reasoning

多模态字体攻击在音频视觉推理中的系统研究

Tianle Chen, Deepti Ghadiyaram

机构 * Boston University(波士顿大学)

专题命中 音频语音多模态 :cross-modal(title,abstract);audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 本文研究多模态字体攻击对多模态大语言模型的影响,发现跨模态攻击比单模态攻击更有效,揭示了多模态推理中的关键安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04229 2026-04-07 cs.MM cs.AI cs.CV cs.SD 85%

Hierarchical Semantic Correlation-Aware Masked Autoencoder for Unsupervised Audio-Visual Representation Learning

层次化语义相关性感知的掩码自编码器用于无监督音频-视觉表示学习

Donghuo Zeng, Hao Niu, Masato Taya

机构 * KDDI Research, Inc., Saitama, Japan(KDDI研究所,埼玉,日本)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出HSC-MAE框架,通过三级表示层次强制语义一致性,结合教师-学生架构和多任务学习,提升无监督音频-视觉表示学习效果。

Comments 6 pages, 2 tables, 4 figures. Accepted by IEEE ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10882 2026-04-07 cs.CL 83%

Computational emotion analysis with multimodal LLMs: Current evidence on an emerging methodological opportunity

基于多模态大语言模型的计算情感分析:当前对新兴方法论机会的证据

Hauke Licht

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CL

AI总结 本文评估了多模态大语言模型在政治视频情感分析中的表现,发现实验室条件下的模型表现接近人类水平,但在真实场景中存在显著性能差距及性别偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29244 2026-04-07 cs.CL cs.LG 79%

The Thiomi Dataset: A Large-Scale Multimodal Corpus for Low-Resource African Languages

Thiomi数据集:一个大规模多模态语料库,用于低资源非洲语言

Hillary Mutisya, John Mugane, Gavin Nyamboga, Brian Chege, Maryruth Gathoni

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 Thiomi数据集包含超过60万条文本注释和38.5万条音频记录,用于训练和评估ASR、MT和TTS模型,显著提升了非洲语言的语音识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07571 2026-04-07 cs.CL cs.MM 62%

A Simple Method to Enhance Pre-trained Language Models with Speech Tokens for Classification

一种通过语音标记增强预训练语言模型用于分类的简单方法

Nicolas Calbucura, Jose Guillen, Valentin Barriere

机构 * Universidad de Chile, DCC(智利大学计算机科学系) Universidad Tecnica Santa Maria(圣玛利亚理工大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.MM

AI总结 本文提出一种简单方法,通过语音信息增强预训练语言模型以提高分类任务性能,采用多模态词袋表示和自监督语言建模目标,实验证明在论证谬误检测和情感计算任务中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04093 2026-04-07 cs.HC 50%

BadgeX: IoT-Enhanced Wearable Analytics Meets LLMs for Collaborative Learning

BadgeX:物联网增强型可穿戴分析与大语言模型结合用于协作学习

Zaibei Li, Shunpei Yamaguchi, Qiuchi Li, Daniel Spikol

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 BadgeX结合轻量级可穿戴物联网设备与大语言模型,实现实时协作学习分析,通过多模态传感器数据生成高层面学习洞察。

Comments 4 pages, 2 figures. Preprint. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03998 2026-04-07 cs.RO 50%

VA-FastNavi-MARL: Real-Time Robot Control with Multimedia-Driven Meta-Reinforcement Learning

VA-FastNavi-MARL:基于多媒体驱动的元强化学习的实时机器人控制

Yang Zhang, Shengxi Jing, Fengxiang Wang, Yuan Feng, Hong Wang

机构 * School of Artificial Intelligence, Hubei University(湖北大学人工智能学院) Department of Mechanical and Aerospace Engineering, University of Missouri(密苏里大学机械与航空航天工程系) School of Construction Machinery, Chang’an University(长安大学工程机械学院) Key Laboratory of Intelligent Sensing System and Security (Ministry of Education), Hubei University(湖北大学智能感知系统与安全教育部重点实验室)

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 本文提出VA-FastNavi-MARL框架,通过元强化学习将异步音频视觉输入统一为潜在表示,实现快速适应未知指令,提升实时控制性能。

Comments Accepted to the 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)

Journal ref 2026 IEEE International Conference on Multimedia and Expo (ICME)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03612 2026-04-07 cs.CR 50%

Perceptual Gaps: ASCII Art and Overlapping Audio as CAPTCHA

感知缺口:ASCII艺术与重叠音频作为CAPTCHA

Choon-Hou Rafael Chong

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文探讨了利用人类高度专业化神经处理的CAPTCHA任务,提出基于ASCII艺术和重叠音频的两种CAPTCHA类型,测试结果显示现有LLM无法有效解决,表明其在当前有效但可能面临AI发展挑战。

Comments 8 pages, 3 figures. Research paper proposing novel CAPTCHA methods using ASCII art and overlapping audio

详情

展开后加载摘要…

URL PDF HTML 收藏