arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-31 至 2026-03-31 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 10 篇

2506.03388 2026-03-31 cs.CV 83%

Cross-Modal Urban Sensing: Evaluating Sound-Vision Alignment Across Street-Level and Aerial Imagery

跨模态城市感知:评估声音与视觉在街道级和航空影像中的对齐情况

Pengyu Chen, Xiao Huang, Teng Fei, Sicheng Wang

机构 * Department of Geography, University of South Carolina(南卡罗来纳大学地理系) Department of Environmental Sciences, Emory University(埃默里大学环境科学系) University of Canterbury(坎特伯雷大学) School of Resource and Environmental Sciences, Wuhan University(武汉大学资源与环境科学学院)

专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 研究通过比较不同视觉表示策略,探讨城市声音与视觉场景的对齐程度,发现街道影像嵌入比分割结果更符合环境声音,而遥感分割在生态分类解释中更有效。

Comments 18 pages, 13 figures

Journal ref Transactions in GIS, 30(2), e70246, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28757 2026-03-31 cs.CV cs.MM cs.SD 81%

SonoWorld: From One Image to a 3D Audio-Visual Scene

SonoWorld:从一张图像到一个三维音频视觉场景

Derong Jin, Xiyi Chen, Ming C. Lin, Ruohan Gao

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出Image2AVScene任务,通过SonoWorld框架生成三维音频视觉场景,结合图像生成全景、三维场景构建、语言引导声音锚点和空间音频渲染,实现沉浸式体验。

Comments Accepted by CVPR 2026, project page: https://humathe.github.io/sonoworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26840 2026-03-31 eess.AS cs.AI 81%

Dual-branch Graph Domain Adaptation for Cross-scenario Multi-modal Emotion Recognition

双分支图域适应用于跨场景多模态情感识别

Yuntao Shou, Jun Zhou, Tao Meng, Wei Ai, Keqin Li

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出双分支图域适应框架DGDA,解决跨场景多模态情感识别中的域移位和标签噪声问题,通过情感交互图和双分支编码器提升模型泛化能力,实验验证其优于现有方法。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27918 2026-03-31 cs.CR cs.AI 79%

Adversarial Attacks on Multimodal Large Language Models: A Comprehensive Survey

对多模态大语言模型的对抗攻击:全面综述

Bhavuk Jain, Sercan Ö. Arık, Hardeo K. Thakur

机构 * Google(谷歌) Bennett University, India(印度贝内特大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文综述了多模态大语言模型面临的对抗威胁,分析了攻击类型及其根源,提出分类框架以提升模型安全性。

Comments Survey paper, 37 pages, 10 figures, accepted at TMLR

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27538 2026-03-31 cs.CV cs.CL 62%

LongCat-Next: Lexicalizing Modalities as Discrete Tokens

LongCat-Next:将模态词典化为离散标记

Meituan LongCat Team, Bin Xiao, Chao Wang, Chengjiang Li, Chi Zhang, Chong Peng, Hang Yu, Hao Yang, Haonan Yan, Haoze Sun, Haozhe Zhao, Hong Liu, Hui Su, Jiaqi Zhang, Jiawei Wang, Jing Li, Kefeng Zhang, Manyuan Zhang, Minhao Jing, Peng Pei, Quan Chen, Taofeng Xue, Tongxin Pan, Xiaotong Li, Xiaoyang Li, Xiaoyu Zhao, Xing Hu, Xinyang Lin, Xunliang Cai, Yan Bai, Yan Feng, Yanjie Li, Yao Qiu, Yerui Sun, Yifan Lu, Ying Luo, Yipeng Mei, Yitian Chen, Yuchen Xie, Yufang Liu, Yufei Chen, Yulei Qian, Yuqi Peng, Zhihang Yu, Zhixiong Han, Changran Wang, Chen Chen, Dian Zheng, Fengjiao Chen, Ge Yang, Haowei Guo, Haozhe Wang, Hongyu Li, Huicheng Jiang, Jiale Hong, Jialv Zou, Jiamu Li, Jianping Lin, Jiaxing Liu, Jie Yang, Jing Jin, Jun Kuang, Juncheng She, Kunming Luo, Kuofeng Gao, Lin Qiu, Linsen Guo, Mianqiu Huang, Qi Li, Qian Wang, Rumei Li, Siyu Ren, Wei Wang, Wenlong He, Xi Chen, Xiao Liu, Xiaoyu Li, Xu Huang, Xuanyu Zhu, Xuezhi Cao, Yaoming Zhu, Yifei Cao, Yimeng Jia, Yizhen Jiang, Yufei Gao, Zeyang Hu, Zhenlong Yuan, Zijian Zhang, Ziwen Wang

机构 * Meituan LongCat Team(美团LongCat团队)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 LongCat-Next提出了一种统一框架DiNA,通过共享离散空间实现多模态一致建模,引入dNaViT实现任意分辨率的标记化与反标记化,构建出单一自回归目标处理文本、视觉和音频的多模态模型,突破离散视觉建模的性能瓶颈。

Comments LongCat-Next Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01448 2026-03-31 cs.LG cs.MM 57%

OpenAVS: Training-Free Open-Vocabulary Audio Visual Segmentation with Foundational Models

OpenAVS: 基于基础模型的无训练开放词汇音频视觉分割

Shengkai Chen, Yifang Yin, Jinming Cao, Shili Xiang, Zhenguang Liu, Roger Zimmermann

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.MM

AI总结 OpenAVS通过文本作为代理,首次实现音频与视觉模态对齐,利用基础模型直接推断掩码,提升开放词汇音频视觉分割的泛化能力。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10652 2026-03-31 cs.CV cs.CR 57%

TriDF: Evaluating Perception, Detection, and Hallucination for Interpretable DeepFake Detection

TriDF:评估可解释深度伪造检测的感知、检测和幻觉

Jian-Yu Jiang-Lin, Kang-Yang Huang, Ling Zou, Ling Lo, Sheng-Ping Yang, Yu-Wen Tseng, Kun-Hsiang Lin, Chia-Ling Chen, Yu-Ting Ta, Yan-Tsung Wang, Po-Ching Chen, Hongxia Xie, Hong-Han Shuai, Wen-Huang Cheng

机构 * National Taiwan University(国立台湾大学) National Yang Ming Chiao Tung University(国立阳明交通大学) Jilin University(吉林大学) VinUniversity

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 TriDF提出一个全面的可解释深度伪造检测基准,评估模型感知、检测和幻觉能力,揭示三者间的相互作用,为构建可信系统提供基础。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28246 2026-03-31 cs.SE 50%

Voice-Controlled Scratch for Children with (Motor) Disabilities

为有(运动)障碍儿童的语音控制Scratch

Elias Goller, Gordon Fraser, Isabella Graßl

专题命中 音频语音多模态 :multi-modal(abstract)

AI总结 本文提出MeowCrophone,通过语音控制实现Scratch编程环境的无障碍编辑,采用多模态语音界面提升残障儿童的交互体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27562 2026-03-31 cs.HC 50%

VoxAnchor: Grounding Speech Authenticity in Throat Vibration via mmWave Radar

VoxAnchor:通过毫米波雷达接地语音真实性 via 喉部振动

Mingda Han, Huanqi Yang, Chaoqun Li, Wenhao Li, Guoming Zhang, Yanni Yang, Yetong Cao, Weitao Xu, Pengfei Hu

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 本文提出VoxAnchor系统,通过毫米波雷达捕捉喉部振动,结合语音声学与雷达信号,实现细粒度语音真实性验证,有效检测编辑、拼接等伪造手段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27418 2026-03-31 cs.HC 50%

Buzz Buzz: Haptic Cuing of Road Conditions in Autonomous Cars for Drivers Engaged in Secondary Tasks

Buzz Buzz:自动驾驶车辆中通过触觉提示维持驾驶员情境意识的辅助驾驶功能

Shivam Pandey

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 研究通过触觉提示在自动驾驶中维持驾驶员情境意识,发现触觉信息能提升正确回答率并减少看屏幕次数,且不影响次要任务表现。

Comments Ph.D. dissertation at Rice University. April 2021. Main text and appendices are 75 pages, 35 figures combined

详情

展开后加载摘要…

URL PDF HTML 收藏