arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-08 至 2026-04-08 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4 篇

2602.07064 2026-04-08 cs.CV 87%

OmniFysics: Towards Physical Intelligence Evolution via Omni-Modal Signal Processing and Network Optimization

OmniFysics:通过多模态信号处理和网络优化实现物理智能进化

Minghao Han, Dingkang Yang, Yue Jiang, Yizhou Liu, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Fysics AI

专题命中 音频语音多模态 :omni-modal(title,abstract);multimodal(abstract);cross-modal(abstract);audio-visual(abstract)

AI总结 OmniFysics通过统一图像、音频、视频和文本的多模态信号处理,结合动态物理数据引擎和物理知识注入,实现网络化AI系统的自主优化,提升物理理解能力。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12863 2026-04-08 cs.SD cs.AI cs.CV eess.AS 85%

Unified Cross-modal Translation of Score Images, Symbolic Music, and Performance Audio

统一的跨模态评分图像、符号音乐和表演音频翻译

Jongmin Jung, Dongmin Kim, Sihun Lee, Seola Cho, Hyungjoon Soh, Irmak Bukey, Chris Donahue, Dasaem Jeong

机构 * Department of Artificial Intelligence, Sogang University(西江大学人工智能系) Sogang Future Lab, Sogang University(西江大学未来实验室) Department of Physics Education, Seoul National University(首尔大学物理教育系) Computer Science Department, Carnegie Mellon University(卡内基梅隆大学计算机科学系) Department of Art & Technology, Sogang University(西江大学艺术与技术系)

专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI、eess.AS

AI总结 本文提出统一模型,通过大规模数据集和模态分词实现多模态翻译,提升光学音乐识别的符号错误率至13.67%并实现评分图像条件音频生成。

Comments Submitted to IEEE Transactions on Audio, Speech and Language Processing (TASLPRO)

Journal ref IEEE Transactions on Audio, Speech and Language Processing, vol. 34, pp. 1876-1891, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05007 2026-04-08 cs.SD cs.AI eess.AS 81%

Generalizable Audio-Visual Navigation via Binaural Difference Attention and Action Transition Prediction

通过双耳差异注意力和动作转移预测实现可泛化的音频视觉导航

Jia Li, Yinfeng Yu

机构 * Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学联合具身智能研究实验室) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语言认知计算联合国际研究实验室) School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI、eess.AS

AI总结 本文提出BDATP框架,通过双耳差异注意力增强空间定位并减少对语义类别的依赖,同时引入动作转移预测任务作为正则化项,提升模型在未见环境中的泛化能力,实验表明在Replica和Matterport3D数据集上取得显著性能提升。

Comments Main paper (6 pages). Accepted for publication by the International Joint Conference on Neural Networks (IJCNN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05683 2026-04-08 cs.SD 50%

Time-Domain Voice Identity Morphing (TD-VIM): A Signal-Level Approach to Morphing Attacks on Speaker Verification Systems

时域语音身份融合(TD-VIM):一种信号层面的语音验证系统攻击方法

Aravinda Reddy PN, Raghavendra Ramachandra, K. Sreenivasa Rao, Pabitra Mitra, Kunal Singh

机构 * Indian Institute of Technology Kharagpur(印度理工学院卡哈拉格普尔分校) Norwegian University of Science and Technology (NTNU)(挪威科技大学)

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 本文提出TD-VIM,一种在信号层面融合不同身份语音特征的方法,通过多语言音频-视觉智能手机数据库生成四个融合信号,并评估其在语音验证系统中的高攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏