arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-16 至 2026-04-16 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 8 篇

2604.13593 2026-04-16 cs.MM 89%

AVID: A Benchmark for Omni-Modal Audio-Visual Inconsistency Understanding via Agent-Driven Construction

AVID:一种通过代理驱动构建的多模态音频视觉不一致理解基准

Zixuan Chen, Depeng Wang, Hao Lin, Li Luo, Ke Xu, Ya Guo, Huijia Zhu, Tanfeng Sun, Xinghao Jiang

专题命中 音频语音多模态 :audio-visual(title,abstract);omni-modal(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 AVID是首个大规模多模态音频视觉不一致理解视频基准,通过可扩展的构建流程和8种细粒度不一致类别,评估检测、时间定位、分类和推理能力,验证了其在可信多模态AI系统中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14129 2026-04-16 cs.CV 85%

Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models

别让视频说话:面向音频-视觉语言模型的音频对比偏好优化

Ami Baid, Zihui Xue, Kristen Grauman

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出ACPO方法,通过引入输出对比和输入对比目标,解决音频-视觉语言模型中视频驱动的音频幻觉问题,提升音频真实性和多模态能力。

Comments Project page: https://vision.cs.utexas.edu/projects/acpo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13380 2026-04-16 cs.HC 78%

Does the TalkMoves Codebook Generalize to One-on-One Tutoring and Multimodal Interaction?

对话移动代码本是否能推广到一对一辅导和多模态交互?

Corina Luca Focsan, Marie Cynthia Abijuru Kamikazi, Tamisha Thompson, Jennifer St. John, Kirk Vanacore, Danielle R. Thomas, Kenneth R. Koedinger, René F. Kizilcec

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 研究探讨TalkMoves代码本在一对一辅导中的一致性、实用性及可解释性,对比AI-人类混合代码本,发现前者在可靠性上更优,但后者在多模态覆盖和可用性上更胜一筹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10522 2026-04-16 cs.MM cs.CV cs.LG cs.SD eess.AS 75%

AudioX: A Unified Framework for Anything-to-Audio Generation

AudioX:一种用于任意到音频生成的统一框架

Zeyue Tian, Zhaoyang Liu, Yizhu Jin, Ruibin Yuan, Liumeng Xue, Xu Tan, Qifeng Chen, Wei Xue, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Independent Researcher(独立研究者)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS

AI总结 本文提出AudioX框架,整合多种模态条件,通过多模态自适应融合模块提升生成质量,并构建大规模高质量数据集IF-caps,验证了其在文本到音频和文本到音乐生成中的优越性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10101 2026-04-16 cs.SD cs.AI cs.GR cs.MM eess.AS 75%

LAV: Audio-Driven Dynamic Visual Generation with Neural Compression and StyleGAN2

LAV:基于神经压缩和StyleGAN2的音频驱动动态视觉生成

Jongmin Jung, Dasaem Jeong

机构 * Dept. of Artificial Intelligence(人工智能系) Dept. of Art & Technology(艺术与技术系)

专题命中 音频语音多模态 :audio-visual(abstract,abstract_cn);分类 cs.AI、cs.MM、eess.AS

AI总结 LAV结合EnCodec神经音频压缩与StyleGAN2生成能力,通过随机初始化线性映射将音频嵌入转换为StyleGAN2的风格潜在空间,实现语义丰富的音频-视觉转换。

Comments Paper accepted at ISEA 2025, The 30th International Symposium on Electronic/Emerging Art, Seoul, Republic of Korea, 23 - 29 May 2025

Journal ref Proceedings of the International Symposium on Electronic/Emerging Art: 2025, Seoul, Republic of Korea / no., 2025, pp.1129-1132

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21760 2026-04-16 cs.CL cs.AI 73%

fMRI-LM: Towards a Universal Foundation Model for Language-Aligned fMRI Understanding

fMRI-LM:迈向语言对齐的fMRI理解的通用基础模型

Yuxiang Wei, Yanteng Zhang, Xi Xiao, Chengxuan Qian, Tianyang Wang, Vince D. Calhoun

机构 * TReNDS Center (Georgia Institute of Technology, Georgia State University, Emory)(TReNDS中心(佐治亚理工学院、佐治亚州立大学、埃默里大学)) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Jiangsu University(江苏大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出fMRI-LM,通过三阶段框架将fMRI与语言结合,实现跨模态脑表示,通过神经分词、预训练LLM适应及多任务微调,提升fMRI的语义理解能力。

Comments Code are available: https://github.com/yuxiangwei0808/fMRI-LM

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20981 2026-04-16 cs.CV cs.AI 62%

Echoes Over Time: Unlocking Length Generalization in Video-to-Audio Generation Models

时间回声:解锁视频到音频生成模型中的长度泛化

Christian Simon, Masato Ishii, Wei-Yao Wang, Koichi Saito, Akio Hayakawa, Dongseok Shim, Zhi Zhong, Shuyang Cui, Shusuke Takahashi, Takashi Shibuya, Yuki Mitsufuji

机构 * Sony Group Corporation(索尼集团公司) Sony AI(索尼人工智能)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MMHNet模型,通过层级结构和非因果Mamba实现长音频生成,提升生成长度至5分钟以上,证明短训练长测试的可行性,优于现有视频到音频生成方法。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13804 2026-04-16 cs.LG 50%

Character Beyond Speech: Leveraging Role-Playing Evaluation in Audio Large Language Models via Reinforcement Learning

角色超越言语:通过强化学习利用角色扮演评估音频大语言模型

Dongjie Fu, Fangming Feng, Xize Cheng, Linjun Li, Zhou Zhao, Tao Jin

机构 * Zhejiang University(浙江大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出RoleJudge框架,通过多模态评估系统评估语音与角色的一致性,引入RoleChat数据集并采用多阶段训练和标准对齐强化学习,验证了多维评估框架的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏