arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-15 至 2026-07-15 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 5 篇

2607.12820 2026-07-15 cs.CV 新提交 90%

AVSCap: Orchestrating Audio-Visual Synergy for Omni-modal Video Captioning

AVSCap:为全模态视频字幕编排视听协同

Yanghai Wang, Jiahao Wang, Jiafu Tang, Yuanxing Zhang, Zhe Cao, Hanyan Bian, Zijie Zhang, Weiliang Luo, Zhiyu Pan, Zixuan Dong, Jiaheng Liu, Zhaoxiang Zhang

机构 * Nanjing University(南京大学) Kuaishou Technology(快手科技) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 音频语音多模态 :audio-visual(title,abstract);omni-modal(title,abstract);multimodal(abstract);cross-modal(abstract)

AI总结 研究全模态视频字幕编排视听协同问题,提出AVSCap框架,构建训练语料库,采用两阶段策略训练字幕生成器,引入新基准,实验表明该模型在非语音音频覆盖率和跨模态绑定方面表现出色,提升了整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27706 2026-07-15 cs.MM 版本更新 83%

MAR3: Multi-Agent Recognition, Reasoning, and Reflection for Reference Audio-Visual Segmentation

MAR3:多智能体识别、推理与反思用于参考音频视觉分割

Yuan Zhao, Zhenqi Jia, Yongqiang Zhang

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.MM

AI总结 本文提出MAR3框架,通过多智能体机制解决参考音频视觉分割中的表达难度识别、模态主导性分析及反思学习问题,提升分割精度。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12958 2026-07-15 cs.HC 新提交 78%

CD-MED: Cross-Domain Multimodal Emotion Descriptor for Visual Comparison of Digital Objects

CD-MED:用于数字对象视觉比较的跨域多模态情感描述符

Elnara Kadyrgali, Muragul Muratbekova, Pakizar Shamoi

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 研究针对数字对象跨模态情感比较难题,提出CD-MED方法,通过各模态情感识别模型输出转化为共享描述符,在共同情感空间表示对象,实现跨域情感比较、检索、推荐及可视化。

Comments Submitted to 2026 Joint 14th International Conference on Soft Computing and Intelligent Systems and 27th International Symposium on Advanced Intelligent Systems (SCIS&ISIS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12176 2026-07-15 cs.CV 新提交 74%

A Calibrated Multimodal Ensemble for Ambivalence/Hesitancy Recognition: System Description and Private-Test Submission Strategy

用于矛盾/犹豫识别的校准多模态集成:系统描述与私密测试提交策略

Josep Cabacas-Maso, Ismael Benito-Altamirano, Carles Ventura

机构 * eHealth Center, Faculty of Computer Science, Multimedia and Telecommunicactions, Universitat Oberta de Catalunya(加泰罗尼亚开放大学计算机科学、多媒体与电信学院电子健康中心) MIND/IN2UB, Department of Electronic and Biomedical Engineeering, Universitat de Barcelona(巴塞罗那大学电子与生物医学工程系MIND/IN2UB) Institute of Semiconductor Technology (IHT) & Laboratory for Emerging Nanometrology (LENA), Technische Universität Braunschweig(布伦瑞克工业大学半导体技术研究所(IHT)和新兴纳米计量实验室(LENA))

专题命中 音频语音多模态 :multimodal(title);分类 cs.CV

AI总结 该研究针对BAH数据集上的ABAW A/H挑战,提出校准多模态集成系统,由三个融合模型组成。在公共测试集上宏F1达0.7358,介绍五次私密测试提交的配置等,首次提交在私密测试中宏F1为0.7361,验证系统能推广到未见参与者。

Comments 8 pages, 1 figure, ECCV workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12290 2026-07-15 eess.AS cs.AI cs.CL cs.LG cs.SD 新提交 67%

The Sound of Absence: Audio-Language Embedding Models Struggle with Negation

缺失之音:音频-语言嵌入模型在处理否定时存在困难

Chun-Yi Kuan, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taiwan(国家台湾大学通讯工程研究所) Artificial Intelligence Center of Research Excellence (AI-CoRE), National Taiwan University, Taiwan(国家台湾大学人工智能卓越研究中心)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 研究音频-语言嵌入模型在处理否定时的问题,引入NegEval-Audio框架将数据集转换为否定感知任务,发现模型在否定情况下性能大幅下降,肯定偏差是缺陷,需明确否定感知训练目标。

Comments Manuscript in progress

详情

展开后加载摘要…

URL PDF HTML 收藏