arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-05 至 2026-05-05 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 7 篇

2605.01219 2026-05-05 cs.MM cs.CV cs.SD eess.IV 90%

Multimodal Confidence Modeling in Audio-Visual Quality Assessment

音频视频质量评估中的多模态置信度建模

Mayesha Maliha R. Mithila, Mylene C. Q. Farias

机构 * Texas State University Department of Computer Science(德克萨斯州立大学计算机科学系)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出MCM-AVQA框架,通过多模态置信度感知方法提升音频视频质量评估的准确性与可解释性,特别在处理不对称退化时表现更优。

Comments Accepted at ICIP 2026, 6 pages, 4 figures, no supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01278 2026-05-05 cs.AI 84%

Valley3: Scaling Omni Foundation Models for E-commerce

Valley3:面向电商的多模态大语言模型规模化

Zeyu Chen, Guanghao Zhou, Qixiang Yin, Ziwang Zhao, Huanjin Yao, Pengjiu Xia, Min Yang, Cen Chen, Minghui Qiu

机构 * Valley Team, ByteDance Group(字节跳动集团山谷团队)

专题命中 音频语音多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);cross-modal(abstract);audio-visual(abstract)

AI总结 Valley3通过四阶段预训练管道,融合多模态能力与电商知识,实现跨模态指令跟随和长链推理,构建了涵盖6个任务的电商基准测试,展现出在电商场景中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15037 2026-05-05 cs.AI cs.CL cs.SD 62%

From Reactive to Proactive: Assessing the Proactivity of Voice Agents via ProVoice-Bench

从被动到主动:通过ProVoice-Bench评估语音代理的主动性

Ke Xu, Yuhao Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ProVoice-Bench评估框架,通过四个新任务评估语音代理的主动性,揭示当前模型在过度触发和推理能力上的不足,为开发更自然的主动代理提供方向。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01197 2026-05-05 cs.SD cs.MM 57%

MG-Former: A Transformer-Based Framework for Music-Driven 3D Conducting Gesture Generation

MG-Former:一种基于Transformer的音乐驱动3D指挥动作生成框架

Ke Qiu, Yawen Qin, Tianzhi Jia, Xiaole Yang, Kaimin Wang, Kaixing Yang

机构 * Malou Tech Inc(Malou科技公司) South-Central Minzu University(西南民族大学) Beijing Jiaotong University(北京交通大学) Fudan University(复旦大学) Renmin University of China(中国人民大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.MM

AI总结 本文提出TransConductor框架,通过SMPL参数数据构建流程生成专业指挥动作,结合Transformer编码器和解码器实现音乐驱动的3D指挥动作生成,并引入检索评估模型验证音乐与动作的对应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20657 2026-05-05 cs.HC cs.AI 57%

Intelligent Agents with Emotional Intelligence: Current Trends, Challenges, and Future Prospects

具有情感智能的智能体:当前趋势、挑战与未来展望

Raziyeh Zall, Alireza Kheyrkhah, Erik Cambria, Zahra Naseri, M. Reza Kangavari

机构 * School of Computer Engineering, Iran University of Science and Technology(伊朗科学技术大学计算机工程学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文综述了情感智能智能体的核心组件,涵盖多模态数据处理的情感理解、情感认知及表达合成,分析了发展中的关键挑战与未来方向,强调生成技术对情感计算的潜力。

Comments Enhanced the quality of figures, incorporated additional and recent references, and improved the manuscript for better clarity and writing quality

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01153 2026-05-05 cs.HC 50%

Toward a Unified Framework for Collaborative Design of Human-AI Interaction

迈向人机交互协作设计的统一框架

Ankur Bhatt, Sven Mayer

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出统一框架整合多模态对齐、交互导向的可解释性及用户代理,通过协作设计与增强现实仓库机器人场景验证,提升人机交互透明度与用户控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00943 2026-05-05 cs.RO 50%

ARIS: Agentic and Relationship Intelligence System for Social Robots

ARIS:面向社交机器人的代理与关系智能系统

Stavya Datta, Fucai Ke, Leimin Tian, Hamid Rezatofighi

机构 * Monash University(墨尔本大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 ARIS通过整合多模态推理、图基社会世界模型和检索增强生成技术,提升社交机器人在多轮交互和社会关系推理中的能力,实验显示其在智能感知和用户亲和力方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏