arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-25 至 2026-02-25 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4 篇

2510.24332 2026-02-25 cs.SD cs.CV eess.AS eess.IV 73%

Sound Source Localization for Spatial Mapping of Surgical Actions in Dynamic Scenes

动态场景中手术动作空间映射的声源定位

Jonas Hein, Lazaros Vlachopoulos, Maurits Geert Laurent Olthof, Bastian Sigrist, Philipp Fürnstahl, Matthias Seibold

机构 * ROCS(罗克辛研究所) Balgrist University Hospital(巴尔格里斯大学医院) University of Zurich(苏黎世大学) Dept. of Orthopedics(骨科部门) Computer Vision and Geometry Group(计算机视觉与几何组) ETH Zurich(苏黎世联邦理工学院)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS

AI总结 本文提出一种动态手术场景中声源定位的方法,通过整合3D音频与视觉数据,提升手术场景的多模态理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20163 2026-02-25 cs.SD cs.CL eess.AS 62%

Graph Modelling Analysis of Speech-Gesture Interaction for Aphasia Severity Estimation

语音-手势交互的图模型分析用于失语症严重程度估计

Navya Martin Kollapally, Christa Akers, Renjith Nelson Joseph

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、eess.AS

AI总结 本文提出基于图神经网络的框架,通过分析语音和手势的交互来自动估计失语症严重程度。

Comments IJCAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20708 2026-02-25 cs.AI cs.CR 57%

ICON: Indirect Prompt Injection Defense for Agents based on Inference-Time Correction

ICON:基于推理时校正的代理间接提示注入防御

Che Wang, Fuyao Zhang, Jiaming Zhang, Ziqi Zhang, Yinghui Wang, Longtao Huang, Jianbo Gao, Zhong Chen, Wei Yang Bryan Lim

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡) Alibaba(阿里巴巴) School of Computer Science, Peking University, China(计算机科学学院,北京大学,中国)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

AI总结 ICON通过潜在空间轨迹探测和修正器实现对代理间接提示注入攻击的防御,有效提升任务连续性和安全性,同时保持高检测率和任务效用。

Comments 11 pages,

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20219 2026-02-25 cs.RO cs.AI 57%

An Approach to Combining Video and Speech with Large Language Models in Human-Robot Interaction

一种结合视频和语音的大型语言模型在人机交互中的应用方法

Guanting Shen, Zi Tian

机构 * Dalian University of Technology(大连理工大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出结合视觉-语言模型、语音处理和模糊逻辑的多模态人机交互框架,通过语音指令实现机械臂的精准操控,实验显示命令执行准确率达75%,为未来人机协作提供灵活的基础。

Comments Preprint currently under revision

详情

展开后加载摘要…

URL PDF HTML 收藏