arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4549 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 4549 篇

2307.14491 2024-10-28 cs.MM cs.SD eess.AS 82%

A Unified Framework for Modality-Agnostic Deepfakes Detection

Cai Yu, Peng Chen, Jiahe Tian, Jin Liu, Jiao Dai, Xi Wang, Yesheng Chai, Shan Jia, Siwei Lyu, Jizhong Han

专题命中 音频语音多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);audio-visual(abstract)

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15124 2026-08-13 cs.SD 版本更新 82%

Synaspot: A Lightweight, Streaming Multi-modal Framework for Keyword Spotting with Audio-Text Synergy

Synaspot:一种轻量级、流式多模态框架,用于音频-文本协同的关键字检测

Kewei Li, Yinan Zhong, Xiaotao Liang, Tianchi Dai, Shaofei Xue

专题命中 音频语音多模态 :multi-modal(title,abstract);multimodal(abstract)

AI总结 Synaspot提出了一种轻量级流式多模态框架,通过减少说话人特定信息和有效融合语音文本特征,实现更高效的关键字检测。

Comments Accepted by IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19037 2026-08-10 cs.SD cs.CL cs.MM eess.AS 82%

MLLM-based Speech Recognition: When and How is Multimodality Beneficial?

Yiwen Guan, Viet Anh Trinh, Vivek Voleti, Jacob Whitehill

机构 * Worcester Polytechnic Institute(沃斯特理工学院)

专题命中 音频语音多模态 :MLLM(title);multi-modal(abstract);分类 cs.CL、cs.MM、eess.AS

Journal ref IEEE Transactions on Multimedia, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03050 2026-08-05 cs.SD cs.AI cs.MM eess.AS 新提交 82%

Learning Music Style for Piano Arrangement Through Cross-Modal Bootstrapping

通过跨模态自举学习音乐风格以实现钢琴编曲

Jingwei Zhao, Gus Xia, Ziyu Wang, Ye Wang

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 本文提出跨模态框架,受BLIP-2启发用Q-Former从预训练音频LM提取风格表示,经两阶段训练实现可控风格钢琴编曲,在多项任务中提升了风格对齐与音乐质量。

Comments Accepted by ISMIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16980 2026-07-21 eess.SP cs.SD 新提交 82%

Efficient Audio-Visual Event Recognition via Knowledge Distillation and Dynamic INT8 Quantization of a Hybrid Cross-Attention Network

通过混合交叉注意力网络的知识蒸馏和动态 INT8 量化实现高效视听事件识别

Parinaz Binandeh Dehaghani, Danilo Pena, A. Pedro Aguiar

机构 * University of Porto, Porto, Portugal(葡萄牙波尔图大学) ResoSight, Montreal, Canada(ResoSight公司)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract)

AI总结 研究针对视听事件识别模型在边缘设备部署的难题,提出结合架构压缩、知识蒸馏和动态 INT8 量化的框架。构建教师与学生模型,经知识蒸馏训练学生模型,再用动态量化减小模型大小。实验表明该框架有效平衡准确率与效率,利于在资源受限平台部署。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18528 2026-07-21 cs.LG cs.SD 版本更新 82%

Audio-Visual Continual Test-Time Adaptation without Forgetting

音频视觉持续测试时间适应无需遗忘

Sarthak Kumar Maharana, Akshay Mehra, Bhavya Ramakrishna, Yunhui Guo, Guan-Ming Su

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract)

AI总结 本文提出AVReCAP方法,在测试时无需源数据即可提升模型性能,通过动态检索最佳融合层参数减少灾难性遗忘。

Comments ECCV 2026 & ICML 2026 Workshop Continual Adaptation at Scale: Towards Sustainable AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06015 2026-07-08 cs.SD 新提交 82%

Music I Care About: Automated Multimodal Benchmarking of LLM Music Perception Skills on (Almost) Any Music

我关心的音乐:对(几乎)任何音乐的大语言模型音乐感知技能进行自动化多模态基准测试

Tomáš Sourada, Katia Vendrame, Jan Hajič

机构 * Charles University(查尔斯大学) Brno University of Technology(布拉格技术大学)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract)

AI总结 针对当前音乐基准测试的局限,引入MusICA-MetaBench框架,利用结构化符号表示和预定义模板生成按需基准测试,通过ChoraleBricks数据集展示并确定规模,经与基线比较证明能测音乐感知,推动了大语言模型音乐感知跨模态评估。

Comments 9 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30646 2026-07-01 cs.SD cs.AI cs.CL eess.AS 新提交 82%

ASR-Agnostic Multimodal Spectrotemporal Modeling for Early Dementia Detection

ASR无关的多模态谱时建模用于早期痴呆检测

Chukwuemeka Ugwu, Oluwafemi Richard Oyeleke

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 提出一种不依赖语音识别的框架,直接从梅尔频谱图中提取谱时位移场作为数字生物标志物,结合CNN-ConvGRU声学嵌入和交叉注意力融合,在三种语言语料库上验证了多模态融合的语料依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28002 2026-06-29 cs.CL cs.AI eess.AS 新提交 82%

Dialogue to Detection: A Multimodal Hybrid NLP Pipeline for Insurance Fraud Detection

对话到检测:用于保险欺诈检测的多模态混合 NLP 流水线

Muhammad Shakeel Akram, Amal Htait, Abdul Hamid Sadka, Emma Meisingseth, Karishma Jaitly

机构 * Aston University(阿斯顿大学) Domestic & General

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 提出一种合成多模态框架,结合ASR、NER、LLM-RAG和说话人嵌入,通过规则风险评分检测保险欺诈中的叙述复用、结构不一致和跨案件语音重复。

Comments 10 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15117 2026-06-16 cs.MM cs.AI cs.CV cs.LG cs.SD 新提交 82%

Teacher-Student Structure for Domain Adaptation in Ensemble Audio-Visual Video Deepfake Detection

用于集成视听视频深度伪造检测中领域适应的师生结构

Elham Abolhasani, Maryam Ramezani, Hamid R. Rabiee

机构 * Department of Computer Engineering, Sharif University of Technology(谢里夫理工学院计算机工程系)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 提出EAV-DFD方法,结合师生框架的领域适应机制,提升模型在未见领域上的泛化能力,在三个数据集上AUC分别提升4.09%、17.94%和0.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00610 2026-06-12 cs.SD cs.AI cs.LG cs.MM eess.AS 版本更新 82%

CMI-RewardBench: Evaluating Music Reward Models with Compositional Multimodal Instruction

CMI-RewardBench: 基于组合多模态指令评估音乐奖励模型

Yinghao Ma, Haiwen Xia, Hewei Gao, Weixiong Chen, Yuxin Ye, Yuchen Yang, Sungkyun Chang, Mingshuo Ding, Yizhi Li, Ruibin Yuan, Simon Dixon, Emmanouil Benetos

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) University of Cambridge(剑桥大学) University of Toronto(多伦多大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 针对音乐生成模型缺乏有效评估机制的问题,提出CMI-RewardBench基准,包含大规模偏好数据集和参数高效奖励模型,实现多模态指令下的音乐质量评估。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07577 2026-06-09 cs.AI cs.CV cs.SD eess.AS 新提交 82%

OmniMem: Perturbation-aware Memory Compression for Streaming Audio-Visual LLMs

OmniMem: 面向流式音视频大语言模型的扰动感知记忆压缩

Guangzhi Sun, Yixuan Li, Yudong Yang, Chao Zhang

机构 * Tsinghua University(清华大学) ByteDance(字节跳动) Department of Engineering, University of Cambridge(剑桥大学工程系)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI、eess.AS

AI总结 提出OmniMem,一种针对音视频LLM的流式记忆压缩框架,通过模态感知分配和扰动感知选择压缩KV缓存,在保持长视频理解的同时减少内存,在多个基准上提升2-4%准确率。

Comments Code: https://github.com/bytedance/SALMONN/tree/omni_mem

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09685 2026-06-03 cs.IR cs.AI cs.MM cs.SD eess.AS 82%

TalkPlayData 2: An Agentic Synthetic Data Pipeline for Multimodal Conversational Music Recommendation

TalkPlayData 2:用于多模态对话式音乐推荐的智能体合成数据流水线

Keunwoo Choi, Seungheon Doh, Juhan Nam

机构 * KAIST(韩国科学技术院)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 提出TalkPlayData 2,一个由智能体数据流水线生成的多模态对话式音乐推荐合成数据集,通过多角色大语言模型模拟对话并覆盖多种场景,以支持生成式推荐模型训练。

Comments 2025-10-08: updating the stat table with the latest numbers. updated the abstract per the latest license terms

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28805 2026-05-28 cs.CL cs.AI cs.CV cs.LG 82%

OmniVerifier-M1: Multimodal Meta-Verifier with Explicit Structured Recalibration

OmniVerifier-M1: 具有显式结构化重校准的多模态元验证器

Xinchen Zhang, Bowei Liu, Jiale Liu, Chufan Shi, Yizhen Zhang, Junhong Liu, Youliang Zhang, Zhiheng Li, Yujiu Yang, Ling Yang

机构 * Tsinghua University(清华大学) Pennsylvania State University(宾夕法尼亚州立大学) University of Southern California(南加州大学) Microcyto Princeton University(普林斯顿大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出OmniVerifier-M1,通过符号化元验证(如边界框)和解耦强化学习,实现多模态大模型的可靠细粒度验证与动态区域级自校正。

Comments ICML 2026. Project: https://github.com/Cominclip/OmniVerifier

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22732 2026-05-22 cs.AI cs.CL cs.HC cs.SD eess.AS 82%

Beyond Acoustic Emotion Recognition: Multimodal Pathos Analysis in Political Speech Using LLM-Based and Acoustic Emotion Models

超越语音情感识别:利用基于LLM和语音情感模型的政治演讲多模态Pathos分析

Juergen Dietrich

机构 * Democracy Intelligence gGmbH(民主智能有限责任公司)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文研究了语音情感识别模型是否能作为政治演讲分析中Pathos维度的代理,通过TRUST多智能体大语言模型(LLM)管道进行操作。使用德国议会全体会议中Felix Banaszak的演讲作为案例研究,比较了三种分析模式:(1) emotion2vec_plus_large,一个通过后验Russell Circumplex投影得到连续唤醒度和估值的语音情感识别(SER)模型;(2) Gemini 2.5 Flash,一个分析完整演讲音频及其转录文本的LLM,以开放和上下文感知的方式进行;(3) TRUST-Pathos分数,来自三个倡导者LLM监督集合。斯皮尔曼等级相关性显示,Gemini估值与TRUST-Pathos高度相关(rho = +0.664,p < 0.001),而emotion2vec估值不相关(rho = +0.097,p = 0.499)。我们进一步通过系统评估柏林情感语音数据库(EMO-DB)使用Gemini在开放注释范式下,证明标准SER基准语料库存在表演性演讲、文化偏见和类别不兼容性。我们的结果表明,基于LLM的多模态分析在捕捉语义定义的政治情感方面比单独的语音模型更有效,而语音特征仍对低层次唤醒度估计有帮助。未来的工作将扩展这种方法到视频分析中,结合面部表情和眼神。

Comments 13 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14654 2026-05-21 cs.CV cs.AI cs.CL 82%

Beyond Words: Multimodal LLM Knows When to Speak

超越词语:多模态大语言模型何时说话

Zikai Liao, Yi Ouyang, Yi-Lun Lee, Chen-Ping Yu, Yi-Hsuan Tsai, Zhaozheng Yin

机构 * Department of Computer Science, Stony Brook University(石溪大学计算机科学系) Atmee AI

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出了一种多模态策略,通过同步视频、音频和文本线索提高对话中的响应时机意识,从而提升大语言模型在对话中的响应准确性。

Comments Project page: https://github.com/lzk901372/MM-When2Speak

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14736 2026-05-18 cs.SD cs.LG 82%

IsoNet: Spatially-aware audio-visual target speech extraction in complex acoustic environments

IsoNet:在复杂声学环境中具有空间意识的音频视觉目标语音提取

Dinanath Padhya, Sajen Maharjan, Binita Adhikari, Ishwor Raj Pokharel

机构 * Department of Electronics and Computer Engineering, Thapathali Campus, Institute of Engineering, Tribhuvan University(电子与计算机工程系,Thapathali校区,工程学院,塔波胡万大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract)

AI总结 IsoNet通过结合多通道STFT特征、GCC-PHAT空间线索和面部条件视觉嵌入,实现了在紧凑麦克风阵列上的目标语音提取,其在复杂声学环境中的性能优于传统方法。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10747 2026-04-21 cs.SD cs.AI cs.CL cs.LG eess.AS 82%

Multimodal Sentiment Analysis with Missing Modality: A Knowledge-Transfer Approach

多模态情感分析中的缺失模态:一种知识迁移方法

Weide Liu, Huijing Zhan

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院) Singapore University of Social Sciences, Singapore(新加坡社会科学研究大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文提出知识迁移网络以重建缺失音频特征,并开发跨模态注意力机制以提升情感预测,实验表明在三个公开数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07859 2026-04-10 eess.SP 82%

Object-Attribute-Relation Model Driven Adaptive Hierarchical Transmission for Multimodal Semantic Communication

基于对象-属性-关系模型的自适应分层传输机制用于多模态语义通信

Chenxing Li, Yiping Duan, Han Jiao, Xiaoming Tao, Weiyao Lin, Mingquan Lu

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出基于自适应对象-属性-关系层次的多模态语义通信框架,通过融合视觉、文本和音频流构建决策导向拓扑图,在低带宽下实现90%的带宽节省和10倍的带宽减少,同时消除深度衰减信道中的悬崖效应。

Comments 13 pages,7 figures, 6 tables,56 reference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08126 2026-03-10 cs.CV cs.AI cs.LG cs.SD eess.AS 82%

Foley-Flow: Coordinated Video-to-Audio Generation with Masked Audio-Visual Alignment and Dynamic Conditional Flows

Foley-Flow:基于掩码音频-视觉对齐和动态条件流的协调视频到音频生成

Shentong Mo, Yibing Song

机构 * CMU / MBZUAI DAMO Academy, Alibaba Group(卡内基梅隆大学 / MBZUAI 大学 DAMO 院,阿里巴巴集团) DAMO Academy, Alibaba Group(DAMO 院,阿里巴巴集团) Hupan Laboratory(虎盘实验室)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.AI、eess.AS

AI总结 FoleyFlow通过掩码建模和动态条件流实现视频到音频的协调生成,提升语义与节奏一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06991 2026-03-10 cs.SD cs.LG 82%

Adaptive Discovery of Interpretable Audio Attributes with Multimodal LLMs for Low-Resource Classification

基于多模态大语言模型的低资源音频分类中可解释属性的自适应发现

Kosuke Yoshimura, Hisashi Kashima

机构 * Kyoto University(京都大学)

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract)

AI总结 本文提出利用多模态大语言模型自适应发现可解释音频属性,提升低资源音频分类的效率和准确性。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12436 2026-03-09 eess.AS cs.AI cs.LG cs.MM cs.SD 82%

Purification Before Fusion: Toward Mask-Free Speech Enhancement for Robust Audio-Visual Speech Recognition

在融合前净化:迈向无掩码的语音增强以实现鲁棒的音频-视觉语音识别

Linzhi Wu, Xingyu Zhang, Hao Yuan, Yakun Zhang, Changyan Zheng, Liang Xie, Tiejun Liu, Erwei Yin

机构 * University of Electronic Science and Technology of China(电子科技大学) Defense Innovation Institute, Academy of Military Sciences(国防科技创新研究院) Peking University(北京大学) High-tech Institute(高新技术研究所)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 本文提出了一种端到端的噪声鲁棒音频-视觉语音识别框架,结合语音增强技术,在无需显式生成噪声掩码的情况下提升鲁棒性。

Comments Accepted by ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11936 2026-02-23 cs.LG 82%

M3OOD: Automatic Selection of Multimodal OOD Detectors

M3OOD:多模态OOD检测器的自动选择

Yuehan Qin, Li Li, Defu Cao, Tiankai Yang, Jiate Li, Yue Zhao

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract)

AI总结 M3OOD通过元学习框架自动选择多模态OOD检测器,有效提升不同分布偏移下的检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04924 2026-02-06 cs.LG cs.SD 82%

Knowing When to Answer: Adaptive Confidence Refinement for Reliable Audio-Visual Question Answering

何时回答:可靠音频-视觉问答的自适应置信度细化

Dinh Phu Tran, Jihoon Jeong, Saad Wazir, Seongah Kim, Thao Do, Cem Subakan, Daeyoung Kim

机构 * School of Computing, KAIST, Republic of Korea(韩国釜山科学技术院计算机科学学院) Laval University(拉瓦尔大学) Mila-Quebec AI Institute(魁北克人工智能研究所)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract)

AI总结 本文提出自适应置信度细化方法,用于提升音频-视觉问答任务中可靠性的性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06893 2026-01-28 cs.CV cs.CL cs.MM cs.SC 82%

A New Hybrid Intelligent Approach for Multimodal Detection of Suspected Disinformation on TikTok

一种用于TikTok上疑似虚假信息多模态检测的新混合智能方法

Jared D. T. Guerrero-Sosa, Andres Montoro-Montarroso, Francisco P. Romero, Jesus Serrano-Guerrero, Jose A. Olivas

机构 * University of Castilla-La Mancha(卡斯蒂利亚-拉曼查大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 本研究提出一种结合深度学习与模糊逻辑的混合方法,用于检测TikTok视频中的疑似虚假信息,通过多模态特征分析与可解释性检测提升虚假信息识别的准确性与实用性。

Journal ref Multimedia Tools and Applications 85 (2026) 37

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21650 2026-01-21 cs.LG 82%

Physic-HM: Restoring Physical Generative Logic in Multimodal Anomaly Detection via Hierarchical Modulation

Physic-HM: 通过分层调制恢复多模态异常检测中的物理生成逻辑

Xiao Liu, Junchen Jin, Yanjie Zhao, Zhixuan Xing

机构 * Chongqing University(重庆大学)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract)

AI总结 Physic-HM通过引入物理归纳偏置,解决多模态异常检测中过程逻辑缺失的问题,实现高维与低维数据的协同建模,提升异常检测性能。

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13143 2026-01-21 cs.LG 82%

FastAV: Efficient Token Pruning for Audio-Visual Large Language Model Inference

FastAV: 面向音频视觉大语言模型推理的高效令牌修剪

Chaeyoung Jung, Youngjoon Jang, Seungwoo Lee, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract)

AI总结 FastAV通过两阶段令牌修剪策略,针对音频视觉大语言模型实现高效推理,减少FLOPs超过40%并保持性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13098 2026-01-21 cs.HC 82%

Exploring the Impacts of Background Noise on Auditory Stimuli of Audio-Visual eHMIs for Hearing, Deaf, and Hard-of-Hearing People

探索背景噪声对听觉刺激在音频视觉eHMIs中的影响:面向听障、聋人及听力障碍人群

Wenge Xu, Foroogh Hajiseyedjavadi, Debargha Dey, Tram Thi Minh Tran, Mark Colley

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract)

AI总结 研究探讨了背景噪声对聋人及听力障碍者在音频视觉eHMI中听觉刺激的影响,发现嘈杂环境会损害行人穿越体验,而增加铃声或语音提示可改善体验。

Comments This is the author's version of the paper accepted at CHI Conference on Human Factors in Computing Systems (CHI '26), April 13-17, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05879 2026-01-19 cs.HC 82%

Human-AI Alignment of Multimodal Large Language Models with Speech-Language Pathologists in Parent-Child Interactions

与语言病理学家在亲子互动中的人机对齐多模态大语言模型

Weiyan Shi, Kenny Tsu Wei Choo

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract)

AI总结 本研究通过多模态大语言模型与语言病理学家的对齐,开发了支持亲子互动分析的系统,实现了85%的感知线索提取准确率和75%的判断精确率,并提出了行为观察-判断系统的构建指南。

Comments This is an earlier version of the work released in May 2025. The version accepted at CHI 2026 is available as a separate preprint at arXiv:2511.04366

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04781 2026-01-09 cs.HC 82%

Dynamic Thermal Feedback in Highly Immersive VR Scenarios: a Multimodal Analysis of User Experience

高度沉浸式VR场景中的动态热反馈:用户体验的多模态分析

Sophie Villenave, Pierre Raimbaud, Guillaume Lavoué

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract)

AI总结 本研究通过多模态分析探讨了高度沉浸式VR场景中动态热反馈对用户体验的影响,发现热反馈可提升沉浸感,但不同质量水平对用户体验的影响因人而异。

Comments 15 pages, 9 figures. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏