arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-14 至 2026-05-14 共收录 2 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 2 篇

2605.11572 2026-05-14 cs.CV 83%

TB-AVA: Text as a Semantic Bridge for Audio-Visual Parameter Efficient Finetuning

TB-AVA:文本作为语义桥梁用于音频-视觉参数高效微调

Seongah Kim, Dinh Phu Tran, Hyeontaek Hwang, Saad Wazir, Duc Do Minh, Daeyoung Kim

机构 * AI2 Lab, KAIST(AI2实验室,韩国科学技术院)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出利用文本作为语义桥梁,通过冻结音频和视觉编码器构建参数高效微调框架,实现音频与视觉流的文本介导交互,实验表明其在多个基准上取得最佳性能。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15280 2026-05-14 cs.HC cs.AI 79%

LLM-based Multimodal Feedback Produces Equivalent Learning and Better Student Perceptions than Educator Feedback

基于大语言模型的多模态反馈在学习效果和学生感知上与教师反馈相当且更优

Chloe Qianhui Zhao, Jie Cao, Jionghao Lin, Kenneth R. Koedinger

机构 * Carnegie Mellon University(卡内基梅隆大学) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) The University of Hong Kong(香港大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种实时AI辅助的多模态反馈系统,通过整合结构化文本解释与动态多媒体资源,实现学习效果与学生感知的提升,证明AI反馈在清晰度、具体性等方面优于传统教师反馈。

Comments 11 pages, to be published at the 16th International Learning Analytics & Knowledge Conference (LAK '26)

详情

展开后加载摘要…

URL PDF HTML 收藏