Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement
鲁棒的基于大语言模型的音频视觉语音识别与稀疏模态对齐和视觉单元引导的细化
Fei Su, Cancan Li, Juan Liu, Wei Ju, Hongbin Suo, Ming Li
机构
*
School of Computer Science, Wuhan University, China(武汉大学计算机学院)
;
School of Artificial Intelligence, Wuhan University, China(武汉大学人工智能学院)
;
School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)人工智能学院)
;
AI Center, OPPO, China(OPPO人工智能中心)
;
Digital Innovation Research Center, Duke Kunshan University, China(杜克大学昆山数字创新研究中心)
专题命中
其他LLM
:LLM(title,abstract);large language model(abstract);language model(abstract)
From Human-Human Collaboration to Human-Agent Collaboration: A Vision, Design Philosophy, and an Empirical Framework for Achieving Successful Partnerships Between Humans and LLM Agents
从人与人协作到人与智能体协作:一种愿景、设计哲学和实现人与LLM智能体成功合作的实证框架
Bingsheng Yao, Chaoran Chen, April Yi Wang, Sherry Tongshuang Wu, Toby Jia-jun Li, Dakuo Wang
专题命中
其他LLM
:LLM(title,abstract);large language model(abstract);language model(abstract)
A Systematic Literature Review on LLM Defenses Against Prompt Injection and Jailbreaking: Expanding NIST Taxonomy
针对提示注入和劫持攻击的LLM防御措施系统文献综述:扩展NIST分类
Pedro H. Barcha Correia, Ryan W. Achjian, Diego E. G. Caetano de Oliveira, Ygor Acacio Maria, Victor Takashi Hayashi, Marcos Lopes, Charles Christian Miers, Marcos A. Simplicio
专题命中
其他LLM
:LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG