CommentsPresented at the 3rd Visually Grounded Interaction and Language (ViGIL) Workshop, NeurIPS 2019, Vancouver, Canada. arXiv admin note: substantial text overlap with arXiv:1812.08407, arXiv:1912.10132
AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues
AV-EMO-Reasoning: 在具有视听线索的全模态大语言模型中基准测试情感推理能力
Dingkun Zhou, Krish Patel, Ajay Kankipati, Akshaj Gupta, Zeyi Austin Li, Mohul Shukla, Vibhor Narang, Sara Kofman, Zongli Ye, Grace Wang, Xiaoyu Shi, Tingle Li, Guan-Ting Lin, Kan Jen Cheng, Huang-Cheng Chou, Jiachen Lian, Gopala Anumanchipalli
机构
*
UC Berkeley(加州大学伯克利分校)
;
South China University of Technology(华南理工大学)
;
Zhejiang University(浙江大学)
;
National Taiwan University(台湾大学)
;
University of Southern California(美国南加州大学)
Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders
用于社交机器人对话轮次转换的多模态语音活动投影及与语音活动相关的预训练编码器
Antonio Cano, Guillermo Pérez, Luis Merino, Randy Gomez
机构
*
i Intelligent Insights(4i智能洞察公司)
;
Universidad de Sevilla(塞维利亚大学)
;
Universidad Pablo de Olavide(巴勃罗·德奥拉维德大学)
;
Honda Research Institute Japan(本田日本研究所)
CommentsAccepted for presentation at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026). Acceptance notification date: 30 May 2026. Final published version pending
Attention-Spectrum Regularization for Replay-Free Continual Multimodal LLMs
注意力谱正则化:无回放的连续多模态大语言模型
Chuangxin Zhao, Canran Xiao, Siyuan Ma, Mengyao Lyu, Yanbiao Ma, Jun Xia, Guiguang Ding, Yang Liu
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Sun Yat-sen University(中山大学)
;
Nanyang Technological University(南洋理工大学)
;
Renmin University of China(中国人民大学)
;
Tsinghua University(清华大学)