Cattle-CLIP: A Multimodal Framework for Cattle Behaviour Recognition from Video
Cattle-CLIP:一种用于从视频中识别牛行为的多模态框架
Huimin Liu, Jing Gao, Daria Baran, AxelX Montout, Neill W Campbell, Andrew W Dowsey
机构
*
Bristol Veterinary School, University of Bristol(布里斯托尔大学布里斯托尔兽医学院)
;
School of Computer Science, University of Bristol(布里斯托尔大学计算机科学学院)
;
Joint Institute of Qingdao Huanghai University and WeITec, Qingdao Huanghai University(青岛黄海学院与WeITec联合学院,青岛黄海学院)
Unified Cross-modal Translation of Score Images, Symbolic Music, and Performance Audio
统一的跨模态评分图像、符号音乐和表演音频翻译
Jongmin Jung, Dongmin Kim, Sihun Lee, Seola Cho, Hyungjoon Soh, Irmak Bukey, Chris Donahue, Dasaem Jeong
机构
*
Department of Artificial Intelligence, Sogang University(西江大学人工智能系)
;
Sogang Future Lab, Sogang University(西江大学未来实验室)
;
Department of Physics Education, Seoul National University(首尔大学物理教育系)
;
Computer Science Department, Carnegie Mellon University(卡内基梅隆大学计算机科学系)
;
Department of Art & Technology, Sogang University(西江大学艺术与技术系)
Generalizable Audio-Visual Navigation via Binaural Difference Attention and Action Transition Prediction
通过双耳差异注意力和动作转移预测实现可泛化的音频视觉导航
Jia Li, Yinfeng Yu
机构
*
Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学联合具身智能研究实验室)
;
Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语言认知计算联合国际研究实验室)
;
School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)
机构
*
Nanyang Technological University(南洋理工大学)
;
Singapore University of Technology and Design(新加坡科技设计大学)
;
The Hong Kong Polytechnic University(香港理工大学)
MINED: Probing and Updating with Multimodal Time-Sensitive Knowledge for Large Multimodal Models
MINED:利用多模态时间敏感知识进行探测与更新以提升大多模态模型
Kailin Jiang, Ning Jiang, Yuntao Du, Yuchen Ren, Yuchen Li, Yifan Gao, Jinhe Bi, Yunpu Ma, Bin Li, Lei Liu, Qing Li
机构
*
University of Science and Technology of China(中国科学技术大学)
;
State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,北京通用人工智能研究院)
;
Northeast Forestry University(东北林业大学)
;
C-FAIR&school of software, Shandong University(山东大学软件学院C-FAIR)
;
State Key Lab. for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)
;
The University of Sydney(悉尼大学)
;
Anhui Polytechnic University(安徽工程大学)
;
Ludwig Maximilian University of Munich(慕尼黑大学)
Watch Before You Answer: Learning from Visually Grounded Post-Training
在回答前观看:从视觉引导的后训练中学习
Yuxuan Zhang, EunJeong Hwang, Huaisong Zhang, Penghui Du, Yiming Jia, Dongfu Jiang, Xuan He, Shenhui Zhang, Ping Nie, Peter West, Kelsey R. Allen
机构
*
University of British Columbia(不列颠哥伦比亚大学)
;
Vector Institute(向量研究所)
;
Etude AI
;
Kolors Team, Kuaishou Technology(快手科技Kolors团队)
;
University of Toronto(多伦多大学)
;
University of Waterloo(滑铁卢大学)
;
University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
HybridKV: Hybrid KV Cache Compression for Efficient Multimodal Large Language Model Inference
HybridKV: 为高效多模态大语言模型推理设计的混合KV缓存压缩
Bowen Zeng, Feiyang Ren, Jun Zhang, Xiaoling Gu, Ke Chen, Lidan Shou, Huan Li
机构
*
The State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室)
;
Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新区(滨江)区块链与数据安全研究院)
;
Hangzhou Dianzi University(杭州电子科技大学)
PDMP: Rethinking Balanced Multimodal Learning via Performance-Dominant Modality Prioritization
PDMP:通过性能主导模态优先级重思平衡多模态学习
Shicai Wei, Chunbo Luo, Qiang Zhu, Yang Luo
机构
*
Laboratory of Intelligent Collaborative Computing, University of Electronic Science and Technology of China(电子科技大学智能协同计算实验室)
;
School of Information and Communication Engineering, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院)
;
Peng Cheng Laboratory(鹏城实验室)