Watch, Remember, Reason: Human-View Video Understanding with MLLMs
Watch, Remember, Reason: 基于多模态大语言模型的人类视角视频理解
Jiahao Meng, Yue Tan, Qi Xu, Kuan Gao, Weisong Liu, Yanwei Li, Jason Li, Lingdong Kong, Haochen Wang, Qianyu Zhou, Jiangning Zhang, Guangliang Cheng, Yunhai Tong, Lu Qi, Minghsuan Yang
机构
*
School of Intelligence Science and Technology, Peking University(北京理工大学智能科学与技术学院)
;
Wuhan University(武汉大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Nanyang Technological University(南洋理工大学)
;
CASIA(中国科学院自动化研究所)
;
University of Tokyo(东京大学)
;
University of Liverpool(利物浦大学)
;
Zhejiang University(浙江大学)
;
National University of Singapore(新加坡国立大学)
;
UC Merced(加州大学默塞德分校)
专题命中
效率与部署
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
Depth-adaptive Inference of Looped Language Models via Continuous Depth Batching
基于连续深度批处理的循环语言模型深度自适应推理
Kristian Schwethelm, Daniel Rueckert, Georgios Kaissis
机构
*
Technical University of Munich (TUM)(慕尼黑工业大学(TUM))
;
Imperial College London(帝国理工学院)
;
Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
;
University of Potsdam(波茨坦大学)
;
Hasso Plattner Institute for Digital Engineering(哈索·普拉特纳数字工程研究所)
When Does Small Data Work? Accuracy and Efficiency Trade-offs Between Tabular Foundation Models and Conventional Methods for Crowd-State Classification at Hajj and Umrah
小数据何时起作用?朝觐和副朝人群状态分类中表格基础模型与传统方法之间的准确性和效率权衡
AlJawharh S. AlOtaibi, Mohamed Eltahir, Jude AlSubaie