Watch, Remember, Reason: Human-View Video Understanding with MLLMs
Watch, Remember, Reason: 基于多模态大语言模型的人类视角视频理解
Jiahao Meng, Yue Tan, Qi Xu, Kuan Gao, Weisong Liu, Yanwei Li, Jason Li, Lingdong Kong, Haochen Wang, Qianyu Zhou, Jiangning Zhang, Guangliang Cheng, Yunhai Tong, Lu Qi, Minghsuan Yang
机构
*
School of Intelligence Science and Technology, Peking University(北京理工大学智能科学与技术学院)
;
Wuhan University(武汉大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Nanyang Technological University(南洋理工大学)
;
CASIA(中国科学院自动化研究所)
;
University of Tokyo(东京大学)
;
University of Liverpool(利物浦大学)
;
Zhejiang University(浙江大学)
;
National University of Singapore(新加坡国立大学)
;
UC Merced(加州大学默塞德分校)
Closed-Form Spectral Regularization for Multi-Task Model Merging
多任务模型融合的闭式谱正则化
Yongxian Wei, Runxi Cheng, Xingxuan Zhang, Li Shen, Chun Yuan, Peng Cui, Dacheng Tao
机构
*
Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
;
Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)
;
Sun Yat-sen University(中山大学)
;
Nanyang Technological University(南洋理工大学)
Task Editing for Generalizable 3D Visuomotor Policy Learning
面向可泛化3D视觉运动策略学习的任务编辑
Jian-Jian Jiang, YiHan Yang, Lan Wei, Yuming Luo, Xiao-Ming Wu, Xuhang Chen, Bin Fan, Dandan Zhang, Wei-Shi Zheng
机构
*
Sun Yat-sen University(中山大学)
;
Imperial College London(帝国理工学院)
;
Nanyang Technological University(南洋理工大学)
;
South China University of Technology(华南理工大学)
OpenHalDet: A Unified Benchmark for Hallucination Detection across Diverse Generation Scenarios
OpenHalDet:面向多种生成场景的幻觉检测统一基准
Xinyi Li, Zhen Fang, Yongxin Deng, Jinyuan Luo, Hongnan Ma, Changdae Oh, Zijing Shi, Shanshan Ye, Hanchen Wang, Shu-Lin Chen, Yadan Luo, Mengyue Yang, Sean Du, Sharon Li, Ling Chen
机构
*
University of Technology Sydney(新南威尔士大学)
;
University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
;
University of Bristol(布里斯托大学)
;
The University of Queensland(昆士兰大学)
;
Nanyang Technological University(南洋理工大学)
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
S-Lab, Nanyang Technological University(南洋理工大学S实验室)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
University of Science and Technology of China(中国科学技术大学)
;
Stanford University(斯坦福大学)
;
Shanghai Innovation Institute(上海创新研究院)
;
The Chinese University of Hong Kong(香港中文大学)
;
Fudan University(复旦大学)
;
CPII under InnoHK(InnoHK下的CPII)
;
Adobe Research(Adobe研究)
IRAF: Interference-Resilient Adaptive Fusion for Noise-Robust End-to-End Full-Duplex Spoken Dialogue Systems
IRAF:面向噪声鲁棒的端到端全双工口语对话系统的抗干扰自适应融合
Tao Zhong, Jiajun Deng, Nikita Kuzmin, Yinke Zhu, Tianxiang Cao, Tristan Tsoi, Zhili Tan, Simon Lui, Xunying Liu
机构
*
The Chinese University of Hong Kong(香港中文大学)
;
AudioLab Hong Kong, Huawei Leibniz Research Center(香港AudioLab,华为Leibniz研究中心)
;
Nanyang Technological University(南洋理工大学)
OGA-AID: Clinician-in-the-loop AI Report Drafting Assistant for Multimodal Observational Gait Analysis in Post-Stroke Rehabilitation
OGA-AID:用于中风后康复多模态观察性步态分析的临床医生在环AI报告起草助手
Khoi T. N. Nguyen, Nghia D. Nguyen, Hui Yu Koh, Patrick W. H. Kwong, Karen Sui Geok Chua, Ananda Sidarta, Baosheng Yu
机构
*
Rehabilitation Research Institute of Singapore, Nanyang Technological University, Singapore(新加坡康复研究中心,南洋理工大学,新加坡)
;
Lee Kong Chian School of Medicine, Nanyang Technological University, Singapore(李光前医学院,南洋理工大学,新加坡)
;
The Grainger College of Engineering, University of Illinois Urbana-Champaign, United States(伊利诺伊大学厄巴纳-香槟分校格雷格学院,美国)
;
Department of Rehabilitation Sciences, The Hong Kong Polytechnic University, Hong Kong(香港理工大学康复科学系,香港)
;
VinUni-Illinois Smart Health Center, VinUniversity, Vietnam(Vin大学Vin-伊利诺伊智能健康中心,越南)
;
Institute of Rehabilitation Excellence, Tan Tock Seng Hospital, NHG Health, Singapore(卓越康复研究所,坦托克桑格医院,NHG健康,新加坡)
机构
*
National University of Singapore(国立新加坡大学)
;
Fudan University(复旦大学)
;
Tsinghua University(清华大学)
;
Zhejiang University(浙江大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Renmin University of China(中国人民大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
The Hong Kong University of Science and Technology(香港科技大学)
;
DeepWisdom(深智科技)
;
Nanjing University(南京大学)
;
Shanghai Jiatong University(上海交通大学)
;
Nanyang Technological University(南洋理工大学)
;
Tencent Hunyuan(腾讯文深)
;
QuantaAlpha(量子阿尔法)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Zhejiang Lab(浙江实验室)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Sun Yat-sen University(中山大学)
Chameleon: Control-Indexed Prospective Memory for Visuomotor Manipulation
Chameleon: 用于视觉运动操控的索引控制前瞻记忆
Xinying Guo, Chenxi Jiang, Hyun Bin Kim, Yuhang Han, Ying Sun, Yang Xiao, Jianfei Yang
机构
*
MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室)
;
Institute for Infocomm Research, A*STAR, Singapore(新加坡*STAR信息与通信研究所)
;
National University of Singapore(新加坡国立大学)
Robust Driving Control for Autonomous Vehicles: An Intelligent General-sum Constrained Adversarial Reinforcement Learning Approach
自动驾驶鲁棒控制:一种智能一般和约束对抗强化学习方法
Junchao Fan, Qi Wei, Ruichen Zhang, Yang Lu, Jianhua Wang, Xiaolin Chang, Bo Ai
机构
*
Beijing Key Laboratory of Security and Privacy in Intelligent Transportation(北京智能交通安全与隐私重点实验室)
;
Beijing Jiaotong University(北京交通大学)
;
College of Computing and Data Science(计算与数据科学学院)
;
Nanyang Technological University(南洋理工大学)
;
School of Computer Science and Technology(计算机科学与技术学院)
;
Taiyuan University of Technology(太原科技大学)
;
School of Electronics and Information Engineering(电子与信息工程学院)