Watch, Remember, Reason: Human-View Video Understanding with MLLMs
Watch, Remember, Reason: 基于多模态大语言模型的人类视角视频理解
Jiahao Meng, Yue Tan, Qi Xu, Kuan Gao, Weisong Liu, Yanwei Li, Jason Li, Lingdong Kong, Haochen Wang, Qianyu Zhou, Jiangning Zhang, Guangliang Cheng, Yunhai Tong, Lu Qi, Minghsuan Yang
机构
*
School of Intelligence Science and Technology, Peking University(北京理工大学智能科学与技术学院)
;
Wuhan University(武汉大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Nanyang Technological University(南洋理工大学)
;
CASIA(中国科学院自动化研究所)
;
University of Tokyo(东京大学)
;
University of Liverpool(利物浦大学)
;
Zhejiang University(浙江大学)
;
National University of Singapore(新加坡国立大学)
;
UC Merced(加州大学默塞德分校)
专题命中
视觉推理
:MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
NoisyGRPO: Incentivizing Multimodal CoT Reasoning via Noise Injection and Bayesian Estimation
NoisyGRPO:通过噪声注入和贝叶斯估计激励多模态Co T推理
Longtian Qiu, Shan Ning, Jiaxuan Sun, Xuming He
机构
*
ShanghaiTech University(上海科技大学)
;
Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程研究中心)
;
Lingang Laboratory(临港实验室)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV
Towards On-Policy Data Evolution for Visual-Native Multimodal Deep Search Agents
面向视觉原生多模态深度搜索智能体的在策略数据演化
Shijue Huang, Hangyu Guo, Guanting Dong, Chenxin Li, Junting Lu, Xinyu Geng, Zhaochen Su, Zhenyu Li, Shuang Chen, Hongru Wang, Yi R. Fung
机构
*
Hong Kong University of Science and Technology(香港理工大学)
;
Renmin University of China(中国人民大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Peking University(北京大学)
;
Tsinghua University(清华大学)
;
University of Edinburgh(爱丁堡大学)