Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum
Wiki-R1: 通过数据和采样课程激励基于知识的多模态推理用于VQA
Shan Ning, Longtian Qiu, Xuming He
机构
*
ShanghaiTech University(上海科技大学)
;
Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程研究中心)
;
Lingang Laboratory(临港实验室)
专题命中
视觉问答
:visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
MedStreamBench: A Time-Aware Benchmark for Streaming and Proactive Medical Video Understanding
MedStreamBench: 面向流式与主动式医疗视频理解的时间感知基准
Yuan Wang, Shujian Gao, Songtao Jiang, Zhengyu Hu, Zuozhu Liu
机构
*
College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
;
Department of Electrical and Computer Engineering, Carnegie Mellon University(卡内基梅隆大学电气与计算机工程系)
机构
*
Nanyang Technological University(南洋理工大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)
专题命中
视觉问答
:multimodal large language model(abstract);分类 cs.AI
Teaching Vision-Language-Action Models What to See and Where to Look
教视觉-语言-动作模型看什么和看哪里
Yuguang Yang, Canyu Chen, Zhewen Tan, Yizhi Wang, Zichao Feng, Chunyang Liu, Kehua Sheng, Juan Zhang, Linlin Yang, Baochang Zhang, Yan Wang, Bo Zhang, Xianbin Cao
机构
*
School of Electronic Information Engineering, Beihang University(北京航空航天大学电子信息工程学院)
;
National College for Excellent Engineers, Beihang University(北京航空航天大学卓越工程师学院)
;
Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)
;
DiDi(滴滴出行)
;
State Key Laboratory of Media Convergence and Communication, Communication University of China(中国传媒大学媒体融合与传播国家重点实验室)
;
School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)
;
School of Cyber Science and Technology, Beihang University(北京航空航天大学网络安全科学与技术学院)
;
School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)