Fast Visuomotor Policy for Robotic Manipulation
机构 * Fudan University(复旦大学) ; MEGVII Technology(MEGVII科技)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * Fudan University(复旦大学) ; MEGVII Technology(MEGVII科技)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; University of California, Merced(加州大学默塞德分校) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; University of Southern California(南加州大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CL
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; The University of Hong Kong(香港大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
Comments 30 pages, a benchmark designed to evaluate Online Spatio-Temporal understanding from the perspective of an agent actively exploring a scene. Project Page: https://rbler1234.github.io/OSTBench.github.io/
机构 * Beijing Institute of Technology(北京理工大学) ; Shenzhen University(深圳大学)
专题命中 视频多模态 :MLLM(abstract);分类 cs.CV
Comments Accepted by NeurIPS 2025. Code: https://github.com/QiWang98/VideoRFT
专题命中 视频多模态 :MLLM(abstract);分类 cs.CV
Comments 16 pages, 9 figures
机构 * ByteDance(字节跳动) ; NUS(国立大学新加坡) ; HKUST(GZ)(香港科技大学(珠海)) ; THU(清华大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
机构 * The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
机构 * Nagoya University(名古屋大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
Comments ACM Multimedia Asia 2025
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
机构 * School of Information Technology, Deakin University(德肯大学信息科技学院)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
Comments 28 pages
机构 * Shanghai Jiao Tong University(上海交通大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Bilibili Inc.(哔哩哔哩公司)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
机构 * State Key Laboratory of Multimedia Information Processing, Peking University(多媒体信息处理国家重点实验室,北京大学) ; Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) ; Tsinghua University(清华大学) ; ModelTC
专题命中 视频多模态 :multimodal(abstract);分类 cs.CL
机构 * Shanghai Jiao Tong University(上海交通大学) ; Alibaba group(阿里巴巴集团)
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
机构 * Amazon(亚马逊)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
Comments Accepted to the International Conference on Computer Vision, ICCV 2025
机构 * Department of Computational Linguistics, University of Zurich, Zurich, Switzerland(计算语言学系,苏黎世大学,苏黎世,瑞士)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
机构 * University of Bristol(布里斯托大学) ; Memories.ai Research(Memories.ai研究)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
机构 * The University of Western Australia(西澳大学) ; Dalian University of Technology(大连理工大学) ; Khalifa University(卡利夫大学) ; Zhejiang Lab(浙江实验室)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
机构 * Free University of Bozen-Bolzano(博洛尼亚-博兹纳自由大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
Comments Accepted at the 2025 Winter Conference on Applications of Computer Vision (WACV) Workshops. Visit the project page at https://edowhite.github.io/Gate-Shift-Pose
机构 * College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
Comments 18 pages,15 figures
Journal ref IEEE Transactions on Neural Networks and Learning Systems, pp. 1-15, 2025
机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) ; Linköping University(_linköping大学) ; SenseTime Research(商汤科技研究院)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
机构 * Columbia University New York, USA(哥伦比亚大学) ; Carnegie Mellon University Pittsburgh, USA(卡内基梅隆大学) ; New York University New York, USA(纽约大学) ; Wuhan University Wuhan, China(武汉大学)
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
Comments This paper is accepted to BMVC 2025
机构 * Sun Yat-sen University(中山大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
Comments Code is available at https://github.com/HCPLab-SYSU/DART
机构 * Sangfor Technologies ; The Australian National University(澳大利亚国立大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) ; School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
Comments *Corresponding authors: Min Zhu (min.zhu@scu.edu.cn) and Junlong Cheng (jlcheng@scu.edu.cn)
机构 * HKUST (GZ)(香港科技大学(广州)) ; HKUST(香港科技大学) ; HIT(哈尔滨工业大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
机构 * VCIP, School of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学) ; ByteDance Inc.(字节跳动公司)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
Comments Accepted at NeurIPS 2025
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI
Comments Conference on Robot Learning (CoRL) 2025
机构 * Nanyang Technological University, Singapore(南洋理工大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
机构 * University of Trento(特伦托大学) ; Fondazione Bruno Kessler (FBK)(布鲁诺·凯斯勒基金会)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
Comments Accepted to NeurIPS 2025
机构 * ERM Automatismes(ERM 自动化公司) ; PAL Robotics(PAL 机器人公司)
专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI