GAZE:Governance-Aware pre-annotation for Zero-shot World Model Environments
机构 * Centific Global Solutions Inc.(Centific全球解决方案公司)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * Centific Global Solutions Inc.(Centific全球解决方案公司)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
机构 * Allen Wang Gavin Tao
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments 14pages, 9 figures, Journal paper
机构 * Computer and Information Science, University of Arkansas - Little Rock(计算机与信息科学,亚拉荷马州立大学) ; ICSI, University of California, Berkeley(ICSI,加州大学伯克利分校) ; COSMOS Research Center, University of Arkansas - Little Rock(COSMOS研究中心,亚拉荷马州立大学)
专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.MM
机构 * Zhejiang Normal University(浙江师范大学) ; Hong Kong University of Science and Technology(香港理工大学) ; Zhejiang University(浙江大学) ; Tencent(腾讯) ; Soochow University(苏州大学)
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
Comments Accepted to ACM MM 2025
机构 * University of Maryland, College Park(马里兰大学学院公园分校) ; University of Virginia(弗吉尼亚大学)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
机构 * Key Laboratory of Education Blockchain and Intelligent Technology, Ministry of Education(教育区块链与智能技术重点实验室,教育部) ; Guangxi Key Laboratory of Multi-Source Information Mining and Security, Guangxi Normal University(广西多源信息挖掘与安全重点实验室,广西师范大学) ; School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Media Analytics and Computing Lab, Department of Artificial Intelligence, School of Informatics, Xiamen University(媒体分析与计算实验室,人工智能系,厦门大学)
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
Comments arXiv admin note: text overlap with arXiv:2401.01686
机构 * University of California, Irvine(加州大学尔湾分校)
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
机构 * Zhejiang University(浙江大学)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
机构 * Nanyang Technological University(南洋理工大学) ; Beijing Jiaotong University(北京交通大学) ; A*STAR Project Page(A*STAR项目页面)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) ; School of Electronic and Information Engineering, Anhui University(安徽大学电子与信息工程学院)
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments Journal extension of Mamba-FETrack which was published on Pattern Recognition and Computer Vision (PRCV) 2024
机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Shanghai Jiao Tong University(上海交通大学) ; University of Trento(特伦特大学) ; Renmin University of China(中国人民大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Hong Kong Polytechnic University(香港理工大学) ; Institute of Automation CAS Beijing China(中国科学院自动化研究所)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments 14 pages, 3 figures, 6 tables
机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Shanghai Jiao Tong University(上海交通大学) ; University of Trento(特伦特大学) ; Renmin University of China(中国人民大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Hong Kong Polytechnic University(香港理工大学)
专题命中 视频多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments 12 pages, 5 Figure, 3 Table
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL
机构 * Tsinghua University(清华大学) ; Sun Yat-sen University(中山大学) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(SZ))
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments 13 pages, 5 figures
机构 * University of Edinburgh(爱丁堡大学) ; TU Darmstadt(德累斯顿理工大学)
专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL
Comments ACL 2025 Main
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
专题命中 视频多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments Accepted at the 38th Conference on Neural Information Processing Systems (NeurIPS 2024 Spolight)
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Journal ref CVPR 2025
专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments Accepted by ICML 2024
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL
Comments Accepted at EMNLP 2024 Main Track
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments IEEE Transactions on Circuits and Systems for Video Technology
Journal ref IEEE Transactions on Circuits and Systems for Video Technology, 2024
专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
Comments Accepted to the main EMNLP 2024 conference
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments Accepted by ACMMM 24
专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI