CueBench: Advancing Unified Understanding of Context-Aware Video Anomalies in Real-World
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV
机构 * EPFL(瑞士联邦理工学院) ; MILA(蒙特利尔人工智能研究院)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV
Journal ref 2025 Conference on Empirical Methods in Natural Language Processing
机构 * Southeast University(东南大学) ; Monash University(墨尔本大学) ; Xiaohongshu Inc.(小红书公司) ; University of Southern California(南加州大学) ; Fudan University(复旦大学)
专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV
机构 * Department of Computer Science(计算机科学系) ; Delft University of Technology(代尔夫特理工大学) ; LatentWorlds AI ; National Policelab AI & Model-Driven Decisions Lab(国家警务实验室AI与模型驱动决策实验室)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV
Comments Accepted as poster in the NeurIPS 2025 Workshop on Space in Vision, Language, and Embodied AI
机构 * Ant Group(蚂蚁集团)
专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Accepted to NeurIPS 2025, 18 pages
机构 * Department of Computer Science and Engineering(计算机科学与工程系)
专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
机构 * Tel Aviv University(特拉维夫大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV
机构 * International Digital Economy Academy (IDEA)(国际数字经济学院(IDEA))
专题命中 视觉定位与Grounding :grounding(abstract);MLLM(abstract);分类 cs.CV
Comments homepage: https://rex-omni.github.io/
机构 * UIUC(伊利诺伊大学香槟分校) ; Northwestern University(西北大学) ; Toyota Research Institute(丰田研究院)
专题命中 视觉定位与Grounding :vision language model(abstract);grounding(abstract);分类 cs.AI
机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(航天信息研究所,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Shanghai Jiao Tong University(上海交通大学) ; University of Wollongong(沃林戈大学) ; SAIS, Shanghai Jiao Tong University(上海交通大学国际关系学院)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV
Comments Accepted to NeurIPS 2025
专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV
Comments 6 pages, 3 figures
机构 * Stanford University(斯坦福大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV
Comments ICCV Short Video Understanding Workshop Paper
机构 * AIR, Tsinghua University(清华大学) ; Peking University(北京大学) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.AI
机构 * University of Mainz(马尔堡大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.AI
Comments Paper presented at AMTA 2025
机构 * Nanjing University of Science and Technology(南京理工大学) ; Intellifusion Inc.(Intellifusion公司) ; Northwestern Polytechnical University(西北工业大学) ; Zhejiang Lab(浙江实验室) ; Yan’an University(延安大学) ; Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV
机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) ; University of Queensland(昆士兰大学) ; UC Merced(加州大学默塞德分校) ; Yonsei University(延世大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV
专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Project page: https://github.com/DianJin-HFUT/SimToken
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Purdue University(普渡大学)
专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV
Comments Accepted to EMNLP 2025 (Main). 17 pages, 7 figures
专题命中 视觉定位与Grounding :vision language model(abstract);VLM(abstract);分类 cs.CV
机构 * Independent Researcher(独立研究者)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV
Comments 17 pages, 3 figures, 3 tables. Dataset available at https://huggingface.co/datasets/umairhassan02/urdu-translated-coco-captions-subset. Scripts and notebooks to reproduce results available at https://github.com/umair-hassan2/COCO-Urdu
机构 * College of Computing and Data Science, Nanyang Technological University(computing and Data Science学院,南洋理工大学) ; School of Electrical and Electronic Engineering, Nanyang Technological University(Electrical and Electronic Engineering学院,南洋理工大学) ; School of Artificial Intelligence, Wuhan University(Artificial Intelligence学院,武汉大学) ; ByteDance(字节跳动)
专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Extended version of our conference paper arXiv:2410.09855
机构 * Politecnico di Torino(托斯尼亚理工学院)
专题命中 视觉定位与Grounding :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV
Comments Accepted at ICIAP 2025
专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments Accepted by ACMMM2025
机构 * Intelligent Control \& Smart Energy (ICSE) Research Group, School of Engineering, University of Warwick, Coventry, CV4 7AL, UK
专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
机构 * Google DeepMind(谷歌DeepMind)
专题命中 视觉定位与Grounding :vision language model(abstract);VLM(abstract);分类 cs.CV
专题命中 视觉定位与Grounding :vision-language model(abstract);LLaVA(abstract);分类 cs.CV
Comments Accepted by CVPR 2025; A real-world long video needle-in-haystack benchmark; long-video QA with human ref frames
机构 * Department of Artificial Intelligence University of Groningen, the Neteherlands(格罗宁根大学人工智能系) ; School of Informatics University of Edinburgh, United Kingdom(爱丁堡大学信息学院) ; Department of Computer Science University College London, United Kingdom(伦敦大学学院计算机科学系)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV
机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University, Shanghai(智能机器人与先进制造学院,复旦大学,上海) ; Shanghai Key Lab of Intelligent Information Processing, College of Computer Science and Artificial Intelligence, Fudan University, Shanghai(上海智能信息处理重点实验室,计算机科学与人工智能学院,复旦大学,上海) ; JIIOV Technology, Beijing(JIIOV技术,北京)
专题命中 视觉定位与Grounding :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV
Comments Accepted by ICCV 2025 (Highlight)
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Mashang Consumer Finance Co, Ltd(马商消费金融有限公司)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV
Comments ACMMM2025