A Matter of Time: Revealing the Structure of Time in Vision-Language Models
机构 * St. Pölten University of Applied Sciences(施普伦特应用科学大学)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * St. Pölten University of Applied Sciences(施普伦特应用科学大学)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) ; Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) ; Shenzhen Research Institute of Big Data, China(大数据研究 institute) ; Sun Yat-sen University, China(中山大学) ; City University of Hong Kong, China(香港城市大学) ; Communication University of China, China(通信大学)
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
机构 * University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute for AI(人工智能矢量研究所)
专题命中 视觉推理 :vision-language model(title);vision language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI
Comments Preprint. Project page: https://davidhalladay.github.io/diysink_demo
机构 * Guilin University of Electronic Technology(桂林电子科技大学) ; The Ohio State University(俄亥俄州立大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.AI
机构 * Centre for Responsible Autonomous Systems in Healthcare (CRASH) Lab, Koita Centre for Digital Health(负责任的自主医疗系统中心(CRASH)实验室、Koita数字健康中心) ; Ashoka University(阿什oka大学) ; Independent Researcher(独立研究者) ; Koita Centre for Digital Health(Koita数字健康中心)
专题命中 视觉推理 :visual reasoning(title,abstract);vision language model(abstract);分类 cs.AI、cs.LG
Comments 29 pages, 7 figures, 7 tables, includes Annexure (1). Part of the work accepted at RSNA 2025 (Cutting Edge Oral Presentation)
机构 * Institute of Cognitive Science, Osnabrück University(认知科学研究所,奥斯纳布吕克大学)
专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
机构 * HKUST(GZ)(香港科技大学(广州)) ; KU Leuven(比利时鲁文大学) ; EPFL(苏黎世联邦理工学院) ; SZU(深圳大学)
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments Accepted by NeurIPS 2025
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Li Auto Inc.(Li汽车公司) ; the School of Aeronautics and Astronautics, Xiamen University(厦门大学航空航天学院) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.LG
机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; University of California, Merced(加州大学默塞德分校)
专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
机构 * IIIT Bangalore(班加罗尔印度理工学院) ; ETH Zürich(苏黎世联邦理工学院)
专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.AI
Comments Monjoy Narayan Choudhury and Junling Wang contributed equally to this work. Accepted at EMNLP2025 main. Code and datasets are open-sourced with links in the paper
Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing
机构 * Brown University(布朗大学) ; Tel Aviv University(特拉维夫大学) ; IIT Kharagpur(印度理工学院卡里帕尔分校) ; New York University(纽约大学) ; University of Tübingen(图宾根大学)
专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.AI
机构 * Old Dominion University(旧 Dominion 大学) ; AnaletIQ ; McDonald Army Health Center(麦克唐纳陆军医疗中心) ; University of Sri Jayewardenepura(Sri Jayewardenepura 大学) ; University of Gdańsk(盖尔范大学) ; University of Colombo(科伦坡大学)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; University of Science and Technology of China(中国科学技术大学)
专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
机构 * Courant New York University New York, United States(Courant 新 York 大学 新 York,美国)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments 10 pages, 5 figures, submitted to a conference (IEEE formate). Authored by students from the Courant Institute, NYU
专题命中 视觉推理 :vision language model(title,abstract);VLM(abstract);分类 cs.AI、cs.LG
Comments Project Website: https://vlmgineer.github.io/release
机构 * Peking University(北京大学) ; Shenzhen Graduate School(深圳研究生院) ; Peng Cheng Laboratory(鹏城实验室)
专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG
机构 * Department of Electrical and Electronics Engineering and KUIS AI Center, Koç University(电气与电子工程系和KUIS人工智能中心,科克大学)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments 14 pages, 9 figures, 5 tables, accepted to IEEE Transactions on Circuits and Systems for Video Technology
Journal ref IEEE Transactions on Circuits and Systems for Video Technology 2025
机构 * LMU Munich(慕尼黑莱布尼茨大学) ; Technical University of Munich(慕尼黑技术大学) ; Siemens Technology(西门子技术) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; University Heidelberg(海德堡大学)
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI、cs.LG
Comments 12 pages, 3 figures
机构 * National University of Singapore (NUS)(新加坡国立大学) ; Nanyang Technological University (NTU)(南洋理工大学) ; Cornell University(康奈尔大学)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments Accepted to ACL 2025
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 视觉推理 :MLLM(title);visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG
专题命中 视觉推理 :visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments Accepted at ACL Findings
机构 * Tsinghua University(清华大学) ; BNRist ; OPPO AI Center(OPPO人工智能中心) ; Peking University(北京大学) ; Hangzhou Zhuoxi Institute of Brain and Intelligence(杭州智行脑科学与人工智能研究所)
专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments Accepted by CVPR 2025
机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) ; Wuhan AI Research, Wuhan, China(武汉人工智能研究所)
专题命中 视觉推理 :visual reasoning(title,abstract);grounding(abstract);分类 cs.CV、cs.AI
Comments Tech report
机构 * Nanyang Technological University(南洋理工大学) ; ByteDance(字节跳动) ; Tsinghua University(清华大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; The University of Sydney(悉尼大学)
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments Technical report
机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) ; School of Engineering, Westlake University(西湖大学工程学院) ; University of Minnesota – Twin Cities(明尼苏达大学双城分校) ; University of Toronto(多伦多大学)
专题命中 视觉推理 :LLaVA(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments Work in progress
机构 * Department of EECS University of Arkanasas Fayetteville(电子工程与科学系阿肯色大学法洛维尔分校)
专题命中 视觉推理 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI、cs.LG
Comments 5 pages, ICASSP 2025. First two authors are equally contributed
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI