Multi-Level LVLM Guidance for Untrimmed Video Action Recognition
机构 * Kunming University of Science and Technology(昆明理工大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Kunming University of Science and Technology(昆明理工大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
机构 * AIRI ; Moscow Institute of Physics and Technology (MIPT)(莫斯科物理技术学院) ; Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学) ; Sberbank, Robotics Center(Sberbank机器人中心) ; Skoltech
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI
机构 * The Chinese University of Hong Kong(香港中文大学) ; Technical University of Munich(慕尼黑技术大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
机构 * Zhejiang University(浙江大学) ; vivo AI Lab(vivo AI实验室)
专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.AI
Comments Accepted by ACM MM 2025
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
机构 * SJTU(上海交通大学) ; vivo AI Lab(vivo人工智能实验室)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
机构 * OPPO AI Center(OPPO人工智能中心) ; Tsinghua University(清华大学)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV
Comments Accepted to ICCV 2025
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Xiamen University(厦门大学) ; University of Science and Technology of China(中国科学技术大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Tsinghua University(清华大学) ; Nanjing University(南京大学) ; Fudan University(复旦大学) ; University of Hong Kong(香港大学) ; Donghua University(东华大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV
Comments in progress
机构 * ASU(亚利桑那州立大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.LG
Comments This paper was accepted to RLC/RLJ 2025
机构 * Vrije Universiteit Amsterdam(范·艾克大学阿姆斯特丹)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
专题命中 GUI与屏幕智能体 :visual language model(abstract);分类 cs.CV
机构 * Institution1(机构1) ; Institution2(机构2)
专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV
机构 * School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications(北京邮电大学智能工程与自动化学院) ; School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) ; Department of Automation, Tsinghua University(清华大学自动化学院)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI
Comments Project Page: https://gary3410.github.io/eif_unknown/
机构 * Chair of Computing in Civil and Building Engineering, Technical University of Munich, Germany(土木与建筑工程计算系,慕尼黑技术大学) ; TUM Georg Nemetschek Institute, Munich, Germany(慕尼黑技术大学Georg Nemetschek研究所)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI
Comments ICML 2025 Workshop on Computer Use Agents
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI
Comments 18 pages, 3 figures, accepted by Workshop on Computer-use Agents @ ICML 2025
机构 * The University of Hong Kong(香港大学) ; Shanghai AI Lab(上海人工智能实验室)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
Comments project page: vlnr1.github.io
机构 * Shanghai Jiao Tong University(上海交通大学) ; Alibaba Group(阿里巴巴集团)
专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.AI
机构 * CASIA(中国科学院自动化研究所) ; BAAI(阿里巴巴人工智能研究院) ; THU(清华大学) ; HKISI(香港理工大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
Comments technical report
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV
Comments Published in 2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). Project page: https://physid.github.io/
Journal ref 2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Hyderabad, India, 2025, pp. 1-5
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; School of Computing, National University of Singapore(新加坡国立大学计算机学院) ; Shanghai Jiaotong University(上海交通大学) ; Tsinghua University(清华大学)
专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.AI
Comments 9 pages of main content, 19 pages in total
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Peng Cheng Laboratory(鹏城实验室) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.AI
Comments 20 pages, 5 figures, 5 tables
机构 * Aim Intelligence ; Yonsei University(延世大学) ; Seoul National University(首尔国立大学)
专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.AI
Comments Accepted ACL 2025 Industry track
机构 * Korea University(韩国大学) ; University of Michigan(密歇根大学) ; Samsung AI Center, DS Division(三星人工智能中心,DS部门) ; Korea Advanced Institute of Science & Technology(韩国先进科学技术研究所)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Johns Hopkins University(约翰霍普金斯大学) ; The First Affiliated Hospital of Nanjing Medical University(南京医科大学第一附属医院) ; University of California, San Francisco(加州大学旧金山分校)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV
机构 * Hugging Face ; Sorbonne University(索邦大学) ; École Normale Supérieure Paris-Saclay(巴黎萨克雷高等师范学院)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.LG
Comments 24 pages. Code and assets: https://github.com/huggingface/lerobot
机构 * Department of Informatics, Graduate School of Informatics and Engineering, The University of Electro-Communications(信息学院、信息与工程研究生院、电通通信大学)
专题命中 GUI与屏幕智能体 :LLaVA(abstract);分类 cs.CV
Comments Accepted at the International Conference on Advanced Concepts for Intelligent Vision Systems (ACIVS 2025)
机构 * ARC Lab, Tencent PCG(腾讯PCG ARC实验室) ; City University of Hong Kong(香港城市大学)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV
Comments Project released at: https://howe125.github.io/AnimeGamer.github.io/