VLM-driven Skill Selection for Robotic Assembly Tasks
机构 * Department of AI Machinery, Korea Institute of Machinery & Materials(人工智能机械系,韩国机械材料研究院)
专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract)
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Department of AI Machinery, Korea Institute of Machinery & Materials(人工智能机械系,韩国机械材料研究院)
专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract)
机构 * The Graduate Center, CUNY(CUNY研究生中心) ; Brooklyn College, CUNY(CUNY布鲁克林学院) ; Borough of Manhattan Community College, CUNY(CUNY曼哈顿社区学院) ; The City College of New York, CUNY(CUNY纽约城市学院)
专题命中 VLM训练与架构 :MLLM(title,abstract)
专题命中 VLM训练与架构 :vision-language model(title,abstract)
机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; College of Intelligence and Computing(智能与计算学院) ; Tianjin University(天津大学) ; School of Computer Science and Technology(计算机科学与技术学院) ; Harbin Institute of Technology Shenzhen(哈尔滨工业大学深圳学院) ; Institute for Infocomm Research, A*STAR(信息通信研究机构,A*STAR) ; Show Lab, National University of Singapore(新加坡国立大学Show实验室) ; National University of Singapore(新加坡国立大学)
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI、cs.LG
Comments Accepted by NeurIPS 2025
专题命中 VLM训练与架构 :multimodal large language model(title,abstract)
Comments 15 pages, 9 figures
专题命中 VLM训练与架构 :LLaVA(title);vision-language model(abstract)
Comments Project page: https://ali-vosoughi.github.io/SoundCLIP/
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; The University of Queensland(昆士兰大学)
专题命中 VLM训练与架构 :LLaVA(title,abstract)
机构 * State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与脑启发智能技术重点实验室) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Institute of Neuroscience, State Key Laboratory of Brain Cognition and Brain-Inspired Intelligence Technology(神经科学研究所) ; CAS Center for Excellence in Brain Science and Intelligence Technology(中国科学院脑科学与智能技术卓越创新中心) ; Chinese Academy of Sciences(中国科学院)
专题命中 VLM训练与架构 :multimodal large language model(title);分类 cs.CV、cs.AI、cs.LG
Comments Published on Nature Machine Intelligence
Journal ref Nature Machine Intelligence, 2025
专题命中 VLM训练与架构 :vision-language model(title,abstract)
机构 * Behavioral and Spatial AI Lab, Peking University & Tongji University(行为与空间人工智能实验室,北京大学 & 同济大学) ; Southern University of Science and Technology(南方科技大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract)
Comments 6 pages, 5 figures, 2 tables
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团) ; UIUC(伊利诺伊大学香槟分校)
专题命中 VLM训练与架构 :vision-language model(title,abstract)
专题命中 VLM训练与架构 :MLLM(title,abstract)
专题命中 VLM训练与架构 :vision-language model(title,abstract)
Comments 15 pages, 8 figures, 3 tables. Accepted by CAAD Futures 2025
专题命中 VLM训练与架构 :MLLM(title,abstract)
专题命中 VLM训练与架构 :LLaVA(title,abstract)
专题命中 VLM训练与架构 :multimodal large language model(title);MLLM(abstract)
Comments Accepted by KDD 2025 (CR)
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI、cs.LG
Comments Code available at https://ybendou.github.io/ProKeR
专题命中 VLM训练与架构 :VLM(title);vision language model(abstract)
Comments 16th International Conference on Social Robotics +AI
专题命中 VLM训练与架构 :vision-language model(title,abstract)
Comments Accepted by AAAI 2025
专题命中 VLM训练与架构 :multimodal large language model(title,abstract)
Comments COLING 2025
专题命中 VLM训练与架构 :visual language model(title);分类 cs.CV、cs.AI、cs.LG
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2024, pp. 7134-7143
专题命中 VLM训练与架构 :LLaVA(title,abstract)
专题命中 VLM训练与架构 :vision-language model(title,abstract)
Comments COLING-LREC 2024
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI、cs.LG
Comments In proceedings of the 27th IEEE High Performance Extreme Computing Conference
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI、cs.LG
Comments ICLR 2023 Oral (notable-top-5%)
专题命中 VLM训练与架构 :visual language model(title);分类 cs.CV、cs.AI、cs.LG
Comments CVPR 2023 Camera-Ready; Project Webpage: https://antoyang.github.io/vid2seq.html ; 18 pages; 6 figures
TransAnyText:通过结构化视觉生成实现电商图像中任意文本的翻译
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 本文提出TransAnyText框架,将电商图像文本翻译转化为生成可渲染HTML补丁,经三阶段后训练优化,在多基准上表现优于对比方法,为跨境电商图像翻译提供有效可控的解决方案。
FIRM:面向遥感推理分割的掩码细粒度令牌内表示
专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出FIRM模型,通过预测视觉令牌内的r×r二值子单元掩码代码结合轻量连续渲染器优化边界,在5个遥感推理分割基准上取得领先结果,提升了细粒度分割性能。