FineGen: A VLM-based Multi-Agent Framework for Fine-Grained Image-Text Dataset Construction
FineGen:基于VLM的多智能体框架用于细粒度图像-文本数据集构建
Chang Kong, Yuebing Li, Peng Mo, Haigang Zhang, Qiuming Luo
机构
*
Shenzhen Polytechnic University(深圳职业技术大学)
;
Institute of Applied Artificial Intelligence of the Guangdong-Hong Kong Macao Greater Bay Area(粤港澳大湾区应用人工智能研究所)
;
Shenzhen University(深圳大学)
VL2Spike: Spike-driven Distillation from VLMs for Low-Power Visual Perception in Embodied AI
VL2Spike:面向具身AI低功耗视觉感知的VLM脉冲驱动蒸馏
Zinan Liu, Eric Zheng, Soumyaratna Debnath, Hao Shi, Ling Xiao, Lin Wang
机构
*
School of EEE, Nanyang Technological University (NTU)(南洋理工大学电气与电子工程学院)
;
Department of Computer Science, University of Toronto(多伦多大学计算机科学系)
;
Advanced Micro Devices, Inc.(超威半导体公司)
;
State Key Laboratory of Extreme Photonics and Instrumentation, Zhejiang University(浙江大学极端光子学与仪器国家重点实验室)
;
Faculty of Information Science and Technology, Hokkaido University(北海道大学信息科学与技术学院)
机构
*
China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区)
;
Guizhou University(贵州大学)
;
Shenzhen Research Institute of Big Data(深圳大数据研究院)
;
Shanghai Jiao Tong University(上海交通大学)
CLASP: Language-Driven Robot Skill Selection and Composition using Task-Parameterized Learning
CLASP: 基于语言驱动的机器人技能选择与组合,采用任务参数化学习
Markus Knauer, Valentin Gieraths, Tai Mai, Samuel Bustamante, Alin Albu-Schäffer, Freek Stulp, João Silvério
机构
*
German Aerospace Center (DLR), Institute of Robotics and Mechatronics (RMC)(德国航空航天中心(DLR),机器人与机电一体化研究所(RMC))
;
Technical University of Munich (TUM)(慕尼黑工业大学(TUM))
CARPRT: Class-Aware Zero-Shot Prompt Reweighting for Black-Box Vision-Language Models
CARPRT:用于黑盒视觉语言模型的类感知零样本提示重加权
Ruijiang Dong, Zesheng Ye, Jianzhong Qi, Lei Feng, Feng Liu, Gang Niu, Masashi Sugiyama
机构
*
University of Melbourne(墨尔本大学)
;
Southeast University(东南大学)
;
RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心)
;
The University of Tokyo(东京大学)
机构
*
National University of Singapore(新加坡国立大学)
;
Tsinghua University(清华大学)
;
University of Science and Technology of China(中国科学技术大学)
;
University of Electronic Science and Technology of China(电子科技大学)
;
University of California, Berkeley(加州大学伯克利分校)
专题命中
VLM训练与架构
:multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI
机构
*
School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院)
;
Beijing Digital Native Digital City Research Center(北京数字原生数字城研究中心)
;
School of Computer Science, Peking University(北京大学计算机学院)
;
School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)