VectorGym: A Multitask Benchmark for SVG Code Generation, Sketching, and Editing
VectorGym:一个多任务基准用于SVG代码生成、草图和编辑
Juan Rodriguez, Haotian Zhang, Abhay Puri, Tianyang Zhang, Rishav Pramanik, Meng Lin, Xiaoqing Xie, Marco Terral, Darsh Kaushik, Aly Shariff, Perouz Taslakian, Spandana Gella, Sai Rajeswar, David Vazquez, Christopher Pal, Marco Pedersoli
机构
*
ServiceNow Research(ServiceNow 研究院)
;
Mila, Quebec AI Institute(Mila 魁北克人工智能研究所)
;
Columbia University(哥伦比亚大学)
;
University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
;
Stony Brook University(石溪大学)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Minzu University of China(中央民族大学)
;
University of Waterloo(滑铁卢大学)
;
Canada CIFAR AI Chair(加拿大 CIFAR 人工智能讲席)
;
Computer Vision Center(计算机视觉中心)
Multi-Modal Representation Learning via Semi-Supervised Rate Reduction for Generalized Category Discovery
通过半监督率减少实现多模态表示学习的通用类别发现
Wei He, Xianghan Meng, Zhiyuan Huang, Xianbiao Qi, Rong Xiao, Chun-Guang Li
机构
*
School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)
;
Intellifusion Inc., Shenzhen, P.R. China(深圳云天励飞技术股份有限公司)
专题命中
VLM训练与架构
:vision language model(abstract);分类 cs.CV
Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism
通过视觉记忆机制扩展多模态大语言模型的长视频理解
Tao Chen, Kun Zhang, Qiong Wu, Xiao Chen, Chao Chang, Xiaoshuai Sun, Yiyi Zhou, Rongrong Ji
机构
*
Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室)
;
National University of Defense Technology(国防科技大学)
专题命中
其他VLM
:multimodal large language model(title,abstract);分类 cs.CV、cs.AI