Universal Item Tokenization for Transferable Generative Recommendation
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments Accepted by CVPR 2025
机构 * Giant NetworkChina(巨网中国) ; The East China University of Science and TechnologyChina(东华大学) ; Northwestern Polytechnical UniversityChina(西北工业大学)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments 5 pages, 4 figures, accepted by Interspeech 2025
机构 * Apple(苹果公司) ; Fudan University(复旦大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Technical report
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Beijing Future Brain Education Technology Co., Ltd.(北京未来脑教育科技有限公司)
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
Comments arXiv admin note: substantial text overlap with arXiv:2502.11916
机构 * Tencent(腾讯)
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
机构 * Amazon Web Services(亚马逊网络服务)
专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV
Comments N/A
机构 * Institute of Mathematics and Statistics, University of São Paulo (IME-USP)(数学统计研究所,圣保罗大学) ; Department of Experimental Psychology, Institute of Psychology, University of São Paulo (IP-USP)(心理学实验部门,心理学研究所,圣保罗大学) ; Institute of Biosciences, University of São Paulo (IB-USP)(生物科学研究所,圣保罗大学)
专题命中 VLM训练与架构 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV
专题命中 VLM训练与架构 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.AI
机构 * Huazhong Agricultural University(华中农业大学)
专题命中 VLM训练与架构 :vision-language model(abstract);InternVL(abstract);分类 cs.CV
Comments Accepted by ICMR 2025
机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家级实验室) ; Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) ; Xi’an Jiaotong University(西安交通大学)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.AI
机构 * Department of Computer Science(计算机科学系) ; ARIC ; Khalifa University of Science and Technology(科技大学) ; Information Technology University of the Punjab(旁遮普信息科技大学) ; University of the Western Australia(西澳大学)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
机构 * UCAS Beijing China(中国科学院大学北京校区) ; Macquarie University(麦考瑞大学)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室) ; ByteDance(字节跳动)
专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV
Comments CVPR 2025. If any references are missing, please contact joyachen@u.nus.edu
机构 * University of Central Florida(佛罗里达中央大学) ; Khulna University of Engineering & Technology(库尔纳工程与技术大学) ; Delineate Inc.(Delineate公司) ; Universiti Tenaga Nasional(国家能源大学) ; University of South Florida(佛罗里达州立大学) ; Daffodil International University(达夫迪尔国际大学) ; Anymate Me(Anymate Me公司)
专题命中 VLM训练与架构 :vision language model(abstract);grounding(abstract);分类 cs.CV
Comments PEFT Survey paper
专题命中 VLM训练与架构 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
Comments Accepted to CVPR 2025 Workshop
专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Technical report. Project page: https://foundationvision.github.io/Liquid/
专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV
Comments Accepted to CVPR 2025 Workshop SyntaGen. Project page: https://tanbuinhat.github.io/NeIn/
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments CVPR 2025
专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.LG
Comments Published at the IEEE International Conference on Robotics and Automation (ICRA) 2025
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.LG
Comments CVPR 2025 Accepted
专题命中 VLM训练与架构 :LLaVA(abstract);grounding(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments 33 pages, 20 figures, 17 tables, ICLR 2025
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments CVPR 2025
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Accepted at ICLR 2025
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments Accepted by CVPR 2025
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV