DreamOmni2: Multimodal Instruction-based Editing and Generation
机构 * CUHK(香港中文大学) ; HKUST(香港科技大学) ; HKU(香港大学) ; ByteDance Inc(字节跳动公司)
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * CUHK(香港中文大学) ; HKUST(香港科技大学) ; HKU(香港大学) ; ByteDance Inc(字节跳动公司)
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV
机构 * The University of Tokyo(东京大学) ; Google DeepMind(谷歌DeepMind)
专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV
Comments Accepted to NeurIPS2025. Website: https://sites.google.com/view/t2v-dlbs and Code: https://github.com/shim0114/T2V-Diffusion-Search
机构 * School of Electronic Engineering(电子工程学院) ; Xidian University(西安电子科技大学) ; School of Computer Science(计算机科学学院)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
机构 * Sichuan University(四川大学) ; Peking University(北京大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
机构 * The University of Western Australia(西澳大学) ; Dalian University of Technology(大连理工大学) ; Khalifa University(卡利夫大学) ; Zhejiang Lab(浙江实验室)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV
Comments 15 pages
机构 * MAIS, CASIA(中国科学院自动化研究所MAIS实验室) ; Kuaishou Technology(快手科技) ; School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
Comments NeurIPS 2025
机构 * Rochester Institute of Technology(罗切斯特理工大学) ; Bosch Research(博世研究) ; DEVCOM Army Research Laboratory(美国陆军研究实验室)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
Comments Accepted by EMNLP2025
机构 * Visual Recognition Group, Czech Technical University in Prague(捷克技术大学布拉格分校视觉识别组)
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV
机构 * Peking University(北京大学) ; AI Geeks ; Australian Artificial Intelligence Institute(澳大利亚人工智能研究所)
专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV
机构 * Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; Columbia University(哥伦比亚大学) ; Rice University(Rice大学) ; Salesforce AI Research(Salesforce人工智能研究)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV
Comments 12 pages
机构 * Ant Group(蚂蚁集团)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
机构 * State Key Laboratory of Media Convergence and Communication(媒体融合与传播国家重点实验室) ; Communication University of China(中国传媒大学) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 VLM训练与架构 :visual question answering(abstract);分类 cs.AI
机构 * University College London(伦敦大学学院)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI
机构 * Peking University(北京大学) ; Tsinghua University(清华大学) ; Mila - Québec AI Institute(魁北克人工智能研究所)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
Comments NeurIPS 2025. Code: https://github.com/Gen-Verse/HermesFlow
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.LG
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
Comments submitted to AAAI 2026
机构 * NVIDIA(英伟达) ; Rutgers University(罗格斯大学) ; UC Berkeley(加州大学伯克利分校) ; MIT(麻省理工学院) ; Nanjing University(南京大学) ; KAIST(韩国科学技术院)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
Comments Accepted by MICCAI 2025
机构 * School of Computer engineering, Iran university of Science and Technology(计算机工程学院,伊朗科学技术大学)
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV
机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡) ; Business School, University of Seoul, Republic of Korea(商学学院,首尔大学,韩国) ; Alibaba Group and the Alibaba-NTU Joint Research Institute, Singapore(阿里巴巴集团及阿里巴巴-南洋理工大学联合研究机构,新加坡)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG
机构 * S-Lab, NTU, Singapore(新加坡国立大学S实验室) ; LMMs-Lab Team(多模态模型实验室团队) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV
机构 * School of Software Engineering(软件工程学院) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy(人工智能与数字经济广东实验室)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
机构 * Korea University(韩国大学)
专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV
机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, CAS, Beijing, China(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院,北京,中国) ; School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(人工智能学院,中国科学院大学,北京,中国) ; Fanyu AI Laboratory, Zhongke Fanyu Technology Co., Ltd, Beijing, China(凡语AI实验室,中科创始人技术有限公司,北京,中国)
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV
Comments EMNLP2025 Main
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG
Comments Accepted at AIES 2025
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.LG
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV
Comments Accepted to ICCV 2025. Code available at https://github.com/adobe-research/CompCon
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) ; School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI
Comments Accepted by ICML 2025
机构 * Tel Aviv University(特拉维夫大学) ; Bar Ilan University(巴伊兰大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
Comments Project page https://shadyabh.github.io/ADIR/
Journal ref BMVC 2025