DualFocus: Integrating Macro and Micro Perspectives in Multi-modal Large Language Models
专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL
专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CL
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI
Comments under review
专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV
Comments 7 pages, 7 figures. Accepted to IEEE International Conference on Robotics and Automation (ICRA) 2024
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV
专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV
Comments 15 pages,version 1
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV
Comments 17 pages, 6 tables, 9 figurs. Code, data, and model are available at: https://github.com/sunsmarterjie/ChatterBox
专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV
专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV
Comments Paper Accepted at the 2nd IEEE Conference on Secure and Trustworthy Machine Learning
专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CL
Comments ICASSP 2024
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV
专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV
Comments Accepted by AAAI 2024. Code will be released at https://github.com/dmzhang0425/FM-OV3D.git
专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV
专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV
Comments The project page is available at https://vlm-driver.github.io/
专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV
专题命中 图文多模态 :cross-modal(title);multimodal(abstract);分类 cs.CV
专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV
专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.MM
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV
Comments Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI) in October 2023
专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV
Comments The source code will be released at https://github.com/Fudan-ProjectTitan/OpenAnnotate3D
专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CL
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV
Comments Preprint
专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV
Comments Accepted at ICCV 2023 workshop, Towards the Next Generation of Computer Vision Datasets: General DataCentric Submission Track
专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV
Comments International Conference on Computer Vision (ICCV) 2023
专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV
专题命中 图文多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV
Comments Proc. of Florence Heri-Tech 2022: The Future of Heritage Science and Technologies: ICT and Digital Heritage, 2022
专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV
Comments 8 pages, 5 figures, 4 tables
Journal ref Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), 2023, pp. 1145-1154