Beyond Embeddings: The Promise of Visual Table in Visual Reasoning
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Project page: https://github.com/LaVi-Lab/Visual-Table
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Project page: https://github.com/LaVi-Lab/Visual-Table
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted to Findings of ACL 2024
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments ACM Transactions on Multimedia Computing, Communications and Applications (2024)
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV
Comments CVPR 2024
专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
Comments 12 pages, 10 figures, conference
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CL
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
Comments ICLR 2024 Camera-ready
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV
Comments CVPR 2024; https://github.com/Beckschen/ViTamin
专题命中 图文多模态 :MLLM(abstract);image-text(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV
Comments Accepted by CVPR 2024
专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
Comments 18 pages, 5 figures
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV
Comments 12pages, 3 figures
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV
Comments CVPR 2024. Project Page: https://snap-research.github.io/Panda-70M
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CL
Comments Preprint
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV
Comments The content of the technical report needs to be updated and retracted to avoid other impacts
专题命中 图文多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.CV
Comments accepted to ICRA2024
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV
Comments Accepted by NeurIPS2023
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.AI
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV
Comments 4 pages. arXiv admin note: substantial text overlap with arXiv:2309.03661
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV
Comments Accepted at NeurIPS 2023. v2 adds SugarCrepe results and more ablations, v3 has minor fixes. v4 adds a code link ( https://github.com/google-research/big_vision ). v5 has minor fixes
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV
Comments Code and models are available at https://github.com/InternLM/InternLM-XComposer
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted to IJCV
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV
Comments NeurIPS 2023 camera ready. code and model available at https://github.com/bytedance/fc-clip
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.AI
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV
Comments TMLR, featured certification; changelog at https://openreview.net/forum?id=a7nvXxNmdV
Journal ref Transactions on Machine Learning Research, 10/2023, issn 2835-8856