Can DeepSeek Reason Like a Surgeon? An Empirical Evaluation for Vision-Language Understanding in Robotic-Assisted Surgery
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
Comments Technical Report
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
Comments Technical Report
专题命中 图文多模态 :image-text(abstract);分类 cs.CL、cs.AI
Comments 12 Pages, 4 Figures
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI
Comments 10 pages , 3 figures
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL
Comments 8 main pages, 4 pages Appendix, 5 figures
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments Accepted by CVPR2025
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.MM
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments CVPR 2025 Main Conference
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments ICLR2025
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments The manuscript is accepted by ICLR 2025 FM-Wild Workshop
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI
Comments accepted by ICLR 2025
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI
Comments Accepted as ICLR 2025 conference paper
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
Comments Accepted as oral paper at ICLR 2025
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments 59 pages, 42 figures
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
Comments 20 pages, 18 figures, 6 tables
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.MM
Comments 11 pages, 8 figures
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
Comments Under Review
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
Comments Model checkpoints are available at https://github.com/google-research/big_vision/tree/main/big_vision/configs/proj/image_text/README_siglip2.md
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments 12 pages, 8 figures
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
Comments Poster at Workshop on Large Language Models and Generative AI for Health at AAAI 2025