Enhancing Surgical Documentation through Multimodal Visual-Temporal Transformers and Generative AI
专题命中 视频多模态 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.AI
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 视频多模态 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.AI
机构 * Li Auto Inc.(利亚汽车公司) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
机构 * University of Windsor(温莎大学)
专题命中 视频多模态 :multi-modal(title);cross-modal(abstract);分类 cs.CV、cs.AI
机构 * University of Windsor(温莎大学)
专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI
专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI
Comments ICRA'25 Workshop: Human-Centered Robot Learning in the Era of Big Data and Large Models
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM
Comments 6 pages, 8 Figures
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
Comments 8 pages
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
Comments Published at WACV 2025
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
Journal ref Neurocomputing, Volume 633, 7 June 2025, 129781
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
Comments 30 pages, 4 figures. Some example paintings are blurred to avoid potential copyright violations
专题命中 视频多模态 :MLLM(title);multi-modal(abstract);分类 cs.CV、cs.AI
Comments CVPR 2025
专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI
Comments IEEE ICRA 2025
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
Comments 29 pages, 16 figures, technical report from MSR
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL
Comments Our dataset can be found at \url{https://huggingface.co/datasets/fazliimam/temporal-vqa}
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL
专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV、cs.MM
Comments 10 pages, 4 figures, THE WEB CONFERENCE 2025
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
Comments Preprint
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
Comments 14 pages, 1 figure, accepted by ICONIP 2024
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM
Comments Accepted for The 39th Annual AAAI Conference on Artificial Intelligence 2025 in Main Track, 19 pages, 24 figures
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
Comments https://apollo-lmms.github.io
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
Comments 11 pages
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.CL
专题命中 视频多模态 :multimodal(title);multi-modal(abstract);分类 cs.CL、cs.AI
Comments This work has been submitted to the IEEE for possible publication