Do we Really Need Visual Instructions? Towards Visual Instruction-Free Fine-tuning for Large Vision-Language Models
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
Comments under review
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
Comments under review
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL
Comments 10 pages, 2 figures, 6 tables
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL
Comments Accepted to NAACL 2025 Main Conference
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI
Journal ref ICLR 2025, BlueSuffix: Reinforced Blue Teaming for Vision-Language Models Against Jailbreak Attacks. In Proceedings of the International Conference on Learning Representations (ICLR), 2025
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
Comments Accepted to NAACL 2025 Findings
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI
Comments Accepted at ICLR 2025. The first two authors contributed equally
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
Comments NAACL 2025, 19 pages, 10 figures
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI
Comments Accepted for publication at ICLR 2025
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL
Comments Accepted by COLING2025
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
Comments Accepted by ISCAS 2025 (Oral)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
Comments This paper has been accepted for presentation at the 2025 IEEE International Symposium on Biomedical Imaging (ISBI 2025)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments Accepted to International Conference of Pattern Recognition (ICPR 2024)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments 10 pages, 10 figures and tables
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI
Comments 10 pages, 2 figures. To be published in ISBI 2025
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL
Comments Accepted at NeurIPS 2024. Project URL at https://vismin.net/
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments accepted by Visual Intelligence
Journal ref Visual Intelligence, 2024, Vol 2, article no.17
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
Comments 10 pages, 5 figures, IEEE Journal of Biomedical and Health Informatics 2025
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.MM
Comments 20 papers
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments Accepted at TMLR (https://openreview.net/forum?id=Conma3qnaT)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments A technical report. Project: https://github.com/xin-ran-w/CapAgent
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
Comments Project link: https://zeyofu.github.io/ReFocus/
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
Comments Won the 'Best Paper Runner-up Award' at the 2024 IEEE International Automated Vehicle Validation Conference (IAVVC 2024). Also accepted at the 1st Workshop on Semantic Reasoning and Goal Understanding in Robotics, at the Robotics Science and Systems Conference (RSS SemRob 2024)