LLaVA-Surg: Towards Multimodal Surgical Assistant via Structured Surgical Video Learning
专题命中 VLM训练与架构 :LLaVA(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :LLaVA(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG
Comments ECCV 2024
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG
Comments ICRA 2024. Project webpage with robot videos: https://www.robot-learning.uk/dream2real
专题命中 VLM训练与架构 :vision-language model(title,abstract);vision language model(abstract);分类 cs.CV、cs.LG
Comments Accepted at BMVC 2024
专题命中 VLM训练与架构 :LLaVA(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments NeurIPS 2024 Under Review
专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments 11 pages, 10 figures
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments CVPR2024 MMFM workshop
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments Github: https://github.com/VIM-Bench/VIM_TOOL, Model and Data: https://huggingface.co/VIM-Bench
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG
Comments 22 pages, 16 figures, published to ICML 2024
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI
Comments Accepted to Findings of ACL 2024
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 VLM训练与架构 :LLaVA(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI
Comments CVPR 2024 Workshop on What is Next in Multimodal Foundation Models
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments ICRA 2024
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.AI、cs.LG
Comments Accepted as a spotlight paper to ELVM workshop at CVPR 2024
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.LG
Comments MULA 2024
专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments Code and models are available at https://github.com/dvlab-research/MiniGemini
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments 14 pages, 2 figures, 11 tables
专题命中 VLM训练与架构 :multimodal large language model(title);LLaVA(abstract);MLLM(abstract);分类 cs.CV、cs.LG
专题命中 VLM训练与架构 :visual language model(title);vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI
Comments Working in progress
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG
Comments Accepted to CVPR 2023. Project webpage: https://danielchyeh.github.io/metaper/
ComMem:视觉语言模型测试时自适应的互补记忆系统
机构 * School of Life Sciences, IDG/McGovern Institute for Brain Research, Tsinghua University, Beijing, China(生命科学学院,IDG/麦克戈文脑科学研究院,清华大学,北京,中国) ; Institute of Software Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所,北京,中国) ; Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院,北京,中国) ; Department of Psychological and Cognitive Sciences, Tsinghua University, Beijing, China(心理学与认知科学系,清华大学,北京,中国) ; Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学-博世联合机器学习中心,THBI实验室,BNRist中心,清华大学,北京,中国)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn,comments);分类 cs.AI
AI总结 提出受生物互补记忆系统启发的ComMem方法,通过快速适应细节记忆和慢速整合抽象记忆协同工作,实现视觉语言模型在测试时的跨模态一致自适应,在15个基准数据集上显著优于现有方法。
Comments A brain-inspired complementary memory framework leveraging fast visual caching and slow textual refinement for VLM test-time adaptation
由非残障人士训练的模型:评估图像质量如何影响产品描述生成
机构 * University of California, Irvine(加州大学尔湾分校) ; Northwestern University(西北大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,comments);分类 cs.CV
AI总结 研究评估图像质量对视觉语言模型生成产品描述准确性的影响,发现图像质量下降会导致模型性能显著降低,提出改进模型可靠性的建议。
Comments Published at CHI 2026; Honorable Mention for Best Paper (Top 5%). Dataset available at: https://github.com/Accessibility-Research-Collective-UCI/image-quality-vlm-chi26
LLaVA-OneVision-1.5:面向民主化多模态训练的完全开放框架
机构 * LLaVA-OneVision Community Contributors(LLaVA-OneVision社区贡献者)
专题命中 VLM训练与架构 :LLaVA(title,abstract);vision-language model(abstract);分类 cs.CV
AI总结 LLaVA-OneVision-1.5通过开放框架和高效训练方法实现了多模态模型的低成本高性能训练。
Comments LLaVA-OneVision-1.5 Technical Report
机构 * Adobe Research(Adobe研究院) ; Tel Aviv University(特拉维夫大学)
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV
Comments Project page at: https://shelley-golan.github.io/VLM-Guided-Creative-Generation/
专题命中 VLM训练与架构 :visual language model(title);vision-language model(abstract,comments);VLM(abstract);分类 cs.CV
Comments Disclaimer: This work is part of a course project and reflects ongoing exploration in the field of vision-language models and calorie estimation. Findings and conclusions are subject to further validation and refinement
RoboSeg:基于单眼在手相机的机器人操作的在线部件级语义重建
机构 * School of Mechanical Engineering and Automation, Beihang University(北京航空航天大学机械工程及自动化学院)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract)
AI总结 RoboSeg是无需CAD模型的部件级语义重建系统,结合VLM、TSDF融合与SAM3,实现机器人操作的部件语义索引,在24次物理试验中21次完成综合任务。