Embodied Multi-Modal Agent trained by an LLM from a Parallel TextWorld
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments Accepted by CVPR 2024
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments Accepted by CVPR 2024
专题命中 VLM训练与架构 :VLM(abstract);visual language model(abstract);分类 cs.CV
Comments project page: https://zhangsha1024.github.io/Agent3D-Zero/
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments 8 Pages, visual instruction tuning
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.LG
专题命中 VLM训练与架构 :VLM(abstract);visual language model(abstract);分类 cs.AI
专题命中 VLM训练与架构 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments Accepted to NeurIPS 2023. Website: https://wysiwyr-itm.github.io/
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments Accepted in ACM ICVGIP 2023
专题命中 VLM训练与架构 :vision-language model(abstract);MLLM(abstract);分类 cs.AI
Comments work in progress. Code and data will be available at https://github.com/hkust-vgd/MarineGPT
专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV
Comments Preprint
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments Fix dataset url: https://huggingface.co/datasets/MMInstruction/M3IT Project: https://m3-it.github.io/
专题命中 VLM训练与架构 :VLM(abstract);visual language model(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments To appear at CVPR 2023
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
专题命中 VLM训练与架构 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV
Comments EMNLP 2022
专题命中 VLM训练与架构 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV
Comments 18 pages
专题命中 VLM训练与架构 :visual question answering(abstract);grounding(abstract);分类 cs.CV
Comments ECCV 2022
专题命中 VLM训练与架构 :LLaVA(abstract,comments);分类 cs.CV、cs.AI、cs.LG
Comments Camera ready, CVPR 2024 (highlight). LLaVA project page: https://llava-vl.github.io
专题命中 VLM训练与架构 :LLaVA(abstract,comments);分类 cs.CV、cs.AI、cs.LG
Comments NeurIPS 2023 Oral; project page: https://llava-vl.github.io/
EATR-Stereo:面向人形机器人视觉-语言-动作控制的具身感知配对立体证据路由
机构 * Harbin Institute of Technology(哈尔滨工业大学)
专题命中 VLM训练与架构 :grounding(abstract,abstract_cn)
AI总结 EATR-Stereo是具身感知的令牌路由框架,在冻结预训练VLA模型的前提下,通过选择性路由配对立体证据,提升了人形机器人长时程视觉-语言-动作控制的任务成功率。
Comments 8 pages, 5 figures
用于胎儿脑室体积测量与异常筛查的跨模态超声-MRI学习
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本研究提出跨模态学习框架VIFBA,基于超声视频实现胎儿脑室体积预测、VM严重程度分类及非VM异常筛查,性能优于基线与现有模型,为产前脑筛查提供实用方案。
Comments 17 pages, 11 figures, 6 tables
更智能地记忆:用于机器人记忆的视觉历史压缩器与双曲经验空间
机构 * Xidian University(西安电子科技大学)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn)
AI总结 该研究提出即插即用模块 RS,通过双分支结构压缩视觉历史并组织经验,适配 pi0 后显著提升机器人任务成功率,在真实机器人实验中表现优异。
Comments 19 pages, 7 pages
多介质重排序:一种基于用户满意度的LLM重排序框架用于多介质搜索
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn)
AI总结 本文提出Rich-Media Re-Ranker框架,通过多维细粒度建模提升用户搜索满意度,整合丰富侧信息和视觉信号,通过多任务强化学习增强系统适应性,实验证明其优于现有方法。
Comments Accepted by the Full Research Track of CIKM-2026
jina-embeddings-v5-omni: 通过锁定对齐塔实现几何保持嵌入
机构 * Jina by Elastic(Jina 由 Elastic 公司)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn)
AI总结 本文提出GELATO方法,通过冻结对齐塔实现多模态嵌入,生成统一语义空间,训练效率高且保持文本嵌入一致性。
Comments 11 pages, 9 figures, 5 tables
LLM智能体能够查看代码仓库
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract_cn)
AI总结 研究多模态大语言模型在仓库级问题解决中利用视觉表示的效果,发现纯视觉方案降低精度,而结合视觉结构图可减少26%输入token并保持或提升精度。
Comments Accepted by ASE 2026. Our code and data are available at https://github.com/cslsolow/SeeRepo
MODUS:仅解码器的多模态任意到任意建模
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 研究任意到任意多模态建模,提出仅解码器的对称多模态建模方法Modus,无需特定模态组件,支持多种应用,在各基准测试中用单模型展现强大性能且与基线竞争,材料开源。
Comments Accepted at ICML 2026. Project page: https://modus-multimodal.epfl.ch
ReVision:一种基于视觉的后处理技术,用于在图像生成管道中替换不可接受的概念
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn)
AI总结 ReVision是一种无需训练的后处理框架,通过视觉模型检测并替换图像生成中不安全的概念,提升安全性与生成质量。