Real-World Robot Applications of Foundation Models: A Review
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 其他VLM :visual language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 12 pages, 5 tables and 9 figures
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Project website: https://sites.google.com/view/evaltasks
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted to ICPR 2024, CVPR workshops 2024
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract)
专题命中 其他VLM :MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Ongoing work. 21 pages. Related materials are continually maintained and available at https://github.com/modelscope/data-juicer/blob/main/docs/awesome_llm_data.md
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted to COLM 2024
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted for publication at ECCV24
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Accepted by ACL 2024 (Findings) - Scores: Soundness - 4/4/4, Dataset - 4/4/4, Overall Assessment - 4/3.5/3.5, Meta - 4
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments In Proceedings of the European Conference on Computer Vision (ECCV), 2024
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 31 pages, 13 figures, 14 tables; We add results of GPT-4o in this version
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments 30 pages, 30 figures
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Project website at https://f3rm.csail.mit.edu, Accepted at the 7th Annual Conference on Robot Learning (CoRL), 2023 in Atlanta, US
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments project page: https://aleafy.github.io/alpha-clip code: https://github.com/SunzeY/AlphaCLIP
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments ACL 2023
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Project site: https://clear-benchmark.github.io
基于几何知识蒸馏的时序锚定组合式相机运动理解
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Tencent(腾讯)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本研究提出CamDistill方法,通过几何知识蒸馏实现时序锚定的组合式相机运动理解,推出含4229个片段的CamChoreo基准,提升了相机运动识别的细粒度与效率。
保持简洁:用于超长视频理解的多键情景记忆检索
机构 * Yonsei University(延世大学) ; Adobe Research(奥多比研究院)
专题命中 其他VLM :MLLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 针对超长视频理解的两阶段范式需求,提出MERIT框架,通过多键表示与按需时间扩展实现精准检索,在三个长视频基准数据集上取得最优性能。
Comments Accepted to ECCV 2026 (Oral). Project Page: https://choi-yeeun.github.io/MERIT/
面向连贯性的梦境场景可视化
机构 * School of Electronic Engineering and Computer Science, Queen Mary University of London(伦敦玛丽女王大学电子工程与计算机科学学院)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 该研究提出DSV系统,通过大型语言模型拆分梦境描述为四部分,结合文本到图像模型生成连贯的四面板图像序列,经DreamBank数据集50次可视化评估,用CLIP等模型指标验证了其质量、保真度与连贯性。
Comments short paper accepted at ICCC 2026
SAGE:计算病理学中基于注意力的生存模型的语义可解释性
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 该研究提出SAGE框架,可从ABMIL模型提取全局语义解释,在7个TCGA癌症队列的生存预测中恢复预后特征,揭示癌症特异性生物学,为病理学家解释模型行为提供支持。
Comments Proceedings of the MICCAI Workshop on Interpretability of Machine Intelligence in Medical Image Computing (iMIMIC)
面向视频理解的覆盖驱动型自适应关键帧选择
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文针对视频理解中LVLM处理大量帧计算开销大的问题,提出无需训练的CSES关键帧选择器,通过覆盖驱动的自适应策略减少需评分和选择的帧数量,同时保持准确率并提升选择速度。
Theia:用于无数据蒸馏的Incidents1M数据集的大规模多模态字幕生成与自动验证
机构 * Università Politecnica delle Marche(马尔凯理工大学)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本研究针对灾害领域多模态数据集的缺陷,提出方法构建并自动验证Incidents1M数据集,生成高保真字幕,其语义一致性达78.65/100,为跨模态知识蒸馏提供了可扩展框架。
整体最优标签选择用于在部分标签下的鲁棒提示学习
机构 * Shandong University, Jinan, China(山东大学(济南,中国))
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 本文提出Holistic Optimal Label Selection方法,通过局部密度过滤和全局最优传输策略,提升部分标签下的提示学习性能,实验表明其在八个基准数据集上表现优异。
Comments ECCV 2026