Test-Time Prompt Tuning for Zero-Shot Generalization in Vision-Language Models
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV
Comments NeurIPS 2022
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV
Comments NeurIPS 2022
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV
Comments To appear in CVPR 2022
专题命中 其他VLM :visual language model(title,abstract);分类 cs.CV
Comments Accept by ICCV2021
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV
Comments accepted by NAACL 2021
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV
专题命中 其他VLM :vision language model(title,abstract)
Comments Peinl, René; Tischler, Vincent (2025): Benchmarking Vision Language Models on German Factual Data. 21st International Conference on Artificial Intelligence Applications and Innovations, 26-29 June, 2025, Limassol, Cyprus (accepted)
大型语言模型在结直肠息肉光学诊断中的性能
专题命中 其他VLM :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本研究评估Claude Opus 4等5款大型语言模型对结直肠息肉的光学诊断性能,发现其区分息肉亚型的准确率接近专家共识,但灵敏度与特异度未达ESGE标准,需进一步研究方可临床应用。
Comments 22 pages, 1 figure, 5 tables
属性应来自图像,而非类名:视觉语言模型的分布条件属性选择
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 其他VLM :vision-language model(title);分类 cs.CV、cs.AI、cs.LG
AI总结 研究视觉语言模型可解释零样本分类,指出基于类名的描述符视觉证据不足。提出从目标图像集选属性的方法,该方法提升了准确率,性能优于CoOp,用时短,所选属性还能描述数据分布,是一种有效的分布条件属性选择策略。
Comments Accepted at the PFATCV Workshop, ECCV 2026. Project page: https://ggare-cmu.github.io/AttributeSelect/
社交机器人眼中的世界——用视觉语言模型增强人机对话
机构 * Institute of Information Systems, University of Lübeck(信息系统研究所,吕贝克大学)
专题命中 其他VLM :vision language model(title,abstract)
AI总结 研究探讨如何用视觉语言模型增强人机对话,通过将米斯特拉尔人工智能语言模型与胡椒机器人结合用于人机交互对话,并研究视觉信息对响应时间的影响,发现纳入视觉信息可增添对话背景,且使用欧洲托管的语言模型便于实际应用。
GePBench:评估多模态大语言模型的基础几何感知能力
机构 * University of Science and Technology of China(中国科学技术大学) ; Tsinghua University(清华大学)
专题命中 其他VLM :multimodal large language model(title,abstract)
AI总结 提出GePBench基准,系统评估多模态大语言模型的几何形状识别与空间关系感知能力,发现现有模型存在显著缺陷,而基于该基准训练可提升下游任务性能。
基于MLLM的按需教学材料提供代理用于辅导支持
专题命中 其他VLM :MLLM(title);multimodal large language model(abstract)
AI总结 本文提出基于多模态大语言模型的代理,用于在一对一辅导中按需提供教学材料,通过分析对话自动检索相关图片,实验显示检索时间减少44.4秒,85.7%的试次提供可接受质量的图片。
Comments The 20th International Conference on E-Service and Knowledge Management (ESKM 2025)
Exp-Force:基于视觉-语言模型的经验条件预抓取力选择
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 其他VLM :vision-language model(title,abstract)
AI总结 Exp-Force通过经验条件框架利用视觉-语言模型实现基于单张图像的预抓取力选择,显著提升了抓取力的准确性和可靠性。
提升计算能力缓解视觉语言模型中的冲突
专题命中 其他VLM :vision language model(title,abstract)
AI总结 本研究发现视觉语言模型通过增加计算资源能更有效解决冲突,展示了大规模神经网络中的优化动态如何产生类人认知控制。
何时以及如何将多模态大语言模型整合到大学生心理治疗中:来自多利益相关者的视角
专题命中 其他VLM :multimodal large language model(title);MLLM(abstract)
AI总结 本研究探讨了多模态大语言模型在大学生心理治疗中的整合时机与方式,指出其作为辅助工具的作用,并揭示了用户接受度受社交身份和相对地位影响的关键因素。
视觉能否取代文本在工作记忆中的作用?来自视觉-语言模型中空间n-Back任务的证据
机构 * Southeast University(东南大学) ; Shanghai Jiao Tong University(上海交通大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 其他VLM :vision-language model(title,abstract)
AI总结 研究通过空间n-Back任务评估视觉-语言模型中视觉与文本对工作记忆的影响,发现文本条件下的表现优于视觉条件,揭示了视觉信息处理中的计算差异。
机构 * Bielefeld University(比勒菲尔德大学)
专题命中 其他VLM :multimodal large language model(title,abstract)
Comments To appear in ACL Findings 2025
Journal ref Findings of the Association for Computational Linguistics: ACL 2025, pp. 24101-24109
专题命中 其他VLM :MLLM(title);multimodal large language model(abstract)
专题命中 其他VLM :vision-language model(title,abstract)
专题命中 其他VLM :multimodal large language model(title,abstract)
机构 * Computer Science, Tennessee Tech University(田纳西科技大学计算机科学系) ; Computer Science, Vanderbilt University(范德比大学计算机科学系)
专题命中 其他VLM :vision language model(title);vision-language model(abstract)
机构 * Ghent University–imec(根特大学–imec)
专题命中 其他VLM :vision-language model(title,abstract)
Comments Accepted at the workshop "Human - Foundation Models Interaction: A Focus On Multimodal Information" (FoMo-HRI) at IEEE RO-MAN 2025 (Camera-ready version)
专题命中 其他VLM :vision-language model(title,abstract)
Comments 11 pages
机构 * University of Tartu(塔尔图大学) ; University of Ljubljana(卢布尔雅那大学) ; Sansan, Inc.(Sansan公司) ; Plaksha University(Plaksha大学)
专题命中 其他VLM :vision-language model(title,abstract)
机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI)、中国电信) ; Northwestern Polytechnical University(西北工业大学) ; Beijing Jiaotong University(北京交通大学) ; Nanjing University(南京大学)
专题命中 其他VLM :multimodal large language model(title,abstract)
专题命中 其他VLM :multimodal large language model(title,abstract)
Comments 57 pages, 17 figures
专题命中 其他VLM :multimodal large language model(title,abstract)
专题命中 其他VLM :vision-language model(title,abstract)
专题命中 其他VLM :vision language model(title);分类 cs.CV、cs.AI、cs.LG
专题命中 其他VLM :vision-language model(title);分类 cs.CV、cs.AI、cs.LG
专题命中 其他VLM :vision language model(title,abstract)