arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-17 至 2026-08-17 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 3 篇

2608.14226 2026-08-17 cs.CV 新提交 57%

RankT2I: A Submodular Framework for Discovering Interpretable and Diverse Semantics in Text-to-Image Models

RankT2I:一种用于发现文本到图像模型中可解释且多样化语义的子模框架

Ritika Allada, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文提出无训练、模型无关的RankT2I框架,通过子模方法自动发现T2I模型的可编辑语义,性能优于现有方法,可高效获取多领域文本到图像编辑所需的多样化语义。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13974 2026-08-17 cs.CV 新提交 57%

ProFocus: Interpreting Affective Experience in Artistic Images with Progressive Visual Focusing

ProFocus:通过渐进式视觉聚焦解释艺术图像中的情感体验

Zhiyan Zhang, Zicheng Yan, Jianqi Chen, Peipei Song, Shanshan Wang, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) Anhui University(安徽大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 本研究针对现有方法无法捕捉艺术情感细微线索的问题,提出ProFocus框架,通过层级艺术评论家与渐进式提示融合模块,在ArtEmis数据集上实现了更优的情感识别与解释性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13605 2026-08-17 cs.AI cs.RO 新提交 57%

Active Perception for Embodied Disambiguation

用于具身消歧的主动感知

Yiwei Liu, Luwei Yang

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) Shenzhen Research Institute of Big Data(深圳大数据研究院)

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

AI总结 该研究针对具身环境中目标歧义问题,提出以主动观测为核心的主动感知框架,结合视觉语言模型实现信息获取与用户意图澄清,经真实机器人实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏