Affective Faces for Goal-Driven Dyadic Communication
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG
Comments 20 pages, 10 figures, NeurIPS 2022
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
Comments 10 pages included reference, conference
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.LG
Comments Neural Information Processing Systems (NeurIPS) 2022
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Accepted to Findings of EMNLP'22
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Accepted to ACM Multimedia PIES-ME 2022. Code: https://github.com/AIR-DISCOVER/LASST
专题命中 其他VLM :vision language model(abstract);分类 cs.AI、cs.LG
Comments Published as a conference paper at ICLR 2022 (spotlight)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
婴儿通过视觉学习的概念可以促进AI模型中的视觉学习和理解
专题命中 其他VLM :vision-language model(abstract,comments);分类 cs.AI
AI总结 研究探讨婴儿早期视觉学习概念如何促进AI模型学习,通过比较早期概念与标准深度网络模型,发现早期概念提升学习准确性和效率,改善模型表征和泛化能力。
Comments Significantly extended version of earlier work, with additional experiments, expanded discussion and related work, new experiments with human participants, and broader evaluation across multiple vision-language models
RankT2I:一种用于发现文本到图像模型中可解释且多样化语义的子模框架
机构 * Virginia Tech(弗吉尼亚理工大学)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
AI总结 本文提出无训练、模型无关的RankT2I框架,通过子模方法自动发现T2I模型的可编辑语义,性能优于现有方法,可高效获取多领域文本到图像编辑所需的多样化语义。
Comments ECCV 2026
ProFocus:通过渐进式视觉聚焦解释艺术图像中的情感体验
机构 * University of Science and Technology of China(中国科学技术大学) ; Anhui University(安徽大学)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV
AI总结 本研究针对现有方法无法捕捉艺术情感细微线索的问题,提出ProFocus框架,通过层级艺术评论家与渐进式提示融合模块,在ArtEmis数据集上实现了更优的情感识别与解释性能。
用于具身消歧的主动感知
机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) ; Shenzhen Research Institute of Big Data(深圳大数据研究院)
专题命中 其他VLM :vision-language model(abstract);分类 cs.AI
AI总结 该研究针对具身环境中目标歧义问题,提出以主动观测为核心的主动感知框架,结合视觉语言模型实现信息获取与用户意图澄清,经真实机器人实验验证有效。
MASCOT:面向复合属性文本到图像检索的模型感知子模覆盖
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
AI总结 针对现有流形重排序方法在复合属性文本到图像检索的多样性降低任务中早期排名召回率大幅下降的问题,提出MASCOT方法,在PixelProse数据集复合约束任务中表现优于MS-DPP,尤其在排名1后召回率上优势显著。
Comments 21 pages, 4 figures. Accepted at ACM Multimedia 2026 (MM '26), Rio de Janeiro, Brazil. Extended version with full appendices
视觉语言模型(VLMs)在水下图像重建的系统评估中胜出
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
AI总结 本文提出水下图像重建的系统评估流程,评估发现未经过明确物理模型训练的视觉语言模型(VLMs)显著优于基于物理的模型,真实场景图像结果验证了该评估。
MMArt:用于视觉艺术理解的多视角多模态数据集
机构 * University of Amsterdam(阿姆斯特丹大学) ; Amazon AGI(亚马逊AGI) ; College of Business and Economics, University of Johannesburg(约翰内斯堡大学经济与商学院)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
AI总结 针对现有艺术数据集单视角局限,推出含74234幅WikiArt画作的多视角多模态数据集MMArt,通过分析各视角特性证实多视角设计的必要性,为视觉艺术理解提供支撑。
基于模拟响应概率的多模态题目参数估计
机构 * College Board(大学理事会)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI
AI总结 本研究基于Qwen3.5微调多模态大语言模型,利用含图像与文本的多项选择题训练语料,通过学习学生能力相关的选择概率,实现了题目参数的准确估计。
Comments Submitted and Accepted for AIME-Con 2026
智能体驱动的柔性光纤束内窥镜用于体内高分辨率近红外二区(NIR-II)荧光成像
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
AI总结 该研究开发了AI驱动的柔性光纤束内窥镜平台,通过光学-计算协同设计及GAME流水线提升NIR-II成像分辨率,实现体内生物样本高分辨率成像,为临床转化奠定基础。
用于细粒度视频表情识别的基于能量缓存的在线个性化测试时自适应
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
AI总结 针对视频FER的测试时自适应难题,提出EB-CaP方法,通过轻量级能量模型结合CLIP生成个性化缓存,在低开销下优于现有SOTA方法。
一致性存在可计算的盲区:视觉-语言图表阅读的无标签可靠性交换理论
专题命中 其他VLM :vision-language model(abstract);分类 cs.LG
AI总结 该研究提出视觉-语言图表阅读的无标签可靠性交换理论,构建无标签、无需训练的检测器,发布REND-EQUIV数据集,揭示一致性盲区可计算,循环重标记可提升性能,解释排序反转现象。
VLAff:用于统一可操作 affordance 的视觉-语言-affordance 模型
机构 * University of Tokyo(东京大学)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
AI总结 本研究提出 VLAff 模型,结合 EgoAffordance 数据集,解决人类与机器人 embodiment 不匹配问题,实现视觉 affordance 预测及真实机器人零样本操作等应用。
Comments 8 pages, 5 figures. Accepted to IEEE/RSJ IROS 2026. Project page: https://ojh6404.github.io/vlaff/
MDTD-ArtIR:针对纹理叠加退化的艺术图像修复的图像编辑与修复模型基准测试
机构 * Durham University(杜伦大学)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
AI总结 本研究构建MDTD-Art基准及MDTD-Art数据集,对比各类模型,发现图像编辑模型在艺术图像修复中优于专用修复架构,结构化提示可放大其性能优势。
Comments 15 pages, 6 figures, 6 tables. Preprint submitted to Elsevier Journal of Visual Communication and Image Representation
基于富有表现力的机器人头部的自适应人机交互混合注意力估计流程
机构 * Technological University of Uruguay(乌拉圭科技大学) ; Ostfalia University of Applied Sciences(奥斯特法利亚应用科技大学)
专题命中 其他VLM :vision-language model(abstract);分类 cs.AI
AI总结 该研究提出结合几何与语义感知层的混合注意力估计流程,通过有限状态机调节自适应人机交互,经10人40次试验验证其交互启动可靠、暂停行为一致且输出信息非冗余。
用于小样本遥感场景分类的局部一致直推式信息最大化
机构 * ICTEAM, UCLouvain(天主教鲁汶大学 ICTEAM 研究所)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
AI总结 针对小样本遥感场景分类问题,提出LC-TIM方法,融合多源遥感基础模型亲和图,建立首个直推式小样本遥感场景分类基准,实验表明其性能优于现有方法。
Comments Accepted at ECCVW2026
基于指令的图像编辑:数据、模型、评估及应用综述
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV
AI总结 综述基于指令的图像编辑研究,围绕任务定义、数据构建、模型架构、评估指标及商业应用五个维度展开,提出综合深度诊断基准,通过开源方案比较揭示优缺点,探讨未来研究方向以推动该领域发展。
Comments 33 pages, 7 figures, Vicinagearth
Journal ref Zang, X., Jiang, Z., Cheng, J. et al. Instruction-based image editing: a survey on data, models, evaluation, and applications. Vicinagearth 3, 3 (2026)
Indic DiarBench:印度语言的多语言联合语音分离与自动语音识别基准
机构 * Sarvam AI(萨尔瓦姆人工智能公司) ; AI4Bharat, IIT Madras(印度理工学院马德拉斯分校人工智能促进印度发展实验室)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI
AI总结 介绍涵盖印度22种在册语言的Indic DiarBench基准数据集,含约108小时多说话者音频,经人工校正注释。通过评估领先系统建立基线,该数据集作为开放资源推动印度语言多语言语音技术研究。
Comments 5 pages, 2 figures, Interspeech 2026 conference
VlogReward:学习用于Vlog编辑的多维评估
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI
AI总结 针对Vlog评估主观性强且缺乏标准等问题,提出VlogReward模型。通过专业指导定义评估框架,构建数据集和基准,增强GRPO框架。该模型能提供多维分数与反馈,优于现有MLLMs,助力Vlog创作者及自动化评估完善系统。
Comments ICML 2026
基于智能识别与生成的电子元件符号与引脚封装数据库
机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波数字孪生研究院,东方理工大学) ; Shanghai Jiao Tong University(上海交通大学) ; BTD Technology(BTD科技)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI
AI总结 研究利用多模态大语言模型开发电子元件符号和引脚封装智能识别与生成流程SFgen,其符号生成准确率86%,引脚封装生成准确率80%,并用此创建含1000个元件的SFnet数据库,为PCB设计自动生成奠定基础。
Comments Accepted by PRCV 2025
多模态大模型中可靠性优先的细粒度生成
机构 * Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science & Technology, Beijing Institute of Technology(北京智能信息科技重点实验室,计算机科学与技术学院,北京理工大学) ; Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University(广东机器感知与智能计算实验室,深圳MSU-BIT大学) ; Department of Electrical and Computer System Engineering, Monash University(电子与计算机系统工程系,莫纳什大学)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV
AI总结 针对多模态大模型细粒度生成易出错的问题,提出GranFact基准和层次感知评估算法,并基于直接偏好优化提出可靠性优先的偏好优化方法,提升细粒度生成同时保持可靠性。
Comments Equal contribution: Xiaomeng Fan and Wu Wei. Corresponding authors: Zhi Gao and Yunde Jia
MOSS 语音转录与说话人识别技术报告
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI
AI总结 MOSS转录与识别通过端到端多模态大语言模型,实现了说话人属性化和时间戳化的转录,解决了现有系统在上下文窗口、长距离说话人记忆和时间戳输出方面的不足。