VLUE: A Multi-Task Benchmark for Evaluating Vision-Language Models
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.LG
Comments ICML 2022, Benchmark website at https://vlue-benchmark.github.io
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.LG
Comments ICML 2022, Benchmark website at https://vlue-benchmark.github.io
机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学) ; Transcengram ; DeepSeek AI ; University of Hong Kong(香港大学)
专题命中 其他VLM :MLLM(title,abstract);分类 cs.CV
Comments Project page: https://cad-mllm.github.io/
VDC-Agent:当视频详细描述器通过代理自我反思而自我进化
机构 * Xi’an Jiaotong University(西安交通大学) ; Kuaishou Technology(快手科技) ; Shenzhen University of Advanced Technology(深圳先进技术大学)
专题命中 其他VLM :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 VDC-Agent通过自我反思机制实现视频详细描述的自我进化,利用自动生成的(描述,评分)对提升描述准确性与评分表现。
Comments Accepted to ECCV 2026. Project Page: https://vdcagent.github.io
学习选择视觉上下文示例
机构 * University of Cincinnati(辛辛那提大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 其他VLM :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出LSD方法,通过强化学习构建最优演示集,提升多模态大语言模型在视觉回归任务中的表现,揭示了学习选择在视觉上下文学习中的必要性。
Comments 21 pages, 12 figure, accepted to Computer Vision and Pattern Recognition Conference (CVPR) 2026 Findings Track
Journal ref In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (pp. 9455-9465) 2026
HATS:用于多臂数据收集的人-智能体遥操作系统
机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ; Nanyang Technological University(南洋理工大学) ; Imperial College London(帝国理工学院)
专题命中 其他VLM :MLLM(summary_cn,abstract)
AI总结 提出HATS系统,由单操作员借助MLLM智能体控制两主臂和两辅助臂,实现高效多臂数据收集,性能媲美双人专家团队。
ReVis:面向基于图像的可视化可重用性的方法
专题命中 其他VLM :MLLM(summary_cn,abstract)
AI总结 ReVis通过引入领域特定语言和MLLM管道,实现复杂可视化的灵活重用,支持分解与再现,并通过交互界面实现数据更新与编码定制。
ComplexityWorld:面向可验证视觉决策的视觉语言模型基准测试
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV
AI总结 该研究推出COMPLEXITYWORLD基准测试VLMs在可验证视觉决策任务上的表现,发现多数模型在直接推理下验证器接受率不足40%,且存在视觉到决策的瓶颈。
基于动态代码本和多模态大语言模型的文本隐写术
机构 * China Agricultural University(中国农业大学)
专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.AI
AI总结 本文提出一种基于动态代码本和多模态大语言模型的文本隐写术,通过共享会话配置和多模态模型构建动态代码本,设计加密隐写映射并引入反馈优化机制,提升隐写术的安全性和实用性。
ArtECulture:评测多模态大语言模型中的文化条件视觉情感理解
专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV
AI总结 针对现有视觉情感理解方法忽略文化差异的问题,提出ArtECulture基准与检索增强型文化条件情感理解框架,评估多模态大语言模型在该任务上的表现并验证框架的提升效果。
用上下文提示调优个性化你的大型视觉语言模型
机构 * Brown University(布朗大学) ; Columbia University(哥伦比亚大学) ; University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) ; Purdue University(普渡大学) ; Rutgers University(罗格斯大学)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV
AI总结 提出上下文提示调优(ICPT)方法,通过轻量投影模块从多参考图像中提取细粒度视觉语义并转化为连续提示,结合几何正则化解决环境偏差和跨概念干扰,实现高效个性化。
Comments Accepted at ECCV 2026, 27 pages, 10 figures, 5 tables
从像素到提示:视觉-语言模型
机构 * MBZUAI
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.AI
AI总结 本文探讨了视觉-语言模型的发展历程,旨在提供清晰的认知框架,帮助读者理解该领域的核心概念和应用,而非罗列所有数据集和模型变体。
错觉-错觉:视觉语言模型在不存在错觉的地方看到错觉
机构 * Harvard University(哈佛大学)
专题命中 其他VLM :vision language model(title,abstract);分类 cs.CV
AI总结 研究通过给视觉语言模型呈现不应引发处理错误的‘错觉-错觉’,发现许多模型会误将其视为错觉,揭示了模型存在基本处理错误,此失败是文献中更广泛失败的一部分。
Comments 9 pages, 5 figures
VideoChat3:用于高效通用视频理解的全开放视频多模态语言模型
机构 * Nanjing University(南京大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Nanyang Technological University(南洋理工大学) ; Peking University(北京大学)
专题命中 其他VLM :MLLM(title,abstract);分类 cs.CV
AI总结 研究针对视频理解开源模型局限,提出VideoChat3。通过I3D-ViT等提升效率,利用可扩展视频数据合成管道生成训练数据集提升泛化性,以4B参数在多基准测试中超越同等或更多参数的开源模型,实现泛化与计算效率平衡。
MOSAIC:用于高效异构视觉语言模型的自适应层间组合
机构 * LiAuto Inc.(理想汽车公司)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV
AI总结 研究针对视觉语言模型中异构结构依赖手工静态混合模式的问题,提出硬件感知搜索方法MOSAIC,通过多目标混合整数规划确定最优配置,并引入两阶段参数恢复过程,提升了模型推理效率且降低训练成本。
Comments 17 pages, 7 figures
区域感知多模态大语言模型:基于慢快标记化与伪掩码引导的3D CT报告生成
机构 * Department of Convergence Medicine, University of Ulsan College of Medicine, Asan Medical Center, Seoul, Republic of Korea(韩国首尔峨山医疗中心蔚山大学医学院融合医学系) ; University of Ulsan College of Medicine, Seoul, Republic of Korea(韩国首尔蔚山大学医学院) ; Department of Radiology and Research Institute of Radiology, University of Ulsan College of Medicine, Asan Medical Center, Seoul, Republic of Korea(韩国首尔峨山医疗中心蔚山大学医学院放射科与放射学研究所)
专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV
AI总结 提出MedRegion-CT框架,通过区域慢快标记器联合建模全局与细粒度信息、伪掩码引导关注诊断关键区域、结构化病变信息提示,实现高质量CT报告生成,在多项指标上达到最优。
Comments Accepted to ECCV 2026. 15 pages, 8 figures, 4 tables
文化反事实:用反事实示例评估大型视觉语言模型中的文化偏见
机构 * Thoughtworks ; University of Ottawa(Ottawa大学)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV
AI总结 提出文化反事实数据集(近6万张反事实图像),通过图像编辑模型将不同人口特征的人置于真实文化背景中,量化大型视觉语言模型在宗教、国籍和社会经济地位方面的文化偏见。
面向视觉语言模型的多语言训练和评估资源
机构 * Villanova.ai ; Aithlas
专题命中 其他VLM :vision-language model(title);vision language model(abstract);分类 cs.AI
AI总结 本文提出跨五种欧洲语言的视觉语言模型训练与评估资源,通过再生与翻译方法生成高质量多语言数据,验证多语言数据在非英语基准上的有效性。
基于上下文的视觉个性化在视觉-语言模型中
机构 * Department of Electrical and Computer Engineering, Seoul National University, Seoul, South Korea(电气电子工程系,首尔国立大学,首尔,韩国) ; Interdisciplinary Program in Artificial Intelligence, Seoul National University, Seoul, Korea(人工智能交叉学科项目,首尔国立大学,首尔,韩国)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV
AI总结 本文提出了一种基于上下文的视觉个性化方法,通过强化学习和生成增强技术改进视觉-语言模型的个性化图像描述能力,并通过诊断评估验证了模型对视觉上下文的真实利用,展示了CoViP在下游个性化任务中的全面提升。
Comments Accepted at ICML 2026
针对大视觉-语言模型的跨模态提示注入攻击:仅图像扰动
机构 * Xidian University(西安电子科技大学)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV
AI总结 本文提出CrossMPI攻击,通过仅图像扰动实现跨模态提示注入,改进模型隐藏状态空间优化并采用层选择策略与距离递减扰动策略,有效提升攻击性能。
SkyLink:一种由大型视觉-语言模型驱动的跨视图无人机地理定位重排序框架
机构 * Department of Data Science, City University of Hong Kong, Hong Kong(香港城市大学数据科学系) ; Information Systems, City University of Hong Kong, Hong Kong(香港城市大学信息系统系) ; College of Computer Science and Technology, Zhejiang University of Technology, Zhejiang(浙江工业大学计算机科学与技术学院)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV
AI总结 本文提出SkyLink框架,利用大型视觉-语言模型建模无人机与卫星视图间的视觉语义关系,通过引入关系感知损失提升跨视图地理定位的排序效果。
基于原型的测试时间适应性视觉-语言模型
机构 * Key Laboratory of Multimedia Trusted Perception(多媒体可信感知关键实验室) ; Efficient Computing, Ministry of Education of China, Xiamen University, 361005, P.R. China(高效计算,中华人民共和国教育部,厦门大学,361005,中国)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV
AI总结 本文提出基于原型的测试时间适应方法PTA,通过类特定知识原型积累测试样本知识,提高效率并实现跨领域图像识别和点云分析的最优性能。
学习你需要看到的东西:多模态大语言模型的注视注意力
机构 * NAVER AI Lab(NAVER AI实验室)
专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV
AI总结 本文提出Gaze Attention机制,使多模态大语言模型在生成过程中选择性关注任务相关的视觉区域,减少冗余计算并提升聚焦效果,实验表明其在图像和视频理解任务中性能优于密集注意力基线。
层次双子空间解耦用于视觉-语言模型中的持续学习
机构 * School of Electronic Engineering, Xidian University(西电电子工程学院)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV
AI总结 本文提出HDSD框架,通过分解参数空间和结构化参数分解,减少子空间干扰和参数漂移,提升视觉-语言模型持续学习性能。
DIMoE-Adapters:动态专家进化用于视觉语言模型的持续学习
机构 * School of Electronic Engineering, Xidian University(西安电子科技大学电子工程学院)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV
AI总结 本文提出DIMoE-Adapters框架,通过动态专家进化方法平衡持续学习中的稳定性与可塑性,解决多领域任务增量学习中的领域迁移问题。
揭示视觉文本风格对大型视觉语言模型生成的基于属性的描述的影响
机构 * Radboud University(拉博德大学) ; Xi'an Jiaotong University(西安交通大学)
专题命中 其他VLM :visual language model(title,abstract);分类 cs.CV
AI总结 研究视觉文本风格如何影响大型视觉语言模型对概念属性的描述,发现即使正确识别概念,文本风格仍会影响模型输出,推动风格感知评估与缓解。
Comments Accepted by ICMR 2026. Code is available at https://github.com/XiaomengWang-AI/The-Impact-of-Visual-Text-style-on-Attribute-based-Descriptions-Produced-by-LVLMs
个性化工具包:无需训练的大型视觉语言模型个性化
机构 * Toyota Motor Europe(丰田欧洲公司)
专题命中 其他VLM :vision language model(title);vision-language model(abstract);分类 cs.CV
AI总结 本文提出无需训练的LVLM个性化方法,通过预训练视觉基础模型提取特征,结合检索增强生成技术实现多概念个性化,适用于图像和视频。
Comments Accepted at Transactions on Machine Learning Research (TMLR) 2026
从头到神经元:多任务视觉-语言模型中的因果归因与操控
机构 * Tongji University(同济大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV
AI总结 本文提出HONES框架,通过任务相关的注意力头来评估神经元的因果贡献,改进多任务视觉-语言模型中神经元的归因与操控,提升模型性能。
Comments ACL 2026 Findings
一种用于手术时间映射的视觉-语言模型和平台
机构 * Halsted AI
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV
AI总结 本文提出Halsted模型,基于Halsted手术图谱实现手术行为映射,提供更全面且高效的解决方案,并开发Halsted平台使外科医生能自动映射自身手术。
哪些概念需要遗忘以及如何拒绝?分解概念以在大视觉-语言模型中实现持续反学习
机构 * Chung-Ang University(Chung-Ang大学) ; NAVER AI Lab(NAVER AI实验室)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV
AI总结 本文提出一种持续反学习框架,通过分解删除目标中的视觉和文本概念,生成基于细粒度描述的拒绝响应,以提升反学习效果和保持通用性。
Comments Accepted to CVPR 2026
Manual2Skill++: 通过视觉语言模型实现连接器感知的指令手册驱动机器人装配
机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) ; University of Toronto(多伦多大学) ; Zhejiang University(浙江大学) ; Peking University(北京大学)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.AI
AI总结 本文提出Manual2Skill++框架,通过视觉语言模型从指令手册中提取结构化连接信息,构建层次化图表示,实现连接器为核心的装配任务理解与执行。
Journal ref ICRA2026