GazeMoE: Perception of Gaze Target with Mixture-of-Experts
GazeMoE:基于专家混合的注视目标感知
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 GazeMoE通过MoE模块结合多模态线索,实现对注视目标的高精度识别,优于现有方法。
Comments 8 pages, 3 figures, ICRA 2026
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
GazeMoE:基于专家混合的注视目标感知
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 GazeMoE通过MoE模块结合多模态线索,实现对注视目标的高精度识别,优于现有方法。
Comments 8 pages, 3 figures, ICRA 2026
MAP: 通过地图级注意力处理缓解大视觉-语言模型中的幻觉
机构 * DAIL Tech(DAIL科技)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 MAP通过地图级注意力处理提升大视觉-语言模型的事实一致性与性能。
Vision-Zero: 通过战略化游戏化自play实现可扩展的VLM自改进
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 Vision-Zero通过战略化游戏化自play框架,实现无标注数据下的多模态模型自改进,提升推理与跨领域任务性能。
Comments ICLR 2026
CAPT:基于混淆的提示微调以减少视觉-语言不一致
机构 * School of Information Engineering, Minzu University of China(中国民族大学信息工程学院) ; School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) ; National Library of China, Beijing, China(中国国家图书馆) ; School of Cyberspace Security, Beijing University of Posts and Telecommunications(北京邮电大学网络安全学院)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 CAPT通过引入混淆感知的提示微调框架,有效减少视觉-语言模型中的混淆误差,提升模型判别能力和泛化性能。
Comments Accepted by CVPR2026
Self-Aug: 用于大视觉-语言模型的查询和熵自适应解码
机构 * Arizona State University(亚利桑那州立大学) ; Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔兰根-纽伦堡弗里德里希-亚历山大大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本研究提出Self-Aug,一种无需训练的解码策略,通过自增强提示和自适应阈值算法提升大视觉-语言模型的事实一致性。
Comments 10 pages, accepted to ICLR 2026
ClinCoT:面向医学视觉语言模型的临床感知视觉推理链
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; East China Normal University(东华大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 ClinCoT通过引入临床感知的视觉推理链框架,提升医学视觉语言模型在临床决策中的事实性支撑与多模态推理能力。
CaptionFool: 针对最新Transformer图像描述模型的通用图像描述模型攻击
机构 * Intuit
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
AI总结 CaptionFool通过修改少量图像块,成功生成任意目标描述,揭示了视觉-语言模型的安全漏洞。
ChainMPQ: 交错文本图像推理链用于缓解关系幻觉
机构 * University of Queensland(昆士兰大学) ; University of California, Merced(加州大学梅尔德分校) ; Ant Group(蚂蚁集团)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 ChainMPQ通过交错文本和图像推理链,利用积累的记忆减少大型视觉语言模型的关系幻觉,提升关系推理能力。
Comments Accepted by ICLR2026
可解释的视觉-语言模型社会公平性偏见消除
机构 * KAIST AI(韩国科学技术院人工智能研究所) ; University of Copenhagen(哥本哈根大学) ; NVIDIA(英伟达公司)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本研究提出DeBiasLens框架,通过稀疏自编码器局部化VLM中的社会属性神经元,以可解释的方式消除模型中的社会偏见,同时保持语义知识。
Comments 25 pages, 30 figures, 13 Tables Accepted to CVPR 2026
Dyslexify: 一种针对CLIP中印刷攻击的机制性防御
机构 * Fraunhofer Heinrich Hertz Institute(弗劳恩霍夫海因里希·赫兹研究所) ; University of Oxford(牛津大学) ; Technological University Dublin(都柏林技术大学) ; Technische Universität Berlin(柏林技术大学)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 Dyslexify通过消融CLIP中的印刷电路,有效防御印刷攻击,提升性能并保持应用安全性。
无偏切片Wasserstein核用于高质量音频描述生成
机构 * Monash University(墨尔本大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.AI、eess.AS
AI总结 本文提出无偏切片Wasserstein核,通过保留模态间时间信息,提升音频描述质量及推理能力。
Journal ref Manh Luong. (2025). Unbiased Sliced Wasserstein Kernels for High-Quality Audio Captioning. In Advances in Neural Information Processing Systems 38 (NeurIPS 2025)
MedCLIPSeg: 基于概率视觉语言适应的数据高效且可泛化的医学图像分割
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL
AI总结 MedCLIPSeg通过概率视觉语言适应方法,提升医学图像分割的数据效率和泛化能力,提供可解释的不确定性图。
Comments CVPR 2026; Project Page: https://tahakoleilat.github.io/MedCLIPSeg
Mantis:一种具有解耦视觉前瞻性能力的多功能视觉-语言-动作模型
机构 * SJTU(上海交通大学) ; SII(上海信息所) ; SUSTech(四川大学) ; NJUPT(南京工业大学) ; FDU(福建大学) ; BOSCH(博世)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
AI总结 Mantis通过解耦视觉前瞻性模块提升视觉-语言-动作模型的性能,实现高成功率和快速收敛。
为印度设计生产级OCR:多语言和领域特定系统
机构 * Krutrim AI
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出两种多语言OCR训练策略,通过Chitrapathak系列在印度多语言文档中实现SOTA性能,并展示了Parichay在政府文档中的高效提取能力。
语言引导的视觉-语言模型不变性探测
机构 * Department of Computer Science, Purdue University(普渡大学计算机科学系)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
AI总结 本文提出LGIP基准,用于评估视觉-语言模型对语言扰动的鲁棒性,发现EVA02-CLIP和OpenCLIP表现优异,而SigLIP存在显著缺陷。
Comments Pattern Recognition Letters 2026
利用LLaVA框架实现波兰语视觉-语言模型的高效标注
机构 * NASK National Research Institute(国家研究机构NASK)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 本文提出利用LLaVA框架高效适应波兰语的视觉-语言模型,通过自动化翻译和合成数据提升多模态模型性能。
大规模电商理解中的视觉-语言模型适应
机构 * eBay Inc.(eBay公司) ; University of Amsterdam(阿姆斯特丹大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出了一种方法,通过大规模实验研究,展示如何通过针对性适应通用视觉-语言模型以提升电子商务性能,同时保持多模态能力,并提出新的评估套件。
代理拼图交互学习:提升视觉感知与推理能力在视觉-语言模型中
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; East China Normal University(华东师范大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 AGILE通过代理拼图交互学习提升视觉-语言模型的感知与推理能力,显著提高拼图任务性能并增强多模态模型的泛化能力。
一种用于零样本临床协作和皮肤病自动概念发现的视觉-语言基础模型
机构 * AIM for Health Lab(AIM for Health实验室) ; Faculty of Information Technology, Monash University(信息技术学院,墨尔本大学) ; Department of Dermatology, Medical University of Vienna(皮肤科,维也纳医学大学) ; Faculty of Engineering, Monash University(工程学院,墨尔本大学) ; Institute of Ophthalmology, University College London(眼科研究所,伦敦大学学院) ; Dermatology Department. Fundacion Hospital 12 de Octubre(皮肤科部门,12月12日基金会医院) ; School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) ; Frazer Institute, The University of Queensland(弗拉泽研究所,昆士兰大学) ; Dermatology Research Centre, Brisbane, Australia(皮肤科研究中心,澳大利亚布里斯班) ; Department of Medical and Cardiovascular Sciences, Sapienza University of Rome(医学与心血管科学系,罗马萨皮恩扎大学) ; Victorian Melanoma Service, Alfred Care Group, Bayside Health, Melbourne, Australia(维多利亚黑色素瘤服务,阿尔弗雷德护理集团,墨尔本布里斯班健康中心,澳大利亚) ; SkIIN Discovery Program, Monash University(SkIIN发现计划,墨尔本大学) ; Claude Bernard Lyon-1 University(克劳德·伯纳德里昂-1大学) ; Centre Léon Berard, Lyon, France(莱昂·贝拉德中心,法国里昂) ; Dermatology department, Hôpital Lyon Sud, Hospices Civils de Lyon, Lyons, France(皮肤科部门,里昂南医院,里昂民事医院,法国里昂) ; Cancer Research Center of Lyon, Lyons, France(里昂癌症研究中心,法国里昂) ; eResearch Centre, Monash University(eResearch研究中心,墨尔本大学) ; NVIDIA AI Techno(NVIDIA AI技术)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 DermFM-Zero是一种用于皮肤病零样本临床协作和自动概念发现的视觉-语言基础模型,通过掩码潜在建模和对比学习训练,实现了无需任务特定适应的高精度诊断和多模态检索能力。
Comments reports
SHIELD:通过偏差和脆弱性防御抑制LVLM编码器中的幻觉
机构 * Department of Electrical and Computer Engineering, Northeastern University(电气与计算机工程系,东北大学) ; Khoury College of Computer Science, Northeastern University(计算机科学学院,东北大学)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 SHIELD通过减少统计偏差、对抗固有偏差和解决脆弱性,有效抑制LVLM编码器中的对象幻觉。
Comments ICLR 2026
STELAR-VISION:基于拓扑意识的高效学习以实现对齐推理
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 STELAR-VISION通过拓扑意识训练框架提升视觉-语言模型的推理准确性和效率,实现更高效的多模态任务处理。
Comments This paper has been accepted at AAAI 2026. This is the author's extended version. The final version will appear in the official proceedings
了解“不”:一种数据驱动的方法用于增强CLIP中的否定意识
机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电子与计算机工程系) ; Amazon(亚马逊) ; Samsung Research(三星研究院) ; School of Computer Science and Engineering, Soongsil University(顺天大学计算机科学与工程学院) ; IPAI, AIIS, ASRI, INMC, and ISRC, Seoul National University(首尔国立大学IPAI、AIIS、ASRI、INMC和ISRC)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 本文提出NegationCLIP,通过生成包含否定的数据增强CLIP的否定意识,同时提出NegRefCOCOg基准用于评估多模态模型的否定理解能力。
Comments Accepted to ICCV 2025
Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2025, pp. 2825-2835
CoTZero:通过分层合成CoT实现无标注的人类级视觉推理
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong MMLab(香港中文大学 MMLab) ; The College of Computer Science and Technology(计算机科学与技术学院) ; Nanjing University of Aeronautics and Astronautics(南京航空航天大学)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI
AI总结 CoTZero通过双阶段数据合成和认知对齐训练,实现无标注的人类级视觉推理,提升模型的层次推理和泛化能力。
Comments 16 pages 6 figures
无需人工标注的预训练视觉-语言模型微调
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ; Institute of Perceptual Intelligence, Peng Cheng Laboratory(感知智能研究院,鹏城实验室) ; Peking University Shenzhen Graduate School, Peking University(北京大学深圳研究生院,北京大学)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 CoFT通过双模型跨模态协作机制和双提示学习策略,在无需人工标注的情况下提升预训练视觉-语言模型的下游任务适应能力。
超越视觉编码器:识别和缓解大视觉-语言模型中的空间偏差
机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳学院) ; Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 本文提出AGCI机制,通过动态注入全局视觉上下文缓解大视觉-语言模型中的空间偏差问题,提升模型的空间鲁棒性和下游任务表现。
Decipher-MR:一种用于3D MRI表示的视觉-语言基础模型
机构 * GE Healthcare(通用电气医疗)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 Decipher-MR是一种专门针对3D MRI的视觉-语言基础模型,通过自监督学习和报告引导的文本监督,实现对多种医学任务的高效支持。
迈向通用且可迁移的视觉-语言模型劫持攻击
机构 * School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算机与信息系) ; School of Computing and Information Systems, Singapore Management University, Singapore(新加坡管理大学计算机与信息系) ; School of Information Technology, Deakin University, Australia(德肯大学信息科技系) ; Institute of Trustworthy Embodied AI, Fudan University, China(复旦大学可信具身人工智能研究所)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出UltraBreak,一种通用且可迁移的视觉-语言模型劫持攻击框架,通过视觉正则化和语义引导的文本监督,有效提升攻击的泛化能力和转移性能。
Comments ICLR 2026
NAP-Tuning: 用于对抗鲁棒视觉-语言模型的神经增强提示微调
机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) ; Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(复旦大学计算机学院智能信息处理重点实验室) ; Department of Mathematics and Applications, University of Naples Federico II(那不勒斯费德里克二世大学应用数学系) ; State Key Laboratory of Advanced Rail Autonomous Operation, Beijing Jiaotong University(北京交通大学先进轨道交通自主运行国家重点实验室)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 NAP-Tuning通过神经增强框架提升视觉-语言模型的对抗鲁棒性,实现多模态提示微调和特征净化,显著提升模型在对抗攻击下的性能。
HueManity: 探索 MLLMs 中的细粒度视觉感知
机构 * Google(谷歌) ; Waymo
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 HueManity 通过细粒度视觉感知基准测试揭示 MLLMs 在捕捉细粒度视觉细节方面的显著缺陷。
Journal ref ICML 2025 Workshop on Assessing World Models
文本就是视觉-语言模型劫持所需
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 Text-DJ通过将文本转换为图像并诱导干扰,成功绕过视觉-语言模型的安全防护,揭示了OCR能力在面对分散多模态输入时的脆弱性。