Deep But Reliable: Advancing Multi-turn Reasoning for Thinking with Images
深度但可靠:提升图像思考的多轮推理
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 DRIM通过多阶段流程提升图像思考的多轮推理能力,通过冗余惩罚策略优化实现自我反思的推理模式,从而在视觉理解任务中取得优越表现。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
深度但可靠:提升图像思考的多轮推理
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 DRIM通过多阶段流程提升图像思考的多轮推理能力,通过冗余惩罚策略优化实现自我反思的推理模式,从而在视觉理解任务中取得优越表现。
通过基于大语言模型的嵌入器实现渐进式视觉-语言对齐的ProCLIP
机构 * Shanghai Jiao Tong University(上海交通大学) ; Beijing Institute of Technology(北京理工大学) ; DeepGlint(深图科技) ; Beijing University of Technology(北京工业大学) ; Tsinghua University(清华大学)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
AI总结 ProCLIP通过课程学习逐步对齐CLIP图像编码器与基于大语言模型的嵌入器,提升长文本处理和多语言理解能力。
Comments 17 pages, 5 fiugres
语义锚点传输:面向视觉-语言模型的鲁棒性测试时间适应
机构 * LIVIA, ÉTS Montréal, Canada(LIVIA,蒙特利尔ÉTS,加拿大) ; International Laboratory on Learning Systems (ILLS), McGILL - ETS - MILA - CNRS - Université Paris-Saclay - CentraleSupélec, Canada(学习系统国际实验室(ILLS),麦吉尔大学-ÉTS-MILA-CNRS-巴黎-萨克雷大学-中央超导大学,加拿大)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
AI总结 语义锚点传输通过生成伪标签和多模板蒸馏方法,提升视觉-语言模型在分布偏移下的鲁棒性与计算效率。
Comments Added additional figures to communicate the algorithm
需要多少数据?在低维结构下生成式与视觉-语言模型的统一收敛界限
机构 * Stevens Institute for Neuroimaging and Informatics, University of Southern California(神经影像与信息学研究所,南加州大学)
专题命中 图文多模态 :image-text(abstract);分类 cs.AI
AI总结 研究在低维结构下生成式和视觉-语言模型的统一收敛界限,探讨数据量与模型校准之间的关系。
Comments 13 pages, 2 figures
本地大语言模型和视觉-语言模型的扩展定律
机构 * Multiverse Computing ; Donostia International Physics Center ; Ikerbasque Foundation for Science ; Multiverse Computing, Centre for Social Innovation
专题命中 图文多模态 :multimodal(abstract);分类 cs.AI
AI总结 研究揭示了本地大语言模型和视觉-语言模型在中央处理单元上的计算扩展定律,并展示了量子启发压缩在降低能耗和资源消耗方面的效果。
UniPercept:迈向跨美学、质量、结构和纹理的统一感知级图像理解
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Peking University(北京大学) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学) ; Nanjing University(南京大学) ; Sun Yat-sen University(中山大学) ; Tele-AI Website(Tele-AI网站)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 UniPercept通过领域自适应预训练和任务对齐强化学习,实现跨美学、质量、结构和纹理的统一感知级图像理解,优于现有多模态大语言模型。
Comments 27 pages, 14 figures, 17 tables
VisRes Bench: 关于评估视觉语言模型的视觉推理能力
机构 * Technology Innovation Institute, Abu Dhabi, UAE(阿布扎比技术创新研究所) ; Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 VisRes Bench通过三个层次评估VLMs的视觉推理能力,揭示其在复杂任务中的局限性,并为多模态研究提供统一框架。
面向高效视觉语言模型推理的输入自适应视觉预处理
机构 * Faculty of Computer Science, University of Brawijaya(计算机科学学院,布拉维亚大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本研究提出一种自适应视觉预处理方法,通过动态调整输入分辨率和空间覆盖,显著提升视觉语言模型的推理效率。
引导视觉-语言预训练模型进行增量面部呈现攻击检测
机构 * School of Computer Science, China University of Geosciences(中国地质大学(北京)计算机科学学院) ; State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(中国科学院人工智能安全重点实验室) ; University of China Academy of Sciences(中国科学院大学) ; Center for Machine Vision and Signal Analysis, University of Oulu(奥卢大学机器视觉与信号分析中心) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
AI总结 SVLP-IL是一种基于视觉-语言预训练模型的增量学习框架,通过多方面提示和选择性弹性权重固化方法,在隐私合规的前提下提升面部呈现攻击检测的鲁棒性。
IndoorUAV:在连续室内环境中进行视觉-语言无人机导航的基准测试
专题命中 图文多模态 :multimodal(abstract);分类 cs.AI
AI总结 IndoorUAV通过构建室内无人机视觉-语言导航基准,结合多模态推理和任务分解,为长视距和短视距导航提供高质量数据与模型支持。
Embodied4C: 评估具身视觉-语言导航中至关重要的因素
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; UAS Esslingen(埃森嫩大学) ; TU Wien(维也纳技术大学) ; Dr. Ing. h.c. F. Porsche AG(保时捷股份有限公司) ; University of Michigan(密歇根大学) ; Voxel51 Inc.(Voxel51公司)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
AI总结 Embodied4C通过三种异构具身评估VLMs的具身能力,发现跨模态对齐和指令微调比规模更重要,而空间和时间推理是可靠具身能力的主要瓶颈。
SSR:基于CLIP的弱监督分割的语义与空间校正
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出SSR方法,通过语义与空间校正提升CLIP在弱监督分割中的性能,实现更高的mIoU分数。
Comments Accepted in AAAI 2026
CLIP纹理-形状偏倚的动态演变及其与人类对齐和模型鲁棒性的关系
机构 * Image Processing Lab, Universitat de Valencia, Spain(瓦伦西亚大学图像处理实验室) ; Centro de Biomateriales e Ingenieria Tisular, Universitat Politecnica de Valencia, Spain(瓦伦西亚理工大学生物材料与组织工程中心) ; Computer Vision Center, Spain(西班牙计算机视觉中心) ; Universitat Autònoma de Barcelona, Spain(巴塞罗那自治大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文研究CLIP模型在训练过程中纹理-形状偏倚的演变,揭示其与人类感知对齐及模型鲁棒性的关系。
通过内在文本锚点进行增量提示调优实现CLIP的持续学习
机构 * School of Computer Science and Engineering, University of New South Wales(新南威尔士大学计算机科学与工程学院) ; Data61, CSIRO(CSIRO数据61研究中心) ; School of Computer Science, University of Auckland(奥克兰大学计算机科学学院) ; Australian Institute for Machine Learning (AIML), The University of Adelaide(阿德莱德大学澳大利亚机器学习研究所)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出基于增量提示调优的CLIP持续学习方法,通过引入文本原型作为稳定锚点,提升多模态嵌入空间稳定性,并联合优化视觉和文本提示以减少遗忘。
Comments Accepted at TMLR. Code is available at https://github.com/jeff024/tppt
N3D-VLM:原生3D接地使视觉-语言模型在3D场景中实现精确的空间推理
机构 * HKUST(香港科技大学) ; Tencent AI Lab(腾讯AI实验室) ; CUHK(香港中文大学) ; ZJU(浙江大学) ; NJU(南京大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 N3D-VLM通过原生3D感知能力提升视觉-语言模型在3D场景中的空间推理精度与解释性。
Comments Project Page: https://n3d-vlm.github.io
R4:在4D时空空间中为视觉语言模型引入检索增强推理
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; Esslingen University of Applied Sciences(埃斯林根应用科学大学) ; Dr. Ing. h.c. F. Porsche AG(德意志联邦汽车工业协会) ; University of Michigan(密歇根大学) ; Voxel51 Inc.(Voxel51公司)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 R4通过构建4D时空知识库,使视觉语言模型具备结构化终身记忆,实现无需训练的检索增强推理,提升动态环境中的具身推理能力。
Null-LoRA: 在空域上进行低秩适应
机构 * School of Computer Science(计算机科学学院) ; Engineering, Sun Yat-sen University, Guangdong, China(工程学院,中山大学,广东,中国)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
AI总结 Null-LoRA通过在空域上进行低秩适应,提升参数效率和模型效果,在图像-文本检索和视觉问答任务中取得最优表现。
VLCache:计算2%的视觉令牌并重用98%用于视觉-语言推断
机构 * Qwen Team, Alibaba Inc.(通义实验室,阿里巴巴集团)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 VLCache通过重用98%的缓存减少计算量,实现高效视觉-语言推理,精度与全重新计算相当,加速1.2x至16倍。
一种用于遥感领域的高效且有效的编码器模型
机构 * INESC-ID, Instituto Superior Técnico, University of Lisbon(INESC-ID,理工学院,里斯本大学) ; Department of Computer Science, Faculty of Science and Technology, Universidade NOVA de Lisboa(计算机科学系,科学与技术学院,诺瓦大学) ; School of Architecture, Civil and Environmental Engineering, EPFL(建筑、土木和环境工程学院,EPFL)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出了一种高效且紧凑的编码器模型,用于处理遥感领域的多任务学习,包括图像文本生成和跨模态检索。
CLIP-FTI: 通过CLIP驱动的属性条件化实现细粒度面部模板逆向
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
AI总结 CLIP-FTI通过CLIP驱动的属性条件化实现细粒度面部模板逆向,提升识别准确性和属性相似性,增强跨模型攻击的可转移性。
Comments Accepted by AAAI 2026
评估专用计数架构和视觉-语言模型的视觉计数能力
机构 * University of Padova(帕多瓦大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文比较了专用计数架构与VLMs在物体计数任务中的性能,发现VLMs在生成中间表示时计数准确率显著提高,但复杂场景计数仍需进一步研究。
SuperCLIP:带有简单分类监督的CLIP
机构 * School of EIC, Huazhong University of Science and Technology(华中科技大学电子与信息学院) ; ByteDance(字节跳动)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
AI总结 SuperCLIP通过添加轻量级分类监督提升CLIP的细粒度视觉-文本对齐能力,有效提升零样本分类和检索性能。
Comments Accepted by NeurIPS 2025. Code: https://github.com/hustvl/SuperCLIP
擦除CLIP记忆:非破坏性、无数据零样本类去学习在CLIP模型中
机构 * Hewlett Packard Labs(惠普实验室)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出了一种基于空空间投影的非破坏性零样本类去学习方法,有效降低CLIP模型中目标类别的性能,同时保留整体多模态知识。
选择性、可控性和领域无关的预训练CLIP模型去学习:一种无需训练和数据的方法
机构 * Hewlett Packard Labs(惠普实验室)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出了一种无需训练和数据的CLIP去学习方法,能够实现选择性、可控性和领域无关的模型遗忘,提升模型在不同任务上的适应性与效率。
为低数据情形下的X射线衍射成像适应通用基础模型
机构 * The University of Alabama(阿拉巴马大学) ; Argonne National Laboratory(阿贡国家实验室)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出PtychoBench基准,通过比较SFT和ICL策略,在低数据环境下优化X射线衍射成像任务的模型适应性,发现任务模态决定最佳专门化路径。
不止于最终答案:提升视觉提取和逻辑一致性的视觉语言模型
机构 * Virginia Tech(弗吉尼亚理工大学) ; Adobe Research(Adobe研究院) ; Apple(苹果公司)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 PeRL-VL通过解耦框架提升视觉语言模型的视觉提取和推理一致性,实现Pass@1准确率提升。
Relation-R1: 逐步认知链式思维引导的强化学习用于统一关系理解
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
AI总结 Relation-R1通过整合认知链式思维引导的强化学习,实现了对二元和N元关系的统一理解,提升了视觉-语义定位能力。
Comments AAAI 2026
通过层次化视觉-语言对齐和建模实现高像素图像的少样本学习
机构 * KAIST(韩国科学技术院) ; IHPC, A*STAR(A*STAR研究院)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 HiVE-MIL通过层次化视觉-语言对齐和建模,提升高像素图像的少样本学习性能,实现4.1%的宏F1提升。
Comments Accepted at NeurIPS 2025
合成血管和病理增强视觉-语言模型推理
机构 * Cornell University(康奈尔大学) ; Weill Cornell Medicine(韦尔·康奈尔医学) ; Technical University of Munich(慕尼黑技术大学) ; New York Eye and Ear Infirmary of Mount Sinai(圣文森特医院) ; Cornell Tech(康奈尔科技)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
AI总结 本研究提出合成血管推理框架,通过生成具有糖尿病视网膜病变特征的图像和文本,提升视觉-语言模型在OCTA图像诊断中的推理能力与病理定位精度。
Comments 23 pages, 8 figures, 6 tables. Full paper under review for MIDL 2026 (Medical Imaging with Deep Learning)
探讨视觉语言模型中注意力头的功能作用:推理模块的证据
机构 * The University of Melbourne(墨尔本大学) ; The University of Sydney(悉尼大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.AI
AI总结 本文通过CogVision数据集探讨视觉语言模型中注意力头的功能作用,揭示其在多模态推理中的关键作用及分布特征。