Recurrent Memory Addressing for describing videos
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL
专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL
Comments published at ECCV 2016 (oral); updated to final version
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL
Comments 11 pages
Penguin-VL:探索基于大语言模型的视觉编码器的效率极限
机构 * Tencent AI Lab(腾讯AI实验室)
专题命中 图文多模态 :multimodal(abstract,comments);分类 cs.CV
AI总结 本文提出Penguin-VL,通过基于大语言模型的视觉编码器替代传统对比预训练,实现更高效的多模态理解,在文档理解、视觉知识和多视角视频理解等任务中超越现有领先VLM。
Comments Penguin-VL demonstrates that text-only initialized vision encoders can achieve superior performance in multimodal understanding tasks; Code: https://github.com/tencent-ailab/Penguin-VL
机构 * Harvard Medical School(哈佛医学院) ; Uppsala University(乌普萨拉大学) ; University of London(伦敦大学) ; Vietnam Military Medical University(越南军医大学) ; University of Technical Education Ho Chi Minh City(胡志明市技术大学) ; Knovel Engineering Lab(Knovel工程实验室) ; University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)
专题命中 图文多模态 :multimodal(abstract,comments);分类 cs.CV
Comments IQ Test for Multimodal Models
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CL;multimodal(comments)
Comments De-Factify: Workshop on Multimodal Fact Checking and Hate Speech Detection, co-located with AAAI 2022
月球地质学的可验证机器解释
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL
AI总结 本研究将地质知识推理方法嵌入多模态视觉-语言架构,构建可验证的月球地质学机器解释模型,结合开卷检索解决数值年龄定年依赖记忆先验的问题,明确自动地质推理的必要架构。
词中结构:用于人类大脑显微镜的弱监督视觉-语言建模
机构 * Institute of Neuroscience and Medicine (INM-1), Research Centre Jülich(神经科学与医学研究所(INM-1),焦耳研究中心) ; Helmholtz AI, Research Centre Jülich(海德堡人工智能研究所,焦耳研究中心) ; Institute for Brain Research, University Hospital Düsseldorf(脑研究所在杜塞尔多夫大学医院) ; Computer Vision, Institute for Computational Visualistics, University of Koblenz(计算机视觉,计算视觉研究所,科布伦茨大学)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
AI总结 本研究提出了一种弱监督视觉-语言建模方法,通过标签介导生成人类大脑显微镜的区域描述,实现了在缺乏配对标注情况下的自然语言生成。
Comments 13 pages, 5 figures, accepted for inclusion at GCPR 2026
先见后答:面向视觉语言模型的无训练视觉层分析
机构 * Leibniz Universität Hannover(汉诺威莱布尼茨大学) ; University of Bath(巴斯大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 该研究提出无需训练的视觉数据集熵(VDE)方法,可预测视觉语言模型的最优视觉层,缩小搜索范围,相比GW距离更具实用性。
Comments ECCVW'26 eXCV
AlignJEPA:面向遥感基础模型的预测性视觉-语言对齐
机构 * Space Applications Centre, ISRO(印度空间研究组织空间应用中心) ; Indian Institute of Science Education and Research (IISER) Bhopal(印度科学教育与研究学院(博帕尔)) ; Indian Institute of Technology Bombay(印度理工学院孟买分校)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
AI总结 该研究针对遥感基础模型与自然语言对齐不足的问题,提出受JEPA启发的AlignJEPA框架,采用轻量级预测对齐网络,结合语义预测与双向对比检索,实现了参数高效的视觉-语言对齐。
Comments 18 pages
TrustCLIP:通过对抗性重建学习隐私视觉特征
机构 * Meta ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; University of Tübingen(图宾根大学) ; National University of Singapore(新加坡国立大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 研究视觉和视觉语言模型中视觉特征隐私问题,提出TrustCLIP框架,以特征条件生成器为隐私对手,优化编码器特征与下游模块投影,降低生成式反演保真度并保持下游任务性能。
Comments https://atnikos.github.io/trustclip/ Update affiliations
使用CLIP进行合成图像检测:理解和评估预测线索
机构 * Institute for Data Science I4DS(数据科学研究所) ; University of Applied Sciences FHNW(应用科学大学) ; FHNW Brugg-Windisch AG(FHNW布吕克-温迪施公司)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
AI总结 本文提出SynthCLIC数据集,通过分析CLIP-based检测器的学习机制,揭示其在合成图像检测中依赖于高级摄影属性而非生成器特定伪影,并强调了持续更新和广泛训练的重要性。
Comments 10 figures; 25 pages
全面的语言-图像预训练用于3D医学图像理解
机构 * Microsoft(微软公司) ; German Cancer Research Center (DKFZ)(德国癌症研究中心) ; Department of Radiology, University of Cambridge and Cambridge University Hospitals NHS Foundation Trust(剑桥大学放射科及剑桥大学医院国家健康服务体系基金会信托) ; Pattern Analysis and Learning Group, Heidelberg University Hospital(海德堡大学医院模式分析与学习组) ; Department of Radiology, Mayo Clinic(梅奥诊所放射科)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
AI总结 本文提出COLIPRI编码器,通过结合报告生成目标和视觉-only预训练,提升3D医学图像的语义理解和生成能力。
SHARP: 为遥感合成促进分辨率提升的频谱感知高动态适应
机构 * School of Computer Science, Northwestern Polytechnical University, Xi'an, China(计算机科学学院,西北工业大学,西安,中国) ; School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University, Xi'an, China(人工智能学院,光学与电子学(iOPEN),西北工业大学,西安,中国)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
AI总结 本文提出SHARP方法,通过频谱感知的高动态适应策略,在无需训练的情况下提升遥感图像分辨率,优于现有无训练基线,在CLIP分数、审美分数和HPSv2上表现更优。
Comments Accepted by the 34th ACM International Conference on Multimedia (ACM MM 2026)
Journal ref Proceedings of the 34th ACM International Conference on Multimedia (ACM MM 2026)
双锚点,效果更佳:用于零样本异常检测的分层分组合并方法
机构 * Sogang University(西江大学) ; LG Electronics(LG电子) ; NAVER Cloud(NAVER云)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
AI总结 针对现有CLIP-based零样本异常检测方法的局限,提出Dual-Anchor框架,结合分层图像锚点与文本锚点,在8个工业和6个医疗基准上实现了优异泛化性能。
Comments 10 pages, 5 figures, 4 tables. Accepted to CVPR 2026 Findings
大型视觉语言模型的测试时幻觉控制
机构 * Australian National University(澳大利亚国立大学) ; The University of New South Wales(新南威尔士大学) ; University of Technology Sydney(悉尼科技大学) ; York University(约克大学) ; Lancaster University(兰卡斯特大学)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
AI总结 针对大型视觉语言模型的物体幻觉问题,提出无训练的测试时幻觉缓解(TTH)方法,通过令牌验证器模块等技术提升模型准确性与稳健性,通用性和实用性良好。
Comments Accepted at ECCV 2026 MUCG
隐式质心引导:用于指令对齐自动驾驶的单次无分类器引导
机构 * Rochester Institute of Technology(罗切斯特理工学院) ; NVIDIA(英伟达公司)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 针对视觉语言自动驾驶模型的指令跟随差距,提出单次引导机制LCS,降低推理延迟约50%,在Bench2Drive和nuScenes基准上提升指令遵循与驾驶性能。
Comments IROS 2026
一旦投毒,任意受控:视觉语言模型(VLM)中的可编程后门
专题命中 图文多模态 :any-to-any(abstract);分类 cs.CV
AI总结 该研究提出一种向VLM植入可编程后门的方法,通过启发式投毒策略和特征空间触发器隐写,可在推理时动态选择未见过的目标字幕并触发对应输出,攻击成功率高且能规避部分防御。
看向何处?:视觉语言模型中视觉编码器的因果追踪
机构 * Indian Institute of Technology Gandhinagar(印度甘地纳格尔印度理工学院)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本研究通过因果追踪方法,发现视觉语言模型的高因果性视觉标记常位于目标区域外,其强大多模态性能不代表存在空间定位因果表示,还揭示了视觉感知、利用与推理视觉结构的差距,提供了研究视觉信息处理的因果框架。
Comments 10 Pages, 6 figures
基于自标注区域对齐的细粒度CLIP微调
机构 * City University of Hong Kong(香港城市大学) ; Hong Kong University of Science & Technology(香港科技大学)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
AI总结 研究针对CLIP在细粒度表示上的局限,提出SFF-CLIP方法,仅用图像-文本对输入,通过运行时区域-短语对齐方案提升其细粒度表示能力,在相关任务中性能显著提升且维持原CLIP图像级任务表现。
LHSDet:基于视觉问答的高分辨率AI生成图像检测方法
机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机学院) ; Academy of Military Science(军事科学院)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
AI总结 针对现有AI生成图像检测方法忽略高分辨率细节、难以应对未知生成模型的问题,提出LHSDet,将检测任务转为视觉问答,采用三分支架构,在各类生成模型上实现高检测准确率与稳健性能。
BRUCE:面向科学视觉-语言推理的污染升级下鲁棒性基准测试
机构 * New York University Abu Dhabi(纽约大学阿布扎比分校)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 该研究提出BRUCE基准测试框架,通过RCI与T-RCI指标分析VLMs在科学视觉-语言推理任务中随污染升级的鲁棒性退化,实现可解释的失败分析。
视觉-语言模型中的源模态监控
机构 * Department of Computer Science, Brown University(布朗大学计算机科学系)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL
AI总结 研究探讨了多模态模型追踪并沟通信息来源的能力,分析了语法与语义信号在绑定提示词与输入组件中的作用,发现语义信号在模态分布差异大时更占主导。
Comments Accepted at COLM 2026. All resources will be available at https://github.com/ethahtz/source-modality-monitoring
解释、验证和对齐视觉语言模型嵌入中的语义层次结构
机构 * University of Lübeck(吕贝克大学) ; Technical University of Munich(慕尼黑工业大学) ; AUMOVIO SE ; Osnabrück University(奥斯纳布吕克大学) ; Leibniz Institute for Agricultural Engineering and Bioeconomy(莱布尼茨农业工程与生物经济研究所) ; University of Hamburg(汉堡大学)
专题命中 图文多模态 :image-text(abstract);分类 cs.AI
AI总结 本文提出一种框架,用于解释、验证和对齐视觉语言模型嵌入中的语义层次结构,通过聚类和概念库匹配提取层次结构,并利用人类本体评估其合理性,最终提出基于本体的对齐方法以提升共享嵌入空间的语义对齐。
Comments camera-ready version of accepted IJCAI-ECAI 2026 paper including supplementary material; code: https://github.com/gesina/ontological-commitment
一次剪枝:面向视觉-语言模型的无需重训练的任务无关剪枝
机构 * Chung-Ang University(中央大学) ; Soongsil University(崇实大学) ; Kookmin University(国民大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出名为PORTA的无需重训练的任务无关VLM剪枝框架,通过自适应稀疏分配实现高压缩下的竞争力性能,支持高效VLM压缩。
Comments Accepted to ECCV 2026
Grad-ECLIP: 基于梯度的CLIP视觉与文本解释
机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) ; Division of Social Science and Department of Computer Science & Engineering, Hong Kong University of Science & Technology(香港科学与技术大学社会科学学院及计算机科学与工程系) ; SenseTime Group Ltd(时光集团有限公司)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
AI总结 本文提出Grad-ECLIP方法,通过分解CLIP编码器架构并分析匹配相似度与中间空间特征的关系,生成有效热图以解释CLIP匹配结果。通过通道和空间权重提升视觉解释质量,并通过定性定量评估验证其有效性。
Journal ref Zhao C, Wang K, Hsiao J H, et al. Grad-eclip: Gradient-based visual and textual explanations for clip[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2026
一段文本胜过千条标题:重新思考视觉-语言检索的文本监督
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
AI总结 该研究针对视觉-语言检索,通过系统对比单标题与段落文本监督,发现仅微调BLIP文本编码器的段落监督模型在DOCCI等任务上优于Long-CLIP,为文本粒度与检索性能的关系提供了新见解。
Comments Accepted at the MUCG workshop, ECCV 2026
VLAff:用于统一可操作 affordance 的视觉-语言-affordance 模型
机构 * University of Tokyo(东京大学)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
AI总结 本研究提出 VLAff 模型,结合 EgoAffordance 数据集,解决人类与机器人 embodiment 不匹配问题,实现视觉 affordance 预测及真实机器人零样本操作等应用。
Comments 8 pages, 5 figures. Accepted to IEEE/RSJ IROS 2026. Project page: https://ojh6404.github.io/vlaff/
CARGO-VL:面向视觉-语言模型的风险约束组优化反事实仲裁方法
专题命中 图文多模态 :multimodal(abstract);分类 cs.AI
AI总结 本研究提出CARGO-VL框架,结合XMC资源,通过组相对优化及原对偶控制器,提升视觉-语言模型的反事实仲裁性能,在多基准上优于逐点基线。
Exo2EgoPose:利用外心演示进行视觉语言引导的自我中心3D手部姿态预测
机构 * University of Electronic Science and Technology of China(电子科技大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI总结 研究视觉语言引导的自我中心3D手部姿态预测任务,提出Exo2EgoPose框架,利用外心演示补偿自我中心视角线索不足,含双层外心重建模块和全局到局部调制模块,实验显示该方法优于现有技术,具备人机转移能力且有改进。
Comments Accepted by ACMMM 2026