Calibrating Multi-modal Representations: A Pursuit of Group Robustness without Annotations
专题命中 图文多模态 :multi-modal(title);分类 cs.CV
Comments Accepted by CVPR 2024
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multi-modal(title);分类 cs.CV
Comments Accepted by CVPR 2024
专题命中 图文多模态 :multimodal(title);分类 cs.CV
专题命中 图文多模态 :multi-modal(title);分类 cs.CV
专题命中 图文多模态 :multimodal(title);分类 cs.CV
Comments 9 pages, 6 figures, presented on NeurIPS workshop on Robustness of Few-shot and Zero-shot Learning in Foundation Models
专题命中 图文多模态 :multimodal(title);分类 cs.AI
专题命中 图文多模态 :image-text(title);分类 cs.CV
Comments CVPR 2023
专题命中 图文多模态 :multi-modal(title);分类 cs.CV
专题命中 图文多模态 :image-text(title);分类 cs.CV
Comments 8 pages, 8 figures, Accepted at SIGGRAPH ASIA 2022, Project Page at https://www.nasir.lol/clipmesh
专题命中 图文多模态 :image-text(title);分类 cs.CV
Comments 10 pages, 4 figures, presented in the MACLEAN workshop during ECML PKDD 2021
专题命中 图文多模态 :multi-modal(title);分类 cs.CL
Comments 8 pages, 2 figures, 2 tables, accepted to NAACL-HLT SRW 2021
专题命中 图文多模态 :multi-modal(title);分类 cs.CV
专题命中 图文多模态 :image-text(title);分类 cs.MM
Comments Accepted by ACMMM2019
专题命中 图文多模态 :multimodal(title);分类 cs.CV
Comments ICCV 2019
专题命中 图文多模态 :multi-modal(title);分类 cs.CV
Comments 6 pages, accepted at MIPR 2019
专题命中 图文多模态 :multimodal(title);分类 cs.CV
Comments 4 pages, 1 figure, accepted at MIPR2018
专题命中 图文多模态 :image-text(title);分类 cs.CL
分割一切模型中的提示工程:方法、应用与新兴挑战
机构 * School of Computer Science and Technology, Tongji University(计算机科学与技术学院,同济大学)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本综述系统梳理了SAM的提示工程技术,将其分为三类并分析方法演变,探讨其跨领域应用,指出三大挑战并提出有前景的研究方向,为相关领域提供参考。
Intern-S2-Preview:科学智能体基础模型
机构 * Shanghai AI Laboratory(上海人工智能实验室)
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL
AI总结 本研究提出Intern-S2-Preview系列科学智能体基础模型,通过多阶段训练与架构优化,在多类基准上取得领先结果,相关模块可提升科学任务表现且无需修改主干模型。
Comments 35 pages, 12 figures
SpikeWorld:用于冻结脉冲世界模型的快速状态适应
机构 * DiDi International Business Group(滴滴国际业务集团)
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI
AI总结 SpikeWorld是145万参数的稀疏脉冲模型,冻结训练参数后通过外部路径实现快速状态适应,提升多模态预测等性能,在Meta-World任务中提高冻结策略奖励与成功率。
Comments 14 pages, 2 figures, 4 tables. Code: https://github.com/Oooorca/SpikeWorld
视觉世界实验中的注视行为可采用现成的语言-视觉编码器建模
机构 * University of Stuttgart(斯图加特大学)
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.CL
AI总结 该研究提出结合CLIP双编码器与双模态归因方法的新方法,无需微调或生成式架构,即可复现经典视觉世界研究的人类注视行为预测结果。
视觉-语言模型在医学影像疾病分类中的交叉公平性
机构 * Biomedical Data Analysis and Visualisation (BDAV) Lab, School of Computer Science(生物医学数据分析与可视化实验室,计算机科学学院) ; Sydney School of Public Health(悉尼公共卫生学院) ; School of Computing(计算学院)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出CMAC-MMD框架,通过标准化交叉亚组的诊断确定性,减少医学影像疾病分类中的交叉偏见,提升诊断准确性和公平性。
用于红外视觉语言模型定向语义攻击的QR结构化热触发装置
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
AI总结 本研究提出QR-STT框架,作为隐蔽黑盒攻击手段,可定向操控IR-VLMs的语义对齐,其扰动还能跨任务迁移,凸显了对该类攻击进行鲁棒性评估的必要性。
TextSLIP:用于医学报告生成的文本自监督CLIP
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI
AI总结 研究针对现有CLIP方法在医学报告生成中语义监督不足问题,提出TextSLIP框架,通过模态内文本对比学习增强CLIP,经实验验证其在报告生成指标上有改进,表明文本级对比学习对改善医学视觉-文本对齐有潜力。
Comments 9 pages
回答前看清楚:通过显著性驱动的感知重新对齐减轻LVLMs中的幻觉
机构 * Xidian University(西安电子科技大学) ; Tsinghua University(清华大学) ; Shanghai Road Transport Development Center(上海市道路运输发展中心) ; Hunan Institute of Advanced Technology(湖南先进技术研究院)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM
AI总结 研究针对LVLMs易产生幻觉问题,提出无需训练的SDPR框架,通过显著性驱动注意力重新分配、缓存对齐及先验约束对比解码,整体对齐视觉意识,在多基准测试中优于现有方法,无需额外训练且开销小。
Comments Accepted by ACM Multimedia 2026
当结构化稀疏自编码器跨模态学习一致概念时
机构 * Zhejiang University(浙江大学) ; Nanyang Technological University(南洋理工大学)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 研究视觉语言模型中普通稀疏自编码器难以学习模态一致概念的问题,提出结构化稀疏自编码器$S^2AE$,通过图像块分组及结构化稀疏正则化强化概念一致性,经实验验证该方法在语义对齐等方面有提升,能促进跨模态表示更连贯解缠。
面向几何的不确定性聚类用于病理学中鲁棒的视觉上下文学习
机构 * FAU Erlangen-Nürnberg, Erlangen, DE(埃尔兰根-纽伦堡大学) ; Department of Computing, Imperial College London, London, UK(伦敦帝国理工学院计算机系)
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI
AI总结 本文提出GAUC,一种无需训练的聚类选择方法,直接在预训练的多模态嵌入空间中操作,通过优化三个目标提升视觉上下文学习的鲁棒性、准确性和校准性。
RADIO1D:用于压缩视觉建模的弹性表示
机构 * NVIDIA(英伟达)
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI
AI总结 挑战视觉语言模型需固定基于补丁的2D视觉特征的假设,分析微调视觉编码器,基于发现引入RADIO1D,用多教师知识蒸馏等将图像压缩成1D令牌序列,有强分层总结能力,在多模态基准测试中有优势。
Comments Published as main conference paper at ICML 2026
SAB-LVLM: 面向大型视觉-语言模型的重要性感知二值化
机构 * State Key Laboratory of Robotics and Intelligent Systems(机器人学国家重点实验室) ; Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 提出SAB-LVLM方法,通过构建空间重要性图与模态引导整合策略,实现跨层跨模态权重重要性感知的二值化,在约1比特压缩下优于现有二值化方法。
SonoCLIP: 面向胎儿超声分析的掩码引导区域感知视觉-语言预训练
机构 * School of Computer Science, Wuhan University, Wuhan, China(武汉大学计算机学院,武汉,中国) ; Institute of Artificial Intelligence, Wuhan University, Wuhan, China(武汉大学人工智能研究院,武汉,中国) ; Department of Ultrasound, Renmin Hospital of Wuhan University, Wuhan, China(武汉大学仁民医院超声科,武汉,中国) ; National Engineering Research Center for Multimedia Software, Wuhan University, Wuhan, China(武汉大学多媒体软件国家工程研究中心,武汉,中国) ; Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University, Wuhan, China(湖北省多媒体与网络通信工程重点实验室,武汉大学,武汉,中国)
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI
AI总结 提出SonoCLIP,首个百万级区域可控胎儿超声视觉-语言基础模型,通过掩码引导的全局-局部对比学习,提升对临床关键局部结构的敏感性,在零样本迁移中表现优异。
ReasonCLIP-58M: CLIP的视觉基础常识推理监督
机构 * Khalifa University(卡利法大学) ; University of Western Australia(西澳大学) ; The Chinese University of Hong Kong(香港中文大学) ; University of Melbourne(墨尔本大学) ; University of Central Florida(佛罗里达中央大学)
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI
AI总结 提出ReasonCLIP-58M框架,通过两阶段策略将大规模推理监督集成到CLIP模型中,构建ReasonLite-42M和ReasonPro-16M数据集及RCLIP-Bench基准,提升视觉基础常识推理和零样本检索性能。
Comments Accepted to ECCV2026