arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46073 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4651 篇

2411.18111 2026-05-12 cs.CV 70%

When Large Vision-Language Models Meet Person Re-Identification

当大视觉-语言模型遇见人重识别

Qizao Wang, Bin Li, Xiangyang Xue

机构 * School of Computer Science, Fudan University, Shanghai, China(复旦大学计算机科学学院,上海,中国)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出LVLM-ReID框架,利用大视觉-语言模型的生成能力提升人重识别的准确性,通过语义引导交互模块生成关键外观语义特征,无需额外标注即可在多个基准上取得竞争性结果。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08493 2026-05-12 cs.CV 70%

CapCLIP: A Vision-Language Representation Alignment Approach for Wireless Capsule Endoscopy Analysis

CapCLIP:一种用于无线胶囊内镜分析的视觉-语言表示对齐方法

Haroon Wahab, Irfan Mehmood, Hassan Ugail

机构 * School of Computer Science, AI and Electronics Faculty of Engineering and Digital Technologies(计算机科学与电子工程学院,工程与数字技术学院) School of Management Faculty of Mgmt, Law & Social Sciences(管理学院,管理、法律与社会科学学院) Centre for Visual Computing and Intelligent Systems(视觉计算与智能系统中心)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 CapCLIP通过将内镜图像与临床标准术语生成的文本描述对齐,提升无线胶囊内镜分析的泛化能力和语义解释性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05546 2026-05-08 cs.AI 70%

SPARK: Self-Play with Asymmetric Reward from Knowledge Graphs

SPARK:基于知识图谱的异步奖励自我对抗学习

Hyobin Park, Taeseop Kim, Dong-Geol Choi

机构 * Hanbat National University, South Korea(韩国翰bac国立大学)

专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.AI

AI总结 SPARK通过构建统一知识图谱实现多文档科学文献的自我对抗学习,利用图路径生成关系推理问题并基于结构化事实计算奖励,优于传统自对抗基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08598 2026-04-28 cs.IR cs.CV 70%

Pretrain-then-Adapt: Uncertainty-Aware Test-Time Adaptation for Text-based Person Search

预训练后再适应:面向基于文本的人脸搜索的不确定性感知测试时间适应

Jiahao Zhang, Shaofei Huang, Yaxiong Wang, Zhedong Zheng

机构 * University of Macau(澳门大学) Hefei University of Technology(合肥工业大学)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出一种预训练后再适应方法,通过离线测试时间适应减少对目标域标注数据的依赖,引入不确定性感知测试时间适应框架以提升人像搜索系统的鲁棒性和效率。

Comments Accepted to ACM SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07076 2026-04-23 cs.CV 70%

Retinex Meets Language: A Physics-Semantics-Guided Underwater Image Enhancement Network

Retinex 与语言的结合:一种物理-语义引导的水下图像增强网络

Shixuan Xu, Yabo Liu, Chao Huang, Junyu Dong, Xinghui Dong

机构 * State Key Laboratory of Physical Oceanography and the Faculty of Information Science and Engineering, Ocean University of China(物理海洋学国家重点实验室和中国海洋大学信息科学与工程学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen university(中山大学深圳校区计算机科学与技术学院)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出PSG-UIENet,结合Retinex光照校正与语言引导,通过构建LUIQD-TD数据集和设计ITSS损失函数,提升水下图像增强效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18134 2026-04-21 cs.CV 70%

Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?

LLM生成文本能否增强外科视觉-语言预训练?

Chengan Che, Chao Wang, Jiayuan Huang, Xinyue Chen, Luis C. Garcia-Peraza-Herrera

机构 * Visual Understanding Research Group, Department of Informatics, King’s College London, UK(视觉理解研究组,信息学院,伦敦国王学院,英国)

专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出SurgLIME框架,利用LLM生成的文本进行多模态预训练,以解决标注成本高的问题,通过LoRA适配和自适应置信度估计机制提升模型鲁棒性。

Comments Accepted at CVPRW 2026 (AI4RWC Oral presentationn)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14629 2026-04-17 cs.CV 70%

Switch-KD: Visual-Switch Knowledge Distillation for Vision-Language Models

Switch-KD:视觉切换知识蒸馏用于视觉-语言模型

Haoyi Sun, Xiaoxiao Wang, Ning Mao, Qian Wang, Lifu Mu, Wen Zheng, Tao Wei, Wei Chen

机构 * Li Auto Inc(利-auto公司)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 Switch-KD通过统一视觉-语言知识转移,解决多模态对齐问题,使小模型高效蒸馏大模型的多模态知识。

Comments 11 pages, 3 figures

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11176 2026-04-17 cs.CV 70%

Precision Synthesis of Multi-Tracer PET via VLM-Modulated Rectified Flow for Stratifying Mild Cognitive Impairment

多示踪PET的高精度合成通过VLM调制的校正流用于区分轻度认知障碍

Tuo Liu, Shuijin Lin, Shaozhen Yan, Haifeng Wang, Jie Lu, Jianhua Ma, Chunfeng Lian

机构 * School of Mathematics and Statistics, Xi'an Jiaotong University(西安交通大学数学与统计学学院) Key Laboratory of Biomedical Information Engineering of Ministry of Education, School of Life Science and Technology, Xi'an Jiaotong University(教育部生物医学信息工程重点实验室,西安交通大学生命科学与技术学院) Department of Radiology and Nuclear Medicine, Xuanwu Hospital, Capital Medical University(首都医科大学宣武医院放射科与核医学科) Research Center for Intelligent Medical Equipment and Devices (IMED), Xi'an Jiaotong University(智能医疗设备与器件研究中心(IMED),西安交通大学)

专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出DIReCT$++$模型,结合MRI和临床信息,通过校正流和视觉语言模型生成高保真多示踪PET图像,实现轻度认知障碍的精准分层。

Comments Added supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03402 2026-04-14 cs.AI cs.LG 70%

Risk Awareness Injection: Calibrating Vision-Language Models for Safety without Compromising Utility

风险感知注入:为安全校准视觉-语言模型而不牺牲实用性

Mengxuan Wang, Yuxin Chen, Gang Xu, Tao He, Hongjie Jiang, Ming Li

机构 * Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(华南理工大学吴贤铭智能工程学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) University of Electronic Science and Technology of China(电子科技大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出RAI框架,通过增强不安全信号恢复视觉-语言模型的安全识别能力,同时保持语义完整性,实验显示有效降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04473 2026-04-07 cs.CV 70%

Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks

超越标准基准:对视觉-语言模型在不同任务中对自然语义变化鲁棒性的系统审计

Jia Chengyu, AprilPyone MaungMaung, Huy H. Nguyen, Jinyin Chen, Isao Echizen

机构 * Zhejiang University of Technology(浙江工业大学) National Institute of Informatics(国立信息学研究所)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文系统评估了视觉-语言模型在自然对抗场景下的鲁棒性,分析了不同模型在零样本图像分类、语义分割和视觉问答中的表现,揭示了鲁棒CLIP模型放大对抗漏洞的问题。

Comments Accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03231 2026-04-06 cs.CV 70%

CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning

CoME-VL:扩展互补多编码视觉语言学习

Ankan Deria, Komal Kumar, Xilin He, Imran Razzak, Hisham Cholakkal, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出CoME-VL框架,通过融合对比学习和自监督编码器提升视觉语言模型性能,实验显示在多个基准上优于单编码基线。

Comments 16 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21482 2026-04-01 cs.CV 70%

ALADIN:Attribute-Language Distillation Network for Person Re-Identification

ALADIN:基于属性-语言的知识蒸馏网络用于人重识别

Wang Zhou, Boran Duan, Haojun Ai, Ruiqi Lan, Ziyue Zhou

机构 * Wuhan University(武汉大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 ALADIN通过属性-语言知识蒸馏网络,提升人重识别中细粒度属性特征的捕捉能力,增强鲁棒性与泛化性。

Comments 14pages, 3figures, 7charts

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27070 2026-03-31 cs.CV 70%

Structural Graph Probing of Vision-Language Models

视觉-语言模型的结构图谱探查

Haoyu He, Yue Zhuo, Yu Zheng, Qi R. Wang

机构 * Northeastern University(东北大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究通过神经拓扑分析视觉-语言模型的层间相关图谱,揭示群体结构对行为的意义、跨模态变化及因果影响,提出神经拓扑作为解释性中间尺度。

Comments IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22419 2026-03-31 cs.CV 70%

CLIP Is Shortsighted: Paying Attention Beyond the First Sentence

CLIP存在短视:超越第一句话的注意力分配

Marc-Antoine Lavoie, Anas Mahmoud, Aldo Zaimi, Arsene Fansi Tchango, Steven L. Waslander

机构 * University of Toronto Robotics Institute(多伦多大学机器人研究所) Mila - Quebec AI Institute(Mila - 魁北克人工智能研究所)

专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 CLIP模型在大规模数据上通过图像-文本对比学习获取可迁移的多模态特征,但其预训练过程偏向于短描述,导致复杂场景对齐不足。本文提出DeBias-CLIP,通过去除摘要句和子采样提升对齐效果,实现更优的长文本检索和鲁棒性。

Comments 20 pages, 15 figures, to be published in the CVPR 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18845 2026-03-31 cs.CV 70%

Echoes of ownership: Adversarial-guided dual injection for copyright protection in MLLMs

所有权的回声:对抗引导的双注入用于MLLMs中的版权保护

Chengwei Xia, Fan Ma, Ruijie Quan, Yunqiu Xu, Kun Zhan, Yi Yang

机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出一种生成版权触发器的框架,通过双注入方法在MLLMs中嵌入可验证的版权信息,以在微调衍生模型中触发专属文本响应,同时在非衍生模型中保持无活性。

Comments Accepted to CVPR 2026!

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23023 2026-03-25 cs.CV 70%

Cog3DMap: Multi-View Vision-Language Reasoning with 3D Cognitive Maps

Cog3DMap:基于3D认知地图的多视角视觉语言推理

Chanyoung Gwak, Yoonwoo Jeong, Byungwoo Jeon, Hyunseok Lee, Jinwoo Shin, Minsu Cho

机构 * POSTECH KAIST(韩国科学技术院) RLWRLD

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出Cog3DMap框架,通过构建显式的3D记忆,使多视角图像中的每个token都具备语义和几何信息,从而提升多模态大语言模型的空间推理能力。

Comments Project Page: https://cog3dmap.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04839 2026-03-24 cs.CV 70%

Towards Highly Transferable Vision-Language Attack via Semantic-Augmented Dynamic Contrastive Interaction

通过语义增强的动态对比交互实现高度可迁移的视觉-语言攻击

Yuanbo Li, Tianyang Xu, Cong Hu, Tao Zhou, Xiao-Jun Wu, Josef Kittler

机构 * School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院) Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey(Surrey 大学视觉、语音和信号处理中心)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出SADCA方法,通过语义引导的渐进扰动提升视觉-语言模型的对抗可迁移性,实验表明其在多个数据集上优于现有方法。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01571 2026-03-24 cs.CV cs.RO 70%

PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model

PixelVLA:推进视觉-语言-动作模型中的像素级理解

Wenqi Liang, Gan Sun, Yao He, Jiahua Dong, Suyan Dai, Ivan Laptev, Salman Khan, Yang Cong

机构 * University of Trento(特伦托大学) School of Automation Science and Engineering, South China University of Technology(华南理工大学自动化科学与工程学院) Mohamed bin Zayed University of Artificial Intelligence(马尔代夫人工智能大学) Australian National University(澳大利亚国立大学)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 PixelVLA通过引入多尺度像素感知编码器和视觉提示感知编码器,提升视觉-语言-动作模型的像素级理解和多模态提示能力,在三个基准和两个模型变体中提升了10.1%-28.7%的操控成功率。

Comments 17pages,7 figures, 5 tabels

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17326 2026-03-19 cs.CV 70%

FineViT: Progressively Unlocking Fine-Grained Perception with Dense Recaptions

FineViT: 通过密集描述逐步解锁细粒度感知

Peisen Zhao, Xiaopeng Zhang, Mingxing Xu, Ruoyu Sun, Zewei Du, Dunzheng Wang, Guanghao Zheng, Haohang Xu, Zhibo Zhang, Yuhang Zhang, Yi Ai, Lin Liu, Qi Tian

机构 * Huawei Inc.(华为公司)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 FineViT通过密集描述逐步训练,提升细粒度视觉感知能力,在长上下文检索中表现优异,超越现有多模态视觉编码器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17079 2026-03-19 cs.CV 70%

ACE-LoRA: Graph-Attentive Context Enhancement for Parameter-Efficient Adaptation of Medical Vision-Language Models

ACE-LoRA:图注意上下文增强用于医疗视觉-语言模型的参数高效适应

M. Arda Aydın, Melih B. Yilmaz, Aykut Koç, Tolga Çukur

机构 * Bilkent University(比尔肯特大学) National Magnetic Resonance Research Center (UMRAM)(国家磁共振研究所以及UMRAM)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出ACE-LoRA框架,通过整合LoRA模块和ACE-HGNN模块,提升医疗VLM的零样本泛化能力,解决领域特异性与泛化能力的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09586 2026-03-17 cs.CV 70%

Delving into Spectral Clustering with Vision-Language Representations

深入探讨基于视觉-语言表示的谱聚类

Bo Peng, Yuanwei Hu, Bo Liu, Ling Chen, Jie Lu, Zhen Fang

专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出基于预训练视觉语言模型的神经切线核谱聚类方法,通过跨模态对齐提升图像聚类性能,实验表明在16个基准数据集上显著优于现有方法。

Comments ICLR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02435 2026-03-16 cs.AI cs.LG 70%

VL-KGE: Vision-Language Models Meet Knowledge Graph Embeddings

VL-KGE:视觉-语言模型与知识图谱嵌入的结合

Athanasios Efthymiou, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出VL-KGE框架,结合视觉-语言模型的跨模态对齐与结构关系建模,提升多模态知识图谱的链接预测性能。

Comments Published in Proceedings of the ACM Web Conference 2026 (WWW '26). This arXiv version includes extended supplementary material

Journal ref In Proceedings of the ACM Web Conference 2026 (WWW '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16201 2026-03-16 cs.CV 70%

Visual Alignment of Medical Vision-Language Models for Grounded Radiology Report Generation

医学视觉-语言模型的视觉对齐以实现基于基础的放射学报告生成

Sarosij Bose, Ravi K. Rajendran, Biplob Debnath, Konstantinos Karydis, Amit K. Roy-Chowdhury, Srimat Chakradhar

机构 * NEC Laboratories America(NEC美洲实验室) University of California, Riverside(加州大学河滨分校)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出VALOR方法,通过临床指导文本推理和自监督视觉推理解决医学报告生成中的视觉幻觉问题,提升生成质量与临床准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11320 2026-03-13 cs.CV 70%

UniCompress: Token Compression for Unified Vision-Language Understanding and Generation

UniCompress: 用于统一视觉-语言理解和生成的标记压缩

Ziyao Wang, Chen Chen, Jingtao Li, Weiming Zhuang, Jiabo Huang, Ang Li, Lingjuan Lyu

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 UniCompress通过引入可学习的全局元标记引导的插件压缩和解压缩机制,显著减少视觉标记数量,同时保持图像理解和生成任务的性能,为资源受限场景下的统一多模态建模提供高效解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07952 2026-03-10 cs.CV 70%

VisualAD: Language-Free Zero-Shot Anomaly Detection via Vision Transformer

VisualAD: 通过视觉变换器实现无语言零样本异常检测

Yanning Hou, Peiyuan Li, Zirui Liu, Yitong Wang, Yanran Ruan, Jianfeng Qiu, Ke Xu

机构 * State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology, Anhui University, Hefei, China(光电信息采集与防护技术国家重点实验室,安徽大学,合肥,中国) School of Artificial Intelligence, Anhui University, Hefei, China(人工智能学院,安徽大学,合肥,中国) College of Intelligence Science and Technology, National University of Defense Technology, Changsha, China(智能科学与技术学院,国防科技大学,长沙,中国)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 VisualAD通过纯视觉变换器实现无语言零样本异常检测,引入可学习标记和空间感知模块,提升异常检测性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24038 2026-03-02 cs.CV cs.MA 70%

Enhancing CLIP Robustness via Cross-Modality Alignment

通过跨模态对齐增强CLIP鲁棒性

Xingyu Zhu, Beier Zhu, Shuo Wang, Kesen Zhao, Hanwang Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 COLA通过跨模态对齐提升CLIP对抗鲁棒性,有效缓解对抗扰动导致的特征不一致问题,提升零样本分类性能。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22548 2026-02-26 cs.CV cs.RO 70%

JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation

JanusVLN: 通过双隐式记忆解耦语义与空间性用于视觉-语言导航

Shuang Zeng, Dekang Qi, Xinyuan Chang, Feng Xiong, Shichao Xie, Xiaolong Wu, Shiyi Liang, Mu Xu, Xing Wei, Ning Guo

机构 * Xi’an Jiaotong University(西安交通大学) Amap, Alibaba Group(阿里巴巴集团)

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 JanusVLN通过双隐式记忆解耦语义与空间性,提升视觉-语言导航的性能和效率。

Comments Accepted to ICLR 2026. Project page: https://miv-xjtu.github.io/JanusVLN.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17028 2026-02-25 cs.LG cs.AI 70%

Distributional Vision-Language Alignment by Cauchy-Schwarz Divergence

通过Cauchy-Schwarz散度进行分布式视觉语言对齐

Wenzhe Yin, Zehao Xiao, Pan Zhou, Shujian Yu, Jiayi Shen, Jan-Jakob Sonke, Efstratios Gavves

机构 * University of Amsterdam(阿姆斯特丹大学) The Netherlands Cancer Institute(荷兰癌症研究所) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) The Arctic University of Norway(挪威北极大学) Singapore Management University(新加坡管理大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出CS-Aligner框架,通过整合Cauchy-Schwarz散度与互信息,实现更紧密的视觉语言分布对齐,提升跨模态生成与检索性能。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14498 2026-02-23 cs.CV cs.LG 70%

Uncertainty-Aware Vision-Language Segmentation for Medical Imaging

面向医学影像的不确定性感知视觉-语言分割

Aryan Das, Tanishq Rachamalla, Koushik Biswas, Swalpa Kumar Roy, Vinay Kumar Verma

机构 * VIT Bhopal(维特大学博帕尔分校) SAHE, Andhra Pradesh(安得拉邦SAHE) IIIT Delhi(德里印度理工学院) Tezpur University Assam(阿萨姆特兹普尔大学) IIT Kanpur(坎普尔印度理工学院)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种不确定性感知的多模态分割框架,通过引入SEU损失和MoDAB模块,提升医学影像分割的精度与效率。

Comments Accepted in WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15943 2026-02-20 cs.CV 70%

Boosting Medical Visual Understanding From Multi-Granular Language Learning

通过多粒度语言学习提升医学视觉理解

Zihan Li, Yiqing Wang, Sina Farsiu, Paul Kinahan

机构 * University of Washington(华盛顿大学) Duke University(杜克大学)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出MGLL框架,通过多粒度语言学习提升医学影像的视觉理解能力,改进多标签和跨粒度对齐,提升下游任务性能。

Comments Accepted by ICLR 2026. 40 pages

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏