arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46073 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4651 篇

2512.17306 2026-01-08 cs.CV 57%

Deep But Reliable: Advancing Multi-turn Reasoning for Thinking with Images

深度但可靠:提升图像思考的多轮推理

Wenhao Yang, Yu Xia, Jinlong Huang, Shiyin Lu, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Yuanyu Wan, Lijun Zhang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 DRIM通过多阶段流程提升图像思考的多轮推理能力,通过冗余惩罚策略优化实现自我反思的推理模式,从而在视觉理解任务中取得优越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18795 2026-01-08 cs.CV 57%

ProCLIP: Progressive Vision-Language Alignment via LLM-based Embedder

通过基于大语言模型的嵌入器实现渐进式视觉-语言对齐的ProCLIP

Xiaoxing Hu, Kaicheng Yang, Ziyang Gong, Qi Ming, Zonghao Guo, Yu Tian, Xiang An, Ziyong Feng, Xue Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing Institute of Technology(北京理工大学) DeepGlint(深图科技) Beijing University of Technology(北京工业大学) Tsinghua University(清华大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 ProCLIP通过课程学习逐步对齐CLIP图像编码器与基于大语言模型的嵌入器,提升长文本处理和多语言理解能力。

Comments 17 pages, 5 fiugres

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17002 2026-01-05 cs.CV 57%

Semantic Anchor Transport: Robust Test-Time Adaptation for Vision-Language Models

语义锚点传输:面向视觉-语言模型的鲁棒性测试时间适应

Shambhavi Mishra, Julio Silva-Rodriguez, Ismail Ben Ayed, Marco Pedersoli, Jose Dolz

机构 * LIVIA, ÉTS Montréal, Canada(LIVIA,蒙特利尔ÉTS,加拿大) International Laboratory on Learning Systems (ILLS), McGILL - ETS - MILA - CNRS - Université Paris-Saclay - CentraleSupélec, Canada(学习系统国际实验室(ILLS),麦吉尔大学-ÉTS-MILA-CNRS-巴黎-萨克雷大学-中央超导大学,加拿大)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 语义锚点传输通过生成伪标签和多模板蒸馏方法,提升视觉-语言模型在分布偏移下的鲁棒性与计算效率。

Comments Added additional figures to communicate the algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23109 2025-12-30 cs.LG cs.AI stat.ML 57%

How Much Data Is Enough? Uniform Convergence Bounds for Generative & Vision-Language Models under Low-Dimensional Structure

需要多少数据?在低维结构下生成式与视觉-语言模型的统一收敛界限

Paul M. Thompson

机构 * Stevens Institute for Neuroimaging and Informatics, University of Southern California(神经影像与信息学研究所,南加州大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.AI

AI总结 研究在低维结构下生成式和视觉-语言模型的统一收敛界限,探讨数据量与模型校准之间的关系。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16531 2025-12-30 cs.AI 57%

Scaling Laws for Energy Efficiency of Local LLMs

本地大语言模型和视觉-语言模型的扩展定律

Ander Alvarez, Alessandro Genuardi, Nilotpal Sinha, Antonio Tiene, Mikail Okyay, Bakbergen Ryskulov, David Montero, Samuel Mugel, Román Orús

机构 * Multiverse Computing Donostia International Physics Center Ikerbasque Foundation for Science Multiverse Computing, Centre for Social Innovation

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究揭示了本地大语言模型和视觉-语言模型在中央处理单元上的计算扩展定律,并展示了量子启发压缩在降低能耗和资源消耗方面的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21675 2025-12-29 cs.CV 57%

UniPercept: Towards Unified Perceptual-Level Image Understanding across Aesthetics, Quality, Structure, and Texture

UniPercept:迈向跨美学、质量、结构和纹理的统一感知级图像理解

Shuo Cao, Jiayang Li, Xiaohui Li, Yuandong Pu, Kaiwen Zhu, Yuanting Gao, Siqi Luo, Yi Xin, Qi Qin, Yu Zhou, Xiangyu Chen, Wenlong Zhang, Bin Fu, Yu Qiao, Yihao Liu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Nanjing University(南京大学) Sun Yat-sen University(中山大学) Tele-AI Website(Tele-AI网站)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 UniPercept通过领域自适应预训练和任务对齐强化学习,实现跨美学、质量、结构和纹理的统一感知级图像理解,优于现有多模态大语言模型。

Comments 27 pages, 14 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21194 2025-12-25 cs.CV 57%

VisRes Bench: On Evaluating the Visual Reasoning Capabilities of VLMs

VisRes Bench: 关于评估视觉语言模型的视觉推理能力

Brigitta Malagurski Törtei, Yasser Dahou, Ngoc Dung Huynh, Wamiq Reyaz Para, Phúc H. Lê Khac, Ankit Singh, Sofian Chaybouti, Sanath Narayan

机构 * Technology Innovation Institute, Abu Dhabi, UAE(阿布扎比技术创新研究所) Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 VisRes Bench通过三个层次评估VLMs的视觉推理能力,揭示其在复杂任务中的局限性,并为多模态研究提供统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20839 2025-12-25 cs.CV 57%

Input-Adaptive Visual Preprocessing for Efficient Fast Vision-Language Model Inference

面向高效视觉语言模型推理的输入自适应视觉预处理

Putu Indah Githa Cahyani, Komang David Dananjaya Suartana, Novanto Yudistira

机构 * Faculty of Computer Science, University of Brawijaya(计算机科学学院,布拉维亚大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本研究提出一种自适应视觉预处理方法,通过动态调整输入分辨率和空间覆盖,显著提升视觉语言模型的推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19022 2025-12-25 cs.CV 57%

Steering Vision-Language Pre-trained Models for Incremental Face Presentation Attack Detection

引导视觉-语言预训练模型进行增量面部呈现攻击检测

Haoze Li, Jie Zhang, Guoying Zhao, Stephen Lin, Shiguang Shan

机构 * School of Computer Science, China University of Geosciences(中国地质大学(北京)计算机科学学院) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(中国科学院人工智能安全重点实验室) University of China Academy of Sciences(中国科学院大学) Center for Machine Vision and Signal Analysis, University of Oulu(奥卢大学机器视觉与信号分析中心) Microsoft Research Asia(微软亚洲研究院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 SVLP-IL是一种基于视觉-语言预训练模型的增量学习框架,通过多方面提示和选择性弹性权重固化方法,在隐私合规的前提下提升面部呈现攻击检测的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19024 2025-12-23 cs.RO cs.AI 57%

IndoorUAV: Benchmarking Vision-Language UAV Navigation in Continuous Indoor Environments

IndoorUAV:在连续室内环境中进行视觉-语言无人机导航的基准测试

Xu Liu, Yu Liu, Hanshuo Qiu, Yang Qirong, Zhouhui Lian

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 IndoorUAV通过构建室内无人机视觉-语言导航基准,结合多模态推理和任务分解,为长视距和短视距导航提供高质量数据与模型支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18028 2025-12-23 cs.RO cs.CV 57%

Embodied4C: Measuring What Matters for Embodied Vision-Language Navigation

Embodied4C: 评估具身视觉-语言导航中至关重要的因素

Tin Stribor Sohn, Maximilian Dillitzer, Jason J. Corso, Eric Sax

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) UAS Esslingen(埃森嫩大学) TU Wien(维也纳技术大学) Dr. Ing. h.c. F. Porsche AG(保时捷股份有限公司) University of Michigan(密歇根大学) Voxel51 Inc.(Voxel51公司)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 Embodied4C通过三种异构具身评估VLMs的具身能力,发现跨模态对齐和指令微调比规模更重要,而空间和时间推理是可靠具身能力的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01701 2025-12-23 cs.CV 57%

SSR: Semantic and Spatial Rectification for CLIP-based Weakly Supervised Segmentation

SSR:基于CLIP的弱监督分割的语义与空间校正

Xiuli Bi, Die Xiao, Junchao Fan, Bin Xiao

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出SSR方法,通过语义与空间校正提升CLIP在弱监督分割中的性能,实现更高的mIoU分数。

Comments Accepted in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09814 2025-12-22 cs.CV 57%

On the dynamic evolution of CLIP texture-shape bias and its relationship to human alignment and model robustness

CLIP纹理-形状偏倚的动态演变及其与人类对齐和模型鲁棒性的关系

Pablo Hernández-Cámara, Jose Manuel Jaén-Lorites, Alexandra Gómez-Villa, Jorge Vila-Tomás, Valero Laparra, Jesus Malo

机构 * Image Processing Lab, Universitat de Valencia, Spain(瓦伦西亚大学图像处理实验室) Centro de Biomateriales e Ingenieria Tisular, Universitat Politecnica de Valencia, Spain(瓦伦西亚理工大学生物材料与组织工程中心) Computer Vision Center, Spain(西班牙计算机视觉中心) Universitat Autònoma de Barcelona, Spain(巴塞罗那自治大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文研究CLIP模型在训练过程中纹理-形状偏倚的演变,揭示其与人类感知对齐及模型鲁棒性的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20680 2025-12-22 cs.CV 57%

Continual Learning on CLIP via Incremental Prompt Tuning with Intrinsic Textual Anchors

通过内在文本锚点进行增量提示调优实现CLIP的持续学习

Haodong Lu, Xinyu Zhang, Kristen Moore, Jason Xue, Lina Yao, Anton van den Hengel, Dong Gong

机构 * School of Computer Science and Engineering, University of New South Wales(新南威尔士大学计算机科学与工程学院) Data61, CSIRO(CSIRO数据61研究中心) School of Computer Science, University of Auckland(奥克兰大学计算机科学学院) Australian Institute for Machine Learning (AIML), The University of Adelaide(阿德莱德大学澳大利亚机器学习研究所)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出基于增量提示调优的CLIP持续学习方法,通过引入文本原型作为稳定锚点,提升多模态嵌入空间稳定性,并联合优化视觉和文本提示以减少遗忘。

Comments Accepted at TMLR. Code is available at https://github.com/jeff024/tppt

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16561 2025-12-19 cs.CV 57%

N3D-VLM: Native 3D Grounding Enables Accurate Spatial Reasoning in Vision-Language Models

N3D-VLM:原生3D接地使视觉-语言模型在3D场景中实现精确的空间推理

Yuxin Wang, Lei Ke, Boqiang Zhang, Tianyuan Qu, Hanxun Yu, Zhenpeng Huang, Meng Yu, Dan Xu, Dong Yu

机构 * HKUST(香港科技大学) Tencent AI Lab(腾讯AI实验室) CUHK(香港中文大学) ZJU(浙江大学) NJU(南京大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 N3D-VLM通过原生3D感知能力提升视觉-语言模型在3D场景中的空间推理精度与解释性。

Comments Project Page: https://n3d-vlm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15940 2025-12-19 cs.CV cs.RO 57%

R4: Retrieval-Augmented Reasoning for Vision-Language Models in 4D Spatio-Temporal Space

R4:在4D时空空间中为视觉语言模型引入检索增强推理

Tin Stribor Sohn, Maximilian Dillitzer, Jason J. Corso, Eric Sax

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Esslingen University of Applied Sciences(埃斯林根应用科学大学) Dr. Ing. h.c. F. Porsche AG(德意志联邦汽车工业协会) University of Michigan(密歇根大学) Voxel51 Inc.(Voxel51公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 R4通过构建4D时空知识库,使视觉语言模型具备结构化终身记忆,实现无需训练的检索增强推理,提升动态环境中的具身推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15233 2025-12-19 cs.CV 57%

Null-LoRA: Low-Rank Adaptation on Null Space

Null-LoRA: 在空域上进行低秩适应

Yi Zhang, Yulei Kang, Haoxuan Chen, Jinxuan Li, Jian-Fang Hu

机构 * School of Computer Science(计算机科学学院) Engineering, Sun Yat-sen University, Guangdong, China(工程学院,中山大学,广东,中国)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 Null-LoRA通过在空域上进行低秩适应,提升参数效率和模型效果,在图像-文本检索和视觉问答任务中取得最优表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12977 2025-12-19 cs.CV 57%

VLCache: Computing 2% Vision Tokens and Reusing 98% for Vision-Language Inference

VLCache:计算2%的视觉令牌并重用98%用于视觉-语言推断

Shengling Qin, Hao Yu, Chenxin Wu, Zheng Li, Yizhong Cao, Zhengyang Zhuge, Yuxin Zhou, Wentao Yao, Yi Zhang, Zhengheng Wang, Shuai Bai, Jianwei Zhang, Junyang Lin

机构 * Qwen Team, Alibaba Inc.(通义实验室,阿里巴巴集团)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 VLCache通过重用98%的缓存减少计算量,实现高效视觉-语言推理,精度与全重新计算相当,加速1.2x至16倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15531 2025-12-18 cs.CV 57%

An Efficient and Effective Encoder Model for Vision and Language Tasks in the Remote Sensing Domain

一种用于遥感领域的高效且有效的编码器模型

João Daniel Silva, Joao Magalhaes, Devis Tuia, Bruno Martins

机构 * INESC-ID, Instituto Superior Técnico, University of Lisbon(INESC-ID,理工学院,里斯本大学) Department of Computer Science, Faculty of Science and Technology, Universidade NOVA de Lisboa(计算机科学系,科学与技术学院,诺瓦大学) School of Architecture, Civil and Environmental Engineering, EPFL(建筑、土木和环境工程学院,EPFL)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种高效且紧凑的编码器模型,用于处理遥感领域的多任务学习,包括图像文本生成和跨模态检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15433 2025-12-18 cs.CV 57%

CLIP-FTI: Fine-Grained Face Template Inversion via CLIP-Driven Attribute Conditioning

CLIP-FTI: 通过CLIP驱动的属性条件化实现细粒度面部模板逆向

Longchen Dai, Zixuan Shen, Zhiheng Zhou, Peipeng Yu, Zhihua Xia

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 CLIP-FTI通过CLIP驱动的属性条件化实现细粒度面部模板逆向,提升识别准确性和属性相似性,增强跨模型攻击的可转移性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15254 2025-12-18 cs.CV cs.LG 57%

Assessing the Visual Enumeration Abilities of Specialized Counting Architectures and Vision-Language Models

评估专用计数架构和视觉-语言模型的视觉计数能力

Kuinan Hou, Jing Mi, Marco Zorzi, Lamberto Ballan, Alberto Testolin

机构 * University of Padova(帕多瓦大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文比较了专用计数架构与VLMs在物体计数任务中的性能,发现VLMs在生成中间表示时计数准确率显著提高,但复杂场景计数仍需进一步研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14480 2025-12-17 cs.CV 57%

SuperCLIP: CLIP with Simple Classification Supervision

SuperCLIP:带有简单分类监督的CLIP

Weiheng Zhao, Zilong Huang, Jiashi Feng, Xinggang Wang

机构 * School of EIC, Huazhong University of Science and Technology(华中科技大学电子与信息学院) ByteDance(字节跳动)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 SuperCLIP通过添加轻量级分类监督提升CLIP的细粒度视觉-文本对齐能力,有效提升零样本分类和检索性能。

Comments Accepted by NeurIPS 2025. Code: https://github.com/hustvl/SuperCLIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14137 2025-12-17 cs.CV 57%

Erasing CLIP Memories: Non-Destructive, Data-Free Zero-Shot class Unlearning in CLIP Models

擦除CLIP记忆:非破坏性、无数据零样本类去学习在CLIP模型中

Ashish Mishra, Tarun Kumar, Gyanaranjan Nayak, Arpit Shah, Suparna Bhattacharya, Martin Foltin

机构 * Hewlett Packard Labs(惠普实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种基于空空间投影的非破坏性零样本类去学习方法,有效降低CLIP模型中目标类别的性能,同时保留整体多模态知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14113 2025-12-17 cs.CV 57%

Selective, Controlled and Domain-Agnostic Unlearning in Pretrained CLIP: A Training- and Data-Free Approach

选择性、可控性和领域无关的预训练CLIP模型去学习:一种无需训练和数据的方法

Ashish Mishra, Gyanaranjan Nayak, Tarun Kumar, Arpit Shah, Suparna Bhattacharya, Martin Foltin

机构 * Hewlett Packard Labs(惠普实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种无需训练和数据的CLIP去学习方法,能够实现选择性、可控性和领域无关的模型遗忘,提升模型在不同任务上的适应性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02503 2025-12-17 cs.CV 57%

Adapting General-Purpose Foundation Models for X-ray Ptychography in Low-Data Regimes

为低数据情形下的X射线衍射成像适应通用基础模型

Robinson Umeike, Neil Getty, Yin Xiangyu, Yi Jiang

机构 * The University of Alabama(阿拉巴马大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出PtychoBench基准,通过比较SFT和ICL策略,在低数据环境下优化X射线衍射成像任务的模型适应性,发现任务模态决定最佳专门化路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12487 2025-12-16 cs.CV 57%

More Than the Final Answer: Improving Visual Extraction and Logical Consistency in Vision-Language Models

不止于最终答案:提升视觉提取和逻辑一致性的视觉语言模型

Hoang Anh Just, Yifei Fan, Handong Zhao, Jiuxiang Gu, Ruiyi Zhang, Simon Jenni, Kushal Kafle, Ruoxi Jia, Jing Shi

机构 * Virginia Tech(弗吉尼亚理工大学) Adobe Research(Adobe研究院) Apple(苹果公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 PeRL-VL通过解耦框架提升视觉语言模型的视觉提取和推理一致性,实现Pass@1准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14642 2025-12-16 cs.CV 57%

Relation-R1: Progressively Cognitive Chain-of-Thought Guided Reinforcement Learning for Unified Relation Comprehension

Relation-R1: 逐步认知链式思维引导的强化学习用于统一关系理解

Lin Li, Wei Chen, Jiahui Li, Kwang-Ting Cheng, Long Chen

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 Relation-R1通过整合认知链式思维引导的强化学习,实现了对二元和N元关系的统一理解,提升了视觉-语义定位能力。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17982 2025-12-15 cs.CV 57%

Few-Shot Learning from Gigapixel Images via Hierarchical Vision-Language Alignment and Modeling

通过层次化视觉-语言对齐和建模实现高像素图像的少样本学习

Bryan Wong, Jong Woo Kim, Huazhu Fu, Mun Yong Yi

机构 * KAIST(韩国科学技术院) IHPC, A*STAR(A*STAR研究院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 HiVE-MIL通过层次化视觉-语言对齐和建模,提升高像素图像的少样本学习性能,实现4.1%的宏F1提升。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11060 2025-12-15 cs.CV 57%

Synthetic Vasculature and Pathology Enhance Vision-Language Model Reasoning

合成血管和病理增强视觉-语言模型推理

Chenjun Li, Cheng Wan, Laurin Lux, Alexander Berger, Richard B. Rosen, Martin J. Menten, Johannes C. Paetzold

机构 * Cornell University(康奈尔大学) Weill Cornell Medicine(韦尔·康奈尔医学) Technical University of Munich(慕尼黑技术大学) New York Eye and Ear Infirmary of Mount Sinai(圣文森特医院) Cornell Tech(康奈尔科技)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本研究提出合成血管推理框架,通过生成具有糖尿病视网膜病变特征的图像和文本,提升视觉-语言模型在OCTA图像诊断中的推理能力与病理定位精度。

Comments 23 pages, 8 figures, 6 tables. Full paper under review for MIDL 2026 (Medical Imaging with Deep Learning)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10300 2025-12-12 cs.AI 57%

Investigating The Functional Roles of Attention Heads in Vision Language Models: Evidence for Reasoning Modules

探讨视觉语言模型中注意力头的功能作用:推理模块的证据

Yanbei Jiang, Xueqi Ma, Shu Liu, Sarah Monazam Erfani, Tongliang Liu, James Bailey, Jey Han Lau, Krista A. Ehinger

机构 * The University of Melbourne(墨尔本大学) The University of Sydney(悉尼大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文通过CogVision数据集探讨视觉语言模型中注意力头的功能作用,揭示其在多模态推理中的关键作用及分布特征。

详情

展开后加载摘要…

URL PDF HTML 收藏