arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5058 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5058 篇

2604.05445 2026-04-08 cs.CL cs.AI cs.CV 62%

Learning What Matters: Dynamic Dimension Selection and Aggregation for Interpretable Vision-Language Reward Modeling

学习什么重要:可解释视觉语言奖励建模的动态维度选择与聚合

Qiyuan Chen, Hongsen Huang, Jiahe Chen, Qian Shao, Jintai Chen, Hongxia Xu, Renjie Hua, Chuan Ren, Jian Wu

机构 * Zhejiang University(浙江大学) Soochow Securities Co.,Ltd.(东吴证券股份有限公司) HKUST(GZ)(香港科技大学(广州)) Nanjing University(南京大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VL-MDR框架,通过动态分解评价为细粒度可解释维度,提升视觉语言奖励建模的可解释性与效率,实验显示其在基准测试中优于现有模型,并有效缓解视觉幻觉。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05831 2026-04-08 cs.LG cs.AI 62%

HeartcareGPT: A Unified Multimodal ECG Suite for Dual Signal-Image Modeling and Understanding

HeartcareGPT:一种统一的多模态ECG套件,用于双信号-图像建模与理解

Yihan Xie, Sijing Li, Tianwei Lin, Zhuonan Wang, Chenglin Yang, Yu Zhong, Wenjie Yan, Wenqiao Zhang, Xiaogang Guo, Jun Xiao, Yueting Zhuang, Beng Chin Ooi

机构 * Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出HeartcareGPT,通过Dual Stream Projection Alignment机制,实现ECG信号与图像的统一建模,提升多视角ECG理解能力,并建立医学多模态大语言模型向生理信号领域扩展的方法论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00727 2026-04-08 cs.LG cs.CR cs.CV 62%

Perturb and Recover: Fine-tuning for Effective Backdoor Removal from CLIP

扰动与恢复:用于从CLIP中有效移除后门的微调

Naman Deep Singh, Francesco Croce, Matthias Hein

机构 * University of Tübingen & Tübingen AI Center(蒂宾根大学 & 蒂宾根人工智能中心) EPFL(瑞士联邦理工学院洛桑)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出PAR机制,通过微调有效移除CLIP中的后门,实验表明其在不同编码器和攻击类型上均能保持良好性能,且无需真实训练数据。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03114 2026-04-06 cs.CV cs.AI 62%

Can VLMs Truly Forget? Benchmarking Training-Free Visual Concept Unlearning

VLMs真的能忘记吗?基于免训练的视觉概念反向学习基准测试

Zhangyun Tan, Zeliang Zhang, Susan Liang, Yolo Yunlong Tang, Lisha Chen, Chenliang Xu

机构 * University of Rochester(罗切斯特大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VLM-UnBench,首个评估VLM免训练视觉概念反向学习的基准,通过四层遗忘等级、七源数据集和十一概念轴,验证提示对概念抑制的真实效果,发现对象和场景概念最难抑制,提示级抑制与真实视觉概念擦除存在明显差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02689 2026-04-06 cs.CV cs.AI 62%

Efficient3D: A Unified Framework for Adaptive and Debiased Token Reduction in 3D MLLMs

Efficient3D: 一种用于3D多模态大语言模型中自适应和去偏token减少的统一框架

Yuhui Lin, Siyue Yu, Yuxing Yang, Guangliang Cheng, Jimin Xiao

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学) University of Liverpool(利物浦大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Efficient3D框架,通过去偏视觉token重要性估计器和自适应token再平衡策略,实现3D MLLMs的高效推理,提升性能并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02477 2026-04-06 cs.CV cs.LG 62%

Guideline2Graph: Profile-Aware Multimodal Parsing for Executable Clinical Decision Graphs

Guideline2Graph:面向可执行临床决策图的多模态解析

Onur Selim Kilic, Yeti Z. Gurbuz, Cem O. Yaldiz, Afra Nawar, Etrit Haxholli, Ogul Can, Eli Waxman

机构 * Georgia Institute of Technology(佐治亚理工学院) MetaDialog Infuse Inc(Infuse公司)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出一种多模态解析方法,通过拓扑感知分块、接口约束分块生成和溯源保留的全局聚合,将完整指南证据转换为可执行临床决策支持图。实验表明,该方法在前列腺指南基准上显著提升了精度和召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08980 2026-04-06 cs.CV cs.AI 62%

Training Multi-Image Vision Agents via End2End Reinforcement Learning

通过端到端强化学习训练多图像视觉代理

Chengqi Dong, Chuhuai Yue, Hang He, Rongge Mao, Fenghe Tang, S Kevin Zhou, Zekun Xu, Xiaohan Wang, Jiajun Chai, Guojun Yin

机构 * MeiTuan(美团) University of Science and Technology of China(中国科学技术大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出IMAgent,通过端到端强化学习训练视觉代理,解决多图像问答任务中的输入限制问题,通过设计视觉反思和验证工具提升模型注意力,首次从注意力角度揭示工具使用对性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02324 2026-04-03 cs.CL cs.AI cs.LG 62%

Grounded Token Initialization for New Vocabulary in LMs for Generative Recommendation

为生成推荐系统中的新词汇提供基础性词 token 初始化

Daiwei Chen, Zhoutong Fu, Chengming Jiang, Haichao Zhang, Ran Zhou, Tan Wang, Chunnan Yao, Guoyao Li, Rui Cai, Yihan Cao, Ruijie Jiang, Fedor Borisyuk, Jianqiang Shen, Jingwei Wu, Ramya Korlakai Vinayak

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) LinkedIn Corporation(领英公司) Northeastern University(东北大学) University of California, Davis(加州大学戴维斯分校)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GTI方法,通过在预训练嵌入空间中语义地初始化新词汇,提升生成推荐系统性能,优于传统均值初始化和辅助任务适应方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02289 2026-04-03 cs.CV cs.AI 62%

Omni123: Exploring 3D Native Foundation Models with Limited 3D Data by Unifying Text to 2D and 3D Generation

Omni123:通过统一文本到2D和3D生成探索有限3D数据的3D原生基础模型

Chongjie Ye, Cheng Cao, Chuanyu Pan, Yiming Hao, Yihao Zhi, Yuanming Hu, Xiaoguang Han

机构 * FNii-Shenzhen(FNii-深圳) SSE, CUHK(SZ)(香港中文大学(深圳)理工学院) Meshy AI

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 Omni123通过统一文本到2D和3D生成,利用文本-图像-3D的跨模态一致性作为隐式约束,提升3D生成的几何一致性与语义对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01941 2026-04-03 cs.CV cs.AI 62%

Captioning Daily Activity Images in Early Childhood Education: Benchmark and Algorithm

在早期教育中的日常活动图像描述:基准和算法

Sixing Li, Zhibin Gu, Ziqi Zhang, Weiguo Pan, Bing Li, Ying Wang, Hongzhe Liu

机构 * School of Robotics, Beijing Union University(北京联合大学机器人学院) College of Computer and Cyber Security, Hebei Normal University(河北师范大学计算机与网络安全学院) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) National Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院) PeopleAI, Inc.(人民人工智能公司) People Youhe Education Technology Co., Ltd.(人民优和教育科技有限公司)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ECAC基准和RSRS算法,通过专家标注和细粒度标签提升早期教育图像描述的专业性,实验显示KinderMM-Cap-3B在TTS上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22294 2026-04-03 cs.CV cs.LG 62%

Structure is Supervision: Multiview Masked Autoencoders for Radiology

结构是监督:用于放射学的多视图掩码自编码器

Sonia Laguna, Andrea Agostini, Alain Ryser, Samuel Ruiperez-Campillo, Irene Cannistraci, Moritz Vandenhirtz, Stephan Mandt, Nicolas Deperrois, Farhad Nooralahzadeh, Michael Krauthammer, Thomas M. Sutter, Julia E. Vogt

机构 * Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系) Department of Computer Science, UC Irvine(加州大学尔湾分校计算机科学系) Department of Quantitative Biomedicine, University of Zurich(苏黎世大学定量生物医学系)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出多视图掩码自编码器(MVMAE),通过利用放射学研究的多视图结构学习视图不变和疾病相关表征,并在三个公开数据集上验证了其在疾病分类任务中的优越性能。

Journal ref Transactions on Machine Learning Research (TMLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00886 2026-04-02 cs.CV cs.AI cs.CL 62%

PixelPrune: Pixel-Level Adaptive Visual Token Reduction via Predictive Coding

PixelPrune: 通过预测编码实现像素级的视觉令牌减少

Nan Wang, Zhiwei Jin, Chen Chen, Haonan Lu

机构 * OPPO AI Center(OPPO AI中心)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 PixelPrune通过预测编码压缩技术,在视觉变换器编码器前消除冗余像素块,提升文档和GUI任务的推理速度和训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00279 2026-04-02 cs.CV cs.AI 62%

The Geometry of Compromise: Unlocking Generative Capabilities via Controllable Modality Alignment

妥协的几何学:通过可控的模态对齐解锁生成能力

Hongyuan Liu, Qinli Yang, Wen Li, Zhong Zhang, Jiaming Liu, Wei Han, Zhili Qin, Jinxia Guo, Junming Shao

机构 * University of Electronic Science and Technology of China(电子科技大学) University of Bristol(布里斯托大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文通过几何分析揭示模态间隙的两个组成部分,提出TPC-CMA框架以减少两者,显著提升跨模态对齐性能,实验显示在不同目标α下模态间隙大幅降低,同时保持高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29852 2026-04-01 cs.GR cs.AI cs.CV 62%

VectorGym: A Multitask Benchmark for SVG Code Generation, Sketching, and Editing

VectorGym:一个多任务基准用于SVG代码生成、草图和编辑

Juan Rodriguez, Haotian Zhang, Abhay Puri, Tianyang Zhang, Rishav Pramanik, Meng Lin, Xiaoqing Xie, Marco Terral, Darsh Kaushik, Aly Shariff, Perouz Taslakian, Spandana Gella, Sai Rajeswar, David Vazquez, Christopher Pal, Marco Pedersoli

机构 * ServiceNow Research(ServiceNow 研究院) Mila, Quebec AI Institute(Mila 魁北克人工智能研究所) Columbia University(哥伦比亚大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Stony Brook University(石溪大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Minzu University of China(中央民族大学) University of Waterloo(滑铁卢大学) Canada CIFAR AI Chair(加拿大 CIFAR 人工智能讲席) Computer Vision Center(计算机视觉中心)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 VectorGym提出一个涵盖SVG生成、复杂编辑和视觉理解的多任务基准,通过专家标注解决现有基准的不足,采用多任务强化学习方法,训练出性能领先的Qwen3-VL模型,公开可用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29258 2026-04-01 cs.CV cs.AI 62%

Omni-NegCLIP: Enhancing CLIP with Front-Layer Contrastive Fine-Tuning for Comprehensive Negation Understanding

Omni-NegCLIP:通过前层对比微调增强CLIP以实现全面否定理解

Jingqi Xu

机构 * University of Southern California(南加州大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Omni-NegCLIP,通过修改CLIP的InfoNCE损失函数,改进其对存在性和缺失性否定表达的理解能力,实验显示在否定任务中性能提升显著,且不牺牲图像-文本检索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29211 2026-04-01 cs.AI cs.CL cs.CV 62%

Xuanwu: Evolving General Multimodal Models into an Industrial-Grade Foundation for Content Ecosystems

玄武:将通用多模态模型演进为内容生态系统工业级基础模型

Zhiqian Zhang, Xu Zhao, Xiaoqing Xu, Guangdong Liang, Weijia Wang, Xiaolei Lv, Bo Li, Jun Gao

机构 * Computational Intelligence Dept, Hello Group Inc(Hello Group Inc. 计算智能部)

专题命中 VLM训练与架构 :InternVL(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Xuanwu VL-2B,通过三阶段训练流程平衡业务专精与通用能力,实现7项多模态指标平均67.90分,7项业务审核任务召回率94.38%,在对抗性OCR场景中超越Gemini-2.5-Pro。

Comments 41 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28605 2026-03-31 cs.CV cs.CY cs.LG 62%

Unsafe2Safe: Controllable Image Anonymization for Downstream Utility

Unsafe2Safe: 可控图像匿名化以保障下游效用

Mih Dinh, SouYoung Jin

机构 * Dartmouth College(达特茅斯学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 Unsafe2Safe通过多模态引导的扩散编辑实现图像隐私保护,减少敏感信息并保持下游任务性能。

Comments Accepted at CVPR 2026 and CVPR 2026 Workshop on Machine Unlearning for Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10932 2026-03-31 cs.CV cs.AI 62%

BabyVLM-V2: Toward Developmentally Grounded Pretraining and Benchmarking of Vision Foundation Models

BabyVLM-V2:迈向基于发展基础的视觉基础模型预训练与基准测试

Shengao Wang, Wenqi Wang, Zecheng Wang, Max Whitton, Michael Wakeham, Arjun Chandra, Joey Huang, Pengyue Zhu, Helen Chen, David Li, Jeffrey Li, Shawn Li, Andrew Zagula, Amy Zhao, Andrew Zhu, Sayaka Nakamura, Yuki Yamamoto, Jerry Jun Yokono, Aaron Mueller, Bryan A. Plummer, Kate Saenko, Venkatesh Saligrama, Boqing Gong

机构 * Boston University(波士顿大学) Sony Group Corporation(索尼集团公司)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 BabyVLM-V2通过纵向多维预训练集、灵活模型和DevCV工具箱,提升婴儿启发式视觉语言模型性能,实验证明其在基准测试中表现优异。

Comments Accepted to CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26049 2026-03-30 cs.CV cs.AI 62%

Seeing Like Radiologists: Context- and Gaze-Guided Vision-Language Pretraining for Chest X-rays

像放射科医生一样观察:面向胸部X光片的上下文和目光引导的视觉-语言预训练

Kang Liu, Zhuoqi Ma, Siyu Liang, Yunan Li, Xiyue Gao, Chao Liang, Kun Xie, Qiguang Miao

机构 * Xidian University(西安电子科技大学) Wuhan University(武汉大学)

专题命中 VLM训练与架构 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CoGaze框架,通过整合临床上下文和放射科医生目光引导,提升胸部X光片的视觉-语言预训练效果,实验显示在多个任务上均优于现有方法。

Comments Code: https://github.com/mk-runner/CoGaze

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02650 2026-03-30 cs.CV cs.LG cs.MM cs.SD eess.AS 62%

Hear What Matters! Text-conditioned Selective Video-to-Audio Generation

听重点!基于文本的视频到音频生成

Junwon Lee, Juhan Nam, Jiyoung Lee

机构 * Graduate School of Cultural Technology, KAIST(韩国科学技术院文化技术研究生院) Division of AI and Software, Ewha Womans University(梨花女子大学人工智能与软件学部)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出基于文本的视频到音频生成任务,通过文本提示选择性提取视频中相关声音源,提升多对象视频音频处理精度。SELVA模型通过文本提示选择视频编码器中的视觉特征,结合补充标记和自监督学习提升音频质量与同步性。

Comments accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25942 2026-03-30 cs.CV cs.AI 62%

Reinforcing Structured Chain-of-Thought for Video Understanding

强化结构链式思考以提升视频理解

Peiyao Wang, Haotian Xu, Noranart Vesdapunt, Rui Hou, Jingyi Zhang, Haibin Ling, Oleksandr Obiednikov, Ning Zhou, Kah Kuen Fu

机构 * Stony Brook University(石溪大学) Amazon(亚马逊)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SDRL框架,通过结构化链式思考格式和自监督机制,解决多模态大语言模型在视频理解中的推理漂移和时间感知问题,实现单阶段强化学习,提升模型泛化能力。

Comments Accepted to CVPR 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25145 2026-03-27 cs.CV cs.LG 62%

Learning to Rank Caption Chains for Video-Text Alignment

学习排名图注链以实现视频-文本对齐

Ansel Blume, Burak Uzkent, Shalini Chaudhuri, Garin Kessler

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon Prime Video(亚马逊Prime Video)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出通过重复图注退化生成大规模挑战性图注链,改进视频-文本对齐的排名优化方法,优于二元DPO并在长形式内容生成中表现更优,需对视觉编码器进行微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24965 2026-03-27 cs.CV cs.AI 62%

Self-Corrected Image Generation with Explainable Latent Rewards

可解释性潜在奖励的自校正图像生成

Yinyi Luo, Hrishikesh Gokhale, Marios Savvides, Jindong Wang, Shengfeng He

机构 * Carnegie Mellon University(卡内基梅隆大学) Singapore Management University(新加坡管理大学) William & Mary(威廉与玛丽学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出xLARD框架,利用多模态大语言模型通过可解释性潜在奖励指导生成,改进语义对齐和视觉保真度,同时保持生成先验。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22593 2026-03-26 cs.CV cs.AI 62%

Language Models Can Explain Visual Features via Steering

语言模型可通过引导解释视觉特征

Javier Ferrando, Enrique Lopez-Cuena, Pablo Agustin Martin-Torres, Daniel Hinjos, Anna Arias-Duart, Dario Garcia-Gasulla

机构 * Barcelona Supercomputing Center(巴塞罗那超级计算中心)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过因果干预引导语言模型解释视觉特征,提供了一种可扩展的替代方法,提升视觉模型的可解释性。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13119 2026-03-26 cs.CV cs.AI 62%

Geometry-Guided Camera Motion Understanding in VideoLLMs

基于几何的视频LLMs中相机运动理解

Haoan Feng, Sri Harsha Musunuri, Guan-Ming Su

机构 * University of Maryland, College Park(马里兰大学College Park分校) Dolby Laboratories Inc.(杜比实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过基准测试、诊断和注入框架,解决视频LLMs中相机运动表示不足的问题,通过CameraMotionDataset和CameraMotionVQA基准,提升模型对相机运动的识别能力。

Comments 10 pages, 7 figures, supplementary included CVPR2026 PVUW

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02566 2026-03-26 cs.CV cs.AI 62%

From Panel to Pixel: Zoom-In Vision-Language Pretraining from Biomedical Scientific Literature

从面板到像素:从生物医学科学文献中进行缩放视觉-语言预训练

Kun Yuan, Min Woo Sun, Zhen Chen, Alejandro Lozano, Xiangteng He, Shi Li, Nassir Navab, Xiaoxiao Sun, Nicolas Padoy, Serena Yeung-Levy

机构 * University of Strasbourg, CNRS, INSERM, ICube, UMR7357, Strasbourg, France(斯特拉斯堡大学、法国国家科学研究中心、法国国家医学研究院、ICube、UMR7357、斯特拉斯堡,法国) Technical University of Munich(慕尼黑技术大学) Stanford University(斯坦福大学) DSAI, The Hong Kong Polytechnic University(香港理工大学DSAI实验室) University of British Columbia(不列颠哥伦比亚大学) Munich Center for Machine Learning(慕尼黑机器学习中心) IHU Strasbourg, Strasbourg(斯特拉斯堡IHU医院,斯特拉斯堡) Vector Institute for AI(人工智能向量研究所) Yale University(耶鲁大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Panel2Patch方法,通过挖掘生物医学文献中的层次结构,生成多粒度监督,提升视觉-语言预训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23308 2026-03-25 cs.CV cs.AI 62%

Curriculum-Driven 3D CT Report Generation via Language-Free Visual Grafting and Zone-Constrained Compression

基于课程学习的3D CT报告生成:通过无语言视觉移植与区域约束压缩

V. K. Cody Bumgardner, Mitchell A. Klusty, Mahmut S. Gokmen, Evan W. Damron

机构 * Center for Applied Artificial Intelligence, University of Kentucky(应用人工智能中心,肯塔基大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Ker-VLJEPA-3B框架,通过四阶段课程学习生成胸腔CT报告,采用无语言视觉主干和区域约束压缩提升生成质量,实验显示其在CT-RATE基准上取得更高F1分数。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13232 2026-03-24 cs.CV cs.AI 62%

What "Not" to Detect: Negation-Aware VLMs via Structured Reasoning and Token Merging

不应检测什么:通过结构化推理和标记合并的否定意识VLMs

Inha Kang, Youngsun Lim, Seonho Lee, Jiho Choi, Junsuk Choe, Hyunjung Shim

机构 * KAIST AI(韩国科学技术院人工智能实验室) Boston University(波士顿大学) Sogang University(成均馆大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CoVAND数据集和NegToMe模块,通过结构化推理和标记合并解决VLMs的否定理解问题,提升检测任务的准确率和泛化能力。

Comments 56 pages

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21232 2026-03-24 cs.CV cs.AI 62%

QMoP: Query Guided Mixture-of-Projector for Efficient Visual Token Compression

QMoP:基于查询的混合投影器用于高效的视觉令牌压缩

Zhongyang Li, Yaqian Li, Faming Fang, Rinyoichi Takezoe, Zi-Hao Bo, Cheng Qian, Mo Guang, Guixu Zhang, Kaiwen Long

机构 * East China Normal University(华东师范大学) Li Auto Inc(Li汽车公司)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出QMoP框架,通过三种协作分支实现视觉令牌的自适应压缩,结合查询引导路由和专家融合机制,提升效率并减少资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17655 2026-03-24 cs.CV cs.AI 62%

Interpretable Cross-Domain Few-Shot Learning with Rectified Target-Domain Local Alignment

可解释的跨领域少样本学习与修正的目标域局部对齐

Yaze Zhao, Yixiong Zou, Yuhua Li, Ruixuan Li

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CC-CDFSL方法,通过循环一致性解决CLIP-based CDFSL中的局部对齐问题,提升局部视觉语言对齐和可解释性,实现SOTA性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏