arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5058 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5058 篇

2511.09195 2026-01-13 cs.CV 57%

Towards Trustworthy Dermatology MLLMs: A Benchmark and Multimodal Evaluator for Diagnostic Narratives

迈向可信的皮肤科多模态大语言模型:一种基准和多模态评估器用于诊断叙述

Yuhao Shen, Jiahe Qian, Shuping Zhang, Zhangtianyi Chen, Tao Lu, Juexiao Zhou

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Department of Dermatology, The First Affiliated Hospital, Shantou University Medical College(皮肤科,汕头大学医学院第一附属医院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出DermBench和DermEval用于评估皮肤科多模态大语言模型的诊断叙述,通过结合基准和自动评估器,实现临床意义的可重复评估,验证模型性能与专家评分的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21541 2026-01-12 cs.CV 57%

Video Generation Models Are Good Latent Reward Models

视频生成模型是良好的潜在奖励模型

Xiaoyue Mi, Wenqing Yu, Jiesong Lian, Shibo Jie, Ruizhe Zhong, Zijun Liu, Guozhen Zhang, Zixiang Zhou, Zhiyong Xu, Yuan Zhou, Qinglin Lu, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯文元) Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Nanjing University(南京大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出PRFL框架,利用预训练视频生成模型在噪声潜在空间中进行奖励建模,实现高效去噪和降低训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08849 2026-01-08 cs.CV 57%

Adapting Vision-Language Foundation Model for Next Generation Medical Ultrasound Image Analysis

为下一代医学超声图像分析适应视觉-语言基础模型

Jingguo Qu, Xinyang Han, Jia Ai, Juan Wu, Tong Zhao, Tonghuan Xiao, Sheng Ning, Yuqi Yang, Jing Qin, Ann Dorothy King, Winnie Chiu-Wing Chu, Jing Cai, Michael Tin-Cheung Ying

机构 * Department of Health Technology and Informatics, The Hong Kong Polytechnic University(健康科技与信息学系,香港理工大学) Centre for Smart Health and School of Nursing, The Hong Kong Polytechnic University(智能健康中心及护理学院,香港理工大学) Department of Imaging and Interventional Radiology, The Chinese University of Hong Kong(影像与介入放射学系,香港中文大学) Suzhou Hospital of Traditional Chinese Medicine Affiliated to Nanjing University of Chinese Medicine(南京中医药大学附属苏州中医医院) Department of Ultrasound, The Affiliated Changzhou No. 2 People's Hospital of Nanjing Medical University(南京医科大学附属常州第二人民医院超声科)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出混合微调策略,通过频域过滤和多尺度特征聚合提升CLIP模型在超声图像分析中的性能,实现更高效和鲁棒的医学诊断应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03198 2026-01-07 cs.LG 57%

Empowering Reliable Visual-Centric Instruction Following in MLLMs

赋能多模态大语言模型中的可靠指令跟随

Weilei He, Feng Ju, Zhiyuan Fan, Rui Min, Minhao Cheng, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Penn State(宾夕法尼亚州立大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.LG

AI总结 本文提出VC-IFEval基准,通过引入视觉依赖性约束,系统评估多模态大语言模型在指令跟随任务中的性能与改进。

Comments Submitted to ARR Jan

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01915 2026-01-06 cs.CV 57%

TalkPhoto: A Versatile Training-Free Conversational Assistant for Intelligent Image Editing

TalkPhoto: 一种多功能的无需训练的对话式智能图像编辑助手

Yujie Hu, Zecheng Tang, Xu Jiang, Weiqi Li, Jian Zhang

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 TalkPhoto通过对话交互实现无需训练的多功能图像编辑,利用提示模板分层调用现有高级编辑方法,提升编辑精度与质量。

Comments a Conversational Assistant for Intelligent Image Editing

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01870 2026-01-06 cs.CV 57%

Entity-Guided Multi-Task Learning for Infrared and Visible Image Fusion

实体引导的多任务学习用于红外和可见图像融合

Wenyu Shao, Hongbo Liu, Yunchuan Ma, Ruili Wang

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 EGMT通过实体引导的多任务学习方法,提升红外和可见图像融合的语义一致性与质量。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23512 2026-01-01 cs.CL cs.AI 57%

UniHetero: Could Generation Enhance Understanding for Vision-Language-Model at Large Data Scale?

UniHetero:生成能否在大规模数据下增强视觉-语言模型的理解?

Fengjiao Chen, Minhao Jing, Weitao Lu, Yan Feng, Xiaoyu Li, Xuezhi Cao

机构 * Meituan, Beijing, China(美团,北京,中国)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 UniHetero通过大规模预训练探索生成对视觉-语言模型理解的增强作用,发现语义层面生成有效,而像素层面生成会导致理解性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22681 2026-01-01 cs.CV 57%

CritiFusion: Semantic Critique and Spectral Alignment for Faithful Text-to-Image Generation

CritiFusion: 语义批评与频谱对齐用于忠实的文本到图像生成

ZhenQi Chen, TsaiChing Ni, YuanFu Yang

机构 * National Yang Ming Chiao Tung University

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 CritiFusion通过语义批评和频谱对齐提升文本到图像生成的忠实度和细节质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23787 2026-01-01 cs.LG stat.CO stat.ME 57%

TabMixNN: A Unified Deep Learning Framework for Structural Mixed Effects Modeling on Tabular Data

TabMixNN:一种用于表格数据结构混合效应建模的统一深度学习框架

Deniz Akdemir

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 TabMixNN是一种结合经典混合效应建模与现代神经网络的统一深度学习框架,支持多种结果类型和复杂数据结构,提供灵活的模块化架构和全面的可解释性工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23546 2025-12-30 cs.CV 57%

PurifyGen: A Risk-Discrimination and Semantic-Purification Model for Safe Text-to-Image Generation

PurifyGen:一种用于安全文本到图像生成的风险判别和语义净化模型

Zongsheng Cao, Yangfan He, Anran Liu, Jun Xie, Feng Chen, Zepeng Wang

机构 * Researcher(研究者)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 PurifyGen通过双阶段策略实现安全文本到图像生成,通过语义距离评估和双空间转换净化危险提示,减少不安全内容生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16531 2025-12-30 cs.AI 57%

Scaling Laws for Energy Efficiency of Local LLMs

本地大语言模型和视觉-语言模型的扩展定律

Ander Alvarez, Alessandro Genuardi, Nilotpal Sinha, Antonio Tiene, Mikail Okyay, Bakbergen Ryskulov, David Montero, Samuel Mugel, Román Orús

机构 * Multiverse Computing Donostia International Physics Center Ikerbasque Foundation for Science Multiverse Computing, Centre for Social Innovation

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 研究揭示了本地大语言模型和视觉-语言模型在中央处理单元上的计算扩展定律,并展示了量子启发压缩在降低能耗和资源消耗方面的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15560 2025-12-30 cs.CV 57%

GRAN-TED: Generating Robust, Aligned, and Nuanced Text Embedding for Diffusion Models

GRAN-TED: 生成稳健、对齐且细腻的文本嵌入以用于扩散模型

Bozhou Li, Sihan Yang, Yushuo Guan, Ruichuan An, Xinlong Chen, Yang Shi, Pengfei Wan, Wentao Zhang, Yuanxing zhang

机构 * Peking University(北京大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Xi’an Jiaotong University(西安交通大学) School of Artificial Intelligence, UCAS(清华大学人工智能学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 GRAN-TED提出了一种生成稳健、对齐且细腻的文本嵌入以用于扩散模型的范式,通过TED-6K基准提升文本编码器性能,显著加快扩散模型训练速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22568 2025-12-30 cs.AI physics.bio-ph q-bio.NC 57%

Lessons from Neuroscience for AI: How integrating Actions, Compositional Structure and Episodic Memory could enable Safe, Interpretable and Human-Like AI

从神经科学中汲取教训:如何通过整合动作、组合结构和事件记忆来实现安全、可解释和类人的人工智能

Rajesh P. N. Rao, Vishwas Sathish, Linxing Preston Jiang, Matthew Bryan, Prashant Rangarajan

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 通过整合动作、组合结构和事件记忆,改进基础模型以实现安全、可解释和类人的人工智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07015 2025-12-29 cs.CL cs.AI cs.IR 57%

FVA-RAG: Falsification-Verification Alignment for Mitigating Sycophantic Hallucinations

FVA-RAG:通过对抗性上下文对齐缓解趋炎附势幻觉

Mayank Ravishankara

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 FVA-RAG通过引入对抗性上下文检索,有效缓解了因前提错误导致的幻觉问题,其在多个基准测试中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21508 2025-12-29 cs.CV 57%

Fixed-Budget Parameter-Efficient Training with Frozen Encoders Improves Multimodal Chest X-Ray Classification

固定预算参数高效训练结合冻结编码器提升多模态胸片分类

Md Ashik Khan, Md Nahid Siddique

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Kharagpur, India(计算机科学与工程系,印度理工学院Kharagpur分校) Knight Foundation School of Computing and Information Sciences, Florida International University, Florida, USA(骑士基金会计算与信息科学学院,佛罗里达国际大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本研究通过冻结编码器的参数高效训练策略,在降低计算成本的同时提升了多模态胸片分类的性能。

Comments Accepted at the 2025 28th International Conference on Computer and Information Technology (ICCIT). 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21450 2025-12-29 cs.LG 57%

RLLaVA: An RL-central Framework for Language and Vision Assistants

RLLaVA: 一种面向语言和视觉助手的强化学习中心框架

Lei Zhao, Zihao Ma, Boyu Lin, Yuhe Liu, Wenjun Wu, Lei Huang

机构 * SKLCCSE, Institute of Artificial Intelligence, Beihang University, Beijing, China(信息与电子技术学院,人工智能研究院,北京航空航天大学,北京,中国) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University(未来区块链与隐私计算先进创新中心,北京航空航天大学) Hangzhou International Innovation Institute, Beihang University, Hangzhou, China(杭州国际创新研究院,北京航空航天大学,杭州,中国)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

AI总结 RLLaVA 提出了一种强化学习中心框架,通过解耦算法逻辑与模型架构,实现高效训练和多任务扩展,提升视觉-语言模型性能。

Comments The code is available at https://github.com/TinyLoopX/RLLaVA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20556 2025-12-24 cs.CV 57%

Multi-Grained Text-Guided Image Fusion for Multi-Exposure and Multi-Focus Scenarios

多粒度文本引导图像融合用于多曝光和多聚焦场景

Mingwei Tang, Jiahao Nie, Guang Yang, Ziqing Cui, Jie Li

机构 * Xidian University(西安电子科技大学) Nanyang Technological University(新加坡国立大学) Xi’an University of Technology(西安理工大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出MTIF方法,通过多粒度文本描述和跨模态调节模块提升多曝光和多聚焦图像融合性能。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19234 2025-12-23 cs.AI 57%

DeliveryBench: Can Agents Earn Profit in Real World?

DeliveryBench: 代理在现实世界中能否获利?

Lingjun Mao, Jiawei Ren, Kun Zhou, Jixuan Chen, Ziqiao Ma, Lianhui Qin

机构 * University of California, San Diego(加州大学圣地亚哥分校) University of Michigan(密歇根大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.AI

AI总结 DeliveryBench通过模拟现实世界中的食品配送任务,评估基于VLM的具身代理在长期规划和约束管理方面的性能,发现其与人类存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18813 2025-12-23 cs.CV 57%

Revealing Perception and Generation Dynamics in LVLMs: Mitigating Hallucinations via Validated Dominance Correction

揭示LVLMs中的感知与生成动态:通过验证主导修正缓解幻觉

Guangtao Lyu, Xinyi Cheng, Chenghao Xu, Qi Liu, Muli Yang, Fen Fang, Huilin Chen, Jiexi Yan, Xu Yang, Cheng Deng

机构 * School of Electronic Engineering, Xidian University(电子科技大学电子工程学院) School of Computer Science and Technology, Xidian University(电子科技大学计算机科学与技术学院) Hohai university(河海大学) Institute for Infocomm Research (I 2 R), A*STAR(信息通信研究所(I2R)) School of Foreign Languages, Xidian University(电子科技大学外国语言学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出VDC策略,通过验证主导修正缓解LVLMs中的幻觉问题,揭示感知与生成的动态机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17436 2025-12-23 cs.CV 57%

Xiaomi MiMo-VL-Miloco Technical Report

小米 MiMo-VL-Miloco 技术报告

Jiaze Li, Jingyang Chen, Yuxun Qu, Shijie Xu, Zhenru Lin, Junyou Zhu, Boshen Xu, Wenhui Tan, Pei Fu, Jianzhong Ju, Zhenbo Luo, Jian Luan

机构 * Xiaomi(小米)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 小米提出 MiMo-VL-Miloco 模型,专为家庭场景设计,通过两阶段训练提升多模态推理与家庭场景理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18007 2025-12-23 cs.RO cs.CV 57%

Robotic VLA Benefits from Joint Learning with Motion Image Diffusion

机器人VLA通过与运动图像扩散的联合学习获益

Yu Fang, Kanchana Ranasinghe, Le Xue, Honglu Zhou, Juntao Tan, Ran Xu, Shelby Heinecke, Caiming Xiong, Silvio Savarese, Daniel Szafir, Mingyu Ding, Michael S. Ryoo, Juan Carlos Niebles

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 本文提出通过联合学习与运动图像扩散提升机器人VLA模型的运动推理能力,实验表明在多个基准测试中显著提升了性能。

Comments Website: https://vla-motion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02190 2025-12-23 cs.RO cs.LG 57%

cVLA: Towards Efficient Camera-Space VLAs

cVLA:迈向高效的相机空间VLA

Max Argus, Jelena Bratulic, Houman Masnavi, Maxim Velikanov, Nick Heppert, Abhinav Valada, Thomas Brox

机构 * University of Freiburg(弗赖堡大学)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.LG

AI总结 cVLA通过利用视觉语言模型在2D图像上的性能,提出了一种高效预测机器人轨迹的VLA方法,具备良好的仿真到现实迁移能力。

Comments 20 pages, 10 figures; CoRL 2025 Workshop on Generalizable Priors for Robot Manipulation

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13274 2025-12-23 cs.LG cs.CL 57%

AdaLRS: Loss-Guided Adaptive Learning Rate Search for Efficient Foundation Model Pretraining

AdaLRS: 基于损失的自适应学习率搜索用于高效基础模型预训练

Hongyuan Dong, Dingkang Yang, Xiao Liang, Chao Feng, Jiao Ran

机构 * ByteDance Inc.(字节跳动公司)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.LG

AI总结 AdaLRS通过优化损失下降速度实现高效基础模型预训练,无需大量超参数调优,显著提升模型性能和鲁棒性。

Comments NeurIPS 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17189 2025-12-22 cs.CV 57%

Anatomical Region-Guided Contrastive Decoding: A Plug-and-Play Strategy for Mitigating Hallucinations in Medical VLMs

解剖区域引导的对比解码:一种用于缓解医学视觉-语言模型幻觉的即插即用策略

Xiao Liang, Chenxi Liu, Zhi Ma, Di Wang, Bin Jing, Quan Wang, Yuanyuan Shi

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出了解剖区域引导的对比解码策略,通过区域特定指导缓解医学视觉-语言模型的幻觉问题,提升诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17121 2025-12-22 cs.LG 57%

The Effect of Negation on CLIP in Medical Imaging: Limitations of Contrastive Language-Image Pretraining

否定对CLIP在医学影像中的影响:对比语言-图像预训练的局限性

Jasmine Vu, Shivanand Sheshappanavar

机构 * Santa Clara University(圣克拉拉大学) University of Wyoming(怀俄明大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

AI总结 研究探讨CLIP在医学影像中处理否定短语的局限性,并通过调优方法提升其检索准确性与可靠性。

Comments 10 pages, 7 figures, submitted to WACV Pixels to Patients Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20322 2025-12-19 cs.CV 57%

HyperET: Efficient Training in Hyperbolic Space for Multi-modal Large Language Models

HyperET: 在超几何空间中为多模态大语言模型实现高效训练

Zelin Peng, Zhengqin Xu, Qingyang Liu, Xiaokang Yang, Wei Shen

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, SJTU(摩埃人工智能重点实验室、人工智能学院、计算机科学学院、上海交通大学)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

AI总结 HyperET通过在双曲空间中动态调整半径,实现多模态大语言模型的高效训练,提升跨模态对齐性能。

Comments Accepted by NeurIPS2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15531 2025-12-18 cs.CV 57%

An Efficient and Effective Encoder Model for Vision and Language Tasks in the Remote Sensing Domain

一种用于遥感领域的高效且有效的编码器模型

João Daniel Silva, Joao Magalhaes, Devis Tuia, Bruno Martins

机构 * INESC-ID, Instituto Superior Técnico, University of Lisbon(INESC-ID,理工学院,里斯本大学) Department of Computer Science, Faculty of Science and Technology, Universidade NOVA de Lisboa(计算机科学系,科学与技术学院,诺瓦大学) School of Architecture, Civil and Environmental Engineering, EPFL(建筑、土木和环境工程学院,EPFL)

专题命中 VLM训练与架构 :visual question answering(abstract);分类 cs.CV

AI总结 本文提出了一种高效且紧凑的编码器模型,用于处理遥感领域的多任务学习,包括图像文本生成和跨模态检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13072 2025-12-16 cs.CV 57%

Forging a Dynamic Memory: Retrieval-Guided Continual Learning for Generalist Medical Foundation Models

锻造动态记忆:基于检索的持续学习用于通用医学基础模型

Zizhi Chen, Yizhen Gao, Minghao Han, Yizhou Liu, Zhaoyu Chen, Dingkang Yang, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing(智能机器人与先进制造学院) Fudan University(复旦大学) Fysics Intelligence Technologies Co., Ltd. (Fysics AI)(Fysics智能技术有限公司(Fysics AI)) School of Computer Science and Engineering(计算机科学与工程学院) Central South University(中南大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出基于检索的持续学习方法,通过动态知识蒸馏和RAG技术,解决多模态医学模型在领域迁移和细粒度特征保留中的核心难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12503 2025-12-16 cs.AI 57%

KidsArtBench: Multi-Dimensional Children's Art Evaluation with Attribute-Aware MLLMs

KidsArtBench: 多维度儿童艺术评估与属性感知的大语言模型

Mingrui Ye, Chanjin Zheng, Zengyi Yu, Chenyu Xiang, Zhixue Zhao, Zheng Yuan, Helen Yannakoudakis

机构 * King’s College London(伦敦国王学院) East China Normal University(东华大学) University of Sheffield(谢菲尔德大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

AI总结 KidsArtBench通过属性感知的多LoRA方法提升儿童艺术评估的准确性与教育意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07128 2025-12-16 cs.CV 57%

MulCLIP: A Multi-level Alignment Framework for Enhancing Fine-grained Long-context CLIP

MulCLIP: 一种多级对齐框架,用于增强细粒度长上下文CLIP

Chau Truong, Hieu Ta Quang, Dung D. Le

机构 * FPT Software AI Center(FPT软件人工智能中心) VinUniversity(文大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 MulCLIP通过多级对齐框架提升细粒度长上下文CLIP的性能,采用标记重建和子描述聚合策略增强语义连接与上下文提取。

详情

展开后加载摘要…

URL PDF HTML 收藏