arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5058 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5058 篇

2510.14543 2026-04-14 cs.CV 57%

Exploring Cross-Modal Flows for Few-Shot Learning

探索跨模态流用于少样本学习

Ziqi Jiang, Yanghao Wang, Long Chen

机构 * Department of CSE, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出跨模态流匹配对齐(FMA)方法,通过多步调整提升跨模态对齐精度与鲁棒性,在多种基准和模型上均取得显著性能提升。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07462 2026-04-14 cs.AI 57%

Do Machines Fail Like Humans? A Human-Centred Out-of-Distribution Spectrum for Mapping Error Alignment

机器是否像人类一样失败?一种以人为中心的分布外谱系用于映射误差对齐

Binxia Xu, Xiaoliang Luo, Luke Dickens, Robert M. Mok

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出以人为中心的分布外谱系,通过量化刺激偏离参考集的程度,揭示不同深度学习架构在近分布外和远分布外条件下的模型-人类对齐差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21334 2026-04-13 cs.CV 57%

Streaming Video Instruction Tuning

流式视频指令微调

Jiaer Xia, Peixian Chen, Mengdan Zhang, Xing Sun, Kaiyang Zhou

机构 * Hong Kong Baptist University(香港浸会大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 本文提出Streamo,一个实时流式视频大语言模型,能执行多种视频任务,如实时叙述、动作理解等。通过大规模指令遵循数据集训练,Streamo在时间推理和多任务处理上表现优异,填补了离线视频模型与实时多模态助手之间的差距。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08513 2026-04-10 cs.CV 57%

When Fine-Tuning Changes the Evidence: Architecture-Dependent Semantic Drift in Chest X-Ray Explanations

当微调改变证据:在胸部X光解释中的架构依赖性语义漂移

Kabilan Elangovan, Daniel Ting

专题命中 VLM训练与架构 :visual reasoning(abstract);分类 cs.CV

AI总结 研究探讨了在多类设置中,微调导致的视觉证据变化,通过评估不同架构在两阶段训练中的表现,揭示了架构依赖性的证据结构重组。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08494 2026-04-10 cs.CV cs.CL cs.HC 57%

What They Saw, Not Just Where They Looked: Semantic Scanpath Similarity via VLMs and NLP metric

他们所见,而不仅仅是他们看的地方:通过VLMs和NLP度量的语义扫视路径相似性

Mohamed Amine Kerkouri, Marouane Tliba, Bin Wang, Aladine Chetouani, Ulas Bagci, Alessandro Bruno

机构 * Northwestern University(西北大学) Radiology, Northwestern University(西北大学放射学系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种整合视觉语言模型的语义扫视路径相似性框架,通过控制视觉上下文生成文本描述,利用NLP度量计算语义相似性,揭示空间差异下的内容一致性。

Comments Accepted at ETRA 2026 GenAI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06467 2026-04-09 cs.CV 57%

PhysHead: Simulation-Ready Gaussian Head Avatars

PhysHead: 可模拟的高斯头部化身

Berna Kabadayi, Vanessa Sklyarova, Wojciech Zielonka, Justus Thies, Gerard Pons-Moll

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ETH Zürich(苏黎世联邦理工学院) University of Tübingen(图宾根大学) Technical University of Darmstadt(达姆施塔特工业大学) Tübingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 本文提出PhysHead,一种结合3D参数网格和发丝的混合表示方法,用于生成具有真实发丝动态的可动画头部化身,通过多视角视频学习实现逼真发丝运动。

Comments Project Page: see https://phys-head.github.io/; Youtube Video: see https://www.youtube.com/watch?v=k68fsSSwzc0; Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07310 2026-04-08 cs.CV 57%

MATRIX: Mask Track Alignment for Interaction-aware Video Generation

MATRIX:用于交互感知视频生成的遮罩跟踪对齐

Siyoon Jin, Seongchan Kim, Dahyun Chung, Jaeho Lee, Hyunwook Choi, Jisu Nam, Jiyoung Kim, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能系)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 MATRIX通过引入遮罩跟踪对齐方法,提升视频生成中交互感知能力,增强语义对齐与传播,减少漂移和幻觉。

Comments Project Page is available at: https://cvlab-kaist.github.io/MATRIX/, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05180 2026-04-08 cs.CV 57%

MIRAGE: Benchmarking and Aligning Multi-Instance Image Editing

MIRAGE:多实例图像编辑的基准测试与对齐

Ziqian Liu, Stephan Alaniz

机构 * LTCI, Télécom Paris, Institut Polytechnique de Paris, France(法国巴黎理工学院电信巴黎分校LTCI实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出MIRAGE框架,通过多分支并行去噪策略实现精确多实例编辑,解决现有方法在多实例和复合指令下的过度编辑和空间错位问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04857 2026-04-07 cs.CV 57%

The Blind Spot of Adaptation: Quantifying and Mitigating Forgetting in Fine-tuned Driving Models

适应的盲区:量化和缓解在微调驾驶模型中的遗忘

Runhao Mao, Hanshi Wang, Yixiang Yang, Qianli Ma, Jingmeng Zhou, Zhipeng Zhang

机构 * AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文首次系统研究驾驶模型中灾难性遗忘问题,提出Drive Expert Adapter框架,通过提示空间适应提升驾驶性能并保留通用能力。

Comments received by cvpr2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04183 2026-04-07 cs.CV 57%

Scale-Aware Vision-Language Adaptation for Extreme Far-Distance Video Person Re-identification

面向极端远距离视频人的规模感知视觉语言适应

Ashwat Rajbhandari, Bharatesh Chakravarthi

机构 * Arizona State University(亚利桑那州立大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种基于CLIP的视觉语言模型,通过升级视觉主干和引入选择性微调机制,提升远距离视频人重识别的鲁棒性,实验表明在DetReIDX基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03172 2026-04-06 cs.CV 57%

EffiMiniVLM: A Compact Dual-Encoder Regression Framework

EffiMiniVLM:一种紧凑的双编码回归框架

Yin-Loon Khor, Yi-Jie Wong, Yan Chai Hum

机构 * Universiti Malaya(马来亚大学) Universiti Tunku Abdul Rahman(拉曼大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出EffiMiniVLM,一种紧凑的双编码回归框架,通过高效网络和轻量级回归头,在冷启动场景中实现高质量产品预测,具有低资源消耗和高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03072 2026-04-06 cs.CV 57%

MI-Pruner: Crossmodal Mutual Information-guided Token Pruner for Efficient MLLMs

MI-Pruner:跨模态互信息引导的令牌修剪器用于高效的大语言模型

Jiameng Li, Aleksei Tiulpin, Matthew B. Blaschko

机构 * Faculty of Medicine, University of Oulu, Finland(芬兰奥卢大学医学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出MI-Pruner,通过计算视觉与文本特征间的互信息来指导令牌修剪,无需依赖注意力机制,实现高效的大语言模型推理。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02973 2026-04-06 cs.CV 57%

Exploring Motion-Language Alignment for Text-driven Motion Generation

探索文本与运动对齐以实现文本驱动的运动生成

Ruxi Gu, Zilei Wang, Wei Wang

机构 * Department of Automation, University of Science and Technology of China(中国科学技术大学自动化系) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,北京通用人工智能研究院)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 本文提出MLA-Gen框架,通过整合全局运动先验与局部条件,提升文本驱动运动生成的对齐精度,并引入SinkRatio指标解决注意力集中问题,提升运动质量和语义对齐。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23032 2026-04-06 cs.CV cs.RO 57%

Generative Event Pretraining with Foundation Model Alignment

基于基础模型对齐的生成事件预训练

Jianwen Cao, Jiaxu Xing, Nico Messikommer, Davide Scaramuzza

机构 * Robotics and Perception Group, University of Zurich(苏黎世大学机器人感知组)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 本文提出GEP框架,通过将互联网级图像数据集中的语义知识迁移到事件数据,并学习事件特有的时间动态,提升事件视觉基础模型在跨任务迁移学习中的性能。

Journal ref CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02317 2026-04-03 cs.CV 57%

A Simple Baseline for Streaming Video Understanding

流媒体视频理解的简单基线

Yujiao Shen, Shulin Tian, Jingkang Yang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 本文提出SimpleStream基线,通过滑动窗口仅使用最近N帧输入现成的VLM,在OVO-Bench和StreamingBench上表现优异,揭示了长上下文对性能的非线性影响及感知与记忆的权衡。

Comments Project page: https://simple-stream.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29966 2026-04-03 cs.CV 57%

Scaling Video Pretraining for Surgical Foundation Models

为手术基础模型扩展视频预训练

Sicheng Lu, Zikai Xiao, Jianhui Wei, Danyu Sun, Qi Lu, Keli Hu, Yang Feng, Jian Wu, Zongxin Yang, Zuozhu Liu

机构 * The Johns Hopkins University(约翰霍普金斯大学) Zhejiang University(浙江大学) Zhejiang University-University of Illinois Urbana-Champaign Institute(浙江大学伊利诺伊大学厄巴纳-香槟分校联合学院) Zhejiang Lab(之江实验室) Shaoxing University(绍兴大学) Angelalign(时代天使) Harvard Medical School(哈佛医学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出SurgRec,通过大规模数据和统一预训练流程提升手术视频理解能力,对比SSL基线和视觉语言模型,展示SurgRec在多个下游任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01881 2026-04-03 cs.CV cs.CL 57%

HieraVid: Hierarchical Token Pruning for Fast Video Large Language Models

HieraVid:用于快速视频大语言模型的分层令牌修剪

Yansong Guo, Chaoyang Zhu, Jiayi Ji, Jianghang Lin, Liujuan Cao

机构 * Xiamen University(厦门大学)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

AI总结 HieraVid通过分层修剪框架减少视频令牌冗余,提升视频大语言模型的效率,在保留性能的同时实现30%的令牌保留率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00983 2026-04-02 cs.CV 57%

ACT Now: Preempting LVLM Hallucinations via Adaptive Context Integration

现在行动:通过自适应上下文整合预防治愈LVLM幻觉

Bei Yan, Yuecong Min, Jie Zhang, Shiguang Shan, Xilin Chen

机构 * University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出ACT方法,通过自适应整合上下文信息缓解LVLM幻觉问题,采用视觉上下文探索和语义上下文聚合技术,有效减少幻觉并提升生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29631 2026-04-01 cs.CV cs.DC cs.IR 57%

Storing Less, Finding More: How Novelty Filtering Improves Cross-Modal Retrieval on Edge Cameras

存储更少,查找更多:新颖性过滤如何改进边缘摄像头上的跨模态检索

Sherif Abdelwahab

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种流式检索架构,通过边缘设备的epsilon-net过滤器保留语义新颖帧,构建去噪嵌入索引,并结合跨模态适配器和云重排序器,提升边缘摄像头跨模态检索性能。

Comments 6 pages, 3 figures, 5 tables; supplementary video included as ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19910 2026-04-01 cs.CV 57%

Multi-Modal Representation Learning via Semi-Supervised Rate Reduction for Generalized Category Discovery

通过半监督率减少实现多模态表示学习的通用类别发现

Wei He, Xianghan Meng, Zhiyuan Huang, Xianbiao Qi, Rong Xiao, Chun-Guang Li

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Intellifusion Inc., Shenzhen, P.R. China(深圳云天励飞技术股份有限公司)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV

AI总结 本文提出SSR²-GCD框架,通过半监督率减少实现多模态表示学习,提升通用类别发现任务的结构属性和知识迁移能力。

Comments 15 pages, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28366 2026-03-31 cs.CV 57%

AutoCut: End-to-end advertisement video editing based on multimodal discretization and controllable generation

AutoCut:基于多模态离散化和可控生成的端到端广告视频编辑

Milton Zhou, Sizhong Qin, Yongzhi Li, Quan Chen, Peng Jiang

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出AutoCut框架,通过多模态离散化和可控生成实现广告视频编辑,提升一致性和可控性,降低生产成本和迭代时间。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27900 2026-03-31 cs.CV 57%

Rényi Entropy: A New Token Pruning Metric for Vision Transformers

瑞尼熵:一种新的token剪枝度量标准用于视觉变换器

Wei-Yuan Su, Ruijie Zhang, Zheng Zhang

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出基于瑞尼熵的无训练token重要性度量Col-Ln,用于改进视觉变换器中早期层的token剪枝,提升推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27744 2026-03-31 cs.CV 57%

Data Organization Matters in Multimodal Instruction Tuning: A Controlled Study of Capability Trade-offs

多模态指令微调中数据组织的重要性:能力取舍的受控研究

Guowei Tang

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 研究探讨了数据组织对多模态指令微调中通用理解、结构化推理和细粒度OCR文档理解能力取舍的影响,发现课程训练在整体表现和结构推理上最佳,平衡采样更利于OCR能力但削弱整体平衡。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27531 2026-03-31 cs.CV 57%

OmniColor: A Unified Framework for Multi-modal Lineart Colorization

OmniColor: 一种多模态线稿上色的统一框架

Xulu Zhang, Haoqian Du, Xiaoyong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 OmniColor提出一种统一框架,通过空间对齐和语义参考信号分类,提升线稿上色的可控性、视觉质量和时间稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22419 2026-03-31 cs.CV 57%

CLIP Is Shortsighted: Paying Attention Beyond the First Sentence

CLIP存在短视:超越第一句话的注意力分配

Marc-Antoine Lavoie, Anas Mahmoud, Aldo Zaimi, Arsene Fansi Tchango, Steven L. Waslander

机构 * University of Toronto Robotics Institute(多伦多大学机器人研究所) Mila - Quebec AI Institute(Mila - 魁北克人工智能研究所)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 CLIP模型在大规模数据上通过图像-文本对比学习获取可迁移的多模态特征,但其预训练过程偏向于短描述,导致复杂场景对齐不足。本文提出DeBias-CLIP,通过去除摘要句和子采样提升对齐效果,实现更优的长文本检索和鲁棒性。

Comments 20 pages, 15 figures, to be published in the CVPR 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26365 2026-03-30 cs.CV 57%

Dynamic Token Compression for Efficient Video Understanding through Reinforcement Learning

通过强化学习实现高效的视频理解动态令牌压缩

Shida Wang, YongXiang Hua, Zhou Tao, Haoyu Cao, Linli Xu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出SCORE框架,通过强化学习学习自适应令牌压缩策略,有效解决视频理解中的计算成本和上下文旋转问题,实现16倍的预填充加速且性能损失仅0.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26128 2026-03-30 cs.CV 57%

TaxaAdapter: Vision Taxonomy Models are Key to Fine-grained Image Generation over the Tree of Life

TaxaAdapter:视觉分类模型是生命树上细粒度图像生成的关键

Mridul Khurana, Amin Karimi Monsefi, Justin Lee, Medha Sawhney, David Carlyn, Julia Chae, Jianyang Gu, Rajiv Ramnath, Sara Beery, Wei-Lun Chao, Anuj Karpatne, Cheng Zhang

机构 * Virginia Tech(弗吉尼亚理工大学) The Ohio State University(俄亥俄州立大学) MIT(麻省理工学院) Boston University(波士顿大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出TaxaAdapter,通过整合视觉分类模型提升细粒度物种生成的精度与一致性,实验表明其在形态学和物种识别准确性上优于现有方法,且具备良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13239 2026-03-30 cs.CY cs.CV cs.IR 57%

CrisiSense-RAG: Crisis Sensing Multimodal Retrieval-Augmented Generation for Rapid Disaster Impact Assessment

CrisiSense-RAG:面向快速灾害影响评估的多模态检索增强生成系统

Yiming Xiao, Kai Yin, Ali Mostafavi

机构 * Zachry Department of Civil Environmental Engineering, Texas A\&M University Department of Computer Science Engineering, Texas A\&M University

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 本文提出CrisiSense-RAG系统,通过多模态检索增强生成技术,解决灾害影响评估中时空不对齐问题,实现零样本设置下的高精度灾害评估。

Comments 27 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25072 2026-03-27 cs.CV 57%

GIFT: Global Irreplaceability Frame Targeting for Efficient Video Understanding

GIFT:全局不可替代性帧目标用于高效视频理解

Junpeng Ma, Sashuai Zhou, Guanghao Li, Xin Gao, Yue Cao, Hengyu Zeng, Yuxiang Yan, Zhibin Wang, Jun Song, Bo Zheng, Shanghang Zhang, Jian Pu

机构 * Institute of Science and Technology for Brain-inspired Intelligence, Fudan University(复旦大学类脑智能科学与技术研究院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Zhejiang University(浙江大学) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Future Living Lab of Alibaba(阿里巴巴未来生活实验室)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

AI总结 GIFT通过评估帧的内在不可替代性选择关键帧,解决视频理解中处理密集帧的高计算成本问题,提升视频分析效率。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24528 2026-03-26 cs.CV 57%

Cross-Modal Prototype Alignment and Mixing for Training-Free Few-Shot Classification

跨模态原型对齐与混合用于无训练少样本分类

Dipam Goswami, Simone Magistri, Gido M. van de Ven, Bartłomiej Twardowski, Andrew D. Bagdanov, Tinne Tuytelaars, Joost van de Weijer

机构 * Department of Computer Science, Universitat Autònoma de Barcelona, Spain(巴塞罗那自治大学计算机科学系) Computer Vision Center, Barcelona, Spain(巴塞罗那计算机视觉中心) Media Integration and Communication Center, University of Florence, Italy(佛罗伦萨大学媒体整合与传播中心) Bernoulli Institute, University of Groningen, the Netherlands(格罗宁根大学伯努利学院) IDEAS Research Institute, Poland(波兰IDEAS研究所) ESAT-PSI, KU Leuven, Belgium(比利时KU莱顿大学ESAT-PSI)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文研究了直接混合图像与文本原型对少样本分类的影响,提出通过投影获取语义对齐的图像子空间,结合文本嵌入和图像特定LDA分类器提升性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏