arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5058 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5058 篇

2511.11910 2026-02-26 cs.CV 57%

Seeing the Forest and the Trees: Query-Aware Tokenizer for Long-Video Multimodal Language Models

看清森林与树木:面向长视频多模态语言模型的查询感知分词器

Siyou Li, Huanan Wu, Juexi Shao, Yinghao Ma, Yujian Gan, Yihao Luo, Yuwei Wang, Dong Nie, Lu Wang, Wenqing Wu, Le Zhang, Massimo Poesio, Juntao Yu

机构 * Queen Mary University of London(伦敦女王学院) University of Sheffield(谢菲尔德大学) Imperial College London(伦敦帝国学院) Pengcheng Laboratory(鹏城实验室) Meta Inc(Meta公司) Meituan Inc(美团公司) Nanjing University of Science(南京理工大学) University of Birmingham(伯明翰大学) Utrecht University(乌得勒支大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 QTSplus是一种轻量高效的视觉token选择模块,通过动态选择重要视觉证据提升长视频多模态语言模型的性能,显著降低计算成本并提高处理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01984 2026-02-26 cs.CV 57%

Enhancing Multi-Image Understanding through Delimiter Token Scaling

通过分隔符标记扩展提升多图像理解

Minyoung Lee, Yeji Park, Dongjun Hwang, Yejin Kim, Seong Joon Oh, Junsuk Choe

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 通过扩展分隔符标记的隐藏状态,提升多图像理解性能,有效减少跨图像信息泄露,提高模型区分和推理能力。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21035 2026-02-25 cs.CV cs.MM 57%

Not Just What's There: Enabling CLIP to Comprehend Negated Visual Descriptions Without Fine-tuning

不只是存在与否:无需微调即可使CLIP理解否定性视觉描述

Junhao Xiao, Zhiyu Wu, Hao Lin, Yi Chen, Yahui Liu, Xiaoran Zhao, Zixu Wang, Zejiang He

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 CLIPGlasses通过双阶段设计提升CLIP对否定性视觉描述的理解能力,无需微调,增强跨领域泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00795 2026-02-25 cs.CV 57%

DVLA-RL: Dual-Level Vision-Language Alignment with Reinforcement Learning Gating for Few-Shot Learning

DVLA-RL:基于强化学习门控的双层视觉-语言对齐用于少样本学习

Wenhao Li, Xianjing Meng, Qiangchang Wang, Zhongyi Han, Zhibin Wu, Yilong Yin

机构 * Software School, Shandong University(山东大学软件学院) Shenzhen Loop Area Institute(深圳河套学院) School of Computing and Artificial Intelligence, Shandong University of Finance and Economics(山东财经大学计算机与人工智能学院)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 DVLA-RL通过双层语义构建和强化学习门控注意力,实现少样本学习中视觉与语言的双层次对齐,提升泛化能力。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05662 2026-02-25 cs.RO cs.CV 57%

DeLTa: Demonstration and Language-Guided Novel Transparent Object Manipulation

DeLTa: 人机交互与语言引导的新透明物体操控演示

Taeyeop Lee, Gyuree Kang, Bowen Wen, Youngho Kim, Seunghyeok Back, In So Kweon, David Hyunchul Shim, Kuk-Jin Yoon

机构 * KAIST(韩国科学技术院) NVIDIA(英伟达) KIMM(韩国智能媒体实验室)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 DeLTa通过整合深度估计、6D姿态估计和视觉-语言规划,实现基于自然语言指令的精确长周期透明物体操控,无需额外训练或类别先验。

Comments Project page: https://sites.google.com/view/DeLTa25/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19542 2026-02-24 cs.CV 57%

Vinedresser3D: Agentic Text-guided 3D Editing

Vinedresser3D: 基于代理的文本引导3D编辑

Yankuan Chi, Xiang Li, Zixuan Huang, James M. Rehg

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 Vinedresser3D通过多模态大语言模型和潜在空间编辑技术实现高质量文本引导的3D编辑,提升编辑精度与一致性。

Comments CVPR 2026, Project website:https://vinedresser3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19449 2026-02-24 cs.CV 57%

Decoupling Vision and Language: Codebook Anchored Visual Adaptation

解耦视觉与语言:基于代码本的视觉适应

Jason Wu, Tianchen Zhao, Chang Liu, Jiarui Cai, Zheng Zhang, Zhuowei Li, Aaditya Singh, Xiang Xu, Mani Srivastava, Jonathan Wu

机构 * AWS University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 CRAFT通过离散代码本解耦视觉与语言,实现无需修改其他部分的领域适应,提升LVLMs性能。

Comments 17 pages, accepted to CVPR2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19418 2026-02-24 cs.CV 57%

PA-Attack: Guiding Gray-Box Attacks on LVLM Vision Encoders with Prototypes and Attention

PA-Attack: 通过原型和注意力引导LVLM视觉编码器的灰盒攻击

Hefei Mei, Zirui Wang, Chang Xu, Jianyuan Guo, Minjing Dong

机构 * City University of Hong Kong(香港城市大学) The University of Sydney(悉尼大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 PA-Attack通过原型和注意力机制提升灰盒攻击效果,实现对LVLM视觉编码器的高效攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17636 2026-02-20 cs.CV 57%

CORAL: Correspondence Alignment for Improved Virtual Try-On

CORAL: 用于改进虚拟试衣的对应对齐

Jiyoung Kim, Youngjin Shin, Siyoon Jin, Dahyun Chung, Jisu Nam, Tongmin Kim, Jongjae Park, Hyeonwoo Kang, Seungryong Kim

机构 * NC AI Co., Ltd(NC AI公司)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 CORAL通过引入基于DiT的框架,显式对齐查询-键匹配与外部对应关系,从而提升虚拟试衣中的人-服装对应精度和细节保留能力。

Comments 32 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17478 2026-02-20 cs.CV 57%

QuPAINT: Physics-Aware Instruction Tuning Approach to Quantum Material Discovery

QuPAINT:一种面向量子材料发现的物理感知指令微调方法

Xuan-Bac Nguyen, Hoang-Quan Nguyen, Sankalp Pandey, Tim Faltermeier, Nicholas Borys, Hugh Churchill, Khoa Luu

机构 * CVIU Lab, University of Arkansas, USA(Arkansas大学计算机视觉实验室) University of Utah, USA(犹他大学) Department of Physics, University of Arkansas, USA(Arkansas大学物理系)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 QuPAINT通过物理感知指令微调方法,提升量子材料发现的多模态表征能力,建立标准化评估基准。

Comments Project page: https://uark-cviu.github.io/projects/qupaint/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15943 2026-02-20 cs.CV 57%

Boosting Medical Visual Understanding From Multi-Granular Language Learning

通过多粒度语言学习提升医学视觉理解

Zihan Li, Yiqing Wang, Sina Farsiu, Paul Kinahan

机构 * University of Washington(华盛顿大学) Duke University(杜克大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出MGLL框架,通过多粒度语言学习提升医学影像的视觉理解能力,改进多标签和跨粒度对齐,提升下游任务性能。

Comments Accepted by ICLR 2026. 40 pages

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17088 2026-02-20 cs.LG 57%

MeGU: Machine-Guided Unlearning with Target Feature Disentanglement

MeGU:基于目标特征解耦的机器引导反学习

Haoyu Wang, Zhuo Huang, Xiaolong Wang, Bo Han, Zhiwei Lin, Tongliang Liu

机构 * School of Automation, Beijing Institute of Technology(自动化学院,北京理工大学) Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) Department of Computer Science, Hong Kong Baptist University(计算机科学系,香港 Baptist 大学)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.LG

AI总结 MeGU通过目标特征解耦实现受控反学习,利用多模态大语言模型进行概念感知的重新对齐,以提升反学习效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16502 2026-02-19 cs.CV 57%

DressWild: Feed-Forward Pose-Agnostic Garment Sewing Pattern Generation from In-the-Wild Images

DressWild: 从真实场景图像生成无需迭代优化的前馈姿态无关服装缝纫图案

Zeng Tao, Ying Jiang, Yunuo Chen, Tianyi Xie, Huamin Wang, Yingnian Wu, Yin Yang, Abishek Sampath Kumar, Kenji Tashiro, Chenfanfu Jiang

机构 * UCLA and Fudan University(UCLA和复旦大学) University of Utah(犹他大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 DressWild通过前馈方法从单张真实图像生成物理一致的2D缝纫图案和3D服装,无需多视角输入或迭代优化,实现高效可扩展的服装模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15903 2026-02-19 cs.CV 57%

Detecting Deepfakes with Multivariate Soft Blending and CLIP-based Image-Text Alignment

利用多变量软融合和基于CLIP的图像-文本对齐检测深度伪造

Jingwei Li, Jiaxin Tong, Pengfei Wu

机构 * Zhejiang Gongshang University(浙江工商大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出MSBA-CLIP框架,通过多变量软融合和CLIP引导的伪造强度估计,提升深度伪造检测的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12281 2026-02-19 cs.RO cs.AI cs.SY eess.SY 57%

Scaling Verification Can Be More Effective than Scaling Policy Learning for Vision-Language-Action Alignment

在视觉-语言-动作对齐中,验证比策略学习更具效率

Jacky Kwok, Xilun Zhang, Mengdi Xu, Yuejiang Liu, Azalia Mirhoseini, Chelsea Finn, Marco Pavone

机构 * Stanford University(斯坦福大学) NVIDIA Research(NVIDIA研究)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.AI

AI总结 本文提出CoVer-VLA验证方法,通过测试时验证在视觉-语言-动作对齐中实现22%的在分布和13%的分布外收益,同时在现实世界实验中进一步提升45%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22211 2026-02-18 cs.CL cs.AI 57%

LogiPart: Local Large Language Models for Data Exploration at Scale with Logical Partitioning

LogiPart: 用于大规模数据探索的本地大语言模型与逻辑分区

Tiago Fernandes Tavares

机构 * Tiago Fernandes Tavares(独立研究者)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 LogiPart通过本地大语言模型与逻辑分区技术,在大规模数据探索中实现高效、可解释的税目发现,克服传统方法的效率与成本限制。

Comments This version introduces a major architectural shift to Local LLMs and NLI-based assignment, scaling the framework to O(1) generative complexity. Formerly titled 'Question-Driven Analysis and Synthesis'

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12936 2026-02-16 cs.CV 57%

Unleashing MLLMs on the Edge: A Unified Framework for Cross-Modal ReID via Adaptive SVD Distillation

在边缘侧释放MLLMs:通过自适应SVD蒸馏实现跨模态重识别的统一框架

Hongbo Jiang, Jie Li, Xinqi Cai, Tianyu Xie, Yunhang Shen, Pingyang Dai, Liujuan Cao

机构 * Tencent Youtu Lab, Shanghai, China(腾讯优图实验室,上海,中国) Xiamen University, Media Analytics(厦门大学,媒体分析) Computing Lab, Department of Artificial Intelligence, School of Informatics, Xiamen, China(计算实验室,人工智能系,信息学院,厦门,中国)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

AI总结 本文提出MLLMEmbed-ReID框架,通过自适应SVD蒸馏实现跨模态重识别的统一部署,结合云-边缘架构提升性能与效率。

Comments Equal contribution by Jie Li

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12311 2026-02-16 cs.SE cs.AI 57%

Perceptual Self-Reflection in Agentic Physics Simulation Code Generation

感知性自我反思在代理物理模拟代码生成中的应用

Prashant Shende, Bradley Camburn

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出了一种多代理框架,通过感知性自我反思机制提升物理模拟代码生成的准确性与稳定性,验证了视觉反馈在物理模拟任务中的有效性。

Comments 15 pages, 2 figures, 2 tables. Introduces a multi-agent architecture for physics simulation code generation with perceptual self-reflection via vision-based validation. Includes qualitative evaluation across multiple physics domains

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09843 2026-02-13 cs.CV 57%

Kelix Technical Report

Kelix技术报告

Boyang Ding, Chenglong Chu, Dunju Zang, Han Li, Jiangxia Cao, Kun Gai, Muhao Wei, Ruiming Tang, Shiyao Wang, Siyang Mao, Xinchen Luo, Yahui Liu, Zhixin Ling, Zhuoran Yang, Ziming Li, Chengru Song, Guorui Zhou, Guowang Zhang, Hao Peng, Hao Wang, Jiaxin Deng, Jin Ouyang, Jinghao Zhang, Lejian Ren, Qianqian Wang, Qigen Hu, Tao Wang, Xingmei Wang, Yiping Yang, Zixing Zhang, Ziqi Wang

机构 * Kuaishou Technology(快手科技)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 Kelix是一种完全离散的自回归统一模型,旨在缩小离散和连续视觉表示之间的理解差距。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11757 2026-02-13 cs.CV 57%

Code2Worlds: Empowering Coding LLMs for 4D World Generation

Code2Worlds: 赋能编码大语言模型进行4D世界生成

Yi Zhang, Yunshuang Wang, Zeyu Zhang, Hao Tang

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 Code2Worlds通过双流架构和闭环机制,提升编码大语言模型在4D世界生成中的动态真实性和物理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09070 2026-02-13 cs.SD cs.AI eess.AS 57%

NarraScore: Bridging Visual Narrative and Musical Dynamics via Hierarchical Affective Control

NarraScore: 通过分层情感控制弥合视觉叙事与音乐动态

Yufan Wen, Zhaocheng Liu, YeGuo Hua, Ziyi Guo, Lihua Zhang, Chun Yuan, Jian Wu

机构 * Tsinghua University(清华大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 NarraScore通过分层情感控制,实现视觉叙事与音乐动态的融合,以高密度压缩叙事逻辑,提升长视频配乐生成的连贯性与自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09225 2026-02-11 cs.LG 57%

Barycentric alignment for instance-level comparison of neural representations

实例层面神经表示的重心对齐

Shreya Saha, Zoe Wanying He, Meenakshi Khosla

机构 * Department of XXX, University of YYY, Location, Country(YYY大学XXX系) School of ZZZ, Institute of WWW, Location, Country(WWW研究所ZZZ学院) Department of Electrical and Computer Engineering, UCSD(UCSD电子与计算机工程系) Cognitive Science Department, UCSD(UCSD认知科学系) Department of Computer Science(计算机科学系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

AI总结 通过实例层面的神经表示重心对齐,揭示了跨视觉和语言模型的表示收敛与发散特性,并展示了人类对齐的跨模态比较能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22274 2026-02-11 cs.CV cs.CL 57%

Common Objects Out of Context (COOCo): Investigating Multimodal Context and Semantic Scene Violations in Referential Communication

常见物体脱离上下文(COOCo):研究多模态上下文和语义场景违规在指代通信中的作用

Filippo Merlo, Ece Takmaz, Wenkai Chen, Albert Gatt

机构 * Utrecht University(乌特雷赫大学) University of Trento(特伦托大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 COOCo研究了VLMs在指代生成中如何利用场景上下文,发现模型根据语义相关性和噪声水平动态平衡局部与上下文信息。

Comments Accepted to TACL (pre-MIT Press publication version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07915 2026-02-10 cs.CV 57%

MARC: Memory-Augmented RL Token Compression for Efficient Video Understanding

MARC: 用于高效视频理解的记忆增强强化学习令牌压缩

Peiran Wu, Zhuorui Yu, Yunze Liu, Chi-Hao Wu, Enmin Zhou, Junxiao Shen

机构 * University of Bristol(布里斯托大学) Memories.ai Research(Memories.ai研究)

专题命中 VLM训练与架构 :visual language model(abstract);分类 cs.CV

AI总结 MARC通过结合结构化检索和强化学习知识蒸馏,实现高效视频理解,显著减少视觉令牌、GPU内存和延迟。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23278 2026-02-10 cs.CV 57%

UniLiP: Adapting CLIP for Unified Multimodal Understanding, Generation and Editing

UniLiP: 适配CLIP以实现统一的多模态理解、生成与编辑

Hao Tang, Chenwei Xie, Xiaoyi Bao, Tingyu Weng, Pandeng Li, Yun Zheng, Liwei Wang

机构 * Center for Data Science, Peking University(北京大学数据科学中心) Alibaba Group(阿里巴巴集团) CASIA Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 UniLIP通过两阶段训练和双条件架构,提升CLIP在多模态理解、生成和编辑任务中的性能,实现高效参数下的高表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07414 2026-02-10 cs.AI cs.CL 57%

Can LLMs Truly Embody Human Personality? Analyzing AI and Human Behavior Alignment in Dispute Resolution

LLMs真的能体现人类个性吗?分析AI与人类行为在纠纷解决中的对齐

Deuksin Kwon, Kaleen Shrestha, Bin Han, Spencer Lin, James Hale, Jonathan Gratch, Maja Matarić, Gale M. Lucas

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文研究LLMs在模拟人类人格驱动的冲突行为方面的有效性,通过评估框架和数据集方法,揭示LLMs在纠纷解决中与人类行为的显著差异。

Comments AAAI 2026 (Special Track: AISI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21266 2026-02-10 cs.AI 57%

Rethinking Explainable Disease Prediction: Synergizing Accuracy and Reliability via Reflective Cognitive Architecture

重新思考可解释疾病预测:通过反思认知架构协同提升准确性和可靠性

Zijian Shao, Haiyang Shen, Mugeng Liu, Gecheng Fu, Yaoqi Guo, Yanfeng Wang, Yun Ma

机构 * Institute for Artificial Intelligence, Peking University School of Software \& Microelectronics, Peking University School of Computer Science, Peking University School of Life Sciences, Peking University Department of Comprehensive Oncology, National Cancer Center/National Clinical Research Center for Cancer/Cancer Hospital, Chinese Academy of Medical Sciences Peking Union Medical College Beijing, China

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出反思认知架构(RCA),通过经验与反思直接从表格数据学习,实现预测精度与解释可靠性的协同提升。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06184 2026-02-09 cs.CV cs.CL 57%

PhenoLIP: Integrating Phenotype Ontology Knowledge into Medical Vision-Language Pretraining

PhenoLIP:将表型本体知识整合到医学视觉-语言预训练中

Cheng Liang, Chaoyi Wu, Weike Zhao, Ya Zhang, Yanfeng Wang, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 PhenoLIP通过整合表型本体知识提升医学视觉-语言模型的表型识别与跨模态检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13928 2026-02-05 cs.CV cs.IR 57%

LoVR: A Benchmark for Long Video Retrieval in Multimodal Contexts

LoVR:一种多模态背景下长视频检索的基准

Qifeng Cai, Hao Liang, Zhaoyang Han, Hejun Dong, Meiyi Qiang, Ruichuan An, Quanqing Xu, Bin Cui, Wentao Zhang

机构 * East China Normal University Shanghai China Peking University \& Zhongguancun Academy Beijing China Huazhong University of Science Beihang University Beijing China Peking University Beijing China East China Normal University Peking University \& Zhongguancun Academy Beihang University Peking University

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 LoVR是一个针对长视频检索的多模态基准,通过高质量标注和细粒度数据提升视频理解挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03615 2026-02-04 cs.CV 57%

KTV: Keyframes and Key Tokens Selection for Efficient Training-Free Video LLMs

KTV: 关键帧与关键令牌选择用于高效无训练视频大语言模型

Baiyang Song, Jun Peng, Yuxin Zhang, Guangyao Chen, Feidiao Yang, Jianyuan Guo

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV

AI总结 KTV通过两阶段框架高效选择关键帧和令牌,提升无训练视频理解的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏