arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5030 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5030 篇

2605.24799 2026-05-26 cs.CV cs.AI 81%

Divide-and-Conquer Inference for Large-Scale Visual Recognition with Multimodal Large Language Models

面向大规模视觉识别的多模态大语言模型分治推理

Zhipeng Ye, Jiaqi Huang, Feng Jiang, Qiufeng Wang, Yikang Duan, Dawei Wang, Xihang Zhou, Qian Qiao

机构 * Taizhou Institute of Science and Technology, Nanjing University of Science and Technology(泰州科技学院、南京理工大学) Department of Intelligence Science, Xi’an Jiaotong-Liverpool University(智能科学系,西安交通大学利物浦大学) School of Computer Science and Technology, Soochow University(计算机科学与技术学院,苏州大学) Department of Statistical Sciences, University of Toronto(统计科学系,多伦多大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型在长序列识别中性能崩溃的问题,提出分治推理(DCI)策略,通过递归分解任务和动态剪枝提升信噪比与分类精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22679 2026-05-22 cs.CV cs.LG 81%

Conceptualizing Embeddings: Sparse Disentanglement for Vision-Language Models

将嵌入概念化:面向视觉-语言模型的稀疏解缠

Piotr Kubaty, Patryk Marszałek, Łukasz Struski, Adam Wróbel, Jacek Tabor, Marek Śmieja

机构 * Faculty of Mathematics and Computer Science, Jagiellonian University(雅盖隆大学数学与计算机科学学院) Doctoral School of Exact and Natural Sciences, Jagiellonian University(雅盖隆大学精确与自然科学博士学校) Centre for Credible AI, Warsaw University of Technology(华沙技术大学可信人工智能中心)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出CEDAR方法,通过稀疏解缠技术在不增加维度的情况下揭示预训练嵌入的组成结构,从而提升视觉-语言模型的可解释性和与人类感知的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13322 2026-05-19 cs.CV cs.LG 81%

KamonBench: A Grammar-Based Dataset for Evaluating Compositional Factor Recovery in Vision-Language Models

KamonBench:一种基于语法规则的数据集,用于评估视觉-语言模型中的组合因子恢复

Richard Sproat, Stefano Peluchetti

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 KamonBench通过20000个合成复合徽章及辅助组件示例,提供评估视觉-语言模型中稀疏组合识别和因子恢复的可控测试环境,支持程序代码因子度量和可控因子对重组。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14938 2026-05-15 cs.LG cs.CV 81%

Octopus: History-Free Gradient Orthogonalization for Continual Learning in Multimodal Large Language Models

Octopus:无历史梯度正交化用于多模态大语言模型中的持续学习

Yuehao Liu, Shanyan Guan, Weijia Zhang, Xuanming Shang, Yanhao Ge, Wei Li, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能大模型关键实验室,人工智能研究院,上海交通大学) vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV、cs.LG

AI总结 Octopus提出一种基于无历史梯度正交化的方法,通过两阶段微调策略平衡持续学习中的可塑性与稳定性,实验表明其在UCIT数据集上性能优于现有最佳方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09429 2026-05-12 cs.CV cs.AI 81%

Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models

逃避视觉失语:面向视觉-语言模型的对比自适应语义令牌修剪

Jie Ma, Yihang Liu, Zhike Qiu, Jiayi Ji, Xiaoshuai Sun

机构 * Xiamen University(厦门大学)

专题命中 VLM训练与架构 :vision-language model(title);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出COAST方法,通过对比自适应语义路由实现视觉-语言模型的高效令牌修剪,减少77.8%的视觉令牌并提升2.15倍的推理速度,同时保持98.64%的原始性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08702 2026-05-12 cs.CV cs.AI 81%

Gate-and-Merge: Zero-shot Compositional Personalization of Vision Language Models

门与融合:面向视觉语言模型的零样本组合个性化

Guodong Ding, Angela Yao

机构 * National University of Singapore(新加坡国立大学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Gate-and-Merge框架,实现视觉语言模型的零样本组合个性化,通过轻量LoRA适配器和门控机制,在无需共现训练的情况下提升多概念联合识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14888 2026-04-28 cs.CV cs.AI 81%

Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models

超越跨模态对齐:测量和利用模态差距在视觉-语言模型中

Hanqi Yan, Xiangxiang Cui, Lu Yin, Jindong Gu, Paul Pu Liang, Yulan He, Yifei Wang

机构 * King’s College London(伦敦国王学院) University of Surrey(萨里大学) University of Oxford(牛津大学) MIT CSAIL(麻省理工学院CSAIL实验室) The Alan Turing Institute(阿兰·图灵研究院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过测量和利用模态差距改进视觉-语言模型的下游任务,引入模态主导分数和自动可解释性度量,实现轻量级编辑和系统分析。

Comments accepted by ACL26-findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19145 2026-04-22 cs.CV cs.AI 81%

ST-Prune: Training-Free Spatio-Temporal Token Pruning for Vision-Language Models in Autonomous Driving

ST-Prune:面向自动驾驶的视觉-语言模型中无训练的时空令牌修剪

Lin Sha, Haiyun Guo, Tao Wang, Cong Zhang, Min Huang, Jinqiao Wang, Qinghai Miao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Carizon Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 针对自动驾驶中多视角相机和多帧视频输入的计算开销问题,ST-Prune提出无训练的时空令牌修剪框架,通过MTP和RSP模块有效压缩时空冗余,实现90%令牌减少下的近无损性能。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17699 2026-04-21 cs.CV cs.AI 81%

Understanding Counting Mechanisms in Large Language and Vision-Language Models

理解大语言和视觉-语言模型中的计数机制

Hosein Hasani, Amirmohammad Izadi, Fatemeh Askari, Mobin Bagherian, Sadegh Mohammadian, Mohammad Izadi, Mahdieh Soleymani Baghshah

机构 * Sharif University of Technology(谢里夫大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究大语言和视觉-语言模型在计数任务中如何表示和计算数值信息,通过实验和分析揭示了计数机制的分层结构及内部计数器的作用。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17217 2026-04-21 cs.CV cs.AI 81%

Cross-Modal Attention Analysis and Optimization in Vision-Language Models: A Study on Visual Reliability

视觉-语言模型中的跨模态注意力分析与优化:对视觉可靠性的研究

Lijie Zhou

机构 * School of Computer Science(计算机科学学院) University of Nottingham Ningbo China(诺丁汉大学宁波分校)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究了视觉-语言模型中跨模态依赖性问题,通过对抗性评估框架发现优化模型能显著降低跨模态依赖,提升视觉特征关注度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16264 2026-04-20 cs.CV cs.LG 81%

Information Router for Mitigating Modality Dominance in Vision-Language Models

信息路由器用于缓解视觉-语言模型中的模态主导问题

Seulgi Kim, Mohit Prabhushankar, Ghassan AlRegib

机构 * OLIVES at the Center for Signal Information Processing CSIP, School of Electrical

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出MoIR信息路由器,通过在融合前减少信息差异,缓解视觉-语言模型中模态主导问题,提升鲁棒性和下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11490 2026-04-20 cs.AI cs.CL cs.CV 81%

Anthropogenic Regional Adaptation in Multimodal Vision-Language Model

人为区域适应于多模态视觉-语言模型

Samuel Cahyawijaya, Peerat Limkonchotiwat, Tack Hwa Wong, Hitesh Laxmichand Patel, Amit Agarwal, Manuel Antonio Rufino, Carlos Rafael Catalan, Muhammad Reza Qorib, Vicky Feliren, Holy Lovenia, Aye Hninn Khine, Frederikus Hudi, David Anugraha, Alham Fikri Aji, Romrawin Chumpu, Viet-Thanh Pham, Minghan Wang, Mohamed Fazli Imam, Ruochen Zhang, Joseph Marvin Imperial, Khumaisa Nur'aini, Do Xuan Long, Musa Izzanardi Wijanarko, Joel Ruben Antony Moniz, Patrick Amadeus Irawan, Hanif Muhammad Zhafran, Isaiah Flores, Salsabila Zahirah Pranida, Jun Kevin, Jostin Jerico Rosal, Patricia Nicole Monderin, Kun Kerdthaisong, Ahmad Mustafid, My Chiffon Nguyen, Natchapon Jongwiriyanurak, Siva Worajitwannakul, Haochen Li, Adrian Xuan Wei Lim, Bin Wang, Muhammad Ravi Shulthan Habibi, Lynnette Hui Xian Ng, Mithil Bangera, Yeshil Bangera, Priyaranjan Pattnayak, Dun Li Chan, Sherissa Caren Djuniwar, Cho Chan Myei Oo, Hee Ming Shan

机构 * Cohere SEACrowd AI Singapore Universiti Teknologi PETRONAS Oracle Carnegie Mellon University(卡内基梅隆大学) Monash University, Indonesia(莫纳什大学(印尼)) King Mongkut’s University of Technology Thonburi(泰国孔敬大学) Nara Institute of Science and Technology(奈良科学技術大學) Stanford University(斯坦福大学) MBZUAI National University of Singapore(新加坡国立大学) Monash University, Australia(莫纳什大学(澳大利亚)) Brown University(布朗大学) University of Bath(巴斯大学) Mila - Quebec AI Institute(蒙特利尔AI研究所) Institut Teknologi Bandung(Bandung 工程技术大学) Ateneo de Manila University(马尼拉亚特内奥大学) Universitas Pelita Harapan(Pelita Harapan 大学) Seoul National University of Science and Technology(首尔科学技术大学) Thammasat University(泰国 Thammasat 大学) Independent(独立) University College London(伦敦大学学院) Nanyang Technological University(南洋理工大学) MiroMind AI University of Indonesia(印度尼西亚大学) University of New Haven(纽黑文大学) INTI International University and Colleges(INTI 国际大学和学院) Binus University(Binus 大学) National University Philippines(菲律宾国家大学) ThoughtFull

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出人为区域适应框架,通过地理通用化简化方法提升多模态模型在特定区域的文化相关性,实验显示在东南亚地区提升5-15%的同时保持全球性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11496 2026-04-17 cs.CV cs.CL cs.LG 81%

Revisiting Compositionality in Dual-Encoder Vision-Language Models: The Role of Inference

重新审视双编码视觉-语言模型中的组合性:推断的作用

Imanol Miranda, Ander Salaberria, Eneko Agirre, Gorka Azkune

机构 * HiTZ Center – Ixa, University of the Basque Country (UPV/EHU)(希茨中心–Ixa,巴斯克国家大学(UPV/EHU))

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文探讨了双编码视觉-语言模型中组合性问题的根源,提出通过改进推断协议提升组合性能,引入轻量级变压器学习局部对齐,优于全微调和端到端训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13803 2026-04-16 cs.CV cs.AI 81%

Gaslight, Gatekeep, V1-V3: Early Visual Cortex Alignment Shields Vision-Language Models from Sycophantic Manipulation

Gaslight, Gatekeep, V1-V3: 早期视觉皮层对齐保护视觉语言模型免受阿谀操控

Arya Shah, Vaibhav Tripathi, Mayank Singh, Chaklam Silpasuwanchai

机构 * Indian Institute of Technology Gandhinagar(印度理工学院加尔各答分校) Asian Institute of Technology(亚洲理工学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究了视觉语言模型在高风险场景中的脆弱性,通过评估12种模型的脑部对齐和顺从性,发现早期视觉皮层对齐能有效降低模型对阿谀操控的敏感性。

Comments 28 pages, 9 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12537 2026-04-15 cs.CV cs.AI 81%

MODIX: A Training-Free Multimodal Information-Driven Positional Index Scaling for Vision-Language Models

MODIX:一种无需训练的多模态信息驱动的位置索引缩放

Ruoxiang Huang, Zhen Yuan

机构 * Peking University(北京大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 MODIX通过动态调整位置步长,基于模态特定贡献优化多模态模型的位置编码,提升多模态推理能力。

Comments Accepted by CVPR 2026 (Highlight). 10 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22911 2026-04-14 cs.CV cs.AI 81%

ForestPrune: High-ratio Visual Token Compression for Video Multimodal Large Language Models via Spatial-Temporal Forest Modeling

ForestPrune: 通过时空森林建模实现视频多模态大语言模型的高比率视觉令牌压缩

Shaobo Ju, Baiyang Song, Tao Chen, Jiapeng Zhang, Qiong Wu, Chao Chang, HuaiXi Wang, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) National University of Defense Technology(国防科技大学)

专题命中 VLM训练与架构 :multimodal large language model(title);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ForestPrune,一种无需训练的视频MLLM令牌压缩方法,通过时空森林建模实现高效高比率压缩,实验表明其在视频任务中效果优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06165 2026-04-14 cs.CV cs.AI 81%

What Users Leave Unsaid: Under-Specified Queries Limit Vision-Language Models

用户未言明的内容:未指定查询限制视觉语言模型

Dasol Choi, Guijin Son, Hanwool Lee, Minhyuk Kim, Hyunwoo Ko, Teabin Lim, Ahn Eungyeol, Jungwhan Kim, Seunghyeok Hong, Youngsook Song

机构 * AIM Intelligence Yonsei University(延世大学) OneLineAI Korea University(高丽大学) Doodlin Corp.(Doodlin公司) NAVER Cloud(NAVER云) Hankuk University of Foreign Studies(韩国外国语大学) Lablup Inc.(Lablup公司)

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract);分类 cs.CV、cs.AI

AI总结 研究探讨了现实用户查询的不明确性对视觉语言模型的影响,通过HAERAE-Vision基准测试发现,即使使用先进模型,未指定查询的准确率仍低于50%,且明确化查询能显著提升性能,揭示了模型能力与实际应用间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09585 2026-04-14 cs.HC cs.AI cs.CV 81%

Evaluating Visual Prompts with Eye-Tracking Data for MLLM-Based Human Activity Recognition

基于眼动数据的视觉提示在基于多模态LLM的人类活动识别中的评估

Jae Young Choi, Seon Gyeom Kim, Hyungjun Yoon, Taeckyung Lee, Donggun Lee, Jaeryung Chung, Jihyung Kil, Ryan Rossi, Sung-Ju Lee, Tak Yeon Lee

机构 * KAIST(韩国科学技术院) Adobe Research(Adobe研究院)

专题命中 VLM训练与架构 :MLLM(title,abstract);分类 cs.CV、cs.AI

AI总结 本文通过眼动数据可视化方法提升多模态LLM处理高频传感器数据的效率,验证了视觉提示在人类活动识别中的有效性与扩展性。

Comments 6 pages. Conditionally accepted to IEEE PacificVis 2026 (VisNotes track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06036 2026-04-10 cs.DC cs.CV cs.LG 81%

CodecSight: Leveraging Video Codec Signals for Efficient Streaming VLM Inference

CodecSight: 利用视频编码信号实现高效的流式视频语言模型推理

Yulin Zou, Yan Chen, Wenyan Chen, JooYoung Park, Shivaraman Nitin, Luo Tao, Francisco Romero, Dmitrii Ustiugov

机构 * Beihang University(北京航空航天大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 CodecSight通过利用视频编码器内嵌的时空结构信息,实现流式视频分析的高效推理,提升吞吐量并减少GPU计算量,同时保持高精度。

Comments 18 pages, 34 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01831 2026-04-08 cs.LG cs.AI 81%

Routing-Based Continual Learning for Multimodal Large Language Models

基于路由的多模态大语言模型持续学习

Jay Mohta, Kenan Emir Ak, Gwang Lee, Dimitrios Dimitriadis, Yan Xu, Mingwei Shen

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于路由的持续学习方法,用于多模态大语言模型,有效缓解灾难性遗忘并提升跨模态迁移性能,同时保持训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04488 2026-04-07 cs.CV cs.LG 81%

A Patch-based Cross-view Regularized Framework for Backdoor Defense in Multimodal Large Language Models

基于补丁的跨视图正则化框架用于多模态大语言模型中的后门防御

Tianmeng Fang, Yong Wang, Zetai Kong, Zengzhen Su, Jun Wang, Chengjin Yu, Wei Wang

机构 * Singapore Management University(新加坡管理大学) China University of Mining and Technology(中国矿业大学) The University of Melbourne(墨尔本大学) Anhui University(安徽大学) Xi’an Jiaotong University(西安交通大学) Sun Yat-sen University(中山大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出一种基于补丁增强和跨视图正则化的统一后门防御框架,通过约束特征表示和输出分布层面的异常行为,有效降低后门攻击成功率并保持正常生成能力。

Comments 26 pages, 3 figures. Subjects: Machine Learning (cs.LG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03980 2026-04-07 cs.CV cs.AI 81%

Gram-Anchored Prompt Learning for Vision-Language Models via Second-Order Statistics

基于二阶统计的Gram锚定提示学习用于视觉-语言模型

Minglei Chen, Weilong Wang, Jiang Duan, Ye Deng

机构 * Southwestern University of Finance and Economics(西南财经大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出GAPL框架,通过引入Gram矩阵增强局部语义对齐与全局结构一致性,解决传统一阶特征在领域偏移下的鲁棒性不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18545 2026-04-06 cs.CV cs.AI 81%

CoDA: Exploring Chain-of-Distribution Attacks and Post-Hoc Token-Space Repair for Medical Vision-Language Models

CoDA:探索链式分布攻击及事后令牌空间修复用于医疗视觉-语言模型

Xiang Chen, Fangfang Yang, Chunlei Meng, Yuxian Dong, Ang Li, Yiwei Wei, Jiahuan Long, Jiujiang Guo, Chengyin Hu

专题命中 VLM训练与架构 :vision-language model(title);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CoDA框架,通过构建临床合理的流程偏移,评估医疗视觉-语言模型在真实临床工作流中的可靠性,发现零样本性能显著下降,并引入事后修复策略提升准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29676 2026-04-01 cs.LG cs.CL cs.CV 81%

A Comprehensive Information-Decomposition Analysis of Large Vision-Language Models

大型视觉-语言模型的全面信息分解分析

Lixin Xiu, Xufang Luo, Hideki Nakayama

机构 * The University of Tokyo(东京大学) Microsoft Research(微软研究院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文通过信息分解方法分析大型视觉-语言模型的信息谱,揭示任务模式和模型策略,为模型设计提供新视角。

Comments Accepted at ICLR 2026. Project page: https://riishin.github.io/pid-lvlm-iclr26/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08829 2026-04-01 cs.CV cs.AI 81%

InfiniteVL: Synergizing Linear and Sparse Attention for Highly-Efficient, Unlimited-Input Vision-Language Models

InfiniteVL: 融合线性与稀疏注意力以实现高效率、无限输入的视觉-语言模型

Hongyuan Tao, Bencheng Liao, Shaoyu Chen, Haoran Yin, Qian Zhang, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Horizon Robotics(地平线机器人)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 InfiniteVL通过融合线性与稀疏注意力机制,实现高效率和无限输入的视觉-语言模型,提升解码速度和长上下文处理能力。

Comments 20 pages, 8 figures, conference or other essential info

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28696 2026-03-31 cs.CV cs.AI 81%

AdaptToken: Entropy-based Adaptive Token Selection for MLLM Long Video Understanding

AdaptToken: 基于熵的自适应令牌选择用于多模态大语言模型长视频理解

Haozhe Qi, Kevin Qu, Mahdi Rad, Rui Wang, Alexander Mathis, Marc Pollefeys

机构 * Microsoft Spatial AI Lab(微软空间人工智能实验室) EPFL(瑞士联邦理工学院洛桑) ETH Zurich(苏黎世联邦理工学院)

专题命中 VLM训练与架构 :MLLM(title,abstract);分类 cs.CV、cs.AI

AI总结 AdaptToken通过利用模型自不确定性实现全局控制信号,提升多模态大语言模型对长视频的理解能力,通过熵信号分配令牌预算并支持提前停止,提升准确率并减少推理时间。

Comments Project page: https://haozheqi.github.io/adapt-token

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26768 2026-03-31 cs.CV cs.AI cs.CL 81%

Aesthetic Assessment of Chinese Handwritings Based on Vision Language Models

基于视觉语言模型的中文手写体审美评估

Chen Zheng, Yuxuan Lai, Haoyang Lu, Wentao Ma, Jitao Yang, Jian Wang

机构 * The Open University of China(中国开放大学) Engineering Research Center of Integration and Application of Digital Learning Technology, Ministry of Education(数字化学习技术集成与应用教育部工程研究中心) OUC-online(国开在线)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文基于视觉语言模型分析中文手写体质量,生成多级反馈,通过低秩适应和上下文学习方法提升评估效果,实验结果在CCL 2025工作坊中表现优异。

Comments Accepted by CCL2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26015 2026-03-30 cs.CV cs.AI 81%

VLAgeBench: Benchmarking Large Vision-Language Models for Zero-Shot Human Age Estimation

VLAgeBench: 大视觉-语言模型在零样本人类年龄估计中的基准测试

Rakib Hossain Sajib, Md Kishor Morol, Rajan Das Gupta, Mohammad Sakib Mahmood, Shuvra Smaran Das

机构 * Begum Rokeya University, Rangpur(贝古姆·罗基亚大学,朗布尔) American International University - Bangladesh(美国国际大学-孟加拉国)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出VLAgeBench,评估大视觉-语言模型在零样本人类年龄估计中的性能,展示通用LVLM在无微调情况下表现优异,揭示图像质量和人口子群体差异对性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25870 2026-03-30 cs.CV cs.LG 81%

Speech-Synchronized Whiteboard Generation via VLM-Driven Structured Drawing Representations

通过VLM驱动的结构化绘图表示实现语音同步的白板生成

Suraj Prasad, Pinak Mahapatra

机构 * Latent Spaces IITB(印度理工学院孟买分校潜在空间实验室)

专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出首个包含24对Excalidraw演示与叙述音频的白板数据集,研究基于Qwen2-VL-7B模型通过时间戳条件化实现语音同步的绘图预测,验证了模型在跨学科领域中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18480 2026-03-20 cs.CV cs.AI cs.HC 81%

Do Vision Language Models Understand Human Engagement in Games?

视觉语言模型是否能理解游戏中的玩家参与度?

Ziyi Wang, Qizan Guo, Rishitosh Singh, Xiyang Hu

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Southern California(南加州大学) Arizona State University(亚利桑那州立大学)

专题命中 VLM训练与架构 :vision language model(title);VLM(abstract);分类 cs.CV、cs.AI

AI总结 研究评估了三种视觉语言模型在不同提示策略下的表现,发现零样本预测效果差,而基于理论的提示策略难以有效提升参与度预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏