arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-21 至 2026-04-21 共收录 32 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 32 篇

2501.05067 2026-04-21 cs.CV cs.AI 91%

LLaVA-Octopus: Unlocking Instruction-Driven Adaptive Projector Fusion for Video Understanding

LLaVA-Octopus:解锁指令驱动的自适应投影器融合用于视频理解

Boyuan Sun, Jiaxing Zhao, Xiang Chen, Xihan Wei, Qibin Hou

机构 * VCIP, CS, Nankai University(南开大学计算机科学与技术学院) Tongyi Group, Alibaba(阿里巴巴通义集团)

专题命中 VLM训练与架构 :LLaVA(title,title_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 LLaVA-Octopus通过根据用户指令动态调整不同视觉投影器的特征权重,提升视频理解任务的性能,实验表明其在多个基准测试中表现优异。

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09741 2026-04-21 cs.CV cs.LG 90%

Constructive Distortion: Improving MLLMs with Attention-Guided Image Warping

构造性失真:通过注意力引导的图像扭曲改进MLLMs

Dwip Dalal, Gautam Vashishtha, Utkarsh Mishra, Jeonghwan Kim, Madhav Kanda, Hyeonjeong Ha, Svetlana Lazebnik, Heng Ji, Unnat Jain

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Skan AI Texas A&M University(德克萨斯大学阿姆斯特朗分校) University of California, Irvine(加州大学 Irvine 分校)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);InternVL(abstract,abstract_cn);MLLM(abstract,abstract_cn);grounding(abstract)

AI总结 本文提出AttWarp方法,通过注意力引导的图像扭曲增强MLLMs对细节和空间关系的感知能力,提升准确性和推理能力。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16462 2026-04-21 cs.CV cs.AI 89%

From Inheritance to Saturation: Disentangling the Evolution of Visual Redundancy for Architecture-Aware MLLM Inference Acceleration

从继承到饱和:解构视觉冗余的演化以实现架构感知的MLLM推理加速

Jiaqi Shi, Yuechan Li, Xulong Zhang, Xiaoyang Qu, Jianzong Wang

机构 * University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司)

专题命中 VLM训练与架构 :MLLM(title,title_cn);LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HalfV框架,通过统一剪枝策略缓解内在视觉冗余,并根据具体表现适应性处理二次饱和冗余,实现跨架构的高效推理。

Comments 16 pages, 14 figures, plus appendix, accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17041 2026-04-21 cs.CV 89%

SIF: Semantically In-Distribution Fingerprints for Large Vision-Language Models

SIF:用于大视觉-语言模型的语义内分布指纹

Yifei Zhao, Qian Lou, Mengxin Zheng

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);LLaVA(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出SIF,一种无需参数修改的非侵入性所有权验证框架,通过语义对齐指纹蒸馏和鲁棒指纹优化,提升大视觉-语言模型的版权保护能力。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17087 2026-04-21 cs.CV cs.LG 86%

EvoComp: Learning Visual Token Compression for Multimodal Large Language Models via Semantic-Guided Evolutionary Labeling

EvoComp: 通过语义引导的进化标注学习多模态大语言模型的视觉令牌压缩

Jiafei Song, Fengwei Zhou, Jin Qu, Wenjin Jason Li, Tong Wu, Gengjian Xue, Zhikang Zhao, Daomin Wei, Yichao Lu, Bailin Na

机构 * OPPO CTG

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 本文提出EvoComp框架,通过语义引导的进化标注策略,有效压缩视觉令牌数量,同时保持任务精度,实验显示在3倍压缩下保持99.3%的准确率,并在移动设备上提升1.6倍速度。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18512 2026-04-21 cs.CV 85%

S2H-DPO: Hardness-Aware Preference Optimization for Vision-Language Models

S2H-DPO:面向视觉-语言模型的硬度感知偏好优化

Nitish Shukla, Surgan Jandial, Arun Ross

机构 * Michigan State University(密歇根州立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出S2H-DPO框架,通过三级层次推理构建多图象偏好数据,提升多图象推理性能,同时保持单图象推理能力,推动视觉偏好对齐的前沿发展。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17320 2026-04-21 cs.CV 85%

Towards Joint Quantization and Token Pruning of Vision-Language Models

面向视觉-语言模型的联合量化与令牌剪枝

Xinqing Li, Xin He, Xindong Zhang, Ming-Ming Cheng, Lei Zhang, Yun Liu

机构 * VCIP, College of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学) School of Computer Science and Engineering, Tianjin University of Technology(计算机科学与工程学院,天津工业大学) OPPO Research Institute(OPPO研究院) Academy for Advanced Interdisciplinary Studies, Nankai University(先进跨学科研究院,南开大学) Nankai International Advanced Research Institute, Shenzhen Futian(南开国际先进研究 institutes,深圳福田) Department of Computing, Hong Kong Polytechnic University(计算学院,香港理工大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出联合量化与令牌剪枝框架,通过统一低比特推理和确定性视觉令牌剪枝,提升视觉-语言模型在低比特下的鲁棒性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17241 2026-04-21 cs.RO 85%

GaLa: Hypergraph-Guided Visual Language Models for Procedural Planning

GaLa:基于超图的视觉语言模型用于程序规划

Kun Wang, Yiming Li, Mingcheng Qu, Aqiang Zhang, Guang Yang, Tonghua Su

机构 * Harbin Institute of Technology(哈尔滨工业大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳)) Chongqing Research Institute of HIT(重庆哈尔滨工业大学研究院)

专题命中 VLM训练与架构 :visual language model(title);VLM(abstract,abstract_cn);vision language model(abstract)

AI总结 GaLa通过超图表示学习,有效捕捉物体间的隐含语义关系和功能区域的层次结构,提升多模态程序规划的性能。

Comments 14pages, 7figures

Journal ref ACL 2026(Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17982 2026-04-21 cs.CV cs.CL 84%

Mitigating Multimodal Hallucination via Phase-wise Self-reward

通过分阶段自奖励缓解多模态幻觉

Yu Zhang, Chuyang Sun, Kehai Chen, Xuefeng Bai, Yang Xiang, Min Zhang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Shenzhen(深圳) China(中国)

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出PSRD框架,通过分阶段自奖励信号在推理时动态抑制幻觉,有效降低LLaVA-1.5-7B的幻觉率50%,在多个基准上优于现有方法。

Comments Self-reward for vision hallucination mitigation

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23179 2026-04-21 cs.AI 81%

Universal Adversarial Attacks against Closed-Source MLLMs via Target-View Routed Meta Optimization

针对闭源多模态大语言模型的通用对抗攻击:通过目标视角路由元优化

Hui Lu, Yi Yu, Yiming Yang, Chenyu Yi, Xueyi Ke, Qixing Zhang, Bingquan Shen, Alex Kot, Xudong Jiang

机构 * Rapid-Rich Object Search Lab, Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(快速丰富目标搜索实验室,跨学科研究生项目,南洋理工大学,新加坡) School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(电气与电子工程学院,南洋理工大学,新加坡) College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡) DSO National Laboratories, Singapore(新加坡国防科学实验室)

专题命中 VLM训练与架构 :MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出MCRMO-Attack,通过多作物聚合与注意力引导裁剪稳定监督,通过对齐性门控令牌路由提升token级可靠性,并元学习跨目标扰动先验,从而在商业MLLM上提升未见图像攻击成功率。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17699 2026-04-21 cs.CV cs.AI 81%

Understanding Counting Mechanisms in Large Language and Vision-Language Models

理解大语言和视觉-语言模型中的计数机制

Hosein Hasani, Amirmohammad Izadi, Fatemeh Askari, Mobin Bagherian, Sadegh Mohammadian, Mohammad Izadi, Mahdieh Soleymani Baghshah

机构 * Sharif University of Technology(谢里夫大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究大语言和视觉-语言模型在计数任务中如何表示和计算数值信息,通过实验和分析揭示了计数机制的分层结构及内部计数器的作用。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17217 2026-04-21 cs.CV cs.AI 81%

Cross-Modal Attention Analysis and Optimization in Vision-Language Models: A Study on Visual Reliability

视觉-语言模型中的跨模态注意力分析与优化:对视觉可靠性的研究

Lijie Zhou

机构 * School of Computer Science(计算机科学学院) University of Nottingham Ningbo China(诺丁汉大学宁波分校)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究了视觉-语言模型中跨模态依赖性问题,通过对抗性评估框架发现优化模型能显著降低跨模态依赖,提升视觉特征关注度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18271 2026-04-21 cs.RO 80%

EmbodiedLGR: Integrating Lightweight Graph Representation and Retrieval for Semantic-Spatial Memory in Robotic Agents

EmbodiedLGR:整合轻量级图表示与检索用于机器人代理中的语义-空间记忆

Paolo Riva, Leonardo Gargani, Matteo Frosi, Matteo Matteucci

机构 * Department of Electronics, Information, and Bioengineering (DEIB), Politecnico di Milano(电子、信息与生物工程系(DEIB),米兰理工大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract)

AI总结 本文提出EmbodiedLGR-Agent,通过参数高效VLM构建语义-空间记忆,实现高效的环境记忆表示与检索,实验证明其在推理和查询时间上达到SOTA,且在实际部署中表现出良好的实用性。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18075 2026-04-21 cs.CV 79%

Enhancing Continual Learning of Vision-Language Models via Dynamic Prefix Weighting

通过动态前缀加权增强视觉-语言模型的持续学习

Hyeonseo Jang, Hyuk Kwon, Kibok Lee

机构 * Yonsei University(延世大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出动态前缀加权框架,通过动态调整前缀权重和适配器机制,提升视觉-语言模型在领域-类别增量学习中的性能。

Comments CVPR 2026; revised text and figures for improved readability

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00553 2026-04-21 cs.CV 79%

HiPrune: Hierarchical Attention for Efficient Token Pruning in Vision-Language Models

HiPrune:面向视觉-语言模型的层次注意力高效标记修剪

Jizhihui Liu, Feiyi Du, Guangdao Zhu, Niu Lian, Jun Li, Bin Chen, Weili Guan, Yaowei Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出HiPrune,通过分析视觉编码器中不同层次的注意力特性,实现高效的标记修剪,无需训练且适用于多种模型,在低token预算下保持高任务准确率。

Comments Accepted at ACL-2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16943 2026-04-21 cs.CL 78%

MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation

MNAFT:多模态大语言模型的模态神经感知微调用于图像翻译

Bo Li, Ningyuan Deng, Tianyu Dong, Shaobo Wang, Shaolin Zhu, Lijie Wen

机构 * School of Computer Science and Technology, Tianjin University, Tianjin, China(天津大学计算机科学与技术学院) School of Software, Tsinghua University, Beijing, China(清华大学软件学院) School of Information Resource Management, Renmin University of China,Beijing, China(中国人民大学信息资源管理学院) School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院) Baidu Inc., Beijing, China(百度公司)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract)

AI总结 本文提出MNAFT,通过识别视觉和语言模块中语言无关和语言特定的神经元,改进多模态大语言模型在图像翻译中的表现,实验表明其优于现有方法。

Comments Accepted by SCIS (SCIENCE CHINA Information Science)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14324 2026-04-21 cs.CV cs.CL 77%

DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies

DualToken: 向通过双视觉词汇统一视觉理解和生成迈进

Wei Song, Yuran Wang, Zijia Song, Yadong Li, Zenan Zhou, Long Chen, Jianhua Xu, Jiaqi Wang, Kaicheng Yu

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Baichuan Inc.(北川科技) Peking University(北京大学) Xiaomi EV(小米电动车)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 DualToken通过双视觉词汇统一视觉理解和生成,解决了视觉理解和生成所需不同表示空间的挑战,提升了ImageNet上的重建质量和零样本准确率,并在下游任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26721 2026-04-21 cs.AI cs.MM 77%

MaLoRA: Gated Modality LoRA for Key-Space Alignment in Multimodal LLM Fine-Tuning

MaLoRA:基于关键空间对齐的门控模态LoRA

Xinhan Zheng, Huyu Wu, Xueting Wang, Duo Su, Haiyun Jiang

机构 * University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-鲁维尔研究所) Rajiv Gandhi University(拉贾·甘地大学) Palmer Research Laboratories(帕勒实验室)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出MaLoRA,通过门控机制对齐多模态LLM微调中的关键空间,揭示文本偏见源于注意力键空间内在不匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07143 2026-04-21 cs.CV 77%

Are We Using the Right Benchmark: An Evaluation Framework for Visual Token Compression Methods

我们是否在使用正确的基准:视觉令牌压缩方法的评估框架

Chenfei Liao, Wensong Wang, Zichen Wen, Xu Zheng, Yiyu Wang, Haocong He, Yuanhuiyi Lyu, Lutao Jiang, Xin Zou, Yuqian Fu, Bin Ren, Linfeng Zhang, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) Northeastern University(东北大学) Shanghai AI Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科技大学) MBZUAI

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文通过实验证明现有基准含大量无关样本, downsampling能有效过滤样本,提出VTC-Bench框架以更公平评估视觉令牌压缩方法。

Comments Accepted by ACL2026 Main. Code: https://github.com/Chenfei-Liao/VTC-Bench; Project Page: https://chenfei-liao.github.io/VTC-Bench-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02617 2026-04-21 cs.LG cs.AI cs.CV 75%

Improving Dynamic Object Interactions in Text-to-Video Generation with AI Feedback

通过AI反馈提升文本到视频生成中动态物体交互

Hiroki Furuta, Heiga Zen, Dale Schuurmans, Aleksandra Faust, Yutaka Matsuo, Percy Liang, Sherry Yang

机构 * Google DeepMind(谷歌DeepMind) The University of Tokyo(东京大学) Stanford University(斯坦福大学)

专题命中 VLM训练与架构 :vision-language model(abstract);vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文研究如何利用反馈提升文本到视频模型中动态物体交互的质量,提出利用视觉语言模型提供针对性反馈,实验表明该方法在视频交互场景质量上有显著提升。

Comments Website: https://sites.google.com/view/aif-dynamic-t2v/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18394 2026-04-21 cs.SE 67%

OpenGame: Open Agentic Coding for Games

OpenGame: 开源代理游戏开发

Yilei Jiang, Jinyuan Hu, Qianyin Xiao, Yaozhi Zheng, Ruize Ma, Kaituo Feng, Jiaming Han, Tianshuo Peng, Kaixuan Fan, Manyuan Zhang, Xiangyu Yue

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn)

AI总结 OpenGame通过Game Skill和GameCoder-27B实现端到端网页游戏开发,解决跨文件不一致和逻辑不一致问题,建立新状态-of-the-art。

Comments OpenGame Report-v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21545 2026-04-21 cs.RO 67%

UniDomain: Pretraining a Unified PDDL Domain from Real-World Demonstrations for Generalizable Robot Task Planning

UniDomain:从真实世界演示中预训练一个统一的PDDL领域以实现可泛化的机器人任务规划

Haoming Ye, Yunxiao Xiao, Cewu Lu, Panpan Cai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 VLM训练与架构 :VLM(abstract_cn);grounding(abstract)

AI总结 UniDomain通过预训练统一的PDDL领域,结合机器人操作演示,实现可泛化的任务规划,实验显示其在零样本情况下任务成功率和计划优化度显著提升。

Comments Accepted at NeurIPS 2025

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17274 2026-04-21 cs.CV cs.AI 62%

Instinct vs. Reflection: Unifying Token and Verbalized Confidence in Multimodal Large Models

本能与反思:统一令牌和 verbalized 自信在多模态大模型中

Yunkai Dang, Yifan Jiang, Yizhu Jiang, Anqi Chen, Wenbin Li, Yang Gao

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文研究多模态大模型响应自信估计的本能-反思不一致问题,提出融合框架和均值对齐方法,提升校准和失败预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17209 2026-04-21 cs.CV cs.AI eess.SP 62%

DREAM: Dynamic Retinal Enhancement with Adaptive Multi-modal Fusion for Expert Precision Medical Report Generation

DREAM:动态视网膜增强与自适应多模态融合用于专家精准医疗报告生成

Nagur Shareef Shaik, Teja Krishna Cherukuri, Dong Hye Ye

机构 * Department of Computer Science, Georgia State University(佐治亚州立大学计算机科学系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 DREAM通过动态多模态融合提升视网膜图像医疗报告生成精度,在数据有限时仍能生成高质量报告,实现BLEU-4 0.241的SOTA表现。

Comments Accepted at the IEEE Engineering in Medicine and Biology Society Annual International Conference (Proceedings of the 48th International Conference), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16883 2026-04-21 cs.LG cs.AI 62%

SinkRouter: Sink-Aware Routing for Efficient Long-Context Decoding in Large Language and Multimodal Models

SinkRouter: 为大语言和多模态模型高效长上下文解码的感知路由

Junnan Liu, Xinyan Liu, Peifeng Gao, Zhaobo Qi, Beichen Zhang, Weigang Zhang, Antoni Bert Chen

机构 * Harbin Institute of Technology (Weihai)(哈尔滨工业大学(威海)) University of Hong Kong(香港大学) City University of Hong Kong(城市大学)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SinkRouter,通过感知路由机制提升长上下文解码效率,减少计算冗余,实现在512K上下文下的2.03倍加速,保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18452 2026-04-21 cs.CV cs.CL 57%

ESsEN: Training Compact Discriminative Vision-Language Transformers in a Low-Resource Setting

ESsEN: 在低资源环境下训练紧凑的判别视觉-语言变换器

Clayton Fields, Casey Kennington

机构 * Department of Computer Science(计算机科学系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出ESsEN模型,通过双塔编码器结构和传统卷积网络,实现低资源环境下高效视觉-语言模型训练,实验表明其参数量仅为其他模型的分数,性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18376 2026-04-21 cs.CV 57%

Towards Robust Text-to-Image Person Retrieval: Multi-View Reformulation for Semantic Compensation

面向鲁棒的文本到图像人物检索:多视图重新公式化用于语义补偿

Chao Yuan, Yujian Zhao, Haoxuan Xu, Guanglin Niu

机构 * Beihang University(北航)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 本文提出基于大语言模型的语义补偿框架,通过多视图语义重新公式化和特征补偿提升跨模态表示一致性,解决文本到图像检索中的表达漂移问题,实验表明其在三个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18260 2026-04-21 cs.CV 57%

Geometry-Guided 3D Visual Token Pruning for Video-Language Models

基于几何的3D视觉标记修剪用于视频-语言模型

Han Li, Zehao Huang, Jiahui Fu, Naiyan Wang, Si Liu

机构 * Beihang University(北京航空航天大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出Geo3DPruner框架,通过几何感知全局注意力建模跨帧相关性,并采用两阶段修剪过程,保留90%的视觉标记同时保持90%原始性能,优于现有文本引导和视觉引导修剪方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18091 2026-04-21 cs.CL cs.CV 57%

Culture-Aware Humorous Captioning: Multimodal Humor Generation across Cultural Contexts

具有文化意识的幽默标题生成:跨文化多模态幽默生成

Run Xu, Lu Li, Rongzhao Zhang, Jie Xu

机构 * Nanyang Technological University(南洋理工大学) Tongji University(同济大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出一种多模态幽默生成任务,通过文化意识标题生成模型在不同文化背景下生成幽默标题,改进了文化背景下的图像相关性、语境适配性和幽默质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17629 2026-04-21 cs.CV 57%

BioVLM: Routing Prompts, Not Parameters, for Cross-Modality Generalization in Biomedical VLMs

BioVLM:通过路由提示而非参数实现生物医学VLMs的跨模态泛化

Mainak Singha, Tanisha Gupta, Ankit Jha, Muhammad Haris Khan, Sayantani Ghosh, Biplab Banerjee

机构 * University of Trento(特伦托大学) Carnegie Mellon University(卡内基梅隆大学) LNMIIT Jaipur(贾伊普尔 LNMIIT) MBZUAI Sunandan Divatia School of Science(Sunandan Divatia 科学学院) IIT Bombay(博伊斯大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 BioVLM通过动态提示选择和提示银行学习,提升跨域泛化能力,无需大量骨干网络微调,在11个MedMNIST+2D数据集上取得新突破。

Comments Accepted in ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏