arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2597 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 533 篇

2607.04593 2026-07-07 cs.CV cs.AI 新提交 81%

TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models

TORINO:通过视觉语言模型中可解释的概念重叠进行令牌减少

Riccardo Renzulli, Gabriele Spadaro, Shruthi Gowda, Alaa Eddine Mazouz, Van-Tam Nguyen

机构 * University of Turin, Italy(意大利都灵大学) Eindhoven University of Technology, The Netherlands(荷兰埃因霍温理工大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 研究视觉语言模型计算成本高问题,提出TORINO框架,利用稀疏自动编码器将视觉令牌投影到可解释潜在空间,通过概念重叠分组并减少令牌,兼顾效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02995 2026-07-07 cs.CV cs.AI 新提交 81%

VISTA: Auditing Semantic Divergence in Vision-Language Models

VISTA:视觉语言模型中的语义差异审计

Junchi Liao, Jiawen Deng, Fuji Ren

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 研究视觉语言模型中视觉概念条件性差异,提出VISTA黑箱跨模型审计方法,结合语义熵与基于分布的差异标记异常,通过实验验证其有效性并发现新差异模式。

Comments Preprint. 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02819 2026-07-07 cs.CR cs.AI cs.CV 新提交 81%

Vision Token Manipulation Attacks on Cloud-Edge Inference of Large Vision-Language Models

对大型视觉语言模型云边缘推理的视觉令牌操纵攻击

Zikai Zhang, Rui Hu, Olivera Kotevska, Jiahao Xu

机构 * Department of Computer Science and Engineering, University of Nevada, Reno(内华达大学里诺分校计算机科学与工程系) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 研究黑盒中间人设置下的视觉令牌操纵攻击,提出四种简答攻击策略和基于优化的令牌选择方法,实验表明操纵少量视觉令牌可大幅降低大型视觉语言模型云边缘推理的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10797 2026-07-14 cs.CV 新提交 80%

Compositional Context Fine-Tuning Vision-Language Model for Complex Assembly Action Understanding from Videos

用于从视频理解复杂装配动作的组合上下文微调视觉语言模型

Hao Zheng, Jinyi Huang, Tiantian Zheng, Xun Xu, Tuka Alhanai

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) The University of Auckland(奥克兰大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV;vision language model(comments)

AI总结 针对装配动作理解难题,提出组合上下文微调方法及层划分交替训练方法,将动作分解为语义元素并微调视觉语言模型,创建相关数据集,实验证明该方法优于基线且能提供可解释预测,助力人机协作装配。

Comments Accepted by ICRA 2026. Video Understanding; Vision Language Model; Multi-modal LLM; Action Recognition; Assembly

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05949 2026-08-07 cs.AI cs.CV cs.LG 新提交 80%

VLMs for Videogame Data Annotation

用于视频游戏数据标注的视觉语言模型(VLMs)

Katrin Schmid, Iuri Frosio

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 该研究针对VLMs在视频游戏应用受限的问题,探究其用于游戏帧序列奖励信号标注的可行性,分析其在游戏问答中的不足并提出应对措施,还研究了输入参数对标注质量的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00584 2026-08-04 cs.CV cs.AI cs.LG 新提交 80%

Element-Aware Group Learning for E-Commerce Image Generation

面向电商图像生成的元素感知组学习

Jingtong Chen, Jiahui Wang, Xue Zhao, ShaoGuo Liu, Minghao Li

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对电商图像生成中GRPO仅在完整提示层面分配信用的缺陷,提出EAGLE-GRPO,通过分解奖励并推导闭式解实现元素级信用分配,提升提示质量与生成图像性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10666 2026-07-14 cs.CV cond-mat.mtrl-sci cs.AI cs.LG 新提交 80%

Answer-Conditioned Chain-of-Thought Distillation for Few-Shot Industrial Vision with Small VLMs

用于少样本工业视觉的小视觉语言模型的答案条件思维链蒸馏

Shubham Rao

机构 * Entropy AI Research Labs Private Limited(熵人工智能研究实验室私人有限公司)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对制造业视觉检测难题,提出答案条件思维链蒸馏法,利用最少标注数据让小型视觉语言模型适应新工业任务,经实验验证该方法在多任务中优于直接微调,提升了推理质量和模型性能。

Comments 11 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07401 2026-07-09 cs.CV cs.AI cs.LG 新提交 80%

Heterogeneity-Adaptive Diffusion Schrodinger Bridge for PET-Guided Whole-Body MRI Translation

用于PET引导的全身MRI转换的异质性自适应扩散薛定谔桥

Chengbo Wang, Jiacheng Yu, Linjie Bian, Ming Qi, Xiaosheng Liu, Tongtong Che, Jichang Zhang, Shuyu Li, Shaoli Song, Xiuying Wang

机构 * The University of Sydney(悉尼大学) Fudan University Shanghai Cancer Center(复旦大学附属上海肿瘤医院) Beijing Normal University(北京师范大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对PET-MR扫描时间长的问题,提出异质性自适应扩散薛定谔桥(HA-DSB)框架,通过整合视觉语言模型嵌入及PET先验,利用双阶段引导机制,实现全身MRI转换,提升不同区域尤其是病变区域的转换质量。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03624 2026-07-07 cs.CV cs.AI cs.LG 新提交 80%

RADIO1D: Elastic Representations for Condensed Vision Modeling

RADIO1D:用于压缩视觉建模的弹性表示

Greg Heinrich, Mike Ranzinger, Collin McCarthy, Natan Bagrov, Eugene Khvedchenya, Bryan Catanzaro, Jan Kautz, Andrew Tao, Pavlo Molchanov

机构 * NVIDIA(英伟达)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 挑战视觉语言模型需固定基于补丁的2D视觉特征的假设,分析微调视觉编码器,基于发现引入RADIO1D,用多教师知识蒸馏等将图像压缩成1D令牌序列,有强分层总结能力,在多模态基准测试中有优势。

Comments Published as main conference paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23679 2026-06-23 cs.CV cs.AI cs.GR cs.LG 新提交 80%

Semantic Browsing: Controllable Diversity for Image Generation

语义浏览:图像生成的可控多样性

Sara Dorfman, Maya Vishnevsky, Omer Dahary, Or Patashnik, Daniel Cohen-Or

机构 * Tel Aviv University(特拉维夫大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对文本到图像模型生成多样性不足且缺乏语义结构的问题,提出一种在文本层面引入多样性的方法,通过视觉语言模型和代理工作流实现用户可导航的语义变化空间。

Comments ECCV 2026. Project page: https://saradorfman1.github.io/SemanticBrowsing-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09059 2026-06-09 cs.LG cs.AI cs.CV 新提交 80%

Stage-1 Controls the Entropy Regime, Not the Outcome

Stage-1 控制熵状态,而非最终结果

Jianxiong Shen

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文通过小数据实验研究两阶段后训练中Stage-1(SFT或OPD)的作用,发现其主要影响策略熵状态,但对最终性能影响有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08060 2026-08-11 cs.CV 新提交 79%

ZOMP: Zeroth-Order Multi-Modal Prompt Tuning for Vision-Language Models

ZOMP:面向视觉-语言模型的零阶多模态提示调优

Sajjad Ghiasvand, Yifan Yang, Mahnoosh Alizadeh, Ramtin Pedarsani

机构 * UC Santa Barbara(加州大学圣巴巴拉分校)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出ZOMP方法,通过跨模态低秩重参数化等技术,在仅前向传递的条件下高效调优CLIP模型,在13个基准上优于现有无反向传播的提示调优方法,泛化能力更强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03580 2026-08-05 cs.CV 新提交 79%

SlimVLM: Sensitivity-aware Dynamic Structured Pruning with Adaptive Visual Token Selection for Efficient Vision-Language Models

SlimVLM:面向高效视觉-语言模型的感知敏感性动态结构化剪枝与自适应视觉token选择

Yaozhi Wen, Jialong Guo, Zhenliang Ni, Han Shu, Xinghao Chen

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 SlimVLM是一种结构化剪枝框架,通过自适应视觉token选择和感知敏感性动态剪枝机制,在压缩视觉-语言模型的同时保持性能,在多模态基准测试中达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25818 2026-07-29 cs.CV 新提交 79%

SepPrune:A Separator-based Pruning Framework for Efficient Multimodal Large Language Models

SepPrune:一种基于分隔符的高效多模态大语言模型剪枝框架

Yuchen Wang, Qihui Zhu, Yang Liu, Xiaoyan Sun, Siying Wu

机构 * University of Science and Technology of China(中国科学技术大学) ChangXin Memory Technologies(长鑫存储技术有限公司)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 针对多模态大语言模型视觉令牌计算成本高的问题,提出SepPrune剪枝方法,以模态分隔符令牌为统一查询来排序和选择视觉令牌,复用内置投影参数,无需架构更改,在Qwen2.5-VL-7B上实验取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24447 2026-07-28 cs.CV 新提交 79%

RP-OPSD: Resolution-Privileged On-Policy Self-Distillation for Multimodal Large Language Models

RP - OPSD:用于多模态大语言模型的分辨率特权在线自蒸馏

Qihui Zhu, Yuchen Wang, Zijian Wen, Tao Zhang, Mengjie Zhang, Yang Liu, Shuangwu Chen, Siying Wu, Jian Yang, Xiaofeng Jiang

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 研究针对多模态大语言模型在线自蒸馏问题,利用同一图像高低分辨率视图信息差提出RP - OPSD,学生策略用低分辨率图像生成轨迹,教师策略用原始分辨率图像监督,实验表明该方法能提升性能并加快训练速度,为在线自蒸馏提供有效途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17052 2026-07-21 cs.CV 新提交 79%

Searching for Task-Specific Vision Paths: Evolutionary Block Pruning Across Vision-Language Models

寻找特定任务的视觉路径:跨视觉语言模型的进化块剪枝

Tarun Tomar

机构 * IIIT(国际信息技术研究所)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究视觉语言模型中能否跳过固定预算视觉块组合,引入源平衡进化搜索并与其他方法比较,实验表明组合搜索可改进路由构建,但能力标签不能定义普遍可转移视觉路径,搜索能跨架构转移,能力专业化稳定性欠佳。

Comments 14 pages, 8 figures. Code and aggregate evidence: https://github.com/TarunTomar122/vision-pathways

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14966 2026-07-17 cs.CV 新提交 79%

U-shaped Multi-granularity Learning for Vision-Language Models

用于视觉语言模型的U形多粒度学习

Biao Chen, Yunqian Yu, Xiangxu Zhao, Zhongshu Chen, Mengmeng Jing, Lin Zuo

机构 * University of Electronic Science and Technology of China(电子科技大学) Hithink Research(恒生电子股份有限公司)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究视觉语言模型提示学习的粒度困境,提出U形多粒度提示学习框架UPrompt,通过构建并行多粒度表示及粗细粒度交互增强与监督,在多个基准实验中验证了其有效性和优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13500 2026-07-16 cs.CV 新提交 79%

Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models

用于高效视觉语言模型的无注意力轻量级令牌约简

Xuanyi Hao, Zuoyuan Zhang, Zhibo Wang, Xiaoyi Pang, Jiahui Hu, Jiacheng Du, Shuguo Zhuo

机构 * Zhejiang University(浙江大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 针对视觉语言模型在边缘设备部署难的问题,提出无注意力轻量级令牌约简框架,通过基于熵的准则估计令牌重要性,引入一致性信号确保视觉覆盖,经实验验证该框架在精度和效率权衡上表现出色。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08029 2026-07-10 cs.LG 新提交 79%

Rethinking Small VLM Quantization: From Component-Wise Analysis to Hardware-Aware Edge Deployment

重新思考小型视觉语言模型量化:从组件级分析到硬件感知边缘部署

Hyeju Shin, Chorwon Kim, Ryangsoo Kim, Hark Yoo, Jaein Kim

专题命中 VLM训练与架构 :VLM(title);vision language model(abstract);分类 cs.LG

AI总结 本文针对小型视觉语言模型量化,提出系统评估框架,在特定硬件上验证五个假设,分离相关组件得出结论,包括量化敏感性受结构范式影响、SigLIP编码器延迟情况、大语言模型INT4量化利弊、复合量化误差特点及不同平台每焦耳智能差异。

Comments 14 pages. Accepted at the ICML 2026 Workshop on Hypothesis Testing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06185 2026-07-08 cs.CV 新提交 79%

Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition

用于细粒度图像识别的视觉语言模型中的结构化压缩提示调优

Xinda Liu, Qinyu Zhang, Weiqing Min, Guohua Geng, Shuqiang Jiang

机构 * School of Information Science and Technology, Northwest University(西北大学信息科学与技术学院) Laboratory of Intelligent Information Processing, Institute of Computing Technology(中国科学院计算技术研究所智能信息处理重点实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 针对细粒度图像识别中视觉语言模型捕捉细微差别能力有限的问题,提出结构化压缩提示调优(SCPT),通过语义关系编码和语义压缩损失增强语义结构建模,在多基准实验中有效减轻语义模糊性,取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01908 2026-07-03 cs.CV 新提交 79%

Towards Real-World Ultrasound Understanding: Large Vision-Language Models from Multi-Image Examinations with Long-Form Reports

迈向真实世界超声理解:基于多图像检查与长文本报告的大规模视觉语言模型

Bingcong Yan, Chunlei Li, Jingliang Hu, Yilei Shi, Xiao Xiang Zhu, Lichao Mou

机构 * MedAI Technology (Wuxi) Co. Ltd.(MedAI科技(无锡)有限公司) Technical University of Munich(慕尼黑工业大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 通过构建150万次真实超声检查的大规模数据集(含1770万图像和多器官覆盖),采用标准视觉语言模型结合低秩适配微调,无需复杂架构即实现多任务超声理解性能领先。

Comments Project Page: https://medai-t.github.io/LUMI/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28266 2026-06-29 cs.CV 新提交 79%

RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning

RSICCLLM:用于遥感图像变化描述的多模态大语言模型

Yelin Wang, Zijia Song, Shuo Ye, Chuanguang Yang, Miaoyu Wang, Yong Xu, Zhulin An, Yongjun Xu, Zitong Yu

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(人工智能安全国家重点实验室,计算技术研究所,中国科学院,北京,中国) Great Bay University, Dongguan, China(东莞Great Bay大学,中国) Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳学院,中国) Dongguan Key Laboratory for Intelligence and Information Technology, Dongguan, China(东莞智能与信息科技重点实验室,中国)

专题命中 VLM训练与架构 :multimodal large language model(title);vision-language model(abstract);分类 cs.CV

AI总结 提出首个针对遥感图像变化描述任务的大视觉语言模型后训练框架RSICCLLM,通过数据生成范式、差异感知微调和双负偏好优化,仅7B参数即超越更大规模模型。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24156 2026-06-24 cs.CV 新提交 79%

Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction

利用先验校正的令牌缩减加速多模态大语言模型

Zengjie Chen, Yuxiang Cai, Jingcai Guo, Taotao Cai, Jianwei Yin, Zhi Chen

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Zhejiang Key Laboratory of Digital-Intelligence Service Technology(浙江省数字化服务技术重点实验室) Hong Kong Polytechnic University(香港理工大学) The University of Southern Queensland(南昆士兰大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 提出PriorTR方法,通过分离任务条件注意力与模型先验注意力,在单次前向传播中估计先验并校正令牌重要性,实现无训练令牌缩减,提升多模态大语言模型效率与准确性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19944 2026-06-19 cs.CV 新提交 79%

Timage: A Generative Text-in-Image Paradigm for Fine-Tuning Vision-Language Models

Timage: 一种用于微调视觉语言模型的文本嵌入图像生成范式

Yifeng Wu, Huimin Huang, Ruiluo Wu, Chunyi Lin, Guanhua Chen, Xian Wu, Wang Song, Ruize Han

机构 * Fudan University(复旦大学) Shenzhen University of Advanced Technology(深圳先进技术大学) Tencent Jarvis Lab(腾讯贾维斯实验室) Southern University of Science and Technology(南方科技大学)

专题命中 VLM训练与架构 :vision-language model(title);multimodal large language model(abstract);分类 cs.CV

AI总结 提出Timage范式,通过约束薛定谔桥将查询文本作为排版覆盖层嵌入图像,以显式空间锚点引导模型关注,在不侵蚀骨干能力前提下提升细粒度空间推理性能。

Comments ECCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19062 2026-06-18 cs.CV 新提交 79%

DREAM: Extending Vision-Language Models with Dual-Objective Encoding for Cross-Modal Retrieval

DREAM: 通过双目标编码扩展视觉-语言模型用于跨模态检索

Kaleem Ullah, Altaf Hussain, Muhammad Munsif, Sung Wook Baik

机构 * Sejong University(世宗大学) Korea Advanced Institute of Science and Technology(韩国科学技术院) Ulsan National Institute of Science and Technology(乌山国立科学研究院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 提出DREAM模型,通过双路径表示增强与对齐,结合层级视觉编码器和混合语言建模,在视频检索任务中实现新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17410 2026-06-17 cs.CV 新提交 79%

Attention Alignment Between Humans and Vision-Language Models

人类与视觉语言模型之间的注意力对齐

Isaac R. Christian, Udith Haputhanthrige, Hanna Hornfeld, Declan Campbell, Samuel Nastase, Taylor Webb, Michael Graziano

机构 * Princeton Neuroscience Institute, Princeton University(普林斯顿大学普林斯顿神经科学研究所) Department of Psychology, Princeton University(普林斯顿大学心理学系) Department of Computer Science, Princeton University(普林斯顿大学计算机科学系) Department of Psychology and Center for Computational Language Sciences, University of Southern California(南加州大学心理学系与计算语言科学中心) Department of Psychology, Université de Montréal(蒙特利尔大学心理学系)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本研究比较了六种视觉语言模型的空间注意力图与人类注视热图,发现解码器架构(LSTM vs Transformer)主导对齐程度,LSTM解码器对齐度更高但空间分散且任务区分度低,而Transformer解码器注意力更集中且任务区分度强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13226 2026-08-14 cs.CV cs.AI 新提交 79%

CoverPrune: Coverage-Driven Token Pruning for 3D VLMs via Optimal Transport

CoverPrune:基于最优传输的3D视觉语言模型的覆盖驱动型令牌剪枝

Peng Ling, Yingda Yin, Lingting Zhu, Weikai Chen, Shengju Qian, Zeyu Hu, Xin Wang, Wenming Yang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) LIGHTSPEED

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对3D VLMs因大量视觉令牌导致的计算瓶颈,提出CoverPrune框架,将剪枝转化为最优传输问题,结合FST成本与SGS算法,实现高效剪枝且性能优异。

Comments Accepted to ECCV 2026 as an Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11167 2026-08-12 cs.CV cs.CL cs.LG 新提交 79%

MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment

多模态代码切换:将视觉对象交织入语言以实现显式对象级对齐

Changhao Xiang, Shangyu Xing, Zhen Wu, Jianbing Zhang, Xinyu Dai

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 VLM训练与架构 :multimodal large language model(abstract,abstract_cn);grounding(abstract);分类 cs.CV、cs.LG

AI总结 针对现有多模态大语言模型的图像级对齐存在指称歧义的问题,提出多模态代码切换(MMCS)范式,构建含77.3万样本的数据集,仅用5万样本即可匹配或超越60万图像-文本对训练的模型,提升了视觉基础与感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07088 2026-08-10 cs.CV cs.AI 新提交 79%

RoRA: Role-Oriented Regional Allocation for Visual Token Pruning in MLLMs

RoRA:面向角色的区域分配,用于多模态大语言模型中的视觉令牌剪枝

Qiyanhui Lu, Han Wu, Rongjian Xu, Tingzhang Luo, Cheng Fan, Xinghao Chen, Minjing Dong, Jufeng Yang, Jianyuan Guo

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究针对多模态大语言模型视觉令牌剪枝的高开销问题,提出无训练框架RoRA,通过角色导向的区域分配实现高效剪枝,在多个模型系列上优于基线,大幅降低推理时间且保留高准确率。

Comments 9 pages, 4 figures, 4 tables. Code is available at https://github.com/LukieLuu/RoRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06411 2026-08-10 cs.AI cs.CV 新提交 79%

Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin

学习在多模态大语言模型(MLLMs)中预测中间层注意力以进行视觉token剪枝

Yuyao Sun, Tao Deng, Shuang Li, Deqing Wang, Hao Geng, Minjun Yu

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对MLLMs视觉token剪枝的固定层非最优及计算成本高的问题,提出MAP方法,实现仅保留5.56%视觉token时维持97.5%性能,获3.09倍端到端加速。

详情

展开后加载摘要…

URL PDF HTML 收藏