arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-03 至 2026-06-03 共收录 22 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 22 篇

2606.03075 2026-06-03 cs.CV 87%

TGV-KV: Text-Grounded KV Eviction for Vision-Language Models

TGV-KV:面向视觉语言模型的文本引导KV驱逐方法

Jizhihui Liu, Ruizi Han, Miao Zhang, Rui Shao, Xuebo Liu, Weili Guan, Yaowei Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);VLM(abstract_cn);分类 cs.CV

AI总结 针对视觉语言模型中视觉信息冗余导致的KV缓存内存消耗问题,提出基于文本引导的KV驱逐方法TGV-KV,通过文本-视觉预算分配、文本加权排序和文本优先保留策略,在保持高精度的同时显著提升推理吞吐量。

Comments Accepted by ICML-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01282 2026-06-03 cs.CV cs.AI 84%

Align-KD: Distilling Cross-Modal Alignment Knowledge for Mobile Vision-Language Model Enhancement

Align-KD:为移动视觉语言模型增强提取跨模态对齐知识

Qianhan Feng, Wenshuo Li, Tong Lin, Xinghao Chen

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University, China(通用人工智能国家重点实验室,智能科学与技术学院,北京大学,中国) Huawei Noah’s Ark Lab, China(华为诺亚方舟实验室,中国)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出Align-KD方法,通过蒸馏教师模型浅层跨模态对齐知识,指导1.7B学生模型学习视觉-文本匹配,在6个基准上平均提升2.0分。

Comments CVPR 2025 Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16816 2026-06-03 cs.RO 83%

"I'm Not Mad, Just Focused'': Understanding Human Emotions in Human-Robot Collaboration

“我没生气,只是专注”:理解人机协作中的人类情绪

Seung Chan Hong, Dana Kulić, Leimin Tian

机构 * Faculty of Engineering, Monash University(莫纳什大学工程学院) CSIRO Robotics(CSIRO机器人实验室)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision language model(abstract)

AI总结 提出基于视觉语言模型(VLM)的情绪识别系统,利用上下文理解改善人机协作中的情绪解读,实验表明其语义相似性和情感对齐优于基线CNN系统,且用户偏好情绪自适应机器人行为。

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 7, pp. 8260-8267, July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05852 2026-06-03 cs.CV 83%

Interpretable Modeling of Driver Attention Shifts with a Vision-Language Model

基于视觉-语言模型的驾驶员注意力转移可解释建模

Kaiser Hamid, Khandakar Ashrafi Akbar, Peihang Li, Nade Liang

机构 * Texas Tech University(德克萨斯理工大学) Towson University(托森大学)

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本研究通过少量人工监督微调视觉-语言模型,生成可解释的驾驶员注意力转移描述,以补充传统注视热图,提升人因分析、监控和态势感知支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18740 2026-06-03 cs.CV cs.AI cs.CL cs.LG 80%

Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation

Vision-OPD:通过在线策略自蒸馏学习多模态大语言模型的精细细节

Qianhao Yuan, Jie Lou, Xing Yu, Hongyu Lin, Le Sun, Xianpei Han, Yaojie Lu

机构 * Tsinghua University(清华大学)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出Vision-OPD框架,通过在线策略自蒸馏将模型自身的局部区域感知能力迁移到全局图像策略,提升多模态大语言模型对细粒度视觉理解的准确性。

Comments Project page: https://github.com/VisionOPD/Vision-OPD

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03180 2026-06-03 cs.CV cs.CL cs.LG 79%

GLINT: Sparsely Gated Vision-Language Alignment for Fine-Grained Radiology Representations

GLINT:面向细粒度放射学表征的稀疏门控视觉-语言对齐

Jonggwon Park, Seongeun Lee, Junhyun Park, Hannah Yun, Hyunwoong Kim, Sohyun Jeong, Hyewon Kang, Byungmu Yoon, Kyoyun Choi

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);grounding(abstract);分类 cs.CV、cs.LG

AI总结 针对放射学图像-报告全局对齐与局部病灶尺度不匹配的问题,提出GLINT框架,通过稀疏门控对齐和密集特征正则化实现零样本分类、定位和分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19320 2026-06-03 cs.CV cs.DB 77%

TextAlign: Preference Alignment for Text Rendering with Hierarchical Rewards

TextAlign: 基于层次化奖励的文本渲染偏好对齐

Mingxuan Cui, Jingpu Yang, Fengxian Ji, Qian Jiang, Zhecheng Shi, Jiaming Wang, Zirui Song, Fajri Koto, Xiuying Chen

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·穆萨大学人工智能学院) Chinese Academy of Sciences Institute of Automation(中国科学院自动化研究所) Northeastern University(东北大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出TextAlign框架,通过层次化视觉语言模型奖励将文本渲染错误分解为全局、单词和字形级别,并转化为标量偏好信号,利用GRPO或DPO进行后训练对齐,在不改变生成器架构下提升文本渲染准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07768 2026-06-03 cs.CV cs.AI cs.LG cs.MM 75%

PAND: Prompt-Aware Neighborhood Distillation for Lightweight Fine-Grained Visual Classification

PAND:面向提示的邻域蒸馏用于轻量级细粒度视觉分类

Qiuming Luo, Yuebing Li, Feng Li, Chang Kong

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 提出PAND框架,通过提示感知语义校准和邻域感知结构蒸馏,将大型视觉语言模型知识迁移至轻量网络,在细粒度分类任务上超越现有方法。

Comments Accepted by ICIP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03093 2026-06-03 cs.AI 70%

Decomposing how prompting steers behavior

分解提示如何引导行为

Fan L. Cheng, Nikolaus Kriegeskorte

机构 * Columbia University(哥伦比亚大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.AI

AI总结 提出嵌套几何分解框架,通过刺激不变映射分析提示如何重塑表示几何,揭示跨维度线性混合是提示引导行为的关键机制。

Comments 59 pages, 41 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03054 2026-06-03 cs.AI 70%

ToolGate: Token-Efficient Pre-Call Control for Tool-Augmented Vision-Language Agents

ToolGate: 面向工具增强视觉语言智能体的令牌高效预调用控制

Anjie Liu, Yan Song, Zhixun Chen, Ziqin Gong, Zhongwei Yu, Jun Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University College London(伦敦大学学院) AI Lab, The Yangtze River Delta(长江三角洲人工智能实验室)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对工具增强视觉语言智能体中工具调用成本高且不必要的问题,提出轻量级外部控制器ToolGate,通过轨迹文本和结构特征预测执行/跳过决策,在降低令牌成本的同时保持或提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31530 2026-06-03 eess.AS cs.SD 67%

UNISON: A Unified Sound Generation and Editing Framework via Deep LLM Fusion

UNISON: 通过深度LLM融合的统一声音生成与编辑框架

Zhaoqing Li, Haoning Xu, Jingran Su, Yaofang Liu, Zhefan Rao, Huimeng Wang, Jiajun Deng, Tianzi Wang, Zengrui Jin, Rui Liu, Haoxuan Che, Xunying Liu

机构 * The Chinese University of Hong Kong(香港中文大学) The Hong Kong Polytechnic University(香港理工大学) City University of Hong Kong(香港城市大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Tsinghua University(清华大学) Huawei Research Hong Kong(华为香港研究)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn)

AI总结 提出UNISON,一个基于潜在扩散的统一框架,通过层间深度LLM融合和多任务架构,实现语音生成、声音生成和音频编辑,在多个任务上达到或超越专业模型性能,且参数量减少约4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05249 2026-06-03 cs.IR 67%

TriAlignGR: Triangular Multitask Alignment with Multimodal Deep Interest Mining for Generative Recommendation

TriAlignGR:面向生成式推荐的多模态深度兴趣挖掘与三角多任务对齐

Yangchen Zeng, Hao Peng, Rongfeng Guo, Zhenyu Yu, Zhiyuan Hu, Jinze Wang

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn)

AI总结 提出TriAlignGR统一多任务多模态框架,通过两阶段语义传播和三角多任务对齐,解决语义ID中的内容退化与语义不透明问题,实现生成式推荐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19684 2026-06-03 cs.LG cs.AI cs.CL cs.CV 67%

CoMPAS3D: A Dataset and Benchmark for Interactive Motion

CoMPAS3D: 一个用于交互动作的数据集和基准

Bermet Burkanova, Yasaman Etesam, Payam Jome Yazdian, Trinity Evans, Chuxuan Zhang, Zoe Stanley, Paige Tuttösí, Angelica Lim

机构 * School of Computing Science Simon Fraser University(计算科学学院西蒙弗雷泽大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出CoMPAS3D数据集和评估框架,通过动作可读性和熟练度适当性等客观指标,解决交互式动作生成中缺乏社交上下文评估的问题。

Comments https://rosielab.github.io/compas3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03879 2026-06-03 cs.CV cs.AI 62%

Beyond Encoder Accumulation: Measuring Encoder Roles in Multi-Encoder VLMs

超越编码器累加:衡量多编码器视觉语言模型中编码器的作用

Wei Ding, Yudong Zhang, Ruobing Xie, Xingwu Sun, Jiansheng Chen, Yu Wang

机构 * Tsinghua University(清华大学) Tencent(腾讯) University of Macau(澳门大学) University of Science and Technology Beijing(北京科技大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 通过重新训练所有31个非空子集,提出容量-必要性分解和预投影器秩分析,揭示多编码器视觉语言模型中编码器角色并非简单累加,并给出最优配对原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03569 2026-06-03 cs.CV cs.AI 62%

When Attention Collapses: Stage-Aware Visual Token Pruning from Structure to Semantics

当注意力崩溃时:从结构到语义的阶段性视觉令牌剪枝

Jiahui Wang, Kai Zhang, Mai Han, Huanghe Zhang

机构 * Shandong University(山东大学) National University of Singapore (Suzhou) Research Institute(新加坡国立大学(苏州)研究院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对视觉语言模型推理中视觉令牌剪枝因依赖单一注意力分数导致特征多样性下降的问题,提出两阶段剪枝框架STS,先通过排斥采样最大化结构多样性,再通过指令感知交叉注意力过滤语义无关令牌,从而提升保留令牌的结构多样性与细粒度任务对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03712 2026-06-03 cs.LG 57%

When Graph Tokens Sink: A Mechanistic Analysis of Graph Language Models

当图标记沉没:图语言模型的机制分析

Ding Zhang, Runtao Zhou, Wenqing Zheng, Rizal Fathony, Bayan Bruss, Chirag Agarwal

机构 * University of Virginia(弗吉尼亚大学) Capital One

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

AI总结 本文通过分析图语言模型中图标记的内部行为,发现激活层面的显著性与图信息利用之间存在解耦,揭示了现有图标记构建、放置和对齐机制的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03216 2026-06-03 cs.CV 57%

Follow-Your-Preference++: Rethinking Preference Alignment for Image Inpainting

Follow-Your-Preference++:重新思考图像修复中的偏好对齐

Junkun Yuan, Yutao Shen, Toru Aonishi, Hideki Nakayama, Yue Ma

机构 * Zhejiang University(浙江大学) The University of Tokyo(东京大学) Tsinghua University(清华大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文从基本原理出发,通过直接偏好优化框架和公开奖励模型构建偏好数据,系统研究了图像修复中的偏好对齐问题,发现奖励模型存在偏差但可通过集成缓解,并在标准指标、大视觉语言模型评估和人类评估上显著超越先前最先进模型。

Comments 23 pages, 14 figures. arXiv admin note: substantial text overlap with arXiv:2509.23082

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02991 2026-06-03 cs.CL cs.AI 57%

Pretraining Language Models on Historical Text

在历史文本上预训练语言模型

Xiaoxi Luo, Zachary Shinnick, Niclas Griesshaber, Yixuan Wang, Junchi Yu, Freda Shi, Philip Torr, Yao Lu

机构 * University of Waterloo(多伦多大学) Vector Institute(向量研究所) AIML, Adelaide University(AIML,阿德莱德大学) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Oxford Centre for Economic and Social History, University of Oxford(牛津大学经济与社会史中心) Department of Computer Science, University College London(伦敦大学学院计算机科学系)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 提出TypewriterLM,一个仅在1913年前英文文本上训练的7.24B历史语言模型,通过构建TypewriterCorpus语料库、引入词汇基础指令微调框架和History-Event基准套件,解决数据质量、时间泄漏、训练和评估等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15748 2026-06-03 cs.CV 57%

Concept-wise Attention for Fine-grained Concept Bottleneck Models

面向细粒度概念瓶颈模型的概念级注意力机制

Minghong Zhong, Guoshuai Zou, Kanghao Chen, Dexia Chen, Ruixuan Wang

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 提出概念级注意力机制(CoAt-CBM),通过可学习概念视觉查询和概念对比优化,实现自适应细粒度图像-概念对齐,解决预训练偏差和概念互斥问题,显著提升性能。

Comments Withdrawn by authors for revision and improvement

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01471 2026-06-03 cs.IR cs.LG 57%

Reconstructing Content with Collaborative Attention for Universal Multimodal Representation Learning

通过协同注意力重建内容以提升多模态嵌入质量

Jiahan Chen, Da Li, Hengran Zhang, Yinqiong Cai, Lixin Su, Jiafeng Guo, Daiting Shi, Dawei Yin, Keping Bi

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Baidu Inc.(百度公司)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.LG

AI总结 提出CoCoA预训练范式,通过重构注意力流和基于EOS的重建任务,利用协同注意力优化多模态嵌入,使模型将输入语义压缩到<EOS>令牌中,从而提升嵌入质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19995 2026-06-03 cs.CV 57%

CREward: A Type-Specific Creativity Reward Model

CREward:一种类型特定的创造力奖励模型

Jiyeon Han, Ali Mahdavi-Amiri, Hao Zhang, Haedong Jeong

机构 * Simon Fraser University(西蒙弗雷泽大学) Sogang University(首尔大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 提出首个类型特定的创造力奖励模型CREward,通过几何、材质和纹理三个轴评估创造力,并应用于创造力评估、可解释创造力及创意样本获取。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03240 2026-06-03 cs.RO 50%

GeoAlign: Beyond Semantics with State-Guided Spatial Alignment in VLA Models

GeoAlign: VLA模型中的状态引导空间对齐超越语义

Yizhi Chen, Zhanxiang Cao, Xinyi Peng, Yixiao Zheng, Xiaxi Si, Yiheng Li, Liyun Yan, Keqi Zhu, Xueyun Chen, Shengcheng Fu, Tianyue Zhan, Yufei Jia, Jinming Yao, Yan Xie, Kun Wang, Cewu Lu, Yue Gao

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Jingdezhen Ceramic University(景德镇陶瓷大学) Tsinghua University(清华大学) HONOR(HONOR公司) University of Science and Technology of China(中国科学技术大学)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 提出GeoAlign架构,通过RGB几何分支的后训练和机器人本体状态引导的几何特征查询,实现几何感知的空间对齐和动态可供性选择,在多个基准上取得高性能。

Comments 20 pages, 9 figures, 8 tables, including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏