arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-19 至 2026-03-19 共收录 68 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 14 篇

2603.14549 2026-03-19 cs.CV cs.LG 73%

ASAP: Attention-Shift-Aware Pruning for Efficient LVLM Inference

ASAP: 一种面向高效视觉-语言模型推理的注意力转移感知剪枝方法

Surendra Pathak, Bo Han

机构 * George Mason University(乔治·马歇尔大学)

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.LG

AI总结 本文提出ASAP方法,通过动态双向软注意力掩码缓解注意力转移问题,并引入加权软合并组件减少语义冗余,实现视觉上下文近似无损压缩,保持99.02%的LLaVA-NeXT-7B性能,计算量降低约80%。

Comments Update in V2: Added citations, refrences, and other minor rewrites

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21818 2026-03-19 cs.CV 70%

SkyReels-V4: Multi-modal Video-Audio Generation, Inpainting and Editing model

SkyReels-V4:多模态视频-音频生成、修复和编辑模型

Guibin Chen, Dixuan Lin, Jiangping Yang, Youqiang Zhang, Zhengcong Fei, Debang Li, Sheng Chen, Chaofeng Ao, Nuo Pang, Yiming Wang, Yikun Dou, Zheng Chen, Mingyuan Fan, Tuanhui Li, Mingshan Chang, Hao Zhang, Xiaopeng Sun, Jingtao Xu, Yuqiang Xie, Jiahua Wang, Zhiheng Xu, Weiming Xiong, Yuzhe Jin, Baoxuan Gu, Binjie Mao, Yunjie Yu, Jujie He, Yuhao Feng, Shiwen Tu, Chaojie Wang, Rui Yan, Wei Shen, Jingchen Wu, Peng Zhao, Xuanyue Zhong, Zhuangzhuang Liu, Kaifei Wang, Fuxiang Zhang, Weikai Xu, Wenyan Liu, Binglu Zhang, Yu Shen, Tianhui Xiong, Bin Peng, Liang Zeng, Xuchen Song, Haoxiang Guo, Peiyu Wang, Max W. Y. Lam, Chien-Hung Liu, Yahui Zhou

机构 * Skywork AI

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 SkyReels-V4是一款多模态视频基础模型,支持视频音频生成、修复和编辑,采用双流多模态扩散变换器架构,结合文本编码器实现多模态指令处理,支持高分辨率、长时长视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18004 2026-03-19 cs.CV cs.AI cs.LG 67%

Unified Spatio-Temporal Token Scoring for Efficient Video VLMs

统一的空间时间令牌评分用于高效的视频视觉-语言模型

Jianrui Zhang, Yue Yang, Rohun Tripathi, Winson Han, Ranjay Krishna, Christopher Clark, Yong Jae Lee, Sangho Lee

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Allen Institute for AI(人工智能研究所)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出STTS,一种高效的统一空间时间令牌评分方法,通过辅助损失和LLM下游梯度学习,在不依赖文本条件或令牌合并的情况下,对视频中50%的视觉令牌进行修剪,提升训练和推理效率62%,性能下降仅0.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17965 2026-03-19 cs.CV 57%

LaDe: Unified Multi-Layered Graphic Media Generation and Decomposition

LaDe:统一的多层图形媒体生成与分解

Vlad-Constantin Lungu-Stan, Ionut Mironica, Mariana-Iuliana Georgescu

机构 * Adobe Research(Adobe研究院)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 LaDe通过结合LLM提示扩展器、4D RoPE位置编码的潜在扩散变换器和RGBA VAE,实现灵活的多层媒体设计生成与分解,提升文本到多层媒体设计的对齐能力。

Comments 18 pages (main + supp)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17326 2026-03-19 cs.CV 57%

FineViT: Progressively Unlocking Fine-Grained Perception with Dense Recaptions

FineViT: 通过密集描述逐步解锁细粒度感知

Peisen Zhao, Xiaopeng Zhang, Mingxing Xu, Ruoyu Sun, Zewei Du, Dunzheng Wang, Guanghao Zheng, Haohang Xu, Zhibo Zhang, Yuhang Zhang, Yi Ai, Lin Liu, Qi Tian

机构 * Huawei Inc.(华为公司)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 FineViT通过密集描述逐步训练,提升细粒度视觉感知能力,在长上下文检索中表现优异,超越现有多模态视觉编码器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17244 2026-03-19 cs.AI cs.IR cs.LO 57%

Graph-Native Cognitive Memory for AI Agents: Formal Belief Revision Semantics for Versioned Memory Architectures

面向AI代理的图原认知记忆:版本化记忆架构的正式信念修订语义

Young Bin Park

机构 * Kumiho Inc.(科米霍公司)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出Kumiho架构,结合正式信念修订语义,实现统一的图原记忆系统,通过双重存储模型和混合检索方式,在LoCoMo和LoCoMo-Plus基准测试中取得显著性能提升。

Comments 56 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22496 2026-03-19 cs.CV 57%

Where MLLMs Attend and What They Rely On: Explaining Autoregressive Token Generation

MLLMs关注什么以及依赖什么:解释自回归标记生成

Ruoyu Chen, Xiaoqing Guo, Kangwei Liu, Siyuan Liang, Shiming Liu, Qunli Zhang, Laiyuan Wang, Hua Zhang, Xiaochun Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) College of Computing and Data Science, NTU(NTU 计算与数据科学学院) Huawei(华为) School of Flexible Electronics, SYSU(SYSU 灵活电子学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(Sun Yat-sen 大学深圳校区计算机科学与技术学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出EAGLE框架,通过轻量级黑盒方法解释MLLMs的自回归标记生成,量化语言先验和感知证据的影响,提升模型可解释性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 1 篇

2603.17055 2026-03-19 cs.CV 57%

PaAgent: Portrait-Aware Image Restoration Agent via Subjective-Objective Reinforcement Learning

PaAgent:通过主观-客观强化学习实现的面向人物图像修复代理

Yijian Wang, Qingsen Yan, Jiantao Zhou, Duwei Dai, Wei Dong

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院) State Key Laboratory of Internet of Things for Smart City, University of Macau(澳门大学智慧城市物联网国家重点实验室) National-Local Joint Engineering Research Center of Biodiagnosis and Biotherapy, the Second Affiliated Hospital of Xi’an Jiaotong University(西安交通大学生物诊断与生物治疗国家地方联合工程研究中心) College of Information and Control Engineering, Xi’an University of Architecture and Technology(西安建筑科技大学信息与控制工程学院)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 PaAgent通过结合自进化的人物银行和检索增强生成技术,提升图像修复任务中对复杂场景的感知能力,通过主观-客观强化学习策略优化修复工具选择,实验验证其在多种修复基准上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏