arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-24 至 2026-06-24 共收录 63 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 13 篇

2606.24286 2026-06-24 cs.CL cs.CV 新提交 57%

AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression

AVOC:通过检索启发的令牌压缩增强全模态大语言模型中的小时级音视频理解

Yijing Chen, Wenhui Tan, Xiaoyi Yu, Yuyue Wang, Xin Cheng, Kaisi Guan, Hao Jiang, Xiangyang Li, Guojie Zhu, Ruihua Song

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Huawei Inc.(华为技术有限公司)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 提出AVOC框架,通过检索启发的令牌压缩模块,将多模态令牌压缩视为top-K检索问题,结合相关性、重要性和多样性三个标准,实现长时音视频理解,在小时级基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 2 篇

2606.23897 2026-06-24 cs.CV cs.AI 新提交 81%

The Professor: Multi-Teacher Unsupervised Prompt Distillation for Vision-Language Models

The Professor: 面向视觉语言模型的多教师无监督提示蒸馏

Ahmad Algadhi, Ahmed Alzuhair, Omar Alkhulaif, Muzammil Behzad

机构 * King Fahd University of Petroleum and Minerals(法赫德国王石油矿产大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 提出多教师提示蒸馏方法TheProfessor,融合领域微调教师和零样本教师,在四个数据集上平均HM提升1.77点,尤其对域偏移数据集效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17110 2026-06-24 cs.CR cs.LG 新提交 57%

Loss Landscape Poisoning: Targeted Extraction of Unseen Training Data from LLMs

损失景观投毒:从大语言模型中定向提取未见训练数据

Md Abdullah Al Mamun, Ngoc Phu Doan, Pedram Zaree, Nael Abu-Ghazaleh, Ihsen Alouani

机构 * Queen's University Belfast(女王大学贝尔法斯特) CSIT, Queen's University Belfast(女王大学贝尔法斯特计算机科学与技术研究所)

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

AI总结 提出一种通过投毒重塑模型损失景观,迫使模型记忆目标数据并实现高成功率提取的攻击方法,在语言和视觉-语言模型上验证有效性,并发现差分隐私可防御但存在绕过攻击。

Comments Updated author order. No technical changes

详情

展开后加载摘要…

URL PDF HTML 收藏