arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-15 至 2026-05-15 共收录 15 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 15 篇

2602.04657 2026-05-15 cs.CV 87%

TRIO: Token Reduction via Inference-Objective Guidance for Efficient Vision-Language Models

TRIO: 通过推理目标引导的令牌缩减以提高视觉-语言模型的效率

Haokui Zhang, Congyang Ou, Dawei Yan, Peng Wang, Qingsen Yan, Yu Zhang, Ying Li, Rong Xiao

机构 * School of Cyberspace Security, Northwestern Polytechnical University(网络安全学院,西北工业大学) School of Computer Science, Northwestern Polytechnical University(计算机学院,西北工业大学) Intellifusion(智融科技)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);VLM(abstract);分类 cs.CV

AI总结 TRIO从推理目标角度出发,通过梯度显著性指导视觉令牌压缩,保留输出不变性,提升视觉-语言模型的推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14621 2026-05-15 cs.CV cs.AI cs.CL 82%

Do We Really Need External Tools to Mitigate Hallucinations? SIRA: Shared-Prefix Internal Reconstruction of Attribution

我们真的需要外部工具来缓解幻觉吗?SIRA:共享前缀内部重构归因

Tian Qin, Junzhe Chen, Yuqing Shi, Tianshu Zhang, Qiang Ju, Lijie Wen

机构 * Tsinghua University(清华大学) The University of Sydney(悉尼大学) Stanford University(斯坦福大学) Baichuan AI(百川AI)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 SIRA通过内部构建对比参考减少视觉语言模型的幻觉,无需外部工具或额外计算,保持描述覆盖并降低开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14291 2026-05-15 cs.CR cs.AI cs.CL cs.CV cs.LG 82%

To See is Not to Learn: Protecting Multimodal Data from Unauthorized Fine-Tuning of Large Vision-Language Model

看清并非学习:保护多模态数据免受大视觉语言模型的未经授权微调

Chengshuai Zhao, Zhen Tan, Dawei Li, Zhiyuan Yu, Huan Liu

机构 * School of Computing Augmented Intelligence, Arizona State University, Tempe, AZ, USA Department of Computer Science Engineering, Texas A\&M University, College Station, TX, USA

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出MMGuard,通过注入不可察觉扰动主动利用LVLM学习动态,生成不可学习示例,从而保护多模态数据免受未经授权的微调。通过最小化训练损失,扰动创建优化捷径,导致模型在推理时因噪声过拟合而性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14938 2026-05-15 cs.LG cs.CV 81%

Octopus: History-Free Gradient Orthogonalization for Continual Learning in Multimodal Large Language Models

Octopus:无历史梯度正交化用于多模态大语言模型中的持续学习

Yuehao Liu, Shanyan Guan, Weijia Zhang, Xuanming Shang, Yanhao Ge, Wei Li, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能大模型关键实验室,人工智能研究院,上海交通大学) vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV、cs.LG

AI总结 Octopus提出一种基于无历史梯度正交化的方法,通过两阶段微调策略平衡持续学习中的可塑性与稳定性,实验表明其在UCIT数据集上性能优于现有最佳方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14893 2026-05-15 cs.CV cs.AI cs.LG 80%

Your CLIP has 164 dimensions of noise: Exploring the embeddings covariance eigenspectrum of contrastively pretrained vision-language transformers

你的CLIP有164个噪声维度:探索对比性预训练视觉-语言变换器的嵌入协方差特征谱

Jakub Grzywaczewski, Dawid Płudowski, Przemysław Biecek

机构 * Warsaw University of Technology(华沙技术大学) Centre for Credible Artificial Intelligence(可信人工智能中心) University of Warsaw(华沙大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文通过协方差矩阵谱分解,揭示对比预训练VLMs的潜在空间中多模态噪声结构,发现去除共享噪声维度对下游任务性能无害,提供对现代VLMs表征结构的新见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14988 2026-05-15 cs.CV 77%

Compositional Video Generation via Inference-Time Guidance

通过推理时间引导进行组合视频生成

Ariel Shaulov, Eitan Shaar, Amit Edenzon, Gal Chechik, Lior Wolf

机构 * Tel-Aviv University(特拉维夫大学) Bar Ilan University(巴伊兰大学) NVIDIA Research(NVIDIA研究)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV

AI总结 本文提出CVG方法,通过利用交叉注意力图中的空间时间接地信号,提升冻结文本到视频模型的组合忠实度,无需修改模型结构或微调生成器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12624 2026-05-15 cs.RO cs.CV 70%

MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving

MindVLA-U1:统一流架构使VLA超越VA用于自动驾驶

Yuzhou Huang, Benjin Zhu, Hengtong Lu, Victor Shea-Jay Huang, Haiming Zhang, Wei Chen, Jifeng Dai, Yan Xie, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多模态实验室) Li Auto Tsinghua University(清华大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 MindVLA-U1通过统一流架构实现自动驾驶中VLA超越VA,采用统一视觉语言模型骨干和流匹配连续动作轨迹,在保持各模态自然输出形式的同时,实现高效规划和低延迟。

Comments Work in progress. Project page: https://mind-omni.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14795 2026-05-15 cs.CV 70%

COAL: Counterfactual and Observation-Enhanced Alignment Learning for Discriminative Referring Multi-Object Tracking

COAL: 基于反事实和观察增强的对齐学习用于判别性参照多目标跟踪

Shukun Jia, Shiyu Hu, Yipei Wang, Ximeng Cheng, Yichao Cao, Xiaobo Lu

机构 * School of Automation, Southeast University, Nanjing, China(东南大学自动化学院,南京,中国) Key Laboratory of Measurement and Control of Complex Systems of Engineering, Ministry of Education, Nanjing, China(工程复杂系统测量与控制国家重点实验室,教育部,南京,中国) School of Physical & Mathematical Sciences, Nanyang Technological University, Singapore(南洋理工大学物理与数学科学学院,新加坡) Big Data Institute, Central South University, Changsha, China(中南大学大数据研究院,长沙,中国)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 COAL通过知识正则化解决RMOT中高判别性需求与稀疏语义监督的矛盾,引入显式语义注入和反事实学习提升多目标跟踪的判别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06202 2026-05-15 cs.CV cs.AI 62%

LoRA in LoRA: Towards Parameter-Efficient Architecture Expansion for Continual Visual Instruction Tuning

LoRA in LoRA: 朝着参数高效架构扩展的方向:持续视觉指令微调

Chang Che, Ziqi Wang, Pengwan Yang, Qi Wang, Hui Ma, Zenglin Shi

机构 * Hefei University of Technology(合肥工业大学) University of Amsterdam(阿姆斯特丹大学) Tsinghua University(清华大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出LiLoRA,一种高效的持续视觉指令微调架构扩展方法,通过共享LoRA矩阵A、低秩分解矩阵B以及余弦正则化损失,提升参数效率和任务学习性能。

Comments AAAI 2026 Oral Presentation. 9 pages

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(24):19978--19986, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14833 2026-05-15 cs.AI cs.HC 57%

Emotion-Attended Stateful Memory (EASM):The Architecture for Hyper-Personalization at Scale

情感关注状态记忆(EASM):大规模超个性化的人机交互架构

Vineet Kotecha, Vansh Gupta

机构 * divAIne Research(divAIne研究)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出EASM架构,通过长期历史、情绪信号和推断意图动态构建用户特定对话上下文,实验表明其在记忆基础、计划清晰度和情感验证方面显著优于无状态基线。

Comments 18 pages, 3 figures, 3 tables. Industry research whitepaper. Includes controlled A/B evaluation across 30 scenarios and 6 emotional categories

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14750 2026-05-15 cs.CR cs.AI 57%

EVA: Editing for Versatile Alignment against Jailbreaks

EVA:针对对抗性攻击的多功能对齐编辑

Yi Wang, Hongye Qiu, Yue Xu, Sibei Yang, Zhan Qin, Minlie Huang, Wenjie Wang

机构 * ShanghaiTech University(上海科技大学) Sun Yat-sen University(中山大学) State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Tsinghua University(清华大学)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.AI

AI总结 本文提出EVA框架,通过直接模型编辑提升安全对齐,有效中和有害行为,实验显示其在LLMs和VLMs中对抗攻击效果优于现有方法。

Comments IEEE TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14594 2026-05-15 cs.CV cs.GR 57%

TOPOS: High-Fidelity and Efficient Industry-Grade 3D Head Generation

TOPOS: 高保真且高效的工业级3D人脸生成

Bojun Xiong, Zoubin Bi, Xinghui Peng, Yunmu Wang, Junchen Deng, Jun Liang, Jing Li, Bowen Cai, Huan Fu

机构 * HUJING Digital Media & Entertainment Group(华景数字媒体与娱乐集团)

专题命中 VLM训练与架构 :MLLM(abstract_cn);分类 cs.CV

AI总结 TOPOS框架通过统一拓扑结构实现单图像条件下的3D人脸生成,生成具有固定拓扑的高保真人脸网格,提升顶点级对应一致性,优于传统方法。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14310 2026-05-15 cs.CV 57%

CoRDS: Coreset-based Representative and Diverse Selection for Streaming Video Understanding

CoRDS:基于核心集的代表性与多样性选择用于流视频理解

Ailar Mahdizadeh, Puria Azadi, Muchen Li, Xiangteng He, Leonid Sigal

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出CoRDS方法,通过核心集选择优化流视频理解中的缓存压缩,提升代表性与多样性,优于传统启发式方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07459 2026-05-15 cs.CV 57%

DAPL: Integration of Positive and Negative Descriptions in Text-Based Person Search

DAPL: 文本基于人物搜索中正负描述的整合

Yuchuan Deng, Zhanpeng Hu, Zijie Xin, Chuang Deng, Qijun Zhao

机构 * Sichuan University(四川大学) Renmin University of China(中国人民大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 DAPL通过整合正负描述提升文本基于人物搜索中视觉-语言模型的解释准确性,结合DIAC和SIAM学习,引入DTS损失以平衡视觉与文本嵌入的粗细粒度对齐,提升匹配精度和鲁棒性。

Journal ref 2025 IEEE International Conference on Multimedia and Expo (ICME)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14442 2026-05-15 cs.CY 50%

GGBound: A Genome-Grounded Agent for Microbial Life-Boundary Prediction

GGBound:一种基于基因组的微生物生命边界预测代理

Hanbo Huang, Xuan Gong, Jing Wang, Lei Bai, Xiang Xiao, Weishu Zhao, Shiyu Liang

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本文提出GGBound代理,通过基因组条件化和工具增强的LLM,解决微生物生命边界预测问题,构建了涵盖1525种菌株的基准数据集,并通过三阶段优化流程提升预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏