arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-24 至 2026-02-24 共收录 14 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 14 篇

2510.27623 2026-02-24 cs.AI cs.CL cs.CV 84%

BEAT: Visual Backdoor Attacks on VLM-based Embodied Agents via Contrastive Trigger Learning

BEAT:通过对比触发学习对基于VLM的具身代理进行视觉后门攻击

Qiusi Zhan, Hyeonjeong Ha, Rui Yang, Sirui Xu, Hanyang Chen, Liang-Yan Gui, Yu-Xiong Wang, Huan Zhang, Heng Ji, Daniel Kang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 BEAT通过对比触发学习在基于VLM的具身代理中实现视觉后门攻击,提升后门激活精度至39%。

Comments ICLR 2026. Project Page: https://zqs1943.github.io/BEAT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15690 2026-02-24 cs.CV cs.CL 83%

MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping

通过动态专家跳过加速混合专家多模态大语言模型

Yushi Huang, Zining Wang, Zhihang Yuan, Yifu Ding, Ruihao Gong, Jinyang Guo, Xianglong Liu, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学) Beihang University(北航) Peking University(北京大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 MoDES通过动态专家跳过机制提升多模态大语言模型的推理效率和准确性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18766 2026-02-24 cs.CV 83%

Initialization matters in few-shot adaptation of vision-language models for histopathological image classification

初始化在视觉-语言模型少量样本适应中的重要性

Pablo Meseguer, Rocío del Amor, Valery Naranjo

机构 * Instituto Universitario de Investigación en Tecnología Centrada en el Ser Humano (HUMAN-Tech)(人类中心技术研究所) Universitat Politécnica de Valencia(巴塞罗那理工大学) Valencian Graduate School and Research Network for Artificial Intelligence (valgrAI)(瓦伦西亚人工智能研究生院和研究网络)

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出ZS-MIL方法,通过利用视觉-语言模型的类级嵌入优化分类器初始化,提升少量样本场景下的病理图像分类性能。

Comments Accepted as oral presentation at CASEIB 2024 held in Sevilla, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18140 2026-02-24 cs.CV 83%

See-in-Pairs: Reference Image-Guided Comparative Vision-Language Models for Medical Diagnosis

See-in-Pairs: 用于医学诊断的参考图像引导的比较视觉-语言模型

Ruinan Jin, Gexin Huang, Xinwei Shen, Qiong Zhang, Yan Shuo Tan, Xiaoxiao Li

机构 * Electrical and Computer Engineering Department, The University of British Columbia(不列颠哥伦比亚大学电气与计算机工程系) Vector Institute(向量研究所) ETH Zurich(苏黎世联邦理工学院) Renmin University of China(中国人民大学) National University of Singapore(新加坡国立大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 See-in-Pairs通过引入参考图像引导的比较机制,提升医学视觉-语言模型的诊断性能,增强样本效率和视觉-文本对齐。

Comments 25 pages, four figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19409 2026-02-24 cs.SD 82%

AuditoryHuM: Auditory Scene Label Generation and Clustering using Human-MLLM Collaboration

AuditoryHuM: 利用人机协同生成和聚类听觉场景标签

Henry Zhong, Jörg M. Buchholz, Julian Maclaren, Simon Carlile, Richard F. Lyon

机构 * Australian Hearing Hub, Macquarie University, Sydney, Australia(澳大利亚听力中心、麦觉里大学、悉尼、澳大利亚) Google Research Australia, Sydney, Australia(谷歌澳大利亚研究、悉尼、澳大利亚)

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract)

AI总结 AuditoryHuM通过人机协同方法实现听觉场景标签的自动生成与聚类,提供了一种高效且低成本的标准化分类解决方案,适用于边缘设备部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19180 2026-02-24 cs.CV 74%

VLM-Guided Group Preference Alignment for Diffusion-based Human Mesh Recovery

基于扩散模型的人体网格恢复中的群体偏好对齐

Wenhao Shen, Hao Wang, Wanqi Yin, Fayao Liu, Xulei Yang, Chao Liang, Zhongang Cai, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) HKUST(GZ)(香港科技大学(广州)) SenseTime Research(商汤科技研究院) A*STAR(新加坡科技研究局)

专题命中 VLM训练与架构 :VLM(title);分类 cs.CV

AI总结 本文提出了一种基于群体偏好的扩散模型微调框架,通过双内存增强的批评代理生成质量评分,提升人体网格恢复的物理合理性和图像一致性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24943 2026-02-24 cs.IR cs.AI cs.CL cs.LG 73%

RAIR: A Rule-Aware Benchmark Uniting Challenging Long-Tail and Visual Salience Subset for E-commerce Relevance Assessment

RAIR:一种融合长尾和视觉显著子集的规则感知基准,用于电商相关性评估

Chenji Lu, Zhuo Chen, Hui Zhao, Zhenyi Wang, Pengjie Wang, Chuan Yu, Jian Xu

机构 * Taobao \& Tmall Group of Alibaba Beijing China Taobao \& Tmall Group of Alibaba

专题命中 VLM训练与架构 :VLM(abstract);visual language model(abstract);分类 cs.AI、cs.LG

AI总结 RAIR提出了一种融合长尾和视觉显著子集的规则感知基准,用于评估电商相关性,通过标准化框架和多子集数据提升模型评估的全面性与挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19870 2026-02-24 cs.CV 70%

ApET: Approximation-Error Guided Token Compression for Efficient VLMs

ApET:基于近似误差的令牌压缩用于高效的视觉语言模型

Qiankun Ma, Ziyao Zhang, Haofei Wang, Jie Chen, Zhen Song, Hairong Zheng

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Peng Cheng Laboratory(鹏城实验室) University of Chinese Academy of Sciences(中国科学院大学) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 ApET通过近似误差指导的令牌压缩,在不使用注意力机制的情况下高效压缩视觉语言模型的令牌预算,提升推理效率。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16449 2026-02-24 cs.CV cs.AI 62%

Emotion-LLaMAv2 and MMEVerse: A New Framework and Benchmark for Multimodal Emotion Understanding

Emotion-LLaMAv2 和 MMEVerse:多模态情感理解的新框架和基准

Xiaojiang Peng, Jingyi Chen, Zebang Cheng, Bao Peng, Fengyi Wu, Yifei Dong, Shuyuan Tu, Qiyu Hu, Huiting Huang, Yuxiang Lin, Jun-Yan He, Kai Wang, Zheng Lian, Zhi-Qi Cheng

机构 * Shenzhen Technology University(深圳技术大学) Shenzhen University of Information Technology(深圳信息科技学院) University of Washington(华盛顿大学) Foundation Model Team, Meituan(美团基础模型团队) National University of Singapore(新加坡国立大学) Tongji University(同济大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 Emotion-LLaMAv2和MMEVerse通过端到端多视图编码器、Conv Attention预融合模块和课程指令调制方案,提升了多模态情绪理解和推理能力,并构建了统一的多模态情绪基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19542 2026-02-24 cs.CV 57%

Vinedresser3D: Agentic Text-guided 3D Editing

Vinedresser3D: 基于代理的文本引导3D编辑

Yankuan Chi, Xiang Li, Zixuan Huang, James M. Rehg

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 Vinedresser3D通过多模态大语言模型和潜在空间编辑技术实现高质量文本引导的3D编辑,提升编辑精度与一致性。

Comments CVPR 2026, Project website:https://vinedresser3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19449 2026-02-24 cs.CV 57%

Decoupling Vision and Language: Codebook Anchored Visual Adaptation

解耦视觉与语言:基于代码本的视觉适应

Jason Wu, Tianchen Zhao, Chang Liu, Jiarui Cai, Zheng Zhang, Zhuowei Li, Aaditya Singh, Xiang Xu, Mani Srivastava, Jonathan Wu

机构 * AWS University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 CRAFT通过离散代码本解耦视觉与语言,实现无需修改其他部分的领域适应,提升LVLMs性能。

Comments 17 pages, accepted to CVPR2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19418 2026-02-24 cs.CV 57%

PA-Attack: Guiding Gray-Box Attacks on LVLM Vision Encoders with Prototypes and Attention

PA-Attack: 通过原型和注意力引导LVLM视觉编码器的灰盒攻击

Hefei Mei, Zirui Wang, Chang Xu, Jianyuan Guo, Minjing Dong

机构 * City University of Hong Kong(香港城市大学) The University of Sydney(悉尼大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 PA-Attack通过原型和注意力机制提升灰盒攻击效果,实现对LVLM视觉编码器的高效攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19058 2026-02-24 cs.CL 50%

Do LLMs and VLMs Share Neurons for Inference? Evidence and Mechanisms of Cross-Modal Transfer

大型语言模型和视觉语言模型是否共享神经元进行推理?证据和跨模态转移的机制

Chenhang Cui, An Zhang, Yuxin Chen, Gelei Deng, Jingnan Zheng, Zhenkai Liang, Xiang Wang, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学)

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 本文研究了大型语言模型和视觉语言模型在推理过程中共享神经元的现象,提出SNRF框架实现低秩融合,提升多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23575 2026-02-24 cs.RO 50%

Generalizable Coarse-to-Fine Robot Manipulation via Language-Aligned 3D Keypoints

可泛化的粗到细机器人操作 via 语言对齐的3D关键点

Jianshu Hu, Lidi Wang, Shujia Li, Yunpeng Jiang, Xiao Li, Paul Weng, Yutong Ban

专题命中 VLM训练与架构 :VLM(abstract)

AI总结 CLAP通过任务分解、VLM微调和3D感知表示,提升机器人操作在新指令和环境下的泛化能力,实现更高的样本效率和操作精度。

Comments Published in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏