arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-03 至 2026-04-03 共收录 11 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 11 篇

2411.11683 2026-04-03 cs.RO cs.AI 83%

Robot Collapse: Supply Chain Backdoor Attacks Against VLM-based Robotic Manipulation

机器人崩溃:针对基于VLM的机器人操控的供应链后门攻击

Xianlong Wang, Hewen Pan, Hangtao Zhang, Minghui Li, Shengshan Hu, Ziqi Zhou, Lulu Xue, Peijin Guo, Aishan Liu, Leo Yu Zhang, Xiaohua Jia

机构 * City University of Hong Kong(香港城市大学) Huazhong University of Science and Technology(华中科技大学) Beihang University(北京航空航天大学) Griffith University(格里菲斯大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI

AI总结 本文提出TrojanRobot框架,通过在模块化机器人策略中嵌入恶意模块,操控LLM到VLM路径,验证了在18个真实任务和4个VLM上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01351 2026-04-03 cs.CV 79%

Long-Tailed Distribution-Aware Router For Mixture-of-Experts in Large Vision-Language Model

长尾分布感知的混合专家路由器:用于大规模视觉-语言模型的混合专家架构

Chaoxiang Cai, Longrong Yang, Minghe Weng, Xuewei Li, Zequn Qin, Xi Li

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Electronic and Information, Shanghai Dianji University(上海电机学院电子信息学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出LTDR路由器,针对视觉-语言混合专家架构中的长尾分布问题,通过模态特定的分布感知路由和动态专家激活策略,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13855 2026-04-03 cs.CV cs.AI 76%

Improvise, Adapt, Overcome -- Telescopic Adapters for Efficient Fine-tuning of Vision Language Models in Medical Imaging

即兴、适应、克服——用于医疗影像中视觉语言模型高效微调的望远镜适配器

Ujjwal Mishra, Vinita Shukla, Praful Hambarde, Amit Shukla

机构 * Centre for Artificial Intelligence and Robotics, Indian Institute of Technology Mandi(印度理工学院曼迪分校人工智能与机器人中心)

专题命中 VLM训练与架构 :vision language model(title);分类 cs.CV、cs.AI

AI总结 本文提出望远镜适配器,通过深度感知缩放提升视觉语言分割模型在医疗影像中的微调效率,仅用613k参数在五个数据集上取得优异性能。

Comments Accepted at the IEEE/CVF winter conference on applications of computer vision (WACV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02020 2026-04-03 cs.CV 70%

Are VLMs Lost Between Sky and Space? LinkS$^2$Bench for UAV-Satellite Dynamic Cross-View Spatial Intelligence

VLMs在天空与空间之间迷失了吗?LinkS$^2$Bench用于无人机-卫星动态跨视角空间智能

Dian Liu, Jie Feng, Di Li, Yuhui Zheng, Guanbin Li, Weisheng Dong, Guangming Shi

机构 * Xidian University(西安电子科技大学) Qinghai Normal University(青海师范大学) Sun Yat-sen University(中山大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出LinkS$^2$Bench,首个评估VLMs跨视角空间智能的综合基准,通过动态无人机视频与高分辨率卫星图像构建17.9k高质量问题-答案对,揭示VLMs在动态跨视角对齐中的性能瓶颈,并提出跨视角对齐适配器提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02324 2026-04-03 cs.CL cs.AI cs.LG 62%

Grounded Token Initialization for New Vocabulary in LMs for Generative Recommendation

为生成推荐系统中的新词汇提供基础性词 token 初始化

Daiwei Chen, Zhoutong Fu, Chengming Jiang, Haichao Zhang, Ran Zhou, Tan Wang, Chunnan Yao, Guoyao Li, Rui Cai, Yihan Cao, Ruijie Jiang, Fedor Borisyuk, Jianqiang Shen, Jingwei Wu, Ramya Korlakai Vinayak

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) LinkedIn Corporation(领英公司) Northeastern University(东北大学) University of California, Davis(加州大学戴维斯分校)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GTI方法,通过在预训练嵌入空间中语义地初始化新词汇,提升生成推荐系统性能,优于传统均值初始化和辅助任务适应方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02289 2026-04-03 cs.CV cs.AI 62%

Omni123: Exploring 3D Native Foundation Models with Limited 3D Data by Unifying Text to 2D and 3D Generation

Omni123:通过统一文本到2D和3D生成探索有限3D数据的3D原生基础模型

Chongjie Ye, Cheng Cao, Chuanyu Pan, Yiming Hao, Yihao Zhi, Yuanming Hu, Xiaoguang Han

机构 * FNii-Shenzhen(FNii-深圳) SSE, CUHK(SZ)(香港中文大学(深圳)理工学院) Meshy AI

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 Omni123通过统一文本到2D和3D生成,利用文本-图像-3D的跨模态一致性作为隐式约束,提升3D生成的几何一致性与语义对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01941 2026-04-03 cs.CV cs.AI 62%

Captioning Daily Activity Images in Early Childhood Education: Benchmark and Algorithm

在早期教育中的日常活动图像描述:基准和算法

Sixing Li, Zhibin Gu, Ziqi Zhang, Weiguo Pan, Bing Li, Ying Wang, Hongzhe Liu

机构 * School of Robotics, Beijing Union University(北京联合大学机器人学院) College of Computer and Cyber Security, Hebei Normal University(河北师范大学计算机与网络安全学院) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) National Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院) PeopleAI, Inc.(人民人工智能公司) People Youhe Education Technology Co., Ltd.(人民优和教育科技有限公司)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ECAC基准和RSRS算法,通过专家标注和细粒度标签提升早期教育图像描述的专业性,实验显示KinderMM-Cap-3B在TTS上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22294 2026-04-03 cs.CV cs.LG 62%

Structure is Supervision: Multiview Masked Autoencoders for Radiology

结构是监督:用于放射学的多视图掩码自编码器

Sonia Laguna, Andrea Agostini, Alain Ryser, Samuel Ruiperez-Campillo, Irene Cannistraci, Moritz Vandenhirtz, Stephan Mandt, Nicolas Deperrois, Farhad Nooralahzadeh, Michael Krauthammer, Thomas M. Sutter, Julia E. Vogt

机构 * Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系) Department of Computer Science, UC Irvine(加州大学尔湾分校计算机科学系) Department of Quantitative Biomedicine, University of Zurich(苏黎世大学定量生物医学系)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出多视图掩码自编码器(MVMAE),通过利用放射学研究的多视图结构学习视图不变和疾病相关表征,并在三个公开数据集上验证了其在疾病分类任务中的优越性能。

Journal ref Transactions on Machine Learning Research (TMLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02317 2026-04-03 cs.CV 57%

A Simple Baseline for Streaming Video Understanding

流媒体视频理解的简单基线

Yujiao Shen, Shulin Tian, Jingkang Yang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 本文提出SimpleStream基线,通过滑动窗口仅使用最近N帧输入现成的VLM,在OVO-Bench和StreamingBench上表现优异,揭示了长上下文对性能的非线性影响及感知与记忆的权衡。

Comments Project page: https://simple-stream.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29966 2026-04-03 cs.CV 57%

Scaling Video Pretraining for Surgical Foundation Models

为手术基础模型扩展视频预训练

Sicheng Lu, Zikai Xiao, Jianhui Wei, Danyu Sun, Qi Lu, Keli Hu, Yang Feng, Jian Wu, Zongxin Yang, Zuozhu Liu

机构 * The Johns Hopkins University(约翰霍普金斯大学) Zhejiang University(浙江大学) Zhejiang University-University of Illinois Urbana-Champaign Institute(浙江大学伊利诺伊大学厄巴纳-香槟分校联合学院) Zhejiang Lab(之江实验室) Shaoxing University(绍兴大学) Angelalign(时代天使) Harvard Medical School(哈佛医学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出SurgRec,通过大规模数据和统一预训练流程提升手术视频理解能力,对比SSL基线和视觉语言模型,展示SurgRec在多个下游任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01881 2026-04-03 cs.CV cs.CL 57%

HieraVid: Hierarchical Token Pruning for Fast Video Large Language Models

HieraVid:用于快速视频大语言模型的分层令牌修剪

Yansong Guo, Chaoyang Zhu, Jiayi Ji, Jianghang Lin, Liujuan Cao

机构 * Xiamen University(厦门大学)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

AI总结 HieraVid通过分层修剪框架减少视频令牌冗余,提升视频大语言模型的效率,在保留性能的同时实现30%的令牌保留率。

详情

展开后加载摘要…

URL PDF HTML 收藏