arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-27 至 2026-04-27 共收录 32 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 2 篇

2604.22464 2026-04-27 cs.LG 57%

Towards Adaptive Continual Model Merging via Manifold-Aware Expert Evolution

面向流形感知的自适应持续模型合并方法

Haiyun Qiu, Xingyu Wu, Kay Chen Tan

机构 * Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 本文提出MADE-IT方法,通过流形几何引导专家表示,解决持续模型合并中的参数饱和与冗余问题,实现自适应专家进化与隐式路由,提升模型在长周期任务序列中的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 1 篇

2604.22492 2026-04-27 eess.IV cs.CV 85%

MTT-Bench: Predicting Social Dominance in Mice via Multimodal Large Language Models

MTT-Bench:通过多模态大语言模型预测小鼠的社会支配

Yunquan Chen, Haoyu Chen

机构 * Department of Communication Systems, KTH Royal Institute of Technology(通信系统系,皇家理工学院) CMVS, University of Oulu(奥卢大学CMVS)

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出MTT-Bench基准,利用多模态大语言模型分析小鼠行为视频,预测社会支配等级,无需显式标签进行零样本推理,展示了在乙学和社会行为分析中的应用潜力。

Comments 8 pages, 2 figures. Submitted to conference

详情

展开后加载摘要…

URL PDF HTML 收藏