arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-29 至 2026-04-29 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 2 篇

2502.02452 2026-04-29 cs.CV 79%

Personalization Toolkit: Training Free Personalization of Large Vision Language Models

个性化工具包:无需训练的大型视觉语言模型个性化

Soroush Seifi, Vaggelis Dorovatas, Matteo Cassinelli, Fabien Despinoy, Daniel Olmeda Reino, Rahaf Aljundi

机构 * Toyota Motor Europe(丰田欧洲公司)

专题命中 其他VLM :vision language model(title);vision-language model(abstract);分类 cs.CV

AI总结 本文提出无需训练的LVLM个性化方法,通过预训练视觉基础模型提取特征,结合检索增强生成技术实现多概念个性化,适用于图像和视频。

Comments Accepted at Transactions on Machine Learning Research (TMLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25361 2026-04-29 cs.CV 57%

HuM-Eval: A Coarse-to-Fine Framework for Human-Centric Video Evaluation

HuM-Eval: 一种以人为中心的视频评估框架

Bingzi Zhang, Kaisi Guan, Ruihua Song

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

AI总结 本文提出HuM-Eval框架,通过粗到细策略评估生成视频中的人体运动质量,实验显示其在人体相关性上达到58.2%的平均值,优于现有方法。

Comments Accepted to the 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏