arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-14 至 2026-04-14 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频数据与评测 3 篇

2511.18957 2026-04-14 cs.CV 57%

Eevee: Towards Close-up High-resolution Video-based Virtual Try-on

Eevee:迈向基于视频的高分辨率虚拟试衣

Jianhao Zeng, Yancheng Bai, Ruidong Chen, Xuanpu Zhang, Lei Sun, Dongyang Jin, Ryan Xu, Nannan Zhang, Dan Song, Xiangxiang Chu

机构 * Amap, Alibaba Group(高德,阿里巴巴集团) Tianjin University(天津大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 本文提出高分辨率视频虚拟试衣数据集,解决现有方法在真实纹理细节捕捉和近距离视频生成上的不足,引入VGID指标评估服装一致性,提升虚拟试衣的真实感和细节保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10127 2026-04-14 cs.CV cs.AI 57%

VGA-Bench: A Unified Benchmark and Multi-Model Framework for Video Aesthetics and Generation Quality Evaluation

VGA-Bench:一个统一的基准和多模型框架用于视频审美和生成质量评估

Longteng Jiang, DanDan Zheng, Qianqian Qiao, Heng Huang, Huaye Wang, Yihang Bo, Bao Peng, Jingdong Chen, Jun Zhou, Xin Jin

机构 * Ant Group(蚂蚁集团) Beijing Film Academy(北京电影学院) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,北京通用人工智能研究院)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 本文提出VGA-Bench,通过三层次分类体系,结合1016个多样化提示生成60000+视频数据集,设计多任务神经评估器,实现视频生成质量与审美质量的系统评估。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10014 2026-04-14 cs.CV cs.AI cs.CL 57%

Demographic and Linguistic Bias Evaluation in Omnimodal Language Models

多模态语言模型中的人口和语言偏差评估

Alaa Elobaid

机构 * Freie Universität Berlin(柏林自由大学)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 本文评估了多模态语言模型中的人口和语言偏差,通过不同任务揭示图像和视频理解任务在人口差异上表现更优,而音频理解任务存在显著偏差和预测崩溃。

Comments Accepted at ICPR 2026. Full paper with complete appendix (31 pages total)

详情

展开后加载摘要…

URL PDF HTML 收藏