arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-01 至 2026-04-01 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 4 篇

2512.21507 2026-04-01 cs.CV 83%

SVBench: Evaluation of Video Generation Models on Social Reasoning

SVBench:视频生成模型在社会推理中的评估

Wenshuo Peng, Gongxuan Wang, Tianmeng Yang, Chuanhao Li, Xiaojie Xu, Hui He, Kaipeng Zhang

机构 * Tsinghua University(清华大学) Shanda AI Research Tokyo(盛大人工智能研究院东京) Shanghai AI Lab(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出SVBench基准,用于评估视频生成模型在社会推理能力上的不足,通过七大核心维度和免训练流程,评估七种先进模型,揭示表面合理性与深层社会推理能力间的差距。

Comments 10pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29931 2026-04-01 cs.CV 79%

Gloria: Consistent Character Video Generation via Content Anchors

Gloria:通过内容锚点实现一致的字符视频生成

Yuhang Yang, Fan Zhang, Huaijin Pi, Shuai Guo, Guowei Xu, Wei Zhai, Yang Cao, Zheng-Jun Zha

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, USTC(教育部类脑智能感知与认知重点实验室,中国科学技术大学) UNSW(新南威尔士大学) HKU(香港大学) UESTC(电子科技大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本研究提出通过紧凑的锚帧集表示字符视觉属性,结合两种机制提升生成一致性,实现高质量多视角一致的字符视频生成。

Comments Accepted by CVPR2026 Main, project: https://yyvhang.github.io/Gloria_Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06537 2026-04-01 cs.CV cs.AI 79%

ProFashion: Prototype-guided Fashion Video Generation with Multiple Reference Images

ProFashion: 基于多参考图像的原型引导时尚视频生成

Xianghao Kong, Qiaosong Qi, Yuanbin Wang, Biaolong Chen, Aixi Zhang, Anyi Rao

机构 * The Hong Kong University of Science and Technology(香港科技大学) Taobao & Tmall Group(淘宝天猫集团)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出ProFashion框架,利用多参考图像提升视图一致性和时间一致性,通过姿态感知原型聚合器和流增强原型生成器改进时尚视频生成。

Comments CVPRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19979 2026-04-01 cs.CV cs.AI 57%

X-World: Controllable Ego-Centric Multi-Camera World Models for Scalable End-to-End Driving

X-World: 可控的以自身为中心的多摄像头世界模型用于可扩展的端到端驾驶

Chaoda Zheng, Sean Li, Jinhao Deng, Zhennan Wang, Shijia Chen, Liqiang Xiao, Ziheng Chi, Hongbin Lin, Kangjie Chen, Boyang Wang, Yu Zhang, Xianming Liu

机构 * GWM Team(长城汽车团队) XPeng Inc.(小鹏汽车)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 X-World通过可控的多摄像头生成世界模型,实现高质量多视角视频生成,支持跨摄像头一致性、长时间动态稳定性和严格动作遵循,为可扩展的端到端驾驶评估提供基础。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏