arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-05-25 至 2026-05-25 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 2 篇

2605.23508 2026-05-25 cs.GR cs.AI cs.CV cs.MM eess.IV 87%

DrawVideo: Generating Long Video from Storyboard Keyframe Sketches

DrawVideo: 从故事板关键帧草图生成长视频

Chuanzhi Xu, Huiqi Liang, Bang Shi, Huiming Zhang, Yifan Xiao, Guangcheng Lin, Haodong Chen, Qiang Qu, Zhicheng Lu, Weidong Cai

机构 * The University of Sydney(悉尼大学) Charles Sturt University(查尔斯·斯特劳特大学)

专题命中 长视频与时序推理 :long video(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV、eess.IV、cs.MM

AI总结 提出 DrawVideo 框架,通过草图引导的故事板分解长视频为可控镜头,结合分层生成策略实现结构可控、外观一致的长视频生成。

Comments 45 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06094 2026-05-25 cs.CV cs.AI 83%

VISD: Enhancing Video Reasoning via Structured Self-Distillation

VISD: 通过结构化自蒸馏增强视频推理

Hao Lin, Kunyang Lv, Xu Jiang, Jingqi Tian, Zhongjing Du, Jiayu Ding, Qiaoman Zhang, Hongbo Jin

机构 * HUST(华中科技大学) Wuhan University(武汉大学) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 长视频与时序推理 :video reasoning(title,abstract);long video(abstract);分类 cs.CV

AI总结 提出VISD框架,利用结构化自蒸馏和方向-幅度解耦机制,实现细粒度信用分配,提升视频推理准确性和训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏