arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-17 至 2026-04-17 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 3 篇

2604.09057 2026-04-17 cs.CV cs.MM cs.SD 76%

Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence

Tora3:基于轨迹的音频视频生成与物理一致性

Junchao Liao, Zhenghao Zhang, Xiangyu Meng, Litao Li, Ziying Zhang, Siyu Zhu, Long Qin, Weizhi Wang

机构 * Alibaba Cloud Computing(阿里巴巴云 computing) Fudan University(复旦大学)

专题命中 视频生成 :video generation(title);分类 cs.CV、cs.MM

AI总结 Tora3通过引入轨迹作为共享的运动先验,提升音频视频生成的物理一致性,采用轨迹对齐的运动表示和混合流匹配方案,改进运动真实性和运动-声音同步性。

Comments 12 pages, 5 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15299 2026-04-17 cs.CV 57%

AnimationBench: Are Video Models Good at Character-Centric Animation?

AnimationBench: 视频模型在以角色为中心的动画生成中表现如何?

Leyi Wu, Pengjun Fang, Kai Sun, Yazhou Xing, Yinwei Wu, Songsong Wang, Ziqi Huang, Dan Zhou, Yingqing He, Ying-Cong Chen, Qifeng Chen

机构 * New AI Labs

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出AnimationBench,首个系统评估动画图像到视频生成的基准,结合动画十二基本原则和IP保护,评估语义一致性、运动合理性等质量维度,支持标准化和开放集评估,揭示现实主义基准忽视的动画特定质量差异。

Comments Project Page: https://animationbench.github.io Code: https://github.com/VideoVerses/AnimationBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15134 2026-04-17 cs.CV 57%

How to Correctly Make Mistakes: A Framework for Constructing and Benchmarking Mistake Aware Egocentric Procedural Videos

如何正确犯错:一个用于构建和基准测试错误感知第一人称视频的框架

Olga Loginova, Frank Keller

机构 * University of Trento(特伦托大学) University of Edinburgh(爱丁堡大学) Italy(意大利) United Kingdom(大不列颠岛)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出PIE-V框架,通过引入可控的人类合理偏差来构建和评估错误感知的第一人称视频,结合心理学启发的错误计划、纠正计划、LLM作家和评委,提升视频的合理性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏