arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-23 至 2026-04-23 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 3 篇

2602.13669 2026-04-23 cs.CV 79%

EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation

EchoTorrent: 向快速、持续和流式多模态视频生成迈进

Rang Meng, Weipeng Wu, Yuming Li, Chenguang Ma

机构 * Ant Group(蚂蚁集团)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出EchoTorrent框架,通过四重设计提升多模态视频生成的效率与稳定性,实现快速、持续和流式生成,增强时空一致性与音频唇同步性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20357 2026-04-23 cs.CV cs.CL 57%

SignDATA: Data Pipeline for Sign Language Translation

SignDATA:手语翻译的数据管道

Kuanwei Chen, Tingyi Lin

机构 * Computer Science and Information Engineering National Central University(计算机科学与信息工程国家级中央大学) Electrical Engineering National Changhua University Of Education(电气工程国家彰化教育大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出SignDATA,一种标准化手语数据集的预处理工具包,支持端到端的姿势和视频处理流程,通过可配置的接口实现统一输出,提升手语研究的可重复性和比较性。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20157 2026-04-23 cs.CV 57%

HumanScore: Benchmarking Human Motions in Generated Videos

HumanScore:在生成视频中评估人类动作的基准测试

Yusu Fang, Tiange Xiang, Tian Tan, Narayan Schuetz, Scott Delp, Li Fei-Fei, Ehsan Adeli

机构 * Stanford University(斯坦福大学) Peking University(北京大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出HumanScore框架,通过六个可解释指标评估AI生成视频中人类动作的质量,揭示感知合理性与生物力学真实性的差距,并产生可靠的模型排名。

详情

展开后加载摘要…

URL PDF HTML 收藏