arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-07-03 至 2026-07-03 共收录 7 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 7 篇

2606.28016 2026-07-03 cs.CV 新提交 83%

TempAct: Advancing Temporal Plausibility in Autoregressive Video Generation via Planner-Executor RL

TempAct: 通过规划器-执行器强化学习推进自回归视频生成中的时间合理性

Jing Wang, Xiangxin Zhou, Jiajun Liang, Kaiqi Liu, Wanyuan Pang, Zhenyu Xie, Tianyu Pang, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区) Tencent Hunyuan(腾讯混元) Tsinghua University(清华大学) Peking University(北京大学) USTB(北京科技大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出TempAct框架,利用规划器-执行器强化学习联合优化时间分解与步骤条件执行,解决自回归视频生成中时间指令模糊、延迟反应和错误传播问题,提升时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01701 2026-07-03 cs.DC 新提交 78%

Arachne: Orchestrating Cascades for Efficient Text-to-Video Model Training

Arachne: 编排级联以实现高效文本到视频模型训练

Peng Yu, Yuankai Fan, Yang Qiu, Tian Li, Bihuan Chen, Yin Chen, Qizhen Weng

专题命中 视频生成 :text-to-video(title,abstract)

AI总结 提出Arachne框架,通过将训练过程分解为细粒度计算单元(级联)并协调其分布式执行与同步,解决T2V模型训练中的负载不均和硬件利用率低问题,迭代时间最多减少65%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32028 2026-07-03 cs.RO 新提交 78%

DVG-WM: Disentangled Video Generation Enables Efficient Embodied World Model for Robotic Manipulation

DVG-WM:解耦视频生成实现高效机器人操作具身世界模型

Ziyu Shan, Zhenyu Wu, Xiaofeng Wang, Zheng Zhu, Ziwei Wang

机构 * Nanyang Technological University, Singapore(南洋理工大学(新加坡)) Beijing University of Posts and Telecommunications, Beijing, China(北京邮电大学(中国北京)) GigaAI

专题命中 视频生成 :video generation(title,abstract)

AI总结 提出解耦视频生成世界模型(DVG-WM),将世界模型分解为动力学学习和视觉合成,通过流匹配直接映射动力学到视频潜变量,并引入潜变量退化机制再生接触细节,在LIBERO和真实平台实现高达3.97倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02517 2026-07-03 cs.CV 新提交 57%

WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory

WorldDirector: 构建具有持久动态记忆的可控世界模拟器

Hanlin Wang, Hao Ouyang, Qiuyu Wang, Wen Wang, Qingyan Bai, Ka Leong Cheng, Yue Yu, Yixuan Li, Yihao Meng, Zichen Liu, Yanhong Zeng, Yujun Shen, Qifeng Chen

机构 * HKUST(香港科技大学) Ant Group(蚂蚁集团) ZJU(浙江大学) CUHK(香港中文大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出WorldDirector框架,通过LLM协调3D轨迹与相机运动作为视频生成控制信号,解耦语义运动编排与视觉生成,实现持久动态对象记忆和自由视角探索。

Comments Project Page: https://worlddirector.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01663 2026-07-03 cs.CV 新提交 57%

Unified Panoramic-Gaussian Representation for Monocular 4D Scene Synthesis

统一全景-高斯表示用于单目4D场景合成

Yuankun Yang, Yi Wei, Wenyang Zhou, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Central Media Technology Institute, Huawei(华为中央媒体技术研究院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出PanoGaussian,结合全景轨迹引导与显式动态高斯表示,解决单目视频4D场景合成中视角外区域推断不一致和动态内容建模问题。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01817 2026-07-03 cs.DC 新提交 50%

HCMS: Head-Chunked Multi-Stream Pipeline for Communication-Computation Overlap in Long-Sequence Parallel Attention

HCMS: 用于长序列并行注意力中通信-计算重叠的头分块多流流水线

Chao Yuan, Pan Li, Yingnan Sun, Jing Liu

专题命中 视频生成 :video generation(abstract)

AI总结 提出HCMS方法,通过将注意力头分块并利用双CUDA流实现细粒度通信-计算重叠,在长序列并行注意力中加速10%-17.5%。

Comments 11 pages, 4 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01766 2026-07-03 cs.AI 新提交 50%

SimWorlds: A Multi-Agent System for Dynamic 3D Scene Creation

SimWorlds: 一个用于动态3D场景创建的多智能体系统

Chunjiang Liu, Xiaoyuan Wang, Haoyu Chen, Yizhou Zhao, Ming-Hsuan Yang, László A. Jeni

机构 * Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学) University of California, Merced(加州大学默塞德分校)

专题命中 视频生成 :video generation(abstract)

AI总结 提出多智能体框架SimWorlds,通过规划-编码-审查流程和运行时状态检查工具,从文本生成动态4D场景,并引入基准4DBuildBench评估视觉保真度和物理一致性。

Comments 20 pages, 3 figures. Project page: https://dynsimworlds.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏