arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-04 至 2026-08-04 共收录 5 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 5 篇

2509.21541 2026-08-04 cs.GR cs.CV 版本更新 83%

ControlHair: Synergizing Physics Simulator and Video Diffusion for Controllable Dynamic Hair Rendering

ControlHair:协同物理模拟器与视频扩散实现可控动态毛发渲染

Weikai Lin, Haoxiang Li, Yuhao Zhu

机构 * University of Rochester(罗切斯特大学) Pixocial Technology(Pixocial技术)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 研究针对毛发模拟渲染难题,提出ControlHair框架,融合物理模拟器与视频扩散,通过三阶段管道实现可控动态毛发渲染,性能优于基线并展示多种应用。

Comments Accepted to ECCV 2026. 21 pages. Project page: https://linwk20.github.io/controlhair-web

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00486 2026-08-04 cs.CV 新提交 79%

DreamTraj: Generating 6-DoF Object Trajectories by Reading Unrendered Video Diffusion Latents

DreamTraj:通过读取未渲染视频扩散隐变量生成6自由度物体轨迹

Tongsheng Ding, Zhen Luo, Yixuan Yang, Boyu Wang, Luyang Xie, Jinyu Yang, Feng Zheng

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 DreamTraj利用含细粒度指令的MOVE数据集,从单张RGB图像和任务指令读取冻结视频扩散模型中间表示,直接解码6自由度物体轨迹,性能优于传统方法且速度提升4.6倍。

Comments 17 pages, 8 figures, 11 tables. Project page: https://whathappen0.github.io/DreamTraj/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04789 2026-08-04 cs.CV 版本更新 79%

Light Forcing: Accelerating Autoregressive Video Diffusion via Sparse Attention

轻量强制:通过稀疏注意力加速自回归视频扩散

Chengtao Lv, Yumeng Shi, Yushi Huang, Ruihao Gong, Shen Ren, Wenya Wang

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 针对自回归视频生成模型中注意力二次复杂度问题,提出首个稀疏注意力方案Light Forcing,通过块感知增长机制和分层稀疏注意力实现质量和效率提升。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12255 2026-08-04 cs.CV cs.AI 版本更新 57%

ARGen: Affect-Reinforced Generative Augmentation towards Vision-based Dynamic Emotion Perception

ARGen:基于情感强化的生成增强方法用于基于视觉的动态情绪感知

Huanzhen Wang, Ziheng Zhou, Jiaqi Song, Li He, Yunshi Lan, Yan Wang, Wenqiang Zhang

机构 * Fudan University(复旦大学) East China Normal University(华东师范大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出ARGen框架,通过情感语义注入和自适应强化扩散阶段,解决野外动态表情识别中的数据稀缺问题,提升情绪感知的生成质量和识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01150 2026-08-04 cs.DC 新提交 50%

Zellige: Moldable Sequence Placement for Mixed Image-Video DiT Training

Zellige:用于混合图像-视频DiT训练的可塑序列放置

Guangyu Xiang, Xueze Kang, Minwei Zhao, Yuxin Wang, Shaohuai Shi, Lin Zhang, Xiaowen Chu

专题命中 视频扩散模型 :video generation(abstract)

AI总结 Zellige是一种可塑序列放置系统,通过硬件分析器、两阶段规划器和合并注意力引擎解决混合图像-视频DiT训练的GPU序列放置问题,在多GPU环境下性能优于KnapFormer。

详情

展开后加载摘要…

URL PDF HTML 收藏