arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-07-10 至 2026-07-10 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 4 篇

2607.08770 2026-07-10 cs.CV 新提交 79%

LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models

LongE2V:基于视频扩散模型的长时程基于事件的视频重建、预测和帧插值

Cheng-De Fan, Chun-Wei Tuan Mu, Chen-Wei Chang, Chin-Yang Lin, Kun-Ru Wu, Yu-Chee Tseng, Yu-Lun Liu

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 研究从稀疏事件流恢复高质量视频的难题,提出LongE2V方法,利用预训练视频扩散先验,通过微调基础模型实现联合处理视频重建、预测和帧插值,在多任务上优于现有方法,有高数据效率、时间连贯性和零样本泛化能力。

Comments SIGGRAPH 2026. Project page: https://cdfan0627.github.io/LongE2V-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30308 2026-07-10 cs.CV 版本更新 79%

The Surprising Effectiveness of Video Diffusion Models for Hand Motion Reconstruction

视频扩散模型在手部运动重建中的惊人有效性

Yuxi Wang, Chengkai Jin, Yufei Liu, Wenqi Ouyang, Tianyi Wei, Zhiwei Zeng, Siyuan Huang, Zhiqi Shen, Xingang Pan

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 提出ViDiHand,利用预训练视频扩散模型重建4D双手姿态,无需检测器或优化,在多个基准上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11117 2026-07-10 cs.CV 版本更新 79%

HairWeaver: Few-Shot Photorealistic Hair Motion Synthesis with Sim-to-Real Guided Video Diffusion

HairWeaver:基于仿真到现实引导视频扩散的少样本逼真头发运动合成

Di Chang, Ji Hou, Aljaz Bozic, Assaf Neuberger, Felix Juefei-Xu, Olivier Maury, Gene Wei-Chin Lin, Tuur Stuyck, Doug Roble, Mohammad Soleymani, Stephane Grabli

机构 * Meta University of Southern California(Meta 美国南加州大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 HairWeaver旨在解决现有方法在头发运动控制上的不足,通过运动上下文LoRA和风格对齐LoRA两个模块,结合CG模拟器生成的数据集训练视频扩散主干,实现对头发运动的精细控制,生成高度逼真且具动态细节的头发动画,达到新的技术水平。

Comments Accepted by ECCV 2026. Website: https://boese0601.github.io/hairweaver/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16456 2026-07-10 cs.CV 版本更新 57%

PhyMAGIC: Physical Motion-Aware Generative Inference with Confidence-guided LLM

PhyMAGIC:基于置信度引导的大语言模型的物理运动感知生成推理

Siwei Meng, Yawei Luo, Ping Liu

机构 * Department of Computer Science \& Engineering, University of Nevada, Reno, USA School of Software Technology, Zhejiang University, China

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 针对3D内容生成中动态模型物理一致性问题,PhyMAGIC提出无需训练的框架,整合图像到视频扩散模型、大语言模型置信度引导推理及可微物理模拟器,通过迭代优化和模拟反馈生成物理一致的运动,性能优于现有方法。

Comments This work is accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏