arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-07-08 至 2026-07-08 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 3 篇

2607.06389 2026-07-08 cs.CV 新提交 70%

FADRA: Frequency-Aware Diffusion with Residual Adaptation for Video Face Restoration

FADRA:用于视频人脸识别的频率感知扩散与残差自适应

Jin Jiang, Jia Wang, Panwen Hu, Weiran Zhao, Shengcai Liao

机构 * United Arab Emirates University (UAEU)(阿联酋大学) Ocean University of China (OUC)(中国海洋大学) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 研究针对视频人脸识别在复杂退化下难以平衡空间保真度和时间连贯性的问题,提出FADRA框架,利用预训练模型的时间一致性,通过LoRA适配器、重复残差自适应头及频率感知损失等实现,实验证明其在恢复面部结构和保持时间一致性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00047 2026-07-08 cs.MM cs.CV cs.GR 新提交 62%

Vertigo Vertigo: Reconstructing a Cinematic Ideal through its Predictive AI Double

眩晕眩晕:通过其预测性AI双重重建电影理想

Adam Cole, Mick Grierson

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV、cs.MM

AI总结 使用仅2.78%原始帧通过视频扩散模型重建希区柯克《迷魂记》,验证生成系统编码的经典电影规范,73.1%帧可识别,3.6%严重失败。

Comments Accepted to Ars Electronica EXPANDED 2026 - Conference on Animation and Interactive Art (in cooperation with ACM SIGGRAPH), Ars Electronica Festival, Linz. 7 pages, 7 figures. Authors' version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06555 2026-07-08 cs.CV 新提交 57%

ProxyPose: 6-DoF Pose Tracking via Video-to-Video Translation

ProxyPose:通过视频到视频转换进行六自由度姿态跟踪

Ruihang Zhang, Felix Taubner, Pooja Ravi, Kiriakos N. Kutulakos, David B. Lindell

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 研究旨在解决单目视频中6-DoF姿态跟踪问题,核心方法是将其转化为视频到视频转换,利用视频扩散模型生成代理视频,通过现成求解器恢复姿态。主要贡献是在无额外输入下实现高精度,且可扩展到多种场景。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏