arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-06-29 至 2026-06-29 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 4 篇

2603.17426 2026-06-29 cs.CV 版本更新 79%

SHIFT: Motion Alignment in Video Diffusion Models with Adversarial Hybrid Fine-Tuning

SHIFT: 视频扩散模型中的运动对齐与对抗混合微调

Xi Ye, Wenjia Yang, Yangyang Xu, Xiaoyang Liu, Duo Su, Mengfei Xia, Jun Zhu

机构 * Tsinghua University(清华大学) Ant Group(蚂蚁集团) University of Chinese Academy of Science(中国科学院大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 针对视频扩散模型微调后运动保真度下降的问题,提出基于像素通量动力学的像素运动奖励和SHIFT框架(平滑混合微调),通过对抗优势改进收敛并缓解奖励黑客,有效解决动态度坍塌。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13910 2026-06-29 cs.CV 版本更新 57%

Scene Generation at Absolute Scale: Utilizing Semantic and Geometric Guidance From Text for Accurate and Interpretable 3D Indoor Scene Generation

绝对尺度下的场景生成:利用文本的语义和几何引导实现精确且可解释的3D室内场景生成

Stefan Ainetter, Thomas Deixelberger, Edoardo A. Dominici, Philipp Drescher, Konstantinos Vardis, Markus Steinberger

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出GuidedSceneGen框架,通过文本预测全局3D布局并利用全景扩散模型和视频扩散模型生成绝对尺度的室内场景,实现高一致性、可导航的3D重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16893 2026-06-29 cs.CV 版本更新 57%

Instant Expressive Gaussian Head Avatars at Over 100 FPS

即时表达性高斯头部虚拟化身,帧率超过100 FPS

Kaiwen Jiang, Xueting Li, Seonwook Park, Ravi Ramamoorthi, Shalini De Mello, Koki Nagano

机构 * University of California, San Diego(加州大学圣地亚哥分校) NVIDIA(英伟达)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出一种前馈编码器流水线,将单张野外图像转换为3D一致、快速且富有表现力的可动画化表示,通过轻量级局部融合策略实现高动画表现力,运行速度达107.31 FPS。

Comments Project website is https://research.nvidia.com/labs/amri/projects/instant4d

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28237 2026-06-29 cs.RO 新提交 50%

Unleashing Infinite Motion: Scaling Expressive Quadrupedal Motion via Generative Video Priors

释放无限运动:通过生成式视频先验扩展富有表现力的四足运动

Youzhi Liu, Li Gao, Yifei Qian, Liu Liu, Yang Cai, Ziqiao Li

机构 * Amap, Alibaba Group(高德,阿里巴巴集团)

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 提出Uni-Mo全自动流水线,利用LLM和视频扩散模型生成四足机器人运动数据,通过身份一致性损失提取3D轨迹,训练真实机器人跟踪策略,并发布包含7488个语言标注运动的数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏