arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-07-17 至 2026-07-17 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 1 篇

2511.22098 2026-07-17 cs.CV 版本更新 83%

WorldWander: Bridging Egocentric and Exocentric Worlds in Video Generation

WorldWander:在视频生成中连接自我中心和外中心世界

Quanjian Song, Yiren Song, Kelly Peng, Yuan Gao, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 研究聚焦视频生成中自我中心与外中心世界转换,提出WorldWander框架,基于视频扩散变换器,整合上下文视角对齐与协作位置编码,精心策划数据集,实验证明该框架在视角同步、角色一致性和泛化能力上表现卓越,设定了新基准。

Comments Accepted by ECCV 2026; Code: https://github.com/showlab/WorldWander

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频扩散模型 1 篇

2607.12358 2026-07-17 cs.CV 版本更新 79%

ACID: Adaptive Caching for vIDeo generation

ACID:用于视频生成的自适应缓存

Om Agrawal, Saurabh Agarwal, Aditya Akella

机构 * UT Austin(德克萨斯大学奥斯汀分校)

专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 研究视频扩散模型推理慢问题,提出ACID自适应缓存方法,通过监测漂移信号变化动态切换阈值,无需重新训练,可插入现有缓存方法,实验证明其能显著提升推理速度且质量退化可忽略。

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏