arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-13 至 2026-08-13 共收录 7 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2 篇

2608.12203 2026-08-13 cs.CV 新提交 79%

GeoFlow: Efficient Driving Video Generation via Geometry-Aligned Priors

GeoFlow:基于几何对齐先验的高效驾驶视频生成

Jiazheng Liu, Hang Li, Jiawei Zhang, Jiahe Li, Xiaohan Yu, Shengyin Fan, Jin Zheng, Xiao Bai

机构 * Beihang University(北京航空航天大学) Macquarie University(麦考瑞大学) Tianyi Transportation Technology Co., Ltd(天宜交通科技有限公司) Jiangxi Research Institute, Beihang University(北京航空航天大学江西研究院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 GeoFlow是一款新型驾驶视频生成框架,通过构建几何对齐先验分布替代标准高斯噪声初始化,可提升生成效率与少步生成质量,减少推理步骤。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12290 2026-08-13 cs.CV cs.AI cs.MM 新提交 62%

Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence

超越试错:面向图像到视频一致性的智能体优化

Aman Tyagi, Hemanth Boinpally, Jonathan Chen, Douglas Gebert, Steven Hickson

机构 * Google Cloud(谷歌云) Google DeepMind(谷歌DeepMind)

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

AI总结 针对图像到视频模型试错效率低的问题,提出Agentic Self-Improvement框架,通过两阶段优化提升视频与文本一致性,生成视频胜率达69%,为视频生成模型提供实用可控的优化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频扩散模型 3 篇

2608.12032 2026-08-13 cs.CV cs.AI 新提交 79%

LoSA: Near-Lossless Sparse Attention for Training-Free Video Diffusion Acceleration

LoSA:用于无训练视频扩散加速的近无损稀疏注意力

Enhuai Liu, Yunke Wang, Yutong Wang, Changming Sun, Chang Xu

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 LoSA是一种无训练稀疏注意力方法,通过固定99%的注意力质量阈值移除冗余计算,在多款视频扩散Transformer上实现最高3.2倍加速,且速度-质量权衡优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11562 2026-08-13 cs.CV cs.AI eess.IV 新提交 62%

From Synthesis to Removal: Physics-Grounded Reflection Simulation and Diffusion-Based Video Dereflection

从合成到去除:基于物理的反射模拟与基于扩散的视频去反射

Zepeng Wang, Jiagao Hu, Fuhao Li, Yuxuan Chen, Fei Wang, Daiguo Zhou

机构 * Xiaomi Inc.(小米公司) MiLM Plus

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV、eess.IV

AI总结 该研究针对视频反射去除数据与模型缺失问题,提出闭环框架S2R,含基于物理的反射模拟、首个扩散式视频去反射模型及专用基准,实现了更优性能与更快推理。

Comments Project page: https://codingwzp.github.io/VideoDereflection_S2R

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11618 2026-08-13 cs.CV 新提交 57%

Generative Video Compression Based on Hierarchical Referencing

基于分层参考的生成式视频压缩

Daowen Li, Ding Ding, Zifu Zhang, Kai Li, Ying Chen

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出基于分层参考的生成式视频压缩方法GVCHR,通过分层结构优化潜在编码与生成重建,在多个基准数据集上较现有最优方法实现LPIPS和DISTS指标下50.5%、54.0%的BD-rate增益,视觉质量显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 动作与事件理解 1 篇

2608.11605 2026-08-13 cs.AI 新提交 50%

Foresight Without Seeing: Latent Futures for World Action Models

无视觉前瞻:面向世界动作模型的潜在未来

Jiakai Huang, Zhongbo Wu, Zheng Zhang, Zihan Wang, Shan You, Tao Huang

机构 * Shanghai Jiao Tong University(上海交通大学) ACE Robotics(ACE机器人公司) Nanyang Technological University(南洋理工大学)

专题命中 动作与事件理解 :video generation(abstract)

AI总结 本文提出ForeWAM,一种动力学条件下的直接策略WAM,通过Future-KV和动力学寄存器在无需显式生成未来视频的情况下,使直接策略WAMs兼具高效动作预测与预测动力学暴露能力,在LIBERO和LIBERO-Plus上取得高成功率。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 1 篇

2608.12107 2026-08-13 cs.CV 新提交 57%

Avatar-Forever: Decoupled Parallel Training for High-Quality Real-Time Infinite Avatars

Avatar-Forever:用于高质量实时无限虚拟形象的解耦并行训练

Ruibin Li, Tao Yang, Zhiyuan Ma, Fangzhou Ai, Shilei Wen, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) ByteDance(字节跳动) AMD(超威半导体公司)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 Avatar-Forever是一种解耦并行训练框架,通过双分支设计与ForeverCache机制,在单张H100 GPU上实现27.2 FPS的768x512音频驱动无限虚拟形象生成,保障质量与效率,推进稳定数字人研究。

详情

展开后加载摘要…

URL PDF HTML 收藏