arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-06 至 2026-08-06 共收录 8 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1 篇

2504.01407 2026-08-06 cs.CV cs.AI 版本更新 89%

ZoomV: Temporal Zoom-in for Efficient Long Video Understanding

TimeSearch: 基于聚光灯和反射的层次视频搜索用于类人长视频理解

Yuan Zhang, Junwen Pan, Rui Zhang, Xin Wan, Qizhe Zhang, Ming Lu, Qi She, Shanghang Zhang

机构 * ByteDance(字节跳动) School of Computer Science, Peking University(北京大学计算机科学学院)

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);video-language(abstract);分类 cs.CV

AI总结 TimeSearch通过Spotlight和Reflection机制,提升长视频理解的准确性和效率

Comments ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 1 篇

2602.19161 2026-08-06 cs.CV 版本更新 74%

Flash-VAED: Plug-and-Play VAE Decoders for Efficient Video Generation

Flash-VAED: 用于高效视频生成的即插即用VAE解码器

Lunjie Zhu, Yushi Huang, Xingtong Ge, Yufei Xue, Zhening Liu, Yumeng Zhang, Zehong Lin, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 Flash-VAED通过通道剪枝和分阶段运算优化,实现了高效视频生成的高质量与高速度平衡。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 4 篇

2602.13357 2026-08-06 cs.CV cs.AI 版本更新 70%

AdaCorrection: Adaptive Offset Cache Correction for Accurate Diffusion Transformers

AdaCorrection: 用于准确扩散变换器的自适应偏移缓存校正

Dong Liu, Yanxuan Yu, Ben Lengerich, Ying Nian Wu

机构 * Columbia University(哥伦比亚大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出AdaCorrection框架,通过自适应偏移缓存校正提升扩散变换器的生成质量与缓存复用效率,减少计算开销并保持高保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01693 2026-08-06 cs.CV 版本更新 57%

From Understanding to Erasing: Towards Complete and Stable Video Object Removal

从理解到擦除:迈向完全且稳定的视频对象移除

Dingming Liu, Wenjing Wang, Chen Li, Jing Lyu, Haotian Dong

机构 * Peking University(北京大学) WeChat Vision, Tencent Inc.(腾讯微信视觉)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出通过外部和内部指导机制,结合视觉基础模型与视频扩散模型,提升视频对象移除的物理和语义理解能力,实现清晰且连贯的移除效果,并建立首个真实世界基准测试。

Comments Code: https://github.com/WeChatCV/UnderEraser

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14294 2026-08-06 cs.CV cs.AI cs.LG cs.RO 版本更新 57%

Seeking Physics in Diffusion Noise

在扩散噪声中寻求物理规律

Chujun Tang, Lei Zhong, Fangqiang Ding

机构 * Brown University(布朗大学) University of Edinburgh(爱丁堡大学) MIT(麻省理工学院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 研究通过分析预训练扩散变换器的中间去噪表示,发现物理合理与不合理视频在中层特征空间部分可分离,提出渐进轨迹选择策略提升物理一致性并降低推理成本。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06140 2026-08-06 cs.CV cs.AI 版本更新 57%

Place-it-R1: Unlocking Environment-aware Reasoning Potential of MLLM for Video Object Insertion

Place-it-R1: 解锁多模态大语言模型在视频物体插入中的环境感知推理潜力

Bohai Gu, Taiyi Wu, Dazhao Du, Jian Liu, Shuai Yang, Xiaotong Zhao, Alan Zhao, Song Guo

机构 * HKUST(香港科技大学) Tencent Video(腾讯视频) Peking University(北京大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 Place-it-R1通过多模态大语言模型的环境感知推理能力,实现物理一致的视频物体插入,提供两种模式以平衡保真度与合理性。

Comments https://nevsnev.github.io/Place-it-R1/

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频数据与评测 2 篇

2608.02150 2026-08-06 cs.CV cs.AI 版本更新 70%

PhyCheck: Fine-Grained Evidence-Grounded Dataset for Physical Law Understanding in Video-LLMs

PhyCheck:面向视频大语言模型的物理规律理解细粒度证据驱动数据集

Zhongjie Ba, Shengwang Xu, Peng Cheng, Jinyang Zou, Ting Yu, Zhibo Wang, Zhan Qin

机构 * Zhejiang University(浙江大学) ZJU-Hangzhou Global Scientific and Technological Innovation Center(浙江大学杭州国际科技创新中心) Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 视频数据与评测 :video understanding(abstract);video-language(abstract);分类 cs.CV

AI总结 本文提出PhyCheck数据集,通过粗粒度、细粒度及诊断子集提升视频大语言模型的物理规律理解,实验证实其训练效果,同时指出当前模型难以整合因果条件的问题。

Comments 15pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21686 2026-08-06 cs.CV 版本更新 57%

WorldMark: A Unified Benchmark Suite for Interactive Video World Models

WorldMark:交互式视频世界模型的统一基准套件

Xiaojie Xu, Zhengyuan Lin, Kang He, Yukang Feng, Xiaofeng Mao, Yuanyang Yin, Yongtao Ge, Kaipeng Zhang

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 WorldMark 是交互式视频世界模型的统一基准套件,通过适配器解决动作格式不兼容问题,从多维度评估模型,揭示现有协议未察觉的差异,将发布相关数据与代码。

详情

展开后加载摘要…

URL PDF HTML 收藏