arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-05-26 至 2026-05-26 共收录 26 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 5 篇

2605.25621 2026-05-26 cs.CV 79%

StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering

StreamOV: 通过证据引导记忆与响应触发的流式全视频理解

Ming Xie, Zizheng Huang, Xudong Tan, Chao Wang, Xiangyu Zeng, Wenxiao Wu, Tao Chen, Limin Wang, Yanwei Fu

机构 * Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Nanjing University(南京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 提出StreamOV框架,利用多模态证据引导的长短期记忆和隐状态驱动的触发机制,实现流式全视频理解中的在线推理与主动响应,并在新基准SOVBench上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25461 2026-05-26 cs.CV 79%

MetaphorVU: Towards Metaphorical Video Understanding

MetaphorVU:迈向隐喻视频理解

Zhuoqun Li, Boxi Cao, Guiping Jiang, Fangrui Lv, Ruotong Pan, Jianan Wang, Xiangyu Wu, Hongyu Lin, Yaojie Lu, Yong Du, Ruyin Jia, Liyan, Tingting Gao, Han Li, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 针对当前多模态大语言模型在隐喻视频理解上的不足,提出首个系统性基准MetaphorVU-Bench,并设计基于隐喻知识图谱的推理增强框架MetaphorBoost,显著提升模型性能。

Comments ICML 2026 spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25979 2026-05-26 cs.CV 57%

LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence

LLaVA-OneVision-2:迈向下一代感知智能

Xiang An, Yin Xie, Feilong Tang, Yunyao Yan, Huajie Tan, Didi Zhu, Changrui Chen, Xiuwei Zhao, Bin Qin, Kaicheng Yang, Yifei Shen, Yuanhan Zhang, Kaichen Zhang, Wenkang Zhang, Zheng Cheng, Nansen Zhang, Chunsheng Wu, Chunjiang Ge, Zimin Ran, Dehua Song, Chunyuan Li, Shikun Feng, Ming Hu, Zhangquan Chen, Junbo Niu, Bo Li, Ziyong Feng, Ziwei Liu, Zongyuan Ge, Jiankang Deng

机构 * Glint Lab(Glint实验室) AIM for Health Lab(健康AI实验室) MVP Lab(MVP实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 提出LLaVA-OV-2模型,通过编解码流令牌化、窗口注意力和3D RoPE实现统一视频理解与时空定位,在多项基准上超越Qwen3-VL-8B。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25615 2026-05-26 cs.CV 57%

UAV-OVO: Out-of-Viewpoint Generalization in UAV Action Recognition

UAV-OVO:无人机动作识别中的视点外泛化

Yu Xia, Zhengbo Zhang, Shuaihu Zhang, Zhigang Tu

机构 * Wuhan University(武汉大学) Singapore University of Technology and Design(新加坡科技与设计大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 针对无人机动作识别中训练与测试视点不一致导致的性能下降问题,提出UAV-OVO基准和LATER方法,通过视点隔离和LoRA锚定特征重中心化实现视点鲁棒泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17260 2026-05-26 cs.CV 57%

LiteFrame: Efficient Vision Encoders Unlock Frame Scaling in Video LLMs

LiteFrame: 高效视觉编码器解锁视频大语言模型中的帧缩放

Jihwan Kim, Nikhil Parthasarathy, Danfeng Qin, Junhwa Hur, Deqing Sun, Bohyung Han, Ming-Hsuan Yang, Boqing Gong

机构 * Seoul National University(首尔国立大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 针对视频大语言模型处理长视频时视觉令牌上下文长度爆炸的问题,提出LiteFrame高效视频编码器,通过压缩令牌蒸馏(CTD)训练框架,使紧凑的学生模型直接预测教师模型的信息密集时空压缩表示,从而在降低35%端到端延迟的同时处理8倍帧数并提升视频理解精度。

Comments Project Page: https://jjihwan.github.io/projects/LiteFrame

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 11 篇

2605.24962 2026-05-26 cs.CV 85%

Tempered Self-Similarity Alignment for Physically Plausible Video Generation

Tempered Self-Similarity Alignment for Physically Plausible Video Generation

Manjin Kim, Suha Kwak, Minsu Cho

机构 * Pohang University of Science and Technology (POSTECH)(浦项科学技术大学)

专题命中 视频生成 :video generation(title,title_cn);分类 cs.CV

AI总结 提出Tempered Self-Similarity Alignment (TSA)损失函数,通过将视觉基础模型中的时空自相似性关系知识迁移到视频生成模型中,以改善视频的物理合理性。

Comments Accepted to the CVPR 2026 Workshop on Video Generative Models: Benchmarks and Evaluation (VGBE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25266 2026-05-26 cs.CV 83%

DeltaCam: Differential Intrinsic Camera Modeling for Video Generation

DeltaCam: 用于视频生成的差分内参相机建模

Debabrata Mandal, Zhihan Peng, Yujie Wang, Praneeth Chakravarthula

机构 * UNC, Chapel Hill USA(北卡罗来纳大学教堂山分校)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出DeltaCam视频扩散框架,通过差分参数化神经相机适配器学习相对变化,实现焦距、光圈、ISO等内参的平滑可控视频生成,并扩展到真实场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25801 2026-05-26 cs.CV 79%

PixelWizard: Towards Efficient High-Fidelity Video Generation at Ultra-Large Spatial Resolution

PixelWizard: 迈向高效高保真超大规模空间分辨率视频生成

Wenxue Li, Jingjing Ren, Peng Zhang, Tian Ye, Daiguo Zhou, Jian Luan, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) MiLM Plus, Xiaomi Inc(小米公司MiLM Plus部门) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出PixelWizard框架,通过分层解耦全局结构建模与细节合成,并引入噪声跨度对齐捷径训练,实现超大规模分辨率视频的高效高保真生成,加速超过10倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25659 2026-05-26 cs.CV 79%

StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration

StreamChar: 基于解耦编排的长时程流式角色音频-视频生成

Linrui Tian, Qi Wang, Bang Zhang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出StreamChar流式框架,通过LLM编排器与联合音频-视频DiT解耦长时程编排与短窗去噪,实现实时、稳定、高质量的角色动画生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26105 2026-05-26 cs.CV 74%

On-Policy Adversarial Flow Distillation for Autoregressive Video Generation

自回归视频生成中的策略对抗流蒸馏

Yang Luo, Shengju Qian, Xiaohang Tang, Zirui Zhu, Yong Liu, Xin Wang, Yang You

机构 * LIGHTSPEED University College London(伦敦大学学院)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 提出策略对抗流蒸馏(AFD)框架,通过策略内对抗性反馈和正向过程流匹配,实现从异构黑盒教师模型向自回归学生模型的高效蒸馏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10543 2026-05-26 cs.CV 74%

TIE: Time Interval Encoding for Video Generation over Events

TIE:面向事件视频生成的时间区间编码

Zhilei Shu, Shangwen Zhu, Zihang Liang, Xiaofan Li, Qianyu Peng, Xinyu Cui, Bo Ye, Yiming Li, Fan Cheng, Jian Zhao, Yang Cao, Zheng-Jun Zha, Ruili Feng

机构 * University of Science and Technology of China(中国科学技术大学) Matrix Team(Matrix团队) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) University of Waterloo(滑铁卢大学) The Pennsylvania State University(宾夕法尼亚州立大学) Zhongguancun Academy(中关村学院) The University of Hong Kong(香港大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 提出时间区间编码(TIE),将旋转位置嵌入推广为区间感知形式,解决扩散变换器(DiT)在重叠事件视频生成中时间区间无法表示的问题,显著提升时间可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24509 2026-05-26 cs.CV cs.AI cs.GR cs.LG 70%

Φ-Noise: Training-Free Temporal Video Conditioning via Phase-Based Noise Manipulation

Φ-Noise:基于相位噪声操作的无训练时间视频条件生成

Ofir Abramovich, Nadav Z. Cohen, Adi Rosenthal, Ariel Shamir

机构 * Canvas-Lab

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出一种无需训练的方法,通过将参考视频的低频相位信息注入扩散噪声潜变量,实现运动条件视频生成,无需修改模型架构或推理流程。

Comments Under Review; 26 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26113 2026-05-26 cs.RO cs.CV 57%

AnyScene: Towards Highly Controllable Driving Scene Generation at Anywhere and Beyond

AnyScene: 迈向高度可控的任意位置驾驶场景生成及超越

Haiming Zhang, Junfei Zhou, Feng Jiang, Jingzhong Li, Zhenglong Guo, Penglin Dai, Jifeng Dai, Yan Xie, Benjin Zhu

机构 * Li Auto(利汽车) Southwest Jiaotong University(西南交通大学) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出AnyScene框架,通过时空占用扩散Transformer和几何引导视图扩展模块,实现从BEV布局生成语义占用序列和参考无关的多视角驾驶视频,支持精确可控和长时生成。

Comments Work in progress. Project page: https://mind-omni.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25343 2026-05-26 cs.CV 57%

Toward Native Multimodal Modeling: A Roadmap

迈向原生多模态建模:路线图

Siyu An, Junru Lu, Junnan Dong, Qiufeng Wang, Yinghui Li, Weizhi Fei, Zichao Yu, Zheng Yuan, Biao Liu, Haopeng Wang, Renzhao Liang, Yixuan Yang, Yunhang Shen, Bo Ke, Keyu Chen, Linhao Luo, Difan Zou, Xiao Huang, Di Yin, Ruizhi Qiao, Xing Sun

机构 * Tencent Youtu Lab(腾讯优图实验室) Tsinghua University(清华大学) The University of Hong Kong(香港大学) University of Warwick(沃林汉大学) Monash University(墨尔本大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出从非原生多模态范式向原生多模态建模(NMM)过渡的正式路线图,通过输入-输出二元性分类现有模型,并系统探讨架构协调、数据整理、训练推理及评估的全栈工业级方案。

Comments 52 pages, 5 figures, 3 tables, ~300 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16229 2026-05-26 cs.LG 50%

Factored Latent Action World Models

因子化潜在动作世界模型

Zizhao Wang, Chang Shi, Jiaheng Hu, Kevin Rohling, Roberto Martín-Martín, Amy Zhang, Peter Stone

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视频生成 :video generation(abstract)

AI总结 提出因子化潜在动作模型(FLAM),通过将场景分解为独立因子并学习各自的潜在动作,提升了无动作视频中多实体动态建模的准确性和视频生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11815 2026-05-26 cs.CY 50%

Video Deepfake Abuse: How Company Choices Predictably Shape Misuse Patterns

视频深度伪造滥用:公司选择如何可预测地塑造滥用模式

Max Kamachee, Stephen Casper, Michelle L. Ding, Rui-Jie Yew, Anka Reuel, Stella Biderman, Dylan Hadfield-Menell

专题命中 视频生成 :video generation(abstract)

AI总结 本文通过分析2025年视频生成模型,指出少数开放权重的模型成为生成逼真AIG-NCII视频的主要工具,并论证开发者与分发平台的责任,强调风险管理可显著影响未来滥用难度。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 5 篇

2605.25941 2026-05-26 cs.CV 88%

Where Concept Erasure Should Occur: Concept-Layer Alignment in Text-to-Video Diffusion Models

概念擦除应发生在何处:文本到视频扩散模型中的概念-层对齐

Yiwei Xie, Ping Liu, Zheng Zhang

机构 * The School of Artificial Intelligence and Automation, Huazhong University of Science and Technology, Wuhan 430074, China(人工智能与自动化学院,华中科技大学,武汉430074,中国) Department of Computer Science and Engineering, University of Nevada, Reno, NV, USA(计算机科学与工程系,内华达大学里诺分校,内华达州,美国)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 本文通过识别概念-层拓扑对齐瓶颈,提出基于可分离性优化的CLEAR框架,在文本到视频扩散模型中实现精确的概念擦除并保持生成质量。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15264 2026-05-26 cs.CV 83%

DriveGen3D: Boosting Feed-Forward Driving Scene Generation with Efficient Video Diffusion

DriveGen3D: 通过高效视频扩散提升前馈驾驶场景生成

Weijie Wang, Jiagang Zhu, Zeyu Zhang, Xiaofeng Wang, Zheng Zhu, Guosheng Zhao, Chaojun Ni, Haoxiao Wang, Guan Huang, Xinze Chen, Yukun Zhou, Wenkang Qin, Duochao Shi, Haoyun Li, Yicheng Xiao, Donny Y. Chen, Jiwen Lu

机构 * Zhejiang University(浙江大学) GigaAI Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Peking University(北京大学) Monash University(墨尔本大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 提出DriveGen3D框架,结合快速视频扩散Transformer(FastDrive-DiT)和前馈3D重建模块(FastRecon3D),实现高质量、可控的动态3D驾驶场景生成,在长视频和3D一致性上达到最优。

Comments ICME 2026 Oral, Project Page: https://lhmd.top/drivegen3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24630 2026-05-26 cs.CV 79%

DexSIM: Real-time Dexterous Simulation with Unified Causal Video Diffusion

DexSIM: 具有统一因果视频扩散的实时灵巧仿真

Adam Lee

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 提出DexSIM框架,通过两阶段训练(双向视频扩散和自回归滚动训练)实现实时、长时一致的灵巧操作仿真,在像素相似度、运动保真度和手部投影精度上超越基线。

Comments World Model @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25500 2026-05-26 cs.CV 57%

Full-4D: Generating Full-Scope 4D Scenes from a Single-View Video

Full-4D:从单视角视频生成全范围4D场景

Tingxi Chen, Ke Hao, Yabo Chen, Zhengxue Cheng, Rong Xie, Li Song, Haibin Huang, Chi Zhang, Xuelong Li

机构 * Shanghai Jiao Tong University(上海交通大学) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出一种将单视角视频转换为全范围4D场景的框架,通过多视角视频合成和基于优化的4D重建,引入大规模数据集Real-MV-4D、融合时间-视图注意力的扩散模型和流匹配蒸馏损失,实现高保真度和几何一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20273 2026-05-26 cs.DC cs.CV 57%

SwiftFusion: Scalable Sequence Parallelism for Distributed Inference of Diffusion Transformers on GPUs

SwiftFusion: 面向GPU上扩散Transformer分布式推理的可扩展序列并行

Jiacheng Yang, Jun Wu, Yaoyao Ding, Zhiying Xu, Yida Wang, Gennady Pekhimenko

机构 * University of Toronto \&\ Institute Amazon University of Toronto \& Vector Institute \& NVIDIA

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 针对扩散Transformer推理中序列并行方法的通信和同步瓶颈,提出拓扑感知的StreamFusion引擎,通过Torus Attention和单边通信实现平均1.35倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频问答 1 篇

2605.19846 2026-05-26 cs.CV cs.AI cs.CL 57%

FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding

FineBench: 细粒度人类活动理解的视觉-语言模型基准测试与增强

Gueter Josmy Faure, Min-Hung Chen, Jia-Fong Yeh, Hung-Ting Su, Winston H. Hsu

机构 * National Taiwan University(国立台湾大学) Google(谷歌) Independent Researcher(独立研究员)

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

AI总结 针对视觉-语言模型在细粒度人类活动理解上的不足,提出包含密集标注的长视频问答基准FineBench和增强框架FineAgent。

Comments CVPR'26 (Workshop on Video Large Language Models). Project Page: https://joslefaure.github.io/assets/html/finebench.html

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 动作与事件理解 1 篇

2605.17543 2026-05-26 cs.CV cs.GR 57%

HL-OutPaint: Coarse-to-Fine Video Outpainting for High-Resolution Long-Range Videos

HL-OutPaint:面向高分辨率长范围视频的粗到细视频外绘

Jeongeun Park, Janghyeok Han, Geonung Kim, Hyun-Seung Lee, Kyuha Choi, Youngseok Han, Sunghyun Cho

机构 * POSTECH Visual Display Business, Samsung Electronics(三星电子视觉显示事业部)

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

AI总结 提出HL-OutPaint框架,采用粗到细两阶段流程,通过全局-局部帧交换机制构建全局粗引导,实现高分辨率长视频的大空间外推和时空一致生成。

Comments Supplementary material and video included. Project page: https://koyy001.github.io/Publications/hl-outpaint

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 长视频与时序推理 2 篇

2605.26014 2026-05-26 cs.CV cs.CL 79%

STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models

STORM: 视频语言模型中时空推理的内化建模

Yiming Liang, Yixiao Chen, Yiyang Zhou, Yixuan Wang, Shoubin Yu, Andong Deng, Fuxiao Liu, Qin Zhang, Chen Chen, Mohit Bansal, Huaxiu Yao

机构 * Purdue(普渡大学) Harvard(哈佛大学) UNC(北卡罗来纳大学教堂山分校) UCF(佛罗里达大学) NVIDIA(英伟达) Physion Labs(Physion 实验室)

专题命中 长视频与时序推理 :video-language(title);video reasoning(abstract);分类 cs.CV

AI总结 提出STORM框架,通过有界连续潜在轨迹内化推理过程,无需显式文本思维链或外部工具,提升视频推理准确性并降低推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25488 2026-05-26 cs.CV cs.AI cs.MM 62%

Test-Time Self-Adaptive Conditioning for Stable Audio-Driven Talking-Head Generation

测试时自适应条件用于稳定音频驱动说话头生成

Zhicheng Zhang, Lei Wang, Yu Zhang, Yongsheng Gao

机构 * School of Business, University of New South Wales (UNSW)(新南威尔士大学商学院) School of Engineering and Built Environment, Griffith University(格里菲斯大学工程与环境学院)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV、cs.MM

AI总结 提出一种无需参数训练的测试时自适应条件框架(TT-SAC),通过反馈循环调整条件表示,提升预训练说话头生成器的身份保持、时间一致性和感知质量。

Comments Research report

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 视频数据与评测 1 篇

2510.22973 2026-05-26 cs.CV 57%

Scaling Up Occupancy-centric Driving Scene Generation: Dataset and Method

扩展以占据为中心的驾驶场景生成:数据集与方法

Bohan Li, Xin Jin, Hu Zhu, Hongsi Liu, Ruikai Li, Jiazhe Guo, Kaiwen Cai, Chao Ma, Yueming Jin, Hao Zhao, Xiaokang Yang, Wenjun Zeng

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(东部技术研究院) School of Electronic Information and Electrical Engineering(电子信息与电气工程学院) Li Auto(力汽车) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生实验室) Ningbo Institute of Digital Twin(宁波数字孪生研究院)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 针对占据数据稀缺问题,构建最大语义占据数据集Nuplan-Occ,并提出统一框架联合生成高质量语义占据、多视角视频和LiDAR点云,采用时空解耦架构及高斯泼溅稀疏点图渲染和传感器感知嵌入策略,实现高保真生成。

Comments IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏