arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-05-25 至 2026-05-25 共收录 21 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2602.07801 2026-05-25 cs.CV cs.AI 83%

VideoTemp-o3: Harmonizing Temporal Grounding and Video Understanding in Agentic Thinking-with-Videos

VideoTemp-o3:在智能视频思考中协调时间定位与视频理解

Wenqi Liu, Yunxiao Wang, Shijie Ma, Meng Liu, Qile Su, Tianke Zhang, Haonan Fan, Changyi Liu, Kaiyu Jiang, Jiankang Chen, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Yinwei Wei, Xuemeng Song

机构 * Shandong University(山东大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beihang University(北航) Southern University of Science and Technology(南方科技大学)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 提出VideoTemp-o3统一框架,通过联合建模视频定位与问答、设计统一掩码机制和专用奖励,解决长视频理解中采样效率低、定位弱和工作流僵化问题。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22907 2026-05-25 cs.CV 83%

VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding

VideoOdyssey: 超长上下文与全模态视频理解基准

Haichen He, Jiayi Zhou, Sifeng Shang, Yihan Hu, Yuanhan Zhang, Kaiyang Zhou

机构 * Hong Kong Baptist University(香港 Baptist 大学) S-Lab, Nanyang Technological University(S 实验室,南洋理工大学) GVC Lab, Great Bay University(GVC 实验室,Great Bay 大学)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 提出VideoOdyssey基准,通过连续证书长度度量认知负荷,评估多模态大模型在超长视频(平均109分钟)上的连续跟踪、信息整合与记忆能力,涵盖视觉与音视频双模态,揭示模型在长上下文推理、细粒度感知和非语言全模态理解上的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 11 篇

2605.23903 2026-05-25 cs.CV 79%

Geo-Align: Video Generation Alignment via Metric Geometry Reward

Geo-Align: 通过度量几何奖励实现视频生成对齐

Zizun Li, Haoyu Guo, Runzhe Teng, Chunhua Shen, Tong He

机构 * USTC(中国科学技术大学) Shanghai AI Lab(上海人工智能实验室) ZJU(浙江大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出首个基于强化学习的框架Geo-Align,通过度量3D估计器提取相机轨迹并惩罚偏差,利用真实条件视频和合成目标轨迹消除配对数据依赖,提升相机控制精度和视觉保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23878 2026-05-25 cs.CV 79%

LaMo: Self-Supervised Latent Motion Priors for Physical Realism in Video Generation

LaMo: 视频生成中物理真实性的自监督潜在运动先验

Bo Jiang, Depu Meng, Yihan Hu, Yichen Xie, Tianshuo Xu, Wei Zhan

机构 * Applied Intuition University of California, Berkeley(加州大学伯克利分校)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 提出LaMo,通过自监督方式从无标签视频中提取运动先验,包括宏运动漂移损失和微运动场引导,无需外部监督即可提升视频扩散模型的物理一致性。

Comments Project Page: https://lamo-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23610 2026-05-25 cs.CV cs.AI 79%

EM-Vid: Training-Free Entity-Centric Memory for Efficient and Consistent Multi-Shot Video Generation

EM-Vid:无需训练的以实体为中心的记忆,用于高效且一致的多镜头视频生成

Jente Vandersanden, Matheus Gadelha, Chun-Hao P. Huang, Hyeonho Jeong, Yulia Gryaditskaya

机构 * Max Planck Institute for Informatics(马克斯·普朗克研究所) Adobe Research(Adobe研究)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出一种以实体为中心的潜在补丁记忆机制,通过稀疏令牌条件化和预算更新策略,实现多镜头视频生成中实体外观一致性与计算效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23458 2026-05-25 cs.CV cs.AI 79%

One-Forcing: Towards Stable One-Step Autoregressive Video Generation

One-Forcing: 迈向稳定的一步自回归视频生成

Jiaqi Feng, Justin Cui, Yuanhao Ban, Cho-Jui Hsieh

机构 * Tsinghua University(清华大学) UCLA(加州大学洛杉矶分校)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 针对现有少步自回归视频生成方法在一步设置下质量严重下降的问题,提出One-Forcing方法,通过向DMD目标添加辅助GAN损失,实现高质量高效的一步视频生成,在VBench上达到83.76总分,成为一步因果视频生成中的最优方法。

Comments Work in Progress. Project Page: https://aurora-edu.github.io/one-forcing/, Code: https://github.com/Aurora-edu/One-Forcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23445 2026-05-25 cs.CV 79%

DFSAttn: Dynamic Fine-grained Sparse Attention for Efficient Video Generation

DFSAttn:面向高效视频生成的动态细粒度稀疏注意力

Jie Hu, Zixiang Gao, Yutong He, Kun Yuan

机构 * Peking University(北京大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 针对扩散变换器中注意力二次复杂度导致计算成本高的问题,提出一种无需训练的稀疏注意力框架DFSAttn,通过希尔伯特曲线重排序、分层块评分和稀疏掩码缓存实现动态细粒度稀疏化,在保持生成质量的同时实现高达2.1倍端到端加速。

Comments ICML 2026; 17 pages, 8 figures;

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23271 2026-05-25 cs.CV cs.AI 79%

EvalVerse: Pipeline-Aware and Expert-Calibrated Benchmarking for Professional Cinematic Video Generation

EvalVerse:面向专业电影级视频生成的流水线感知与专家校准基准测试

Songlin Yang, Haobin Zhong, Ruilin Zhang, Xiaotong Zhao, Shuai Li, Kai Zheng, Xuyi Yang, Zhe Wang, Zhenchen Tang, Yang Li, Bohai Gu, Zhengwei Peng, Yidan Huang, Mengzhou Luo, Yihang Bo, Dalu Feng, Yujia Zhang, Juntao Ma, Ruiqi Wang, Lvmin Zhang, Yuwei Guo, Frank Guan, Maneesh Agrawala, Hongbo Fu, Alan Zhao, Anyi Rao

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Tencent(腾讯) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Film Academy(北京电影学院) Stanford University(斯坦福大学) The Chinese University of Hong Kong(香港中文大学) Singapore Institute of Technology(新加坡理工学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出EvalVerse框架,通过将电影制作专业知识系统化为评估分类法、构建专家标注数据集并微调视觉语言模型进行链式推理,解决了现有基准忽视电影质量、缺乏领域特异性指标的问题,实现了对生成视频“正确性”与“优良性”的全面评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22996 2026-05-25 cs.CV 79%

CoMoGen: COntrollable MOtion Dynamics and Interactions with Mask-Guided Video GENeration

CoMoGen: 基于掩码引导的视频生成的可控运动动力学与交互

Adil Meric, Lin Geng Foo, Mert Kiray, Benjamin Busam, Rishabh Dabral, Christian Theobalt

机构 * Technical University of Munich(慕尼黑技术大学) Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息研究所,萨尔兰信息校园) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Obsphera

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出CoMoGen框架,通过轻量级MaskAdapter将二进制掩码序列编码为潜在残差信号注入MMDiT模型,并利用LoRA微调运动层,实现从单张图像和掩码序列生成逼真的交互运动,在运动保真度和感知真实性上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23891 2026-05-25 cs.CV 57%

Smart-Insertion-V: Photorealistic Video Insertion via a Closed-Loop Feedback Dual-Stream Framework

Smart-Insertion-V: 通过闭环反馈双流框架实现逼真的视频插入

Xiao Cao, Yansong Qu, Xiangzhen, Chang, Wen Xiao, Jiakui Hu, Heyuan Li, Jialun Liu, Zhiyong Huang, Xuelong Li

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出一种端到端双流框架Smart-Insertion-V,通过闭环反馈机制和双世界视角旋转位置编码解决参考对象与源视频风格域差异大的问题,实现无需掩码的逼真视频对象插入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18214 2026-05-25 cs.CV 57%

EgoInteract: Synthetic Egocentric Videos Generation for Interaction Understanding and Anticipation

EgoInteract: 用于交互理解和预测的合成自我中心视频生成

Rosario Leonardi, Francesco Ragusa, Daniele Materia, Alessandro Passanisi, James Fort, Jakob Engel, Giovanni Maria Farinella

机构 * Department of Mathematics and Computer Science, University of Catania(卡塔尼亚大学数学与计算机科学系) Next Vision s.r.l.(Next Vision公司) Reality Labs Research, Meta(Meta现实实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出EgoInteract可控模拟器,生成带密集时空标注的合成自我中心视频,用于动作分割、下一活动物体检测、交互预测和手物交互检测,在多个真实基准上提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23381 2026-05-25 cs.CV 57%

VDE: Training-Free Accelerating Rectified Flow Model via Velocity Decomposition and Estimation

VDE: 通过速度分解与估计实现无训练加速整流流模型

Junwen Tan, Jinglin Liang, Hongyuan Chen, Shuangping Huang

机构 * South China University of Technology(华南理工大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出速度分解与估计(VDE)方法,通过将模型速度分解为平行和正交分量并利用其时间可预测性和方向稳定性进行输入自适应估计,无需训练即可加速整流流模型,在图像和视频生成任务中实现显著加速且视觉质量损失极小。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05202 2026-05-25 cs.CV 57%

GT-SVJ: Generative-Transformer-Based Self-Supervised Video Judge For Efficient Video Reward Modeling

GT-SVJ: 基于生成式Transformer的自监督视频评判器用于高效视频奖励建模

Shivanshu Shekhar, Uttaran Bhattacharya, Raghavendra Addanki, Mehrab Tanjim, Somdeb Sarkhel, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Adobe Inc.(Adobe公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出GT-SVJ,通过将视频生成模型重新用作能量模型,并利用对比目标训练,实现高效、时间感知的视频质量评估,在少量标注下达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 3 篇

2605.23245 2026-05-25 cs.CV cs.AI 57%

SimInsert: Seamless Video Object Insertion via Regional Sparse Attention Fusion

SimInsert: 通过区域稀疏注意力融合实现无缝视频对象插入

Xinyu Chen, Yuyi Qian, Jiang Lin, Shenyi Wang, Gao Wang, Zhiqiu Zhang, Jizhi Zhang, Mingjie Wang, Qiang Tang, Qian Wang, Song Wu, Zili Yi

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院,南京大学) JIUTIAN Research(JIUTIAN研究机构) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) Zhejiang Sci-Tech University(浙江科技学院) The University of British Columbia(不列颠哥伦比亚大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出SimInsert,一种无需训练的视频对象插入方法,利用图像到视频扩散模型的先验和区域稀疏注意力融合,实现时空一致和交互真实感,在PSNR、SSIM和LPIPS上分别提升18.8%、20.1%和降低44.1%。

Comments Accepted by ICME2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00948 2026-05-25 cs.CV 57%

InfVSR: Toward Consistency-Driven Streaming Generative Video Super-Resolution

InfVSR:迈向一致性驱动的流式生成视频超分辨率

Ziqing Zhang, Kai Liu, Zheng Chen, Xi Li, Yucong Chen, Bingnan Duan, Linghe Kong, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出InfVSR,通过自回归单步扩散范式与流式推理,实现长视频的高效、一致超分辨率,速度提升达58倍。

Comments Code and model are available at https://github.com/Kai-Liu001/InfVSR

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17119 2026-05-25 cs.LG cs.AI 50%

Diffusion and Flow Matching Models for Tabular Data: A Survey

表格数据的扩散与流匹配模型:综述

Zhong Li, Qi Huang, Lincen Yang, Jiayang Shi, Zhao Yang, Niki van Stein, Thomas Bäck, Matthijs van Leeuwen

机构 * Great Bay University(大湾大学) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) LIACS, Leiden University(莱顿大学LIACS)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 本文系统综述了扩散模型和流匹配模型在表格数据生成、缺失值填补、可信数据生成和异常检测等任务中的应用,分析了数据工程挑战、设计选择、评估维度及开放问题。

Comments We substantially updated the previous version "Diffusion Models for Tabular Data: Challenges, Current Progress, and Future Directions" by including flow matching models for tabular data

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 动作与事件理解 2 篇

2605.23428 2026-05-25 cs.CV cs.MM 62%

FAST-ME: Foundation-aware Adaptive Stopping for Motion Estimation for Efficient IoT Video Analysis

FAST-ME:面向高效物联网视频分析的基于基础模型的自适应运动估计停止方法

Kakia Panagidi, Stathes Hadjieftymiadis

机构 * Department of Informatics \& Telecommunications National Kapodistrian University of Athens Athens, Greece

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 提出一种基于最优停止理论和基础模型(如ViT和SAM)的语义感知运动估计框架,通过融合语义注意力分数与失真度量实现自适应停止,在降低计算量的同时保持精度和语义覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23355 2026-05-25 cs.CV cs.LG cs.MM 62%

Decoupling Spatio-Temporal Adapter for Fine-Grained Badminton Action Localization

解耦时空适配器用于细粒度羽毛球动作定位

Tianyu Wang, Junjie Wu, Jingquan Gao, Shishuo Li

机构 * School of Economics and Management, Beihang University(北京航空航天大学经济管理学院) Key Laboratory of Data Intelligence and Management, Beihang University, Ministry of Industry and Information Technology(信息产业部北京航空航天大学数据智能与管理重点实验室)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 针对细粒度羽毛球动作定位中复杂的时空动态,提出解耦时空适配器(DSTA),通过三个并行分支分别建模时间动态、垂直和水平空间变化,在Fine-Badminton数据集和ShuttleSet基准上实现最优性能且计算开销极小。

Comments 11 pages, 11figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 2 篇

2605.23508 2026-05-25 cs.GR cs.AI cs.CV cs.MM eess.IV 87%

DrawVideo: Generating Long Video from Storyboard Keyframe Sketches

DrawVideo: 从故事板关键帧草图生成长视频

Chuanzhi Xu, Huiqi Liang, Bang Shi, Huiming Zhang, Yifan Xiao, Guangcheng Lin, Haodong Chen, Qiang Qu, Zhicheng Lu, Weidong Cai

机构 * The University of Sydney(悉尼大学) Charles Sturt University(查尔斯·斯特劳特大学)

专题命中 长视频与时序推理 :long video(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV、eess.IV、cs.MM

AI总结 提出 DrawVideo 框架,通过草图引导的故事板分解长视频为可控镜头,结合分层生成策略实现结构可控、外观一致的长视频生成。

Comments 45 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06094 2026-05-25 cs.CV cs.AI 83%

VISD: Enhancing Video Reasoning via Structured Self-Distillation

VISD: 通过结构化自蒸馏增强视频推理

Hao Lin, Kunyang Lv, Xu Jiang, Jingqi Tian, Zhongjing Du, Jiayu Ding, Qiaoman Zhang, Hongbo Jin

机构 * HUST(华中科技大学) Wuhan University(武汉大学) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 长视频与时序推理 :video reasoning(title,abstract);long video(abstract);分类 cs.CV

AI总结 提出VISD框架,利用结构化自蒸馏和方向-幅度解耦机制,实现细粒度信用分配,提升视频推理准确性和训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 视频数据与评测 1 篇

2605.23237 2026-05-25 cs.CV 57%

StereoGenBench: A Synthetic Multi-Camera Benchmark for Stereo Generation under Controlled Baseline Regimes

StereoGenBench:一种用于受控基线条件下立体生成的合成多相机基准

Yangzhi Cui, Feng Qiao, Nathan Jacobs

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 提出一个合成多相机基准StereoGenBench,通过可控基线、内参、深度和姿态,实现立体生成中基线灵敏度与目标相机一致性的可测量评估。

详情

展开后加载摘要…

URL PDF HTML 收藏