arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-05-13 至 2026-05-13 共收录 18 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 4 篇

2605.09598 2026-05-13 cs.CV 79%

SoccerLens: Grounded Soccer Video Understanding Beyond Accuracy

SoccerLens: 超越准确性的 grounded 球赛视频理解

Ismael Elsharkawi, Ahmed Sait, Silvio Giancola, Bernard Ghanem, Hossam Sharara, Abdelrahman Eldesokey

机构 * Department of Computer Science and Engineering, The American University in Cairo(美国亚历山大大学计算机科学与工程系) Image And Visual Understanding Lab (IVUL), KAUST(卡塔尔大学图像与视觉理解实验室)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出 SoccerLens 基准测试,评估球赛视频理解中视觉 grounding 的有效性,发现现有模型在准确率高但 grounding 表现差,揭示了时空复杂领域中 grounded 评估的重要性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06950 2026-05-13 cs.CV cs.CL 79%

READ: Recurrent Adapter with Partial Video-Language Alignment for Parameter-Efficient Transfer Learning in Low-Resource Video-Language Modeling

READ:基于部分视频-语言对齐的递归适配器用于低资源视频-语言建模的参数高效迁移学习

Thong Nguyen, Xiaobao Wu, Xinshuai Dong, Khoi Le, Zhiyuan Hu, Cong-Duy Nguyen, See-Kiong Ng, Luu Anh Tuan

专题命中 视频理解 :video-language(title,abstract);分类 cs.CV

AI总结 本文提出READ框架,通过递归计算和部分最优传输对齐,提升低资源视频-语言建模任务的性能,优于现有迁移学习方法。

Comments Accepted at AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12056 2026-05-13 cs.AI 75%

OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models

OmniRefine: 一种面向对齐的协作压缩方法以提高多模态大语言模型的效率

Yuchen Deng, Zidang Cai, Hai-Tao Zheng, Jie Wang, Feidiao Yang, Yuxing Han

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Pengcheng Laboratory(鹏城实验室)

专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);long video(abstract)

AI总结 本文提出OmniRefine,一种无需训练的两阶段框架,通过跨模态对齐和协作压缩提升多模态大语言模型的推理效率与性能稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11477 2026-05-13 cs.CV 57%

LDDR: Linear-DPP-Based Dynamic-Resolution Frame Sampling for Video MLLMs

LDDR:基于线性DPP的动态分辨率帧采样用于视频MLLMs

Jingfeng Chen, Jiawen Qian, Wendi Deng, Yinuo Guo, Jiaqi Yu, Sicong Leng, Raghuveer Thirukovalluru, Bhuwan Dhingra

机构 * Carnegie Mellon University(卡内基梅隆大学) Individual Researcher(个人研究员) National University Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Duke University(杜克大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出LDDR框架,通过任务条件特征空间中查询感知的DPP帧选择,在有限视觉token预算下提升视频理解,实现3倍速度提升,并通过组DPP重要性度量动态分配分辨率,优于现有基线方法。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 5 篇

2605.12480 2026-05-13 cs.CV cs.AI 79%

OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation

OmniNFT: 多模态联合音频视频生成的模态感知强化学习

Guohui Zhang, XiaoXiao Ma, Jie Huang, Hang Xu, Hu Yu, Siming Fu, Yuming Li, Zeyue Xue, Lin Song, Haoyang Huang, Nan Duan, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) JD Explore Academy(京东探索研究院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出OmniNFT,通过模态感知强化学习框架解决多模态联合生成中的模态一致性、梯度不平衡和信用分配问题,提升音频视频感知质量与同步性能。

Comments Project page: https://zghhui.github.io/OmniNFT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12038 2026-05-13 cs.CV 79%

OmniHumanoid: Streaming Cross-Embodiment Video Generation with Paired-Free Adaptation

OmniHumanoid: 流式跨躯体视频生成与配对自由适应

Yiren Song, Xiyao Deng, Pei Yang, Yihan Wang, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(展示实验室,新加坡国立大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出OmniHumanoid框架,通过分离可迁移运动学习与躯体特定适应,实现跨躯体视频生成,利用无配对视频进行适应,并通过分支隔离注意力设计提升运动与躯体适应的分离度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12198 2026-05-13 cs.CV 57%

Enhancing Domain Generalization in 3D Human Pose Estimation through Controllable Generative Augmentation

通过可控生成增强在3D人体姿态估计中的领域泛化

Xinhao Hu, Yiyi Zhang, Liqing Zhang, Jianfu Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出可控人体姿态生成框架,通过系统变化姿态、背景和摄像机视角合成多样化视频数据,增强训练集多样性,提升模型泛化能力,验证了在处理领域差异方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12167 2026-05-13 cs.RO cs.CV 57%

From Imagined Futures to Executable Actions: Mixture of Latent Actions for Robot Manipulation

从想象的未来到可执行的动作:用于机器人操作的潜在动作混合

Yajie Li, Bozhou Zhang, Chun Gu, Zipei Ma, Jiahui Zhang, Jiankang Deng, Xiatian Zhu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院) Imperial College London(伦敦帝国理工学院) University of Surrey(萨里大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出MoLA,一种面向控制的接口,将想象的未来视频转化为可执行的表示,通过混合预训练的逆动力学模型,提升机器人操作的稳定性和通用性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11363 2026-05-13 cs.CV cs.CL 57%

PresentAgent-2: Towards Generalist Multimodal Presentation Agents

PresentAgent-2: 向通用多模态展示代理迈进

Wei Wu, Ziyang Xu, Zeyu Zhang, Yang Zhao, Hao Tang

机构 * Peking University(北京大学) La Trobe University(拉特罗布大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 PresentAgent-2通过多模态资源收集与生成,实现基于用户查询的交互式展示视频生成,支持单人叙述、多人讨论及观众互动三种模式。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 4 篇

2605.11628 2026-05-13 cs.CV 83%

Single-Shot HDR Recovery via a Video Diffusion Prior

单次曝光HDR恢复通过视频扩散先验

Chinmay Talegaonkar, Jinshi He, Christopher McKenna, Nicholas Antipa

机构 * University of California San Diego(加州大学圣地亚哥分校) Creare LLC(Creare公司)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文提出通过视频扩散模型生成曝光序列并融合生成HDR图像,提升单次曝光HDR重建的保真度和可解释性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11424 2026-05-13 cs.CV 79%

VidSplat: Gaussian Splatting Reconstruction with Geometry-Guided Video Diffusion Priors

VidSplat:基于几何引导视频扩散先验的高斯点云重建

Jimin Tang, Wenyuan Zhang, Junsheng Zhou, Zian Huang, Kanle Shi, Shenkun Xu, Yu-Shen Liu, Zhizhong Han

机构 * School of Software, Tsinghua University(清华大学软件学院) Department of Computer Science, Wayne State University(韦恩州立大学计算机科学系)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 VidSplat通过几何引导的视频扩散先验,解决稀疏视图下3D场景重建问题,提出免训练生成框架,迭代合成新视角以恢复完整3D场景。

Comments Accepted by SIGGRAPH Conference 2026. Project Page: https://tangjm24.github.io/VidSplat

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11869 2026-05-13 cs.CV cs.LG 70%

FIS-DiT: Breaking the Few-Step Video Inference Barrier via Training-Free Frame Interleaved Sparsity

FIS-DiT:通过无训练帧交错稀疏性打破视频推断的少步障碍

Jian Tang, Jiawei Fan, Qingbin Liu, Zheng Wei

机构 * Platform and Content Group, Tencent(腾讯平台与内容组)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出FIS-DiT,通过将优化重点从时间轨迹转向潜在帧维度,解决少步推断中特征复用和预测建模受限的问题,实现2.11-2.41倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12431 2026-05-13 cs.CV 57%

GaitProtector: Impersonation-Driven Gait De-Identification via Training-Free Diffusion Latent Optimization

GaitProtector: 通过无训练扩散潜在优化实现基于伪装的步态去标识

Huiran Duan, Qian Zhou, Zhongliang Guo, Junhao Dong, Yuqi Li, Guoying Zhao, Yingli Tian

机构 * City University of New York(纽约城市大学) Wuhan University(武汉大学) University of Aberdeen(阿伯丁大学) Nanyang Technological University(南洋理工大学) ELLIS Institute Finland(芬兰ELLIS研究所) University of Oulu(奥卢大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出GaitProtector框架,通过无训练扩散潜在优化实现基于伪装的步态去标识,通过伪装和伪装两个紧密耦合组件,在保持主导身体形状和运动动态的同时减少识别准确率。

Comments Accepted to the 20th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 动作与事件理解 1 篇

2501.02955 2026-05-13 cs.CV 57%

MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models

MotionBench: 视觉语言模型视频细粒度运动理解的基准测试与改进

Wenyi Hong, Yean Cheng, Zhuoyi Yang, Weihan Wang, Lefan Wang, Xiaotao Gu, Shiyu Huang, Yuxiao Dong, Jie Tang

机构 * Tsinghua University(清华大学) Zhipu AI(智谱AI)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 MotionBench针对视觉语言模型在细粒度视频运动理解方面的不足,提出综合评估基准,通过六类运动导向问题类型评估模型运动层面感知能力,并提出Through-Encoder融合方法提升模型对有限序列长度内细粒度运动的感知。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 1 篇

2605.12496 2026-05-13 cs.CV 57%

CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives

CausalCine:多镜头视频叙事的实时自回归生成

Yihao Meng, Zichen Liu, Hao Ouyang, Qiuyu Wang, Ka Leong Cheng, Yue Yu, Hanlin Wang, Haobo Li, Jiapeng Zhu, Yanhong Zeng, Xing Zhu, Yujun Shen, Qifeng Chen, Huamin Qu

机构 * HKUST(香港科技大学) Ant Group(蚂蚁集团) SJTU(上海交通大学)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 CausalCine通过自回归框架实现多镜头视频生成,通过动态提示和记忆路由保持跨镜头连贯性,优于现有自回归模型,实现实时交互生成。

Comments Project page: https://yihao-meng.github.io/CausalCine/

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 视频数据与评测 2 篇

2605.12074 2026-05-13 cs.CV 57%

BARISTA: A Multi-Task Egocentric Benchmark for Compositional Visual Understanding

BARISTA:一种多任务第一人称视角基准,用于组合视觉理解

Patrick Knab, Orgest Xhelili, Inis Buzi, Drago Andres Guggiana Nilo, Mohd Saquib Khan, Lorenz Kolb, Manuel Scherzer, Kerem Yildirir, Christian Bartelt, Philipp Johannes Schubert

机构 * Ramblr.ai Research(Ramblr.ai 研究院) Technical University of Clausthal(Clausthal 技术大学)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 BARISTA通过185个真实世界咖啡制作视频,提供密集标注的数据集,涵盖全自动、手冲和胶囊式流程,用于评估场景理解中的多任务能力,揭示任务家族间强变化及无主导模型家族。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09904 2026-05-13 cs.CV 57%

TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models

TOC-Bench:一个用于视频大语言模型的时序物体一致性基准

Junzhe Chen, Siyuan Meng, Yuxi Chen, Man Zhao, Wenyao Gui, Xiaojie Guo

机构 * Tianjin University(天津大学)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 TOC-Bench旨在评估视频大语言模型的时序物体一致性,通过设计三层时序必要性过滤协议,筛选出17900个时间依赖项,构建了包含2323个高质量问答对的基准,揭示了模型在事件计数、事件排序等任务上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他视频模型 1 篇

2406.05615 2026-05-13 cs.CL 79%

Video-Language Understanding: A Survey from Model Architecture, Model Training, and Data Perspectives

视频-语言理解:从模型架构、模型训练和数据视角的综述

Thong Nguyen, Yi Bin, Junbin Xiao, Leigang Qu, Yicong Li, Jay Zhangjie Wu, Cong-Duy Nguyen, See-Kiong Ng, Luu Anh Tuan

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 其他视频模型 :video-language(title,abstract)

AI总结 本文综述了视频-语言理解系统的关键任务与挑战,从模型架构、训练和数据角度总结方法,并比较性能,探讨未来研究方向。

Comments Accepted at ACL 2024 (Findings). Code is available at https://github.com/nguyentthong/video-language-understanding

详情

展开后加载摘要…

URL PDF HTML 收藏