arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-14 至 2026-04-14 共收录 22 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 7 篇

2604.10060 2026-04-14 cs.PF 82%

Mosaic: Cross-Modal Clustering for Efficient Video Understanding

Mosaic:用于高效视频理解的跨模态聚类

Tuowei Wang, He Zhou, Chengru Song, Qiushi Li, Ju Ren

专题命中 视频理解 :video understanding(title,abstract);video reasoning(abstract)

AI总结 Mosaic是首个针对流式长视频理解的跨模态聚类驱动VLM推理系统,通过优化KVCache管理实现1.38倍速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17574 2026-04-14 cs.CV cs.AI 79%

HumanVBench: Probing Human-Centric Video Understanding in MLLMs with Automatically Synthesized Benchmarks

HumanVBench: 通过自动合成基准测试探测多模态大语言模型中的以人为本的视频理解

Ting Zhou, Daoyuan Chen, Qirui Jiao, Bolin Ding, Yaliang Li, Ying Shen

机构 * Sun Yat-Sen University(中山大学) Alibaba Group(阿里巴巴集团) Peng Cheng Laboratory(鹏城实验室) Guangdong Provincial Key Laboratory of Fire Science and Intelligent Emergency Technology(广东省消防科学与智能应急技术重点实验室)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出HumanVBench,一个针对多模态大语言模型(MLLMs)中以人为本的视频理解能力的综合基准测试,通过自动化流程生成高质量视频注释和挑战性问题,揭示30个领先MLLMs在感知细微情绪和对齐语音与视觉线索方面的不足。

Comments Accepted as a conference paper at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24329 2026-04-14 cs.CL cs.AI cs.CV 79%

GameplayQA: A Benchmarking Framework for Decision-Dense POV-Synced Multi-Video Understanding of 3D Virtual Agents

GameplayQA: 一种用于3D虚拟代理多视频理解的决策密集型视角同步评估框架

Yunzhe Wang, Runhui Xu, Kexin Zheng, Tianyi Zhang, Jayavibhav Niranjan Kogundi, Soham Hans, Volkan Ustun

机构 * University of Southern California(南加州大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 GameplayQA通过密集标注多玩家3D游戏视频,构建了2.4K诊断QA对,评估代理感知与推理能力,揭示了前沿MLLM在时间同步、跨视频定位及决策密度处理上的不足。

Comments Accepted to the Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11637 2026-04-14 cs.CV 74%

STS-Mixer: Spatio-Temporal-Spectral Mixer for 4D Point Cloud Video Understanding

STS-Mixer:用于4D点云视频理解的时空频混合器

Wenhao Li, Xueying Jiang, Gongjie Zhang, Xiaoqin Zhang, Ling Shao, Shijian Lu

机构 * Nanyang Technological University(南洋理工大学) Alibaba Group(阿里巴巴集团) Zhejiang University of Technology(浙江工业大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视频理解 :video understanding(title);分类 cs.CV

AI总结 本文提出STS-Mixer框架,通过将4D点云视频转换为图谱信号,结合时空与频域信息,提升对4D点云视频的几何结构和时间动态的理解。

Comments Accepted by CVPR 2026, Open Sourced

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11102 2026-04-14 cs.CV cs.MM 62%

OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video

OmniScript: 向长篇影视视频的音频-视觉脚本生成迈进

Junfu Pu, Yuxin Chen, Teng Wang, Ying Shan

机构 * ARC Lab, Tencent(腾讯ARC实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 本文提出视频到脚本任务,介绍OmniScript模型,通过渐进式训练在长篇叙事理解中实现高效脚本生成,优于开源模型并接近专有模型。

Comments Project Page: https://arcomniscript.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09547 2026-04-14 cs.CV 57%

Tango: Taming Visual Signals for Efficient Video Large Language Models

Tango:驯服视觉信号以提高视频大语言模型的效率

Shukang Yin, Sirui Zhao, Hanchao Wang, Baozhi Jia, Xianquan Wang, Chaoyou Fu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Reconova AI Lab(Reconova AI实验室) Nanjing University(南京大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 Tango通过改进注意力选择和相似性聚类方法,优化视频大语言模型的视觉信号利用,实现在保留10%视频token时性能损失仅0.1%,推理速度提升1.88倍。

Comments Code: https://github.com/xjtupanda/Tango

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05564 2026-04-14 cs.CV 57%

ProPhy: Progressive Physical Alignment for Dynamic World Simulation

ProPhy:渐进式物理对齐用于动态世界模拟

Zijun Wang, Panwen Hu, Jing Wang, Terry Jingchen Zhang, Yuhao Cheng, Long Chen, Yiqiang Yan, Zutao Jiang, Hanhui Li, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Peng Cheng Laboratory(鹏城实验室) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ETH Zürich(苏黎世联邦理工学院) Lenovo Research(联想研究院)

专题命中 视频理解 :video generation(abstract);分类 cs.CV

AI总结 ProPhy通过渐进式物理对齐框架,实现物理感知的视频生成,提升动态物理现象的准确性与物理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 8 篇

2604.10030 2026-04-14 cs.CV 83%

Prompt Relay: Inference-Time Temporal Control for Multi-Event Video Generation

提示中继:多事件视频生成的推理时时间控制

Gordon Chen, Ziqi Huang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出Prompt Relay方法,通过在交叉注意力机制中引入惩罚项,实现多事件视频生成中的细粒度时间控制,提升文本-视频对齐和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11788 2026-04-14 cs.CV 79%

HDR Video Generation via Latent Alignment with Logarithmic Encoding

通过潜变量对齐与对数编码实现HDR视频生成

Naomi Ken Korem, Mohamed Oumoumad, Harel Cain, Matan Ben Yosef, Urska Jelercic, Ofir Bibi, Yaron Inger, Or Patashnik, Daniel Cohen-Or

机构 * Lightricks Gear Productions Tel Aviv University(特拉维夫大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出通过利用预训练生成模型的视觉先验,采用对数编码实现HDR视频生成,无需重新训练编码器,通过轻量微调即可实现高质量HDR视频生成。

Comments https://HDR-LumiVid.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06964 2026-04-14 cs.CV 79%

Adversarial Video Promotion Against Text-to-Video Retrieval

对抗性视频推广对抗文本到视频检索

Qiwei Tian, Chenhao Lin, Zhengyu Zhao, Qian Li, Shuai Liu, Chao Shen

机构 * Xi'an Jiaotong University(西安交通大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出首个对抗性视频推广攻击,通过改进的模态细化方法提升黑盒转移能力,实验显示在多种场景下攻击效果显著,揭示了文本到视频检索的潜在漏洞。

Comments This paper has been accepted by TIFS

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01264 2026-04-14 cs.RO cs.AI 78%

LLM-based Realistic Safety-Critical Driving Video Generation

基于LLM的现实安全关键驾驶视频生成

Yongjie Fu, Ruijian Zha, Pei Tian, Xuan Di

机构 * Department of Civil Engineering and Engineering Mechanics, Columbia University(哥伦比亚大学土木工程与工程力学系) Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系)

专题命中 视频生成 :video generation(title,abstract)

AI总结 本文提出利用LLM生成少样本代码实现安全关键驾驶场景生成,结合CARLA模拟器与Cosmos-Transfer1和ControlNet生成真实驾驶视频,提升自动驾驶测试效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10837 2026-04-14 cs.CV 74%

Immune2V: Image Immunization Against Dual-Stream Image-to-Video Generation

Immune2V: 图像免疫对抗双流图像到视频生成

Zeqian Long, Ozgur Kara, Haotian Xue, Yongxin Chen, James M. Rehg

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 针对图像到视频生成中对抗性攻击的鲁棒性问题,提出Immune2V框架,通过时间平衡的潜在差异和预计算的崩溃诱导轨迹提升防御效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11792 2026-04-14 cs.CV 57%

LottieGPT: Tokenizing Vector Animation for Autoregressive Generation

LottieGPT:为自回归生成设计向量动画的标记化

Junhao Chen, Kejun Gao, Yuehan Cui, Mingze Sun, Mingjin Chen, Shaohui Wang, Xiaoxiao Long, Fei Ma, Qi Tian, Ruqi Huang, Hao Zhao

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) AIR, Tsinghua University(清华大学人工智能研究院) BAAI(百度人工智能研究院) The Hong Kong Polytechnic University(香港理工大学) Nanjing University(南京大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳))

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出首个向量动画标记化与自回归生成框架,基于Lottie标准设计标记器并构建大规模数据集,通过微调Qwen-VL生成可编辑的向量动画。

Comments Accepted by CVPR 2026. Project Page: https://lottiegpt.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20654 2026-04-14 cs.CV cs.AI 57%

AccidentSim: Generating Vehicle Collision Videos with Physically Realistic Collision Trajectories from Real-World Accident Reports

AccidentSim: 从真实世界事故报告生成具有物理真实碰撞轨迹的车辆碰撞视频

Xiangwen Zhang, Qian Zhang, Longfei Han, Qiang Qu, Xiaoming Chen, Weidong Cai

机构 * School of Computer and Artificial Intelligence, Beijing Technology and Business University(北京工商大学计算机与人工智能学院) The University of Sydney(悉尼大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 AccidentSim通过提取事故报告中的物理信息生成真实碰撞视频,结合物理模拟和NeRF技术提升视觉与物理真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10367 2026-04-14 cs.AI cs.SD 50%

Beyond Monologue: Interactive Talking-Listening Avatar Generation with Conversational Audio Context-Aware Kernels

超越独白:基于对话音频上下文感知核的交互式谈话-倾听虚拟角色生成

Yuzhe Weng, Haotian Wang, Xinyi Yu, Xiaoyan Wu, Haoran Xu, Shan He, Jun Du

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK(科大讯飞)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出基于对话音频上下文感知核的交互式虚拟角色生成方法,通过引入多头高斯核解决谈话与倾听行为的时间尺度差异问题,构建了能同时处理双流音频输入的全双工虚拟代理,并在VoxHear数据集上验证了其在生成自然响应的全双工数字人类方面的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 1 篇

2604.11331 2026-04-14 cs.CV cs.CG 57%

Any 3D Scene is Worth 1K Tokens: 3D-Grounded Representation for Scene Generation at Scale

任何3D场景都值得1000个标记:面向大规模场景生成的3D grounded表示

Dongxu Wei, Qi Xu, Zhiqi Li, Hangning Zhou, Cong Qiu, Hailong Qin, Mu Yang, Zhaopeng Cui, Peidong Liu

机构 * Westlake University(西湖大学) Afari Intelligent Drive(阿法里智能驾驶) Zhejiang University(浙江大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出在隐式3D潜在空间中直接生成3D场景,解决传统2D方法在3D空间扩展中的不足,通过3DRAE和3DDiT实现高效且一致的3D生成。

Comments Under Review. Project Page: https://wswdx.github.io/3DRAE

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 动作与事件理解 1 篇

2604.11135 2026-04-14 cs.RO cs.LG 50%

AIM: Intent-Aware Unified world action Modeling with Spatial Value Maps

AIM: 基于意图的统一世界动作建模与空间价值图

Liaoyuan Fan, Zetian Xu, Chen Cao, Wenyao Zhang, Mingqi Yuan, Jiayu Chen

机构 * INFIFORCE Intelligent Technology Co., Ltd.(英飞睿智科技有限公司) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 动作与事件理解 :video generation(abstract)

AI总结 AIM通过显式空间接口解决视频模型与动作生成间的结构不匹配问题,利用预训练视频生成模型和意图因果注意力机制,实现高成功率的机器人控制。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 2 篇

2604.07209 2026-04-14 cs.CV 57%

INSPATIO-WORLD: A Real-Time 4D World Simulator via Spatiotemporal Autoregressive Modeling

INSPATIO-WORLD:通过时空自回归建模实现实时4D世界模拟器

InSpatio Team, Donghui Shen, Guofeng Zhang, Haomin Liu, Haoyu Ji, Hujun Bao, Hongjia Zhai, Jialin Liu, Jing Guo, Nan Wang, Siji Pan, Weihong Pan, Weijian Xie, Xianbin Liu, Xiaojun Xiang, Xiaoyu Zhang, Xinyu Chen, Yifu Wang, Yipeng Chen, Zhenzhou Fan, Zhewen Le, Zhichao Ye, Ziqiang Zhao

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 本文提出INSPATIO-WORLD框架,通过时空自回归模型实现从单帧视频恢复和生成高保真动态交互场景,解决空间一致性和实时交互难题,实现在WorldScore-Dynamic基准中领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08995 2026-04-14 cs.CV 57%

Matrix-Game 3.0: Real-Time and Streaming Interactive World Model with Long-Horizon Memory

矩阵游戏3.0:具有长时程记忆的实时和流式交互世界模型

Zile Wang, Zexiang Liu, Jiaxing Li, Kaichen Huang, Baixin Xu, Fei Kang, Mengyin An, Peiyu Wang, Biao Jiang, Yichen Wei, Yidan Xietian, Jiangbo Pei, Liang Hu, Boyi Jiang, Hua Xue, Zidong Wang, Haofeng Sun, Wei Li, Wanli Ouyang, Xianglong He, Yang Liu, Yangguang Li, Yahui Zhou

机构 * Skywork AI(天工AI)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 矩阵游戏3.0通过改进数据、模型和推理方法,实现了720p实时长视频生成,支持长时程时空一致性,提升了生成效率和质量。

Comments Project page: https://matrix-game-v3.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 视频数据与评测 3 篇

2511.18957 2026-04-14 cs.CV 57%

Eevee: Towards Close-up High-resolution Video-based Virtual Try-on

Eevee:迈向基于视频的高分辨率虚拟试衣

Jianhao Zeng, Yancheng Bai, Ruidong Chen, Xuanpu Zhang, Lei Sun, Dongyang Jin, Ryan Xu, Nannan Zhang, Dan Song, Xiangxiang Chu

机构 * Amap, Alibaba Group(高德,阿里巴巴集团) Tianjin University(天津大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 本文提出高分辨率视频虚拟试衣数据集,解决现有方法在真实纹理细节捕捉和近距离视频生成上的不足,引入VGID指标评估服装一致性,提升虚拟试衣的真实感和细节保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10127 2026-04-14 cs.CV cs.AI 57%

VGA-Bench: A Unified Benchmark and Multi-Model Framework for Video Aesthetics and Generation Quality Evaluation

VGA-Bench:一个统一的基准和多模型框架用于视频审美和生成质量评估

Longteng Jiang, DanDan Zheng, Qianqian Qiao, Heng Huang, Huaye Wang, Yihang Bo, Bao Peng, Jingdong Chen, Jun Zhou, Xin Jin

机构 * Ant Group(蚂蚁集团) Beijing Film Academy(北京电影学院) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,北京通用人工智能研究院)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 本文提出VGA-Bench,通过三层次分类体系,结合1016个多样化提示生成60000+视频数据集,设计多任务神经评估器,实现视频生成质量与审美质量的系统评估。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10014 2026-04-14 cs.CV cs.AI cs.CL 57%

Demographic and Linguistic Bias Evaluation in Omnimodal Language Models

多模态语言模型中的人口和语言偏差评估

Alaa Elobaid

机构 * Freie Universität Berlin(柏林自由大学)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 本文评估了多模态语言模型中的人口和语言偏差,通过不同任务揭示图像和视频理解任务在人口差异上表现更优,而音频理解任务存在显著偏差和预测崩溃。

Comments Accepted at ICPR 2026. Full paper with complete appendix (31 pages total)

详情

展开后加载摘要…

URL PDF HTML 收藏