arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-07 至 2026-04-07 共收录 25 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 4 篇

2604.03697 2026-04-07 cs.CV 79%

SGTA: Scene-Graph Based Multi-Modal Traffic Agent for Video Understanding

基于场景图的多模态交通代理:视频理解的模块化框架

Xingcheng Zhou, Mingyu Liu, Walter Zimmer, Jiajie Zhang, Alois Knoll

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 SGTA结合结构化场景图与多模态推理,通过检测、跟踪和车道提取构建交通场景图,并利用ReAct处理大语言模型的推理轨迹,实现复杂视频问题的可解释决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00318 2026-04-07 cs.CV 79%

Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning

链式帧:通过帧感知推理推进多模态大语言模型的视频理解

Sara Ghazanfari, Francesco Croce, Nicolas Flammarion, Prashanth Krishnamurthy, Farshad Khorrami, Siddharth Garg

机构 * New York University(纽约大学) EPFL(瑞士联邦理工学院洛桑分校)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出一种单阶段视频LLM,通过显式引用相关帧减少推理中的时间不一致性,利用COF-DATA数据集提升视频理解性能,发现合成数据显著提升模型准确率。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03414 2026-04-07 cs.CV 57%

KiToke: Kernel-based Interval-aware Token Compression for Video Large Language Models

KiToke:基于核的区间感知令牌压缩用于视频大语言模型

Haifeng Huang, Yang Li

机构 * Department of Computer Science, Iowa State University(爱荷华州立大学计算机科学系)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 KiToke通过全局核冗余度测量和区间感知令牌合并,有效压缩视频大语言模型的视觉令牌,提升效率并保持关键信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03302 2026-04-07 cs.CV cs.AI 57%

Beyond Static Vision: Scene Dynamic Field Unlocks Intuitive Physics Understanding in Multi-modal Large Language Models

超越静态视觉:场景动态场解锁多模态大语言模型中的直观物理理解

Nanxi Li, Xiang Wang, Yuanjie Chen, Haode Zhang, Hong Li, Yong-Lu Li

机构 * Shanghai Jiao Tong University(上海交通大学) Tianjin University(天津大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 研究探讨多模态大语言模型在物理理解上的不足,提出Scene Dynamic Field方法提升对连续物体动态的理解能力,实现20.7%的改进并展现良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 7 篇

2509.24702 2026-04-07 cs.CV 79%

Enhancing Physical Plausibility in Video Generation by Reasoning the Implausibility

通过推理不合理的部分来增强视频生成的物理合理性

Yutong Hao, Chen Chen, Ajmal Saeed Mian, Chang Xu, Daochang Liu

机构 * University of Western Australia(西澳大利亚大学) University of Sydney(悉尼大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出一种无需训练的框架,在推理阶段通过显式推理不合理性来提升视频生成的物理合理性,通过同步解耦引导策略和物理感知推理流程,有效抑制不合理内容,提升物理真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03738 2026-04-07 cs.CV 79%

Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video Generation

重新思考位置嵌入作为多参考和多镜头视频生成的上下文控制器

Binyuan Huang, Yuning Lu, Weinan Jia, Hualiang Wang, Mu Liu, Daiqing Yang

机构 * Wuhan University(武汉大学) University of Science and Technology of China(中国科学技术大学) Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出PoCo方法,通过引入位置嵌入作为额外的上下文控制,解决多参考和多镜头视频生成中参考混淆问题,提升跨镜头一致性和参考保真度。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23279 2026-04-07 cs.CV cs.AI 74%

Vid-Freeze: Protecting Images from Malicious Image-to-Video Generation via Temporal Freezing

Vid-Freeze:通过时间冻结保护图像免受恶意图像到视频生成的侵害

Rohit Chowdhury, Aniruddha Bala, Rohan Jaiswal, Siddharth Roheda

机构 * Samsung(三星)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出Vid-Freeze,通过在生成视频中添加不可察觉的扰动,强制时间冻结,抑制I2V模型中的注意力动态,从而阻止恶意内容生成。

Comments Under Review at ACM-MM 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04142 2026-04-07 cs.CV 57%

OP-GRPO: Efficient Off-Policy GRPO for Flow-Matching Models

OP-GRPO:用于流匹配模型的高效非策略GRPO

Liyu Zhang, Kehan Li, Tingrui Han, Tao Zhao, Yuxuan Sheng, Shibo He, Chao Li

机构 * College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) Central Research Institute, Huawei(华为中央研究院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 OP-GRPO通过高效非策略训练方法提升流匹配模型生成质量,通过高质轨迹选择与重要采样修正,实现训练效率提升34.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04029 2026-04-07 cs.CV 57%

ATSS: Detecting AI-Generated Videos via Anomalous Temporal Self-Similarity

ATSS:通过异常时间自相似性检测AI生成视频

Hang Wang, Chao Shen, Lei Zhang, Zhi-Qi Cheng

机构 * Xi’an Jiaotong University(西安交通大学) The Hong Kong Polytechnic University(香港理工大学) University of Washington(华盛顿大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出ATSS方法,通过三重相似性表示和跨注意融合机制,检测AI生成视频的异常时间自相似性,优于现有方法,在多个基准上表现更优。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03305 2026-04-07 cs.CV 57%

HVG-3D: Bridging Real and Simulation Domains for 3D-Conditional Hand-Object Interaction Video Synthesis

HVG-3D: 联接真实与仿真领域用于3D条件手-物体交互视频合成

Mingjin Chen, Junhao Chen, Zhaoxin Fan, Yujian Lee, Zichen Dang, Lili Wang, Yawen Cui, Lap-Pui Chau, Yi Wang

机构 * Dept. of EEE, The Hong Kong Polytechnic University(香港理工大学电机及电子工程学系) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院未来区块链与隐私计算北京高精尖创新中心) Tsinghua University(清华大学) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院) State Key Laboratory of Virtual Reality Technology and Systems, School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院虚拟现实技术与系统国家重点实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 HVG-3D提出一种统一框架,通过显式3D表示条件生成3D-aware手-物体交互视频,结合3D ControlNet与扩散架构,实现高保真度与时空可控性。

Comments Project page: https://hvg3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07469 2026-04-07 cs.CV 57%

VideoCoF: Unified Video Editing with Temporal Reasoner

VideoCoF:基于时间推理的统一视频编辑

Xiangpeng Yang, Ji Xie, Yiyuan Yang, Yue Ma, Yan Huang, Min Xu, Qiang Wu

机构 * University of Technology Sydney(悉尼科技大学) Zhejiang University(浙江大学) HKUST(香港科技大学)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

AI总结 VideoCoF通过引入时间推理机制,解决视频编辑中精度与统一性的矛盾,实现无需掩码的精确区域映射和细粒度编辑,验证了方法的高效性与有效性。

Comments Accepted by CVPR 2026, Project Page: https://videocof.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 4 篇

2604.04451 2026-04-07 cs.CV 83%

Beyond Few-Step Inference: Accelerating Video Diffusion Transformer Model Serving with Inter-Request Caching Reuse

超越少量步骤推理:利用跨请求缓存重用加速视频扩散变换器模型服务

Hao Liu, Ye Huang, Chenghuan Huang, Zhenyi Zheng, Jiangsu Du, Ziyang Ma, Jing Lyu, Yutong Lu

机构 * Sun Yat-sen University, China(中山大学) Independent Researcher(独立研究者)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文提出Chorus方法,通过跨请求缓存重用加速视频扩散模型服务,实现45%的速度提升,特别在中间去噪步骤中结合Token-Guided Attention Amplification提升语义对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03552 2026-04-07 cs.RO cs.AI cs.CV cs.LG 83%

CRAFT: Video Diffusion for Bimanual Robot Data Generation

CRAFT:基于视频扩散的双臂机器人数据生成

Jason Chen, I-Chun Arthur Liu, Gaurav Sukhatme, Daniel Seita

机构 * University of Southern California(南加州大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 CRAFT通过视频扩散生成双臂机器人演示数据,利用边缘结构线索提升生成多样性与鲁棒性,提升多视角任务的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04934 2026-04-07 cs.CV 57%

Vanast: Virtual Try-On with Human Image Animation via Synthetic Triplet Supervision

Vanast:通过合成三元监督实现的人像虚拟试穿

Hyunsoo Cha, Wonjung Woo, Byungjun Kim, Hanbyul Joo

机构 * Seoul National University(首尔国立大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 Vanast通过统一框架直接从单张人体图像、服装图像和姿态引导视频生成服装转移的人形动画视频,解决传统两阶段流程导致的身份漂移、服装扭曲和前后不一致问题。

Comments Accepted to CVPR 2026, Project Page: https://hyunsoocha.github.io/vanast/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00408 2026-04-07 cs.CV cs.AI 57%

Low-Bitrate Video Compression through Semantic-Conditioned Diffusion

基于语义的低比特率视频压缩

Lingdong Wang, Guan-Ming Su, Divya Kothandaraman, Tsung-Wei Huang, Mohammad Hajiesmaili, Ramesh K. Sitaraman

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Dolby Laboratories(杜比实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出DiSCo框架,通过语义条件扩散模型在低比特率下实现高质量视频压缩,采用文本描述、空间时间退化视频和可选草图等模态,提升感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 动作与事件理解 2 篇

2604.04502 2026-04-07 cs.RO 50%

Veo-Act: How Far Can Frontier Video Models Advance Generalizable Robot Manipulation?

Veo-Act:前沿视频模型在通用机器人操作中能走多远?

Zhongru Zhang, Chenghan Yang, Qingzhou Lu, Yanjiang Guo, Jianke Zhang, Yucheng Hu, Jianyu Chen

机构 * Tsinghua University(清华大学)

专题命中 动作与事件理解 :video generation(abstract)

AI总结 本文探讨前沿视频模型如Veo-3在通用机器人操作中的应用,提出Veo-Act框架结合高阶运动规划与低阶执行器,提升指令跟随性能。

Comments 16 pages, 12 figures. Equal contribution by Zhongru Zhang, Chenghan Yang, Qingzhou Lu and Yanjiang Guo. Project lead: Yanjiang Guo

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26433 2026-04-07 cs.LG 50%

Co-Evolving Latent Action World Models

共演潜在动作世界模型

Yucen Wang, Fengming Zhang, De-Chuan Zhan, Li Zhao, Kaixin Wang, Jiang Bian

专题命中 动作与事件理解 :video generation(abstract)

AI总结 本文提出CoLA-World,通过关键预热阶段实现联合学习,解决世界模型与动作模型的协同问题,提升视频模拟质量和下游视觉规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 2 篇

2604.04372 2026-04-07 cs.CV 83%

Graph-to-Frame RAG: Visual-Space Knowledge Fusion for Training-Free and Auditable Video Reasoning

图到帧RAG:面向无训练和可审计的视频推理的视觉空间知识融合

Songyuan Yang, Weijiang Yu, Ziyu Liu, Guijian Tang, Wenjing Yang, Huibin Tan, Nong Xiao

机构 * National University of Defense Technology(国防科技大学) Sun Yat-sen University(中山大学)

专题命中 长视频与时序推理 :video reasoning(title,abstract);long video(abstract);分类 cs.CV

AI总结 本文提出G2F-RAG,通过视觉空间知识融合提升视频推理的可解释性和效率,减少认知负担并保留可追溯的证据轨迹。

Comments Accepted at CVPR 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04184 2026-04-07 cs.CV 57%

AURA: Always-On Understanding and Real-Time Assistance via Video Streams

AURA: 通过视频流实现始终在线的理解与实时协助

Xudong Lu, Yang Bo, Jinpeng Chen, Shuhan Li, Xintong Guo, Huankang Guan, Fang Liu, Dunyuan Xu, Peiwen Sun, Heyang Sun, Rui Liu, Hongsheng Li

机构 * Huawei Research(华为研究院) CUHK MMLab(香港中文大学多媒体实验室)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 AURA提出一个端到端的视频流交互框架,实现视频大语言模型持续处理视频流并支持实时问答与主动响应,达到流式基准的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 视频数据与评测 5 篇

2512.09299 2026-04-07 cs.CV cs.SD 79%

VABench: A Comprehensive Benchmark for Audio-Video Generation

VABench:音频视频生成的综合性基准

Daili Hua, Xizhi Wang, Bohan Zeng, Xinyi Huang, Hao Liang, Junbo Niu, Xinlong Chen, Quanqing Xu, Wentao Zhang

机构 * Peking University(北京大学) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence (Peking University)(北京市数据智能重点实验室(北京大学)) Ant Group(蚂蚁集团) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Huazhong University of Science and Technology(华中科技大学)

专题命中 视频数据与评测 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出VABench,一个用于评估同步音频视频生成能力的综合性基准,涵盖三种任务类型和15个评估维度,旨在建立新的评估标准以推动视频生成领域的发展。

Comments 24 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04634 2026-04-07 cs.CV cs.AI 57%

Preserving Forgery Artifacts: AI-Generated Video Detection at Native Scale

保留伪造痕迹:在原生尺度上进行AI生成视频检测

Zhengcen Li, Chenyang Jiang, Hang Zhao, Shiyang Zhou, Yunyang Mo, Feng Gao, Fan Yang, Qiben Shan, Shaocong Wu, Jingyong Su

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) Peking University(北京大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 本文提出在原生尺度上进行AI生成视频检测的新方法,通过构建大规模数据集和新型框架,有效保留高频率伪影和时空不一致特征,提升检测性能。

Comments ICLR 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04419 2026-04-07 cs.CV 57%

BoxComm: Benchmarking Category-Aware Commentary Generation and Narration Rhythm in Boxing

BoxComm:基于 boxing 的类别感知评论生成与叙述节奏基准测试

Kaiwen Wang, Kaili Zheng, Rongrong Deng, Yiming Shi, Chenyi Guo, Ji Wu

机构 * Tsinghua University(清华大学) Beijing Sport University(北京体育大学)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 本文提出 BoxComm 数据集,包含 445 场世界拳击锦标赛视频及 52000 多条专业评论,通过分类注解和两项新评估方法,解决拳击评论生成中的节奏与类别准确性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04402 2026-04-07 cs.CV 57%

UENR-600K: A Large-Scale Physically Grounded Dataset for Nighttime Video Deraining

UENR-600K:一个大规模的物理基础数据集用于夜间视频去雨

Pei Yang, Hai Ci, Beibei Lin, Yiren Song, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show Lab) National University of Singapore(新加坡国立大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 本文提出UENR-600K数据集,通过Unreal Engine模拟真实夜间雨景,解决传统小规模数据无法捕捉物理特性的问题,提升模型在真实夜间雨场景下的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03819 2026-04-07 cs.CV 57%

ActivityForensics: A Comprehensive Benchmark for Localizing Manipulated Activity in Videos

活动取证:一种全面的基准,用于定位视频中的篡改活动

Peijun Bao, Anwei Luo, Gang Pan, Alex C. Kot, Xudong Jiang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) School of Computing and Artificial Intelligence, Jiangxi University of Finance and Economics(江西财经大学计算机与人工智能学院) Jiangxi Provincial Key Laboratory of Multimedia Intelligent Processing(江西省多媒体智能处理重点实验室) Faculty of Engineering, Shenzhen MSU-BIT University(深圳北理莫斯科大学工程系) VinUniversity

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 本文提出ActivityForensics基准,用于定位视频中被篡改的活动。该基准包含6000多个无缝融合的篡改视频片段,并引入了Temporal Artifact Diffuser方法,评估了多种最先进的伪造定位器。

Comments [CVPR 2026] The first benchmark for action-level deepfake localization

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他视频模型 1 篇

2604.04379 2026-04-07 cs.CV 79%

Reinforce to Learn, Elect to Reason: A Dual Paradigm for Video Reasoning

强化以学习,选择以推理:视频推理的双范式

Songyuan Yang, Weijiang Yu, Jilin Ma, Ziyu Liu, Guijian Tang, Wenjing Yang, Huibin Tan, Nong Xiao

机构 * National University of Defense Technology(国防科技大学) Sun Yat-sen University(中山大学)

专题命中 其他视频模型 :video reasoning(title,abstract);分类 cs.CV

AI总结 本文提出RLER双范式,通过强化学习生成证据并验证推理一致性,提升视频推理的可靠性和可解释性,实验表明其在多个基准上均取得最佳性能。

Comments Accepted at CVPR 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏