arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-05-27 至 2026-05-27 共收录 20 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 5 篇

2605.26584 2026-05-27 cs.CV 79%

O-MARC: Omni Memory-Augmented Compression Distillation for Efficient Video Understanding

O-MARC: 全记忆增强压缩蒸馏用于高效视频理解

Peiran Wu, Yunze Liu, Chi-Hao Wu, Chen Chen, Junxiao Shen

机构 * University of Bristol(布里斯托大学) Memories.ai Research(Memories.ai研究院) University of Central Florida(佛罗里达中央大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 提出O-MARC框架,通过无训练压缩方法OMAC保留视觉记忆和音频锚点,并利用压缩蒸馏使紧凑模型鲁棒,在多个基准上提升性能并降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26680 2026-05-27 cs.CV cs.AI 74%

DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding

DynFrame: 自适应推理驱动的多模态框架与动态帧增强用于复杂视频理解

Peng Zhang, Guanghao Zhang, Wanggui He, Longxiang Zhang, Mushui Liu, Yan Xia, Zhenhao Peng, Weilong Dai, Jinlong Liu, Haobing Tang, Le Zhang, Hao Jiang, Pipei Huang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 视频理解 :video understanding(title);分类 cs.CV

AI总结 提出DynFrame框架,通过将时间窗口和采样密度作为原生token进行单步检索,并引入分段解耦GRPO优化,解决了视频多模态大模型中采样密度不可学习及检索与回答优化耦合的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07669 2026-05-27 cs.CV 70%

SRL-CLIP: Efficient CLIP Video Adaptation via Structured Semantic Role Labels

SRL-CLIP: 通过结构化语义角色标签实现高效的CLIP视频适配

Darshan Singh, Zeeshan Khan, Makarand Tapaswi

机构 * CVIT, IIIT Hyderabad(IIIT海得拉巴计算机视觉研究所) Inria, École normale supérieure, CNRS, PSL Research University(法国国家信息与自动化研究所、巴黎综合理工学院、国家科学研究中心、巴黎高等研究大学)

专题命中 视频理解 :video understanding(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出SRL-CLIP,利用结构化语义角色标签(SRL)生成规则化字幕,仅用23k视频-字幕对进行对比微调,即可高效适配CLIP用于通用视频理解,在零样本文本-视频检索上性能优于参数多4-8倍、数据多6000倍的模型。

Comments Accepted to the CV4Smalls Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26967 2026-05-27 cs.CV 57%

CodecCap: High-Fidelity Codec-Inspired Residual Modeling for Dense Video Captioning

CodecCap: 高保真度编解码器启发的残差建模用于密集视频字幕生成

Zihan Lin, Songhe Deng, Shuwei He, Danxiang Zhu, Dan Zhang, Yishu Lei, Xianlong Luo, Shikun Feng, Rui Liu

机构 * ERNIE Team, Baidu(百度ERNIE团队) College of Artificial Intelligence, Inner Mongolia University(内蒙古大学人工智能学院)

专题命中 视频理解 :video-language(abstract);分类 cs.CV

AI总结 提出CodecCap框架,通过关键帧和残差字幕模拟视频编解码器,在保持细粒度视觉证据的同时减少冗余,并引入VidCapQA基准验证其高保真度。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26232 2026-05-27 cs.CV 57%

Not All Modalities Are Equal: Instruction-Aware Gating for Multimodal Videos

并非所有模态都平等:面向多模态视频的指令感知门控

Bonan Ding, Umair Nawaz, Ufaq Khan, Abdelrahman M. Shaker, Muhammad Haris Khan, Jiale Cao, Jin Xie, Fahad Shahbaz Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能学院) Tianjin University(天津大学) Chongqing University(重庆大学) Linköping University(林奈大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 提出UniMVU框架,通过内模态和模态级指令感知动态门控实现多模态视频理解,在六个基准上优于静态融合方法。

Comments 19 pages, 8 figures, 7 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 9 篇

2604.24764 2026-05-27 cs.CV 86%

World-R1: Reinforcing 3D Constraints for Text-to-Video Generation

World-R1:通过强化学习为文本到视频生成注入3D约束

Weijie Wang, Xiaoxuan He, Youping Gu, Yifan Yang, Zeyu Zhang, Yefei He, Yanbo Ding, Xirui Hu, Donny Y. Chen, Zhiyuan He, Yuqing Yang, Bohan Zhuang

机构 * Zhejiang University(浙江大学) Microsoft Research(微软研究院) Independent Researcher(独立研究者)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title);分类 cs.CV

AI总结 提出World-R1框架,利用强化学习(Flow-GRPO)结合3D基础模型和视觉语言模型的反馈,在不修改架构的情况下增强视频生成的3D一致性,并采用周期解耦训练策略平衡刚体几何与动态场景。

Comments ICML 2026, Project Page: https://aka.ms/world-r1, Code: https://github.com/microsoft/World-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27336 2026-05-27 cs.CV 85%

PARE: Pruning and Adaptive Routing for Efficient Video Generation

PARE:面向高效视频生成的剪枝与自适应路由

Yutong Wang, Yunke Wang, Tianfan Xue, Yu Qiao, Yaohui Wang, Xinyuan Chen, Chang Xu

机构 * The University of Sydney(悉尼大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 提出PARE方法,通过结构感知剪枝压缩宽度和输入自适应路由压缩深度,联合减少视频扩散Transformer的计算量,在Wan2.1-14B上实现每步计算大幅降低且质量保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26316 2026-05-27 cs.CV cs.AI 83%

E$^3$C: Video Generation with 3D Environmental Memory and Ego-Exo Human Pose Control

E$^3$C: 具有3D环境记忆和自我-外部人体姿态控制的视频生成

Qiao Gu, Lingni Ma, Adam W Harley, Richard Newcombe, Florian Shkurti, Julian Straub

机构 * Meta Reality Labs(Meta现实实验室) University of Toronto(多伦多大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出E$^3$C可控视频扩散框架,通过3D点云记忆和双通道人体控制(自我与外骨骼),实现物理一致的自我中心视频生成。

Comments Preprint. Project Page: https://e3c-videogen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13428 2026-05-27 cs.CV cs.AI 83%

"PhyWorldBench": A Comprehensive Evaluation of Physical Realism in Text-to-Video Models

PhyWorldBench:文本到视频模型中物理真实性的全面评估

Jing Gu, Xian Liu, Yu Zeng, Ashwin Nagarajan, Fangrui Zhu, Daniel Hong, Yue Fan, Qianqi Yan, Kaiwen Zhou, Ming-Yu Liu, Xin Eric Wang

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) NVIDIA Research(NVIDIA研究) Northeastern University(东北大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);分类 cs.CV

AI总结 提出PhyWorldBench基准,通过1050个提示评估12个视频生成模型在物理规律遵循上的表现,并引入反物理类别,利用多模态大语言模型进行零样本评估。

Comments 35 pages, 21 figures

Journal ref ICLR 2026 oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05729 2026-05-27 cs.CV 83%

TAGRPO: Boosting GRPO on Image-to-Video Generation with Direct Trajectory Alignment

TAGRPO: 通过直接轨迹对齐提升图像到视频生成中的GRPO

Jin Wang, Jianxiang Lu, Guangzheng Xu, Comi Chen, Haoyu Yang, Linqing Wang, Peng Chen, Mingtao Chen, Zhichao Hu, Longhuang Wu, Shuai Shao, Qinglin Lu, Ping Luo

机构 * The University of Hong Kong(香港大学) Tencent Hunyuan(腾讯文心)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 针对图像到视频生成中GRPO优化效果不佳的问题,提出基于对比学习的TAGRPO框架,通过中间潜变量对齐高奖励轨迹并远离低奖励轨迹,结合记忆库提升多样性,显著优于DanceGRPO。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14993 2026-05-27 cs.CV cs.AI cs.LG 83%

Kandinsky 5.0: A Family of Foundation Models for Image and Video Generation

Kandinsky 5.0:图像与视频生成的基础模型系列

Vladimir Arkhipkin, Vladimir Korviakov, Nikolai Gerasimenko, Denis Parkhomenko, Viacheslav Vasilev, Alexey Letunovskiy, Nikolai Vaulin, Maria Kovaleva, Ivan Kirillov, Lev Novitskiy, Denis Koposov, Nikita Kiselev, Alexander Varlamov, Dmitrii Mikhailov, Vladimir Polovnikov, Andrey Shutkin, Julia Agafonova, Ilya Vasiliev, Anastasiia Kargapoltseva, Anna Dmitrienko, Anastasia Maltseva, Anna Averchenkova, Olga Kim, Tatiana Nikulina, Denis Dimitrov

机构 * Kandinsky Lab(Kandinsky 实验室)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文介绍Kandinsky 5.0系列模型,通过多阶段训练、自监督微调和强化学习后训练,实现高分辨率图像和10秒视频的高质量生成。

Comments Website: https://kandinskylab.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26918 2026-05-27 cs.CL 78%

Are Video Models Zero-Shot Learners and Reasoners in Education? EduVideoBench, A Knowledge-Skills-Attitude Benchmark for Educational Video Generation

视频模型是教育领域的零样本学习者和推理者吗?EduVideoBench:面向教育视频生成的知识-技能-态度基准

Unggi Lee, Hoyoung Ahn, Yoon Choi, Seonmin Eun, Jahyun Jeong, Seonmin Jin, Harmony Jung, Hye Jin Kim, Chaerin Lee, Hyunji Lee, Jeongjin Lee, Soohwan Lee, Young-Seok Oh, Jaehyeon Park, Sun-ok Ryu, Sunyoung Shin, Yoorim Son, Haeun Park, Yeil Jeong

机构 * Korea University Sejong Campus(韩国大学世宗校区) Cardiff Metropolitan University(卡迪夫 Metropolitan 大学) Seoul National University(首尔国立大学) Bugil Academy(Bugil 学院) Gyeonggi Provincial Office of Education(京畿省教育厅) Loughborough University(洛桑大学) Korea National University of Education(韩国教育大学) Korea University(韩国大学) Korean Educational Development Institute(韩国教育发展院) Sungshin Women’s University(顺天堂女子大学) Seoul National University of Education(首尔国立教育大学) Korea Institute for Curriculum and Evaluation(韩国课程评价院) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 视频生成 :video generation(title,abstract)

AI总结 提出基于知识-技能-态度框架的教育视频生成基准EduVideoBench,评估五个前沿视频生成模型在教育有效性上的不足,并发现教育有效性是多维度的,单一元素不匹配即可使视频失效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26628 2026-05-27 cs.AI 67%

Tail-Aware HiFloat4: W4A4 Post-Training Quantization for Wan2.2

Tail-Aware HiFloat4: 面向Wan2.2的W4A4训练后量化

Zhanfeng Feng, Shuai Guo, Xin Di, Long Peng, Yang Cao, Zhengjun Zha

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract)

AI总结 提出Tail-Aware HiFloat4方法,通过感知激活尾部的百分位校准和紧凑PTQ状态恢复,在HiFloat4数值格式下对Wan2.2进行W4A4训练后量化,减少罕见校准异常值的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26486 2026-05-27 cs.CV 57%

LongCat-Video-Avatar 1.5 Technical Report

LongCat-Video-Avatar 1.5 技术报告

Meituan LongCat Team, Xunliang Cai, Meng Cheng, Feng Gao, Zhe Kong, Jiamu Li, Le Li, Weiheng Li, Hongyu Liu, Shuai Tan, Xiaoming Wei, Tianyu Yang, Yong Zhang

机构 * Meituan LongCat Team(美团LongCat团队)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出 LongCat-Video-Avatar 1.5,一个通过升级音频编码器、优化训练策略、数据筛选和RLHF训练实现高精度唇同步、全身时间稳定性和长视频生成的开放框架,在多个基准测试中达到或超越商业系统性能。

Comments Homepage: https://meigen-ai.github.io/LongCat-Video-Avatar-1.5-Page/ Github: https://github.com/meituan-longcat/LongCat-Video

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 3 篇

2507.16116 2026-05-27 cs.CV 85%

Pusa V1.0: Unlocking Temporal Control in Pretrained Video Diffusion Models via Vectorized Timestep Adaptation

Pusa V1.0: 通过向量化时间步长适应解锁预训练视频扩散模型中的时间控制

Yaofang Liu, Yumeng Ren, Aitor Artola, Yuxuan Hu, Xiaodong Cun, Xiaotong Zhao, Alan Zhao, Raymond H. Chan, Suiyun Zhang, Rui Liu, Dandan Tu, Jean-Michel Morel

机构 * City University of Hong Kong(香港城市大学) The Chinese University of Hong Kong(香港中文大学) Huawei Research(华为研究) Great Bay University(大湾大学) AI Technology Center, Tencent PCG(腾讯AI技术中心) Lingnan University(岭南大学) Hong Kong Centre for Cerebro-Cardiovascular Health Engineering(香港脑心血管健康工程中心)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 提出向量化时间步长适应(VTA)方法,在统一视频扩散框架中实现细粒度时间控制,零样本完成图像到视频生成、起止帧控制等任务,且不破坏基础模型能力。

Comments Code is open-sourced at https://github.com/Yaofang-Liu/Pusa-VidGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26266 2026-05-27 cs.LG cs.AI cs.CV cs.GR eess.IV 81%

Quantized Keys Steal Attention: Bias Correction for KV-Cache Compression in Video Diffusion

量化键窃取注意力:视频扩散中KV缓存压缩的偏差校正

Tuna Tuncer, Felix Becker, Thomas Pfeil

机构 * Technical University of Munich(慕尼黑技术大学) Tensordyne

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV、eess.IV

AI总结 针对视频扩散模型中KV缓存量化导致注意力权重系统性偏差的问题,提出基于Jensen偏差的在线逐注意力分数校正方法,在INT2量化下恢复接近BF16的视频质量,且内存减半。

Comments Variants of this manuscript were accepted to the ICML 2026 workshops SCALE and F2S

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27003 2026-05-27 cs.CV cs.AI 57%

Timestep-Aware SVDQuant-GPTQ for W4A4 Quantization of Wan2.2-I2V

时间步感知的 SVDQuant-GPTQ 用于 Wan2.2-I2V 的 W4A4 量化

Junhao Wu, Dezhong Yao, Hai Jin

机构 * National Engineering Research Center for Big Data Technology and System(大数据技术与系统国家工程研究中心) Services Computing Technology and System Lab(服务计算技术与系统实验室) Cluster and Grid Computing Lab(集群与网格计算实验室) School of Computer Science and Technology(计算机科学与技术学院) Huazhong University of Science and Technology(华中科技大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 针对 Wan2.2-I2V 视频扩散 Transformer 的 W4A4 量化,提出结合 SVDQuant 低秩异常补偿、GPTQ 重建感知残差权重量化和时间步分箱逐层激活裁剪比搜索的后训练量化框架,在 OpenS2V-Eval 上降低 59.3% 峰值显存且仅损失 0.9% VBench 平均分。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 3 篇

2605.26525 2026-05-27 cs.CV cs.AI 79%

ReCA: Multi-Shot Long Video Extrapolation via Recursive Context Allocation

ReCA: 通过递归上下文分配实现多镜头长视频外推

Akide Liu, Jinbo Xing, Chaojie Mao, Ye Li, Zeyu Zhang, Yefei He, Weijie Wang, Zihan Wang, Yu Liu, Gholamreza Haffari, Bohan Zhuang

机构 * Monash University(墨尔本大学) Tongyi Lab, Alibaba Group(通义实验室,阿里集团) Zhejiang University(浙江大学) University of Queensland(昆士兰大学)

专题命中 长视频与时序推理 :long video(title);video generation(abstract);分类 cs.CV

AI总结 针对多镜头视频外推任务中上下文分配瓶颈,提出递归上下文分配框架,通过层次化分解和结构化状态传播提升长视频生成的一致性和质量。

Comments Project Page: https://reca.vmv.re , Code: https://github.com/ali-vilab/ReCA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28730 2026-05-27 cs.RO cs.CL cs.CV 79%

SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning

SOLE-R1:视频语言推理作为机器人强化学习的唯一奖励

Philip Schroeder, Thomas Weng, Karl Schmeckpeper, Eric Rosen, Stephen Hart, Ondrej Biza

机构 * MIT(麻省理工学院) RAI Institute(机器人智能研究所)

专题命中 长视频与时序推理 :video-language(title,abstract);分类 cs.CV

AI总结 提出SOLE-R1模型,通过视频语言时空推理生成密集任务进度估计作为唯一奖励信号,实现在无真实奖励、演示或任务特定调优下的零样本在线强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26485 2026-05-27 cs.CV cs.CL 57%

OmniInteract: Benchmarking Real-World Streaming Interaction for Real-Time Omnimodal Assistants

OmniInteract:面向实时全模态助手的流式交互基准测试

Xudong Lu, Xueying Li, Annan Wang, Yang Bo, Jinpeng Chen, Zengliang Li, Nianzu Yang, Rui Liu, Xue Yang, Jingwen Hou, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多模态实验室) SJTU(上海交通大学) NTU(国立新加坡大学) McMaster(麦马斯特大学) CityUHK(香港城市大学) JUFE(吉林大学)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 提出OmniInteract基准,通过在线推理音视频流评估全模态大模型的实时交互能力,发现现有模型在流式交互中表现薄弱。

详情

展开后加载摘要…

URL PDF HTML 收藏