arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-05-20 至 2026-05-20 共收录 24 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 4 篇

2605.19223 2026-05-20 cs.CV 79%

HAVEN: Hierarchically Aligned Multimodal Benchmark for Unified Video Understanding

HAVEN:用于统一视频理解的层次对齐多模态基准

Mengqi Shi, Haopeng Zhang

机构 * Department of Information and Computer Sciences(信息与计算机科学系)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出HAVEN,一个用于统一视频理解的层次对齐多模态基准,旨在解决现有多模态大语言模型在复杂叙事总结和推理方面评估不足的问题,通过引入全粒度和全多模态的数据集架构,提供了一个严谨的标准测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19559 2026-05-20 cs.CV cs.AI 57%

EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs

EgoCoT-Bench: 用于MLLMs的 grounded 和可验证的 operation-centric 思维链推理基准测试

Yang Dai, Dian Jiao, Tianwei Lin, Wenqiao Zhang

机构 * Zhejiang University(浙江大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出EgoCoT-Bench,一个用于评估MLLMs在第一人称视角下细粒度操作中心推理能力的基准测试,包含3172个可验证的问答对,涵盖感知、预见和高层次推理等任务,旨在解决现有基准测试在细粒度推理和证据验证方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19137 2026-05-20 cs.CV 57%

Towards Data-Efficient Video Pre-training with Frozen Image Foundation Models

迈向数据高效的视频预训练:使用冻结的图像基础模型

Svetlana Orlova, Niccolò Cavagnero, Gijs Dubbelman

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文探讨了如何通过冻结预训练的图像基础模型并仅训练时间模块来实现数据高效的视频预训练,从而减少对大规模视频数据和计算资源的需求。

Comments Accepted to CVPR 2026 Workshops CV4Smalls

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18431 2026-05-20 cs.CV 57%

Seeing Together: Multi-Robot Cooperative Egocentric Spatial Reasoning with Multimodal Large Language Models

协同视见:基于多模态大语言模型的多机器人协作自体空间推理

Kunyu Peng, Zhikun Zhou, Kailun Yang, Di Wen, Ruiping Liu, Yufan Chen, Junwei Zheng, Hao Shi, Yi Zhou, M. Saquib Sarfraz, Danda Pani Paudel, Luc Van Gool

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Hunan University(湖南大学) University of Oxford(牛津大学) Zhejiang University(浙江大学) ETH Zurich(苏黎世联邦理工学院) Ant Group(蚂蚁集团)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文研究了多机器人协作动态空间推理问题,提出了首个针对该任务的基准CoopSR以及多机器人自体问答数据集EgoTeam,通过引入SP-CoR框架实现了细粒度的协作空间推理,显著提升了多机器人协作推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 11 篇

2605.18739 2026-05-20 cs.CV cs.DC 88%

LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation

LongLive-2.0: 一个基于NVFP4的长视频生成并行基础设施

Yukang Chen, Luozhou Wang, Wei Huang, Shuai Yang, Bohan Zhang, Yicheng Xiao, Ruihang Chu, Weian Mao, Qixin Hu, Shaoteng Liu, Yuyang Zhao, Huizi Mao, Ying-Cong Chen, Enze Xie, Xiaojuan Qi, Song Han

机构 * NVIDIA

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 本文提出LongLive-2.0,一个基于NVFP4的并行基础设施,用于长视频生成的整个训练和推理流程,解决了速度和内存瓶颈问题。通过引入序列并行自回归训练方法,结合NVFP4精度,显著降低了GPU内存消耗并加速了训练过程。同时,该系统能够将扩散模型转换为长视频生成的自回归扩散模型,并在不同GPU架构上实现了高效的推理和训练。

Comments Code, model, and demos are available at https://github.com/NVlabs/LongLive

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19242 2026-05-20 cs.CV cs.AI cs.ET cs.LG cs.MM 81%

PhyWorld: Physics-Faithful World Model for Video Generation

PhyWorld: 用于视频生成的物理忠实世界模型

Pu Zhao, Juyi Lin, Timothy Rupprecht, Arash Akbari, Chence Yang, Rahul Chowdhury, Elaheh Motamedi, Arman Akbari, Yumei He, Chen Wang, Geng Yuan, Weiwei Chen, Yanzhi Wang

机构 * Northeastern University(东北大学) University of Georgia(佐治亚大学) Tulane University(路易斯安那大学) EmbodyX

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出PhyWorld,一种通过两阶段训练提升视频生成模型的物理忠实性,以改进世界模拟器的性能,从而更有效地支持物理AI系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19995 2026-05-20 cs.CV 79%

CogOmniControl: Reasoning-Driven Controllable Video Generation via Creative Intent Cognition

CogOmniControl: 通过创意意图认知实现推理驱动的可控视频生成

Hongji Yang, Songlian Li, Yucheng Zhou, Xiaotong Zhao, Alan Zhao, Chengzhong Xu, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学SKL-IOTSC、CIS实验室) Online-Video BU, Tencent(腾讯在线视频事业部)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出CogOmniControl框架,通过将可控视频生成分解为创意意图认知和生成两个阶段,利用专门训练的CogVLM生成更专业清晰的输出,并通过强化学习对齐不同条件的控制,最终在两个基准测试中超越现有开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19728 2026-05-20 cs.CV 79%

Aero-World: Action-Conditioned Aerial Video Generation from Inertial Controls

Aero-World: 从惯性控制生成动作条件的空中视频

Abdul Mohaimen Al Radi, Kunyang Li, Yuzhang Shang, Mubarak Shah, Yu Tian

机构 * Institute of Artificial Intelligence, University of Central Florida(中央佛罗里达大学人工智能研究所)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 本文提出Aero-World,一种将预训练图像到视频扩散模型转换为可控空中视频生成器的方法,通过注入加速度和角速度序列,利用冻结的物理探测器提供惯性一致性监督,从而提高生成视频对低级动作信号的符合度和时间稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18396 2026-05-20 cs.CV 79%

NEWTON: Agentic Planning for Physically Grounded Video Generation

NEWTON:面向物理基础视频生成的代理规划

Yuxiang Feng, Juncheng Wang, Chao Xu, Yijie Qian, Huihan Wang, Wenlong Hou, Yang Liu, Baigui Sun, Yong Liu, Shujun Wang

机构 * Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学) IROOTECH TECHNOLOGY(IROOTECH技术公司) Sany Group(三一集团)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出NEWTON,通过将视频生成从系统输出降级为代理工具箱中的一个动作,利用学习的规划器协调物理感知工具,提高视频生成的物理合理性,从而在VideoPhy-2数据集上显著提升联合准确性。

Comments project page: https://Newton026.github.io/newton

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08503 2026-05-20 cs.CV 79%

Phantom: Physics-Infused Video Generation via Joint Modeling of Visual and Latent Physical Dynamics

Phantom:通过联合建模视觉和潜在物理动态实现物理 infused 的视频生成

Ying Shen, Jerry Xiong, Tianjiao Yu, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出Phantom模型,通过联合建模视觉内容和潜在物理动态,使视频生成过程具备物理一致性,从而生成既视觉真实又物理合理的视频。

Comments 15 pages, 6 figures, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22292 2026-05-20 cs.CV cs.AI 79%

Jailbreaking on Text-to-Video Models via Scene Splitting Strategy

通过场景分割策略对文本到视频模型进行劫持

Wonjun Lee, Haon Park, Doehyeon Lee, Bumsub Ham, Suhyun Kim

机构 * Yonsei University(延世大学) Korea Institute of Science and Technology(韩国科学技术院) AIM Intelligence(AIM智能) Seoul National University(首尔国立大学) Kyung Hee University(庆熙大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出了一种新的黑盒劫持方法SceneSplit,通过将有害叙述分割成多个良性场景,利用场景组合作为约束来引导最终输出,从而提高生成有害视频的可能性,验证了当前文本到视频模型的安全机制存在漏洞。

Comments ICLR 2026. Project page at https://velpegor.github.io/SceneSplit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06310 2026-05-20 cs.CV 74%

Scene-Action Prompt Fusion for Coherent Text-to-Video Storytelling

场景-动作提示融合用于连贯的文本到视频叙事

Taewon Kang, Divya Kothandaraman, Ming C. Lin

机构 * University of Maryland at College Park(马里兰大学学院市分校) Dolby Laboratories(杜比实验室)

专题命中 视频生成 :text-to-video(title);分类 cs.CV

AI总结 本文提出了一种整合场景和动作提示的叙事框架,通过动态启发的提示混合策略,解决文本到视频生成中时间一致性、语义一致性和场景-动作连续性的问题,通过三个关键组件实现了更连贯的视频叙事。

Comments Accepted to the 2026 IEEE International Conference on Image Processing (ICIP 2026). 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16503 2026-05-20 cs.CV cs.AI 70%

Motif-Video 2B: Technical Report

Motif-Video 2B:技术报告

Junghwan Lim, Wai Ting Cheung, Minsu Ha, Beomgyu Kim, Taewhan Kim, Haesol Lee, Dongpin Oh, Jeesoo Lee, Taehyun Kim, Minjae Kim, Sungmin Lee, Hyeyeon Cho, Dahye Choi, Jaeheui Her, Jaeyeon Huh, Hanbin Jung, Changjin Kang, Dongseok Kim, Jangwoong Kim, Youngrok Kim, Hyukjin Kweon, Hongjoo Lee, Jeongdoo Lee, Junhyeok Lee, Eunhwan Park, Yeongjae Park, Bokki Ryu, Dongjoo Weon

机构 * Motif Technologies(Motif技术公司)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 该研究探讨在有限预算下是否能够训练出高质量的文本到视频生成模型,提出通过架构设计而非单纯扩大模型规模来提升性能,结合共享交叉注意力和三部分主干网络,实现了在较少参数和数据下的高质量视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22940 2026-05-20 cs.CV 57%

One-to-All Animation: Alignment-Free Character Animation and Image Pose Transfer

一对一动画:无对齐角色动画和图像姿态转换

Shijun Shi, Jing Xu, Zhihang Li, Chunli Peng, Xiaoda Yang, Lijing Lu, Kai Hu, Jiangning Zhang

机构 * Jiangnan University(江南大学) University of Science and Technology of China(中国科学技术大学) Chinese Academy of Sciences(中国科学院) Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出了一种统一框架,用于高保真角色动画和图像姿态转换,解决了参考姿态错位问题,通过自监督补全任务和混合参考融合注意力机制提升生成质量。

Comments Project Page:https://ssj9596.github.io/one-to-all-animation-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19319 2026-05-20 cs.CV 57%

SWEET: Sparse World Modeling with Image Editing for Embodied Task Execution

SWEET:基于图像编辑的稀疏世界建模用于具身任务执行

Yiren Song, Yihan Wang, Xiyao Deng, Zhuoran Yan, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室) Central South University(中南大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文研究图像编辑模型能否作为稀疏视觉世界模型用于机器人操作,通过预测任务级未来状态而非密集视频生成,提出SWEET框架实现稀疏视觉规划,结合语言指令和空间引导生成关键帧,并通过扩散动作预测器生成可执行动作,实验表明其在不同场景中提升关键帧预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 5 篇

2601.18993 2026-05-20 cs.CV cs.AI cs.GR 81%

FreeOrbit4D: Training-Free Arbitrary Camera Redirection for Monocular Videos via Foreground-Complete 4D Reconstruction

FreeOrbit4D: 通过前景完整4D重建实现免训练的任意相机重定向

Wei Cao, Hao Zhang, Fengrui Tian, Yulun Wu, Yingying Li, Shenlong Wang, Ning Yu, Yaoyao Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Pennsylvania(宾夕法尼亚大学) Eyeline Labs(Eyeline实验室)

专题命中 视频扩散模型 :video generation(abstract,abstract_cn);video diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出FreeOrbit4D,一种无需训练的框架,通过恢复完整的前景4D代理来解决大角度重定向中的几何模糊问题,从而生成更真实且时间一致的视频。

Comments 12 pages, 10 figures. Accepted to SIGGRAPH Conference Papers 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19949 2026-05-20 cs.CV 57%

Feed-Forward Gaussian Splatting from Sparse Aerial Views

从稀疏航拍视图进行前馈高斯点扩散

Dongli Wu, Zhuoxiao Li, Tongyan Hua, Yinrui Ren, Xiaobao Wei, Rongjun Qin, Wufan Zhao

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Peking University(北京大学) The Ohio State University(俄亥俄州立大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出AnyCity框架,通过观察驱动的生成重建方法,解决稀疏航拍视图中大规模城市场景重建中的证据不平衡问题,通过几何潜在表示和条件化空中完成标记预测,实现高质量的3D高斯点场重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19726 2026-05-20 cs.CV 57%

Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention

通过块近似稀疏注意力实现扩散语言模型的高效长上下文建模

Wenhu Zhang, Yiming Wu, Huanyu Wang, Yaoyang Liu, Huanzhang Dou, Senqiao Yang, Sitong Wu, Hanbin Zhao, Jiaya Jia

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出了一种块近似稀疏注意力框架(BA-Att),通过块级预下采样操作识别信息区域,避免依赖脆弱的位置先验,从而在保持高性能的同时提升计算效率,实验表明其在注意力计算上比FlashAttention快6.95倍,并在50%稀疏度下保持接近全注意力性能。

Comments CVPR 2026 Findings paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19378 2026-05-20 cs.CV 57%

Sparse Mixture-of-Experts Routing in Visual Diffusion Transformers:Diagnosis, Boundary Calibration and Evolutionary Roadmap from Routing Collapse to Selective Deadlock

视觉扩散变换器中稀疏专家混合路由的稀疏性:从路由崩溃到选择性死锁的诊断、边界校准和进化路线图

Haiying Sha

机构 * Haiying Sha(海ying Sha)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文系统诊断了Token-Choice稀疏混合专家(MoE)在视频扩散变换器中的训练失败模式,通过分析超过6500万个标记的路由决策时间序列,提出了功能冗余假说,并总结了从视觉统一到世界模型的三步进化路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03924 2026-05-20 cs.LG cs.AI physics.ao-ph 50%

WIND: Weather Inverse Diffusion for Zero-Shot Atmospheric Modeling

WIND:用于零样本大气建模的天气反向扩散

Michael Aich, Andreas Fürst, Florian Sestak, Carlos Ruiz-Gonzalez, Niklas Boers, Johannes Brandstetter

机构 * Munich Climate Center(慕尼黑气候中心) Earth System Modelling Group, TUM School of Engineering(地球系统建模组,技术大学工程学院) Design, Technical University of Munich, Germany(设计,慕尼黑技术大学,德国) ELLIS Unit, LIT AI Lab, Institute for Machine Learning, JKU Linz, Austria(ELLIS单元,LIT人工智能实验室,机器学习研究所,JKU林茨,奥地利) Emmi AI GmbH, Linz, Austria(Emmi AI GmbH,林茨,奥地利) Potsdam Institute for Climate Impact Research, Potsdam, Germany(波茨坦气候影响研究所,波茨坦,德国) Department of Mathematics, University of Exeter, Exeter, United Kingdom(数学系,埃克塞特大学,埃克塞特,英国)

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 本文提出WIND,一种统一的预训练基础模型,能够无需任务特定微调即可替代各种任务的专用基线,通过自监督视频重建目标预训练,实现了对大气的鲁棒、任务无关的先验学习,从而解决天气和气候问题,如概率预报、空间时间降尺度、从稀疏观测重建空间场以及强制全球干空气质量守恒。

Comments Published at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频问答 2 篇

2505.16819 2026-05-20 cs.CV 57%

Character-Centered Dialogue Generation from Scene-Level Prompts

从场景级提示生成以角色为中心的对话

Taewon Kang, Ming C. Lin

机构 * University of Maryland at College Park, United States(马里兰大学学院市分校,美国)

专题命中 视频问答 :video generation(abstract);分类 cs.CV

AI总结 本研究提出了一种模块化流程,将动作级提示转化为视觉和听觉上一致的对话,丰富了基于场景的故事叙述。通过预训练的视觉-语言编码器提取高级视觉语义,并结合结构化提示引导大型语言模型生成对话。引入递归叙述银行以保持跨场景的上下文和情感一致性,最终生成具有表现力的角色条件语音,产生完整的视听叙事。

Comments Accepted to the 2026 IEEE International Conference on Image Processing (ICIP 2026). 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19390 2026-05-20 cs.CV 57%

LMM-Track4D: Eliciting 4D Dynamic Reasoning in LMMs via Trajectory-Grounded Dialogue

LMM-Track4D: 通过轨迹引导的对话激发LMM中的4D动态推理

Chaoyue Li, Yongxue Xu, Jie Feng, Jiayu Ding

机构 * Huazhong University of Science and Technology(华中科技大学) Sun Yat-sen University(中山大学) Beihang University(北航) Peking University(北京大学)

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

AI总结 本文提出LMM-Track4D任务,通过轨迹引导的多轮时空对话,结合RTGE、TRK和OSK-RA解码器,提升LMM在4D动态推理中的性能,实验表明显式动态状态建模是有效设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 1 篇

2605.19322 2026-05-20 cs.CV 77%

DynaTok: Temporally Adaptive and Positional Bias-Aware Token Compression for Video-LLMs

DynaTok: 时序自适应和位置偏见感知的视频大语言模型token压缩

Minyoung Park, Taehun Kong, Sangjun Ahn

机构 * LG Electronics, Seoul, South Korea(LG电子,首尔,韩国)

专题命中 长视频与时序推理 :video understanding(abstract);video reasoning(abstract);long video(abstract);分类 cs.CV

AI总结 本文提出DynaTok,一种无需训练的时序自适应和位置偏见感知的token压缩框架,通过在时序和空间维度上分配token预算,有效减少冗余的时空覆盖,提升视频大语言模型的效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 视频数据与评测 1 篇

2605.19382 2026-05-20 cs.AI 50%

PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning

PRISM:一个程序化空间-时间推理的基准测试

Qiran Zhang, Yuheng Wang, Runde Yang, Lin Wu, Jingru Fan, Shu Yao, Jie Zhang, Tianle Zhou, Huatao Li, Ruijie Shi, Yihan Li, Chen Qian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 视频数据与评测 :video generation(abstract)

AI总结 本文提出PRISM基准测试,通过大规模人类校准的指令-代码对(共10,372个,比之前基准大20倍),评估语言模型生成空间正确动画输出的能力,并揭示执行成功率与空间正确率之间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏