arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-01 至 2026-04-01 共收录 15 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1 篇

2603.29494 2026-04-01 cs.CV 57%

VecAttention: Vector-wise Sparse Attention for Accelerating Long Context Inference

VecAttention: 向量级稀疏注意力用于加速长上下文推理

Anmin Liu, Ruixuan Yang, Huiqiang Jiang, Bin Lin, Minmin Sun, Yong Li, Chen Zhang, Tao Xie

机构 * SCS, Peking University(北京大学计算机科学技术学院) Key Lab of HCST (PKU), MOE(高可信软件技术教育部重点实验室(北京大学)) Fudan University(复旦大学) Alibaba Group(阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出VecAttention,一种向量级稀疏注意力框架,通过动态选择信息向量提升视频模型的精度与效率,实测在视频理解和生成任务中比全注意力快2.65倍,比现有稀疏注意力方法快1.83倍且精度相当。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 4 篇

2512.21507 2026-04-01 cs.CV 83%

SVBench: Evaluation of Video Generation Models on Social Reasoning

SVBench:视频生成模型在社会推理中的评估

Wenshuo Peng, Gongxuan Wang, Tianmeng Yang, Chuanhao Li, Xiaojie Xu, Hui He, Kaipeng Zhang

机构 * Tsinghua University(清华大学) Shanda AI Research Tokyo(盛大人工智能研究院东京) Shanghai AI Lab(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出SVBench基准,用于评估视频生成模型在社会推理能力上的不足,通过七大核心维度和免训练流程,评估七种先进模型,揭示表面合理性与深层社会推理能力间的差距。

Comments 10pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29931 2026-04-01 cs.CV 79%

Gloria: Consistent Character Video Generation via Content Anchors

Gloria:通过内容锚点实现一致的字符视频生成

Yuhang Yang, Fan Zhang, Huaijin Pi, Shuai Guo, Guowei Xu, Wei Zhai, Yang Cao, Zheng-Jun Zha

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, USTC(教育部类脑智能感知与认知重点实验室,中国科学技术大学) UNSW(新南威尔士大学) HKU(香港大学) UESTC(电子科技大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本研究提出通过紧凑的锚帧集表示字符视觉属性,结合两种机制提升生成一致性,实现高质量多视角一致的字符视频生成。

Comments Accepted by CVPR2026 Main, project: https://yyvhang.github.io/Gloria_Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06537 2026-04-01 cs.CV cs.AI 79%

ProFashion: Prototype-guided Fashion Video Generation with Multiple Reference Images

ProFashion: 基于多参考图像的原型引导时尚视频生成

Xianghao Kong, Qiaosong Qi, Yuanbin Wang, Biaolong Chen, Aixi Zhang, Anyi Rao

机构 * The Hong Kong University of Science and Technology(香港科技大学) Taobao & Tmall Group(淘宝天猫集团)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出ProFashion框架,利用多参考图像提升视图一致性和时间一致性,通过姿态感知原型聚合器和流增强原型生成器改进时尚视频生成。

Comments CVPRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19979 2026-04-01 cs.CV cs.AI 57%

X-World: Controllable Ego-Centric Multi-Camera World Models for Scalable End-to-End Driving

X-World: 可控的以自身为中心的多摄像头世界模型用于可扩展的端到端驾驶

Chaoda Zheng, Sean Li, Jinhao Deng, Zhennan Wang, Shijia Chen, Liqiang Xiao, Ziheng Chi, Hongbin Lin, Kangjie Chen, Boyang Wang, Yu Zhang, Xianming Liu

机构 * GWM Team(长城汽车团队) XPeng Inc.(小鹏汽车)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 X-World通过可控的多摄像头生成世界模型,实现高质量多视角视频生成,支持跨摄像头一致性、长时间动态稳定性和严格动作遵循,为可扩展的端到端驾驶评估提供基础。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 3 篇

2603.30043 2026-04-01 cs.CV 57%

Video Models Reason Early: Exploiting Plan Commitment for Maze Solving

视频模型早起推理:利用计划承诺解决迷宫

Kaleb Newman, Tyler Zhu, Olga Russakovsky

机构 * Princeton University(普林斯顿大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 研究通过2D迷宫解决探讨视频模型生成过程中的规划动态,发现模型在早期步骤中承诺高层运动计划,并揭示路径长度而非障碍密度是迷宫难度的主要预测因素,提出ChEaP方法提升复杂迷宫解决性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29036 2026-04-01 cs.CV 57%

Generating Humanless Environment Walkthroughs from Egocentric Walking Tour Videos

从第一人称行走游览视频生成无人类环境 walkthroughs

Yujin Ham, Junho Kim, Vivek Boominathan, Guha Balakrishnan

机构 * Rice University(莱斯大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出一种生成算法,通过去除行走视频中的人和阴影效果,提升环境建模应用,使用半合成数据集训练Casper模型,实现高质量的无人类视频生成,进而构建三维/四维城市模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11423 2026-04-01 cs.CV 57%

JoyStreamer-Flash: Real-time and Infinite Audio-Driven Avatar Generation with Autoregressive Diffusion

JoyStreamer-Flash: 基于自回归扩散的实时和无限音频驱动化身生成

Chaochao Li, Ruikui Wang, Liangbo Zhou, Jinheng Feng, Huaishao Luo, Huan Zhang, Youzheng Wu, Xiaodong He

机构 * JD Technology(京东科技)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出JoyStreamer-Flash,一种能实现实时推断和无限长度视频生成的音频驱动自回归模型,通过渐进式步进 bootstrap、运动条件注入和无界RoPE via Cache-Resetting提升生成质量与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 4 篇

2603.29252 2026-04-01 cs.CV cs.AI 88%

Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism

通过视觉记忆机制扩展多模态大语言模型的长视频理解

Tao Chen, Kun Zhang, Qiong Wu, Xiao Chen, Chao Chang, Xiaoshuai Sun, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) National University of Defense Technology(国防科技大学)

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 本文提出FlexMem方法,通过视觉记忆机制实现长视频理解,有效提升多模态大语言模型处理无限长视频的能力,实验显示其在单块3090 GPU上能处理超1000帧视频并优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30045 2026-04-01 cs.CV 79%

OmniRoam: World Wandering via Long-Horizon Panoramic Video Generation

OmniRoam:通过长视界全景视频生成实现世界漫游

Yuheng Liu, Xin Lin, Xinke Li, Baihan Yang, Chen Wang, Kalyan Sunkavalli, Yannick Hold-Geoffroy, Hao Tan, Kai Zhang, Xiaohui Xie, Zifan Shi, Yiwei Hu

机构 * University of California, Irvine(加州大学尔湾分校) University of California, San Diego(加州大学圣地亚哥分校) City University of Hong Kong(香港城市大学) University of Pennsylvania(宾夕法尼亚大学) Adobe Research(Adobe研究院)

专题命中 长视频与时序推理 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出OmniRoam框架,利用全景视频生成实现长视界场景漫游,通过预览和精炼阶段提升视频质量和一致性,实验表明其在视觉质量、可控性和长期一致性方面优于现有方法。

Comments Code is available at https://github.com/yuhengliu02/OmniRoam

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29664 2026-04-01 cs.CV 74%

CutClaw: Agentic Hours-Long Video Editing via Music Synchronization

CutClaw:通过音乐同步实现代理长时间视频编辑

Shifang Zhao, Yihan Hu, Ying Shan, Yunchao Wei, Xiaodong Cun

机构 * Beijing Jiaotong University(北京交通大学) GVC Lab, Great Bay University(大湾区大学GVC实验室) ARC Lab, Tencent(腾讯ARC实验室)

专题命中 长视频与时序推理 :long video(title);分类 cs.CV

AI总结 本文提出CutClaw,一种多代理框架,利用多模态语言模型自动编辑长时间原始素材为有意义的短视频,通过音乐同步和视觉优化提升视频质量。

Comments Project Code: https://github.com/GVCLab/CutClaw

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23043 2026-04-01 cs.CV 57%

HieraMamba: Video Temporal Grounding via Hierarchical Anchor-Mamba Pooling

HieraMamba:通过分层锚点-Mamba池化实现视频时间接地

Joungbin An, Kristen Grauman

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 HieraMamba通过分层锚点-Mamba池化结构,在长视频中实现精确的时间定位,解决了视频时间接地中的全局上下文与细粒度时间细节捕捉难题。

Comments CVPR 2026. Project Page: https://vision.cs.utexas.edu/projects/hieramamba/

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视频数据与评测 3 篇

2603.29186 2026-04-01 cs.CV cs.AI 88%

SLVMEval: Synthetic Meta Evaluation Benchmark for Text-to-Long Video Generation

SLVMEval: 合成元评估基准用于文本到长视频生成

Ryosuke Matsuda, Keito Kudo, Haruto Yoshida, Nobuyuki Shimizu, Jun Suzuki

机构 * Tohoku University(东北大学) LY Corporation

专题命中 视频数据与评测 :long video(title,abstract);video generation(title);text-to-video(abstract);分类 cs.CV

AI总结 本文提出SLVMEval基准,用于元评估文本到视频系统,通过合成降质视频对评估系统在长视频质量评估中的可靠性,实验显示人类评估准确率高于现有系统。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05513 2026-04-01 cs.CV 79%

Know-Show: Benchmarking Video-Language Models on Spatio-Temporal Grounded Reasoning

Know-Show:在时空 grounded 推理上评估视频语言模型的基准测试

Chinthani Sugandhika, Chen Li, Deepu Rajan, Basura Fernando

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Institute of High-Performance Computing, Agency for Science, Technology and Research(新加坡科技研究局高性能计算研究所) Centre for Frontier AI Research, Agency for Science, Technology and Research(新加坡科技研究局前沿人工智能研究中心)

专题命中 视频数据与评测 :video-language(title,abstract);分类 cs.CV

AI总结 Know-Show基准测试评估视频语言模型在时空 grounded 推理能力,通过五个互补场景揭示现有模型与人类推理的差距,并提出GRAM方法提升模型的细粒度 grounded 推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06561 2026-04-01 cs.CV 57%

EgoReasoner: Learning Egocentric 4D Reasoning via Task-Adaptive Structured Thinking

EgoReasoner:通过任务自适应结构化思维学习视角4D推理

Fangrui Zhu, Yunfeng Xi, Jianmo Ni, Mu Cai, Boqing Gong, Long Zhao, Chen Qu, Ian Miao, Yi Li, Cheng Zhong, Huaizu Jiang, Shwetak Patel

机构 * Northeastern University(东北大学) Google Research(谷歌研究院) Google DeepMind(谷歌DeepMind)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 本文提出EgoReasoner框架,通过任务自适应结构化思维解决视角4D推理任务,提升空间锚定、时间跟踪和持续推理能力,模型在HD-EPIC基准上取得37.5%准确率。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏