arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-27 至 2026-03-27 共收录 13 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2603.25072 2026-03-27 cs.CV 79%

GIFT: Global Irreplaceability Frame Targeting for Efficient Video Understanding

GIFT:全局不可替代性帧目标用于高效视频理解

Junpeng Ma, Sashuai Zhou, Guanghao Li, Xin Gao, Yue Cao, Hengyu Zeng, Yuxiang Yan, Zhibin Wang, Jun Song, Bo Zheng, Shanghang Zhang, Jian Pu

机构 * Institute of Science and Technology for Brain-inspired Intelligence, Fudan University(复旦大学类脑智能科学与技术研究院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Zhejiang University(浙江大学) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Future Living Lab of Alibaba(阿里巴巴未来生活实验室)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 GIFT通过评估帧的内在不可替代性选择关键帧,解决视频理解中处理密集帧的高计算成本问题,提升视频分析效率。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20525 2026-03-27 cs.CV 57%

Mistake Attribution: Fine-Grained Mistake Understanding in Egocentric Videos

错误归因:第一性错误理解在第一人称视频中

Yayuan Li, Aadit Jain, Filippos Bellos, Jason J. Corso

机构 * University of Michigan(密歇根大学) Voxel51

专题命中 视频理解 :video-language(abstract);分类 cs.CV

AI总结 本文提出MATT任务,通过细粒度分析第一人称视频中的人类错误,开发MisEngine数据引擎生成带有归因注释的错误样本,并提出MisFormer模型在语义、时间和空间维度上实现统一的错误归因,实验表明其在视频语言理解等任务上优于现有方法。

Comments 12 pages, 5 figures, 7 tables. Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 5 篇

2512.07237 2026-03-27 cs.CV 85%

Unified Camera Positional Encoding for Controlled Video Generation

统一的相机位置编码用于受控视频生成

Cheng Zhang, Boying Li, Meng Wei, Yan-Pei Cao, Camilo Cruz Gambardella, Dinh Phung, Jianfei Cai

机构 * Monash University(莫纳什大学) Building 4.0 CRC(4.0建筑CRC) VAST(VAST研究院)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出UCPE,通过统一相机信息实现视频生成中的高可控性与视觉真实性,结合轻量级注意力适配器提升模型性能。

Comments Camera Ready of CVPR2026. Project Page: https://chengzhag.github.io/publication/ucpe/ Code: https://github.com/chengzhag/UCPE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25746 2026-03-27 cs.CV 83%

ShotStream: Streaming Multi-Shot Video Generation for Interactive Storytelling

ShotStream: 流式多镜头视频生成用于交互式叙事

Yawen Luo, Xiaoyu Shi, Junhao Zhuang, Yutian Chen, Quande Liu, Xintao Wang, Pengfei Wan, Tianfan Xue

机构 * MMLab, CUHK(MMLab,香港中文大学) Kuaishou Technology(快手科技) CPII under InnoHK(香港创科旗下CPII)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出ShotStream,一种新型因果多镜头架构,通过流式提示实现动态交互叙事,解决传统方法交互性差和延迟高的问题,实验表明其生成视频在亚秒延迟下达到16FPS,质量不低于传统双向模型。

Comments Project Page: https://luo0207.github.io/ShotStream/ Code: https://github.com/KlingAIResearch/ShotStream

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24835 2026-03-27 cs.CV 83%

DCARL: A Divide-and-Conquer Framework for Autoregressive Long-Trajectory Video Generation

DCARL:一种用于自回归长轨迹视频生成的分而治之框架

Junyi Ouyang, Wenbin Teng, Gonglin Chen, Yajie Zhao, Haiwei Chen

机构 * Institute for Creative Technologies(创意技术研究所) University of Southern California(南加州大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出DCARL框架,通过分而治之策略结合VDMs的高保真生成能力,解决长轨迹视频生成中的视觉漂移和可控性问题,实现高质量且稳定的生成。

Comments 29 pages, 11 figures. Project page: https://junyiouy.github.io/projects/dcarl

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25188 2026-03-27 cs.CV 79%

AnyID: Ultra-Fidelity Universal Identity-Preserving Video Generation from Any Visual References

AnyID: 从任意视觉参考生成超保真度的通用身份保持视频

Jiahao Wang, Hualian Sheng, Sijia Cai, Yuxiao Yang, Weizhan Zhang, Caixia Yan, Bing Deng, Jieping Ye

机构 * School of Computer Science and Technology, MOEKLINNS, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院、MOEKLINNS) Alibaba Cloud Computing(阿里云计算有限公司) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 AnyID通过引入可扩展的多参考架构和主参考生成范式,实现从多种异构身份输入生成高保真的视频,通过大规模数据集训练和强化学习微调提升身份保真度和属性可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00393 2026-03-27 cs.CV 57%

NeoVerse: Enhancing 4D World Model with in-the-wild Monocular Videos

NeoVerse:基于真实世界单目视频增强4D世界模型

Yuxue Yang, Lue Fan, Ziqi Shi, Junran Peng, Feng Wang, Zhaoxiang Zhang

机构 * NLPR & MAIS, CASIA(国家工程实验室与机器智能研究所,中国科学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出NeoVerse,一种能实现4D重建、生成新颖轨迹视频及多种下游应用的 versatile 4D 世界模型。通过解决现有方法在可扩展性上的局限,NeoVerse 基于单目视频构建可扩展的全流程,实现高泛化能力与高性能。

Comments CVPR 2026; Project Page: https://neoverse-4d.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 1 篇

2512.22854 2026-03-27 cs.CV cs.GR cs.LG 57%

ByteLoom: Weaving Geometry-Consistent Human-Object Interactions through Progressive Curriculum Learning

ByteLoom: 通过渐进课程学习编织几何一致的人-物体交互

Bangya Liu, Xinyu Gong, Zelin Zhao, Ziyang Song, Yulei Lu, Suhui Wu, Jun Zhang, Suman Banerjee, Hao Zhang

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ByteDance(字节跳动) Georgia Institute of Technology(佐治亚理工学院) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出ByteLoom框架,通过简化的人类条件和3D物体输入生成几何一致的人-物体交互视频,解决多视角信息注入和手部网格标注依赖的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 3 篇

2603.25209 2026-03-27 cs.CV cs.AI 88%

Free-Lunch Long Video Generation via Layer-Adaptive O.O.D Correction

通过层适应性O.O.D校正实现免费午餐长视频生成

Jiahao Tian, Chenxi Song, Wei Cheng, Chi Zhang

机构 * Westlake University(西湖大学)

专题命中 长视频与时序推理 :long video(title,abstract);video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 本文提出FreeLOC框架,通过层适应性机制解决长视频生成中的O.O.D问题,提升时序一致性和视觉质量。

Comments Accepted to CVPR 2026. Code: https://github.com/Westlake-AGI-Lab/FreeLOC

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25730 2026-03-27 cs.CV cs.AI 83%

PackForcing: Short Video Training Suffices for Long Video Sampling and Long Context Inference

PackForcing:短视频训练足以支持长视频采样和长上下文推理

Xiaofeng Mao, Shaohao Rui, Kaining Ying, Bo Zheng, Chuanhao Li, Mingmin Chi, Kaipeng Zhang

机构 * Alaya Studio, Shanda AI Research Tokyo(Alaya工作室,盛大AI研究东京) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 长视频与时序推理 :long video(title);video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出PackForcing框架,通过三部分KV缓存策略有效管理生成历史,实现高效内存使用和长视频生成,展示短视频监督足以支持高质量长视频合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22120 2026-03-27 cs.CV 57%

StreamingClaw Technical Report

流式Claw技术报告

Jiawei Chen, Zhe Chen, Chaoqun Du, Maokui He, Wei He, Hengtao Li, Qizhen Li, Zide Liu, Hao Ma, Xuhao Pan, Chang Ren, Xudong Rao, Xintian Shen, Chenfeng Wang, Tao Wei, Chengjun Yu, Pengfei Yu, Shengyu Yao, Chunpeng Zhou, Kun Zhan, Lihao Zheng, Pan Zhou, Xuhan Zhu, Yufei Zheng

机构 * Li Auto Inc.(理想汽车)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 本文提出StreamingClaw框架,解决流式视频理解与具身智能中的实时推理、多模态记忆和闭环控制问题,提升复杂环境下的自主决策能力。

Comments Under Progress

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视频数据与评测 2 篇

2512.14698 2026-03-27 cs.CV cs.AI cs.CL cs.MM 62%

TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs

TimeLens:重新思考视频时间接地与多模态大语言模型

Jun Zhang, Teng Wang, Yuying Ge, Yixiao Ge, Xinhao Li, Ying Shan, Limin Wang

机构 * Nanjing University(南京大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) Shanghai AI Lab(上海人工智能实验室)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 本文提出TimeLens,通过数据质量和算法设计两个维度系统研究多模态大语言模型的视频时间接地能力,构建高质量数据集并提出有效训练方法,实现开源模型在视频时间接地任务上的领先性能。

Comments CVPR 2026. Website: https://timelens-arc-lab.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04033 2026-03-27 cs.CV 57%

Thinking with Frames: Generative Video Distortion Evaluation via Frame Reward Model

基于框架的思考:通过帧奖励模型生成视频失真评估

Yuan Wang, Borui Liao, Huijuan Huang, Jinda Lu, Ouxiang Li, Kuien Liu, Meng Wang, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV

AI总结 本文提出REACT框架,通过帧级奖励模型评估生成视频的结构性失真,结合人类偏好数据集和高效合成流程,提升视频生成质量评估的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏