arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-23 至 2026-04-23 共收录 9 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2604.20760 2026-04-23 cs.CV 79%

Exploring High-Order Self-Similarity for Video Understanding

探索高阶自相似性用于视频理解

Manjin Kim, Heeseung Kwon, Karteek Alahari, Minsu Cho

机构 * POSTECH RLWRLD Inc.(RLWRLD公司) INRIA Grenoble Rhône-Alpes(INRIA格勒诺布尔罗纳-阿尔卑斯研究院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出多阶自相似模块MOSS,通过学习和整合多阶时空自相似特征,提升视频任务中的运动建模能力,实验表明在动作识别、视频VQA和机器人任务中均取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20473 2026-04-23 cs.CV 70%

Video-ToC: Video Tree-of-Cue Reasoning

Video-ToC: 视频树状提示推理

Qizhong Tan, Zhuotao Tian, Guangming Lu, Jun Yu, Wenjie Pei

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

AI总结 Video-ToC通过树状提示推理框架提升视频理解,引入三创新:树引导视觉提示定位、需求驱动奖励机制和自动化标注流程,验证其在视频理解与幻觉检测中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 3 篇

2602.13669 2026-04-23 cs.CV 79%

EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation

EchoTorrent: 向快速、持续和流式多模态视频生成迈进

Rang Meng, Weipeng Wu, Yuming Li, Chenguang Ma

机构 * Ant Group(蚂蚁集团)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出EchoTorrent框架,通过四重设计提升多模态视频生成的效率与稳定性,实现快速、持续和流式生成,增强时空一致性与音频唇同步性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20357 2026-04-23 cs.CV cs.CL 57%

SignDATA: Data Pipeline for Sign Language Translation

SignDATA:手语翻译的数据管道

Kuanwei Chen, Tingyi Lin

机构 * Computer Science and Information Engineering National Central University(计算机科学与信息工程国家级中央大学) Electrical Engineering National Changhua University Of Education(电气工程国家彰化教育大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出SignDATA,一种标准化手语数据集的预处理工具包,支持端到端的姿势和视频处理流程,通过可配置的接口实现统一输出,提升手语研究的可重复性和比较性。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20157 2026-04-23 cs.CV 57%

HumanScore: Benchmarking Human Motions in Generated Videos

HumanScore:在生成视频中评估人类动作的基准测试

Yusu Fang, Tiange Xiang, Tian Tan, Narayan Schuetz, Scott Delp, Li Fei-Fei, Ehsan Adeli

机构 * Stanford University(斯坦福大学) Peking University(北京大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出HumanScore框架,通过六个可解释指标评估AI生成视频中人类动作的质量,揭示感知合理性与生物力学真实性的差距,并产生可靠的模型排名。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 3 篇

2604.20470 2026-04-23 cs.CV 86%

DynamicRad: Content-Adaptive Sparse Attention for Long Video Diffusion

动态Rad:面向长视频扩散的内容自适应稀疏注意力

Yongji Long, Shijun Liang, Jintao Li, Yun Li

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Shenzhen Institute for Advanced Study, UESTC(深圳先进研究院) Computational Mathematics, Science, & Engineering at Michigan State University (MSU)(密歇根州立大学计算数学、科学与工程)

专题命中 视频扩散模型 :video diffusion(title,abstract);long video(title);分类 cs.CV

AI总结 本文提出DynamicRad,通过引入双模式策略和语义运动路由器,实现长视频扩散中的高效稀疏注意力机制,提升推理速度并保持高质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20289 2026-04-23 cs.CV 70%

X-Cache: Cross-Chunk Block Caching for Few-Step Autoregressive World Models Inference

X-Cache:跨块块缓存用于少步自回归世界模型推理

Yixiao Zeng, Jianlei Zheng, Chaoda Zheng, Shijia Chen, Mingdian Liu, Tongping Liu, Tengwei Luo, Yu Zhang, Boyang Wang, Linkun Xu, Siyuan Lu, Bo Tian, Xianming Liu

机构 * AI Infra Team, XPeng Inc.(AI基础设施团队,小鹏汽车)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出X-Cache,一种无需训练的加速方法,通过跨连续生成块缓存而非去噪步骤来提升少步自回归世界模型的推理效率,实现71%的块跳过率和2.6倍的速度提升,同时保持最小的性能下降。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19683 2026-04-23 cs.RO 50%

Mask World Model: Predicting What Matters for Robust Robot Policy Learning

遮罩世界模型:为鲁棒机器人策略学习预测重要的内容

Yunfan Lou, Xiaowei Chi, Xiaojie Zhang, Zezhong Qian, Chengxuan Li, Rongyu Zhang, Yaoxu Lyu, Guoyu Song, Chuyao Fu, Haoxuan Xu, Pengwei Wang, Shanghang Zhang

机构 * Peking University, Beijing, China State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University Beijing Academy of Artificial Intelligence, Beijing, China National University of Singapore, Singapore The Hong Kong University of Science Nanjing University, Nanjing, China

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 本文提出Mask World Model,通过预测语义遮罩而非像素,提升机器人策略学习的鲁棒性与泛化能力,实验证明其在仿真和现实任务中均优于现有方法。

Comments 16 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 1 篇

2604.20136 2026-04-23 cs.CV cs.AI 57%

IMPACT-CYCLE: A Contract-Based Multi-Agent System for Claim-Level Supervisory Correction of Long-Video Semantic Memory

IMPACT-CYCLE:一种基于合同的多智能体系统,用于长视频语义记忆的层次级监督修正

Weitong Kong, Di Wen, Kunyu Peng, David Schneider, Zeyun Zhong, Alexander Jaus, Zdravko Marinov, Jiale Wei, Ruiping Liu, Junwei Zheng, Yufan Chen, Lei Qi, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) INSAIT ETH Zurich(苏黎世联邦理工学院) Technical University of Munich(慕尼黑技术大学)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 本文提出IMPACT-CYCLE,通过多智能体系统实现长视频语义记忆的层次级监督修正,提升下游推理性能并降低人工仲裁成本。

Comments 7 pages, 2 figures, code are available at https://github.com/MKong17/IMPACT_CYCLE

详情

展开后加载摘要…

URL PDF HTML 收藏