arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-22 至 2026-04-22 共收录 10 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 7 篇

2604.19720 2026-04-22 cs.CV 83%

ReImagine: Rethinking Controllable High-Quality Human Video Generation via Image-First Synthesis

ReImagine:重新思考通过图像优先合成实现可控高质量人类视频生成

Zhengwentai Sun, Keru Zheng, Chenghong Li, Hongjie Liao, Xihe Yang, Heyuan Li, Yihao Zhi, Shuliang Ning, Shuguang Cui, Xiaoguang Han

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) Future Network of Intelligence Institute, CUHK-Shenzhen, China(CUHK-深圳智能网络研究院)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出通过图像优先合成方法,结合预训练图像模型与SMPL-X运动引导,生成高质量且时间一致的视频,同时释放人类数据集与辅助模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19473 2026-04-22 cs.CV 83%

TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation

TS-Attn:多事件视频生成的时序可分离注意力

Hongyu Zhang, Yufan Deng, Zilin Pan, Peng-Tao Jiang, Bo Li, Qibin Hou, Zhiyang Dou, Zhen Dong, Daquan Zhou

机构 * Peking University(北京大学) Shenzhen Graduate School(深圳研究生院) Zhejiang University(浙江大学) Nankai University(南开大学) Massachusetts Institute of Technology(麻省理工学院) Nanjing University(南京大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出TS-Attn机制,解决多事件视频生成中时序不一致与注意力冲突问题,提升生成质量,实验表明在两个数据集上效果显著。

Comments ICLR 2026, code available at: https://github.com/Hong-yu-Zhang/TS-Attn

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18215 2026-04-22 cs.CV 79%

Memorize When Needed: Decoupled Memory Control for Spatially Consistent Long-Horizon Video Generation

按需记忆:用于空间一致长时视频生成的解耦记忆控制

Yanjun Guo, Zhengqiang Zhang, Pengfei Wang, Xinyue Liang, Zhiyuan Ma, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出解耦框架,分离记忆条件与生成过程,提升空间一致性并保持生成能力。通过轻量记忆分支和跨帧注意力机制,实现高效且高质量的长时视频生成。

Comments 24 pages, with supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18993 2026-04-22 cs.CV cs.AI cs.MM 62%

AutoAWG: Adverse Weather Generation with Adaptive Multi-Controls for Automotive Videos

AutoAWG:用于自动驾驶视频的自适应多控逆境天气生成

Jiagao Hu, Daiguo Zhou, Danzhen Fu, Fuhao Li, Zepeng Wang, Fei Wang, Wenhua Liao, Jiayi Xie, Haiyang Sun

机构 * MiLM Plus, Xiaomi Inc.(小米 MiLM Plus) Xiaomi Inc.(小米公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

AI总结 本文提出AutoAWG,通过自适应多控生成逆境天气视频,提升自动驾驶感知鲁棒性,实验表明其在FID和FVD指标上显著优于现有方法。

Comments Accepted by ICMR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18564 2026-04-22 cs.CV 57%

MultiWorld: Scalable Multi-Agent Multi-View Video World Models

多世界:可扩展的多智能体多视角视频世界模型

Haoyu Wu, Jiwen Yu, Yingtian Zou, Xihui Liu

机构 * The University of Hong Kong(香港大学) Sreal AI

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 多世界框架通过多智能体控制模块和全局状态编码器,实现多智能体多视角视频世界建模,提升视频保真度和多视角一致性。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19734 2026-04-22 cs.RO cs.AI 50%

UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling

UniT:迈向人类到人形机器人政策学习和世界建模的统一物理语言

Boyu Chen, Yi Chen, Lu Qiu, Jerry Bai, Yuying Ge, Yixiao Ge

机构 * XPENG Robotics(小鹏机器人) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 视频生成 :video generation(abstract)

AI总结 UniT通过三分支交叉重建机制建立统一物理语言,实现人类到人形机器人的跨身体迁移,提升政策学习和世界建模的效率与鲁棒性。

Comments Project page: https://xpeng-robotics.github.io/unit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19194 2026-04-22 cs.GR 50%

sumo3Dviz: A three dimensional traffic visualisation

sumo3Dviz: 一种三维交通可视化

Kevin Riehl, Julius Schlapbach, Anastasios Kouvelas, Michail A. Makridis

专题命中 视频生成 :video generation(abstract)

AI总结 sumo3Dviz提供轻量级开源3D可视化工具,用于SUMO交通模拟,支持外部视角和第一人称视角,优化批量视频生成,适用于大规模场景可视化和教育演示。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频扩散模型 1 篇

2604.19747 2026-04-22 cs.CV 74%

AnyRecon: Arbitrary-View 3D Reconstruction with Video Diffusion Model

AnyRecon:基于视频扩散模型的任意视角3D重建

Yutian Chen, Shi Guo, Renbiao Jin, Tianshuo Yang, Xin Cai, Yawen Luo, Mingxin Yang, Mulin Yu, Linning Xu, Tianfan Xue

机构 * AnyRecon: Arbitrary-View 3D Reconstruction with Video Diffusion Model(AnyRecon:任意视角3D重建与视频扩散模型)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 AnyRecon通过视频扩散模型实现任意视角3D重建,保留显式几何控制并支持灵活条件设置,通过全局场景记忆和几何感知条件策略提升大场景重建效率与鲁棒性。

Comments Webpage: https://yutian10.github.io/AnyRecon/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长视频与时序推理 2 篇

2603.01455 2026-04-22 cs.CV cs.AI cs.CL cs.IR cs.MM 66%

From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents

从逐字到概要:基于语义信息瓶颈的金字塔多模态记忆压缩用于长视界视频智能体

Niu Lian, Yuting Wang, Hanshu Yao, Jinpeng Wang, Bin Chen, Yaowei Wang, Min Zhang, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) Peng Cheng Laboratory(鹏城实验室)

专题命中 长视频与时序推理 :video understanding(abstract,comments);分类 cs.CV、cs.MM

AI总结 本文提出MM-Mem架构,通过金字塔多模态记忆压缩,结合语义信息瓶颈目标,实现长视界视频理解中的高效记忆组织与任务相关信息保留。

Comments Accepted by ACL 2026 Main. 17 pages, 7 figures, 8 tables. TL;DR: We propose MM-Mem, a cognition-inspired, dual-trace hierarchical memory framework for long-horizon video understanding grounded in Fuzzy-Trace Theory. It features adaptive memory compression via the Information Bottleneck and employs an entropy-driven top-down retrieval to access fine-grained details only when necessary

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08014 2026-04-22 cs.CV 57%

Bridging Time and Space: Decoupled Spatio-Temporal Alignment for Video Grounding

弥合时空:解耦的时空对齐用于视频定位

Xuezhen Tu, Jingyu Wu, Fangyu Kang, Qingpeng Nong, Kaijin Zhang, Chaoyue Niu, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) ZTE Corporation(中兴通讯)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 本文提出Bridge-STG框架,通过解耦时空定位并保持语义连贯性,解决视频定位中时空对齐和视觉token冗余问题,实验表明其在多个基准上达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏