arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-04 至 2026-08-04 共收录 12 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 12 篇

2608.01942 2026-08-04 cs.CV cs.CL cs.MM 新提交 88%

CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation

CultureVidBench:文本到视频生成中的文化理解基准测试

Xianjing Han, Yuhan Su, Yang Deng, Dong Ma, Wee Peng Tay, Bin Zhu

机构 * Nanyang Technological University(南洋理工大学) Centrale Supélec(中央高等电力学院) Singapore Management University(新加坡管理大学) University of Cambridge(剑桥大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV、cs.MM

AI总结 本研究推出CultureVidBench基准,评估7款T2V模型的文化理解能力,发现现有模型难捕捉细粒度文化细节,尤其针对代表性不足的文化区域与线索。

Comments Project page:https://hanxjing.github.io/CultureVidBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27110 2026-08-04 cs.CV 版本更新 88%

FreqForcing: Autoregressive Long Video Generation via Spectral Self-Anchoring

FreqForcing:基于频谱自锚定的自回归长视频生成方法

Jiatong Li, Leo Liang, Linghe Kong, Yulun Zhang

专题命中 视频生成 :video generation(title,abstract);long video(title);video diffusion(abstract);分类 cs.CV

AI总结 本文针对自回归长视频生成中的误差累积问题,提出无需训练的FreqForcing框架,通过频谱自锚定技术实现24倍外推,性能优于现有无训练方法且与有训练方法有竞争力。

Comments Code is available at: https://github.com/jiatongli2024/FreqForcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02817 2026-08-04 cs.CV 版本更新 83%

MMPhysVideo: Physically Plausible Video Generation Through Joint RGB-Perception Modeling

MMPhysVideo: 通过联合多模态建模提升视频生成的物理合理性

Shubo Lin, Xuanyang Zhang, Wei Cheng, Weiming Hu, Gang Yu, Jin Gao

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) StepFun(阶跃星辰) Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(多模态信息超级智能安全北京市重点实验室) School of Information Science and Technology, Shanghai Tech University(上海科技大学信息科学与技术学院)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 MMPhysVideo通过联合多模态建模提升视频生成的物理合理性,将感知线索统一为伪RGB格式,提出双向控制教师架构以减少跨模态干扰,并通过MMPhysPipe构建物理丰富的多模态数据集,提升物理合理性和视觉质量。

Comments Project Page: https://shubolin028.github.io/MMPhysVideo-Page

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09112 2026-08-04 cs.CV 版本更新 83%

GimbalDiffusion: Gravity-Aware Camera Control for Video Generation

GimbalDiffusion:基于重力的摄像机控制用于视频生成

Frédéric Fortier-Chouinard, Yannick Hold-Geoffroy, Valentin Deschaintre, Matheus Gadelha, Jean-François Lalonde

机构 * Université Laval(拉瓦尔大学) Adobe

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出GimbalDiffusion框架,通过物理坐标系实现摄像机运动的精确控制,引入null-pitch conditioning策略以避免冲突提示内容干扰,并建立新基准评估重力感知摄像机控制视频生成能力。

Comments Accepted at ECCV 2026. Project page: https://lvsn.github.io/GimbalDiffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02504 2026-08-04 cs.CV 新提交 79%

Token Radius Attention for Efficient Video Generation

用于高效视频生成的 Token 半径注意力机制

Jiayu Chen, Zhikun Jiang, Maoliang Li, Jiayi Luo, Jiawei Yang, Zihao Zheng, Hengyi Zhang, Guojie Luo, Xiang Chen

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 该研究针对视频扩散 Transformer 自注意力计算成本高的问题,提出 Token 半径注意力机制,在多种视频生成模型配置上实现了高效加速,同时保持了良好的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01944 2026-08-04 cs.CV 新提交 79%

UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation

UniMoCa:将运动与相机控制统一为忠实人类视频生成的视觉代理

Liming Tan, Ye Chen, Hao Zhang, Lirong Qian, Feifei Li, Bingbing Ni

机构 * SJTU(上海交通大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 UniMoCa是统一运动与相机控制的视觉代理框架,提出MCVP表征并构建MCVP-Video数据集,在Wan2.2 I2V上实现视频生成多方面性能提升且复杂度低

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00617 2026-08-04 cs.CV 新提交 79%

Diagnosing Under-Development of Irreversible Processes in Video Generation

诊断视频生成中不可逆过程的欠发展问题

Jian Xu, Yanning Wu, Delu Zeng, John Paisley, Qibin Zhao

机构 * RIKEN iTHEMS(理化学研究所 iTHEMS) RIKEN AIP(理化学研究所 AIP) South China University of Technology(华南理工大学) Columbia University(哥伦比亚大学)

专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV

AI总结 本研究针对视频生成模型是否遵循物理不可逆性的问题,提出含进展与静态率的两部分协议,发现模型存在不可逆属性欠发展问题,并验证解耦属性潜空间的单调性构建可消除可操纵的读出引导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00079 2026-08-04 cs.CV cs.SD 新提交 70%

LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation

LeapTalk:打破说话头生成中的延迟-质量权衡

Rongxiang Zhang, Songhua Liu

专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV

AI总结 LeapTalk是一种新型说话头生成框架,通过单步前向传播结合数据到数据传输、异质蒸馏与音频驱动无分类器引导,实现了200 FPS的稳定实时生成,打破了延迟-质量权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14686 2026-08-04 cs.CV cs.AI 版本更新 70%

MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model

MVHOI: 通过3D基础模型桥接多视角条件与复杂人-物体交互视频重现

Jinguang Tong, Jinbo Wu, Kaisiyuan Wang, Zhelun Shen, Xuan Huang, Mochu Xiang, Xuesong Li, Yingying Li, Haocheng Feng, Chen Zhao, Hang Zhou, Wei He, Chuong Nguyen, Jingdong Wang, Hongdong Li

专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV

AI总结 本文提出MVHOI框架,通过3D基础模型结合多视角参考条件,生成复杂人-物体交互视频,提升了长时视频生成的性能。

Comments Project page: https://mvhoi.hirotong.fun

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02603 2026-08-04 cs.CV 新提交 57%

WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity

WorldExam:从表观外观到内在反应性对世界模型进行基准测试

Yuxue Yang, Shuyao Shang, Jiahe Wang, Zitong Zhou, Liang Tan, Junhan Zeng, Ruizhi Li, Junyan Li, Yu Liu, Xiao Yang, Yong Li, Jun Zhu, Hongsheng Li, Tieniu Tan, Lue Fan, Zhaoxiang Zhang

机构 * CASIA(中国科学院自动化研究所) SLAI(智能科学与技术实验室) CUHK(香港中文大学) AMAP(中国农业科学院) THU(清华大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 该研究推出WorldExam基准,评估20个模型在视觉质量等四层级的表现,发现不同驱动模型能力有明显分化,无模型兼具广泛任务覆盖与稳定性能,高视觉质量不代表内在反应性强。

Comments Project Website: https://WorldExam.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28394 2026-08-04 cs.CV 版本更新 57%

Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer

大基础模型时代的手物交互:重建、生成与具身迁移

Weiquan Lin, Yu Deng, Shiyang Liu, Luping Xiao, Xu Tang, Junzhi Yu, Jiaolong Yang, Lei Zhang, Xingyu Chen

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本综述系统梳理大基础模型在手物交互(HOI)领域的应用,建立基础模型子先验分类,分析其在HOI任务与机器人学习中的作用,总结数据集与评估协议并展望未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30514 2026-08-04 cs.CV 版本更新 57%

3D Scene-Adaptive Trajectory-Controllable Human Image Animation with Camera Movement

3D场景自适应轨迹可控的人体图像动画与相机运动

Deyin Liu, Jicheng Xu, Lin Yuanbo Wu, Xiaowei Zhao, Xiatian Zhu, Zhe Jin, Anjan Dutta

机构 * Engineering Research Center of Autonomous Unmanned System Technology(自主无人系统工程研究中心) Ministry of Education(教育部) Anhui Provincial Key Laboratory of Security Artificial Intelligence(安徽省安全人工智能重点实验室) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) University of Warwick(沃林格大学) Zhejiang Yuexiu University(浙江越秀大学) University of Surrey(萨里大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出场景自适应人体动画框架,通过地面自适应3D运动重定向和视角自适应潜在融合机制,实现自然场景中人体运动与相机轨迹的可控视频生成。

Comments Accepted to the 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏