arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-03 至 2026-03-03 共收录 11 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 11 篇

2603.01509 2026-03-03 cs.CV cs.AI 88%

Retrieval, Refinement, and Ranking for Text-to-Video Generation via Prompt Optimization and Test-Time Scaling

通过提示优化和测试时扩展实现文本到视频生成的检索、细化与排序

Zillur Rahman, Alex Sheng, Cristian Meo

机构 * Algoverse AI

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出3R框架,通过提示优化和测试时扩展提升文本到视频生成的准确性与效率。

Comments 2026 ICLR TTU Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02049 2026-03-03 cs.CV 83%

WorldStereo: Bridging Camera-Guided Video Generation and Scene Reconstruction via 3D Geometric Memories

WorldStereo: 通过3D几何记忆桥接相机引导的视频生成与场景重建

Yisu Zhang, Chenjie Cao, Tengfei Wang, Xuhui Zuo, Junta Wu, Jianke Zhu, Chunchao Guo

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯文心)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 WorldStereo通过3D几何记忆模块实现相机引导视频生成与3D场景重建的高效融合,提升多视角一致性与重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00159 2026-03-03 cs.CV cs.AI cs.MM cs.SD 81%

FlowPortrait: Reinforcement Learning for Audio-Driven Portrait Video Generation

FlowPortrait:基于强化学习的音频驱动肖像视频生成

Weiting Tan, Andy T. Liu, Ming Tu, Xinghua Qu, Philipp Koehn, Lu Lu

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

AI总结 FlowPortrait通过强化学习框架结合多模态模型和人类对齐评估系统,提升音频驱动肖像视频生成的质量和表现力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20999 2026-03-03 cs.CV 79%

VII: Visual Instruction Injection for Jailbreaking Image-to-Video Generation Models

VII: 视觉指令注入用于劫持图像到视频生成模型

Bowen Zheng, Yongli Xiang, Ziming Hong, Zerong Lin, Chaojian Yu, Tongliang Liu, Xinge You

机构 * National Anti-Counterfeit Engineering Research Center, Huazhong University of Science and Technology(华中科技大学反伪工程研究中心) School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) Sydney AI Centre, The University of Sydney(悉尼大学AI中心)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 VII通过将恶意意图伪装为良性视觉指令,有效劫持图像到视频生成模型,实现高攻击成功率并降低拒绝率。

Comments Project page: https://Zbwwwwwwww.github.io/VII

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00466 2026-03-03 cs.CV 79%

DreamWorld: Unified World Modeling in Video Generation

DreamWorld: 视频生成中的统一世界建模

Boming Tan, Xiangdong Zhang, Ning Liao, Yuqing Zhang, Shaofeng Zhang, Xue Yang, Qi Fan, Yanyong Zhang

机构 * University of Science(科学技术大学) Shanghai Jiao Tong University, Shanghai, China.(上海交通大学) Nanjing University, Suzhou, China.(南京大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 DreamWorld通过联合世界建模范式和约束退火技术,提升视频生成的世界一致性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09642 2026-03-03 cs.GR cs.AI 78%

Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k

Open-Sora 2.0:在20万美元内训练一个商业级视频生成模型

Zangwei Zheng, Xiangyu Peng, Yuxuan Lou, Chenhui Shen, Tom Young, Xinying Guo, Binluo Wang, Hang Xu, Hongxin Liu, Mingyan Jiang, Wenjun Li, Yuhui Wang, Anbang Ye, Gang Ren, Qianran Ma, Wanying Liang, Xiang Lian, Xiwen Wu, Yuting Zhong, Zhuangyan Li, Chaoyu Gong, Guojun Lei, Leijun Cheng, Limin Zhang, Minghao Li, Ruijie Zhang, Silan Hu, Shijie Huang, Xiaokang Wang, Yuanheng Zhao, Yuqi Wang, Ziang Wei, Yang You

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 视频生成 :video generation(title,abstract)

AI总结 Open-Sora 2.0通过低成本训练实现了商业级视频生成模型,展示了训练成本的可控性,并开源促进视频生成技术的普及与创新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00978 2026-03-03 cs.CV cs.AI 77%

EraseAnything++: Enabling Concept Erasure in Rectified Flow Transformers Leveraging Multi-Object Optimization

EraseAnything++: 通过多对象优化实现Rectified Flow Transformers中的概念擦除

Zhaoxin Fan, Nanxiang Jiang, Daiheng Gao, Shiji Zhou, Wenjun Wu

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算先进创新中心,人工智能学院,北航) University of Science and Technology of China(中国科学技术大学)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 EraseAnything++通过多目标优化实现图像和视频扩散模型中的概念擦除,提升生成质量与时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01418 2026-03-03 cs.CV cs.MM cs.SD 62%

UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation

UniTalking: 一种统一的音频-视频框架用于说话肖像生成

Hebeizi Li, Zihao Liang, Benyuan Sun, Zihao Yin, Xiao Sha, Chenliang Wang, Yi Yang

机构 * Central Media Technology Institute, Huawei(华为中央媒体技术研究所) School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

AI总结 UniTalking提出了一种统一的端到端扩散框架,用于生成高质量的语音和唇同步视频,通过多模态Transformer块和个性化语音克隆技术,提升了视觉保真度和训练效率。

Comments Accepted at CVPR 2026 (Findings Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01757 2026-03-03 cs.CV 57%

StepVAR: Structure-Texture Guided Pruning for Visual Autoregressive Models

StepVAR: 结构-纹理引导的视觉自回归模型剪枝

Keli Liu, Zhendong Wang, Wengang Zhou, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 StepVAR通过结合结构和纹理重要性,提出无需训练的token剪枝框架,实现视觉自回归模型的高效推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06871 2026-03-03 cs.CV 57%

RFDM: Residual Flow Diffusion Model for Efficient Causal Video Editing

RFDM: 基于残差流扩散模型的高效因果视频编辑

Mohammadreza Salehi, Mehdi Noroozi, Luca Morreale, Ruchika Chavhan, Malcolm Chadwick, Alberto Gil Ramos, Abhinav Mehrotra

机构 * Samsung AI Center, Cambridge(三星人工智能中心,剑桥)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 RFDM通过残差流扩散模型实现高效因果视频编辑,超越I2I方法并竞争于全时空视频生成模型。

Comments Accepted at CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00110 2026-03-03 cs.RO 50%

Learning Physics from Pretrained Video Models: A Multimodal Continuous and Sequential World Interaction Models for Robotic Manipulation

从预训练视频模型中学习物理:一种多模态连续和序列世界交互模型用于机器人操作

Zijian Song, Qichang Li, Sihan Qin, Yuhao Chen, Tianshui Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室) Guangdong University of Technology(广东工业大学)

专题命中 视频生成 :video generation(abstract)

AI总结 PhysGen通过预训练视频模型学习物理知识,实现机器人操作的连续和序列世界交互,优于现有基线方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏