arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-12 至 2026-03-12 共收录 8 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 5 篇

2603.02816 2026-03-12 cs.CV cs.AI 86%

BrandFusion: A Multi-Agent Framework for Seamless Brand Integration in Text-to-Video Generation

BrandFusion: 一种多智能体框架,用于文本到视频生成中的无缝品牌整合

Zihao Zhu, Ruotong Wang, Siwei Lyu, Min Zhang, Baoyuan Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) State University of New York at Buffalo(纽约州立大学布法罗分校) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV

AI总结 BrandFusion通过多智能体框架实现文本到视频生成中的无缝品牌整合,提升品牌辨识度和内容自然度,推动T2V的可持续商业化应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21145 2026-03-12 cs.CV 83%

TEAR: Temporal-aware Automated Red-teaming for Text-to-Video Models

TEAR:面向文本到视频模型的时序感知自动化红队测试

Jiaming He, Guanyu Hou, Hongwei Li, Zhicong Huang, Kangjie Chen, Yi Yu, Wenbo Jiang, Guowen Xu, Tianwei Zhang

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) University of Manchester(曼彻斯特大学) Ant Group(蚂蚁集团) Nanyang Technological University(南洋理工大学) Jilin University(吉林大学)

专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);分类 cs.CV

AI总结 TEAR通过时序感知自动化红队测试框架,有效识别文本到视频模型中的安全风险,实验显示攻击成功率高达80%

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05927 2026-03-12 cs.CV cs.AI cs.RO 79%

World Models That Know When They Don't Know - Controllable Video Generation with Calibrated Uncertainty

能识别不确定性的世界模型 - 可控视频生成中的校准不确定性

Zhiting Mei, Tenny Yin, Micah Baker, Ola Shorinwa, Anirudha Majumdar

机构 * Princeton University(普林斯顿大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出C3方法,通过校准不确定性量化提升可控视频生成的可靠性与可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09488 2026-03-12 cs.CV 74%

Streaming Autoregressive Video Generation via Diagonal Distillation

通过对角蒸馏实现流式自回归视频生成

Jinxiu Liu, Xuanming Liu, Kangfu Mei, Yandong Wen, Ming-Hsuan Yang, Weiyang Liu

机构 * South China University of Technology(南方科技大学) Westlake University(西湖大学) Johns Hopkins University(约翰霍普金斯大学) University of California, Merced(加州大学默塞德分校) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出对角蒸馏方法,通过不对称生成策略和隐式光学流建模,在减少计算步骤的同时提升视频生成的运动质量和效率。

Comments ICLR 2026 (31 pages, 10 figures, project page: https://spherelab.ai/diagdistill/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11048 2026-03-12 cs.CV cs.AI cs.CL cs.MA cs.NE 57%

COMIC: Agentic Sketch Comedy Generation

COMIC:基于代理的即兴喜剧生成

Susung Hong, Brian Curless, Ira Kemelmacher-Shlizerman, Steve Seitz

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 COMIC提出了一种基于代理的自动化系统,通过LLM评论家和迭代优化生成高质量喜剧视频。

Comments Project page: https://susunghong.github.io/COMIC/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频扩散模型 2 篇

2510.13702 2026-03-12 cs.CV cs.AI 70%

MVCustom: Multi-View Customized Diffusion via Geometric Latent Rendering and Completion

MVCustom: 通过几何潜在渲染和完成实现多视图定制化扩散

Minjung Shin, Hyunin Cho, Sooyeon Go, Jin-Hwa Kim, Youngjung Uh

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 MVCustom通过几何潜在渲染和完成技术,实现多视图定制化扩散,解决多视图一致性和定制化保真度的统一问题。

Comments ICLR 2026, Project page: https://minjung-s.github.io/mvcustom

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10256 2026-03-12 cs.SD cs.CV cs.GR 57%

ID-LoRA: Identity-Driven Audio-Video Personalization with In-Context LoRA

ID-LoRA:基于身份的音频视频个性化与上下文LoRA

Aviad Dahan, Moran Yanuka, Noa Kraicer, Lior Wolf, Raja Giryes

机构 * Tel Aviv University(特拉维夫大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 ID-LoRA通过联合生成音频和视频实现身份驱动的个性化,利用上下文LoRA技术在单次生成过程中提升语音与视觉的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 动作与事件理解 1 篇

2603.10408 2026-03-12 cs.CV 79%

Motion Forcing: A Decoupled Framework for Robust Video Generation in Motion Dynamics

运动强制:一种解耦框架,用于运动动态中的鲁棒视频生成

Tianshuo Xu, Zhifei Chen, Leyi Wu, Hao Lu, Ying-cong Chen

专题命中 动作与事件理解 :video generation(title,abstract);分类 cs.CV

AI总结 运动强制通过解耦物理推理与视觉合成,提升复杂场景下视频生成的鲁棒性和物理一致性。

Comments https://tianshuo-xu.github.io/Motion-Forcing/

详情

展开后加载摘要…

URL PDF HTML 收藏