arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-12 至 2026-03-12 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 2 篇

2510.13702 2026-03-12 cs.CV cs.AI 70%

MVCustom: Multi-View Customized Diffusion via Geometric Latent Rendering and Completion

MVCustom: 通过几何潜在渲染和完成实现多视图定制化扩散

Minjung Shin, Hyunin Cho, Sooyeon Go, Jin-Hwa Kim, Youngjung Uh

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 MVCustom通过几何潜在渲染和完成技术,实现多视图定制化扩散,解决多视图一致性和定制化保真度的统一问题。

Comments ICLR 2026, Project page: https://minjung-s.github.io/mvcustom

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10256 2026-03-12 cs.SD cs.CV cs.GR 57%

ID-LoRA: Identity-Driven Audio-Video Personalization with In-Context LoRA

ID-LoRA:基于身份的音频视频个性化与上下文LoRA

Aviad Dahan, Moran Yanuka, Noa Kraicer, Lior Wolf, Raja Giryes

机构 * Tel Aviv University(特拉维夫大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 ID-LoRA通过联合生成音频和视频实现身份驱动的个性化,利用上下文LoRA技术在单次生成过程中提升语音与视觉的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏