arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-10 至 2026-04-10 共收录 6 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 6 篇

2604.08546 2026-04-10 cs.CV 88%

When Numbers Speak: Aligning Textual Numerals and Visual Instances in Text-to-Video Diffusion Models

当数字说话:在文本到视频扩散模型中对齐文本数字和视觉实例

Zhengyang Sun, Yu Chen, Xin Zhou, Xiaofan Li, Xiwu Chen, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Zhejiang University(浙江大学) Afari Intelligent Drive(阿法里智能驾驶)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出NUMINA框架,通过识别和引导提升文本到视频扩散模型中数字对齐的准确性,实验显示在不同模型规模上均提升了计数精度,并保持了CLIP对齐和时间一致性。

Comments Accepted by CVPR 2026. Project page: https://h-embodvis.github.io/NUMINA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08329 2026-04-10 eess.IV cs.MM 62%

DiV-INR: Extreme Low-Bitrate Diffusion Video Compression with INR Conditioning

DiV-INR:基于INR条件的极端低比特率扩散视频压缩

Eren Çetin, Lucas Relic, Yuanyi Xue, Markus Gross, Christopher Schroers, Roberto Azevedo

专题命中 视频扩散模型 :video diffusion(abstract);分类 eess.IV、cs.MM

AI总结 本文提出一种结合隐式神经表示与预训练视频扩散模型的视频压缩框架,旨在解决极低比特率下的压缩问题,通过INR条件引导扩散过程,提升感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08500 2026-04-10 cs.CV 57%

Novel View Synthesis as Video Completion

新颖视角合成作为视频补全

Qi Wu, Khiem Vuong, Minsik Jeon, Srinivasa Narasimhan, Deva Ramanan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出将稀疏新颖视角合成视为低帧率视频补全任务,通过改进架构实现视角不变性,证明视频模型能以最少监督生成竞争性稀疏视角合成结果。

Comments Project page: https://frame-crafter.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17445 2026-04-10 cs.CV 57%

LangDriveCTRL: Natural Language Controllable Driving Scene Editing with Multi-modal Agents

LangDriveCTRL: 通过多模态代理实现自然语言可控的驾驶场景编辑

Yun He, Francesco Pittaluga, Ziyu Jiang, Matthias Zwicker, Manmohan Chandraker, Zaid Tasneem

机构 * University of Maryland, College Park(马里兰大学帕克分校) NEC Labs America(NEC美国实验室) UC San Diego(加州大学圣迭戈分校)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 LangDriveCTRL通过多模态代理实现驾驶视频的自然语言可控编辑,生成多样化的交通场景,提升真实感和交通场景的真实性。

Comments Project Page: https://yunhe24.github.io/langdrivectrl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04335 2026-04-10 cs.DC 50%

GENSERVE: Efficient Co-Serving of Heterogeneous Diffusion Model Workloads

GENSERVE:高效共服务异构扩散模型工作负载

Fanjiang Ye, Zhangke Li, Xinrui Zhong, Ethan Ma, Russell Chen, Kaijian Wang, Jingwei Zuo, Desen Sun, Ye Cao, Triston Cao, Myungjin Lee, Arvind Krishnamurthy, Yuke Wang

专题命中 视频扩散模型 :text-to-video(abstract)

AI总结 GENSERVE通过利用扩散过程的可预测性,优化共服务效率,解决异构工作负载下的延迟SLA问题,实验表明其在多种配置下将SLA达成率提升44%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22486 2026-04-10 stat.ML cs.LG math.ST stat.TH 50%

Flow Matching is Adaptive to Manifold Structures

流匹配适应于流形结构

Shivam Kumar, Yixin Wang, Lizhen Lin

机构 * Booth School of Business, University of Chicago(芝加哥大学布斯商学院) Department of Statistics, University of Michigan(密歇根大学统计系) Department of Mathematics, University of Maryland, College Park(马里兰大学帕克分校数学系)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 本文研究流匹配在流形支持下的收敛性,证明其在高维数据中适应数据几何并避免维度灾难。

详情

展开后加载摘要…

URL PDF HTML 收藏