arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-02 至 2026-04-02 共收录 6 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 6 篇

2510.02226 2026-04-02 cs.CV cs.AI cs.LG 85%

TempoControl: Temporal Attention Guidance for Text-to-Video Models

TempoControl: 文本到视频模型中的时间注意力引导

Shira Schiber, Ofir Lindenbaum, Idan Schwartz

机构 * Bar-Ilan University(巴伊兰大学)

专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出TempoControl,通过新颖的优化方法实现文本到视频模型的时间对齐,无需重新训练,支持时间重排、动作时机控制和音频对齐等应用。

Comments Accepted CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08210 2026-04-02 cs.CV 79%

Video2LoRA: Unified Semantic-Controlled Video Generation via Per-Reference-Video LoRA

Video2LoRA:通过每参考视频LoRA实现统一的语义控制视频生成

Zexi Wu, Baolu Li, Jing Dai, Yiming Zhang, Yue Ma, Qinghe Wang, Xu Jia, Hongming Xu

机构 * Dalian University of Technology(大连理工大学) HKUST(香港科技大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出Video2LoRA框架,通过轻量级超网络预测个性化LoRA权重,实现灵活高效的语义控制视频生成,模型重量小于150MB,具备良好的零样本泛化能力。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12090 2026-04-02 cs.CV cs.CR cs.LG 77%

SPDMark: Selective Parameter Displacement for Robust Video Watermarking

SPDMark:基于选择性参数位移的鲁棒视频水印技术

Samar Fares, Nurbek Tastan, Karthik Nandakumar

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Michigan State University (MSU)(密歇根州立大学)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 SPDMark通过在视频扩散模型中选择性位移参数,在生成视频时嵌入不可见水印,实现高鲁棒性和计算效率的平衡。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24506 2026-04-02 cs.CV 57%

Toward Physically Consistent Driving Video World Models under Challenging Trajectories

迈向在挑战性轨迹下物理一致的驾驶视频世界模型

Jiawei Zhou, Zhenxin Zhu, Lingyi Du, Linye Lyu, Lijun Zhou, Zhanqian Wu, Hongcheng Luo, Zhuotao Tian, Bing Wang, Guang Chen, Hangjun Ye, Haiyang Sun, Yu Li

机构 * Zhejiang University(浙江大学) Xiaomi EV(小米电动汽车) The Hong Kong Polytechnic University(香港理工大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出PhyGenesis,通过物理条件生成器和物理增强视频生成器,解决挑战性轨迹下视频生成的物理不一致问题,实验表明其在复杂轨迹上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24587 2026-04-02 cs.LG cs.RO 50%

DreamerAD: Efficient Reinforcement Learning via Latent World Model for Autonomous Driving

DreamerAD:通过潜在世界模型实现高效的强化学习用于自动驾驶

Pengxuan Yang, Yupeng Zheng, Deheng Qian, Zebin Xing, Qichao Zhang, Linbo Wang, Yichen Zhang, Shaoyu Guo, Zhongpu Xia, Qiang Chen, Junyu Han, Lingyun Xu, Yifeng Pan, Dongbin Zhao

机构 * Institute of Automation, CAS(中国科学院自动化研究所) Chongqing Chang’an Technology Co., Ltd(重庆长安科技有限公司) School of Advanced Interdisciplinary Sciences, UCAS(中国科学院大学先进交叉科学学院) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院)

专题命中 视频生成 :video generation(abstract)

AI总结 DreamerAD通过压缩扩散采样将步骤从100步减少到1步,实现80倍加速并保持视觉可解释性,解决了自动驾驶中真实世界数据训练成本高和安全风险大的问题。

Comments authors update

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00319 2026-04-02 cs.AI cs.MA 50%

Collaborative AI Agents and Critics for Fault Detection and Cause Analysis in Network Telemetry

协同AI代理与批评者用于网络遥测中的故障检测与原因分析

Syed Eqbal Alam, Zhan Shu

机构 * Department of Electrical and Computer Engineering, University of Alberta(阿尔伯塔大学电气与计算机工程系) SheQAI Research(SheQAI研究)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出一种多代理联邦系统,通过AI代理与批评者协作完成网络遥测中的故障检测、严重性和原因分析等多模态任务,利用多时间尺度随机逼近技术保证收敛性,通信开销低且隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏