arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-14 至 2026-04-14 共收录 8 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 8 篇

2604.10030 2026-04-14 cs.CV 83%

Prompt Relay: Inference-Time Temporal Control for Multi-Event Video Generation

提示中继:多事件视频生成的推理时时间控制

Gordon Chen, Ziqi Huang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出Prompt Relay方法,通过在交叉注意力机制中引入惩罚项,实现多事件视频生成中的细粒度时间控制,提升文本-视频对齐和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11788 2026-04-14 cs.CV 79%

HDR Video Generation via Latent Alignment with Logarithmic Encoding

通过潜变量对齐与对数编码实现HDR视频生成

Naomi Ken Korem, Mohamed Oumoumad, Harel Cain, Matan Ben Yosef, Urska Jelercic, Ofir Bibi, Yaron Inger, Or Patashnik, Daniel Cohen-Or

机构 * Lightricks Gear Productions Tel Aviv University(特拉维夫大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出通过利用预训练生成模型的视觉先验,采用对数编码实现HDR视频生成,无需重新训练编码器,通过轻量微调即可实现高质量HDR视频生成。

Comments https://HDR-LumiVid.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06964 2026-04-14 cs.CV 79%

Adversarial Video Promotion Against Text-to-Video Retrieval

对抗性视频推广对抗文本到视频检索

Qiwei Tian, Chenhao Lin, Zhengyu Zhao, Qian Li, Shuai Liu, Chao Shen

机构 * Xi'an Jiaotong University(西安交通大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出首个对抗性视频推广攻击,通过改进的模态细化方法提升黑盒转移能力,实验显示在多种场景下攻击效果显著,揭示了文本到视频检索的潜在漏洞。

Comments This paper has been accepted by TIFS

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01264 2026-04-14 cs.RO cs.AI 78%

LLM-based Realistic Safety-Critical Driving Video Generation

基于LLM的现实安全关键驾驶视频生成

Yongjie Fu, Ruijian Zha, Pei Tian, Xuan Di

机构 * Department of Civil Engineering and Engineering Mechanics, Columbia University(哥伦比亚大学土木工程与工程力学系) Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系)

专题命中 视频生成 :video generation(title,abstract)

AI总结 本文提出利用LLM生成少样本代码实现安全关键驾驶场景生成,结合CARLA模拟器与Cosmos-Transfer1和ControlNet生成真实驾驶视频,提升自动驾驶测试效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10837 2026-04-14 cs.CV 74%

Immune2V: Image Immunization Against Dual-Stream Image-to-Video Generation

Immune2V: 图像免疫对抗双流图像到视频生成

Zeqian Long, Ozgur Kara, Haotian Xue, Yongxin Chen, James M. Rehg

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 针对图像到视频生成中对抗性攻击的鲁棒性问题,提出Immune2V框架,通过时间平衡的潜在差异和预计算的崩溃诱导轨迹提升防御效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11792 2026-04-14 cs.CV 57%

LottieGPT: Tokenizing Vector Animation for Autoregressive Generation

LottieGPT:为自回归生成设计向量动画的标记化

Junhao Chen, Kejun Gao, Yuehan Cui, Mingze Sun, Mingjin Chen, Shaohui Wang, Xiaoxiao Long, Fei Ma, Qi Tian, Ruqi Huang, Hao Zhao

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) AIR, Tsinghua University(清华大学人工智能研究院) BAAI(百度人工智能研究院) The Hong Kong Polytechnic University(香港理工大学) Nanjing University(南京大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳))

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出首个向量动画标记化与自回归生成框架,基于Lottie标准设计标记器并构建大规模数据集,通过微调Qwen-VL生成可编辑的向量动画。

Comments Accepted by CVPR 2026. Project Page: https://lottiegpt.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20654 2026-04-14 cs.CV cs.AI 57%

AccidentSim: Generating Vehicle Collision Videos with Physically Realistic Collision Trajectories from Real-World Accident Reports

AccidentSim: 从真实世界事故报告生成具有物理真实碰撞轨迹的车辆碰撞视频

Xiangwen Zhang, Qian Zhang, Longfei Han, Qiang Qu, Xiaoming Chen, Weidong Cai

机构 * School of Computer and Artificial Intelligence, Beijing Technology and Business University(北京工商大学计算机与人工智能学院) The University of Sydney(悉尼大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 AccidentSim通过提取事故报告中的物理信息生成真实碰撞视频,结合物理模拟和NeRF技术提升视觉与物理真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10367 2026-04-14 cs.AI cs.SD 50%

Beyond Monologue: Interactive Talking-Listening Avatar Generation with Conversational Audio Context-Aware Kernels

超越独白:基于对话音频上下文感知核的交互式谈话-倾听虚拟角色生成

Yuzhe Weng, Haotian Wang, Xinyi Yu, Xiaoyan Wu, Haoran Xu, Shan He, Jun Du

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK(科大讯飞)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出基于对话音频上下文感知核的交互式虚拟角色生成方法,通过引入多头高斯核解决谈话与倾听行为的时间尺度差异问题,构建了能同时处理双流音频输入的全双工虚拟代理,并在VoxHear数据集上验证了其在生成自然响应的全双工数字人类方面的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏