arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-28 至 2026-04-28 共收录 8 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 8 篇

2601.20597 2026-04-28 cs.CV 79%

StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval

StructAlign:结构化跨模态对齐用于连续文本到视频检索

Shaokun Wang, Weili Guan, Jizhou Han, Jianlong Wu, Yupeng Hu, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Xi’an Jiaotong University(西安交通大学) Shandong University(山东大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出StructAlign,通过结构化跨模态对齐方法解决连续文本到视频检索中的模态错位和特征漂移问题,提升模型持续学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21718 2026-04-28 cs.CV cs.AI cs.CL cs.LG cs.MM 79%

Building a Precise Video Language with Human-AI Oversight

构建具有人机监督的精确视频语言

Zhiqiu Lin, Chancharik Mitra, Siyuan Cen, Isaac Li, Yuhan Huang, Yu Tong Tiffany Ling, Hewei Wang, Irene Pi, Shihang Zhu, Ryan Rao, George Liu, Jiaxi Li, Ruojin Li, Yili Han, Yilun Du, Deva Ramanan

专题命中 视频生成 :video generation(abstract);video understanding(abstract);video-language(abstract);分类 cs.CV、cs.MM

AI总结 本文提出CHAI框架,通过专家与AI协作提升视频描述精度,改进开源模型并实现专业级视频生成。

Comments CVPR 2026 Highlight. Project page: https://linzhiqiu.github.io/papers/chai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23325 2026-04-28 cs.CV cs.AI eess.IV 73%

EAD-Net: Emotion-Aware Talking Head Generation with Spatial Refinement and Temporal Coherence

EAD-Net:具有空间细化和时间一致性的情感感知说话头生成

Yahui Li, Yinfeng Yu, Liejun Wang, Shengjie Shen

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)

专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV、eess.IV

AI总结 EAD-Net通过引入同步网络监督和时空方向注意力机制,提升情感感知说话头生成的唇同步精度和时间一致性,同时利用大语言模型增强情感语义控制。

Comments Main paper (10 pages). Accepted for publication by ICMR(International Conference on Multimedia Retrieval) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03075 2026-04-28 cs.CV cs.AI cs.LG 57%

What Drives Compositional Generalization? The Importance of Continuous Training Objectives in Visual Generative Models

是什么驱动了组合泛化?在视觉生成模型中连续训练目标的重要性

Karim Farid, Rajat Sahay, Yumna Ali Alnaggar, Simon Schrodi, Volker Fischer, Cordelia Schmid, Thomas Brox

机构 * University of Freiburg Bosch Center for Artificial Intelligence Inria, \'E cole Normale Sup \'e rieure, CNRS, PSL Research University

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 研究探讨了视觉生成模型中连续训练目标对组合泛化能力的影响,发现训练目标分布的离散或连续性及条件信息对泛化性能有关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23579 2026-04-28 cs.MM 57%

CineAGI: Character-Consistent Movie Creation through LLM-Orchestrated Multi-Modal Generation and Cross-Scene Integration

CineAGI:通过LLM协同多模态生成与跨场景整合实现角色一致的电影创作

Tianyidan Xie, Zhentao Huang, Mingjie Wang, Xin Huang, Jun Zhou, Minglun Gong, Zili Yi

专题命中 视频生成 :video generation(abstract);分类 cs.MM

AI总结 CineAGI通过多代理叙事合成模块、角色中心流水线和分层音视频同步机制,提升电影创作的一致性和质量,实现40%的整体一致性提升。

Comments Accepted to ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23574 2026-04-28 cs.CV 57%

PhysLayer: Language-Guided Layered Animation with Depth-Aware Physics

PhysLayer:基于语言的分层动画与深度感知物理

Tianyidan Xie, Zhentao Huang, Mingjie Wang, Xin Huang, Jun Zhou, Minglun Gong, Zili Yi

机构 * Nanjing University(南京大学) University of Guelph(圭尔夫大学) Zhejiang Sci-Tech University(浙江科技大学) Dalian Maritime University(大连海事大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 PhysLayer通过深度感知物理模拟和语言引导,实现静态图像的分层动画生成,提升了物理真实性和可控性,实验结果显示在多个指标上均有显著提升。

Comments Accepted to ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19234 2026-04-28 cs.CV 57%

Learning to Credit the Right Steps: Objective-aware Process Optimization for Visual Generation

学习正确的步骤:面向视觉生成的客观感知过程优化

Rui Li, Ke Hao, Yuanzhi Liang, Haibin Huang, Chi Zhang, Yun Gu, XueLong Li

机构 * University of Science and Technology of China(科学技术大学) Shanghai Jiao Tong University(交通大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出OTCA框架,通过细粒度奖励分配提升视觉生成质量,解决传统GRPO在奖励分配上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04204 2026-04-28 cs.CY cs.AI cs.CL cs.HC cs.MA 50%

TeachMaster: Generative Teaching via Code

TeachMaster: 通过代码生成教学内容

Yuheng Wang, Runde Yang, Lin Wu, Jie Zhang, Jingru Fan, Tianle Zhou, Ruoyu Fu, Huatao Li, Ruijie Shi, Siheng Chen, Weinan E, Chen Qian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出Generative Teaching paradigm,通过多智能体框架TeachMaster实现教学内容的自动化生成,提升生产效率并降低教育视频制作成本。

Comments Accepted to ACL 2026; https://www.teachmaster.cn/

详情

展开后加载摘要…

URL PDF HTML 收藏