arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-24 至 2026-02-24 共收录 6 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 6 篇

2602.09609 2026-02-24 cs.CV 83%

Tele-Omni: a Unified Multimodal Framework for Video Generation and Editing

Tele-Omni: 一种用于视频生成与编辑的统一多模态框架

Jialun Liu, Tian Li, Xiao Cao, Yukuo Ma, Gonghu Shang, Haibin Huang, Chi Zhang, Xiangzhen Chang, Zhiyong Huang, Jiakui Hu, Zuoxin Li, Yuanzhi Liang, Cong Liu, Junqi Liu, Robby T. Tan, Haitong Tang, Qizhen Weng, Yifan Xu, Liying Yang, Xiaoyan Yang, Peng Yu, Shiwen Zhang, Xuelong Li

机构 * TeleAI

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 Tele-Omni是一种统一多模态框架,通过解析文本、图像和参考视频指令,实现视频生成与编辑的灵活控制,提升时间一致性和视觉一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08318 2026-02-24 cs.CV 83%

LinVideo: A Post-Training Framework towards O(n) Attention in Efficient Video Generation

LinVideo: 一种面向高效视频生成的O(n)注意力后训练框架

Yushi Huang, Xingtong Ge, Ruihao Gong, Chengtao Lv, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学) Beihang University(北航) Sensetime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 LinVideo提出一种高效的无数据后训练框架,通过选择性迁移将部分自注意力模块替换为线性注意力,从而在保持性能的同时显著提升视频生成效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19163 2026-02-24 cs.CV cs.MM cs.SD 81%

JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation

JavisDiT++:联合音频视频生成的统一建模与优化

Kai Liu, Yanhao Zheng, Kai Wang, Shengqiong Wu, Rongjunchen Zhang, Jiebo Luo, Dimitrios Hatzinakos, Ziwei Liu, Hao Fei, Tat-Seng Chua

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) University of Toronto(多伦多大学) HiThink Research(HiThink研究) University of Rochester(罗切斯特大学) Nanyang Technological University(南洋理工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

AI总结 JavisDiT++通过统一建模与优化方法,在联合音频视频生成任务中实现高质量的同步与语义对齐。

Comments Accepted by ICLR 2026. Homepage: https://JavisVerse.github.io/JavisDiT2-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19040 2026-02-24 cs.IR cs.AI cs.MM 79%

Adaptive Multi-Agent Reasoning for Text-to-Video Retrieval

自适应多智能体推理用于文本到视频检索

Jiaxin Wu, Xiao-Yong Wei, Qing Li

机构 * Shenzhen University(深圳大学) The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.MM

AI总结 本文提出自适应多智能体框架,通过动态协调检索、推理和查询重述智能体,提升文本到视频检索的零样本跨模态对齐与复杂查询处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18618 2026-02-24 cs.CV 57%

Narrating For You: Prompt-guided Audio-visual Narrating Face Generation Employing Multi-entangled Latent Space

为你叙述:基于多纠缠潜在空间的提示引导音频视觉叙述面部生成

Aashish Chandra, Aashutosh A, Abhijit Das

机构 * Machine Intelligence Group, Department of CS&IS, BITS Pilani, Hyderabad Campus, India(机器智能组,计算机科学与信息学系,比斯汉学院海得拉巴校区,印度) Georgia Institute of Technology, USA(佐治亚理工学院,美国)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出了一种基于多纠缠潜在空间的音频视觉叙述面部生成方法,通过合成静态图像、语音档案和目标文本来生成逼真的说话面孔。

Comments To appear in the Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026. Presented at Poster Session 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06559 2026-02-24 cs.GT 50%

GenAI vs. Human Creators: Procurement Mechanism Design in Two-/Three-Layer Markets

生成式AI与人类创作者:跨域市场中的采购机制设计

Rui Ai, David Simchi-Levi, Haifeng Xu

专题命中 视频生成 :video generation(abstract)

AI总结 本文研究了生成式AI与人类创作者在跨域市场中的采购机制设计,揭示了数据中介带来的影响及对社会福利的负面影响,提出需政府监管以优化数据生态系统。

详情

展开后加载摘要…

URL PDF HTML 收藏