arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2127 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2127 篇

2602.09609 2026-02-24 cs.CV 83%

Tele-Omni: a Unified Multimodal Framework for Video Generation and Editing

Tele-Omni: 一种用于视频生成与编辑的统一多模态框架

Jialun Liu, Tian Li, Xiao Cao, Yukuo Ma, Gonghu Shang, Haibin Huang, Chi Zhang, Xiangzhen Chang, Zhiyong Huang, Jiakui Hu, Zuoxin Li, Yuanzhi Liang, Cong Liu, Junqi Liu, Robby T. Tan, Haitong Tang, Qizhen Weng, Yifan Xu, Liying Yang, Xiaoyan Yang, Peng Yu, Shiwen Zhang, Xuelong Li

机构 * TeleAI

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 Tele-Omni是一种统一多模态框架,通过解析文本、图像和参考视频指令,实现视频生成与编辑的灵活控制,提升时间一致性和视觉一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08318 2026-02-24 cs.CV 83%

LinVideo: A Post-Training Framework towards O(n) Attention in Efficient Video Generation

LinVideo: 一种面向高效视频生成的O(n)注意力后训练框架

Yushi Huang, Xingtong Ge, Ruihao Gong, Chengtao Lv, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学) Beihang University(北航) Sensetime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 LinVideo提出一种高效的无数据后训练框架,通过选择性迁移将部分自注意力模块替换为线性注意力,从而在保持性能的同时显著提升视频生成效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12271 2026-02-13 cs.CV cs.LG 83%

MonarchRT: Efficient Attention for Real-Time Video Generation

MonarchRT:实时视频生成中的高效注意力机制

Krish Agarwal, Zhuoming Chen, Cheng Luo, Yongqi Chen, Haizhong Zheng, Xun Huang, Atri Rudra, Beidi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) University at Buffalo(布法罗大学) Morpheus AI

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 MonarchRT通过结构化注意力参数化方法,实现高效实时视频生成,达到95%的注意力稀疏性,优于现有内核性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10113 2026-02-11 cs.CV 83%

ConsID-Gen: View-Consistent and Identity-Preserving Image-to-Video Generation

ConsID-Gen:视图一致且身份保持的图像到视频生成

Mingyang Wu, Ashirbad Mishra, Soumik Dey, Shuo Xing, Naveen Ravipati, Hansi Wu, Binbin Li, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯大学) eBay Inc.(eBay公司)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 ConsID-Gen通过视图辅助生成框架提升图像到视频生成的视图一致性和身份保持性。

Comments Project page: https://myangwu.github.io/ConsID-Gen

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08682 2026-02-11 cs.CV 83%

ALIVE: Animate Your World with Lifelike Audio-Video Generation

ALIVE: 用逼真音频视频生成动画你的世界

Ying Guo, Qijun Gan, Yifu Zhang, Jinlai Liu, Yifei Hu, Pan Xie, Dongjun Qian, Yu Zhang, Ruiqi Li, Yuqi Zhang, Ruibiao Lu, Xiaofeng Mei, Bo Han, Xiang Yin, Bingyue Peng, Zehuan Yuan

机构 * Bytedance ALIVE Team(字节跳动ALIVE团队)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 ALIVE通过结合预训练文本到视频模型与新的音频视频生成技术,实现了逼真的音频视频生成和动画,展示了优于开源和商业解决方案的性能。

Comments Technical report for ALIVE. Bytedance ALIVE Team. Homepage: https://foundationvision.github.io/Alive/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06959 2026-02-09 cs.CV 83%

CineScene: Implicit 3D as Effective Scene Representation for Cinematic Video Generation

CineScene:隐式3D作为电影视频生成的有效场景表示

Kaiyi Huang, Yukun Huang, Yu Li, Jianhong Bai, Xintao Wang, Zinan Lin, Xuefei Ning, Jiwen Yu, Pengfei Wan, Yu Wang, Xihui Liu

机构 * The University of Hong Kong(香港大学) Kling Team, Kuaishou Technology(快手技术 Kling 团队) Tsinghua University(清华大学) Zhejiang University(浙江大学) Microsoft Research Project Page(微软研究院项目页面)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 CineScene通过隐式3D场景表示实现电影视频生成,能生成动态主体且保持场景一致的高质量视频。

Comments Project website: https://karine-huang.github.io/CineScene/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06028 2026-02-06 cs.CV 83%

Context Forcing: Consistent Autoregressive Video Generation with Long Context

上下文强制:通过长上下文实现一致的自回归视频生成

Shuo Chen, Cong Wei, Sun Sun, Ping Nie, Kai Zhou, Ge Zhang, Ming-Hsuan Yang, Wenhu Chen

机构 * Department of EECS, University of California, Merced, USA(加州大学梅尔塞德斯分校电子工程与计算机科学系) University of Waterloo, Canada(滑铁卢大学)

专题命中 视频生成 :video generation(title,abstract);long video(abstract);分类 cs.CV

AI总结 Context Forcing通过长上下文教师训练学生,解决长视频生成中的学生-教师不匹配问题,实现更长的上下文长度和更一致的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01623 2026-02-03 cs.CV 83%

Omni-Judge: Can Omni-LLMs Serve as Human-Aligned Judges for Text-Conditioned Audio-Video Generation?

Omni-Judge: 能否将 Omni-LLMs 用作文本条件音频视频生成的人类对齐裁判?

Susan Liang, Chao Huang, Filippos Bellos, Yolo Yunlong Tang, Qianxiang Shen, Jing Bi, Luchuan Song, Zeliang Zhang, Jason Corso, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 Omni-Judge 评估 Omni-LLMs 是否能作为文本条件音频视频生成的人类对齐裁判,展现其在多模态评估中的潜力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10214 2026-02-02 cs.CV cs.GR 83%

Beyond Inpainting: Unleash 3D Understanding for Precise Camera-Controlled Video Generation

超越修复:释放3D理解以实现精确的相机控制视频生成

Dong-Yu Chen, Yixin Guo, Shuojin Yang, Tai-Jiang Mu, Shi-Min Hu

机构 * BNRist, Department of Computer Science and Technology, Tsinghua University(BNRist,计算机科学与技术系,清华大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 DepthDirector通过双流条件机制和LoRA适配器实现精确摄像机控制,提升视频生成的3D理解和视觉质量。

Comments Project page: https://eleanor6725.github.io/DepthDirector/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05179 2026-02-02 cs.CV 83%

FlashVideo: Flowing Fidelity to Detail for Efficient High-Resolution Video Generation

FlashVideo: 为高效高分辨率视频生成实现流畅的细节保真度

Shilong Zhang, Wenbo Li, Shoufa Chen, Chongjian GE, Peize Sun, Yifu Zhang, Yi Jiang, Zehuan Yuan, Bingyue Peng, Ping Luo

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) ByteDance(字节跳动)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 FlashVideo通过两阶段框架在高效高分辨率视频生成中实现流畅细节保真度,优化计算效率并提升商业应用潜力。

Comments Model and Weight: https://github.com/FoundationVision/FlashVideo

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01943 2026-01-28 cs.CV 83%

Learning Video Generation for Robotic Manipulation with Collaborative Trajectory Control

基于协作轨迹控制的机器人操作视频生成学习

Xiao Fu, Xintao Wang, Xian Liu, Jianhong Bai, Runsen Xu, Pengfei Wan, Di Zhang, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) Kuaishou Technology(快手科技) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 RoboMaster通过协作轨迹控制方法,解决多物体交互建模问题,实现机器人操作视频生成的高保真度与多物体交互建模。

Comments ICLR 2026. Project Page: https://fuxiao0719.github.io/projects/robomaster/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18698 2026-01-27 cs.CV 83%

Are Video Generation Models Geographically Fair? An Attraction-Centric Evaluation of Global Visual Knowledge

视频生成模型在地理上是否公平?一种以吸引力为中心的全球视觉知识评估

Xiao Liu, Jiawei Zhang

机构 * IFM Lab, Department of Computer Science University of California, Davis(信息融合实验室,计算机科学系加州大学戴维斯分校)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文通过GAP框架评估了文本到视频模型在地理公平性上的表现,发现模型在不同地区和文化群体中具有相对均匀的地理相关视觉知识,表明其在全球应用中的潜力。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11210 2026-01-19 cs.CR cs.CV 83%

VidLeaks: Membership Inference Attacks Against Text-to-Video Models

VidLeaks:针对文本到视频模型的成员推断攻击

Li Wang, Wenyu Chen, Ning Yu, Zheng Li, Shanqing Guo

机构 * School of Cyber Science and Technology, Shandong University(山东大学网络科学与技术学院) Eyeline Labs(Eyeline实验室) State Key Laboratory of Cryptography and Digital Economy Security, Shandong University(山东大学密码与数字经济安全国家重点实验室) Shandong Key Laboratory of Artificial Intelligence Security, Shandong University(山东省人工智能安全重点实验室)

专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);分类 cs.CV

AI总结 VidLeaks通过空间重建保真度和时间生成稳定性两种信号,首次系统研究了针对文本到视频模型的成员推断攻击,揭示了模型在稀疏和时间记忆方面的隐私风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02107 2026-01-06 cs.CV 83%

MagicFight: Personalized Martial Arts Combat Video Generation

MagicFight: 个性化武术战斗视频生成

Jiancheng Huang, Mingfu Yan, Songyan Chen, Yi Huang, Shifeng Chen

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院) China Telecom Cloud Technology Co., Ltd.(中国电信云技术有限公司) Shenzhen University of Advanced Technology(深圳大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 MagicFight通过定制数据集和优化模型,解决两人武术战斗视频生成中的身份混淆和动作不匹配问题,生成高保真的战斗视频。

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00943 2026-01-06 cs.CV 83%

PhyEduVideo: A Benchmark for Evaluating Text-to-Video Models for Physics Education

PhyEduVideo: 一个用于评估物理教育中文本到视频模型的基准

Megha Mariam K. M, Aditya Arun, Zakaria Laskar, C. V. Jawahar

机构 * IIIT Hyderabad(印度海得拉巴理工学院) Adobe MDSR IISER Thiruvananthapuram(泰米尔纳德邦土著科学研究所)

专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);分类 cs.CV

AI总结 PhyEduVideo基准评估文本到视频模型在物理教育中的表现,揭示其在概念准确性与视觉质量间的差距,推动更精准的教育视频生成。

Comments Accepted at IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.21059 2026-01-06 cs.CV 83%

VisionReward: Fine-Grained Multi-Dimensional Human Preference Learning for Image and Video Generation

VisionReward: 面向图像和视频生成的细粒度多维人类偏好学习

Jiazheng Xu, Yu Huang, Jiale Cheng, Yuanming Yang, Jiajun Xu, Yuan Wang, Wenbo Duan, Shen Yang, Qunlin Jin, Shurun Li, Jiayan Teng, Zhuoyi Yang, Wendi Zheng, Xiao Liu, Dan Zhang, Ming Ding, Xiaohan Zhang, Xiaotao Gu, Shiyu Huang, Minlie Huang, Jie Tang, Yuxiao Dong

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 VisionReward通过细粒度多维人类偏好学习框架,提升图像和视频生成的偏好对齐效果,实验显示其在准确性与胜率上均优于现有方法。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18281 2026-01-06 cs.CV 83%

MotionCharacter: Fine-Grained Motion Controllable Human Video Generation

MotionCharacter: 高精度可调控的人体视频生成

Haopeng Fang, Di Qiu, Binjie Mao, He Tang

机构 * Meituan(美团)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 MotionCharacter通过解耦动作类型与运动强度,实现高保真人体视频生成,提升细粒度运动控制与身份一致性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21776 2026-01-01 cs.CV cs.AI 83%

Inference-based GAN Video Generation

基于推断的GAN视频生成

Jingbo Yang, Adrian G. Bors

机构 * Department of Computer Science, University of York(计算机科学系,约克大学)

专题命中 视频生成 :video generation(title,abstract);long video(abstract);分类 cs.CV

AI总结 本文提出了一种基于对抗的VAE-GAN混合结构,通过马尔可夫链框架实现长视频生成,解决时序扩展难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04678 2025-12-30 cs.CV 83%

Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation

奖励强制:基于奖励分布匹配蒸馏的高效流式视频生成

Yunhong Lu, Yanhong Zeng, Haobo Li, Hao Ouyang, Qiuyu Wang, Ka Leong Cheng, Jiapeng Zhu, Hengyuan Cao, Zhipeng Zhang, Xing Zhu, Yujun Shen, Min Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) SIAS-ZJU SJTU(上海交通大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 奖励强制通过EMA-Sink和Re-DMD提升流式视频生成效率与质量,实现23.1 FPS的高性能视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22536 2025-12-30 cs.CV cs.AI 83%

CoAgent: Collaborative Planning and Consistency Agent for Coherent Video Generation

CoAgent:协作规划与一致性代理用于连贯视频生成

Qinglin Zeng, Kaitong Cai, Ruiqi Chen, Qinhan Lv, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 CoAgent通过协作框架提升视频生成的连贯性与一致性,采用计划-合成-验证流程优化长视频的叙事质量与视觉一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20619 2025-12-29 cs.CV 83%

SemanticGen: Video Generation in Semantic Space

SemanticGen: 语义空间中的视频生成

Jianhong Bai, Xiaoshi Wu, Xintao Wang, Xiao Fu, Yuanxing Zhang, Qinghe Wang, Xiaoyu Shi, Menghan Xia, Zuozhu Liu, Haoji Hu, Pengfei Wan, Kun Gai

机构 * Zhejiang University(浙江大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) CUHK(香港中文大学) DLUT(大连理工大学) HUST(华中科技大学)

专题命中 视频生成 :video generation(title,abstract);long video(abstract);分类 cs.CV

AI总结 SemanticGen通过在语义空间中生成视频,提高了长视频生成的效率和质量,优于现有方法。

Comments Project page: https://jianhongbai.github.io/SemanticGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02622 2025-12-25 cs.CV 83%

RULER-Bench: Probing Rule-based Reasoning Abilities of Next-level Video Generation Models for Vision Foundation Intelligence

RULER-Bench: 探索下一代视频生成模型的基于规则的推理能力以实现视觉基础智能

Xuming He, Zehao Fan, Hengjia Li, Fan Zhuo, Hankun Xu, Senlin Cheng, Di Weng, Haifeng Liu, Can Ye, Boxi Wu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 RULER-Bench通过评估视频生成模型的基于规则的推理能力,揭示了其在时间一致性等指标上的不足,为提升视频生成模型的推理能力提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19020 2025-12-23 cs.CV cs.LG 83%

CETCAM: Camera-Controllable Video Generation via Consistent and Extensible Tokenization

CETCAM: 通过一致且可扩展的分词实现相机可控的视频生成

Zelin Zhao, Xinyu Gong, Bangya Liu, Ziyang Song, Jun Zhang, Suhui Wu, Yongxin Chen, Hao Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院) ByteDance(字节跳动) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 CETCAM通过一致且可扩展的分词方案实现相机可控的视频生成,提高了几何一致性和视觉真实性,同时支持额外的控制模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14428 2025-12-23 cs.CV cs.AI 83%

Comp-Attn: Present-and-Align Attention for Compositional Video Generation

Comp-Attn: 为组合视频生成的呈现与对齐注意力

Hongyu Zhang, Yufan Deng, Shenghai Yuan, Yian Zhao, Peng Jin, Xuehan Hou, Chang Liu, Jie Chen

机构 * School of Electronic and Computer Engineering, Peking University, Shenzhen, China(北京大学电子与计算机工程学院) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) Tsinghua University, Beijing, China(清华大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 Comp-Attn通过呈现与对齐范式解决T2V生成中主体存在与关系对齐问题,提升生成质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17040 2025-12-22 cs.CV 83%

Infinite-Homography as Robust Conditioning for Camera-Controlled Video Generation

无限透视作为摄像机控制的鲁棒条件化方法用于摄像机控制的视频生成

Min-Jung Kim, Jeongho Kim, Hoiyeong Jin, Junha Hyung, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能研究所)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 InfCam通过无限透视变形和数据增强管道,实现高姿态保真度的摄像机控制视频生成,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13019 2025-12-16 cs.CV 83%

SneakPeek: Future-Guided Instructional Streaming Video Generation

SneakPeek: 基于未来的指导性视频生成

Cheeun Hong, German Barquero, Fadime Sener, Markos Georgopoulos, Edgar Schönfeld, Stefan Popov, Yuming Du, Oscar Mañas, Albert Pumarola

机构 * Meta Superintelligence Labs(Meta超智能实验室) Seoul National University(首尔国立大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 SneakPeek通过预测因果适应、未来引导自我强制和多提示条件,实现了基于未来的指导性视频生成,提高了时间一致性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12193 2025-12-16 cs.CV 83%

SMRABooth: Subject and Motion Representation Alignment for Customized Video Generation

SMRABooth: 主体和运动表示对齐用于定制视频生成

Xuancheng Xu, Yaning Li, Sisi You, Bing-Kun Bao

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 SMRABooth通过自监督和光流编码器对齐主体和运动表示,提升定制视频生成中主体外观和运动模式的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00090 2025-12-12 cs.CV cs.AI 83%

LeMiCa: Lexicographic Minimax Path Caching for Efficient Diffusion-Based Video Generation

LeMiCa:基于词典极小极大路径缓存的高效扩散式视频生成

Huanlin Gao, Ping Chen, Fuyuan Shi, Chao Tan, Zhaoxiang Liu, Fang Zhao, Kai Wang, Shiguo Lian

机构 * Data Science & Artificial Intelligence Research Institute, China Unicom(数据科学与人工智能研究院,中国联合电信) Unicom Data Intelligence, China Unicom(中国联合电信数据智能中心)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 LeMiCa通过词典极小极大路径优化策略,提升扩散式视频生成的推理速度与生成质量,实现高效且高质量的视频合成。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04221 2025-12-11 cs.CV 83%

MoReGen: Multi-Agent Motion-Reasoning Engine for Code-based Text-to-Video Synthesis

MoReGen:基于代码领域的文本到视频合成多智能体运动-推理引擎

Xiangyu Bai, He Liang, Bishoy Galoaa, Utsav Nandi, Shayda Moezzi, Yuhang He, Sarah Ostadabbas

机构 * Northeastern University(东北大学) University of Oxford(牛津大学) Microsoft Research(微软研究院)

专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);分类 cs.CV

AI总结 MoReGen通过整合多智能体大语言模型、物理模拟器和渲染器,实现了基于代码领域的文本到视频合成,强调物理精度和运动一致性,为生成符合物理原理的视频提供了一种新的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08269 2025-12-10 cs.CV 83%

EgoX: Egocentric Video Generation from a Single Exocentric Video

EgoX:从单个外视视频生成自视视频

Taewoong Kang, Kinam Kim, Dohyeon Kim, Minho Park, Junha Hyung, Jaegul Choo

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 EgoX通过轻量级LoRA适应和统一条件策略,从单个外视视频生成自视视频,实现几何一致且逼真的视频生成,具有高可扩展性和鲁棒性。

Comments 21 pages, project page : https://keh0t0.github.io/EgoX

详情

展开后加载摘要…

URL PDF HTML 收藏