arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2141 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2141 篇

2603.19048 2026-07-07 cs.CV 版本更新 74%

Measuring 3D Spatial Geometric Consistency in Dynamic Video Generation

动态生成视频中3D空间几何一致性的测量

Weijia Dou, Wenzhao Zheng, Weiliang Chen, Yu Zheng, Jie Zhou, Jiwen Lu

机构 * Tongji University(同济大学) Tsinghua University(清华大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出SGC指标,用于评估动态生成视频中的3D空间几何一致性,通过分析多个相机姿态的分歧度来量化几何不一致问题,实验证实其能有效识别现有方法遗漏的关键故障。

Comments Accepted at ECCV 2026. Code is available at https://github.com/tj12323/SGC

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21466 2026-07-01 cs.CV 版本更新 74%

StreamEdit: Training-Free Video Editing via Few-Step Streaming Video Generation

StreamGVE: 无需训练的视频编辑通过少步流式视频生成

Guanlong Jiao, Chenyangguang Zhang, Jia Jun Cheng Xian, Zewei Zhang, Renjie Liao

机构 * The University of British Columbia(不列颠哥伦比亚大学) ETH Zürich(苏黎世联邦理工学院) McMaster University(麦马斯特大学) Vector Institute(向量研究所) Canada CIFAR AI Chair(加拿大 CIFAR 人工智能主席)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出StreamGVE,一种基于噪声到数据视角的视频编辑方法,通过引入双分支快速采样和自注意力桥接以及交叉注意力接地/增强,实现了高效的视频编辑,能够在少步设置中优于现有方法。

Comments ECCV 2026. Project Page: https://dsl-lab.github.io/StreamEdit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17461 2026-07-01 cs.CV 版本更新 74%

AR-CoPO: Align Autoregressive Video Generation with Contrastive Policy Optimization

AR-CoPO: 利用对比策略优化对齐自回归视频生成

Dailan He, Guanlin Feng, Xingtong Ge, Yi Zhang, Bingqi Ma, Guanglu Song, Yu Liu, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) Vivix Group Limited(Vivix集团有限公司) HKUST(香港科技大学) Shenzhen Loop Area Institute(深圳河套学院) CPII under InnoHK(InnoHK下的CPII)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 提出AR-CoPO框架,通过分叉机制构建邻域候选、分块级对齐和半在线训练策略,解决流式自回归视频生成中RLHF对齐难题,提升跨域泛化与人类偏好对齐。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25743 2026-06-30 cs.CV 74%

RefAlign: Representation Alignment for Reference-to-Video Generation

RefAlign:参考到视频生成的表示对齐

Lei Wang, YuXin Song, Ge Wu, Haocheng Feng, Hang Zhou, Jingdong Wang, Yaxing Wang, Jian Yang

机构 * PCA Lab, VCIP, College of Computer Science, Nankai University(南开大学计算机学院VCIP实验室PCA Lab) Baidu Inc.(百度公司) PCA Lab, School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院PCA Lab) College of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 RefAlign通过显式对齐DiT参考分支特征与视觉基础模型的语义空间,提升参考生成的准确性与可控性,实验表明其在R2V任务中优于现有方法。

Comments Accepted to ECCV 2026;Code: https://github.com/gudaochangsheng/RefAlign Project: https://gudaochangsheng.github.io/RefAlign-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03117 2026-06-29 cs.CV cs.SD 版本更新 74%

Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction

通过高级模态条件与交互驯服文本到发声视频生成

Kaisi Guan, Xihua Wang, Zhengfeng Lai, Xin Cheng, Peng Zhang, XiaoJiang Liu, Ruihua Song, Meng Cao

机构 * Renmin University of China(中国人民大学) Apple(苹果公司)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 提出分层视觉基础字幕框架(HVGC)生成解耦的视频和音频字幕,并基于此引入双塔扩散变换器BridgeDiT,通过双交叉注意力机制实现对称双向信息交互,在三个基准数据集上达到最先进结果。

Comments The 19th European Conference on Computer Vision -- ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17030 2026-06-18 cs.CV 新提交 74%

Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation

Qwen-RobotWorld技术报告:通过语言条件视频生成统一具身世界模型

Jie Zhang, Xiaoyue Chen, Anzhe Chen, Dayiheng Liu, Deqing Li, Gengze Zhou, Hale Yin, Haoqi Yuan, Haoyang Li, Jiahao Li, Jiazhao Zhang, Jingren Zhou, Kaiyuan Gao, Kun Yan, Lihan Jiang, Ningyuan Tang, Pei Lin, Qihang Peng, Shengming Yin, Tianhe Wu, Tianyi Yan, Xiao Xu, Yan Shu, Yanran Zhang, Ye Wang, Yi Wang, Yilei Chen, Yixian Xu, Yiyang Huang, Yuxiang Chen, Zekai Zhang, Zhendong Wang, Zixing Lei, Zhixuan Liang, Zihao Liu, Zikai Zhou, Chenxu Lv, Xiong-Hui Chen, Chenfei Wu

机构 * Qwen Team(Qwen团队)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 提出Qwen-RobotWorld,一种以自然语言为统一动作接口的语言条件视频世界模型,通过双流MMDiT、大规模具身世界知识语料和渐进式课程训练,在机器人操作、自动驾驶等任务中实现物理一致的未来视觉轨迹预测,在多个基准上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01900 2026-06-16 cs.CV 版本更新 74%

Auteur: Language-Driven Cinematographic Framing for Human-Centric Video Generation

Auteur: 以语言驱动的电影化取景实现以人为中心的视频生成

Muhammed Burak Kizil, Enes Sanli, Niloy J. Mitra, Xuelin Chen, Erkut Erdem, Aykut Erdem, Duygu Ceylan

机构 * Koç University(科克大学) University College London(伦敦大学学院) Adobe(Adobe公司) Hacettepe University(哈切特佩大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 提出Auteur方法,通过将相机运动参数化为以人为中心的取景(包括镜头尺寸、角度和构图),并利用领域特定语言(DSL)和微调的多模态大语言模型,实现语言驱动的电影化取景,在人类中心视频生成中优于现有方法。

Comments Project Page: https://cyberiada.github.io/Auteur/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13872 2026-06-15 cs.CV 新提交 74%

Avatar V: Scaling Video-Reference Avatar Video Generation

Avatar V:缩放视频参考的化身视频生成

Benjamin Liang, Ce Chen, Desmond Lin, Ivan Somov, Jiajun Zhao, Jiewei Yuan, Jingfeng Zhang, Junhao Huang, Nik Nolte, Pedram Haqiqi, Penghan Wang, Rong Yan, Rui Zhang, Sam Prokopchuk, Sivan Wang, Viktor Goriachko, Yi Ren, Yuanming Li, Yutao Chen, Zhenhui Ye, Zhibin Hong, Zilong Nie, Zujin Guo

机构 * HeyGen Research(HeyGen 研究院)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 提出Avatar V框架,通过视频参考条件化身份建模,利用稀疏参考注意力机制实现长视频线性复杂度条件化,结合运动表示流和身份感知超分辨率精炼器,生成无限时长1080p视频,在身份保持、唇形同步和质量上超越现有方法。

Comments 31 pages, 15 figures. All contributors are listed in alphabetical order by first name

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05665 2026-06-05 cs.CV 74%

V2V-Bench: A Comprehensive Benchmark for Video-to-Video Generation Evaluation

V2V-Bench:视频到视频生成评估的综合基准

Tao Liu, Leela Krishna, Gouti Pavan Kumar, Sreeja K, Vishav Garg

机构 * Centific Global Solutions Inc.(Centific全球解决方案公司)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 针对视频到视频生成评估中现有指标无法同时衡量编辑指令遵循和帧级对应的问题,提出包含11个维度、5个类别的V2V-Bench基准,评估三个模型并验证其与人类判断高度相关。

Comments Accepted at ICML 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19741 2026-06-05 cs.CV 74%

CityRAG: Stepping Into a City via Spatially-Grounded Video Generation

CityRAG: 通过空间感知的视频生成进入城市

Gene Chou, Charles Herrmann, Kyle Genova, Boyang Deng, Songyou Peng, Bharath Hariharan, Jason Y. Zhang, Noah Snavely, Philipp Henzler

机构 * Google(谷歌) Cornell University(康奈尔大学) Stanford University(斯坦福大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 CityRAG通过利用地理注册数据的大型语料库,生成空间一致且可导航的真实环境视频,其核心方法是结合学习的先验知识和时空不一致训练数据,以实现复杂的运动和外观变化。

Comments Project page: cityrag.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26105 2026-05-26 cs.CV 74%

On-Policy Adversarial Flow Distillation for Autoregressive Video Generation

自回归视频生成中的策略对抗流蒸馏

Yang Luo, Shengju Qian, Xiaohang Tang, Zirui Zhu, Yong Liu, Xin Wang, Yang You

机构 * LIGHTSPEED University College London(伦敦大学学院)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 提出策略对抗流蒸馏(AFD)框架,通过策略内对抗性反馈和正向过程流匹配,实现从异构黑盒教师模型向自回归学生模型的高效蒸馏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10543 2026-05-26 cs.CV 74%

TIE: Time Interval Encoding for Video Generation over Events

TIE:面向事件视频生成的时间区间编码

Zhilei Shu, Shangwen Zhu, Zihang Liang, Xiaofan Li, Qianyu Peng, Xinyu Cui, Bo Ye, Yiming Li, Fan Cheng, Jian Zhao, Yang Cao, Zheng-Jun Zha, Ruili Feng

机构 * University of Science and Technology of China(中国科学技术大学) Matrix Team(Matrix团队) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) University of Waterloo(滑铁卢大学) The Pennsylvania State University(宾夕法尼亚州立大学) Zhongguancun Academy(中关村学院) The University of Hong Kong(香港大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 提出时间区间编码(TIE),将旋转位置嵌入推广为区间感知形式,解决扩散变换器(DiT)在重叠事件视频生成中时间区间无法表示的问题,显著提升时间可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22563 2026-05-22 cs.CV 74%

Cell Phantom Video Generation in Elliptical Fourier Descriptor Domain

椭圆傅里叶描述符域中的细胞假体视频生成

Francesco Benedetto, Roberto Basla, Luca Magri, Giacomo Boracchi

机构 * Department of Electronics Information and Bioengineering(电子信息与生物工程系)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本研究提出了一种在椭圆傅里叶描述符(EFD)域中生成细胞假体视频的新框架,通过将细胞假体演变表示为多变量时间序列的EFD系数,引入了强先验知识,从而高效生成在时间上一致的视频,验证了在EFD空间建模时间演变能够生成生物合理性的假体视频,为合成标注数据生成提供了方法,减少了标注努力。

Comments 6 pages, Accepted at the International Conference on Image Processing (ICIP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06310 2026-05-20 cs.CV 74%

Scene-Action Prompt Fusion for Coherent Text-to-Video Storytelling

场景-动作提示融合用于连贯的文本到视频叙事

Taewon Kang, Divya Kothandaraman, Ming C. Lin

机构 * University of Maryland at College Park(马里兰大学学院市分校) Dolby Laboratories(杜比实验室)

专题命中 视频生成 :text-to-video(title);分类 cs.CV

AI总结 本文提出了一种整合场景和动作提示的叙事框架,通过动态启发的提示混合策略,解决文本到视频生成中时间一致性、语义一致性和场景-动作连续性的问题,通过三个关键组件实现了更连贯的视频叙事。

Comments Accepted to the 2026 IEEE International Conference on Image Processing (ICIP 2026). 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06356 2026-05-12 cs.CV 74%

SwiftI2V: Efficient High-Resolution Image-to-Video Generation via Conditional Segment-wise Generation

SwiftI2V: 通过条件分段生成实现高效的高分辨率图像到视频生成

YaoYang Liu, Yuechen Zhang, Wenbo Li, Yufei Zhao, Rui Liu, Long Chen

机构 * HKUST(香港科技大学) CUHK(香港大学) Joy Future Academy(京东探索研究院) HKU(香港大学) HUAWEI Research(华为研究)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出SwiftI2V框架,通过分段生成和双向上下文交互,在2K分辨率下实现高效图像到视频生成,相比端到端模型减少GPU时间202倍。

Comments 27 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06051 2026-05-08 cs.CV 74%

RealCam: Real-Time Novel-View Video Generation with Interactive Camera Control

RealCam: 通过交互式相机控制实现实时新视角视频生成

Youcan Xu, Jiaxin Shi, Zhen Wang, Wensong Song, Feifei Shao, Chen Liang, Jun Xiao, Long Chen

机构 * Zhejiang University(浙江大学) Xmax.AI Ltd.(Xmax.AI有限公司) Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 RealCam提出一种自回归框架,实现交互式实时相机控制的视频到视频生成,通过交叉帧上下文学习和循环闭合数据增强提升生成质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10837 2026-04-14 cs.CV 74%

Immune2V: Image Immunization Against Dual-Stream Image-to-Video Generation

Immune2V: 图像免疫对抗双流图像到视频生成

Zeqian Long, Ozgur Kara, Haotian Xue, Yongxin Chen, James M. Rehg

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 针对图像到视频生成中对抗性攻击的鲁棒性问题,提出Immune2V框架,通过时间平衡的潜在差异和预计算的崩溃诱导轨迹提升防御效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05091 2026-04-13 cs.CV 74%

PoseGen: In-Context LoRA Finetuning for Pose-Controllable Long Human Video Generation

PoseGen: 一种基于上下文LoRA微调的长人类视频生成框架

Jingxuan He, Busheng Su, Finn Wong

机构 * Xiaoice, China(小冰公司,中国) The University of Sydney, Australia(悉尼大学,澳大利亚)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 PoseGen通过上下文LoRA微调实现对人物姿态的精细控制,生成长时长视频,解决了身份漂移和视频长度限制问题。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23279 2026-04-07 cs.CV cs.AI 74%

Vid-Freeze: Protecting Images from Malicious Image-to-Video Generation via Temporal Freezing

Vid-Freeze:通过时间冻结保护图像免受恶意图像到视频生成的侵害

Rohit Chowdhury, Aniruddha Bala, Rohan Jaiswal, Siddharth Roheda

机构 * Samsung(三星)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出Vid-Freeze,通过在生成视频中添加不可察觉的扰动,强制时间冻结,抑制I2V模型中的注意力动态,从而阻止恶意内容生成。

Comments Under Review at ACM-MM 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25931 2026-03-30 cs.CV cs.AI 74%

DiReCT: Disentangled Regularization of Contrastive Trajectories for Physics-Refined Video Generation

DiReCT:对比轨迹解耦的对比正则化用于物理精细视频生成

Abolfazl Meyarian, Amin Karimi Monsefi, Rajiv Ramnath, Ser-Nam Lim

机构 * Path Robotics The Ohio State University(俄亥俄州立大学) University of Central Florida(中佛罗里达大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出DiReCT方法,通过解耦对比轨迹正则化提升物理精细视频生成的物理合理性,改进VideoPhy的物理常识评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23132 2026-03-25 cs.CV 74%

InterDyad: Interactive Dyadic Speech-to-Video Generation by Querying Intermediate Visual Guidance

InterDyad:通过查询中间视觉指导实现交互式双人语音到视频生成

Dongwei Pan, Longwei Guo, Jiazhi Guan, Luying Huang, Yiding Li, Haojie Liu, Haocheng Feng, Wei He, Kaisiyuan Wang, Hang Zhou

机构 * Baidu Inc.(百度公司)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出InterDyad框架,通过查询结构运动指导实现自然交互动态合成,解决双人场景中跨个体依赖和精细行为控制问题,提出交互性注入器、元查询模态对齐机制和角色感知双人高斯指导等方法,提升唇形同步和空间一致性。

Comments Project Page: https://interdyad.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21299 2026-03-24 cs.CV 74%

Identity-Consistent Video Generation under Large Facial-Angle Variations

在大面部角度变化下实现身份一致的视频生成

Bin Hu, Zipeng Qi, Guoxi Huang, Zunnan Xu, Ruicheng Zhang, Chongjie Ye, Jun Zhou, Xiu Li, Jingdong Wang

机构 * Tsinghua University(清华大学) Baidu Inc., China(百度公司) University of Bristol(布里斯托大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出Mv²ID框架,通过区域遮蔽训练策略和参考解耦RoPE机制,解决大角度变化下的身份一致性与自然运动平衡问题,并构建大规模数据集和评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16931 2026-03-19 cs.CV cs.AI 74%

Script-to-Slide Grounding: Grounding Script Sentences to Slide Objects for Automatic Instructional Video Generation

脚本到幻灯片接地:将脚本句子接地到幻灯片对象以实现自动教学视频生成

Rena Suzuki, Masato Kikuchi, Tadachika Ozono

机构 * Nagoya Institute of Technology(名古屋技术大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出Script-to-Slide Grounding任务,利用大语言模型实现脚本与幻灯片对象的自动接地,实验显示F1分数达0.924,为自动化幻灯片视频编辑奠定基础。

Comments The 21st International Conference on E-Service and Knowledge Management (ESKM 2025-Winter)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09488 2026-03-12 cs.CV 74%

Streaming Autoregressive Video Generation via Diagonal Distillation

通过对角蒸馏实现流式自回归视频生成

Jinxiu Liu, Xuanming Liu, Kangfu Mei, Yandong Wen, Ming-Hsuan Yang, Weiyang Liu

机构 * South China University of Technology(南方科技大学) Westlake University(西湖大学) Johns Hopkins University(约翰霍普金斯大学) University of California, Merced(加州大学默塞德分校) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出对角蒸馏方法,通过不对称生成策略和隐式光学流建模,在减少计算步骤的同时提升视频生成的运动质量和效率。

Comments ICLR 2026 (31 pages, 10 figures, project page: https://spherelab.ai/diagdistill/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03646 2026-03-05 cs.CV 74%

InfinityStory: Unlimited Video Generation with World Consistency and Character-Aware Shot Transitions

InfinityStory: 无限视频生成与世界一致性及角色感知镜头过渡

Mohamed Elmoghany, Liangbing Zhao, Xiaoqian Shen, Subhojyoti Mukherjee, Yang Zhou, Gang Wu, Viet Dac Lai, Seunghyun Yoon, Ryan Rossi, Abdullah Rashwan, Puneet Mathur, Varun Manjunatha, Daksh Dangi, Chien Nguyen, Nedim Lipka, Trung Bui, Krishna Kumar Singh, Ruiyi Zhang, Xiaolei Huang, Jaemin Cho, Yu Wang, Namyong Park, Zhengzhong Tu, Hongjie Chen, Hoda Eldardiry, Nesreen Ahmed, Thien Nguyen, Dinesh Manocha, Mohamed Elhoseiny, Franck Dernoncourt

机构 * Adobe Research(Adobe研究院) KAUST(卡塔尔科技大学) University of Oregon(俄勒冈大学) University of Memphis(密苏里大学孟菲斯分校) Johns Hopkins University(约翰霍普金斯大学) Meta AI Texas A&M University(德克萨斯农工大学) Dolby Labs(杜比实验室) Virginia Tech(弗吉尼亚理工大学) Cisco(思科) University of Maryland, College Park(马里兰大学学院市分校)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 InfinityStory通过引入背景一致的生成管道和过渡感知的视频合成模块,实现了多主体场景下的长篇视频生成,提升了背景一致性、主体一致性和时间连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18573 2026-03-05 cs.CV cs.AI 74%

Kaleido: Open-Sourced Multi-Subject Reference Video Generation Model

Kaleido:开源多主体参考视频生成模型

Zhenxing Zhang, Jiayan Teng, Zhuoyi Yang, Tiankun Cao, Cheng Wang, Xiaotao Gu, Jie Tang, Dan Guo, Meng Wang

机构 * Hefei University of Technology(合肥工业大学) Tsinghua University(清华大学) Zhipu AI(智谱AI)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 Kaleido通过改进的数据构建和参考旋转位置编码,提升了多主体参考视频生成的一致性、保真度和泛化能力。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07595 2026-02-10 cs.CV cs.AI 74%

TeleBoost: A Systematic Alignment Framework for High-Fidelity, Controllable, and Robust Video Generation

TeleBoost:一种系统对齐框架,用于高保真、可控且稳健的视频生成

Yuanzhi Liang, Xuan'er Wu, Yirui Liu, Yijie Fang, Yizhen Fan, Ke Hao, Rui Li, Ruiying Liu, Ziqi Ni, Peng Yu, Yanbo Wang, Haibin Huang, Qizhen Weng, Chi Zhang, Xuelong Li

机构 * TeleBoost Team(TeleBoost团队)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 TeleBoost提出了一种系统化的训练后框架,通过整合监督策略塑造、奖励驱动强化学习和偏好细化,提升视频生成的保真度、时间连续性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02444 2026-02-04 cs.IR cs.CV 74%

RANKVIDEO: Reasoning Reranking for Text-to-Video Retrieval

RANKVIDEO: 文本到视频检索中的推理重排序

Tyler Skow, Alexander Martin, Benjamin Van Durme, Rama Chellappa, Reno Kriz

机构 * Johns Hopkins University(约翰霍普金斯大学) Human Language Technology Center of Excellence(人机语言技术卓越中心)

专题命中 视频生成 :text-to-video(title);分类 cs.CV

AI总结 RANKVIDEO通过基于视频内容的推理机制,提升了文本到视频检索的重排序性能,实验显示在nDCG@10上平均提升31%,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05241 2026-01-09 cs.CV cs.AI cs.RO 74%

RoboVIP: Multi-View Video Generation with Visual Identity Prompting Augments Robot Manipulation

RoboVIP: 多视角视频生成与视觉身份提示增强机器人操作

Boyang Wang, Haoran Zhang, Shujie Zhang, Jinkun Hao, Mingda Jia, Qi Lv, Yucheng Mao, Zhaoyang Lyu, Jia Zeng, Xudong Xu, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) University of Michigan(密歇根大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 RoboVIP通过引入视觉身份提示和可扩展的视觉身份池,提升机器人操控数据的质量与多样性,从而增强视觉语言-动作和视觉-运动政策模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01352 2026-01-06 cs.CV cs.AI 74%

Slot-ID: Identity-Preserving Video Generation from Reference Videos via Slot-Based Temporal Identity Encoding

Slot-ID: 通过基于槽的时序身份编码从参考视频中生成身份保持的视频

Yixuan Lai, He Wang, Kun Zhou, Tianjia Shao

机构 * State Key Lab of CAD&CG(计算机辅助设计与图形学国家重点实验室) University College London(伦敦大学学院) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 Slot-ID通过基于槽的时序身份编码从参考视频生成身份保持的视频,提升大姿态变化下的身份保留和视觉真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏