Harness Local Rewards for Global Benefits: Effective Text-to-Video Generation Alignment with Patch-level Reward Models
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract)
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract)
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract)
Comments 9 pages, 6 figures
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract)
专题命中 视频生成 :video generation(title,abstract);text-to-video(title);分类 cs.CV、cs.MM
Comments 5 pages,conference
CAPE-T2V:面向文本到视频生成中双侧条件对齐的以字幕生成器为锚点的提示增强方法
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
AI总结 该研究针对文本到视频生成中存在的PE-字幕 gap,提出CAPE-T2V框架,通过两步微调PE与DiT,在多个基准数据集上实现了更高的生成综合得分,有效缩小了训练与推理间的条件不匹配。
Comments Includes appendix; 11 figures. Project page: https://github.com/yizzz927/CAPE-T2V
当物理偏好遇到语义约束:用于文本到视频生成的物理和语义直接偏好优化
机构 * University of Nevada, Reno(内华达大学雷诺分校) ; Zhejiang University(浙江大学)
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
AI总结 文本到视频生成模型存在物理合理性与语义一致性的矛盾,提出物理和语义直接偏好优化方法(PSDPO),通过调节偏好对贡献,限制语义漂移,实现更可靠平衡,实验验证其在提高物理合理性和保持语义一致性上优于基线和现有方法。
Comments This work is accepted by ACM MM 2026
MAVEN:面向多元文化文本到视频生成的多智能体框架
机构 * Santa Clara University(圣克拉拉大学)
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
AI总结 提出MAVEN多智能体提示优化框架,通过并行或串行分解提示为人物、动作、地点维度,提升单文化和跨文化文本到视频生成的文化保真度,并构建包含243个文化提示和972个视频的基准进行评估。
Comments [14] pages, [6] figures, [11] tables, appendix included. Preprint
你的数据流形实际上是一个奖励模型:Shell-LCC 用于文本到视频生成
机构 * Huawei Central Research Institute(华为中央研究院) ; Guangdong University of Technology(广东技术大学)
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
AI总结 提出 Shell-LCC 方法,通过建模高质量 SFT 数据的流形结构,提供密集、可微且几乎零成本的奖励信号,以提升文本到视频生成质量,减少低层失真。
Comments ECCV 2026
DomainShuttle: 自由形式开放域主题驱动文本到视频生成
机构 * Hong Kong University of Science and Technology(香港科技大学)
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
AI总结 提出DomainShuttle方法,通过Domain-MoT解耦视频与参考特征、Video-Reference DualRoPE实现精确主体空间建模及Cross-Pair Consistent Loss提取本质特征,在开放域视频个性化中同时实现高保真与生成灵活性。
Comments 19 pages, 9 figures
物理问题场景图:文本到视频生成中物理合理性的细粒度评估
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; AI2(艾伦人工智能研究所) ; Johns Hopkins University(约翰霍普金斯大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 视频生成 :video generation(title,abstract);text-to-video(title);分类 cs.CV
AI总结 提出物理问题场景图(PQSG),一种基于层次化问题的评估流程,通过图结构问题检查视频在对象、动作和物理规律上的忠实度,实现细粒度评估。
Comments ECCV 2026. Code and data: https://github.com/atinpothiraj/pqsg
PhyGDPO: 物理感知的分组直接偏好优化以实现物理一致的文本到视频生成
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; Johns Hopkins University(约翰霍普金斯大学) ; Meta BizAI(Meta商业人工智能)
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
AI总结 提出PhyAugPipe构建大规模物理增强数据集PhyVidGen-135K,并设计PhyGDPO框架,利用分组Plackett-Luce模型和物理引导奖励机制,实现物理一致的文本到视频生成。
Comments ECCV 2026
Memento: 通过重建来记忆以实现一致的长视频生成
机构 * Xiamen University(厦门大学) ; ERNIE Team, Baidu Inc.(百度公司ERNIE团队)
专题命中 视频生成 :video generation(title,abstract);long video(title);分类 cs.CV
AI总结 提出Memento框架,通过主体重建引导和双查询记忆机制,解决长视频生成中主体一致性丢失问题,实现跨镜头连贯生成。
Comments Project page: https://ernie-research.github.io/Memento/
检索缺失内容:面向一致长视频生成的覆盖最大化检索
机构 * Korea University(韩国大学) ; KAIST(韩国科学技术院)
专题命中 视频生成 :video generation(title,abstract);long video(title);分类 cs.CV
AI总结 提出基于深度的覆盖最大化检索增强生成框架COVRAG,利用预训练3D先验构建轻量级覆盖图作为记忆证据,通过迭代检索最大化残差覆盖来提升长视频生成的几何一致性。
Comments 19 pages, 10 figures, 5 tables
SafeGen-Bench: 图像条件文本到视频生成中的安全性基准测试
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Tsinghua University(清华大学) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 视频生成 :video generation(title,abstract);text-to-video(title);分类 cs.CV
AI总结 针对图像条件文本到视频生成中安全文本和图像组合仍可能产生有害内容的问题,提出SafeGen-Bench基准,定义10个恶意类别并评估现有模型,发现当前模型难以避免生成恶意内容,且单模态护栏防御不足。
Comments 8 pages, 7 figures, 2 tables
World-R1:通过强化学习为文本到视频生成注入3D约束
机构 * Zhejiang University(浙江大学) ; Microsoft Research(微软研究院) ; Independent Researcher(独立研究者)
专题命中 视频生成 :video generation(title,abstract);text-to-video(title);分类 cs.CV
AI总结 提出World-R1框架,利用强化学习(Flow-GRPO)结合3D基础模型和视觉语言模型的反馈,在不修改架构的情况下增强视频生成的3D一致性,并采用周期解耦训练策略平衡刚体几何与动态场景。
Comments ICML 2026, Project Page: https://aka.ms/world-r1, Code: https://github.com/microsoft/World-R1
具有对齐检测和局部细化的自纠正文本到视频生成
机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; NTU Singapore(新加坡国立大学) ; Allen Institute for AI(人工智能研究院) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
AI总结 本文提出VideoRepair框架,通过检测并修正视频与文本提示的对齐问题,提升生成质量。框架分为三个阶段,保留正确生成区域并针对性修正错误部分,有效提升多种对齐指标。
Comments Accepted to ACL 2026 Findings. Project page: https://video-repair.github.io
通过AI反馈提升文本到视频生成中动态物体交互
机构 * Google DeepMind(谷歌DeepMind) ; The University of Tokyo(东京大学) ; Stanford University(斯坦福大学)
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
AI总结 本文研究如何利用反馈提升文本到视频模型中动态物体交互的质量,提出利用视觉语言模型提供针对性反馈,实验表明该方法在视频交互场景质量上有显著提升。
Comments Website: https://sites.google.com/view/aif-dynamic-t2v/
BrandFusion: 一种多智能体框架,用于文本到视频生成中的无缝品牌整合
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shenzhen Loop Area Institute(深圳河套学院) ; State University of New York at Buffalo(纽约州立大学布法罗分校) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
AI总结 BrandFusion通过多智能体框架实现文本到视频生成中的无缝品牌整合,提升品牌辨识度和内容自然度,推动T2V的可持续商业化应用。
通过校准稀疏注意力加速文本到视频生成
机构 * Apple Tel Aviv University(苹果以色列大学)
专题命中 视频生成 :video generation(title,abstract);text-to-video(title);分类 cs.CV
AI总结 CalibAtt通过校准稀疏注意力提升文本到视频生成的效率,实现1.58倍的加速效果。
PhyPrompt:基于强化学习的物理合理文本到视频生成的提示优化
机构 * Northwestern University(西北大学) ; Dolby Laboratories(杜比实验室)
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
AI总结 PhyPrompt通过强化学习优化提示,提升文本到视频生成的物理合理性,优于GPT-4o和DeepSeek-V3,实现更高效的物理常识和语义忠实度提升。
Dual-IPO: 双迭代偏好优化用于文本到视频生成
机构 * Fudan University(复旦大学) ; Shanghai Academy of AI for Science(上海人工智能科学研究院)
专题命中 视频生成 :video generation(title,abstract);text-to-video(title);分类 cs.CV
AI总结 Dual-IPO通过迭代优化奖励模型和视频生成模型,提升文本到视频生成的质量和人类偏好对齐,无需手动标注即可提高合成效果。
Comments To appear in ICLR 2026, GitHub Code: https://github.com/SAIS-FUXI/IPO
GRADEO: 通过多步骤推理实现文本到视频生成的人类级评估
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国) ; CSE department, The Chinese University of Hong Kong, Hong Kong,China(中国香港大学计算机科学与工程系,中国香港,中国) ; Department of Computer Science(计算机科学系) ; Engineering, The Hong Kong University of Science(工程,香港科学大学)
专题命中 视频生成 :video generation(title,abstract);text-to-video(title);分类 cs.CV
AI总结 GRADEO通过多步骤推理实现文本到视频生成的人类级评估,提出多维评估数据集和专门设计的视频评估模型,提升评估的可解释性和与人类判断的一致性。
机构 * Shanghai Jiao Tong University, Tencent Youtu Lab(上海交通大学,腾讯云图实验室) ; Tencent Youtu Lab(腾讯云图实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Tencent(腾讯)
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
Comments ACM Multimedia 2025; code URL: https://github.com/rain152/IPVG
机构 * Tsinghua University(清华大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; South China University of Technology(华南理工大学) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室) ; Singapore Management University(新加坡管理学院)
专题命中 视频生成 :video generation(title,abstract);text-to-video(title);分类 cs.CV
Comments Safa-Sora is accepted by NeurIPS 2025
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队)
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
Comments Accepted by ICCV 2025
机构 * CUHK(中文大学) ; HKUST(香港科技大学) ; Huawei Cloud(华为云) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 视频生成 :video generation(title,abstract);long video(title);分类 cs.CV
Comments ICCV 2025 camera-ready version, Project Website: https://flymin.github.io/magicdrive-v2/
机构 * San Jose State University(圣何塞州立大学) ; Guilin University of Electronic Technology(桂林电子科技大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Peng Cheng Laboratory(鹏城实验室) ; Shanghai AI Laboratory(上海人工智能实验室) ; Tongji University(同济大学)
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
机构 * Institute of Image Communication and Network Engineering(图像通信与网络工程研究所) ; MoE Key Lab of Artificial Intelligence(人工智能MoE重点实验室) ; AI Institute(人工智能研究院) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
机构 * University of Technology Sydney(悉尼技术大学) ; Zhejiang University(浙江大学)
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV