arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 106 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 106 篇

2605.21466 2026-07-01 cs.CV 版本更新 74%

StreamEdit: Training-Free Video Editing via Few-Step Streaming Video Generation

StreamGVE: 无需训练的视频编辑通过少步流式视频生成

Guanlong Jiao, Chenyangguang Zhang, Jia Jun Cheng Xian, Zewei Zhang, Renjie Liao

机构 * The University of British Columbia(不列颠哥伦比亚大学) ETH Zürich(苏黎世联邦理工学院) McMaster University(麦马斯特大学) Vector Institute(向量研究所) Canada CIFAR AI Chair(加拿大 CIFAR 人工智能主席)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出StreamGVE,一种基于噪声到数据视角的视频编辑方法,通过引入双分支快速采样和自注意力桥接以及交叉注意力接地/增强,实现了高效的视频编辑,能够在少步设置中优于现有方法。

Comments ECCV 2026. Project Page: https://dsl-lab.github.io/StreamEdit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17461 2026-07-01 cs.CV 版本更新 74%

AR-CoPO: Align Autoregressive Video Generation with Contrastive Policy Optimization

AR-CoPO: 利用对比策略优化对齐自回归视频生成

Dailan He, Guanlin Feng, Xingtong Ge, Yi Zhang, Bingqi Ma, Guanglu Song, Yu Liu, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) Vivix Group Limited(Vivix集团有限公司) HKUST(香港科技大学) Shenzhen Loop Area Institute(深圳河套学院) CPII under InnoHK(InnoHK下的CPII)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 提出AR-CoPO框架,通过分叉机制构建邻域候选、分块级对齐和半在线训练策略,解决流式自回归视频生成中RLHF对齐难题,提升跨域泛化与人类偏好对齐。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03117 2026-06-29 cs.CV cs.SD 版本更新 74%

Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction

通过高级模态条件与交互驯服文本到发声视频生成

Kaisi Guan, Xihua Wang, Zhengfeng Lai, Xin Cheng, Peng Zhang, XiaoJiang Liu, Ruihua Song, Meng Cao

机构 * Renmin University of China(中国人民大学) Apple(苹果公司)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 提出分层视觉基础字幕框架(HVGC)生成解耦的视频和音频字幕,并基于此引入双塔扩散变换器BridgeDiT,通过双交叉注意力机制实现对称双向信息交互,在三个基准数据集上达到最先进结果。

Comments The 19th European Conference on Computer Vision -- ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01900 2026-06-16 cs.CV 版本更新 74%

Auteur: Language-Driven Cinematographic Framing for Human-Centric Video Generation

Auteur: 以语言驱动的电影化取景实现以人为中心的视频生成

Muhammed Burak Kizil, Enes Sanli, Niloy J. Mitra, Xuelin Chen, Erkut Erdem, Aykut Erdem, Duygu Ceylan

机构 * Koç University(科克大学) University College London(伦敦大学学院) Adobe(Adobe公司) Hacettepe University(哈切特佩大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 提出Auteur方法,通过将相机运动参数化为以人为中心的取景(包括镜头尺寸、角度和构图),并利用领域特定语言(DSL)和微调的多模态大语言模型,实现语言驱动的电影化取景,在人类中心视频生成中优于现有方法。

Comments Project Page: https://cyberiada.github.io/Auteur/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09449 2026-08-12 cs.CV 版本更新 70%

Sekai2: From World Exploration to Interactive World Modeling

Sekai2:从世界探索到交互式世界建模

Kang He, Wenshuo Peng, Zihui Gao, Jiaming Tan, Kaipeng Zhang, Yongtao Ge

机构 * Alaya Lab(Alaya实验室) Shanghai Innovation Institute(上海创新研究院) Wuhan University(武汉大学) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV

AI总结 研究人员推出多源真实世界视频数据集Sekai2,其具备丰富观测数据与标注,可用于长时程视频生成、相机可控合成及交互式世界模型预训练。

Comments Sekai2 dataset technical report. Developed at Alaya Lab

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14686 2026-08-04 cs.CV cs.AI 版本更新 70%

MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model

MVHOI: 通过3D基础模型桥接多视角条件与复杂人-物体交互视频重现

Jinguang Tong, Jinbo Wu, Kaisiyuan Wang, Zhelun Shen, Xuan Huang, Mochu Xiang, Xuesong Li, Yingying Li, Haocheng Feng, Chen Zhao, Hang Zhou, Wei He, Chuong Nguyen, Jingdong Wang, Hongdong Li

专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV

AI总结 本文提出MVHOI框架,通过3D基础模型结合多视角参考条件,生成复杂人-物体交互视频,提升了长时视频生成的性能。

Comments Project page: https://mvhoi.hirotong.fun

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05394 2026-07-27 cs.CV 版本更新 70%

Delving into Latent Spectral Biasing of Video VAEs for Superior Diffusability

深入探究视频VAE的潜在频谱偏置以实现更优的可扩散性

Shizhan Liu, Xinran Deng, Zhuoyi Yang, Jiayan Teng, Xiaotao Gu, Jie Tang

机构 * Zhipu AI, Beijing, China(智谱AI,北京,中国) Tsinghua University, Beijing, China(清华大学,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文通过统计分析发现视频VAE潜在空间的频谱特性对扩散训练至关重要,提出局部相关正则化和潜在掩码重建两种轻量级正则化器,实现3倍收敛加速和10%视频奖励提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12035 2026-07-22 cs.AR cs.CV 版本更新 70%

Timeripple: Accelerating vDiTs by Understanding the Spatio-Temporal Correlations in Latent Space

Timeripple:通过理解潜在空间中的时空相关性加速视频扩散变换器

Wenxuan Miao, Yulin Sun, Aiyue Chen, Jing Lin, Yiwu Yao, Yiming Gan, Jieru Zhao, Jingwen Leng, Minyi Guo, Yu Feng

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Qizhi Institute(上海启智研究院) Huawei Technologies Co.,Ltd(华为技术有限公司) Institute of Computing Technology, Chinese Academy of Science(中国科学院计算技术研究所)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 针对视频生成中vDiT模型推理延迟问题,利用潜在空间时空相关性,提出轻量级自适应重用策略,通过重用相关令牌部分注意力分数近似计算,相比现有技术计算节省85%,且视频质量损失小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13030 2026-07-08 cs.CV 版本更新 70%

Generative Refinement Networks for Visual Synthesis

生成细化网络用于视觉合成

Jian Han, Jinlai Liu, Jiahuan Wang, Bingyue Peng, Zehuan Yuan

机构 * ByteDance(字节跳动)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出生成细化网络(GRN),通过近无损分层二进制量化解决离散化瓶颈,结合全局细化机制和熵引导采样策略,提升图像生成质量与效率。

Comments code: https://github.com/bytedance/GRN

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05672 2026-07-07 cs.CV cs.AI cs.LG 版本更新 70%

InverseCrafter: Efficient Video ReCapture as a Latent Domain Inverse Problem

InverseCrafter:作为潜在域逆问题的高效视频重新捕捉

Yeobin Hong, Suhyeon Lee, Hyungjin Chung, Jong Chul Ye

机构 * Graduate School of AI, KAIST, South Korea(韩国釜山国立大学人工智能研究生院) EverEx, South Korea(韩国EverEx公司) Korea University, South Korea(韩国国立庆熙大学)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出InverseCrafter框架,将新视角视频生成转化为潜在空间基于图像修复的逆问题,通过轻量级潜在掩码编码器建立算子等价,无需标注4D训练数据,实现高效合成与编辑。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13546 2026-07-07 cs.CV 版本更新 70%

NABLA: Neighborhood Adaptive Block-Level Attention

$\nabla$NABLA:邻域自适应块级注意力

Dmitrii Mikhailov, Aleksey Letunovskiy, Maria Kovaleva, Vladimir Arkhipkin, Vladimir Korviakov, Vladimir Polovnikov, Viacheslav Vasilev, Evelina Sidorova, Denis Dimitrov

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出NABLA,一种邻域自适应块级注意力机制,通过自适应稀疏性驱动阈值减少计算开销,保持生成质量,无需定制低层运算符,可无缝集成PyTorch的Flex Attention。实验表明,NABLA在训练和推理速度上提升2.7倍,几乎不牺牲定量指标和视觉质量。

Journal ref IEEE Access, vol. 14, pp. 64655-64665, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17492 2026-08-14 cs.CV 版本更新 57%

EvDiff: Event-Based Video Reconstruction using One-Step Diffusion Models

EvDiff:高质视频与事件相机

Weilun Li, Lei Sun, Ruixi Gao, Qi Jiang, Yuqin Ma, Kaiwei Wang, Ming-Hsuan Yang, Luc Van Gool, Danda Pani Paudel

机构 * Zhejiang University(浙江大学) INSAIT UC Merced(加州大学默塞德分校) Google DeepMind(谷歌DeepMind)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 EvDiff通过基于事件的扩散模型和替代训练框架,从单色事件流生成高质量彩色视频,提升视频生成的保真度和现实感。

Comments Replacement note: This manuscript has been transferred from the CVPR format to the ECCV 2026 format, with the corresponding title and template updated accordingly. The technical content remains largely unchanged from the previous version. (Current version: 21 pages, 6 figures, and 3 tables.) Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07468 2026-08-12 cs.CV 版本更新 57%

SimWAM: A Simple World Action Model for End-to-End Autonomous Driving

SimWAM:一种用于端到端自动驾驶的简单世界动作模型

Zongchuang Zhao, Xin Zhou, Tianyang Xu, Zhengyang Sun, Kaixuan Zhou, Honglin Li, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science & Technology(华中科技大学) Dongfeng Research & Development Institute(东风研发院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 SimWAM是一种仅将视频生成用作训练信号的简单WAM,通过联合流匹配协同训练视频与动作专家,在NAVSIM上达91.5 PDMS且延迟更低,可零样本迁移至nuScenes,为高效自动驾驶提供可靠基线。

Comments The code and model weights are available at https://github.com/H-EmbodVis/SimWAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14556 2026-08-11 cs.CV cs.AI 版本更新 57%

Controllable Video Object Insertion via Multi-View Priors

通过多视角先验实现可控的视频物体插入

Qi Xia, Peishan Cong, Yichen Yao, Ziyi Wang, Yaoqin Ye, Yuexin Ma

机构 * ShanghaiTech University(上海科技大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出一种通过多视角先验解决视频物体插入中外观不一致和遮挡问题的新方法,采用双路径视图一致条件机制和质量感知加权机制,提升插入物体的稳定性和真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01720 2026-08-10 cs.CV cs.AI cs.CL 版本更新 57%

SignVerse-2M: A Two-Million-Clip Pose-Native Universe of 55+ Sign Languages

SignVerse-2M:包含55+种手语的两百万片段姿态原生数据集

Sen Fang, Hongbin Zhong, Yanxin Zhang, Dimitris N. Metaxas

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出SignVerse-2M,这是一个包含55+种手语、约200万片段的大规模多语言姿态原生手语数据集,适配现代姿态驱动的生成与识别范式,兼具真实场景适配性,可支撑多语言手语姿态建模与评估。

Comments Fix some typos. 13 pages. Project Page at: https://signerx.github.io/SignVerse-2M/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08260 2026-08-10 cs.CV 版本更新 57%

TIDE: Task-Isolated Diffusion for Unified Video Editing and Generation

TIDE: 任务隔离扩散模型用于统一视频编辑与生成

Qi Liu, Gang Yue, Mingyu Yin, Lisai Zhang, Yidi Wu, Yaole Wang, Yaohui Wang, Chang Yao, Jingyuan Chen, Lin Ma

机构 * Zhejiang University(浙江大学) Bilibili Inc.(哔哩哔哩股份有限公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出TIDE统一框架,通过逐token任务嵌入和双路径条件机制,实现指令编辑、参考编辑和多参考生成,在多任务渐进训练下达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26237 2026-08-07 cs.CV 版本更新 57%

LumaGuide: Distribution Shaping for Training-Free HDR Generation in Diffusion Models

LumaGuide:用于扩散模型中无需训练的高动态范围(HDR)生成的分布塑造方法

Bowen Chen, Shreshth Saini, Balu Adsumilli, Alan C. Bovik

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Google/YouTube(谷歌/YouTube) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本研究提出无需训练的LumaGuide框架,通过在采样时直接塑造输出分布,实现扩散模型的可控生成,可用于HDR及视频生成,无需重新训练模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16278 2026-08-07 cs.CV cs.AI 版本更新 57%

RealityBridge: Bridging Editable 3D Gaussian Splatting Driving Simulations and Real-World Videos

RealityBridge: 连接可编辑3D高斯泼溅驾驶模拟与现实世界视频

Zhenhua Wu, Yun Pang, Mingkun Chang, Yuwei Ning, Liangzhi Wang, Yi Xiao, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Information Security Technology(广东省信息安全技术重点实验室) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education(教育部机器智能与先进计算重点实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出RealityBridge框架,利用多模态控制和轻量级GateNet,结合自回归长视频训练与奖励引导后训练,缩小编辑后3DGS驾驶视频的Sim-to-Real差距,提升视觉真实感和时间一致性。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16987 2026-08-07 cs.CV 版本更新 57%

DVAR: Adversarial Multi-Agent Debate for Video Authenticity Detection

DVAR:对抗性多智能体辩论用于视频真实性检测

Hongyuan Qi, Feifei Shao, Ming Li, Hehe Fan, Jun Xiao

机构 * Zhejiang University(浙江大学) Guangming Lab(光明实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 DVAR通过多智能体辩论框架,将视频真实性检测转化为结构化推理过程,利用生成假设代理与自然机制代理的竞争,结合MDL框架和GenVideoKB知识库,实现对未知生成架构的强泛化能力。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00094 2026-08-05 cs.CV 版本更新 57%

Video Models as Native 4D Renderers: World-Grounded Conditioning from Animated Mesh

视频模型作为原生4D渲染器:基于动画网格的世界 grounding 条件

Junhao Chen, Mingjin Chen, Henghaofan Zhang, Minglin Chen, Liaoyuan Fan, Boran Zhang, Saining Zhang, Mingze Sun, Hao Zhao, Ruqi Huang, Zhihao Li, Yufei Wang

机构 * Tsinghua University(清华大学) The Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学) Sun Yat-sen University(中山大学) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

AI总结 该研究提出参考引导渲染器DAR,扩展Wan2.2相机控制,用跟踪和世界位置组成的4D G缓冲作为条件,在DAR-4D基准上实现优于现有方法的视频生成性能。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28394 2026-08-04 cs.CV 版本更新 57%

Hand-Object Interaction in the Age of Large Foundation Models:Reconstruction, Generation, and Embodied Transfer

大基础模型时代的手物交互:重建、生成与具身迁移

Weiquan Lin, Yu Deng, Shiyang Liu, Luping Xiao, Xu Tang, Junzhi Yu, Jiaolong Yang, Lei Zhang, Xingyu Chen

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本综述系统梳理大基础模型在手物交互(HOI)领域的应用,建立基础模型子先验分类,分析其在HOI任务与机器人学习中的作用,总结数据集与评估协议并展望未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30514 2026-08-04 cs.CV 版本更新 57%

3D Scene-Adaptive Trajectory-Controllable Human Image Animation with Camera Movement

3D场景自适应轨迹可控的人体图像动画与相机运动

Deyin Liu, Jicheng Xu, Lin Yuanbo Wu, Xiaowei Zhao, Xiatian Zhu, Zhe Jin, Anjan Dutta

机构 * Engineering Research Center of Autonomous Unmanned System Technology(自主无人系统工程研究中心) Ministry of Education(教育部) Anhui Provincial Key Laboratory of Security Artificial Intelligence(安徽省安全人工智能重点实验室) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) University of Warwick(沃林格大学) Zhejiang Yuexiu University(浙江越秀大学) University of Surrey(萨里大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出场景自适应人体动画框架,通过地面自适应3D运动重定向和视角自适应潜在融合机制,实现自然场景中人体运动与相机轨迹的可控视频生成。

Comments Accepted to the 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23855 2026-08-03 cs.SD cs.CV 版本更新 57%

OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation

OmniVAE:用于联合生成的具有跨模态对齐的音频-视频变分自编码器

Jun Zhan, Chen Yang, Yitian Gong, Donghua Yu, Kuangwei Chen, Wenbo Zhang, Kexin Huang, Qi Luo, Zhe Xu, Ying Zhu, Jin Wang, Tengyue Zhang, Qi Chen, Cheng Chang, Songlin Wang, Junqi Dai, Jiasheng Ye, Xiaogui Yang, Tianyi Liang, Xiangyu Peng, Zhaoye Fei, Shimin Li, Qinyuan Cheng, Xie Chen, Xinchi Chen, Xipeng Qiu

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 研究针对音频和视频联合生成中跨模态对齐难的问题,提出OmniVAE,通过联合训练学习音频和视频潜在表示间的细粒度语义对齐,使用对比目标捕捉对应关系并对齐潜在空间,还提炼特征提升可学习性,实验证明其有效提升生成质量和同步准确性。

Comments 15 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25333 2026-08-03 cs.CV 版本更新 57%

Teaching Video Generators to Remember: Eliciting Dynamic Memory for Out-of-Sight State Evolution

教会视频生成器记忆:为不可见状态演化引出动态记忆

Tianshuo Xu, Yichen Xie, Depu Meng, Chensheng Peng, Quentin Herau, Bo Jiang, Yihan Hu, Wei Zhan

机构 * Applied Intuition(应用直觉) University of California, Berkeley(加州大学伯克利分校)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

AI总结 针对视频生成模型在观测中断时状态冻结的问题,提出ReMind框架,通过面向记忆的数据构建、事件感知训练和缓存适配,利用KV缓存机制实现动态记忆,在STEVO-Bench和恢复任务上取得最佳成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10383 2026-07-31 cs.CV 版本更新 57%

Authoring for Living Worlds: Tool-Constrained LLM Agents for Executable Multi-Actor Scenarios

代理视频生成:通过工具约束的LLM规划从文本到可执行事件图

Nicolae Cudlenco, Mihai Masala, Marius Leordeanu

机构 * Institute of Mathematics of the Romanian Academy(罗马尼亚科学院数学研究所) National University of Science and Technology Politehnica Bucharest(布加勒斯特理工大学) Büchi Labortechnik AG(布奇实验室技术股份公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出了一种代理系统,通过LLM生成结构化的事件图规范,并在3D引擎中确定性执行,解决了传统视频生成的语义可靠性问题,展示了在物理真实性和语义对齐上的优越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04607 2026-07-30 cs.CV cs.AI 版本更新 57%

G2VD: Generalizable AI-Generated Video Detection via Counterfactual Intervention and Causal Disentanglement

G2VD:通过反事实干预和因果解缠实现可泛化的人工智能生成视频检测

Meng Du, Hongchang Chen, Ran Li, Junjie Zhang, Qi Ouyang, Shibo Zhang, Shuxin Liu

机构 * Information Engineering University(信息工程大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 针对AI生成视频检测中因捷径学习导致跨域性能差的问题,提出G2VD框架,用反事实干预管道生成样本并对齐,设计因果解缠分类器,提升了跨域性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21848 2026-07-28 cs.CV 版本更新 57%

Closing the Loop: Training-Free Revisit Consistency for Autoregressive Generative Rendering

闭环:自回归生成渲染的无训练重访一致性

Wenchao Ma, Changran Liu, Sharon X. Huang, Haomiao Jiang

机构 * Roblox(罗布乐思) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 研究自回归生成渲染中相机重访位置时的不一致问题,利用3D引擎提供的时间和空间对应关系,将姿态匹配的历史潜在块检索到KV缓存,并使注意力偏向对应区域,在相关数据集上实验,提升了重访一致性且不损失视频质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08797 2026-07-27 cs.CV 版本更新 57%

HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation

混元视频-HOMA:多模态驱动人体动画中的通用人机交互

Ziyao Huang, Zixiang Zhou, Juan Cao, Yifeng Ma, Yi Chen, Zejing Rao, Zhiyong Xu, Hongmei Wang, Qin Lin, Yuan Zhou, Qinglin Lu, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯混元)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 针对人体-物体交互视频生成的局限,提出混元视频-HOMA弱条件多模态驱动框架,通过稀疏解耦运动引导等方法,将外观和运动信号编码融合,经优化训练,在弱监督下性能达先进水平,还具文本生成和物体操纵通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09168 2026-07-24 cs.CV 版本更新 57%

ELT: Elastic Looped Transformers for Visual Generation

ELT:弹性循环变换器用于视觉生成

Sahil Goyal, Swayam Agrawal, Gautham Govind Anil, Prateek Jain, Sujoy Paul, Aditya Kusupati

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 ELT通过共享权重的循环变换块实现高效视觉生成,采用Intra-Loop Self Distillation提升训练效率,实现动态平衡计算成本与生成质量。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18217 2026-07-22 cs.CV 版本更新 57%

HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enhancement

HOMIE:通过多模态智能增强实现以人为对象的视频个性化

Yiyang Cai, Nan Chen, Rongchang Xie, Junwen Pan, Chunyang Jiang, Cheng Chen, Wen Zhou, Zhenbang Sun, Wei Xue, Wenhan Luo, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 研究以人为对象的视频个性化问题,提出HOMIE框架,统一处理主体间和主体内输入设置。通过更好的MLLM集成策略、自注意力中的全局多模态引导及模态参考嵌入,在多任务中达最优性能。

Comments 28 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏