arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6781 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1305 篇

2607.15278 2026-07-17 cs.CV 新提交 70%

Hierarchical Denoising For Multi-Step Visual Reasoning

用于多步视觉推理的分层去噪

Zezhong Qian, Xiaowei Chi, Chak-Wing Mak, Tianze Zhou, Ruibin Yuan, Yuhan Rui, Hengzhe Sun, Zhuoqun Wu, Yuming Li, Siyuan Qian, Sirui Han, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理技术国家重点实验室) The Hong Kong University of Science and Technology(香港科技大学) Beihang University(北京航空航天大学) Fuzhou University(福州大学) Muka Robotics(木卡机器人)

专题命中 视频扩散模型 :video generation(abstract);video reasoning(abstract);分类 cs.CV

AI总结 研究针对视频模型多步推理不足的问题,提出HDR框架,通过树形层次结构和稀疏分层注意力模式进行多步推理,在新基准测试中提升了成功率和进度,推理更快,数据效率更高,在机器人实验中展现潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06389 2026-07-08 cs.CV 新提交 70%

FADRA: Frequency-Aware Diffusion with Residual Adaptation for Video Face Restoration

FADRA:用于视频人脸识别的频率感知扩散与残差自适应

Jin Jiang, Jia Wang, Panwen Hu, Weiran Zhao, Shengcai Liao

机构 * United Arab Emirates University (UAEU)(阿联酋大学) Ocean University of China (OUC)(中国海洋大学) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 研究针对视频人脸识别在复杂退化下难以平衡空间保真度和时间连贯性的问题,提出FADRA框架,利用预训练模型的时间一致性,通过LoRA适配器、重复残差自适应头及频率感知损失等实现,实验证明其在恢复面部结构和保持时间一致性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05305 2026-07-07 cs.CV cs.AI cs.CL 版本更新 70%

FlashBlock: Attention Caching for Efficient Long-Context Block Diffusion

FlashBlock:用于高效长上下文块扩散的注意力缓存

Zhuokun Chen, Jianfei Cai, Bohan Zhuang

机构 * Monash University(墨尔本大学) Zhejiang University(浙江大学)

专题命中 视频扩散模型 :video generation(abstract);long video(abstract);分类 cs.CV

AI总结 研究长内容生成中块扩散在长上下文设置下的注意力计算开销问题,提出FlashBlock机制,利用块外注意力输出稳定性复用注意力,减少计算与缓存访问,提升效率且不影响质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23851 2026-06-23 cs.CV 70%

TinyHistory: Lightweight Video History Embeddings via Two-Stage Context Learning

TinyHistory: 通过两阶段上下文学习实现轻量级视频历史嵌入

Lvmin Zhang, Shengqu Cai, Muyang Li, Chong Zeng, Beijia Lu, Anyi Rao, Song Han, Gordon Wetzstein, Maneesh Agrawala

机构 * Stanford University(斯坦福大学) MIT(麻省理工学院) Carnegie Mellon University(卡内基梅隆大学) HKUST(香港科技大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出TinyHistory,通过两阶段上下文学习实现轻量级视频历史嵌入,在有限计算和内存下实现与更重模型相当的一致性。

Comments Additional Results: https://lllyasviel.github.io/TinyHistory_gitpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15819 2026-06-19 cs.CV 版本更新 70%

VideoSketcher: Sequential Sketch Generation Using Video Model Priors

VideoSketcher:利用视频模型先验的序列草图生成

Hui Ren, Yuval Alaluf, Omer Bar Tal, Alexander Schwing, Antonio Torralba, Yael Vinker

机构 * MIT(麻省理工学院)

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 提出VideoSketcher方法,结合LLM的语义规划与视频扩散模型的时序渲染,通过两阶段微调从少量样本学习笔画顺序与风格,生成高质量序列草图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30431 2026-06-01 cs.CV 70%

DTG-Restore: Training-Free Diffusion Refinement for Generative Video Super-Resolution

DTG-Restore: 无需训练的视频超分辨率扩散精炼

Hidir Yesiltepe, Koutilya PNVR, Gaurav Pathak, Navaneeth Bodla, Bharat Singh, Pinar Yanardag, Jinrong Xie

机构 * Virginia Tech(弗吉尼亚理工大学) Adobe(Adobe公司)

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 提出解耦时间引导(DTG)方法,通过时间解耦条件与无条件分支,无需训练即可增强扭曲低分辨率视频,提升结构保真度和时间稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09429 2026-06-01 cs.CV cs.AI cs.LG 70%

Rays as Pixels: Learning A Joint Distribution of Videos and Camera Trajectories

射线即像素:学习视频与相机轨迹的联合分布

Wonbong Jang, Shikun Liu, Soubhik Sanyal, Juan Camilo Perez, Kam Woh Ng, Sanskar Agrawal, Juan-Manuel Perez-Rua, Yiannis Douratsos, Tao Xiang

机构 * Meta AI

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出一种视频扩散模型(Rays as Pixels),通过将相机表示为密集射线像素(raxels)并与视频帧共享潜在空间,联合去噪实现相机轨迹预测和相机控制视频生成。

Comments Accepted to ICML 2026. 9-page main paper plus supplementary material. Project page: https://wbjang.github.io/raysaspixels/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30263 2026-05-29 cs.CV 70%

minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models

minWM: 用于实时交互式视频世界模型的全栈开源框架

Min Zhao, Hongzhou Zhu, Bokai Yan, Zihan Zhou, Yimin Chen, Wenqiang Sun, Kaiwen Zheng, Guande He, Xiao Yang, Chongxuan Li, Fan Bao, Jun Zhu

机构 * ShengShu(盛书) THU(清华大学) RUC(中国人民大学) HKUST(香港科技大学) UT-Austin(德克萨斯大学奥斯汀分校)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出minWM全栈开源框架,通过因果强制/因果强制++流水线将双向视频扩散模型转化为可控制、低延迟的自回归世界模型,支持相机控制与多种骨干架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21876 2026-05-29 cs.CV cs.AI 70%

EPiC: Efficient Video Camera Control Learning with Precise Anchor-Video Guidance

EPiC: 基于精确锚点视频引导的高效视频摄像机控制学习

Zun Wang, Jaemin Cho, Jialu Li, Han Lin, Jaehong Yoon, Yue Zhang, Mohit Bansal

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出EPiC框架,通过基于首帧可见性掩码构建精确对齐的锚点视频,并引入轻量模块Anchor-ControlNet,以极低参数实现高效、精确的3D摄像机控制,在RealEstate10K和MiraData上达到最先进性能。

Comments Accepted to ICML 2026. Project website: https://zunwang1.github.io/Epic

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28394 2026-05-28 cs.CV cs.GR 70%

Sketch2Motion: Text-driven 2D Sketch to 3D Animation via Diffusion-guided Skeleton Optimization

Sketch2Motion: 文本驱动的二维草图到三维动画的扩散引导骨架优化

Gaurav Rai, Ojaswa Sharma

机构 * Graphics Research Group, IIIT Delhi(IIIT德里图形研究组)

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 提出Sketch2Motion框架,结合扩散模型和骨架优化,将二维草图转化为三维动画,无需配对运动数据,支持多种角色类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20497 2026-05-28 cs.CV cs.AI 70%

LESA: Learnable Stage-Aware Predictors for Diffusion Model Acceleration

LESA: 可学习的阶段感知预测器用于扩散模型加速

Peiliang Cai, Jiacheng Liu, Haowen Xu, Xinyu Wang, Chang Zou, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 针对扩散模型计算开销大、现有缓存策略难以适应去噪过程阶段动态变化的问题,提出基于两阶段训练的可学习阶段感知预测器框架,利用KAN网络学习时序特征映射并采用多阶段多专家架构,在保持高质量生成的同时实现显著加速。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09675 2026-05-28 cs.CV 70%

Accelerating Diffusion Sampling via Exploiting Local Transition Coherence

利用局部转移一致性加速扩散采样

Shangwen Zhu, Han Zhang, Zhantao Yang, Qianyu Peng, Zhao Pu, Huangji Wang, Fan Cheng

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 提出一种无需训练的加速方法LTC-Accel,通过利用相邻步骤间转移算子的统计关系来估计当前转移算子,从而加速文本到图像和视频的扩散采样,兼容多种网络结构和现有加速技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21766 2026-05-22 cs.CV cs.GR 70%

BodyReLux: Temporally Consistent Full-Body Video Relighting

BodyReLux: 时序一致的全身人体视频重照明

Li Ma, Mingming He, Xueming Yu, David M. George, Ahmet Levent Taşel, Paul Debevec, Julien Philip

机构 * Eyeline Labs(Eyeline实验室)

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出BodyReLux,一种基于视频扩散的框架,用于在时序一致的方式下重照明全身人体表演。该方法利用混合数据集训练,结合传统静态单光源捕捉和新型动态表演捕捉技术,通过引入新的光照条件表示方法和数据增强管道,实现了高质量、鲁棒且时序一致的视频重照明。

Comments Siggraph 2026 Journal Track. Project page: https://eyeline-labs.github.io/bodyrelux/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20659 2026-05-21 cs.CV cs.LG 70%

RoPeSLR: 3D RoPE-driven Sparse-LowRank Attention for Efficient Diffusion Transformers

RoPeSLR: 3D RoPE驱动的稀疏低秩注意力用于高效的扩散变换器

Yuxi Liu, Zekun Zhang, Yixiang Cai, Renjia Deng, Yutong He, Kun Yuan

机构 * Peking University(北京大学) University of Electronic Science and Technology of China(电子科技大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视频扩散模型 :video generation(abstract);long video(abstract);分类 cs.CV

AI总结 本研究提出RoPeSLR,一种基于3D RoPE的稀疏低秩注意力框架,旨在解决扩散变换器中长序列生成的高复杂度问题,通过结合高频率语义尖峰集和极低秩背景连续体,实现子二次稀疏性和子线性秩增长,从而在超长视频推理中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11869 2026-05-13 cs.CV cs.LG 70%

FIS-DiT: Breaking the Few-Step Video Inference Barrier via Training-Free Frame Interleaved Sparsity

FIS-DiT:通过无训练帧交错稀疏性打破视频推断的少步障碍

Jian Tang, Jiawei Fan, Qingbin Liu, Zheng Wei

机构 * Platform and Content Group, Tencent(腾讯平台与内容组)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出FIS-DiT,通过将优化重点从时间轨迹转向潜在帧维度,解决少步推断中特征复用和预测建模受限的问题,实现2.11-2.41倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20289 2026-04-23 cs.CV 70%

X-Cache: Cross-Chunk Block Caching for Few-Step Autoregressive World Models Inference

X-Cache:跨块块缓存用于少步自回归世界模型推理

Yixiao Zeng, Jianlei Zheng, Chaoda Zheng, Shijia Chen, Mingdian Liu, Tongping Liu, Tengwei Luo, Yu Zhang, Boyang Wang, Linkun Xu, Siyuan Lu, Bo Tian, Xianming Liu

机构 * AI Infra Team, XPeng Inc.(AI基础设施团队,小鹏汽车)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出X-Cache,一种无需训练的加速方法,通过跨连续生成块缓存而非去噪步骤来提升少步自回归世界模型的推理效率,实现71%的块跳过率和2.6倍的速度提升,同时保持最小的性能下降。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13509 2026-04-16 cs.CV 70%

DiT as Real-Time Rerenderer: Streaming Video Stylization with Autoregressive Diffusion Transformer

DiT作为实时重绘器:基于自回归扩散变换器的流式视频风格化

Hengye Lyu, Zisu Li, Yue Hong, Yueting Weng, Jiaxin Shi, Hanwang Zhang, Chen Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) XMax.AI Ltd.(XMax人工智能有限公司) Nanyang Technological University(南洋理工大学)

专题命中 视频扩散模型 :video generation(abstract);long video(abstract);分类 cs.CV

AI总结 本文提出RTR-DiT框架,通过微调双向教师模型和知识蒸馏实现高效视频风格化,支持文本和参考图像引导,实现实时稳定处理长视频和风格切换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24718 2026-04-13 cs.CV cs.LG 70%

Generative View Stitching

生成视图拼接

Chonghyuk Song, Michal Stary, Boyuan Chen, George Kopanas, Vincent Sitzmann

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Runway ML

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出生成视图拼接(GVS),通过并行采样确保生成场景与预定义相机轨迹一致,解决视频生成中因未来条件缺失导致的碰撞问题,实现稳定且一致的相机引导视频生成。

Comments Published at ICLR 2026. Camera-ready Submission. Project website: https://andrewsonga.github.io/gvs

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07026 2026-04-09 cs.CV 70%

Not all tokens contribute equally to diffusion learning

并非所有标记对扩散学习贡献相等

Guoqing Zhang, Lu Shi, Wanru Xu, Linna Zhang, Sen Wang, Fangfang Wang, Yigang Cen

机构 * School of Mechanical Engineering, Guizhou University, Guizhou, China(贵州大学机械工程学院) School of Information Science and Technology, Hangzhou Normal University, Zhejiang, China(杭州师范大学信息科学与技术学院)

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出DARE框架,通过分布偏见缓解和空间一致性提升扩散模型的语义引导,解决训练数据长尾分布和交叉注意力空间对齐问题,提升文本到视频生成的准确性和语义对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19121 2026-04-09 cs.CV cs.AI 70%

MSG Score: Automated Video Verification for Reliable Multi-Scene Generation

MSG Score: 多场景生成的自动化视频验证

Daewon Yoon, Hyeongseok Lee, Wonsik Shin, Sangyu Han, Nojun Kwak

机构 * Seoul National University(首尔大学) Samsung Electronics(三星电子)

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出MSG Score用于评估长视频生成的叙事和视觉一致性,结合Implicit Insight Distillation解决评估与推理速度的平衡,实现可靠且可扩展的视频生成。

Comments 8 pages, 5 figures, 1 table, Accepted AAAI 2026 CVM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00503 2026-04-08 cs.CV 70%

Diff4Splat: Controllable 4D Scene Generation with Latent Dynamic Reconstruction Models

Diff4Splat:基于潜在动态重建模型的可控4D场景生成

Panwang Pan, Chenguo Lin, Jingjing Zhao, Chenxin Li, Yuchen Lin, Haopeng Li, Honglei Yan, Kairun Wen, Yunlong Lin, Yixuan Yuan, Yadong Mu

机构 * Peking University(北京大学) Xiamen University(厦门大学) CUHK(香港中文大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 Diff4Splat通过单张图像和相机轨迹生成可控的4D场景,结合视频扩散模型的生成先验与大规模4D数据集学习的几何和运动约束,在单次前向传递中直接预测可变形3D高斯场,无需测试时优化。

Comments Accepted to CVPR 2026. Project page: https://paulpanwang.github.io/Diff4Splat

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01955 2026-04-08 cs.CV 70%

MotionAdapter: Video Motion Transfer via Content-Aware Attention Customization

MotionAdapter: 通过内容感知注意力定制实现视频动作迁移

Zhexin Zhang, Yangyang Xu, Yifeng Zhu, Long Chen, Yong Du, Shengfeng He, Jun Yu

机构 * Hangzhou Dianzi University(杭州电子科技大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) The Hong Kong University of Science and Technology(香港科技大学) Ocean University of China(中国海洋大学) Singapore Management University(新加坡管理大学)

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出MotionAdapter框架,通过解耦动作与外观并自适应定制动作,实现DiT视频扩散模型中的稳健动作迁移,实验表明其在质量和定量评估中优于现有方法,支持复杂动作迁移与编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05138 2026-03-31 cs.CV 70%

VerseCrafter: Dynamic Realistic Video World Model with 4D Geometric Control

VerseCrafter:基于4D几何控制的动态真实视频世界模型

Sixiao Zheng, Minghao Yin, Wenbo Hu, Xiaoyu Li, Ying Shan, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) HKU(香港大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出VerseCrafter,通过4D几何控制生成动态真实视频,相比传统方法更精确控制相机和多物体运动。

Comments Project Page: https://sixiaozheng.github.io/VerseCrafter_page/, Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27086 2026-03-31 cs.CV 70%

EFlow: Fast Few-Step Video Generator Training from Scratch via Efficient Solution Flow

EFlow:通过高效解流实现从零开始的快速少步视频生成训练

Dogyun Park, Yanyu Li, Sergey Tulyakov, Anil Kag

机构 * Snap Inc.(Snap公司) Korea University(高丽大学)

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出EFlow框架,通过高效解流目标和改进的训练方法,减少采样步骤和计算成本,实现更高的训练吞吐量和更低的推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25892 2026-03-30 cs.CV 70%

THFM: A Unified Video Foundation Model for 4D Human Perception and Beyond

THFM:一种用于4D人体感知及更广泛领域的统一视频基础模型

Letian Wang, Andrei Zanfir, Eduard Gabriel Bazavan, Misha Andriluka, Cristian Sminchisescu

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 THFM是一种统一的视频基础模型,能够同时处理密集任务和稀疏任务,其基于预训练的文本到视频扩散模型,并通过可学习的标记增强稀疏预测能力,且在合成数据上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23326 2026-03-25 cs.CV 70%

ViBe: Ultra-High-Resolution Video Synthesis Born from Pure Images

ViBe:源自纯图像的超高清视频合成

Yunfeng Wu, Hongying Cheng, Zihao He, Songhua Liu

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) Jilin University(吉林大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出纯图像适应框架,通过两阶段LoRA策略提升视频扩散模型生成超高清视频的能力,无需视频训练数据,在VBench基准上超越现有最佳模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21864 2026-03-24 cs.CV cs.AI 70%

Adaptive Video Distillation: Mitigating Oversaturation and Temporal Collapse in Few-Step Generation

自适应视频蒸馏:缓解少步生成中的过饱和与时间崩溃

Yuyang You, Yongzhi Li, Jiahui Li, Yadong Mu, Quan Chen, Peng Jiang

机构 * Peking University(北京大学) Kuaishou Technology(快手科技)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出针对视频扩散模型的自适应蒸馏框架,通过动态回归损失、时间正则化损失和推理时帧插值策略,提升少步视频生成的稳定性和感知真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19672 2026-03-23 cs.CV 70%

Making Video Models Adhere to User Intent with Minor Adjustments

通过小幅调整使视频模型符合用户意图

Daniel Ajisafe, Eric Hedlin, Helge Rhodin, Kwang Moo Yi

机构 * Department of Computer Science(计算机科学系) The University of British Columbia(不列颠哥伦比亚大学)

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文通过调整用户提供的边界框以提高视频生成质量和对控制输入的符合度,提出平滑掩码和注意力最大化目标,通过实验验证方法有效性。

Comments Project page and code: https://ubc-vision.github.io/MinorAdjustVideo/docs/webpage/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17735 2026-03-19 cs.CV 70%

TAPESTRY: From Geometry to Appearance via Consistent Turntable Videos

TAPESTRY:从几何到外观 via 一致的旋转台视频

Yan Zeng, Haoran Jiang, Kaixin Yao, Qixuan Zhang, Longwen Zhang, Lan Xu, Jingyi Yu

机构 * ShanghaiTech University(上海科技大学) Deemos Technology(德莫斯科技)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 TAPESTRY通过基于显式3D几何的视频扩散方法生成高保真旋转台视频,用于驱动纹理合成和神经渲染,实现高质量3D重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13702 2026-03-12 cs.CV cs.AI 70%

MVCustom: Multi-View Customized Diffusion via Geometric Latent Rendering and Completion

MVCustom: 通过几何潜在渲染和完成实现多视图定制化扩散

Minjung Shin, Hyunin Cho, Sooyeon Go, Jin-Hwa Kim, Youngjung Uh

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 MVCustom通过几何潜在渲染和完成技术,实现多视图定制化扩散,解决多视图一致性和定制化保真度的统一问题。

Comments ICLR 2026, Project page: https://minjung-s.github.io/mvcustom

详情

展开后加载摘要…

URL PDF HTML 收藏