arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-05 至 2026-08-05 共收录 34 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 1 篇

2604.12341 2026-08-05 cs.CV 版本更新 70%

Bridging the Micro--Macro Gap: Frequency-Aware Semantic Alignment for Image Manipulation Localization

弥合微-宏观差距:面向图像操纵本地化的频率感知语义对齐

Xiaojie Liang, Zhimin Chen, Ziqi Sheng, Wei Lu

机构 * School of Computer Science Engineering, Sun Yat-sen University Guangzhou China Engineering, Sun Yat-sen University

专题命中 图像编辑 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出FASA框架,通过自适应双频带DCT模块提取操纵敏感频率特征,结合冻结CLIP表示的补丁级对比对齐学习语义先验,实现传统和扩散生成操纵的精准本地化。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 扩散模型 27 篇

2406.14429 2026-08-05 cs.LG cs.AI cs.CV 版本更新 83%

CollaFuse: Collaborative Diffusion Models

CollaFuse:协同扩散模型

Simeon Allmendinger, Domenique Zipperling, Lukas Struppek, Niklas Kühl

机构 * University of Bayreuth(巴耶鲁斯大学) Fraunhofer FIT(弗劳恩霍夫 FIT) FIM Research Center for Information Management(信息管理研究所以) Technical University of Darmstadt(达姆施塔特技术大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI))

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出CollaFuse协同扩散模型,通过本地保留数据和轻量计算,将高计算任务转移至服务器,降低客户端负担,提升性能并减少数据泄露风险。

Comments Accepted at the Journal of Artificial Intelligence Research (JAIR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00064 2026-08-05 cs.CV 版本更新 81%

Noise-Robust Conditional Flow Matching: Generating Clean Samples from Noisy Datasets

噪声鲁棒条件流匹配:从噪声数据集生成干净样本

Adrian Urbański, Gabriel della Maggiora, Artur Yakimovich

机构 * Center for Advanced Systems Understanding (CASUS)(高级系统理解中心) Helmholtz-Zentrum Dresden-Rossendorf e. V. (HZDR)(德累斯顿-罗森多夫亥姆霍兹中心) Institute of Computer Science, University of Wrocław(弗罗茨瓦夫大学计算机科学学院) School of Computation, Information and Technology, Technical University of Munich(慕尼黑工业大学计算、信息与技术学院) Cluster of Excellence Physics of Life(生命物理学卓越集群)

专题命中 扩散模型 :diffusion(summary_cn,abstract);分类 cs.CV

AI总结 该研究针对科学成像中噪声数据难以获取干净参考的问题,提出NR-CFM模型,可从单张带噪图像学习生成干净样本,在多数场景优于NR-GAN,高噪声下与Ambient Diffusion相当,低信噪比科学数据上表现良好。

Comments 10 pages, 3 Figures, and an Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23586 2026-08-05 cs.CV cs.CL cs.MM cs.SD eess.AS 版本更新 81%

Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling

Talker-T2AV:基于自回归扩散模型的联合说话音频视频生成

Zhen Ye, Xu Tan, Aoxiong Yin, Hongzhan Lin, Guangyan Zhang, Peiwen Sun, Yiming Li, Chi-Min Chan, Wei Ye, Shikun Zhang, Wei Xue

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Independent Researcher(独立研究者)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出Talker-T2AV,通过共享骨干和模态特定解码器实现音频视频联合生成,提升跨模态一致性与生成效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02151 2026-08-05 cs.GR 版本更新 79%

Fourier-Latent Diffusion for Constrained Generation of Triply Periodic Minimal Surfaces

用于三重周期极小曲面约束生成的傅里叶潜扩散模型

Shu Yan, Bohan Wang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.GR

AI总结 该研究提出基于扩散的生成框架,构建含超1.8万种TPMS的数据集,训练Transformer扩散模型实现TPMS的可控生成,满足几何与弹性能约束,为TPMS逆设计提供实用工具。

Comments 11 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27741 2026-08-05 cs.CV 版本更新 79%

SIFT: Self-Imagination Fine-Tuning for Physically Plausible Motion in Video Diffusion Models

SIFT: 视频扩散模型中物理合理运动的自我想象微调

Ruoyu Wang, Jialun Liu, Huayang Huang, Haibin Huang, Jiepeng Wang, Chi Zhang, Xuelong Li, Yu Wu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI)) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对视频扩散模型生成运动物理不合理的问题,提出自我想象微调(SIFT)范式,通过从模型自身生成视频学习而非直接重建真实视频,结合运动感知判别监督和渐进式难例重放策略,提升运动解耦与物理真实性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15615 2026-08-05 cs.LG cs.CV 版本更新 79%

MoECa: Aligning Feature Reuse with Expert Decomposition in Diffusion Transformers

MoECa: 在扩散变换器中对齐特征复用与专家分解

Maoliang Li, Haojing Chen, Jiayu Chen, Zihao Zheng, Xinhao Sun, Hailong Zou, Xiang Chen

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Software Engineering, University of Electronic Science and Technology of China(电子科技大学软件工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对DiT-MoE中跨时间步的冗余计算,提出基于专家分支级别的细粒度缓存框架MoECa,实现分支级特征复用,并引入专家感知自适应控制和同步缓存更新,在多个模型上取得高达2.83倍加速且质量损失极小。

Comments Will appear in ACM MM'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15169 2026-08-05 cs.CV 版本更新 79%

MeSS: City Mesh-Guided Outdoor Scene Generation with Cross-View Consistent Diffusion

MeSS: 基于城市网格的户外场景生成与跨视角一致扩散

Xuyang Chen, Zhijun Zhai, Kaixuan Zhou, Zengmao Wang, Jianan He, Dong Wang, Yanfeng Zhang, mingwei Sun, Rüdiger Westermann, Konrad Schindler, Liqiu Meng

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MeSS通过改进跨视角一致性,利用城市网格模型生成高质量且风格一致的户外场景,并结合3D高斯点划重建技术提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23953 2026-08-05 cs.CV 版本更新 79%

T2VAttack: Adversarial Attack on Text-to-Video Diffusion Models

T2VAttack:针对文本到视频扩散模型的对抗攻击

Changzhen Li, Yuecong Min, Jie Zhang, Zheng Yuan, Shiguang Shan, Xilin Chen

机构 * Hangzhou Institute for Advanced Study, UCAS, school of Intelligent Science and Technology(杭州高等研究院,UCAS,智能科学与技术学院) State Key Laboratory of AI Safety, Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences (UCAS)(中国科学院大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 T2VAttack研究了文本到视频扩散模型的对抗攻击,提出两种攻击方法揭示模型在语义和时间动态上的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04551 2026-08-05 cs.CV 版本更新 79%

Two-Way Garment Transfer: Unified Diffusion Framework for Dressing and Undressing Synthesis

双向衣物迁移:用于穿衣和脱衣合成的统一扩散框架

Angang Zhang, Fang Deng, Hao Chen, Zhongjian Chen, Junyan Li

专题命中 扩散模型 :diffusion(title);image synthesis(abstract);分类 cs.CV

AI总结 本研究针对虚拟试穿与脱衣任务孤立研究的不足,提出双向衣物迁移模型,构建统一扩散框架,通过双向特征解纠缠和分阶段训练,在两个公开数据集上验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01774 2026-08-05 cs.LG cs.AI 版本更新 78%

FLARE: Diffusion for Hybrid Language Model

FLARE: 混合语言模型的扩散方法

Yuchen Zhu, Jing Shi, Chongjian Ge, Hao Tan, Yiran Xu, Wanrong Zhu, Jason Kuen, Koustava Goswami, Rajiv Jain, Yongxin Chen, Molei Tao, Jiuxiang Gu

机构 * Adobe Research(Adobe研究院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出FLARE框架,通过结合自回归和扩散目标、硬件感知内核和统一推理,将混合注意力LLM转换为支持并行解码的扩散模型,在保持能力的同时提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01370 2026-08-05 cs.LG cs.AI cs.NA math.NA stat.ML 版本更新 78%

PRISMA: Improving the Accuracy-Latency Frontier of Diffusion-based PDE Solvers Using Physics-Informed Spectral Attention

超越损失引导:利用PDE残差作为频域中的频谱注意力在扩散神经算子中

Medha Sawhney, Abhilash Neog, Mridul Khurana, Anuj Karpatne

机构 * Department of Computer Science(计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 PRISMA通过将PDE残差作为频谱注意力机制整合到扩散神经算子中,实现了无需梯度下降的快速、稳健和准确的PDE求解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10221 2026-08-05 math.NA cs.NA 版本更新 78%

On $τ$-preconditioners for a quasi-compact difference scheme to Riesz fractional diffusion equations with variable coefficients

关于变系数Riesz分数阶扩散方程拟紧致差分格式的τ-预条件子

Zi-Hang She, Xue Zhang, Xian-Ming Gu, Stefano Serra-Capizzano

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对变系数Riesz分数阶扩散方程离散的非对称线性系统,提出τ预条件子加速GMRES收敛,理论与数值结果验证其有效性。

Comments 23 pages, 3 figures, we improve some contexts and simplify some mathematical equations

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10671 2026-08-05 cs.CV 版本更新 74%

FadeMem: Distance-Aware Memory Consolidation for Autoregressive Video Diffusion

FadeMem: 面向自回归视频扩散的距离感知记忆巩固

Yu Lu, Junjie Yang, Piotr Koniusz, YuXin Song, Yi Yang

机构 * Zhejiang University(浙江大学) University of New South Wales (UNSW)(新南威尔士大学) Data61/CSIRO Baidu Inc(百度公司)

专题命中 扩散模型 :diffusion(title);分类 cs.CV

AI总结 提出FadeMem,一种距离感知的KV记忆巩固机制,在固定缓存预算下将历史KV块组织成时间层次,通过幂律分配实现近密远疏的记忆,提升长视频生成中的主体一致性和时间连贯性。

Comments 14 pages, 9 figures. Substantially revised manuscript with expanded experiments and integrated supplementary material. Project page: https://fademem.github.io/FadeMem_Webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06606 2026-08-05 cs.CV 版本更新 74%

MaterialFusion: High-Quality, Zero-Shot, and Controllable Material Transfer with Diffusion Models

MaterialFusion:基于扩散模型的高质量零样本可控材质迁移

Kamil Garifullin, Maxim Nikolaev, Andrey Kuznetsov, Aibek Alanov

专题命中 扩散模型 :diffusion(title);分类 cs.CV

AI总结 MaterialFusion是基于扩散模型的新型材质迁移框架,可零样本实现高质量可控材质迁移,在质量、可控性等方面优于现有方法,代码公开。

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01127 2026-08-05 cs.CV 版本更新 70%

MiniWorld: Democratizing the Training of Video World Models from Scratch

MiniWorld:从零开始普及视频世界模型的训练

Yian Zhao, Ruochong Zheng, Hongcan Guo, Yu Yan, Jian Zhang, Jie Chen

机构 * Peking University(北京大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 MiniWorld是从零开始训练流式视频世界模型的可复现框架,采用特定模型与训练策略,可在单台8-GPU服务器数天内完成训练,旨在降低训练门槛以推动相关研究。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08834 2026-08-05 cs.LG cs.AI stat.ML 版本更新 67%

Rex: A Family of Reversible Exponential (Stochastic) Runge-Kutta Solvers

Rex: 一族可逆指数(随机)龙格-库塔求解器

Zander W. Blasingame, Chen Liu

机构 * University of Washington(华盛顿大学)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract)

AI总结 提出Rex求解器族,通过Lawson方法将显式(随机)龙格-库塔格式转化为代数可逆形式,用于扩散ODE和SDE,实现近机器精度重建并提升流模型和扩散模型的性能。

Comments Accepted as an Oral presentation at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01597 2026-08-05 cs.LG stat.AP stat.ML 版本更新 67%

Heteroscedasticity of Denoising Score Matching with Generalised Smooth Noise

带广义平滑噪声的去噪得分匹配的异方差性

Juyan Zhang, Rhys Newbury, Xinyang Zhang, Tin Tran, Dana Kulic, Michael Burke

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 该研究指出去噪得分匹配(DSM)存在固有的异方差性,推导了理想加权函数并给出实用近似方案,为各向同性高斯扩散的启发式权重提供了理论依据,在多分布和高阶得分上验证了理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00883 2026-08-05 cs.MM cs.CV cs.SD 版本更新 62%

Audio-Visual World Models: Learning Physically Grounded Multisensory Dynamics

视听世界模型:为具身智能体奠定多感官想象的基础

Jiahua Wang, Leqi Zheng, Jialong Wu, Yaoxin Mao, Shijie Cheng

机构 * Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 提出视听世界模型(AVWM)统一框架,通过条件扩散Transformer(AV-CDiT)联合预测双耳音频与视觉动态,在30小时基准AVW-4k上实现高保真多模态预测,并验证其在具身导航中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15065 2026-08-05 cs.RO cs.CV cs.LG 版本更新 57%

DriftWorld: Fast World Modeling through Drifting

DriftWorld:通过漂移实现快速世界建模

Susie Lu, Haonan Chen, Weirui Ye, Yilun Du

机构 * Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对预测性世界模型生成展开慢的问题,提出基于漂移生成模型的DriftWorld,训练时学习动作条件漂移以快速生成未来帧,在机器人操作基准测试中实现快速准确决策,还能作离线模拟器,性能优于基于扩散的基线。

Comments Website at https://susie-lu.github.io/driftworld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14019 2026-08-05 cs.CV 版本更新 57%

RISE: Single Static Radar-based Indoor Scene Understanding

RISE:基于单静态雷达的室内场景理解

Kaichen Zhou, Laura Dodds, Sayed Saad Afzal, Fadel Adib

机构 * Massachusetts Institute of Technology(麻省理工学院) Cartesian Systems

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出RISE系统,利用毫米波雷达的多径反射(传统视为噪声)编码几何线索,通过双角度多径增强和模拟到现实的分层扩散框架,实现布局重建和物体检测,在50,000帧数据集上布局重建倒角距离降低60%,首次实现基于毫米波雷达的物体检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18792 2026-08-05 cs.CV 版本更新 57%

Rethinking Uncertainty Quantification and Entanglement in Image Segmentation

重新思考图像分割中的不确定性量化与纠缠

Jakob Lønborg Christensen, Vedrana Andersen Dahl, Morten Rieger Hannemose, Anders Bjorholm Dahl, Christian F. Baumgartner

机构 * Technical University of Denmark, DTU Compute(丹麦技术大学,DTU计算学院) University of Lucerne, Faculty of Health Sciences and Medicine(卢塞恩大学,医学与健康科学学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文研究了图像分割中不确定性量化的分解与纠缠问题,分析了不同模型组合的不确定性纠缠程度,并提出量化指标,评估了不同任务下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07754 2026-08-05 cs.LG quant-ph 版本更新 50%

Image classification via a quantum-inspired strategy involving a mixture of experts

通过包含专家混合的量子启发策略进行图像分类

Kumari Jyoti, Rohith Babu, Apoorva D. Patel

机构 * Centre for High Energy Physics, Indian Institute of Science(印度科学研究所高能物理中心)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究提出一种经典 - 量子混合的图像分类策略,量子部分含图像幅度编码等操作,多个专家用不同参数处理图像并提取特征,经典部分联合处理特征进行预测。实验表明该策略优于单个专家分析,降低预测失败率,在GPU上开销适中,还可在量子处理器执行。

Comments 14 pages, 18 figures, comments welcome (v2) The number of features extracted from the images is considerably reduced, which simplifies the subsequent classification. The results are essentially the same

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08149 2026-08-05 physics.chem-ph 版本更新 50%

Generation and Characterization of Surface-Attached Ultrathin Liquid Sheets for Grazing-Incidence X-ray Scattering

用于掠入射X射线散射的表面附着超薄液膜的产生与表征

Yibo Wang, Daniel P. DePonte, Adi Natan

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究针对固液界面超快结构动力学研究中面临的挑战,提出创建和表征超薄表面附着自由流动液膜的方法,利用撞击射流和气体辅助成型,实现超快时间分辨率,为掠入射散射实验提供稳定平台。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18928 2026-08-05 cs.LG 版本更新 50%

The Ensemble Schr{ö}dinger Bridge filter for Nonlinear Data Assimilation

集合施罗德桥滤波器用于非线性数据同化

Hui Sun

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种新的非线性最优滤波方法,结合预测步骤与扩散生成模型分析步骤,有效处理高非线性动态和观测过程,优于传统滤波方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01807 2026-08-05 math.AP 版本更新 50%

Logarithmically Coupled p-Laplacian Systems: A Complete Variational Theory from Compactness to Rigidity

p-拉普拉斯系统在局部有限图上的地面态解

Wenzheng Hu

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了局部有限图上带有对数耦合项的p-拉普拉斯系统,通过Nehari流形和山峰定理证明了地面态的存在,并提出了一种新的指数校准技术以解决非分离的对数奇异性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18933 2026-08-05 cs.RO cs.AI 版本更新 50%

Gated Memory Policy: In-Context Memorization and Adaptation

门控记忆策略

Yihuai Gao, Jeff Jinyun Liu, Shuang Li, Shuran Song

机构 * Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出门控记忆策略,通过学习记忆回溯时机与内容,提升机器人操作任务中对历史信息的利用效率,实现在非马尔可夫任务中性能提升30.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15736 2026-08-05 math.PR 版本更新 50%

Convergence Rate of the Join-the-Shortest-Queue System

最短队列系统收敛速率

Yuanzhe Ma, Siva Theja Maguluri

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了最短队列系统在有限时间内的收敛速率,揭示了其在总变差距离下的收敛特性,为实际应用提供了更精确的分析。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 可控生成 4 篇

2602.16611 2026-08-05 cs.GR cs.CV 版本更新 62%

Style-Aware Gloss Control for Generative Non-Photorealistic Rendering

风格感知的光泽控制用于生成非照片实感渲染

Santiago Jimenez-Navarro, Belen Masia, Ana Serrano

机构 * University of Zaragoza -- I3A(萨拉戈萨大学--I3A)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出了一种风格感知的光泽控制方法,通过训练生成模型来解耦光泽与艺术风格,实现对非照片实感图像的精细控制。

Comments Published in Computers & Graphics journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00094 2026-08-05 cs.CV 版本更新 57%

Video Models as Native 4D Renderers: World-Grounded Conditioning from Animated Mesh

视频模型作为原生4D渲染器:基于动画网格的世界 grounding 条件

Junhao Chen, Mingjin Chen, Henghaofan Zhang, Minglin Chen, Liaoyuan Fan, Boran Zhang, Saining Zhang, Mingze Sun, Hao Zhao, Ruqi Huang, Zhihao Li, Yufei Wang

机构 * Tsinghua University(清华大学) The Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学) Sun Yat-sen University(中山大学) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出参考引导渲染器DAR,扩展Wan2.2相机控制,用跟踪和世界位置组成的4D G缓冲作为条件,在DAR-4D基准上实现优于现有方法的视频生成性能。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏