arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1688 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 1299 篇

2506.14614 2026-08-14 q-fin.MF 版本更新 67%

Pricing options on the cryptocurrency futures contracts

加密货币期货合约上的期权定价

Julia Kończal

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 本研究针对加密货币期权市场特性,校准评估多种期权定价模型,发现Kou模型对BTC期权、Bates模型对ETH期权定价误差最低,凸显纳入跳跃与随机波动率的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08834 2026-08-05 cs.LG cs.AI stat.ML 版本更新 67%

Rex: A Family of Reversible Exponential (Stochastic) Runge-Kutta Solvers

Rex: 一族可逆指数(随机)龙格-库塔求解器

Zander W. Blasingame, Chen Liu

机构 * University of Washington(华盛顿大学)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract)

AI总结 提出Rex求解器族,通过Lawson方法将显式(随机)龙格-库塔格式转化为代数可逆形式,用于扩散ODE和SDE,实现近机器精度重建并提升流模型和扩散模型的性能。

Comments Accepted as an Oral presentation at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01597 2026-08-05 cs.LG stat.AP stat.ML 版本更新 67%

Heteroscedasticity of Denoising Score Matching with Generalised Smooth Noise

带广义平滑噪声的去噪得分匹配的异方差性

Juyan Zhang, Rhys Newbury, Xinyang Zhang, Tin Tran, Dana Kulic, Michael Burke

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 该研究指出去噪得分匹配(DSM)存在固有的异方差性,推导了理想加权函数并给出实用近似方案,为各向同性高斯扩散的启发式权重提供了理论依据,在多分布和高阶得分上验证了理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26924 2026-08-03 cs.LG cs.RO 版本更新 67%

Temporally Centered SIGReg Improves Multi-Task LeWorldModel Learning: From Analysis to Method

时间中心SIGReg改进多任务LeWorldModel学习:从分析到方法

Chang Liu, Fei Suo, Yanzhou Jin, Yusuke Iwasawa, Yutaka Matsuo, Yaonan Zhu

机构 * Graduate School of Engineering, The University of Tokyo(东京大学工程学院)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 该研究针对SIGReg在多任务LeWM中导致表示混叠的问题,提出将其应用于时间中心残差的改进方法,在LIBERO基准上显著提升了多任务世界模型的下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03661 2026-07-31 cs.LG cs.AI 版本更新 67%

Dynamically Scaled Activation Steering

动态缩放的激活引导

Alex Ferrando, Xavier Suau, Jordi Gonzàlez, Pau Rodriguez

机构 * Apple(苹果公司) Universitat Autònoma de Barcelona(巴塞罗那自治大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract)

AI总结 DSAS是一种动态缩放的激活引导框架,通过自适应调节引导强度,在生成过程中实现对特定概念的调控,同时提升模型的可解释性和性能平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23615 2026-07-09 cs.LG cs.AI 版本更新 67%

L-GTA: Latent Generative Modeling for Time Series Augmentation

L-GTA:用于时间序列增强的潜在生成建模

Luis Roque, Vitor Cerqueira, Carlos Soares, Luis Torgo

机构 * Faculdade de Engenharia da Universidade do Porto(葡萄牙波尔图大学工程学院) Fraunhofer Portugal AICOS(德国弗劳恩霍夫葡萄牙AICOS研究所) University of Coimbra(科英布拉大学) Dalhousie University(达尔豪斯大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 研究针对时间序列分析中的数据增强问题,提出基于变分自编码器、双向LSTM和时间自注意力的L-GTA模型,通过定义等变性目标学习潜在表示并应用可控扰动,实验表明该模型在多方面优于其他方法,能有效降低预测误差。

Journal ref ECML PKDD 2026 Research Track, Naples, Italy, September 7-11, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20070 2026-06-23 cs.LG 版本更新 67%

Generative Modeling via Kernelized Stochastic Interpolants

基于核化随机插值的生成建模

Florentin Coeurdoux, Etienne Lempereur, Nathanaël Cuvelle-Magar, Stéphane Mallat, Eric Vanden-Eijnden

机构 * CCM, Flatiron Institute, New York, USA(CCM,Flatiron研究所,纽约,美国) Courant Institute of Mathematical Sciences, New York University, New York, USA(数学科学学院,纽约大学,纽约,美国)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract)

AI总结 提出一种基于核方法的随机插值生成框架,用线性系统替代神经网络训练,通过求解与数据维度无关的线性系统得到生成SDE的漂移项,并处理扩散系数在t=0处的奇异性,适用于多种特征映射,在金融时间序列、湍流和图像生成中验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01565 2026-06-19 cs.LG cs.DC 版本更新 67%

TetriServe: Efficiently Serving Mixed DiT Workloads

TetriServe: 高效服务混合DiT工作负载

Runyu Lu, Shiqi He, Wenxuan Tan, Shenggui Li, Ruofan Wu, Jeff J. Ma, Ang Chen, Mosharaf Chowdhury

机构 * University of Michigan(密歇根大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract)

AI总结 针对混合分辨率与截止时间的异构DiT工作负载,提出基于步骤级序列并行的TetriServe系统,通过轮次调度与自适应并行度,在保证图像质量下将SLO达成率提升32%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09465 2026-06-16 stat.ML cs.LG 版本更新 67%

Branching Flows: Discrete, Continuous, and Manifold Flow Matching with Splits and Deletions

分支流:带有分裂和删除的离散、连续和流形流匹配

Lukas Billera, Hedwig Nora Nordlinder, Jack Collier Ryder, Anton Oresten, Aron Stålmarck, Theodor Mosetti Björk, Ben Murrell

机构 * Department of Microbiology, Tumor and Cell Biology, Karolinska Institutet(卡罗林斯卡研究所微生物学、肿瘤和细胞生物学系)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract)

AI总结 提出分支流框架,通过随机分支和死亡过程控制序列元素数量,适用于变长数据生成,并在小分子、抗体序列和蛋白质骨架生成中验证效果。

Comments 39 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21072 2026-06-11 cs.CR cs.AI cs.LG 版本更新 67%

Erased but Not Forgotten: How Backdoors Compromise Concept Erasure

擦除但未遗忘:后门如何破坏概念擦除

Tobias Braun, Jonas Henry Grebe, Marcus Rohrbach, Anna Rohrbach

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract)

AI总结 本文揭示了一种名为擦除规避后门(EEB)的漏洞,攻击者将后门触发器绑定到待擦除概念上,使得该恶意链接在后续擦除后仍然存在,从而绕过多种概念擦除方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00883 2026-08-05 cs.MM cs.CV cs.SD 版本更新 62%

Audio-Visual World Models: Learning Physically Grounded Multisensory Dynamics

视听世界模型:为具身智能体奠定多感官想象的基础

Jiahua Wang, Leqi Zheng, Jialong Wu, Yaoxin Mao, Shijie Cheng

机构 * Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 提出视听世界模型(AVWM)统一框架,通过条件扩散Transformer(AV-CDiT)联合预测双耳音频与视觉动态,在30小时基准AVW-4k上实现高保真多模态预测,并验证其在具身导航中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19537 2026-08-03 cs.CV cs.AI cs.LG cs.MM cs.SD eess.AS 版本更新 62%

Deepfake Media Generation and Detection in the Generative AI Era: A Survey and Outlook

生成式AI时代的深度伪造媒体生成与检测:综述与展望

Florinel-Alin Croitoru, Andrei-Iulian Hiji, Vlad Hondru, Nicolae Catalin Ristea, Paul Irofti, Marius Popescu, Cristian Rusu, Radu Tudor Ionescu, Fahad Shahbaz Khan, Mubarak Shah

机构 * Department of Computer Science, University of Bucharest(布加勒斯特大学计算机科学系) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Department of Computer Science, University of Central Florida(中佛罗里达大学计算机科学系)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 综述了深度伪造生成与检测技术,涵盖图像、视频、音频和多模态内容,构建了分类体系,并提出了新的多模态基准测试,发现现有检测器对未见生成器的深度伪造泛化能力不足。

Comments Accepted in ACM Computing Surveys

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18314 2026-07-29 cs.CV cs.GR cs.RO 版本更新 62%

Diff2DGS: Reliable Reconstruction of Occluded Surgical Scenes via 2D Gaussian Splatting

Diff2DGS: 通过2D高斯点散布实现遮挡手术场景的可靠重建

Tianyi Song, Danail Stoyanov, Evangelos Mazomenos, Francisco Vasconcelos

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 Diff2DGS通过两阶段框架提升遮挡手术场景的3D重建精度,结合扩散模型和可学习变形模型,实现更准确的几何和外观重建。

Comments This work has been accpeted by the IEEE Robotics and Automation Letters(RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26795 2026-07-14 cs.CV cs.AI cs.MM 版本更新 62%

NaviCache: Test-Time Self-Calibration Caching for Video Generation

NaviCache: 视频生成的测试时自校准缓存

Zheqi Lv, Zhibo Zhu, Jinke Wang, Qi Tian, Shengyu Zhang, Zhengyu Chen, Chengxi Zang, Zhou Zhao, Fei Wu

机构 * Zhejiang University(浙江大学) Cornell University(康奈尔大学) Tencent Hunyuan(腾讯文生视频)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 针对视频扩散模型计算成本高的问题,提出NaviCache方法,将特征演化重构思为惯性导航系统问题,通过双状态估计架构自适应跟踪特征变化比和潜在漂移,实现有界误差的计算跳过,在多个模型上取得优异性能。

Comments Published at ICML 2026: Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05354 2026-06-25 cs.CV cs.GR 版本更新 62%

SplatPainter: Interactive Authoring of 3D Gaussians from 2D Edits via Test-Time Training

SplatPainter: 通过测试时训练从2D编辑交互式创作3D高斯

Yang Zheng, Hao Tan, Kai Zhang, Peng Wang, Leonidas Guibas, Gordon Wetzstein, Wang Yifan

机构 * Stanford University(斯坦福大学) Adobe

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出SplatPainter,一种状态感知的前馈模型,通过测试时训练实现从用户2D视图连续编辑3D高斯资产,支持局部细节优化、涂改和全局重着色,达到交互速度。

Comments project page https://y-zheng18.github.io/SplatPainter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01538 2026-06-12 cs.GR cs.CV cs.LG 版本更新 62%

MPMWorlds: Material-Point-Method Simulations for Inferring and Extrapolating Physical Dynamics

MPMWorlds: 用于推断和外推物理动力学的物质点法模拟

Žiga Kovačič, Kevin Ellis

机构 * Cornell University(康奈尔大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 通过构建2D物质点法(MPM)模拟数据集,研究从视频推断物理动力学并外推时间演化的能力,比较代码生成与视频扩散方法的优劣。

Comments 16 pages, 13 figures. Project page: https://zzigak.github.io/mpmworlds/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14614 2026-06-10 cs.CV cs.GR 版本更新 62%

WorldPlay: Towards Long-Term Geometric Consistency for Real-Time Interactive World Modeling

WorldPlay:面向实时交互式世界建模的长期几何一致性

Wenqiang Sun, Haiyu Zhang, Haoyuan Wang, Junta Wu, Zehan Wang, Zhenwei Wang, Yunhong Wang, Jun Zhang, Tengfei Wang, Chunchao Guo

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出WorldPlay流式视频扩散模型,通过双重动作表示、重构上下文记忆和上下文强制蒸馏方法,实现实时交互式世界建模并保持长期几何一致性,生成24 FPS的720p长视频。

Comments project page: https://3d-models.hunyuan.tencent.com/world/, demo: https://3d.hunyuan.tencent.com/sceneTo3D, code: https://github.com/Tencent-Hunyuan/HY-WorldPlay

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07011 2026-06-09 cs.CV cs.GR 版本更新 62%

HiMat: DiT-based Ultra-High Resolution SVBRDF Generation

HiMat: 基于DiT的超高分辨率SVBRDF生成

Zixiong Wang, Jian Yang, Yiwei Hu, Milos Hasan, Beibei Wang

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) Adobe Research(Adobe研究) NVIDIA Nanjing University(南京大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出HiMat框架,利用扩散变压器和线性注意力在高压缩潜空间生成4K SVBRDF,并通过CrossStitch模块保持跨图一致性,实现高效、多样化的超高分辨率材质生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13037 2026-08-17 cs.CV 版本更新 57%

Spatially-Grounded Text-to-Video Generation via Inference-Time Gradient-Free Optimization

基于推理时无梯度优化的空间接地文本到视频生成

Guillaume Jeanneret, Mathis Koroglu, Hugo Caselles-Dupré, Arnaud Dapogny, Matthieu Cord

机构 * ISIR - Sorbonne Université(ISIR - 索邦大学) Obvious Research

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对文本到视频生成的空间可控性挑战,提出无训练无梯度的GATO-Vid方法,通过解析求解交叉注意力分数实现精确空间引导,在提升定位精度的同时降低计算开销。

Comments Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30528 2026-08-17 cs.CV cs.LG 版本更新 57%

$μ$Flow: Leveraging Average Images for Improving Generalisation of Deepfake Faces Detectors

$μ$Flow:利用平均图像提升深度伪造人脸检测器的泛化能力

Orazio Pontorno, Mattia Litrico, Luca Guarnera, Mario Valerio Giuffrida, Sebastiano Battiato

机构 * University of Catania(卡塔尼亚大学) University of Nottingham(诺丁汉大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出仅用真实图像训练的单类深度伪造检测器$μ$Flow,通过平均图像放大生成痕迹并利用归一化流对齐特征分布,实现跨生成器类别的高泛化性能。

Comments Accepted at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31109 2026-08-17 cs.CV 版本更新 57%

InfiniVerse: Occupancy Guided Unbounded Scene Generation for Autonomous Driving

InfiniVerse: 面向自动驾驶的占用引导无界场景生成

Xiaoyu Ye, Leheng Li, Xinyu Ji, Yingjie Cai, Hongda He, Xu Yan, Guanyi Zhao, Ying-Cong Chen, Bingbing Liu, Shuguang Cui, Zhen Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Nanyang Technological University(南洋理工大学) Huawei Technologies Ltd.(华为技术有限公司) University of New South Wales(新南威尔士大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出InfiniVerse统一框架,通过3D占用表示和视频扩散模型实现从单帧到长距离、2D-3D对齐的动态城市场景可控生成,在Waymo和nuScenes上达到SOTA。

Comments Paper accepted as poster at ECCV workshop SPAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21378 2026-08-17 cs.CV cs.AI physics.geo-ph 版本更新 57%

An InSAR Phase Unwrapping Framework for Large-scale and Complex Events

一种用于大规模和复杂事件的InSAR相位解包裹框架

Yijia Song, Juliet Biggs, Alin Achim, Robert Popescu, Simon Orrego, Nantheera Anantrasirichai

机构 * Visual Information Laboratory, School of Computer Science, University of Bristol, UK(布里斯托尔大学计算机科学学院视觉信息实验室) COMET, School of Earth Sciences, University of Bristol, UK(布里斯托尔大学地球科学学院COMET中心) COMET, School of Computer Science, University of Bristol, UK(布里斯托尔大学计算机科学学院COMET中心)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于扩散模型的相位解包裹框架,用于处理大规模干涉图并解决由变形引起的相位不连续性,实验表明其在近地表变形场景中有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11745 2026-08-14 cs.CV 版本更新 57%

LiveAnimate: Stable Long-Form Streaming Human Animation in Real-Time

LiveAnimate:稳定的长时长流驱动人体动画实时生成系统

Yuxuan Zhang, Haozhong Xiong, Yubo Huang, Jiayi Song, Jinpeng Yu, Haofan Wang, Jiaming Liu, Ruihua Huang, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Qwen Applications Business Group of Alibaba(阿里巴巴通义千问应用业务组) Liblib AI

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 LiveAnimate基于14B参数视频DiT,经两阶段训练结合PR-Sink等设计,实现19.63 FPS长时长流人体动画生成,兼顾实时性、质量与稳定性,优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30045 2026-08-14 cs.CV 版本更新 57%

DualEraser: Joint Video Object and Effect Removal via Balanced Text-Mask Guidance and Decoupled Locator-Preserver

GenEraser:通过平衡文本-掩码引导和解耦定位器-保持器实现可泛化的视频对象移除

Yuqing Chen, Lin Liu, Haisu Wu, Xiaopeng Zhang, Yaowei Wang, Yujiu Yang, Qi Tian

机构 * Tsinghua University(清华大学) Pengcheng National Laboratory(鹏城实验室) Huawei(华为) Southeast University(东南大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出GenEraser框架,通过多条件混合专家、可学习深度CFG融合机制和解耦专家架构,解决视频对象移除中目标与物理效应同时消除的泛化难题,在ROSE和VOR-Eval上分别提升2.16 dB和1.44 dB。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01296 2026-08-14 cs.CV 版本更新 57%

SIFT-VTON: Geometric Correspondence Supervision on Cross-Attention for Virtual Try-On

SIFT-VTON:跨注意力中的几何对应监督用于虚拟试穿

Kosuke Takemoto, Takafumi Koshinaka

机构 * The Graduate School of Data Science, Yokohama City University, Kanagawa, Japan(数据科学研究生院, Yokohama 市立大学,神奈川县,日本)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SIFT-VTON方法,利用SIFT关键点匹配提供显式几何指导,提升扩散模型在虚拟试穿中的细节保留能力。

Comments Accepted at ICPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17897 2026-08-14 cs.CV cs.AI cs.LG cs.RO 版本更新 57%

RadarGen: Automotive Radar Point Cloud Generation from Cameras

RadarGen:从摄像头生成汽车雷达点云

Tomer Borreda, Fangqiang Ding, Sanja Fidler, Shengyu Huang, Or Litany

机构 * Technion(技术学院) MIT(麻省理工学院) NVIDIA(英伟达) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 RadarGen通过扩散模型从摄像头图像生成逼真的雷达点云,结合BEV对齐的深度、语义和运动线索,提升雷达生成的物理合理性与多模态模拟能力。

Comments ECCV 2026. Project page: https://radargen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10479 2026-08-13 cs.CV 版本更新 57%

Bridging Event Streams and DiT: Event-Guided Video Frame Interpolation

连接事件流与DiT:事件引导的视频帧插值

Guixu Lin, Yuyang Yu, Xiang Ji, Linyao Chen, Zhengwei Yin, Mengshun Hu, Mingdeng Cao, Shengfeng He, Yinqiang Zheng

机构 * The University of Tokyo(东京大学) South China University of Technology(华南理工大学) Wuhan University(武汉大学) Singapore Management University(新加坡管理大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于适配器的框架,将事件衍生提示融入预训练图像转视频扩散模型,利用IWEs与双向稀疏光流引导生成,提升视频帧插值质量,效果优于现有SOTA方法。

Comments https://joseph-lin-tech.github.io/BridgeEventDiT-VFI/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08672 2026-08-13 cs.GR cs.CG cs.NA math.NA 版本更新 57%

Adaptive Volumetric Parameterization of Simply Connected 3-Manifolds with Applications

单连通三维流形的自适应体积参数化及应用

Zhiyuan Lyu, Qiguang Chen, Lok Ming Lui, Gary P. T. Choi

专题命中 扩散模型 :diffusion(abstract);分类 cs.GR

AI总结 本文针对现有体积参数化方法不匹配三维流形形状导致畸变的问题,提出自适应体积参数化框架,含三类目标域设置与三步算法,可应用于多分辨率重网格化等任务,验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05474 2026-08-13 cs.CV 版本更新 57%

3D Scene Generation: A Survey

3D场景生成:一项综述

Haozhe Xie, Beichen Wen, Zhaoxi Chen, Fangzhou Hong, Ziwei Liu

机构 * S-Lab, Nanyang Technological University, Singapore(南洋理工大学S实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本综述系统梳理3D场景生成的四大范式方法,分析其技术基础与挑战,展望物理感知生成等方向,为该领域发展提供参考。

Comments Accepted by IJCV. Project Page: https://github.com/hzxie/Awesome-3D-Scene-Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09385 2026-08-12 cs.LG cs.AI cs.CV 版本更新 57%

Imaginative Generative AI: Crossing the Entropy Wall into Worlds Beyond Imitation

想象式生成人工智能:跨越熵墙进入超越模仿的世界

Farzan Farnia, Hossein Goli, Amin Gohari

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出IGA框架,通过熵约束投影实现从模仿到想象的生成,可修复数据多样性并实现可控频谱外推,相关方法适用于DDPM等扩散模型。

详情

展开后加载摘要…

URL PDF HTML 收藏