arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-07 至 2026-07-07 共收录 243 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 192 篇

2512.18773 2026-07-07 eess.SP 版本更新 78%

Decentralized GNSS at Global Scale via Graph-Aware Diffusion Adaptation

通过图感知扩散适应实现全球规模去中心化GNSS

Xue Xian Zheng, Xing Liu, Tareq Y. Al-Naffouri

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种全球去中心化GNSS架构,利用时间变化图模型和深度线性神经网络优化信息交换,实现厘米级自定位和网络共识,提升收敛速度和通信效率。

Comments Accepted by Nature (npj Wireless Technology)

Journal ref npj Wireless Technology, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14991 2026-07-07 cs.LG math.OC q-fin.PM 版本更新 78%

Adaptive Partitioning and Learning for Stochastic Control of Diffusion Processes

用于扩散过程随机控制的自适应划分与学习

Hanqing Jin, Renyuan Xu, Yanzhao Yang

机构 * Mathematical Institute, University of Oxford(牛津大学数学研究所) Department of Management Science and Engineering, Stanford University(斯坦福大学管理科学与工程系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究无界连续状态空间等设定下扩散过程的强化学习,引入基于模型算法自适应划分联合状态-动作空间,平衡探索与近似,分析得出依赖多因素的遗憾界并验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10355 2026-07-07 math.NA cs.NA 版本更新 78%

Staggered time discretization in finitely-strained heterogeneous visco-elastodynamics with damage or diffusion in the Eulerian frame

欧拉框架下具有损伤或扩散的有限应变非均匀粘弹性动力学中的交错时间离散化

Tomáš Roubíček

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究将半隐式时间离散化应用于欧拉描述的可压缩非线性粘弹性固体动力学模型,考虑了开尔文-沃伊特流变学等,证明了三维情况下的数值稳定性和收敛性,并简要概述了一些增强内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11866 2026-07-07 cs.IR 版本更新 78%

SimDiffRec: Semantic Similarity-Guided Diffusion for Contrastive Sequential Recommendation

SimDiffRec:用于对比序列推荐的语义相似性引导扩散

Jinkyeong Choi, Yejin Noh, Donghyeon Park

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对序列推荐系统,提出SimDiffRec,利用物品嵌入向量相似性生成语义一致噪声,依高置信度选增强位置,结合对比学习提升训练效率与推荐性能,实验表明其优于基线模型。

Comments To appear in Proceedings of the 19th ACM International Conference on Web Search and Data Mining (WSDM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02628 2026-07-07 cs.CV cs.LG 新提交 77%

SE-UNet: Singular Equivariant Imaging for Real-World Constrained Generation

SE-UNet:用于现实世界约束生成的奇异等变成像

Kanishk Awadhiya

机构 * Independent Researcher(独立研究者)

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);image synthesis(abstract);分类 cs.CV

AI总结 介绍SE-UNet框架,将生成视为受几何等变性和奇异值门控约束的优化问题,有效规范解空间,实现CIFAR-10上零样本修复,超越DIP基线,为约束生成提供数据高效途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16898 2026-07-07 cs.AI cs.CV cs.CY 版本更新 77%

AI's Blind Spots: Geographic Knowledge and Diversity Deficit in Generated Urban Scenario

人工智能的盲点:生成式城市场景中的地理知识与多样性不足

Ciro Beneduce, Massimiliano Luca, Bruno Lepri

机构 * Bruno Kessler Foundation(布鲁诺·凯斯勒基金会) University of Trento(特伦托大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);text-to-image(abstract);分类 cs.CV

AI总结 评估基于扩散的文本到图像模型在生成美国城市街景图像中的地理知识和表征偏差,通过生成图像并嵌入模型对比FID,发现模型能编码地理信息,但存在视觉刻板印象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05392 2026-07-07 cs.CV 新提交 74%

SynCity 3000: Bootstrapping Scene-Scale 3D Diffusion

SynCity 3000:引导式构建场景级3D扩散模型

Paul Engstler, Iro Laina, Christian Rupprecht, Andrea Vedaldi

机构 * Visual Geometry Group, University of Oxford(牛津大学视觉几何组)

专题命中 扩散模型 :diffusion(title);分类 cs.CV

AI总结 针对3D场景训练数据稀缺问题,该框架将图像转3D生成器改造为卷积算子,依托新合成数据引擎微调,可生成全局连贯、支持细粒度布局控制的任意规模3D场景。

Comments Project Page: https://research.paulengstler.com/syncity-3k/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04739 2026-07-07 cs.RO 新提交 71%

Spatial Attention: Adapting Execution Horizons for Diffusion Policies via Observation Sensitivity

空间注意力:通过观测敏感度调整扩散策略的执行范围

Che-Sang Park, Junsu Ha, Jianlong Fu, Frank C. Park

机构 * Robotics Laboratory, Seoul National University(首尔国立大学机器人实验室) Microsoft Research Asia(微软亚洲研究院)

专题命中 扩散模型 :diffusion(title)

AI总结 研究如何在机器人学习中自适应调整采样动作块的执行范围以平衡响应性和计算成本,引入空间注意力概念,通过预测未来值动态分配执行范围,实验表明该方法可提高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15161 2026-07-07 nlin.PS 版本更新 71%

Localized spatiotemporal reaction-diffusion patterns on a line and a disk arising from a subcritical finite wavenumber Hopf instability

线和盘上由亚临界有限波数霍普夫不稳定性产生的局部化时空反应扩散模式

Edgar Knobloch, Saar O. Modai, Hannes Uecker, Arik Yochelis

专题命中 扩散模型 :diffusion(title)

AI总结 研究亚临界有限波数霍普夫分岔与Purwins模型中的时空局部化和扩展结构,通过数值持续方法分析线上的局部稳态和行进波的蛇形行为,并用弱非线性理论验证结果,揭示跳跃振子的起源及非典型同宿蛇形结构的组织。

Comments 40 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05088 2026-07-07 cs.CV 新提交 70%

RADIANCE: Relative Adaptive Denoising with IP-Adapter for Novel Concept Enhancement

RADIANCE:使用IP-适配器进行相对自适应去噪以增强新颖概念

Zi-Xiang Ni, Bo-Lun Huang, Teng-Fang Hsiao, Bo-Kai Ruan, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对文本到图像扩散模型合成罕见概念的问题,提出无训练框架RADIANCE,通过三个模块组件增强预训练主干,经实验验证其能提升合成效果。

Comments Accepted to ECCV 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04674 2026-07-07 cs.CV 新提交 70%

Video Generation Models Are Inherent Lighting Estimators

视频生成模型是内在的光照估计器

Ziqi Cai, Shuchen Weng, Kaiqi Liu, Zifeng Wang, Zhiquan Zhang, Minggui Teng, Han Jiang, Boxin Shi

机构 * Peking University(北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) OpenBayes Information Technology Co., Ltd.(北京智谱华章科技有限公司)

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 研究从单张自然视频恢复动态环境图的问题,核心方法是将光照估计重构为引导视频修复任务,贡献是提出V-LITE框架,能生成连贯HDR环境图,证明视频扩散模型可估计物理场景光照。

Comments Project Page: https://caiziqi.com/research/vlite/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03580 2026-07-07 cs.LG cs.CV 新提交 70%

When Geometry Aligns: Dihedral Hidden-State Transformations in UNet, ViT, and DiT Architectures

当几何对齐时:UNet、ViT和DiT架构中的二面体隐藏状态变换

Mojtaba Faramarzi, Alex Lamb, Irina Rish

机构 * University of Montreal(蒙特利尔大学) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 研究通过将二面体群基于反射的元素应用于中间隐藏状态作为受控内部干预,对比几何一致和不一致变体,分析特征稳定性和几何漂移,发现一致变换可提高稳定性,为稳定隐藏状态干预确立关键原则。

Comments Accepted at the Conference on Lifelong Learning Agents (CoLLAs), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03488 2026-07-07 cs.CV 新提交 70%

Learning to Generate Multiple Objects from Dense and Occluded Layouts

从密集和遮挡布局中学习生成多个对象

Bach-Hoang Ngo, Si-Tri Ngo, Hieu Le, Trung-Nghia Le

机构 * University of Science, Ho Chi Minh City(胡志明市科学大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究文本到图像扩散模型在密集场景中对象计数错误问题,提出布局感知注意力偏差和无模态平衡损失方法,引入基准测试,提高计数准确性并防止实例合并且保持图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03470 2026-07-07 cs.CV 新提交 70%

PhysMirror: Physics-Aware Mirror Object Generation

物理镜像:物理感知镜像对象生成

Xuan-Bach Mai, Duy-Phuc Nguyen, Quoc-Van Le, Tam V. Nguyen, Thanh-Toan Do, Huu Le, Duong-Van Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, Ho Chi Minh City(胡志明市科学大学) Vietnam National University, Ho Chi Minh City(胡志明市越南国家大学) University of Dayton(代顿大学) Monash University(莫纳什大学) VinFast(VinFast公司) VinUniversity(Vin大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对现代文本到图像扩散模型合成物理精确镜像反射的挑战,提出物理感知生成框架PhysMirror,通过3D空间先验执行投影几何,引入评估指标,实验表明其在反射精度等方面优于基线。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00832 2026-07-07 cs.CV cs.AI 新提交 70%

Pano2World: End-to-End 3D Generation via Unified Multi-View Sequences

Pano2World: 通过统一多视图序列进行端到端三维生成

Zhenjia Li, Jinrang Jia, Yifeng Shi

机构 * Ke Holdings Inc.(贝壳找房)

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 提出Pano2World方法,利用全景扩散模型和视图感知注意力路由,从单张室内全景图直接生成可探索的三维高斯场景,解决多步管道误差累积和视频模型灵活性不足的问题。

Comments 10 pages, 3 figures, 3 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31604 2026-07-07 cs.CV 版本更新 70%

Representation Forcing for Bottleneck-Free Unified Multimodal Models

表示强制:无瓶颈统一多模态模型

Yuqing Wang, Zhijie Lin, Ceyuan Yang, Yang Zhao, Fei Xiao, Hao He, Qi Zhao, Zihan Ding, Fuyun Wang, Shuai Wang, Youliang Zhang, Haoqi Fan, Xihui Liu

机构 * University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子) The Chinese University of Hong Kong(香港中文大学) Nanjing University(南京大学) Tsinghua University(清华大学)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出表示强制(RF)技术,通过让解码器自回归预测视觉表示作为中间令牌,再在相同骨干网络中引导像素扩散,从而消除统一多模态模型对预训练VAE的依赖,实现无瓶颈的端到端模型。

Comments Project page: https://yuqingwang1029.github.io/RepresentationForcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16239 2026-07-07 cs.CV 版本更新 70%

EM3M: An Electron Micrograph Dataset for Microstructural Segmentation and Generation

EM3M:用于微观结构分割与生成的电子显微镜图像数据集

Nan Wang, Zhiyi Xia, Yiming Li, Siyuan Zhang, Shi Tang, Zuxin Fan, Xi Fang, Haoyi Tao, Guolin Ke, Yanhui Hong

机构 * DP Technology(DP技术)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对深度学习分析电子显微镜图像缺乏大规模专家标注数据集的问题,引入EM3M数据集,介绍构建过程,提供文本到图像扩散模型,评估分割方法并给出优化基线,推动自动化材料分析研究。

Comments 31 pages, 13 figures, Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05376 2026-07-07 cs.CV cs.GR 新提交 62%

MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing

MV-Forcing:基于4D锚定时空自强制的长时长多视角视频生成

Gal Fiebelman, Hadar Averbuch-Elor, Sagie Benaim

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Cornell University(康奈尔大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 针对动态场景长时多视角一致视频生成难题,提出MV-Forcing框架,融合时序与视角自回归,实现任意时长视角数的高一致性多视角视频生成。

Comments Accepted to ECCV 2026. Project webpage: https://galfiebelman.github.io/mv-forcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02798 2026-07-07 cs.CV cs.GR 新提交 62%

Track the Noise, Move the World:3D-Grounded Motion-Consistent Noise for Controllable Video Generation

追踪噪声,移动世界:用于可控视频生成的3D地面运动一致噪声

Long Vu, Tan Ngo, Animesh Karnewar, Amir Habibian, Binh-Son Hua, Hung Bui, Minh Hoai Nguyen, Phong Nguyen-Ha

机构 * Qualcomm AI Research(高通人工智能研究中心) Trinity College Dublin(都柏林三一学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 研究如何在视频生成中实现对物体和相机运动的精确统一控制。核心方法是构建统一框架UniCaMo,直接构造扩散模型输入噪声。主要贡献是在视频质量和运动可控性上取得先进成果,且无需对基础模型做大改动。

Comments Project Page: https://phongnhhn.info/Unicamo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14721 2026-07-07 cs.GR cs.CV cs.RO 新提交 62%

DC-Motion: Decoupling Structure and Details via Discrete-Continuous Tokens for Human Motion Generation

DC-Motion: 通过离散-连续令牌解耦语义与细节以生成人体运动

Hequan Wang, Xuean Chen, Jiaxu Zhang, Zhengbo Zhang, Zhigang Tu

机构 * Wuhan University(武汉大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出DC-Motion框架,通过离散-连续VAE将运动分解为语义离散令牌和细节连续残差,结合掩码自回归模型和残差扩散模型,实现复杂文本指令下的高质量运动生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05373 2026-07-07 cs.CV 新提交 57%

PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space

PixWorld:在像素空间中统一3D场景生成与重建

Sensen Gao, Zhaoqing Wang, Qihang Cao, Dongdong Yu, Changhu Wang, Jia-Wang Bian

机构 * Nanyang Technological University(南洋理工大学) AISphere(人工智能领域)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对3D场景生成与重建原有范式存在信息损失等缺陷,提出像素空间统一扩散框架PixWorld,引入几何感知损失,无需预训练自编码器,性能优于现有方法。

Comments Project page: https://sensengao.github.io/PixWorld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05133 2026-07-07 cs.CV 新提交 57%

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation

UNIVERSE:面向自动驾驶的基于灵活掩码调制模态生成的统一视频动作模型

Mengmeng Liu, Diankun Zhang, Jiuming Liu, Jianfeng Cui, Hongwei Xie, Guang Chen, Hangjun Ye, Francesco Nex, Hao Cheng, Michael Ying Yang

机构 * University of Twente(特温特大学) Xiaomi EV(小米汽车) University of Cambridge(剑桥大学) University of Bath(巴斯大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对现有方案难以将视频建模收益迁移至轨迹生成的问题,提出单掩码调制扩散Transformer的统一模型,通过模态解耦掩码实现直接的视频监督,大幅提升跨域动作泛化与推理效率。

Comments 18 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05056 2026-07-07 cs.CV 新提交 57%

Consistent and Editable: A Balanced Framework for Text-Guided Video Editing

一致且可编辑:文本引导视频编辑的平衡框架

Tao Jin, Li Xiao

机构 * USTC(中国科学技术大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对视频编辑中时间一致性和可编辑性难以平衡的问题,提出EquiEdit框架。通过时间Mamba模块增强时间一致性,设计基于频谱变换的噪声注入策略提升可编辑性,实验证明该方法有效。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04553 2026-07-07 cs.MM cs.AI 新提交 57%

Lights, Camera, Carbon: Architectural Scaling Laws for Video Generation Energy Consumption

灯光、相机、碳:视频生成能耗的架构缩放定律

Nidhal Jegham, Boris Gamazaychikov, Sasha Luccioni

机构 * University of Rhode Island, Sustainable AI Group(罗德岛大学,可持续人工智能小组) Sustainable AI Group(可持续人工智能小组)

专题命中 扩散模型 :diffusion(abstract);分类 cs.MM

AI总结 提出双向框架,从架构原理和生成参数估算文本到视频等模型能耗。正向预测能耗,反向从推理时间恢复架构缩放行为,基于视频扩散模型性质证明能耗服从缩放定律,为模型可持续性基准测试提供框架。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03875 2026-07-07 cs.CV 新提交 57%

MACRO: Training-free Multi-plane Attention for Closeup Render Optimization

MACRO:用于特写渲染优化的免训练多平面注意力

Nitzan Hodos, Roy Amoyal, Lior Fritz, Ianir Ideses, Sagie Benaim, Netalee Efrat

机构 * Amazon Prime Video(亚马逊Prime视频) Technion, Israel Institute of Technology(以色列理工学院) Ben Gurion University(本古里安大学) Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对特写渲染难题,分析现有方法失败原因,提出MACRO,利用场景3D结构解决比例差距,无需架构改变和额外训练,贡献新基准和评估协议,取得领先成果。

Comments Project page: https://nitzanhod.github.io/MACRO

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02638 2026-07-07 cs.CV q-bio.QM 新提交 57%

CLABTOOLKIT: An Open-Source Toolkit for Routine Processing, Manipulation, and Visualization of Neuroimaging Data

CLABTOOLKIT:用于神经影像数据常规处理、操作和可视化的开源工具包

Yasser Alemán-Gómez, Nino Hervé, Patric Hagmann

机构 * Connectomics Lab, Department of Radiology, Lausanne University Hospital (CHUV)(洛桑大学医院(CHUV)放射科连接组学实验室) University of Lausanne (UNIL)(洛桑大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 神经影像研究面临数据结构多样、工具接口和格式不兼容问题。CLABTOOLKIT将相关操作整合为统一框架,核心数据结构可处理多种格式数据,还有多个模块支持多种分析及可视化,其配置系统方便定制工作流程。

Comments Presented at OHBM 2026 in Bordeaux, France. Submitted to Aperture Neuro

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02596 2026-07-07 cs.CV cs.LG 新提交 57%

CIPHER: Causal Intervention Pathways for Healthcare Equity and Robustness

CIPHER:用于医疗公平性和稳健性的因果干预路径

Xinyu Jia, Weidong Guo, Wangyuan Zhao, Yi Guo, Zeju Li, Yuanyuan Wang

机构 * College of Biomedical Engineering, Fudan University(复旦大学 生物医学工程学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究医疗诊断深度学习模型在敏感亚组间表现差异问题,基于结构因果模型揭示敏感属性影响图像内容的四条路径,引入CIPHER框架干预因果路径,提升诊断准确性并减少差异。

Comments 8 pages, 2 figures. Accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01220 2026-07-07 cs.CV 版本更新 57%

Visual Implicit Autoregressive Modeling

基于隐式平衡层的视觉隐式自回归建模

Pengfei Jiang, Jixiang Luo, Luxi Lin, Zhaohong Huang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出VIAR模型,通过隐式平衡层和可调节的计算控制,在保持生成质量的同时降低内存和提升效率,优于现有自回归基线和扩散模型。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27422 2026-07-07 cs.CV 版本更新 57%

Difix3D-W: Distractor-Free Few-Shot 3D Gaussian Splatting in the Wild

野外稀疏视角3D高斯点云生成

Wongi Park, Jordan A. James, Myeongseok Nam, Minjae Lee, Soomok Lee, Sang-Hyun Lee, William J. Beksi

机构 * University of Texas at Arlington(德克萨斯大学阿灵顿分校) GenGenAI Seoul National University(首尔国立大学) Kennesaw State University(肯纳邦斯州立大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种针对无约束真实场景的3D稀疏视角合成框架,通过引入扩散模型和瞬时掩码提升3D表示质量,实现高保真3D渲染。

Comments 16 pages, 16 figures, and 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08029 2026-07-07 cs.LG cs.CV 版本更新 57%

CLARITY: Medical World Model for Guiding Treatment Decisions by Modeling Context-Aware Disease Trajectories in Latent Space

CLARITY:用于通过在潜在空间中建模情境感知疾病轨迹来指导治疗决策的医学世界模型

Tianxingjian Ding, Yuanhao Zou, Chen Chen, Mubarak Shah, Yu Tian

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 CLARITY通过在潜在空间中建模时间间隔和患者特定数据,预测疾病演变轨迹,生成个性化治疗方案,并在医学领域实现最先进的治疗规划性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏