arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-30 至 2026-03-30 共收录 43 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 43 篇

2403.18425 2026-03-30 cs.CV cs.AI cs.LG 85%

U-Sketch: An Efficient Approach for Sketch to Image Diffusion Models

U-Sketch:一种高效的从草图到图像扩散模型方法

Ilias Mitsouras, Eleftherios Tsonis, Paraskevi Tzouveli, Athanasios Voulodimos

机构 * Artificial Intelligence and Learning Systems Laboratory(人工智能与学习系统实验室) School of Electrical and Computer Engineering(电气与计算机工程学院) National Technical University of Athens(雅典国立技术大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 U-Sketch通过引入U-Net类型的潜在边缘预测器和草图简化网络,提升草图到图像合成的效率与真实度,减少去噪步骤并提升生成质量。

Journal ref IEEE Access 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06178 2026-03-30 cs.CV 83%

Making Training-Free Diffusion Segmentors Scale with the Generative Power

利用生成能力使免训练扩散分割器扩展

Benyuan Meng, Qianqian Xu, Zitai Wang, Xiaochun Cao, Longtao Huang, Qingming Huang

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) School of Cyber Science and Tech., Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络空间安全学院) Alibaba Group(阿里巴巴集团) School of Computer Science and Tech., University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) Key Laboratory of Big Data Mining and Knowledge Management, CAS(中国科学院大数据挖掘与知识管理重点实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文研究了如何通过提升扩散模型的生成能力来改进免训练的图像分割方法,提出自动聚合和像素级重缩放技术以解决注意力图与全局表示不一致及文本标记间得分不平衡的问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21419 2026-03-30 cs.LG cs.CV 83%

Revisiting Diffusion Model Predictions Through Dimensionality

通过维度性重新审视扩散模型预测

Qing Jin, Chaoyang Wang

机构 * Independent Researcher(独立研究员)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文通过理论框架解释高维数据中直接预测数据优于噪声和速度预测的原因,并提出k-Diff框架自动学习最优预测参数以提升生成性能。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20353 2026-03-30 cs.LG cs.AI cs.CV cs.MM cs.PF 81%

FastCache: Fast Caching for Diffusion Transformer Through Learnable Linear Approximation

通过可学习线性近似加速扩散变换器的FastCache

Dong Liu, Yanxuan Yu, Jiayi Zhang, Yifan Li, Ben Lengerich, Ying Nian Wu

机构 * Yale University(耶鲁大学) Columbia University(哥伦比亚大学) University of California, Los Angeles(加州大学洛杉矶分校) University of Wisconsin--Madison(威斯康星大学麦迪逊分校) Michigan State University(密歇根州立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出FastCache,通过隐藏状态层面的缓存与压缩框架,利用模型内部表示中的冗余性加速扩散变换器推理,结合可学习线性近似方法,有效降低计算开销并保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26509 2026-03-30 cs.CV 79%

Conditional Diffusion for 3D CT Volume Reconstruction from 2D X-rays

基于条件扩散的3DCT体积重建从2DX光

Martin Rath, Morteza Ghahremani, Yitong Li, Ashkan Taghipour, Marcus Makowski, Christian Wachinger

机构 * Technical University of Munich (TUM)(慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) University of Western Australia (UWA)(西澳大利亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出AXON框架,通过多阶段扩散模型直接从真实X光重建高保真3DCT体积,采用粗到细策略和ControlNet优化,支持双平面X光输入并提升诊断分辨率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26263 2026-03-30 cs.CV cs.RO 79%

DRUM: Diffusion-based Raydrop-aware Unpaired Mapping for Sim2Real LiDAR Segmentation

DRUM:基于扩散的反射率感知无配对映射用于Sim2Real激光雷达分割

Tomoya Miyawaki, Kazuto Nakashima, Yumi Iwashita, Ryo Kurazume

机构 * Kyushu University(九州大学) Jet Propulsion Laboratory, California Institute of Technology(喷气推进实验室,加州理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DRUM通过利用未标记真实数据预训练的扩散模型,结合反射强度和射线丢失噪声特性,提升Sim2Real激光雷达分割性能。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26211 2026-03-30 cs.CV cs.AI 79%

Towards GUI Agents: Vision-Language Diffusion Models for GUI Grounding

迈向GUI代理:用于GUI定位的视觉-语言扩散模型

Shrinidhi Kumbhar, Haofu Liao, Srikar Appalaraju, Kunwar Yashraj Singh

机构 * Arizona State University(亚利桑那州立大学) AWS Agentic AI

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文探讨了离散扩散视觉-语言模型在GUI定位中的应用,通过混合掩码策略提升定位精度,并在多个数据集上验证了其有效性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26117 2026-03-30 eess.IV cs.CV 79%

FINDER: Zero-Shot Field-Integrated Network for Distortion-free EPI Reconstruction in Diffusion MRI

FINDER:用于扩散磁共振成像中无失真EPI重建的零样本场积分网络

Namgyu Han, Seong Dae Yun, Chaeeun Lim, Sunghyun Seok, Sunju Kim, Yoonhwan Kim, Yohan Jun, Tae Hyung Kim, Berkin Bilgic, Jaejin Cho

机构 * Sejong University(世宗大学) Forschungszentrum Jülich(于利希研究中心) Athinoula A. Martinos Center for Biomedical Imaging(Athinoula A. Martinos生物医学成像中心) Harvard Medical School(哈佛医学院) Hongik University(弘益大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出FINDER网络,通过联合优化图像和B0场图,解决EPI重建中的几何失真问题,提升扩散成像质量。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26071 2026-03-30 cs.CV cs.LG 79%

MUST: Modality-Specific Representation-Aware Transformer for Diffusion-Enhanced Survival Prediction with Missing Modality

MUST:一种模态特定表示感知的Transformer,用于具有缺失模态的扩散增强生存预测

Kyungwon Kim, Dosik Hwang

机构 * Yonsei University(延世大学) Korea Institute of Science and Technology(韩国科学技术研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MUST通过分解模态特定和跨模态上下文化组件,提高生存预测的准确性,在缺失模态情况下仍能保持稳健预测。

Comments Accepted to CVPR 2026. 10 pages, 5 figures, supplementary included

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19692 2026-03-30 cs.CV 79%

Interact2Ar: Full-Body Human-Human Interaction Generation via Autoregressive Diffusion Models

Interact2Ar:通过自回归扩散模型生成全身体态的人与人交互

Pablo Ruiz-Ponce, Sergio Escalera, José García-Rodríguez, Jiankang Deng, Rolandos Alexandros Potamias

机构 * Universidad de Alicante(阿利坎特大学) Universitat de Barcelona and Computer Vision Center(巴塞罗那大学与计算机视觉中心) Imperial College London(伦敦帝国理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Interact2Ar,首个基于文本条件的自回归扩散模型,用于生成全身体态的人与人交互,通过专用并行分支实现详细手部运动,结合新颖的记忆技术提升适应性,支持多场景应用。

Comments Project Page: https://pabloruizponce.com/papers/Interact2Ar

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16928 2026-03-30 cs.CV 79%

Rethinking Diffusion Model-Based Video Super-Resolution: Leveraging Dense Guidance from Aligned Features

重新思考基于扩散模型的视频超分辨率:利用对齐特征的密集引导

Jingyi Xu, Meisong Zheng, Ying Chen, Minglang Qiao, Xin Deng, Mai Xu

机构 * Beihang University(北京航空航天大学) State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DGAF-VSR方法,通过优化对齐和补偿机制提升视频超分辨率的感知质量、保真度和时间一致性。

Comments Accepted by CVPR 2026,20pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26014 2026-03-30 eess.IV cs.CV 79%

Cone-Beam CT Image Quality Enhancement Using A Latent Diffusion Model Trained with Simulated CBCT Artifacts

使用基于伪CBCT伪影训练的条件潜变量扩散模型进行锥束CT图像质量增强

Naruki Murahashi, Mitsuhiro Nakamura, Megumi Nakao

机构 * Graduate School of Medicine, Kyoto University(京都大学医学研究科)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种基于条件潜变量扩散模型的锥束CT图像质量增强方法,利用伪CBCT图像进行自监督学习,有效提升图像质量并保持解剖结构,实验表明其在处理速度和图像改善性能上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25977 2026-03-30 cs.CV 79%

Diffusion MRI Transformer with a Diffusion Space Rotary Positional Embedding (D-RoPE)

具有扩散空间旋转位置嵌入的扩散磁共振成像变换器(D-RoPE)

Gustavo Chau Loo Kung, Mohammad Abbasi, Camila Blank, Juze Zhang, Alan Q. Wang, Sophie Ostmeier, Akshay Chaudhari, Kilian Pohl, Ehsan Adeli

机构 * Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出D-RoPE以解决扩散磁共振成像中空间、扩散加权和方向依赖性的建模问题,通过自监督预训练提升模型在多种任务中的表现,实现更稳健的跨设置表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25758 2026-03-30 cs.CV cs.AI cs.LG eess.IV 79%

A-SelecT: Automatic Timestep Selection for Diffusion Transformer Representation Learning

A-SelecT:扩散变换器表示学习中的自动时间步选择

Changyu Liu, James Chenhao Liang, Wenhao Yang, Yiming Cui, Jinghao Yang, Tianyang Wang, Qifan Wang, Dongfang Liu, Cheng Han

机构 * University of Missouri–Kansas City(密苏里大学堪萨斯城分校) U. S. Naval Research Laboratory(美国海军研究实验室) Lamar University(拉马尔大学) University of Florida(佛罗里达大学) University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德河谷分校) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Meta AI Rochester Institute of Technology(罗切斯特理工学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出A-SelecT方法,通过动态选择扩散变换器中最信息丰富的时间步,提升训练效率和表示能力,在分类和分割任务中优于现有扩散模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26432 2026-03-30 quant-ph cond-mat.mes-hall cs.LG 78%

Reconstructing Quantum Dot Charge Stability Diagrams with Diffusion Models

利用扩散模型重建量子点电荷稳定性图

Vinicius Hernandes, Joseph Rogers, Rouven Koch, Thomas Spriggs, Brennan Undseth, Anasua Chatterjee, Lieven M. K. Vandersypen, Eliska Greplova

机构 * Kavli Institute of Nanoscience, Delft University of Technology(代尔夫特理工大学卡夫利纳米科学研究所)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出利用条件扩散模型从稀疏测量中重建量子点电荷稳定性图,通过两种实验驱动的掩码策略验证,展示了生成模型在减少量子设备表征开销方面的有效性。

Comments Code available at https://gitlab.com/QMAI/papers/diffusioncsds. Data available at https://doi.org/10.5281/zenodo.19252638

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26364 2026-03-30 cs.SD 78%

LLaDA-TTS: Unifying Speech Synthesis and Zero-Shot Editing via Masked Diffusion Modeling

LLaDA-TTS: 通过掩码扩散建模统一语音合成与零样本编辑

Xiaoyu Fan, Huizhi Xie, Wei Zou, Yunzhang Chen

机构 * BRVoice Team, Bairong, Inc., China(百融云创BRVoice团队,中国)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 LLaDA-TTS通过掩码扩散模型替代自回归解码,实现语音合成与零样本编辑的统一,提升生成速度并减少推理延迟。

Comments 11 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26322 2026-03-30 cs.RO 78%

DiffusionAnything: End-to-End In-context Diffusion Learning for Unified Navigation and Pre-Grasp Motion

DiffusionAnything: 端到端的上下文扩散学习用于统一导航和预抓取运动

Iana Zhura, Yara Mahmoud, Jeffrin Sam, Hung Khang Nguyen, Didar Seyidov, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Center for Digital Engineering, Skolkovo Institute of Science and Technology(斯科尔科沃科学技术学院数字工程中心智能空间机器人实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种端到端的上下文扩散学习方法,通过多尺度特征调制实现统一的导航与精细操控,仅需5分钟自监督数据即可实现零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03857 2026-03-30 cond-mat.stat-mech math.PR 78%

Classification of diffusion processes in dimension $d$ via the Carleman approach with applications to models involving additive, multiplicative or square-root noises

通过Carleman方法对维度为d的扩散过程进行分类,应用于包含加性、乘性或平方根噪声的模型

Cecile Monthus

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过Carleman方法将随机微分方程转化为线性系统,分析不同噪声类型的扩散过程的谱分解特性,揭示其在不同维度下的动态行为。

Comments 69 pages

Journal ref J. Stat. Mech. (2026) 033204

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05946 2026-03-30 math.AP 78%

Elementary discrete diffusion/redistancing schemes for the mean curvature flow

均 curvature 流的初等离散扩散/再分布方案

Antonin Chambolle, Daniele De Gennaro, Massimiliano Morini

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于简单扩散步骤和精确再分布操作的均 curvature 流离散方案,并在标准CFL条件下证明其收敛性,同时讨论了更一般化的卷积/再分布方案扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25872 2026-03-30 cs.LG 78%

DRiffusion: Draft-and-Refine Process Parallelizes Diffusion Models with Ease

DRiffusion:通过草稿与精修过程轻松并行化扩散模型

Runsheng Bai, Chengyu Zhang, Yangdong Deng

机构 * CSAIL, MIT(麻省理工学院计算机科学与人工智能实验室) Tsinghua University(清华大学) IST, Nanjing University(南京大学智能科学与技术学院) School of Software, Tsinghua University(清华大学软件学院) FuturististAI Lab, Shanghai Tsinghua International Innovation Center(上海清华国际创新中心未来人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 DRiffusion通过草稿与精修过程并行化扩散模型,提升采样速度同时保持生成质量,实验显示在多个模型上实现1.4至3.7倍加速,质量指标仅小幅下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25752 2026-03-30 cs.CL cs.SD eess.AS 78%

Relational graph-driven differential denoising and diffusion attention fusion for multimodal conversation emotion recognition

关系图驱动的微分去噪和扩散注意力融合用于多模态对话情感识别

Ying Liu, Yuntao Shou, Wei Ai, Tao Meng, Keqin Li

机构 * College of Computer and Mathematics, Central South University of Forestry and Technology(中南林业科技大学计算机与数学学院) Department of Computer Science, State University of New York, New Paltz(纽约州立大学新帕尔茨分校计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出关系感知去噪和扩散注意力融合模型,通过微分Transformer去噪、构建模态关系子图和文本引导跨模态扩散机制,提升多模态对话情感识别性能。

Comments 19 pages

Journal ref neurocomputing2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02040 2026-03-30 math-ph math.MP 78%

Renormalisation for Reaction-Diffusion Systems with Non-Local Interactions

反应-扩散系统非局部相互作用的重整化

Chris D Greenman

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究非局部相互作用对反应-扩散系统的影响,发现非局部相互作用可抑制紫外发散,但红外发散仍存在。重整化方法在临界点表现出与局部相互作用相同的普遍行为,并通过重整化群解释空间-时间-场缩放保持作用结构,可直接求解Callan-Symanzik方程。

Comments 25 Pages, 6 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20316 2026-03-30 math.PR math.FA 78%

Score-Based Diffusion Models in Infinite Dimensions: A Malliavin Calculus Perspective

基于无穷维的分数模型:从马尔可夫计算视角

Ehsan Mirafzali, Frank Proske, Daniele Venturi, Razvan Marinescu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文从马尔可夫计算视角研究无穷维分数模型,推导了无穷维过渡测度的对数导数表达式,适用于希尔伯特空间的几何结构和一般迹类算子。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09364 2026-03-30 cs.IR cs.LG cs.NE 78%

Diffusion Recommender Models and the Illusion of Progress: A Concerning Study of Reproducibility and a Conceptual Mismatch

扩散推荐模型与进步的幻觉:关于可重复性和概念不匹配的令人担忧的研究

Michael Benigni, Maurizio Ferrari Dacrema, Dietmar Jannach

机构 * Politecnico di Milano(米兰理工大学) University of Klagenfurt(克拉根福大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究评估了九篇SIGIR 2023和2024推荐算法的可重复性,发现仅25%的结果可复现,且扩散模型在传统推荐任务中存在概念不匹配,质疑其适用性。

Journal ref ACM Transactions on Recommender Systems (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10242 2026-03-30 math.OC 78%

Reinforcement Learning for optimal dividend problem under diffusion model

基于扩散模型的最优分红问题的强化学习

Lihua Bai, Thejani Gamage, Jin Ma, Gaozhan Wang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文从强化学习视角研究连续时间扩散模型下的最优分红问题,提出基于熵正则化的探索性控制算法,通过神经网络近似价值函数及其导数,实现非显式确定最优控制的数值方法。

Comments In this version the numerical scheme and the experiments are reconstructed

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08130 2026-03-30 math.PR 71%

On the parabolic Adams theorem and its applications to diffusion processes

关于抛物Adams定理及其在扩散过程中的应用

N. V. Krylov

专题命中 扩散模型 :diffusion(title)

AI总结 本文探讨了抛物Adams定理及其在估计抛物型算子相关演算族及Itô方程解的初始数据导数矩中的应用。

Comments 24 pages, cosmetic changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09435 2026-03-30 cs.CV 57%

UniPart: Part-Level 3D Generation with Unified 3D Geom-Seg Latents

UniPart: 部级3D生成与统一3D几何-分割潜在表示

Xufan He, Yushuang Wu, Xiaoyang Guo, Chongjie Ye, Jiaqing Zhou, Tianlei Hu, Xiaoguang Han, Dong Du

机构 * Nanjing University of Science and Technology(南京理工大学) ByteDance Games(字节跳动游戏) Zhejiang University(浙江大学) FNii-Shenzhen(深圳福田国家创新研究院) SSE, CUHKSZ(香港中文大学(深圳)理工学院) Guangdong Provincial Key Laboratory of Future Networks of Intelligence(广东省未来智能网络重点实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出UniPart,一种基于统一3D几何-分割潜在表示的两阶段扩散框架,实现图像引导的部级3D生成,提升分割可控性和几何质量。

Comments Project page: https://xfanhe.github.io/projects/unipart/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01752 2026-03-30 cs.CV physics.med-ph 57%

Clinical Metadata Guided Limited-Angle CT Image Reconstruction

临床元数据引导的限角CT图像重建

Yu Shi, Shuyi Fan, Changsheng Fang, Shuo Han, Haodong Li, Li Zhou, Bahareh Morovati, Dayang Wang, Hengyong Yu

机构 * University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于结构化临床元数据的两阶段扩散框架,用于改进限角CT重建,通过整合元数据提升图像质量与效率。

Comments IEEE Transactions on Medical Imaging, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03745 2026-03-30 cs.CV cs.AI cs.LG eess.IV 57%

StreamDiT: Real-Time Streaming Text-to-Video Generation

StreamDiT:实时流式文本到视频生成

Akio Kodaira, Tingbo Hou, Ji Hou, Markos Georgopoulos, Felix Juefei-Xu, Masayoshi Tomizuka, Yue Zhao

机构 * UC Berkeley(加州大学伯克利分校) Meta

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出StreamDiT模型,通过流匹配和混合训练提升内容一致性和视觉质量,实现16FPS实时视频生成,支持流式生成等实时应用。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25765 2026-03-30 cs.CV cond-mat.mtrl-sci 57%

Evaluating Synthetic Images as Effective Substitutes for Experimental Data in Surface Roughness Classification

评估合成图像作为实验数据的有效替代品在表面粗糙度分类中的应用

Binwei Chen, Huachao Leng, Chi Yeung Mang, Tsz Wai Cheung, Yanhua Chen, Wai Keung Anthony Loh, Chi Ho Wong, Chak Yin Tang

机构 * State Key Laboratory of Ultra-precision Machining Technology, Department of Industrial and Systems Engineering, The Hong Kong Polytechnic University(香港理工大学工业及系统工程学系超精密加工技术国家重点实验室) Division of Science, Engineering and Health Studies, The School of Professional Education and Executive Development, The Hong Kong Polytechnic University(香港理工大学专业进修学院科学、工程及健康研究学部) Department of Science and Environmental Studies, The Education University of Hong Kong(香港教育大学科学与环境研究学系)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文研究了使用合成图像替代实验数据在陶瓷表面粗糙度分类中的有效性,通过生成图像增强真实数据,实现了与实验数据相当的分类准确率,并验证了生成模型的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏