arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2193 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2193 篇

2606.24874 2026-06-24 cs.CV cs.AI 新提交 79%

FLUX3D: High-Fidelity 3D Gaussian Generation with Diffusion-Aligned Sparse Representation

FLUX3D: 基于扩散对齐稀疏表示的高保真3D高斯生成

Haorui Ji, Weizhe Liu, Hongdong Li, Hengkai Guo

机构 * The Australian National University(澳大利亚国立大学) ByteDance(字节跳动)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出FLUX3D框架,通过扩散对齐结构化潜变量(DA-SLAT)和稀疏结构感知扩散变压器(SMDiT)解决稀疏体素表示中高频细节丢失和跨模态对齐问题,实现高保真图像到3D高斯生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24192 2026-06-24 cs.CV cs.AI cs.CL 新提交 79%

Co-occurring associated retained concepts in Diffusion Unlearning

扩散模型遗忘中的共现关联保留概念

Miso Kim, Georu Lee, Yunji Kim, Hoki Kim, Jinseong Park, Woojin Lee

机构 * Dongguk University-Seoul(东国大学-首尔) Chung-Ang University(Chung-Ang 大学) Korea Institute for Advanced Study(韩国高级研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对扩散模型遗忘中误删良性共现概念的问题,提出CARE评分量化保留程度,并设计ReCARE框架通过自动构建CARE集实现稳健遗忘,平衡概念擦除、整体效用与共现概念保留。

Comments Accepted as a poster at ICLR 2026. Code available at https://github.com/damilab/CARE

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24161 2026-06-24 cs.CV 新提交 79%

Dual-Branch Cross-Projection Debiasing through Diffusion-based Disentanglement

基于扩散解耦的双分支交叉投影去偏

Xiangqian Zhao, Xinyang Jiang, Zhipeng Xu, Lingfeng He, Zilong Wang, Dongsheng Li, De Cheng, Nannan Wang

机构 * Xidian University(西安电子科技大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对有偏数据下基础模型的泛化问题,提出置信引导的偏差概念挖掘(CBCM)和双分支交叉投影去偏(DCD)框架,通过扩散解耦和交叉零空间投影分离目标与虚假特征,在无组标签条件下实现最差组准确率最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22371 2026-06-24 eess.IV cs.CV 新提交 79%

ZeroGVC: Zero-Shot Generative Video Compression with Autoregressive Diffusion Priors

ZeroGVC:基于自回归扩散先验的零样本生成式视频压缩

Yixin Gao, Xiaohan Pan, Lin Liu, Xin Li, Zhibo Chen, Qi Tian

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Inc(华为公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出ZeroGVC,一种零样本生成式视频压缩框架,利用预训练自回归扩散先验,通过码本引导的自回归潜压缩和双向参考模式,在超低码率下实现高质量感知重建,无需额外训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22314 2026-06-24 cs.LG cs.AI cs.CV 新提交 79%

Diffusion Integrated Gradients: Controllable Path Generation for Flexible Feature Attribution

扩散积分梯度:用于灵活特征归因的可控路径生成

Soyeon Kim, Kyowoon Lee, Jaesik Choi

机构 * KAIST(韩国科学技术院) Ajou University(亚洲大学) INEEJI Corp.(INEEJI公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出扩散积分梯度(DiffIG),通过扩散模型生成路径并嵌入用户引导,实现灵活可控的特征归因,在定量和定性上优于现有方法。

Comments 44 pages, 22 figures, 10 tables. Accepted to ECCV 2026; includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20189 2026-06-24 cs.CV cs.AI cs.RO 新提交 79%

HilDA: Hierarchical Distillation with Diffusion for Advancing Self-Supervised LiDAR Pre-training

HilDA:利用扩散的分层蒸馏推进自监督LiDAR预训练

Maciej Wozniak, Jesper Ericsson, Hariprasath Govindarajan, Truls Nyberg, Thomas Gustafsson, Patric Jensfelt, Olov Andersson

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) Linköping University(林雪平大学) TRATON AB(TRATON公司) Qualcomm Auto Ltd Sweden Filial(高通汽车有限公司瑞典分公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出HilDA框架,通过分层蒸馏(多层蒸馏和全局上下文蒸馏)结合时间占用扩散目标,自监督预训练LiDAR骨干网络,在3D检测、场景流和语义占用预测任务上达到最先进水平。

Comments Accepted to ECCV 2026. Maciej and Jesper contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21414 2026-06-23 eess.IV cs.AI cs.CV 新提交 79%

2D Versus 3D Diffusion for In Silico Training of Interventional X-ray AI Models

二维与三维扩散在介入X射线AI模型模拟训练中的比较

Sampath Rapuri, Jeremy Ko, Benjamin D. Killeen, Russell H. Taylor, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文比较了基于3D条件潜在扩散模型生成CT体数据用于DRR合成与基于视图条件的2D扩散模型直接生成合成X射线两种方法,发现2D扩散生成的合成X射线可用于训练解剖标志检测模型,性能接近真实数据训练模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23362 2026-06-23 cs.CR cs.CV 新提交 79%

TooBad: Backdoor Diffusion Models with Ultra-Low Poison Rate and Imperceptible Trigger

TooBad: 超低投毒率和不可察觉触发器的后门扩散模型

Vu Tuan Truong, Long Bao Le

机构 * INRS, University of Quebec(INRS大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出TooBad框架,通过针对扩散模型的触发器优化技术,在极低投毒率(0.5%)下实现高攻击成功率(>85%),并保持高隐蔽性和实用性。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23298 2026-06-23 cs.CV 新提交 79%

Ocean4D: Generative Underwater 4D Reconstruction via Medium-Aware Video Diffusion

Ocean4D:通过介质感知视频扩散的生成式水下4D重建

Yuqiang Huang, Yuxi Wang, Junyu Dong, Zhaoxiang Zhang

机构 * Faculty of Information Science and Engineering, Ocean University of China(中国海洋大学信息科学与工程学部) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Ocean4D生成式框架,通过4D几何一致性条件化和介质感知去噪扩散,解决水下动态场景中吸收与散射导致的几何不稳定和跨视角不一致问题,实现单目视频到目标轨迹的高质量4D重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23019 2026-06-23 cs.CV cs.AI 新提交 79%

ScalingAttention: Discovering Intrinsic Sparse Attention Topology for Video Diffusion Transformers

ScalingAttention: 发现视频扩散变换器的内在稀疏注意力拓扑

Ruiliang Zhou, Xuecheng Wu, Kang He, Guangyun Han, Bin Liu, Qinqin Chen, Wende Xu, Qingjie Zhao, Chengru Song

机构 * KlingAI Research(KlingAI研究院) Beijing Institute of Technology(北京理工大学) NVIDIA(英伟达) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出ScalingAttention框架,通过权重编码的稀疏拓扑(WEST)和保真度感知灵敏度调优(FAST)实现训练无关的注意力稀疏化,在Wan2.1上获得最高1.90倍加速并保持高质量。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22959 2026-06-23 cs.AI cs.CV 新提交 79%

The Impact of VAE Design on Latent Pose Representations for Diffusion-based Sign Language Production

VAE设计对基于扩散的手语生成中潜在姿态表示的影响

Guilhem Fauré, Mostafa Sadeghi, Sam Bigeard, Slim Ouni

机构 * CNRS(国家科学研究中心) Inria(法国国家信息与自动化技术研究所) LORIA(洛林信息与自动化研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究变分自编码器(VAE)架构和训练目标设计如何影响潜在空间结构,进而影响基于潜在扩散模型的手语生成性能,发现潜在空间特性比重建精度更能解释生成性能差异。

Journal ref GenSign Generative AI for Sign Language CVPR 2026 Workshop, Jun 2026, Denver (Colorado, USA), France. pp. 10631-10640

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22702 2026-06-23 cs.CV 新提交 79%

Modular Diffusion Models for Structured Visual Recognition

模块化扩散模型用于结构化视觉识别

Siddhesh Khandelwal, Björn Ommer, Leonid Sigal

机构 * Department of Computer Science, University of British Columbia(不列颠哥伦比亚大学计算机科学系) Vector Institute for AI(向量人工智能研究所) CompVis, Ludwig Maximilian University of Munich(慕尼黑路德维希·马克西米利安大学计算机视觉实验室) Munich Center for Machine Learning(慕尼黑机器学习中心) CIFAR AI Chair(CIFAR人工智能教席)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出模块化扩散模型(MDMs),通过将扩散过程分解为任务特定模块,学习结构化输出的分布,以处理视觉识别中的不确定性,在目标检测、实例分割和场景图生成任务上取得优势。

Comments 34 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22660 2026-06-23 cs.CV 新提交 79%

Prompting Diffusion Models for Zero-Shot Instance Segmentation

提示扩散模型用于零样本实例分割

Irem Zeynep Alagöz, Nils Morbitzer, Andrea Ramazzina, Nassir Navab, Federico Tombari, Stefano Gasperini

机构 * Technical University of Munich (TUM)(慕尼黑工业大学) Munich Center of Machine Learning (MCML)(慕尼黑机器学习中心) Mercedes-Benz AG(梅赛德斯-奔驰集团) Visualais

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Prompt2Seg框架,通过空间条件化增强扩散模型,利用2D高斯或置信度图作为提示,实现零样本实例分割,在多个数据集上优于基线。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21700 2026-06-23 cs.CV 新提交 79%

VT-DUDA: Visual Token Conditioning for Diffusion-guided Unsupervised Domain Adaptation

VT-DUDA: 扩散引导的无监督域适应的视觉令牌条件化

Xuan Qi, Daniele Berardini, Dario Serez, Vito Paolo Pastore, Vittorio Murino

机构 * Istituto Italiano di Tecnologia(意大利技术研究院) University of Genoa(热那亚大学) University of Verona(维罗纳大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出VT-DUDA框架,通过将源图像映射为视觉令牌并与文本嵌入拼接作为条件,增强扩散模型生成目标风格图像时的实例级引导,提升无监督域适应性能。

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21234 2026-06-23 cs.CV 新提交 79%

Context-Aware Autoregressive Diffusion for Gloss-Wise Sign Language Production

上下文感知的自回归扩散用于逐词汇手语生成

JungHoon Sung, Boeun Kim, Chu Xin, Hyung Jin Chang, ChangHo Kim, Sang-Il Choi, Younggeun Choi

机构 * Dankook University(檀国大学) University of Birmingham(伯明翰大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出GARD模型,通过语义和运动上下文条件化,结合词汇间过渡引导和全局运动协调器,实现逐词汇手语生成,在Phoenix-T和CSL-Daily数据集上优于现有方法。

Comments 18 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20112 2026-06-19 cs.CV eess.IV 新提交 79%

Pixel-Level Residual Diffusion Transformer: Scalable 3D CT Volume Generation

像素级残差扩散Transformer:可扩展的3D CT体生成

Zhenkai Zhang, Markus Hiller, Krista A. Ehinger, Tom Drummond

机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算与信息系统学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出像素级残差扩散Transformer(PRDiT),通过两阶段训练(局部MLP盲估计器分离低频结构+全局残差扩散Transformer建模高频残差)实现高保真3D CT体生成,在LIDC-IDRI和RAD-ChestCT数据集上优于现有方法。

Comments Accepted at ICLR 2026. Code available at https://github.com/Fredy-Zhang/PRDiT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20110 2026-06-19 cs.CV 新提交 79%

FrozenDrive: Zero-Shot Text-Guided Driving Scene Generation and Data Augmentation with Parameter-Free Frozen Diffusion Model

FrozenDrive: 零样本文本引导驾驶场景生成与数据增强的无参数冻结扩散模型

Yuhwan Jeong, Hyeonseong Kim, Daehyun We, Seonkyu Song, Jinnyeong Yang, Hyun-Kurl Jang, Youngho Yoon, Kuk-Jin Yoon

机构 * KAIST, Visual Intelligence Lab(韩国科学技术院视觉智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出FrozenDrive框架,利用冻结的预训练扩散模型,通过知识保留的时空注意力实现多视图一致性和时间连贯性,无需微调即可生成恶劣天气下的驾驶场景,提升自动驾驶模型鲁棒性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20076 2026-06-19 cs.CV cs.AI 新提交 79%

Variable-Length Tokenization via Learnable Global Merging for Diffusion Transformers

基于可学习全局合并的可变长度分词用于扩散变换器

Dong Hoon Lee, Seunghoon Hong

机构 * Kim Jaechul Graduate School of AI, KAIST, Daejeon, South Korea(韩国科学技术院金载哲人工智能研究生院,大田,韩国) School of Computing, KAIST, Daejeon, South Korea(韩国科学技术院计算学院,大田,韩国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对固定压缩比限制扩散模型质量-计算权衡的问题,提出基于可学习全局合并的可变长度分词器,通过合并令牌实现跨长度表示对齐,在ImageNet 256×256生成中实现更优的gFID-计算权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19961 2026-06-19 cs.CV 新提交 79%

Addressing Detail Bottlenecks in Latent Diffusion for RGB-to-SWIR Image Translation

解决潜在扩散模型中RGB到SWIR图像翻译的细节瓶颈

Kaili Wang, Martin Dimitrievski, Jose Maria Salvador, Ben Stoffelen, David Van Hamme, Lore Goetschalckx

机构 * imec imec-IPI-Ghent University(imec-IPI-根特大学) Yale University(耶鲁大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对潜在扩散模型在RGB到SWIR图像翻译中丢失空间细节的问题,提出源条件自编码器和可学习引导编码器两种轻量级改进,在驾驶场景下将检测mAP提升至2倍,小目标提升3.4倍,并达到最优FID。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19939 2026-06-19 cs.CV 新提交 79%

DiffMath: Symbol- and Graph-Aware Latent Diffusion Transformer for Handwritten Mathematical Expression Generation

DiffMath:面向手写数学表达式生成的符号与图感知潜在扩散Transformer

Wei Pan, Xuhan Zheng, Yilin Shi, Huiguo He, Hiuyi Cheng, Dezhi Peng, Minghui Liao, Lianwen Jin

机构 * South China University of Technology(华南理工大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出DiffMath框架,利用LaTeX层次结构作为先验,通过关系抽象语法树、结构保持潜在表示和条件去噪,无需位置监督即可生成结构一致的手写数学表达式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19662 2026-06-19 cs.CV 新提交 79%

Learning When to Denoise: Optimizing Asynchronous Schedules for Latent Diffusion

学习何时去噪:优化潜在扩散的异步调度

Bingshuo Qian, Xiang Cheng

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出学习异步调度策略,通过调度校正目标优化多表示扩散模型的去噪顺序,在ImageNet 256x256上以不到1%额外训练计算实现4倍加速,FID达1.02。

Comments 25 pages, 9 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19534 2026-06-19 cs.CV cs.AI cs.CL 新提交 79%

PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models

PerceptionDLM:基于多模态扩散语言模型的并行区域感知

Yueyi Sun, Yuhao Wang, Jason Li, Ye Tian, Tao Zhang, Jacky Mai, Yihan Wang, Haochen Wang, Jinbin Bai, Ling Yang, Yunhai Tong

机构 * Peking University(北京大学) MSALab ByteDance(字节跳动)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出PerceptionDLM,利用扩散语言模型的并行解码特性,通过高效提示和结构化注意力掩码实现多区域并行感知,显著提升推理效率,并构建ParaDLC-Bench基准进行评估。

Comments Code available at https://github.com/MSALab-PKU/PerceptionDLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19151 2026-06-18 cs.CY cs.CV 新提交 79%

The Market in the Model: Latent Diffusion as Neural Economy

模型中的市场:潜在扩散作为神经经济

Eryk Salvaggio

机构 * Cambridge Digital Humanities(剑桥数字人文研究中心) University of Cambridge(剑桥大学) Machine Visual Culture Research Group(机器视觉文化研究组) Max Planck Institute(马克斯·普朗克研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文从计算机视觉工程问题出发,分析潜在扩散模型的机制,论证其作为神经经济运作,将社会交流抽象为可通约向量,并警示仅关注版权与商品防御的批评可能强化模型产生的拜物教。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17675 2026-06-17 cs.CV 新提交 79%

Do We Really Need Diffusion? A Fast U-Net for Paired Medical Image Translation

我们真的需要扩散吗?用于配对医学图像翻译的快速U-Net

Alicia Pirwass, Birte Glimm, Michael Munz, Hans-Joachim Wilke

机构 * Institute of Artificial Intelligence, Ulm University(乌尔姆大学人工智能研究所) Institute of Orthopaedic Research and Biomechanics, Centre for Trauma Research, University Hospital Ulm(乌尔姆大学医院创伤研究中心骨科研究与生物力学研究所) AI for Sensor Data Analytics Research Group, Ulm University of Applied Sciences(乌尔姆应用科学大学传感器数据分析人工智能研究组)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文比较轻量级4级U-Net与去噪扩散概率模型(DDPM)在从T2加权MRI估计脂肪分数任务上的性能,发现U-Net在精度和速度上均优于DDPM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17521 2026-06-17 cs.MM 新提交 79%

DiffPC: Diffusion-Based Projector Photometric Compensation

DiffPC: 基于扩散的投影仪光度补偿

Yuxi Wang, Haibin Ling, Bingyao Huang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 提出一种基于扩散模型的光度补偿方法,将投影失真建模为环境相关加性噪声,通过扩散模型逐步去噪生成补偿图像,并设计融合光度与内容特征的噪声估计网络,在未知场景中取得更优视觉表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17342 2026-06-17 cs.CV 新提交 79%

Learning a Maximum Entropy Model for Visual Textures using Diffusion

使用扩散学习视觉纹理的最大熵模型

Xinyuan Zhao, Eero P. Simoncelli

机构 * New York University(纽约大学) Flatiron Institute(熨斗研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出首个基于扩散模型无监督学习最大熵模型统计量的纹理建模方法,仅用512个统计量即可生成质量优于或媲美当前最优模型(约177k统计量)的纹理图像,并实现平滑插值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17257 2026-06-17 cs.CV cs.AI 新提交 79%

Pulling The REINS: Training-Free Safety Alignment of Video Diffusion Models via Representation Steering

Pulling The REINS: 通过表示引导实现视频扩散模型的无训练安全对齐

Rohit Kundu, Arindam Dutta, Sarosij Bose, Athula Balachandran, Amit K. Roy-Chowdhury

机构 * University of California, Riverside(加州大学河滨分校) YouTube (Google)(YouTube(谷歌))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出REINS方法,在推理时通过线性方向引导视频扩散模型的内部表示,实现无训练的安全对齐,避免有害内容生成,且不降低通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15614 2026-06-17 cs.CV 新提交 79%

Variational Test-time Optimization for Diffusion Synchronization

扩散同步的变分测试时优化

Hyunsoo Lee, Farrin Marouf Sofian, Kushagra Pandey, Stephan Mandt

机构 * Seoul National University(首尔大学) University of California, Irvine(加利福尼亚大学尔湾分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出基于最优控制的变分测试时优化框架,通过优化控制变量引导多轨迹协同生成,无需额外训练即可提升扩散同步性能。

Comments Preprint. Project website: https://hleephilip.github.io/SyncVC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16255 2026-06-16 cs.CV 新提交 79%

UniDDT: Unifying Multimodal Understanding and Generation with Decoupled Diffusion Transformer

UniDDT: 使用解耦扩散变换器统一多模态理解与生成

Shuai Wang, Liang Li, Yang Chen, Ruopeng Gao, Yao Teng, Limin Wang

机构 * Nanjing University(南京大学) ByteDance Seed(字节跳动Seed) University of Hong Kong(香港大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出UniDDT模型,通过噪声ViT编码器统一视觉语义表示,并采用解耦扩散解码器分离扩散与文本解码,平衡多模态理解与生成任务,在多个基准上取得优异性能。

Comments This work was completed in \textbf{November 2025}

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15486 2026-06-16 cs.CV 新提交 79%

ST-DiffEye: Diffusion-based Continuous Gaze Generation via Joint Scanpath-Trajectory Modeling

ST-DiffEye: 基于扩散的连续注视生成通过联合扫描路径-轨迹建模

Brian Nlong Zhao, Ozgur Kara, Junho Kim, James M. Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出ST-DiffEye,一种联合轨迹-扫描路径扩散框架,通过将两者拼接为额外输入通道进行联合建模,并引入基于连续排序概率得分(CRPS)的评估方法,在视觉搜索和自由观看任务上达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏