arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2962 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2264 篇

2606.20807 2026-06-23 cond-mat.stat-mech 新提交 71%

Tuning ergodicity breaking: Anomalous diffusion under asymptotic power-law forcing

调节遍历性破缺:渐近幂律强迫下的反常扩散

Raul V. B. Morás, M. Florencia Carusela, Luciano C. Lapas

专题命中 扩散模型 :diffusion(title)

AI总结 研究通过广义朗之万方程中的标度参数η,揭示了渐近幂律外力驱动下系统的热化、遍历性破缺和失控增长三种动力学相,并发现涨落-耗散定理与外力无关。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17999 2026-06-23 cs.CL 新提交 71%

VoidPadding: Let [VOID] Handle Padding in Masked Diffusion Language Models so that [EOS] Can Focus on Semantic Termination

VoidPadding: 让 [VOID] 处理掩码扩散语言模型中的填充,以便 [EOS] 专注于语义终止

Chunyu Liu, Zhengyang Fan, Kaisen Yang, Alex Lamb

机构 * Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title)

AI总结 提出VoidPadding方法,通过引入[VOID]令牌处理填充,将[EOS]从双重角色中解放,实现大块解码下的早期停止和自适应响应扩展,在数学推理和代码生成任务上平均提升17.84分,并减少55.7%的NFE。

Comments Minor related-work revisions; results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19656 2026-06-19 cs.RO cs.LG 新提交 71%

DF-ExpEnse: Diffusion Filtered Exploration for Sample Efficient Finetuning

DF-ExpEnse: 扩散滤波探索用于高效样本微调

Calvin Luo, Chen Sun, Shuran Song

机构 * Stanford University(斯坦福大学) Brown University(布朗大学)

专题命中 扩散模型 :diffusion(title)

AI总结 提出DF-ExpEnse探索技术,利用生成控制策略的多模态建模能力和评论家集成,在微调中高效收集在线经验,提升样本效率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19070 2026-06-18 math.AP 新提交 71%

A Measure-Valued Obstacle Problem for an Obliquely Reflected Diffusion with a Max-Type Payoff

具有最大值型收益的斜反射扩散的测度值障碍问题

Louis Shuo Wang, Jiguang Yu, Ye Liang

专题命中 扩散模型 :diffusion(title)

AI总结 针对非负象限中具有非光滑最大值型收益的斜反射最优停止问题,提出测度值势论形式的障碍问题公式,推导反射Itô-Tanaka恒等式,并证明验证定理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18183 2026-06-17 stat.ML cs.LG math.PR 新提交 71%

A Diffusion Approximation for Temporal-Difference Learning with Linear Features under Markovian Noise

马尔可夫噪声下线性特征时序差分学习的扩散近似

M. Forzo, E. Monzio Compagnoni, A. Russo, A. Pacchiano

机构 * Technical University of Munich (TUM), Munich, Germany(慕尼黑技术大学) University of Basel, Basel, Switzerland(巴塞尔大学) Boston University, Boston, USA(波士顿大学)

专题命中 扩散模型 :diffusion(title)

AI总结 针对线性TD(0)在马尔可夫噪声下的随机波动,提出随机微分方程近似模型,揭示投影Bellman算子收缩动力学与马尔可夫采样影响的区别,解释常数步长误差下限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13433 2026-06-12 stat.ME 新提交 71%

Smoothed-KL Reweighting: A Principled Account and Matching Rule for SNR-Based Diffusion Training

平滑KL重加权:基于信噪比的扩散训练的原则性解释与匹配规则

Lei Li

专题命中 扩散模型 :diffusion(title)

AI总结 提出平滑KL重加权方法,从扩散散度推导出闭式权重,建立与Min-SNR家族的匹配规则,在CIFAR-10和CelebA-64上验证,最终FID相当但迭代效率因数据集而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10368 2026-06-10 cs.SD cs.AI 新提交 71%

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation

语音遇见ELF:用于语音识别和翻译的音频条件连续目标扩散

Xuanchen Li, Tianrui Wang, Yuheng Lu, Zikang Huang, Yu Jiang, Chenghan Lin, Chenrui Cui, Ziyang Ma, Xingyu Ma, Chunyu Qiang, Guochen Yu, Xie Chen, Longbiao Wang, Jianwu Dang

机构 * Tianjin University(天津大学) Shanghai Jiao Tong University(上海交通大学) Nankai University(南开大学)

专题命中 扩散模型 :diffusion(title)

AI总结 提出ELF-S2T,一种基于预训练ELF骨干的音频条件连续目标生成模型,通过音频强制训练和分类器自由引导,在LibriSpeech和CoVoST2上实现竞争性ASR和S2TT性能,并揭示识别与翻译错误均源于连续潜空间中的近距离混淆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14043 2026-08-17 cs.CV 新提交 70%

Beyond Text Conditioning: A Systematic Study of MLLM-DiT Fusion for Video Generation

超越文本条件:面向视频生成的MLLM-DiT融合系统研究

Yanbo Ding, Yijia Fan, Caihua Shan, Yifan Yang, Yifei Shen, Weijie Wang, Xirui Hu, Dongsheng Li, Lili Qiu, Yuqing Yang, Yali Wang

机构 * Chinese Academy of Sciences(中国科学院) Microsoft Research(微软研究院) Sun Yat-sen University(中山大学) Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Xi’an Jiaotong University(西安交通大学)

专题命中 扩散模型 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 该研究针对视频生成中MLLM与DiT融合问题,提出BiVidGen框架,通过MLLM生成语义视觉标记辅助DiT渲染,提升了视频的语义对齐度与时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13729 2026-08-17 cs.CV 新提交 70%

Limitations of Synthetic Data Generation in Specialized Data-Scarce Domains

合成数据生成在数据稀缺的专业领域中的局限性

Edward Zhang, Marcel Hussing, Tanay Tandon, Shenbagaraj Kannapiran, Jason Hughes, Youkang Wang, Joshua Caswell, Agelos Kratimenos, Yi Fan Li, Milan Manoj, Ethan Sanchez, Sumukh Shrote, Camillo Jose Taylor, Daniel A. Hashimoto, Eric Eaton

机构 * University of Pennsylvania(宾夕法尼亚大学) The Hong Kong Polytechnic University (PolyU)(香港理工大学)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 该研究针对数据稀缺的专业视觉领域,评估两类生成式稀疏数据扩展方法的分类性能,发现其无法持续优于非生成式基线,且存在记忆坍缩等失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11643 2026-08-13 cs.CV cs.LG 新提交 70%

Robustness of AI-Art Detectors under Generator Shift

生成器偏移下AI生成艺术检测器的鲁棒性

Shivank Singh Thakur, Meien Li, Mark Stamp

机构 * San Jose State University(圣何塞州立大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 该研究针对生成器偏移问题,在SD3.5m数据集上评估了五个AI艺术检测器的鲁棒性,发现模型在跨生成器场景下泛化能力不足,CLIP ViT-L/14表现最优,为分层防御检测器的开发提供了依据。

Comments To appear as a chapter in the book "Artificial Intelligence for Cyber Defense in Emerging Threats", to be published by Springer by early 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10985 2026-08-12 cs.CV 新提交 70%

PEAK: Precise and Persistent Concept Erasure via k-Sparse Autoencoders

PEAK:基于k稀疏自编码器(kSAEs)的精确且持久的概念擦除

Man Jiang, Ouxiang Li, Weibao Xue, Zhenhua Tang, Yuan Wang, Shuo Wang, Yanbin Hao

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本研究针对文本到图像扩散模型的概念擦除难题,提出基于k稀疏自编码器的PEAK框架,实现了精确持久的概念擦除,在I2P基准上大幅降低了冒犯性内容检测量与攻击成功率,同时保留了生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09373 2026-08-11 cs.CV 新提交 70%

Preserve More Details: Mitigating Content Drift in Real-World Image Super-Resolution

保留更多细节:缓解真实世界图像超分辨率中的内容漂移

Chunxiao Liu, Wei Liu, Anbin Xiong, Erli Meng

机构 * Xiaomi Corporation(小米公司)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 针对真实世界图像超分辨率中因低质量输入导致的内容漂移问题,提出双路径架构的新型单步扩散模型FSP-Diff,在标准基准上优于现有单步扩散方法。

Comments Accepted to ACM MM 2026. This is the author's accepted version. The definitive version is published in the Proceedings of ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08319 2026-08-11 cs.CV cs.LG 新提交 70%

A continually expandable foundation model for brain MRI

可持续扩展的脑MRI基础模型

Michail Mamalakis, Carmen Jimenez-Mesa, Yonghao Li, Hao Chen, Chao Li, Antonios Mamalakis, John Suckling, Richard Bethlehem, Stephen J. Price, Richard J. Gilbertson, Pietro Lio

机构 * University of Cambridge(剑桥大学) University of Málaga(马拉加大学)

专题命中 扩散模型 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出可扩展的Alcmaeon脑MRI基础模型,结合体积编码、潜在扩散生成与Graph-Blueprint Pruning,在跨临床领域扩展时遗忘程度更低,可支持多种任务,为持续发展的脑MRI基础模型提供了可行方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03135 2026-08-05 cs.CV cs.AI 新提交 70%

Rectify Then Diffuse: Disentangling Concepts Before Denoising Trajectory Unfolds

先校正再扩散:去噪轨迹展开前解耦概念

Ning Zhu, An Chen, Mengfei Zhao, Juntao Xu, Jingze Liang, Boyuan Gu, Liang-Jian Deng

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对文本到图像扩散模型多概念生成时的遗漏或合并错误,提出无训练框架RTD,通过SOD和IGR校正初始概念分配,在AE-Bench上实现组合保真度与效率的显著提升

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29180 2026-08-03 cs.CV cs.AI 新提交 70%

MoRAE: Flow-Friendly Self-Supervised Latents for Text-to-Motion Generation

MoRAE:面向文本到动作生成的流友好型自监督隐变量

Yifei Zhu, Mingyi Shi, Yangyang Cai, Miao Cheng, Yoshifumi Kitamura, Taku Komura

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 MoRAE针对文本到动作生成中直接采用图像生成RAE范式的失败,解决了动作空间的两个特有瓶颈,使Flow-Matching DiT实现了最先进的文本到动作生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26108 2026-07-30 cs.GR cs.LG 新提交 70%

Two2Four: Generative Quadruped Puppeteering from Human Motion

Two2Four:基于人类动作的生成式四足动物操控

Fatemeh Zargarbashi, Zehong Qiu, Dhruv Agrawal, Stelian Coros, Robert W. Sumner, Martin Guay, Jakob Buhmann

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);分类 cs.GR

AI总结 该研究提出Two2Four框架,采用两阶段生成扩散模型,可从人类动作生成可控逼真四足动物动作,用于动画和虚拟制作,效果优于现有重定向方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25894 2026-07-29 cs.CV 新提交 70%

TIGA: Trajectory-Injected Generative Attack against Black-box AIGC Detectors

TIGA:针对黑盒AIGC检测器的轨迹注入生成攻击

Xia Du, Zhuosen Bao, Zheng Lin, Jizhe Zhou, Jiawei Lian, Chi-man Pun, Jun Luo, Wei Ni, Symeon Chatzinotas

机构 * School of Computer and Information Engineering, Xiamen University of Technology(厦门理工学院计算机与信息工程学院) Interdisciplinary Centre for Security, Reliability and Trust (SnT), University of Luxembourg(卢森堡大学安全、可靠性和信任跨学科中心) School of Computer Science, Engineering Research Center of Machine Learning and Industry Intelligence, Sichuan University(四川大学计算机学院机器学习与工业智能工程研究中心) PCA Laboratory, Key Laboratory of Intelligent Perception and Systems for High-Dimensional Information of Ministry of Education, School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院高维信息智能感知与系统教育部重点实验室PCA实验室) Department of Computer and Information Science, Faculty of Science and Technology, University of Macau(澳门大学科技学院计算机与信息科学系) School of Engineering, Edith Cowan University(伊迪斯科文大学工程学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 扩散模型 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对黑盒AIGC检测器,TIGA提出无需源图像和训练的框架,通过操纵DDIM轨迹、聚合梯度及方向搜索估计目标响应,实现强大黑盒攻击性能、可转移性及高鲁棒性,且无需源图像或扩散模型再训练。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25275 2026-07-29 cs.CV cs.AI 新提交 70%

ScaleResfusion: Residual Rectified Flow based on Residual Vector Field

ScaleResfusion:基于残差向量场的残差整流流

Zhenning Shi, Chen Xu, Junhao Zhang, Kefei Zhang, Linjie Liu, Zhedong Zheng, Tao Li

机构 * Nankai University(南开大学) University of Macau(澳门大学) Csiro Data 61(联邦科学与工业研究组织数据61部) Beihang University(北京航空航天大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究旨在解决现实世界图像恢复问题,提出ScaleResfusion框架,核心是残差整流流,从低质量图像出发学习残差向量场,结合知识蒸馏降低采样成本,实验证明其高效且性能优,为图像恢复提供实用可扩展方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23492 2026-07-28 cs.CV cs.LG 新提交 70%

To Erase, or Not to Erase: Robust Training-Free Concept Erasure with Preservation aware Adaptive Ranked Subspace Expansion

擦除还是不擦除:基于保留感知自适应排序子空间扩展的无训练鲁棒概念擦除

Shaswati Saha, Rajasekhar Anguluri, Manas Gaur

机构 * University of Maryland Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究针对文本到图像扩散模型的概念擦除技术面临的鲁棒性与效用权衡问题,提出无训练框架PARSE,通过自适应发现擦除与保留概念、编辑交叉注意力值空间及迭代搜索触发因素来实现鲁棒概念擦除,引入BEUS评估,实验证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22531 2026-07-27 cs.CV 新提交 70%

Twins: Learn to Predict Unified Representations with Focal Loss

Twins:使用焦点损失学习预测统一表示

Kaixiong Gong, Xin Cai, Bin Lin, Hao Wang, Yunlong Lin, Mingzhe Zheng, Bohao Li, Jian-Wei Zhang, Miles Yang, Zhao Zhong, Liefeng Bo, Xiangyu Yue

机构 * Tencent-Hunyuan(腾讯混元)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究统一多模态模型潜在空间不匹配问题,提出Twins统一连续令牌空间。因联合建模有优化不平衡,采用焦点回归目标解决,在ImageNet上有gFID增益,在多模态理解基准测试中表现好,还提高了重建保真度。

Comments ICML 2026. Code: https://github.com/Tencent-Hunyuan/Twins

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21326 2026-07-24 cs.CV 新提交 70%

SlerpFlow: Spherical Trajectory Correction for Rectified Flow Inversion

SlerpFlow:用于整流流反演的球形轨迹校正

Wenbin Duan, Yan Shu, Zhuoyuan Fu, Fangmin Zhao, Yan Li, Yaru Zhao, Binyang Li

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究针对基于整流流的图像生成中反演难题,提出SlerpFlow方法,基于流形假设,整合球形线性插值校正流速度方向,缓存校正速度,实现高精度反演,提升重建保真度与编辑语义对齐,无需额外训练。

Comments 16 pages. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18516 2026-07-22 cs.LG cs.CV 新提交 70%

Signed Rectified Flow: Negativity-Controlled Generation

带符号整流流:负性控制生成

Runlong Liao, Baiyu Su, Lizhang Chen, Qiang Liu

机构 * UT Austin(德克萨斯大学奥斯汀分校)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 研究提出带符号整流流(Signed RF),通过推广整流流,基于带符号测度构建生成模型,能将概率集中在正区域并排除负区域。分析其连续性方程并给出解释,推动实用算法,在多应用中提升性能,改进了保真度 - 多样性权衡等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17833 2026-07-21 cs.CV 新提交 70%

Consistent Feature Transport for Image Relighting

用于图像重光照的一致特征传输

Bohan Zhang, Huanwei Liang, Yuhan He, Hongteng Xu, Quxiao Chao, Luoqi Liu, Dixin Luo, Ting Liu

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) MT Lab, Meitu Inc.(美图公司MT实验室) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究图像重光照问题,提出一致特征传输(CFT)方法,基于整流流通过轨迹级监督联合建模噪声到图像生成及光照一致的源到目标传输,构建数据集实验验证,该方法能改进重光照并推广到其他编辑任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13685 2026-07-16 cs.CV 新提交 70%

DNA: Dual-stage Native Attribution for Generated Image Source Tracing

DNA:用于生成图像源追踪的双阶段原生归因

Chao Wang, Kejiang Chen, Zijin Yang, Yaofei Wang, Yuang Qi, Weiming Zhang, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对图像生成中家族内变体源追踪难题,提出双阶段原生归因(DNA)框架。粗粒度用 AEDR 筛选,细粒度用 NPC 归因。构建 DNA-30K 基准,实验表明 DNA 准确率高,优于基线,为图像源追踪提供有效方法。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13300 2026-07-16 cs.CV 新提交 70%

Improving Medical Image Generative Models with Fréchet Distance Loss

用弗雷歇距离损失改进医学图像生成模型

Andrew Marshall, Xuanang Xu, Xiaoran Zhang, Rui Wang, Lawrence Staib, James Duncan

机构 * Yale University(耶鲁大学)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究针对扩散生成模型难以捕捉异质性肿瘤复杂形态特征的问题,提出用弗雷歇距离损失微调模型,通过在多数据集上集成该损失,提升了下游分割网络性能,证明其是改进医学图像生成模型临床工作流程的有效正则化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11233 2026-07-14 cs.CV 新提交 70%

Structure-Detail Decoupled Autoregressive Generation for Fast and High-Fidelity Virtual Try-On

用于快速和高保真虚拟试穿的结构-细节解耦自回归生成

Lu Yang, Xiaonan Hu, Yanan Li, Daqi Liu, Xiang Bai, Hao Lu

机构 * Huazhong University of Science and Technology(华中科技大学) Wuhan Institute of Technology(武汉工程大学) Xiaomi EV(小米汽车)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究虚拟试穿问题,提出STAR-VTON框架,通过解耦潜在空间结构合成与像素空间细节恢复,结合匹配信息细化器,实现高效高保真虚拟试穿,其中VAR-VTON效率高,像素空间细化器能有效恢复细节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11196 2026-07-14 cs.CV 新提交 70%

Slot-RAE: Streamlining Object-Centric Learning via Direct Representation Auto-Encoders

Slot-RAE:通过直接表示自动编码器简化以对象为中心的学习

Alexandre Chapin, Emmanuel Dellandrea, Liming Chen

机构 * LIRIS(里昂图像与信息系统实验室) Ecole Centrale de Lyon(里昂中央理工学院)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 研究针对以对象为中心的模型部署问题,提出Slot-RAE框架,直接在视觉基础模型特征空间运行,采用特征空间扩散过程及独特训练方式,在COCO数据集实验中取得领先成果,实现高效无监督对象发现等,速度和计算效率更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06432 2026-07-08 cs.LG cs.AI cs.CV 新提交 70%

TILDE: TILt-based Distributional Erasure for Concept Unlearning

TILDE:基于倾斜的概念遗忘分布擦除

Naveen George, Naoki Murata, Yuhta Takida, Konda Reddy Mopuri, Yuki Mitsufuji

机构 * Indian Institute of Technology Hyderabad(印度理工学院海得拉巴分校) Sony AI(索尼人工智能公司) Sony Group Corporation(索尼集团公司)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 文本到图像扩散模型的概念遗忘研究中,提出TILDE方法,将概念遗忘视为分布对齐问题,通过能量倾斜的无锚点目标抑制概念图像,用残差∇-GFlowNet训练实例化,实验显示其在多方面实现强大遗忘效果,提升保留率和分布保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05088 2026-07-07 cs.CV 新提交 70%

RADIANCE: Relative Adaptive Denoising with IP-Adapter for Novel Concept Enhancement

RADIANCE:使用IP-适配器进行相对自适应去噪以增强新颖概念

Zi-Xiang Ni, Bo-Lun Huang, Teng-Fang Hsiao, Bo-Kai Ruan, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对文本到图像扩散模型合成罕见概念的问题,提出无训练框架RADIANCE,通过三个模块组件增强预训练主干,经实验验证其能提升合成效果。

Comments Accepted to ECCV 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04674 2026-07-07 cs.CV 新提交 70%

Video Generation Models Are Inherent Lighting Estimators

视频生成模型是内在的光照估计器

Ziqi Cai, Shuchen Weng, Kaiqi Liu, Zifeng Wang, Zhiquan Zhang, Minggui Teng, Han Jiang, Boxin Shi

机构 * Peking University(北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) OpenBayes Information Technology Co., Ltd.(北京智谱华章科技有限公司)

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 研究从单张自然视频恢复动态环境图的问题,核心方法是将光照估计重构为引导视频修复任务,贡献是提出V-LITE框架,能生成连贯HDR环境图,证明视频扩散模型可估计物理场景光照。

Comments Project Page: https://caiziqi.com/research/vlite/

详情

展开后加载摘要…

URL PDF HTML 收藏