arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-14 至 2026-07-14 共收录 159 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 6 篇

2607.10535 2026-07-14 cs.CV 新提交 89%

Improving Sample Diversity in Autoregressive Text-to-Image Generation via Cluster Truncation

通过聚类截断提高自回归文本到图像生成中的样本多样性

Trang Nguyen, Shuang Wu, Runyan Tan, Phillip Howard

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Thoughtworks(Thoughtworks公司)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 研究自回归图像生成模型中样本多样性问题,指出其关键属性限制现有方法。提出无p聚类新解码策略,在四个自回归T2I模型和两个数据集上评估,该策略能解锁最大多样性并保持图像质量与提示对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11886 2026-07-14 cs.CV 新提交 88%

Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation

读回:预训练的多模态语言模型是文本到图像生成的零样本奖励模型

Runhui Huang, Qihui Zhang, Zhe Liu, Yu Gao, Jie Wu, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) ByteDance Seed(字节跳动Seed) Peking University(北京大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 研究提出SpectraReward将预训练多模态语言模型转为图像生成强化学习奖励模型,用图像条件提示对数似然作奖励,还引入Self-SpectraReward形成闭环框架。经广泛实验验证,二者能提升生成性能,表明奖励-策略对齐是关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19558 2026-07-14 cs.CR cs.AI cs.CV cs.LG 版本更新 70%

SPQR: A Multi-Dimensional Benchmark for Safety Alignment under Benign Model Adaptation

SPQR:良性模型适应下安全对齐的多维基准测试

Mohammed Talha Alam, Nada Saadi, Fahad Shamshad, Nils Lukas, Karthik Nandakumar, Fahkri Karray, Samuele Poppi

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Waterloo(滑铁卢大学) Michigan State University(密歇根州立大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究文本到图像扩散模型安全对齐在良性微调下的稳定性,引入SPQR基准测试,通过单评分指标提供统一框架,经多方面分析确定安全对齐失败情况,为T2I安全对齐技术提供简洁全面的基准。

Comments 34 pages, 9 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11199 2026-07-14 cs.CV 新提交 57%

DynEval: Holistic Evaluations of T2I Generative Models in the Wild

DynEval:对自然环境下的文本到图像生成模型进行全面评估

Shyam Marjit, Dheeraj Baiju, Anuj Shikarkhane, Akhil Sakthieswaran, Sayak Paul, Anirban Chakraborty

机构 * Indian Institute of Science(印度科学研究所) Hugging Face(拥抱脸)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 研究针对文本到图像生成模型评估难题,提出DynEval动态评估框架,通过构建两个数据集,利用课程学习策略微调评估器,在多基准测试中与人类判断相关性更高,可对多个T2I模型进行细粒度分析。

Comments Accepted at ECCV 2026. Project page: https://vcl-iisc.github.io/dyneval/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02161 2026-07-14 cs.CV 版本更新 57%

TIIF-Bench: How Does Your T2I Model Follow Your Instructions?

TIIF-Bench:你的文本到图像模型如何遵循指令?

Xinyu Wei, Jinrui Zhang, Zeqing Wang, Hongyang Wei, Zhen Guo, Bairui Li, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学) OPPO Research Institute(OPPO研究院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 研究旨在评估T2I模型遵循指令能力,提出TIIF-Bench基准,含多维度、多难度提示及新评估指标,利用大语言模型知识开发可重现评估器,通过对主流模型测试分析其优缺点及现有基准局限性。

Comments 35 pages, 14 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10557 2026-07-14 cs.CL 新提交 50%

UNIBROWSE: A Data-to-Agent Framework for Multimodal BrowseComp

UNIBROWSE:用于多模态浏览比较的数据到智能体框架

Xiyu Wei, Qingwei Zong, Zhuocheng Yu, Sujian Li

机构 * Key Laboratory of Computational Linguistics, MOE, Peking University(教育部计算语言学重点实验室,北京大学) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) School of Computer Science, Peking University(北京大学计算机科学学院)

专题命中 文生图 :text-to-image(abstract)

AI总结 研究多模态浏览比较任务,提出UNIBROWSE统一数据管道,同时生成三种模式训练数据,增强知识图谱,引入探索度度量。经此训练的35B规模智能体在多模态浏览比较基准测试中性能领先,超多个闭源智能体工作流程。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 6 篇

2607.10800 2026-07-14 cs.CV 新提交 83%

h-Flow: Flexible Flow-based Image Editing via Doob's h-Transform

h-Flow:通过杜布h变换实现基于灵活流的图像编辑

Zehui Guo, Zhen Wang, Junwei Shu, Yang Li, Changbo Wang, Long Chen

机构 * East China Normal University(华东师范大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 图像编辑 :image editing(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出h-Flow,一个无需训练且基于理论的基于流的图像编辑框架。受杜布h变换启发,将图像编辑重述为条件生成,通过构建等效SDE扩展h变换,设计专用h函数并引入速度正交分解,实现有效、稳健且灵活的图像编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24844 2026-07-14 cs.CV 版本更新 79%

Bridging the Manifold Gap: Riemannian Residual Line Search for One-Step Image Editing

弥合流形差距:黎曼残差线搜索用于一步图像编辑

Hongzhu Yi, Zhongtian Luo, Tong Li, Yiyan Fan, Jungang Xu

机构 * UCAS(中国科学院大学) WashU(华盛顿大学) SHU(上海大学)

专题命中 图像编辑 :image editing(title);diffusion(abstract);分类 cs.CV

AI总结 针对一步扩散编辑中固定更新强度无法兼顾目标提示和源图像保真度的问题,提出黎曼残差线搜索方法,通过局部时间曲率估计和残差路径选择,在PIE-Bench++上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13692 2026-07-14 cs.CV cs.AI cs.SE 版本更新 79%

Training-Free, Identity-Preserving Image Editing for Fashion Pose Alignment and Normalization

用于时尚姿势对齐和归一化的无训练、身份保留图像编辑

Potito Aghilar, Vito Walter Anelli, Michelantonio Trizio, Eugenio Di Sciascio, Tommaso Di Noia

机构 * Polytechnic University of Bari(巴里理工大学)

专题命中 图像编辑 :image editing(title);diffusion(abstract);分类 cs.CV

AI总结 针对时尚行业非刚性姿势调整难题,提出无训练的FashionRepose管道,结合预训练模型,通过零样本方法在保留服装身份特征的同时实现近实时编辑,已成功为OVS处理大量长袖服装。

Journal ref Expert Systems With Applications, 293, 128579 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11643 2026-07-14 cs.RO cs.AI 新提交 75%

Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model

小米机器人-U0:基于世界基础模型的统一具身合成

Xinghang Li, Jun Guo, Qiwei Li, Long Qian, Hang Lai, Yueze Wang, Hongyu Yan, Jiahang Cao, Xi Chen, Jingen Qu, Jiaxi Song, Nan Sun, Hanye Zhao, Futeng Liu, Wanli Peng, Heyun Wang, Yunhong Wang, Caoyu Xia, Jack Zhao, Diyun Xiang, Hangjun Ye, Heng Qu, Huaping Liu, Jason Li

机构 * Xiaomi Robotics(小米机器人)

专题命中 图像编辑 :image generation(abstract);text-to-image(abstract);image editing(abstract)

AI总结 研究针对基础模型应用于具身场景受限问题,提出小米机器人-U0多模态自回归模型,将具身生成扩展为基础图像和视频生成的形式,联合优化多种生成任务,在多方面取得领先成果,证明基础世界模型可用于具身智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11281 2026-07-14 cs.CV 新提交 57%

The Devil Is in the Leakage: A Disentangled Dual-Purification Framework for High-Fidelity Hairstyle Transfer

问题出在泄漏中:用于高保真发型转移的解缠双净化框架

Jijie Li, Jiankuo Zhao, Xiangyu Zhu, Zhen Lei

机构 * SAI, UCAS(中国科学院大学 模式识别国家重点实验室) MAIS, CASIA(中国科学院自动化所 模式识别国家重点实验室) CAIR, HKSIS, CAS(中国科学院香港创新研究院 计算机与信息工程实验室) SCSE, FIE, M.U.S.T(澳门科技大学 资讯科技学院)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 研究发型转移中参考发型与源身份纠缠及现有方法泄漏问题,提出双净化框架,含对抗发型净化和对比几何净化两个正则化器,实现高保真、身份保留的发型转移并达领先性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10301 2026-07-14 cs.CV cs.CL 新提交 57%

ChartSync: A Benchmark for Visuo-Logical Cascading Chart Editing

ChartSync:视觉逻辑级联图表编辑的基准测试

Jiakang Yu, Yixuan Chai, Tianci Wang, Rihui Jin, Guangkai Xu, Hongtao Deng, Xun Zhu, Wang Gao, Xinrun Guo, Haipang Wu

机构 * Jianghan University(江汉大学) HiThink Research(海思睿研) University of Science and Technology of China(中国科学技术大学) Southeast University(东南大学) Zhejiang University(浙江大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 研究针对生成式图像编辑模型处理结构化统计图的困难,提出视觉逻辑级联编辑任务。引入ChartSync基准测试,含多种图表类别和任务类型。通过两层框架评估模型,发现开源与专有模型能力差距,分析误差以指导多模态架构发展,数据集和代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 123 篇

2607.01170 2026-07-14 cs.IR cs.AI 版本更新 89%

Diffusion-GR2: Diffusion Generative Reasoning Re-ranker

Diffusion-GR2: 扩散生成推理重排序器

Zhuoxuan Zhang, Kangqi Ni, Yuhang Chen, Mingfu Liang, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Frank Shyu, Adam, Song, Sandeep Pandey, Luke Simon, Tianlong Chen, Xi Liu

机构 * Meta AI UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 提出Diffusion-GR2,通过转换微调、在线策略蒸馏和强化学习将自回归推理重排序器转换为块扩散模型,在保持精度的同时将推理吞吐量提升2.4-3.5倍。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11655 2026-07-14 cs.CV 新提交 86%

Feature-Space Guided Diffusion for Realistic Ultrasound Image Synthesis

用于逼真超声图像合成的特征空间引导扩散

Marina Domínguez, Nélida Mirabet-Herranz, Valery Naranjo

机构 * Artikode Intelligence S.L.(Artikode智能有限公司)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title);分类 cs.CV

AI总结 研究针对条件扩散模型合成超声图像逼真度不足问题,提出无需训练的特征空间候选引导(FSCG)采样策略,通过局部k近邻特征校正及按特征空间能量选最佳候选,缩小与真实图像差距,在多数据集上效果优于标准采样及其他基线。

Comments 11 pages, 4 figures. Pre-review manuscript version of a paper accepted at DGM4MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09787 2026-07-14 cs.CV cs.LG 新提交 86%

Adversarially Guided Diffusion for LiDAR Range Image Synthesis

用于激光雷达距离图像合成的对抗引导扩散

Stavros Bouras, Antonios Makris, Alexandros Gkillas, Aris S. Lalos, Konstantinos Tserpes

机构 * School of Electrical and Computer Engineering, National Technical University of Athens(雅典国立技术大学电气与计算机工程学院) Industrial Systems Institute, Athena Research Center(雅典娜研究中心工业系统研究所)

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(title);分类 cs.CV

AI总结 研究针对二维距离图像分割的无限制对抗攻击,提出基于扩散并利用分割损失对抗引导的方法,在SemanticKITTI数据集实验,能跨架构转移,相比基线在有效性与现实性间有独特权衡,实现可控退化。

Comments Accepted at the 1st Workshop on Secure and Trustworthy AI (STAI 2026), co-located with the European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML PKDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10853 2026-07-14 cs.CV cs.LG 新提交 84%

Diversify Diffusion with Temperature Sampling and Variance-Corrective Time Shifting

通过温度采样和方差校正时间偏移实现扩散多样化

Peizhuo Li, Emre Aksan, Alexandru-Eugen Ichim, Thabo Beeler, Olga Sorkine-Hornung

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对扩散模型难以达到罕见模式的问题,提出方差校正时间偏移方法,并结合温度采样,无需重新训练就能提升样本多样性,在多个模型中以低成本实现质量和保真度提升,还能实现从粗到细的控制。

Comments Webpage: https://peizhuoli.github.io/diversify-diffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09784 2026-07-14 cs.CV cs.IT math.IT 新提交 83%

Compression Asymmetry and Trajectory Binding in Noise-Anchored Diffusion Inversion

噪声锚定扩散反演中的压缩不对称性与轨迹绑定

Yongseong Park, Joeun Kim, HoEun Kim, Young-Sik Kim

机构 * DGIST(大邱庆北科学技术院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究真实图像扩散反演的质量-成本权衡,通过高斯噪声锚分离出压缩不对称与轨迹绑定机制,据此提出NARC方法,该方法无需训练,存储少且效果好,在实验中表现出色并可应用于其他模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15041 2026-07-14 cs.LG cs.SE 版本更新 82%

HyperNet-Adaptation for Diffusion-Based Test Case Generation

基于扩散的测试用例生成的超网络自适应

Oliver Weißl, Vincenzo Riccio, Severin Kacianka, Andrea Stocco

机构 * Technical University of Munich(慕尼黑技术大学) University of Udine(乌迪内大学) fortiss

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract)

AI总结 针对深度学习系统可靠性评估问题,提出HyNeA生成式测试方法,通过超网络实现无数据集可控性,采用独特训练策略,能以较低计算成本有针对性地生成现实故障用例,提高可控性和测试多样性,还可推广到无故障标签数据领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22510 2026-07-14 cs.LG stat.ML 版本更新 82%

CANDI: Hybrid Discrete-Continuous Diffusion Models

CANDI:混合离散-连续扩散模型

Patrick Pynadath, Jiaxin Shi, Ruqi Zhang

机构 * Purdue University, West Lafayette, U.S.A(普渡大学) Google Deepmind(谷歌DeepMind)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 研究连续扩散应用于离散数据表现不佳的问题,提出CANDI混合框架解耦离散和连续破坏,实现同时学习,在受控生成和文本生成中分别展现优势,解锁连续扩散对离散空间的好处。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11385 2026-07-14 eess.IV cs.CV 新提交 80%

Diffusion MRI preprocessing affects ADC estimation and automatic PI-RADS v2.1 classification in bi-parametric prostate MRI

扩散加权磁共振成像预处理影响双参数前列腺磁共振成像中表观扩散系数估计和自动PI-RADS v2.1分类

Christos Kanakis, Mathias Perslev, Tim Schakel, Silvia Ingala, Akshay Pai, Dennis Klomp, Chantal M. W. Tax

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究不同DWI预处理策略对前列腺MRI中ADC估计及PI-RADS分类的影响,通过对268个病例应用多种处理方法,比较不同算法下的ADC图,训练分类器预测PI-RADS分数,发现预处理可提升ADC图质量及分类预测能力。

Comments 19 pages, 10 figures, ISMRM Diffusion workshop 2025, ESMRMB 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11578 2026-07-14 cs.LG cs.AI cs.CV eess.SP 新提交 79%

DiffEEG: A Self-Supervised Denoising Diffusion Model for Learning EEG Generic Representations

DiffEEG:用于学习脑电通用表示的自监督去噪扩散模型

Abdulkader Helwan, Lina Abou-Abbas, Hussein El Amouri, Belkacem Chikhaoui, Khadidja Henni

机构 * Lebanese American University(黎巴嫩美国大学) Institute of Applied Artificial Intelligence, TÉLUQ University(应用人工智能研究所,泰鲁克大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对基于脑电的癫痫检测面临的注释稀缺和类别不平衡问题,提出DiffEEG自监督基础模型,通过去噪扩散预训练和强化学习微调学习通用神经表示,在癫痫检测中取得较好效果,证明该方法能以最少标记数据实现临床可部署监测。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11533 2026-07-14 cs.CV cs.LG 新提交 79%

Adaptive Routing for Efficient Diffusion Transformer-Based PNI Prediction

基于高效扩散变压器的PNI预测的自适应路由

Youngung Han, Dohyun Kweon, Kyeonghun Kim, Hyunsu Go, Jina Jeong, Suah Park, Induk Um, Junga Kim, Anna Jung, Yului Jeong, Sungha Park, Jinyong Jun, Pa Hong, Woo Kyoung Jeong, Won Jae Lee, Ken Ying-Kai Liao, Hyuk-Jae Lee, Nam-Joon Kim

机构 * Seoul National University(首尔国立大学) Kyung Hee University(庆熙大学) OUTTA Chung-Ang University(Chung-Ang 大学) Seoul National University School of Medicine(首尔国立大学医学院) Samsung Changwon Hospital(三星昌原医院) Samsung Medical Center(三星医疗中心) NVIDIA AI Technology Center(NVIDIA AI 技术中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对胆管癌PNI术前MRI预测难题,传统方法有局限。本文将PNI预测设为扩散分类问题,用基于Transformer的表示实现去噪网络,并引入自适应路由提高效率,实验取得了0.731的AUC及257.57 GFLOPs的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11081 2026-07-14 cs.CV cs.AI 新提交 79%

Controlling Motion Transfer in Diffusion Transformers via Attention Heads

通过注意力头控制扩散变换器中的运动传递

Sunyoung Jung, Jiwoo Park, Yoonseok Choi, Kyobin Choo, Ming-Hsuan Yang, Seong Jae Hwang

机构 * Yonsei University(延世大学) LG Electronics(LG电子) University of California, Merced(加州大学默塞德分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究如何控制扩散变换器中的运动传递,通过在注意力头层面分析,提出无需参数更新的头感知可控运动传递框架,利用语义对应引导和选择性特征注入,实现精确运动传递并为可控视频生成提供可解释基础。

Comments Accepted to ECCV 2026, Project page: https://sunyj-hxppy.github.io/halo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10984 2026-07-14 cs.CV cs.AI cs.HC cs.LG 新提交 79%

EquiFusion: Kinematics-Agnostic Human Motion Prediction via Equivariant Latent Diffusion

EquiFusion:通过等变潜扩散实现与运动学无关的人体运动预测

Cecilia Curreli, Florian Hofherr, Dominik Muhle, Abhishek Saroha, Riccardo Marin, Daniel Cremers

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对现有3D人体运动预测模型受骨骼运动学硬编码限制的问题,提出EquiFusion模型,通过排列等变架构实现潜扩散,对未见运动学有跨数据集泛化能力,在基准测试中成果领先,建立了新的人体运动预测标准。

Comments Accepted to ECCV 2026. Visit our webpage at https://ceveloper.github.io/publications/equifusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10580 2026-07-14 cs.CV cs.AI 新提交 79%

DiffUE: Enhancing Utility-Unlearnability Trade-off of Unlearnable Examples via Diffusion Autoencoders

DiffUE:通过扩散自动编码器增强不可学习示例的效用-不可学习性权衡

Syed Irfan Ali Meerza, Oktay Ozturk, Amir Sadovnik, Jian Liu

机构 * University of Tennessee, Knoxville(田纳西大学诺克斯维尔分校) Oak Ridge National University, Knoxville(橡树岭国家实验室诺克斯维尔分部) University of Georgia, Athens(佐治亚大学雅典分校) Virginia Commonwealth University, Richmond(弗吉尼亚联邦大学里士满分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对AI模型利用个人图像致隐私侵犯问题,DiffUE通过在图像语义空间注入噪声,利用扩散自动编码器框架操纵语义特征,增强图像不可学习性,显著提升了图像质量和不可学习性之间的权衡,保障个人数据安全。

Comments To appear at the European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09753 2026-07-14 cs.CV cs.AI cs.LG 新提交 79%

Unified Backbone Refinement for Diffusion Models via Internal-Latent Analysis

通过内部潜变量分析对扩散模型进行统一骨干细化

Haksoo Lim, Myeongjin Lee, Wonjoon Chang, Jaesik Choi

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) INEEJI

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究扩散模型骨干细化问题,提出DUNE框架,通过分析内部潜变量检测突变偏差,对选定条目进行骨干特定抑制,可自然扩展到基于Transformer的模型,经实验验证该方法能提高保真度并减少幻觉。

Comments 45 pages, 23 figures. Accepted at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22036 2026-07-14 cs.LG cs.MM 版本更新 79%

Hyper-modal Imputation Diffusion Embedding with Dual-Distillation for Federated Multimodal Knowledge Graph Completion

基于双蒸馏的超模态插补扩散嵌入用于联邦多模态知识图谱补全

Ying Zhang, Yu Zhao, Xuhui Sui, Baohang Zhou, Xiangrui Cai, Li Shen, Xiaojie Yuan, Dacheng Tao

机构 * College of Computer Science, VCIP, DISSec, Nankai University(计算机学院、VCIP、DISSec、南开大学) School of Software, Tiangong University(软件学院、天津工业大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院、南洋理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 针对多模态知识图谱分散问题,提出FedMKGC任务及MMFeD3-HidE框架,客户端内用超模态插补扩散嵌入模型,客户端间用多模态联邦双蒸馏传输知识,通过FedMKGC基准验证了该框架的有效性、语义一致性和收敛鲁棒性。

Comments Published in IEEE Transactions on Multimedia, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00786 2026-07-14 cs.CV 版本更新 79%

Zero-Shot Paragraph-level Handwriting Imitation with Latent Diffusion Models

基于潜在扩散模型的零样本段落级手写模仿

Martin Mayr, Marcel Dreier, Florian Kordon, Mathias Seuret, Jochen Zöllner, Fei Wu, Andreas Maier, Vincent Christlein

机构 * Planet AI GmbH

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出基于潜在扩散模型的零样本段落级手写模仿方法,通过改进模型、增强注意力机制等,能处理未见风格,提高手写生成真实感,在综合评估中表现优异,还公开代码支持相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10919 2026-07-14 econ.TH 新提交 78%

Diffusion of tacit knowledge in a company: a mathematical model based on diffusion on graphs

公司中隐性知识的传播:基于图上扩散的数学模型

Radosław A. Kycia, Agnieszka Niemczynowicz, Andrzej Buszko

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究公司中隐性知识传播,提出基于物理学热扩散概念及图论的模型,通过定义隐性知识转移图编码问卷数据,可优化课程安排、识别高知识需求员工,有助于公司多方面提升及改进知识管理等。

Comments 57 pages, 8 figures

Journal ref Journal of Knowledge Management (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11631 2026-07-14 stat.CO stat.ML 新提交 78%

Markov Chain Monte Carlo with Diffusion Paths

带扩散路径的马尔可夫链蒙特卡罗

Han Chen, Sifan Liu, Jun Yang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对多模态分布采样难题,提出沿扩散路径插值的方法,通过变分估计中间得分,引入MAD - Path采样器消除偏差,经谱隙分析明确路径特性,量化误差影响,实验表明其在全局探索和模式权重估计上优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏