arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-27 至 2026-07-27 共收录 55 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 55 篇

2601.03499 2026-07-27 eess.IV cs.CV 版本更新 89%

GeoDiff-SAR: A Geometric Prior Guided Diffusion Model for SAR Image Generation

GeoDiff-SAR:一种基于几何先验的扩散模型用于SAR图像生成

Fan Zhang, Xuanting Wu, Fei Ma, Qiang Yin, Yuxin Hu

机构 * College of Information Science and Technology, Beijing University of Chemical Technology(信息科学与技术学院,北京化工大学) Aerospace Information Research Institute, Chinese Academy of Sciences(航天信息研究所,中国科学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(title,abstract);分类 cs.CV

AI总结 GeoDiff-SAR通过引入几何先验引导扩散模型,提升SAR图像生成的保真度和分类准确性,尤其在不同方位角识别性能上有显著提升。

Comments 3 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21904 2026-07-27 cs.CV cs.CL 新提交 88%

Diffusion Models in Medical Image Inpainting: Challenges, Solution Taxonomy, and Future Directions

医学图像修复中的扩散模型:挑战、解决方案分类及未来方向

Arthur Dantas Mangussi, Joana Cristo Santos, Ricardo Cardoso Pereira, Ana Carolina Lorena, Mário A. T. Figueiredo, Pedro Henriques Abreu

机构 * Aeronautics Institute of Technology(航空技术学院) Science and Technology Institute, Federal University of São Paulo(圣保罗联邦大学科学与技术研究所) LASIGE, Faculdade de Ciências, Universidade de Lisboa(里斯本大学理学院LASIGE实验室) University of Coimbra, CISUC/LASI – Centre for Informatics and Systems of the University of Coimbra(科英布拉大学CISUC/LASI - 科英布拉大学信息与系统中心) Instituto Superior Técnico, Universidade de Lisboa, Instituto de Telecomunicações(里斯本大学高等技术学院、电信研究所)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

AI总结 该研究对基于扩散的医学图像修复方法进行系统回顾,涵盖多方面内容并提出分类法。分析显示相关研究兴趣快速增长,扩散模型在生成合理重建结果及辅助临床任务上表现出色,但也面临缺乏标准化基准等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22428 2026-07-27 cs.HC cs.AI cs.LG cs.MM 新提交 87%

Unboxing Diffusion Models for the Arts: Interactive Model Bending and Practice-Based Explainability

剖析艺术领域的扩散模型:交互式模型调整与基于实践的可解释性

Ahmed M. Abuzuraiq, Philippe Pasquier

机构 * School of Interactive Arts and Technology, Surrey, Canada(交互艺术与技术学院,英国苏城)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.MM

AI总结 研究探讨创意实践中可解释人工智能,提出以实验和干预为中心的方法,通过集成模型调整和交互界面到工作流程,经对Stable Diffusion 1.5分析,助艺术家理解模型组件对生成图像的影响,让大型模型成为创意材料。

Comments Under review for "Explainable AI for the Arts" (N. Bryan-Kinns, Ed.), Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21606 2026-07-27 cs.AI 新提交 85%

TILT: Improving Compositional Generation in Diffusion Models with a Model-Intrinsic Reward

TILT:使用模型内在奖励改进扩散模型中的组合生成

Debottam Dutta, Jaehoon Hahm, Jianchong Chen, Romit Roy Choudhury

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract)

AI总结 研究如何改进扩散模型的组合生成,提出无训练框架TILT,通过测试时奖励对齐,将组合失败解释为分布重叠模式并定义固有奖励,产生KL约束目标及指导步骤,实验表明该方法能在保图质时提升组合对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10058 2026-07-27 cs.CV 版本更新 83%

Color Me Correctly: Bridging Perceptual Color Spaces and Text Embeddings for Improved Diffusion Generation

正确为我上色:弥合感知颜色空间与文本嵌入以改进扩散生成

Sung-Lin Tsai, Bo-Lun Huang, Yu Ting Shen, Cheng Yu Yeo, Chiang Tseng, Bo-Kai Ruan, Wen-Sheng Lien, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究文本到图像生成中颜色对齐问题,提出利用大语言模型消除颜色提示歧义、在文本嵌入空间指导颜色混合操作的无需训练框架,提高了颜色准确性且不影响图像质量,弥合文本语义与视觉生成差距。

Comments Accepted to ACM Multimedia 2025 (MM '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22386 2026-07-27 cs.CV cs.CR 新提交 79%

Correlation-Aware and Gaussianity-Preserving Robust Latent Angular Watermarking for Diffusion Models

用于扩散模型的相关感知和高斯性保持的鲁棒潜在角水印

Yebin Zheng, Haonan An, Guang Hua, Zhiping Lin, Yuguang Fang

机构 * Singapore Institute of Technology(新加坡理工学院) City University of Hong Kong(香港城市大学) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究扩散模型潜在域水印问题,提出潜在角水印(LAW)及变体LAW-M,通过对映角编码保持高斯性,解决现有方法易受攻击及相关性退化问题,理论上严格表征相关性退化并推导自相关结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22231 2026-07-27 cs.CV cs.AI 新提交 79%

TRaM-VSR: Importance-Aware Token Routing and Merging for One-Step Diffusion Video Super-Resolution

TRaM-VSR:用于一步扩散视频超分辨率的重要性感知令牌路由与合并

Sicheng Gao, Zhuyun Zhou, Yixuan Liu, Tong Shen, Zongwei Wu, Radu Timofte

机构 * Advanced Micro Devices Inc.(超威半导体公司) Computer Vision Lab, CAIDAS & IFI, University of Würzburg(维尔茨堡大学CAIDAS与IFI计算机视觉实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对视频超分辨率中扩散模型计算成本高及现有方法存在问题,提出TRaM-VSR框架,通过融合线索估计令牌重要性,经离线规划器校准调整,在路由组内分处理关键与非关键令牌,实现加速推理且保持质量和一致性。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22091 2026-07-27 cs.CV 新提交 79%

Spectral Prior for Reducing Exposure Bias in Diffusion Models

用于减少扩散模型中曝光偏差的频谱先验

Yuya Kobayashi, Masato Ishii, Yuhta Takida, Takashi Shibuya, Yuki Mitsufuji

机构 * Sony AI(索尼人工智能) Sony Group Corporation(索尼集团公司)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对扩散模型曝光偏差问题,提出频谱对齐(SPA)方法,通过离线拟合参数频谱模型及推理时基于快速傅里叶变换的梯度计算引导,减少计算开销且与CFG互补,在多种架构上实现一致改进。

Comments Accepted at ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13826 2026-07-27 eess.IV cs.CV 版本更新 79%

Latent Interpolation Learning Using Diffusion Models for Cardiac Volume Reconstruction

使用扩散模型进行心脏容积重建的潜在插值学习

Niklas Bubeck, Suprosanna Shit, Chen Chen, Can Zhao, Pengfei Guo, Dong Yang, Georg Zitzlsberger, Daguang Xu, Bernhard Kainz, Daniel Rueckert, Jiazhen Pan

机构 * School of Computation, Information and Technology, Technical University Munich(技术大学慕尼黑计算信息学院) Munich Center for Machine Learning(慕尼黑机器学习中心) Department of Quantitative Biomedicine, University of Zurich(苏黎世大学定量生物医学系) Institute of Biomedical Engineering, Department of Engineering Science, University of Oxford(牛津大学生物医学工程研究所) Imperial College London(伦敦帝国学院) University of Sheffield(谢菲尔德大学) NVIDIA(英伟达) Department of Computing, Imperial College London(伦敦帝国学院计算机系) Department AIBE of Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔兰根-纽伦堡大学AIBE系) School of Medicine, Klinikum Rechts der Isar, Technical University of Munich(慕尼黑技术大学医学院,莱纳特医院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对心脏磁共振成像二维切片采集稀疏致容积信息不完整、现有重建方法有局限的问题,提出CaLID框架,创新采用基于扩散模型的插值方案、潜在空间高效计算法,仅用稀疏二维图像输入达SOTA,扩展到二维加时间数据,提升了重建质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20302 2026-07-27 cs.CV 版本更新 79%

TDiR: Transformer based Diffusion for Image Restoration Tasks

TDiR:基于Transformer的扩散用于图像恢复任务

Abbas Anwar, Ibrahim Radwan, Ali Arshad Nasir, Mudassir Masood, Saeed Anwar

机构 * Department of Computer Vision(计算机视觉系) FutureDataMinds Electrical Engineering Dept(电气工程系) King Fahd University of Petroleum and Minerals(国王法赫德石油和矿产大学) Department of Computer Science and Software Engineering(计算机科学与软件工程系) University of Western Australia(西澳大学) School of Computing(计算学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对图像在复杂环境下的退化问题,开发基于Transformer的扩散模型用于图像恢复。该模型在水下增强、去噪、去雨三项任务中经五个基准测试,并与18种先进技术对比,结果显示其性能优越,有效提升了退化图像质量,拓宽了相关下游任务应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21928 2026-07-27 cs.CG 新提交 78%

TG-Diff: Coupling Discrete Topology Diffusion and Topology-conditioned Geometry Diffusions for B-Rep Generation

TG-Diff:耦合离散拓扑扩散与拓扑条件几何扩散用于边界表示生成

MingZe Sun, Haiyong Jiang, Bingchen Yang, Haoxuan Song, Yidi Li, Jun Xiao, Peter Wonka

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究提出TG-Diff框架,通过解耦拓扑与几何建模生成B-rep。基于以曲面为中心的表示开发两个扩散模型,拓扑扩散用离散扩散模型,曲面隐变量生成用条件隐变量扩散模型,经后处理形成封闭B-rep,计算量小且性能优越。

Comments none

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21661 2026-07-27 cs.RO 新提交 78%

GRACE: Gradient-Free Robot Action Generation via Combined Diffusion-MPPI Posterior Mean Estimation

GRACE:通过组合扩散-MPPI后验均值估计实现无梯度机器人动作生成

Leesai Park, Jiho HOng, Sanghyun Kim

机构 * School of Mechanical Engineering, Kyung Hee University(庆熙大学机械工程学院) Advanced Institute of Convergence Technology (AICT)(融合技术高级研究院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究提出GRACE方法,通过组合扩散-MPPI后验均值估计,仅用前向成本评估引导预训练扩散策略,构建成本条件引导后验并估计均值,在模拟和真实机器人上验证,比基线方法成功率高,能避免部署时障碍物。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21634 2026-07-27 cs.LG cs.AI 新提交 78%

MotifRole-Diff: Risk-Optimal Role-Aware Corruption for Masked Molecular Graph Diffusion

MotifRole-Diff:用于掩码分子图扩散的风险最优角色感知损坏

Tasfia Nuzhat Ornee, Elias Hossain, Ivan Garibay, Niloofar Yousef

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对分子图扩散中统一损坏计划的不足,提出MotifRole-Diff方法,根据去噪难度和扰动影响分配掩码率,经实验验证该方法能提升生成有效性并降低FCD,表明结构感知损坏是更优掩码策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22199 2026-07-27 cs.LG cs.IT math.IT stat.ML 新提交 78%

From Score Approximation to Distribution Approximation in Score-Based Diffusion Models

基于得分的扩散模型中从得分近似到分布近似

Lan V. Truong

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究基于得分的扩散模型中得分近似与分布近似的关系,利用经典神经网络近似理论等,通过推导显式上界,建立两者定量联系,给出从得分函数近似到反向扩散模型概率分布近似的简单明确保证。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21987 2026-07-27 physics.geo-ph 新提交 78%

Diffusion-guided optimization for full waveform inversion

用于全波形反演的扩散引导优化

Yiran Shen, Yangkang Chen, Björn Engquist

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究提出在全波形反演(FWI)中用预训练扩散模型作正则化器,比较三种引导策略,通过多种实验表明分裂吉布斯扩散采样(SGDS)能提升重建质量,扩散引导优化可作实用正则化策略并保留波动方程建模循环。

Comments 32 pages, 16 figures. Source code: https://github.com/shenyiran91/SGDS-FWI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21954 2026-07-27 physics.ao-ph 新提交 78%

Anomalous Diffusion of Tropical Cyclones Observed in Huge Ensembles of Hindcasts

在大量后报数据中观测到的热带气旋异常扩散

Abdoul R. Zeba, William D. Collins, Ankur Mahesh, Boris Bonev, Karthik Kashinath, Thorsten Kurth, Michael S. Pritchard, Shashank Subramanian

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究利用2023年夏季大量后报数据,通过改进的检测和跟踪框架识别热带气旋,用球形傅里叶神经算子生成后报数据,重现异常扩散幂律,得出其对热带气旋轨迹和登陆位置预测性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21854 2026-07-27 physics.geo-ph 新提交 78%

Anomalous-diffusion synthesis of non-Gaussian reservoir anomalies for time-lapse seismic inversion

用于时移地震反演的非高斯储层异常的反常扩散合成

Anderson Mateus de Sousa Nogueira, Paulo Vitor Ferreira, Katerine Rincon Perez, João M. de Araújo, Tiago Barros, Samuel Xavier-de-Souza, Sérgio Luiz da Silva, Gilberto Corso

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究开发基于物理知识的时移地震反演框架,针对现有方法无法捕捉储层反常输运特征的问题,引入时空分数扩散数据生成器,训练卷积神经网络,经验证能准确重建异常,扩展了4D地震反演适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22273 2026-07-27 cond-mat.mtrl-sci physics.comp-ph 新提交 78%

Unbiased Diffusion Monte Carlo for non local operators

用于非局部算符的无偏扩散蒙特卡罗方法

Carlos Rodriguez Perez, Valerio Olevano, Francesco Sottile, Vitaly Gorelov

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对计算非局部算符的无偏扩散蒙特卡罗估计值问题,提出新数学精确方法,指出前沿技术前向行走的局限,通过在对称哈伯德二聚体和氦原子系统中的验证,证明新方法显著优于前向行走。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21849 2026-07-27 cond-mat.mtrl-sci 新提交 78%

Property-Guided Diffusion for Inverse Design of Crystalline Materials

用于晶体材料逆设计的属性引导扩散

Sourav Mal, Subhankar Mishra, Prasenjit Sen

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对晶体材料逆设计中属性引导相关问题,基于DiffCrysGen开发框架,用参数高效适配器微调及无分类器引导,以多种属性为任务研究其影响,经预筛选和验证识别出稳定材料,确立该框架并提供新见解。

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21726 2026-07-27 cond-mat.mtrl-sci 新提交 78%

Ionic Diffusion Properties of Rare-Earth High-Entropy Oxides from a Machine-Learned Interatomic Potential

基于机器学习原子间势的稀土高熵氧化物离子扩散特性

Mary Kathleen Caucci, Billy E. Yang, Saeed S. I. Almishal, Jon-Paul Maria, Susan B. Sinnott

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究利用CHGNet机器学习原子间势驱动分子动力学模拟,探究铈基稀土高熵氧化物中氧扩散。通过对三种CHGNet变体基准测试,揭示氧传输受空位浓度和阳离子环境影响,明确成分调整增强氧离子电导率的途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19686 2026-07-27 cs.CL cs.LG 版本更新 78%

Multi-Mask Diffusion Language Models for Few-Step Generation

用于少步生成的多掩码扩散语言模型

Sijin Chen, Yinuo Ren, Heyang Zhao, Ziheng Cheng, Quanquan Gu, Lexing Ying

机构 * ByteDance Seed(字节跳动种子) Princeton University(普林斯顿大学) Stanford University(斯坦福大学) UCLA(加州大学洛杉矶分校) UC Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对掩码扩散模型少步生成难的问题,提出多掩码扩散模型MultiMDM,通过特定前向过程使反向过程有起草能力,推导训练目标并制定蒸馏方案,经实验验证其为少步生成提供了有效基础。

Comments Needs corporate approval

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07428 2026-07-27 math.OC math.PR 版本更新 78%

Constrained Zero-Sum Stochastic Linear-Quadratic Differential Game for Jump-Diffusion Systems with Random Coefficients

具有随机系数的跳扩散系统约束零和线性二次微分博弈

Yanyan Tang, Xun Li, Jie Xiong

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了具有随机系数和 regime switching 的跳扩散系统中带锥约束的零和线性二次微分博弈,通过FBSDEs建立了开环解的存在性并推导了闭式解表达式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22352 2026-07-27 cs.LG cs.AI 版本更新 78%

SurvDiff: A Diffusion Model for Generating Synthetic Data in Survival Analysis

SurvDiff:用于生存分析中生成合成数据的扩散模型

Marie Brockschmidt, Maresa Schröder, Stefan Feuerriegel

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 SurvDiff是一种专为生存分析设计的端到端扩散模型,通过联合生成协变量、事件时间和删失机制,提升合成数据的分布忠实度和生存模型评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12311 2026-07-27 cs.NI cs.CR cs.HC cs.LG 版本更新 78%

Cross-reality location privacy protection in 6G-enabled vehicular metaverses: an LLM-enhanced hybrid generative diffusion model-based approach

6G赋能车联网元宇宙中的跨现实位置隐私保护:一种基于LLM增强混合生成扩散模型的方法

Xiaofeng Luo, Jiayi He, Jiawen Kang, Ruichen Zhang, Zhaoshui He, Ekram Hossain, Dong In Kim

机构 * School of Automation, Guangdong University of Technology(自动化学院,广东技术大学) School of Computer Science and Engineering, Nanyang Technological University(计算机科学与工程学院,南洋理工大学) Department of Electrical and Computer Engineering, University of Manitoba(电气与计算机工程系,曼尼托巴大学) Department of Electrical and Computer Engineering, Sungkyunkwan University(电气与计算机工程系,成均馆大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种基于LLM增强混合生成扩散模型的方法,用于6G赋能车联网元宇宙中的跨现实位置隐私保护,通过混合动作优化平衡隐私保护、延迟降低和服务质量维护。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02844 2026-07-27 cs.RO cs.LG 78%

VLM as Strategist: Adaptive Generation of Safety-critical Testing Scenarios via Guided Diffusion

VLM作为策略家:通过引导扩散实现安全关键测试场景的自适应生成

Xinzheng Wu, Junyi Chen, Naiting Zhong, Yong Shen

机构 * School of Automotive Studies, Tongji University(同济大学汽车研究学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种结合VLM和引导扩散模型的框架,用于高效生成安全关键测试场景,提升自动驾驶系统的测试效率和安全性。

Comments 25 pages, 9 figures

Journal ref Accident Analysis & Prevention Volume 236, October 2026, 108680

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12841 2026-07-27 physics.comp-ph 版本更新 78%

Generating Samples of Stationary Distributions of Weakly Interacting Diffusion Models Without Finite Particle Truncation: A Weak Generative Approach

在无有限粒子截断情况下生成弱相互作用扩散模型平稳分布的样本:一种弱生成方法

Zhiqiang Cai, Chengyu Liu, Xiang Zhou

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对计算弱相互作用扩散粒子平均场模型平稳分布及样本的难题,提出基于弱偏微分方程公式的生成框架,能同时计算平稳分布并生成样本,揭示真实分布,数值实验验证了该方法的有效性。

Comments 29 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22101 2026-07-27 cs.CV 新提交 77%

InnoText: A Unified Model for Visual Text Generation and Editing

InnoText:一种用于视觉文本生成和编辑的统一模型

Haowei Liu, Runze He, Jian Lu, Ao Ma, Run Ling, Ke Cao, Jiasong Feng, Wei Feng, Shuo Lu, Yexing Xu, Yun Wang, Jing Wang, Zhanjie Zhang

机构 * JD.com, Inc.(京东公司) University of Chinese Academy of Sciences(中国科学院大学) Chongqing University of Post and Telecommunications(重庆邮电大学) Beijing University of Technology(北京工业大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对视觉文本生成和编辑的挑战,提出基于DiT的统一框架InnoText,通过引入字体大小感知调制模块等策略,构建双语数据集,实现了在单个模型中进行文本生成和编辑,提升了生成精度和编辑质量。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22531 2026-07-27 cs.CV 新提交 70%

Twins: Learn to Predict Unified Representations with Focal Loss

Twins:使用焦点损失学习预测统一表示

Kaixiong Gong, Xin Cai, Bin Lin, Hao Wang, Yunlong Lin, Mingzhe Zheng, Bohao Li, Jian-Wei Zhang, Miles Yang, Zhao Zhong, Liefeng Bo, Xiangyu Yue

机构 * Tencent-Hunyuan(腾讯混元)

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究统一多模态模型潜在空间不匹配问题,提出Twins统一连续令牌空间。因联合建模有优化不平衡,采用焦点回归目标解决,在ImageNet上有gFID增益,在多模态理解基准测试中表现好,还提高了重建保真度。

Comments ICML 2026. Code: https://github.com/Tencent-Hunyuan/Twins

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20368 2026-07-27 cs.CV 版本更新 57%

Self Gradient Forcing: Native Long Video Extrapolation

自梯度强制:原生长视频外推

Junhao Zhuang, Shiyi Zhang, Yuxuan Bian, Yaowei Li, Yawen Luo, Yijun Liu, Weiyang Jin, Songchun Zhang, Xianglong He, Xuying Zhang, Haoran Li, Haoyang Huang, Zeyue Xue, Nan Duan

机构 * Joy Future Academy(京东探索研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对自回归视频扩散方法的历史上下文梯度差距问题,提出自梯度强制(SGF)两阶段训练策略,利用未来视频潜变量损失监督模型将上下文编码为有效因果记忆,在长视频外推实验中效果优于自强制。

Comments Project page: https://zhuang2002.github.io/SelfGradientForcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10135 2026-07-27 cs.CV cs.AI 版本更新 57%

BiWM: Advancing Open-Source Interactive Video World Models with Bidirectional Autoregression

BiWM:利用双向自回归推进开源交互式视频世界模型

Shaohao Rui, Xiaofeng Mao, Zhanyu Zhang, Peijia Lin, Yansong Zhu, Yibo Zhang, Haibin Wan, Zhangrui Zhao, Weijie Ma

机构 * LynnReal AI Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出BiWM框架,通过双向自回归范式将预训练视频骨干转化为交互式世界模型,仅需两阶段训练(微调+分布匹配蒸馏),支持多尺度模型和长程生成,优于现有因果流水线。

详情

展开后加载摘要…

URL PDF HTML 收藏