arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-11 至 2026-05-11 共收录 98 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 4 篇

2605.08043 2026-05-11 cs.CV cs.AI 83%

SCOPE: Structured Decomposition and Conditional Skill Orchestration for Complex Image Generation

SCOPE:结构分解与条件技能协调用于复杂图像生成

Tianfei Ren, Zhipeng Yan, Yiming Zhao, Zhen Fang, Yu Zeng, Guohui Zhang, Hang Xu, Xiaoxiao Ma, Shiting Huang, Ke Xu, Wenxuan Huang, Lionel Z. Wang, Lin Chen, Zehui Chen, Jie Huang, Feng Zhao

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知 MOE 实验室,中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出SCOPE框架,通过结构化规范和条件技能协调解决复杂图像生成中语义承诺的持续跟踪问题,通过Gen-Arena基准验证其有效性,取得优于基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07414 2026-05-11 cs.MA cs.AI cs.CR 78%

OrchJail: Jailbreaking Tool-Calling Text-to-Image Agents by Orchestration-Guided Fuzzing

OrchJail:通过协调引导的模糊测试对工具调用文本到图像代理进行劫持

Jianming Chen, Yawen Wang, Junjie Wang, Zhe Liu, Qing Wang, Fanjiang Xu

机构 * Institute of Software, Chinese Academy of Sciences, Beijing, China Science \& Technology on Integrated Information System Laboratory, Beijing, China State Key Laboratory of Complex System Modeling University of Chinese Academy of Sciences, Beijing, China

专题命中 文生图 :text-to-image(title,abstract)

AI总结 研究提出OrchJail框架,通过协调引导的模糊测试方法提升对工具调用文本到图像代理的劫持效果,实现更高的攻击成功率和图像质量,同时降低查询成本。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07230 2026-05-11 cs.CV cs.AI 77%

CASCADE: Context-Aware Relaxation for Speculative Image Decoding

CASCADE:基于上下文的放松方法用于推测图像解码

Selin Yildirim, Subhajit Dutta Chowdhury, Mohammad Mahdi Kamani, Vikram Appia, Deming Chen

机构 * AMD(AMD公司)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出CASCADE方法,通过捕捉目标模型隐藏状态中的冗余性,在不额外训练的情况下实现接受放松,提升推测解码效率,实验表明在多模态模型中达到3.6倍加速,保持图像质量和提示一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04676 2026-05-11 cs.CV cs.AI 57%

Decoding the Pulse of Reasoning VLMs in Multi-Image Understanding Tasks

解码多图像理解任务中推理视觉语言模型的脉冲

Chenjun Li

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出PulseFocus方法,通过规划和聚焦块结构及软注意力门控,提升多图像推理任务性能,实现在BLINK和MuirBench上分别提升3.7%和1.07%。

Comments This article is withdrawn because the experimental results and analysis require substantial revision. The current version should not be cited as a reliable representation of the work

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 7 篇

2605.07455 2026-05-11 cs.CV 83%

EditTransfer++: Toward Faithful and Efficient Visual-Prompt-Guided Image Editing

EditTransfer++:迈向精确且高效的视觉提示引导图像编辑

Lan Chen, Qi Mao, Yiren Song, Yuchao Gu, Siwei Ma

机构 * School of Information and Communication Engineering and the State Key Laboratory of Media Convergence and Communication, Communication University of China(信息与通信工程学院和媒体融合与通信国家重点实验室,中国传媒大学) ShowLab, National University of Singapore(新加坡国立大学ShowLab)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 EditTransfer++通过渐进式结构训练和高效条件方案提升视觉提示的准确性与推理效率,结合文本解耦训练和对比细化机制,实现更稳定的图像编辑效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07940 2026-05-11 cs.CV 79%

Delta-Adapter: Scalable Exemplar-Based Image Editing with Single-Pair Supervision

Delta-Adapter:基于单对监督的可扩展示例图像编辑

Jiacheng Chen, Songze Li, Han Fu, Baoquan Zhao, Wei Liu, Yanyan Liang, Li Qing, Xudong Mao

机构 * Sun Yat-sen University(中山大学) Video Rebirth Macau University of Science and Technology(澳门科技大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 Delta-Adapter通过单对监督学习可迁移的编辑语义,利用预训练视觉编码器提取语义差异,并通过Perceiver-based适配器注入图像编辑模型,提升编辑准确性和内容一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07477 2026-05-11 cs.CV 79%

ReasonEdit: Towards Interpretable Image Editing Evaluation via Reinforcement Learning

ReasonEdit:通过强化学习实现可解释图像编辑评估

Honghua Chen, Zitong Xu, Huiyu Duan, Xinyun Zhang, Xiongkuo Min, Guangtao Zhai

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出ReasonEdit,通过引入ReasonEdit-22K数据集和RE-Reward模型,训练出可解释的图像编辑评估模型,提升评估的可解释性和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07457 2026-05-11 cs.CV 79%

EditRefiner: A Human-Aligned Agentic Framework for Image Editing Refinement

EditRefiner:一种对齐人类的代理框架用于图像编辑细化

Zitong Xu, Huiyu Duan, Yifei Nie, Mingda Du, Sijing Wu, Xiongkuo Min, Tianyi Zheng, Jian Zhang, Shusong Xu, Jinwei Chen, Bo Li, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Vivo Mobile Communication Co., Ltd(Vivo移动通信有限公司) University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出EditRefiner,一种对齐人类的代理框架,通过人类反馈数据集改进图像编辑的细粒度问题,通过感知-推理-行动-评估循环提升编辑质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01586 2026-05-11 cs.CV 79%

InterCoG: Towards Spatially Precise Image Editing with Interleaved Chain-of-Grounding Reasoning

InterCoG:迈向空间精确图像编辑的交错链式 grounding 推理

Yecong Wan, Fan Li, Chunwei Wang, Hao Wu, Mingwen Shao, Wangmeng Zuo

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Zhengzhou Advanced Research Institute of Harbin Institute of Technology(哈尔滨工业大学郑州先进研究院) Huawei Noah’s Ark Lab(华为诺亚实验室) Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳先进技术大学人工智能研究院)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出InterCoG框架,通过文本与视觉的交错链式推理实现复杂场景中精细图像编辑,结合文本空间关系和视觉定位提升编辑精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07767 2026-05-11 cs.CV 57%

SIMI: Self-information Mining Network for Low-light Image Enhancement

Xuanshuo Fu, Lei Kang, Javier Vazquez-Corral

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 在低光环境下,图像质量受到严重影响,给图像编辑和可视化带来挑战。本文提出了一种名为SIMI的自信息挖掘网络,该网络基于位平面分解技术,无需外部数据即可从低光图像中挖掘内在信息,实现了高效的无监督增强。该方法不仅加快了模型收敛速度,降低了计算开销,还在标准基准测试中取得了当前最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19974 2026-05-11 cs.CV 57%

RL-RIG: A Generative Spatial Reasoner via Intrinsic Reflection

基于内在反思的生成式空间推理器:RL-RIG

Tianyu Wang, Zhiyuan Ma, Qian Wang, Xinyi Zhang, Xinwei Long, Bowen Zhou

机构 * Zhiyuan College, Shanghai Jiao Tong University(上海交通大学紫元学院) Huazhong University of Science and Technology(华中科技大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 图像编辑 :image generation(abstract);分类 cs.CV

AI总结 RL-RIG通过生成-反思-编辑范式,提升图像生成的精细空间关系捕捉能力,采用Scene Graph IoU和VLM评估策略,在空间一致性上优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 70 篇

2605.07503 2026-05-11 cs.CV 90%

Diffusion-APO: Trajectory-Aware Direct Preference Alignment for Video Diffusion Transformers

Diffusion-APO:基于轨迹的直接偏好对齐用于视频扩散变换器

Jingyuan Zhu, Biaolong Chen, Le Zhang, Aixi Zhang, Hao Jiang, Pipei Huang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(title,title_cn);分类 cs.CV

AI总结 本文提出Diffusion-APO,通过同步训练噪声与推理时的去噪路径,解决视频扩散模型与人类意图对齐的问题,采用统一的RLHF框架实现灵活的多阶段偏好对齐,提升视觉质量和指令遵循性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14186 2026-05-11 cs.CV 87%

Setting-Matched and Semantics-Scaled Benchmarking of One-Step Generative Models Against Multistep Diffusion and Flow Models

一步生成模型与多步扩散和流模型的匹配与语义缩放基准测试

Advaith Ravishankar, Serena Liu, Mingyang Wang, Todd Zhou, Jeffrey Zhou, Arnav Sharma, Ziling Hu, Léopold Das, Abdulaziz Sobirov, Faizaan Siddique, Freddy Yu, Seungjoo Baek, Yan Luo, Mengyu Wang

机构 * Harvard AI and Robotics Lab(哈佛人工智能与机器人实验室)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文通过ImageNet验证集、ImageNetV2和reLAIONet数据集,评估了八种模型在类条件协议下的性能,发现FID和CFG选择在少步情况下可能误导,引入csFID、psFID等指标以诊断语义对齐的图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07973 2026-05-11 cs.CV 85%

HEART: Hyperspherical Embedding Alignment via Kent-Representation Traversal in Diffusion Models

HEART:通过扩散模型中的Kent表示遍历实现超球面嵌入对齐

Arani Roy, Shristi Das Biswas, Kaushik Roy

机构 * Purdue University(普渡大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出HEART框架,通过超球面几何对齐实现图像生成中的直观精确编辑,无需微调或优化,提升控制精度与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06699 2026-05-11 eess.IV cs.AI cs.CV cs.LG 83%

Multimodal synthesis of MRI and tabular data with diffusion in a joint latent space via cross-attention

通过交叉注意力在联合潜在空间中利用扩散模型进行MRI和表格数据的多模态合成

Daniel Mensing, Jan Kapar, Jochen G. Hirsch, Matthias Günther, Horst Hahn, Marvin N. Wright

机构 * Fraunhofer Institute for Digital Medicine MEVIS(弗劳恩霍夫数字医学研究所MEVIS) Leibniz Institute for Prevention Research and Epidemiology – BIPS(莱比锡预防研究与流行病学研究所 – BIPS) Faculty of Mathematics and Computer Science, University of Bremen(不莱梅大学数学与计算机科学学院) Faculty of Physics and Electrical Engineering, University of Bremen(不莱梅大学物理与电气工程学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出了一种多模态潜在扩散模型,通过交叉注意力在共享潜在空间中联合生成MRI和临床表格数据,验证了在单一扩散框架中联合建模MRI和混合类型表格数据的可行性。

Journal ref Proc. SPIE 13925, Medical Imaging 2026: Image Processing, 139252D (April 03, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07456 2026-05-11 cs.LG 82%

Inference-Time Attribute Distribution Alignment for Unconditional Diffusion

推理时属性分布对齐用于无条件扩散

Hao Luan, See-Kiong Ng, Chun Kai Ling

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文提出在推理时对齐属性分布的方法,通过最优控制问题优化扩散过程,实现更灵活的属性分布对齐,无需重新训练模型。

Comments Preprint. 35 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07571 2026-05-11 q-fin.CP q-fin.MF 82%

Forecasting implied volatility surface with generative diffusion models

用生成扩散模型预测无套利隐含波动率面

Chen Jin, Ankush Agarwal

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于扩散概率模型的生成模型,通过条件化市场变量预测无套利隐含波动率面,采用信号噪声比无参数加权方案解决训练数据中的套利问题,实验显示其在波动率预测上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08044 2026-05-11 cs.CL cs.AI cs.LG 80%

Fast Byte Latent Transformer

快速字节潜在变换器

Julie Kallini, Artidoro Pagnoni, Tomasz Limisiewicz, Gargi Ghosh, Luke Zettlemoyer, Christopher Potts, Xiaochuang Han, Srinivasan Iyer

机构 * FAIR at Meta(Meta的FAIR) Stanford University(斯坦福大学) University of Washington(华盛顿大学)

专题命中 扩散模型 :diffusion(summary_cn,abstract)

AI总结 本文提出BLT Diffusion和BLT Self-speculation等方法,通过并行生成和验证步骤提升字节级语言模型的生成速度和质量,降低内存带宽消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08054 2026-05-11 cs.CV 79%

Towards Highly-Constrained Human Motion Generation with Retrieval-Guided Diffusion Noise Optimization

面向高约束人类动作生成的检索引导扩散噪声优化

Hanchao Liu, Fang-Lue Zhang, Shining Zhang, Tai-Jiang Mu, Shi-Min Hu

机构 * Tsinghua University(清华大学) University of New South Wales(新南威尔士大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于无训练扩散噪声优化框架的检索引导方法,通过关系任务解析和奖励引导掩码优化,解决高约束下的动作生成问题,提升虚拟代理行为合成能力。

Comments Accepted to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07915 2026-05-11 cs.CV 79%

What Matters for Diffusion-Friendly Latent Manifold? Prior-Aligned Autoencoders for Latent Diffusion

潜在扩散 manifold 中什么因素重要?面向潜在扩散的先验对齐自编码器

Zhengrong Yue, Taihang Hu, Mengting Chen, Haiyu Zhang, Zihao Pan, Tao Liu, Zikang Wang, Jinsong Lan, Xiaoyong Zhu, Bo Zheng, Yali Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Beihang University(北航) Sun Yat-sen University(中山大学) Nankai University(南开大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究潜在 manifold 组织对扩散模型生成质量的影响,提出 PAE 显式构建潜在 manifold,提升训练效率和生成质量,达到新状态的 gFID 1.03。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02129 2026-05-11 cs.CV 79%

VDEGaussian: Video Diffusion Enhanced 4D Gaussian Splatting for Dynamic Urban Scenes Modeling

VDEGaussian:基于视频扩散的4D高斯点云用于动态城市场景建模

Yuru Xiao, Zihan Lin, Chao Lu, Deming Zhai, Kui Jiang, Wenbo Zhao, Wei Zhang, Junjun Jiang, Huanran Wang, Xianming Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种结合视频扩散的4D高斯点云方法,解决动态场景建模中快速移动物体建模难题,通过时间一致性先验和不确定性蒸馏提升新型视角合成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06924 2026-05-11 cs.CV cs.AI 79%

A$^2$RD: Agentic Autoregressive Diffusion for Long Video Consistency

A$^2$RD:基于代理的自回归扩散用于长视频一致性

Do Xuan Long, Yale Song, Min-Yen Kan, Tomas Pfister, Long T. Le

机构 * Google Cloud AI Research(谷歌云人工智能研究)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 A$^2$RD通过Retrieve-Synthesize-Refine-Update循环实现长视频一致性合成,提升视频生成的连贯性和叙事一致性。

Comments Project page: http://dxlong2000.github.io/AARD

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06892 2026-05-11 cs.CV 79%

Not All Tokens Need 40 Steps: Heterogeneous Step Allocation in Diffusion Transformers for Efficient Video Generation

并非所有标记都需要40步:扩散变换器中的异质步分配用于高效视频生成

Ernie Chu, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HSA算法,通过根据速度动态分配不同时间空间标记的步数预算,提升视频生成效率,实验表明在加速运行时表现优于现有方法。

Comments Project page: https://ernestchu.github.io/hsa

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06829 2026-05-11 cs.LG cs.CV cs.ET cs.IT cs.NE math.IT 79%

A Unified Measure-Theoretic View of Diffusion, Score-Based, and Flow Matching Generative Models

扩散、基于分数的和流匹配生成模型的统一测度论观点

Aditya Ranganath, Mukesh Singhal

机构 * Center for Applied Scientific Computing(应用科学计算中心) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) University of California Merced(加州默塞德大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文从测度论角度统一了扩散、基于分数和流匹配生成模型,探讨了时间依赖向量场诱导的边缘分布,并分析了采样、稳定性和计算的权衡。

Comments 62 pages, 1 figure, jmlr preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06169 2026-05-11 cs.LG cs.CV 79%

Mean Mode Screaming: Mean--Variance Split Residuals for 1000-Layer Diffusion Transformers

均值模式尖叫:用于1000层扩散变换器的均值-方差分割残差

Pengqi Lu

机构 * Beijing, China(中国北京)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出均值-方差分割残差,解决扩散变换器在数百层时出现的均值主导崩溃问题,通过分割残差更新和泄漏主干均值替换,使模型在极端深度下保持稳定训练。

Comments 43 pages (9-page main paper + appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13837 2026-05-11 cs.CV 79%

A Causal Diffusion Model for Video Reconstruction from Ultra-Low-Bitrate Representations

一种用于从超低比特率表示中重建视频的因果扩散模型

Cem Eteke, Batuhan Tosun, Martin Piccolrovazzi, Alexander Griessel, Wolfgang Kellerer, Eckehard Steinbach

机构 * Chair of Media Technology(媒体技术系) Chair of Communication Networks(通信网络系) Munich Institute of Robotics and Machine Intelligence(慕尼黑机器人与智能机械研究所) School of Computation Information and Technology, Technical University of Munich(计算信息与技术学院,慕尼黑技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种因果扩散模型,用于从超低比特率语义和高度压缩帧中重建视频,通过联合建模互补信息,提升重建质量,优于传统、神经、生成和语义基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16748 2026-05-11 cs.CV 79%

Multimodal Diffusion Transformer with Memory Bank for Scalable Long-Duration Talking Video Generation

具有内存库的多模态扩散变换器用于可扩展的长时谈话视频生成

Haojie Zhang, Zhihao Liang, Ruibo Fu, Bingyan Liu, Zhengqi Wen, Xuefei Liu, Jianhua Tao, Yaling Liang

机构 * South China University of Technology(南方科技大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing National Research Center for Information Science and Technology, Tsinghua University(北京信息科学研究中心,清华大学) Department of Automation, BNRist, Tsinghua University(清华大学自动化系,北京信息科学研究中心)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出 LetsTalk 框架,通过多模态指导和内存库机制解决长时谈话视频生成中的质量、一致性、时间连贯性和计算效率问题,实验表明其在生成质量和效率上达到新水平。

Comments 16 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07969 2026-05-11 cs.LG cs.IT math.IT 78%

When Diffusion Model Can Ignore Dimension: An Entropy-Based Theory

扩散模型可以忽略维度:基于熵的理论

Ahmad Aghapour, Erhan Bayraktar

机构 * Department of Mathematics, University of Michigan(数学系,密歇根大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文从信息论角度探讨扩散采样收敛性,证明高维数据下采样效率由潜在表示熵决定,而非环境维度,为高维空间高效采样提供理论支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07933 2026-05-11 cs.CL 78%

How to Train Your Latent Diffusion Language Model Jointly With the Latent Space

如何与潜在空间联合训练潜在扩散语言模型

Viacheslav Meshchaninov, Alexander Shabalin, Egor Chimbulatov, Nikita Gushchin, Ilya Koziev, Alexander Korotin, Dmitry Vetrov

机构 * Constructor University(Constructor大学) HSE University(莫斯科国立高等经济大学) Applied AI Institute(应用人工智能研究所) AXXX Independent researcher(独立研究者)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出联合训练潜在扩散语言模型,通过重塑预训练语言模型的表示构建潜在空间,提升生成性能并加快速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07748 2026-05-11 cs.CL 78%

TextLDM: Language Modeling with Continuous Latent Diffusion

TextLDM:基于连续潜在扩散的语言建模

Jiaxiu Jiang, Jingjing Ren, Wenbo Li, Bo Wang, Haoze Sun, Yijun Yang, Jianhui Liu, Yanbing Zhang, Shenghe Zheng, Yuan Zhang, Haoyang Huang, Nan Duan, Wangmeng Zuo

机构 * Joy Future Academy(京东探索研究院) HIT(Harbin Institute of Technology) HKUST(GZ)(Hong Kong University of Science and Technology (Guangzhou))

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 TextLDM将视觉潜在扩散框架应用于文本生成,通过Representation Alignment提升文本表示质量,在OpenWebText2上训练后优于现有扩散语言模型,匹配GPT-2性能。

详情

展开后加载摘要…

URL PDF HTML 收藏