arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-22 至 2026-05-22 共收录 80 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 5 篇

2605.17602 2026-05-22 cs.AI cs.CV cs.LG 83%

AutoRubric-T2I: Robust Rule-Based Reward Model for Text-to-Image Alignment

AutoRubric-T2I: 一种用于文本到图像对齐的鲁棒基于规则的奖励模型

Kuei-Chun Kao, Daixuan Huo, Yuanhao Ban, Cho-Jui Hsieh

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出AutoRubric-T2I,一种首个用于文本到图像生成的规则学习框架,通过自动合成和选择显式规则来指导视觉语言模型(VLM)法官。该方法通过合成偏好对的推理轨迹生成候选规则,并利用VLM法官在每种规则下对配对图像进行评分,产生配对规则评分差异用于偏好学习。通过ℓ1正则化逻辑回归精简器去除噪声和冗余规则,从而在少量标注偏好数据下生成高质量、可解释的奖励信号,并在多个图像奖励基准测试中优于现有奖励模型基线。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22645 2026-05-22 cs.AI 78%

AtelierEval: Agentic Evaluation of Humans & LLMs as Text-to-Image Prompters

AtelierEval: 人类与LLM作为文本到图像提示器的代理评估

Hanjun Luo, Zhimu Huang, Sylvia Chung, Yiran Wang, Yingbin Jin, Jialin Li, Jiang Li, Xinfeng Li, Hanan Salam

机构 * New York University Abu Dhabi(纽约大学阿布扎克校区) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 文生图 :text-to-image(title,abstract)

AI总结 本文提出AtelierEval,首个统一基准,通过360个专家设计的任务量化提示能力,引入技能基于的记忆增强代理评估器,实现与人类专家的高相关性,验证了提示器在图像增强方向的优越性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22649 2026-05-22 cs.CV cs.LG 74%

From Baseline to Follow-Up: Counterfactual Spine DXA Image Synthesis in UK Biobank Using a Causal Hierarchical Variational Autoencoder

从基线到随访:利用因果层次变分自编码器在UK Biobank中生成脊柱DXA图像

Yilin Zhang, Nicholas C. Harvey, Nicholas R. Fuggle, Rahman Attar

机构 * School of Electronics and Computer Science(电子与计算机科学学院) University of Southampton(萨塞克斯大学) MRC Lifecourse Epidemiology Centre(英国医学研究理事会生命周期流行病学中心) University of Southampton, Southampton General Hospital(萨塞克斯大学索马塞特医院) Computer Science University of Southampton(计算机科学萨塞克斯大学)

专题命中 文生图 :image synthesis(title);分类 cs.CV

AI总结 本文提出了一种基于元数据的因果层次变分自编码器,用于在UK Biobank中生成一致的脊柱DXA图像,通过基线到随访的设置评估因果一致性,展示了年龄干预下关键椎体形态学变量的高一致性,支持了在解剖上合理的DXA图像合成。

Comments 7 pages, 4 figures, 3 tables. Accepted at the 48th Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21573 2026-05-22 cs.CV 74%

Lens: Rethinking Training Efficiency for Foundational Text-to-Image Models

Lens:重新思考基础文本到图像模型的训练效率

Dong Chen, Fangyun Wei, Ziyu Wan, Dongdong Chen, Jiawei Zhang, Jinjing Zhao, Sirui Zhang, Yang Yue, Zhiyang Liang, Baining Guo, Chong Luo, Jianmin Bao, Ji Li, Lei Shi, Qinhong Yang, Xiuyu Wu, Xuelu Feng, Yan Lu, Yanchen Dong, Yitong Wang, Yunuo Chen

机构 * Microsoft Lens Team(微软Lens团队)

专题命中 文生图 :text-to-image(title);分类 cs.CV

AI总结 本文提出Lens,一个具有38亿参数的文本到图像模型,在多种基准测试中表现与超过60亿参数的最新模型相当甚至更优,同时训练计算需求显著降低。通过最大化训练批次的数据信息密度和改进收敛速度的架构选择,实现了高效的训练和优化。

Comments Project Page: https://github.com/microsoft/Lens

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22061 2026-05-22 cs.CV 70%

Distributed Image Compression with Multimodal Side Information at Extremely Low Bitrates

分布式图像压缩与多模态侧信息在极低比特率下的应用

Guojun Xu, Mingyang Zhang, Jianwen Xiang, Cheng Tan, Yanchao Yang, Junwei Zhou

机构 * School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种多模态分布式图像压缩框架(MDIC),通过利用多模态侧信息在极低比特率下实现高质量图像重建,核心方法是引入文本到图像扩散解码器和特征掩码生成器,以提升全局感知质量和局部细节保留能力。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 2 篇

2602.01851 2026-05-22 cs.CV 79%

How Well Do Models Follow Visual Instructions? VIBE: A Systematic Benchmark for Visual Instruction-Driven Image Editing

模型能多好地遵循视觉指令?VIBE:一个系统性的视觉指令驱动图像编辑基准

Huanyu Zhang, Xuehai Bai, Chengzu Li, Chen Liang, Haochen Tian, Haodong Li, Ruichuan An, Yifan Zhang, Anna Korhonen, Zhang Zhang, Liang Wang, Tieniu Tan

机构 * School of Artificial Intelligence, University of Chinese Academy of Science(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) Peking University(北京大学) South China University of Technology(华南理工大学) Nanjing University(南京大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出VIBE基准,用于评估视觉指令驱动的图像编辑模型,通过三级交互层次评估指涉 grounding、形态操作和因果推理,并发现专有模型在早期阶段表现优异但随着任务难度增加性能下降。

Comments https://vibe-benchmark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22126 2026-05-22 cs.CV 57%

AesFormer: Transform Everyday Photos into Beautiful Memories

AesFormer: 将日常照片转化为美丽的记忆

Tianxiang Du, Hulingxiao He, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University, Beijing, China(王轩计算机技术研究所,北京大学,北京,中国)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出AesFormer框架,通过将审美规划与图像编辑解耦,改进照片的审美质量,同时保持主体身份和场景语义,构建了包含9071对严格对齐图像对的AesRecon基准数据集。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 60 篇

2605.21981 2026-05-22 cs.CV 90%

RiT: Vanilla Diffusion Transformers Suffice in Representation Space

RiT: vanilla diffusion transformers suffice in representation space

Le Zhang, Ning Mang, Aishwarya Agrawal

机构 * Mila – Québec AI Institute, UdeM(魁北克AI研究院,麦吉尔大学) Utrecht University(乌得勒支大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 扩散模型 :diffusion(title,title_cn);分类 cs.CV

AI总结 该研究探讨了在表示空间中使用vanilla diffusion transformers进行图像生成的有效性,发现通过预训练的表示空间能够更有效地进行流匹配学习,从而在ImageNet数据集上取得了优于DiT-DH-XL的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22717 2026-05-22 cs.SD cs.AI cs.LG cs.MM 87%

Live Music Diffusion Models: Efficient Fine-Tuning and Post-Training of Interactive Diffusion Music Generators

实时音乐扩散模型:交互式音乐生成扩散模型的高效微调与后训练

Zachary Novack, Stephen Brade, Haven Kim, Hugo Flores García, Nithya Shikarpur, Chinmay Talegaonkar, Suwan Kim, Valerie K. Chen, Julian McAuley, Taylor Berg-Kirkpatrick, Cheng-Zhi Anna Huang

机构 * UC San Diego(加州大学圣迭戈分校) MIT(麻省理工学院) Adobe(Adobe公司)

专题命中 扩散模型 :diffusion(title,summary_cn);分类 cs.MM

AI总结 本文研究了音频扩散模型能否通过块级KV缓存高效地转化为交互式模型,从而在消费级硬件上实现。提出的Live Music Diffusion Models (LMDMs)通过块级KV缓存恢复并超越了离散Live Music Models (LMMs)的推理复杂度,并通过ARC-Forcing范式实现稳定的后训练对齐,从而在无需显式RL或奖励模型的情况下减少误差累积。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02112 2026-05-22 cs.LG cs.AI cs.CL 87%

Unifying Masked Diffusion Models with Various Generation Orders and Beyond

统一多种生成顺序及超越的掩码扩散模型

Chunsan Hong, Sanghyun Lee, Jong Chul Ye

机构 * Graduate School of AI, KAIST, South Korea(韩国延世大学人工智能研究生院)

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 本文提出Order-Expressive Masked Diffusion Model (OeMDM)和Learnable-Order Masked Diffusion Model (LoMDM),统一了不同生成顺序的扩散生成过程,并通过单目标学习生成顺序和扩散骨干,提升了文本生成性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22668 2026-05-22 cs.CV 85%

SEGA: Spectral-Energy Guided Attention for Resolution Extrapolation in Diffusion Transformers

SEGA:用于扩散变换器中分辨率外推的频谱-能量引导注意力

Javad Rajabi, Kimia Shaban, Koorosh Roohi, David B. Lindell, Babak Taati

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 SEGA通过动态调整注意力权重来提升扩散变换器在高分辨率生成中的表现,其核心方法是根据潜在空间的频谱结构调整RoPE组件的注意力缩放,从而在保持全局结构和恢复细节方面取得平衡。

Comments 27 pages, 14 figures. Project page: https://rajabi2001.github.io/sega/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22011 2026-05-22 cs.CV 83%

Rethinking Token Reduction for Diffusion Models via Output-Similarity-Awareness

重新思考扩散模型的token减少:通过输出相似性意识

Hangyeol Lee, Hyojeong Lee, Joo-Young Kim

机构 * KAIST(韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出DiTo,一种基于输出中心的token减少方法,通过利用相邻时间步的输出相似性来建立token对应关系,从而减少计算复杂度并提高生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11246 2026-05-22 cs.LG 82%

Support-Proximity Augmented Diffusion Estimation for Offline Black-Box Optimization

支持接近增强的扩散估计用于离线黑盒优化

Yonghan Yang, Ye Yuan, Zipeng Sun, Linfeng Du, Bowei He, Haolun Wu, Can Chen, Xue Liu

机构 * MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(MBZUAI - 摩擦 bin Zayed 大学) McGill University(麦吉尔大学) Mila - Quebec AI Institute(Mila - 加拿大AI研究所) Amazon AGI(亚马逊人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出SPADE框架,通过条件生成建模重新想象前向替代建模,利用扩散模型建模前向似然p(y|x),并引入校准扩散估计模块和支撑接近正则化机制,以提高优化性能。

Comments Accepted by ICML 2026. First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21911 2026-05-22 cs.LG 82%

Noise Schedule Design for Diffusion Models: An Optimal Control Perspective

扩散模型的噪声调度设计:一个最优控制视角

Seo Taek Kong, Weina Wang, R. Srikant

机构 * ECE & CSL University of Illinois Urbana-Champaign(电子工程与计算机科学实验室,伊利诺伊大学厄巴纳-香槟分校) Computer Science Department Carnegie Mellon University(计算机科学系,卡内基梅隆大学) ECE, CSL & NCSA University of Illinois Urbana-Champaign(电子工程、计算机科学实验室及国家计算科学中心,伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文从最优控制的角度出发,提出了一种分析和设计扩散模型噪声调度的框架,通过将噪声调度问题转化为最优控制问题,推导出噪声调度的充分条件,实现了更优的采样误差,并通过参数调整得到新的噪声调度方案,提升了图像生成的FID分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16077 2026-05-22 cs.LG 82%

MDM-Prime-v2: Binary Encoding and Index Shuffling Enable Scaling of Diffusion Language Models

MDM-Prime-v2:二进制编码和索引洗牌使扩散语言模型能够扩展

Chen-Hao Chao, Wei-Fang Sun, Junwei Quan, Chun-Yi Lee, Rahul G. Krishnan

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) NVIDIA AI Technology Center(NVIDIA AI技术中心) National Taiwan University(国立台湾大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出MDM-Prime-v2,通过二进制编码和索引洗牌技术改进扩散语言模型,解决了子分词器功能形式与BPE分词器结合导致的交叉熵损失增加以及子分词器粒度超参数选择缺乏工具的问题,从而提升了模型在常识推理基准上的零样本准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18159 2026-05-22 cs.LG 82%

Bringing Stability to Diffusion: Decomposing and Reducing Variance of Training Masked Diffusion Models

为扩散模型带来稳定性:分解和减少训练掩码扩散模型的方差

Mengni Jia, Mengyu Zhou, Yihao Liu, Xiaoxi Jiang, Guanjun Jiang

机构 * University of Cambridge(剑桥大学) Peking University(北京大学) Qwen Large Model Application Team, Alibaba(阿里巴巴通义大模型应用团队)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了掩码扩散模型(MDMs)训练方差高导致不稳定的问题,通过分解方差来源并提出六种方差减少方法,显著提升了模型在复杂推理任务中的准确率,并将运行间变异性降低至自回归模型(ARMs)水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04938 2026-05-22 cs.CV cs.AI cs.LG 81%

Improved DDIM Sampling with Moment Matching Gaussian Mixtures

改进的DDIM采样与矩匹配高斯混合模型

Prasad Gabbur

机构 * Independent Researcher(独立研究者) Apple(苹果公司)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出在DDIM框架中使用高斯混合模型作为反向转换操作符,通过约束GMM参数匹配DDPM前向边缘的矩,从而在少量采样步骤下提升生成样本质量,实验表明GMM核在FID和IS指标上优于传统高斯核。

Comments 34 pages, 12 figures; Accepted to TMLR; Code open sourced

Journal ref Transactions on Machine Learning Research, 05/2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22344 2026-05-22 cs.CV cs.AI cs.MM 81%

Bernini: Latent Semantic Planning for Video Diffusion

Bernini: 视频扩散中的潜在语义规划

Bernini Team, Chenchen Liu, Junyi Chen, Lei Li, Lu Chi, Mingzhen Sun, Zhuoying Li, Yi Fu, Ruoyu Guo, Yiheng Wu, Ge Bai, Zehuan Yuan

机构 * Bernini Team(伯尼尼团队)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出Bernini框架,通过将大规模多模态语言模型用于语义规划,扩散模型用于像素生成,实现了视频生成与编辑的统一方法,提升了编辑任务的泛化能力。

Comments Project Page: https://bernini-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22420 2026-05-22 cs.CV cs.AI cs.RO 79%

Diffusion-guided Generalizable Enhancer for Urban Scene Reconstruction

基于扩散的通用增强器用于城市场景重建

Henry Che, Jingkang Wang, Yun Chen, Ze Yang, Sivabalan Manivasagam, Raquel Urtasun

机构 * Waabi University of Toronto(多伦多大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GenRe,一种基于扩散的通用增强器,用于城市场景重建,通过学习不同场景中的生成先验,高效地生成稳健且高保真的表示,能够可靠地泛化到挑战性的未见过的视角,从而在自动驾驶中实现鲁棒和可扩展的传感器模拟。

Comments ICRA 2026. Project page: https://waabi.ai/genre

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22311 2026-05-22 cs.CV 79%

PIU: Proximity-guided Identity Unlearning in ID-Conditioned Diffusion Models

PIU:基于接近性的身份去学习在ID条件化的扩散模型中

Jose Edgar Hernandez Cancino Estrada, Mauro Díaz Lupone, Žiga Emeršič, Vitomir Štruc, Peter Peer, Darian Tomašević

机构 * University of Ljubljana, Faculty of Computer and Information Science(卢布尔雅那大学计算机与信息科学系) University of Ljubljana, Faculty of Electrical Engineering(卢布尔雅那大学电子工程系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了在ID条件化的扩散模型中身份去学习的问题,提出了一种基于接近性的身份去学习框架PIU,通过在学习的身份空间中重新分配源身份到选定的锚身份来实现身份移除,并结合基于ArcFace表示几何的锚点选择策略,通过局部微调少量身份敏感的交叉注意力层实现有效的去学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22017 2026-05-22 cs.CV 79%

Diverse Yet Consistent: Context-Guided Diffusion with Energy-Based Joint Refinement for Multi-Agent Motion Prediction

多样且一致:基于能量的联合细化的上下文引导扩散用于多智能体运动预测

Lei Chu, Yuhuan Zhao

机构 * University of Southern California(南加州大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于扩散的框架,通过利用历史轨迹中的丰富上下文信息来改进多智能体运动预测,通过引导机制增强预测动作的多样性和表达性,并引入基于能量的公式来细化联合轨迹分布,同时保持个体轨迹的合理性,实验表明该方法在多个基准数据集上均优于现有方法。

Comments MEIS-- CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22015 2026-05-22 cs.CV cs.AR 79%

ORBIS: Output-Guided Token Reduction with Distribution-Aware Matching for Video Diffusion Acceleration

ORBIS: 通过分布感知匹配的输出引导标记减少以加速视频扩散

Hangyeol Lee, Joo-Young Kim

机构 * KAIST(韩国科学技术院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ORBIS,一种针对视频扩散Transformer的SW-HW协同设计加速器,通过利用前一时间步的输出激活获得更准确的token相似性,从而提高匹配质量并实现更高的标记减少比例,同时引入分布感知标记匹配算法和专用硬件设计,实现比现有方法更高的标记减少率、更快的速度和更低的能耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21907 2026-05-22 cs.CV 79%

Guided Trajectory Optimization with Sparse Scaling for Test-Time Diffusion

引导轨迹优化与稀疏缩放用于测试时间扩散

Gang Dai, Yining Huang, Yiming Xia, Guohao Chen, Shuaicheng Niu

机构 * Guangdong University of Technology(广东工业大学) South China University of Technology(华南理工大学) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出RTS方法,通过奖励引导的噪声优化策略和稀疏测试时间缩放框架,提升扩散模型的生成性能,实验表明在GenEval和ImageReward指标上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21661 2026-05-22 cs.LG cs.AI cs.CV 79%

Hierarchical Variational Policies for Reward-Guided Diffusion

分层变分策略用于奖励引导的扩散

Kushagra Pandey, Farrin Marouf Sofian, Jan Niklas Groeneveld, Felix Draxler, Stephan Mandt

机构 * Department of Computer Science(计算机科学系) University of California Irvine(加州大学伊文斯顿分校)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种分层变分模型框架,通过将控制信息压缩到轻量级且表达能力强的随机策略中,实现了在降低推理成本的同时生成高质量的奖励对齐样本,该方法在4倍超分辨率任务中实现了比现有最佳基线快5倍的推理速度并具有更好的感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17837 2026-05-22 cs.CV cs.AI 79%

Temporal Aware Pruning for Efficient Diffusion-based Video Generation

具有时间意识的剪枝用于高效扩散式视频生成

Sheng Li, Yang Sui, Junhao Ran, Bo Yuan, Yue Dai, Xulong Tang

机构 * University of Pittsburgh(匹兹堡大学) Illinois Institute of Technology(伊利诺伊理工学院) Rutgers University(罗格斯大学) Rice University(Rice大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出TAPE,一种无需训练的时间感知剪枝方法,用于高效扩散式视频生成,通过时间平滑、层内token重选和时间步预算调度,提升生成效率并保持高质量视觉效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16579 2026-05-22 cs.CV cs.LG 79%

Attend Locally, Remember Linearly: Linear Attention as Cross-Frame Memory for Autoregressive Video Diffusion

局部关注,线性记忆:线性注意力作为跨帧记忆用于自回归视频扩散

Kunyang Li, Mubarak Shah, Yuzhang Shang

机构 * Institute of Artificial Intelligence, University of Central Florida(中央佛罗里达大学人工智能研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种名为ARL2的混合注意力模块,通过将二次跨帧注意力替换为固定大小的递归状态,解决了自回归视频扩散模型在长视频生成中的可扩展性瓶颈问题,实现了线性时间复杂度和常数内存消耗,同时提升了时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22776 2026-05-22 cs.LG cs.AI stat.CO stat.ML 78%

SDPM: Survival Diffusion Probabilistic Model for Continuous-Time Survival Analysis

SDPM:用于连续时间生存分析的生存扩散概率模型

Stanislav R. Kirpichenko, Andrei V. Konstantinov, Lev V. Utkin

机构 * Peter the Great St.Petersburg Polytechnic University(彼得大帝圣彼得堡国立大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出SDPM,一种用于连续时间生存分析的生成模型,通过去噪扩散模型建模生存结果的条件分布,避免了对事件时间分布的参数假设,并在变换的目标空间中使用标准化对数时间和连续高斯混合表示来表示删失指示符,从而在多个真实生存数据集上取得了竞争力的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22765 2026-05-22 cs.LG stat.ML 78%

Uniform Diffusion Models Revisited: Leave-One-Out Denoiser and Absorbing State Reformulation

统一扩散模型再审视:留一法去噪器和吸收状态重述

Samson Gourevitch, Yazid Janati, Dario Shariatian, Umut Simsekli, Eric Moulines, Eric P. Xing, Alain Durmus

机构 * CMAP, Ecole polytechnique(巴黎高等学院CMAP实验室) Institute of Foundation Models(基础模型研究所) Inria, PSL Research University(法国国家信息与自动化研究所) MBZUAI(马尔科姆·布罗德本特大学人工智能研究所) EPITA, LRE(EPITA实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了统一扩散模型中去噪后验与留一法后验之间的不匹配问题,并通过改进的参数化和采样方法提升了模型性能。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22596 2026-05-22 cs.LG 78%

Factored Diffusion Policies:Compositionally Generalized Robot Control with a Single Score Network

因子扩散策略:一种单一分数网络的组成通用机器人控制

Sayan Mitra, Ege Yuceel, Noah Giles, Abhishek Pai

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种因子扩散策略,通过单一共享的扩散网络实现通用机器人控制,该网络在推理时能将分数分解为各因子的加法形式,从而在训练任务预算上从因子基数的乘积减少到求和,通过轨迹管证书将分数界转化为闭环状态轨迹管,实验验证了其泛化界和证书的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22541 2026-05-22 astro-ph.GA 78%

Probing the ion-neutral drift velocity towards the L1544 prestellar core: Detection of ambipolar diffusion using N$_2$D$^+$ and para-NH$_2$D

探测L1544原恒星核心中离子-中性粒子漂移速度:利用N₂D⁺和反丁基氨D检测偶极扩散

Doris Arzoumanian, Silvia Spezzano, Tommaso Grassi, Paola Caselli, Yusuke Tsukamoto, Haruka Fukihara, Yoshiaki Misugi, Felipe Alves, Jaime Pineda, Sigurd Jensen, Elena Redaelli, Alexei Ivlev

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究通过观测L1544原恒星核心中的N₂D⁺离子和para-NH₂D中性物种,探测离子-中性粒子的漂移速度差异,从而检测偶极扩散现象,并探讨尘埃颗粒生长对偶极电阻和密集核心动态演化的影响。

Comments Accepted for publication in Astronomy & Astrophysics

详情

展开后加载摘要…

URL PDF HTML 收藏