arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1655 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 1274 篇

2503.17657 2026-07-21 cs.CV 版本更新 83%

Improving Diffusion Generative Models via Truncated Karhunen--Loève Expansion

通过截断卡尔胡宁-勒夫展开改进扩散生成模型

Yumeng Ren, Yaofang Liu, Aitor Artola, Laurent Mertz, Raymond H. Chan, Jean-michel Morel

机构 * City University of Hong Kong(香港城市大学) Lingnan University of Hong Kong(香港理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究预训练扩散模型训练-采样不匹配问题,提出基于截断卡尔胡宁-勒夫展开的无训练采样策略,通过相应方程实现,无需修改网络架构,在多数据集上改进预训练模型,加快收敛并降低生成误差。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00927 2026-07-16 cs.CV cs.AI 版本更新 83%

Post-Training Pruning for Diffusion Transformers

扩散变换器的训练后剪枝

Chengzhi Hu, Xuewen Liu, Jing Zhang, Mengjuan Chen, Zhikai Li, Qingyi Gu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 针对扩散变换器(DiTs)计算开销大的问题,提出DiT-Pruning方法,通过能量感知的显著性度量与聚类感知的剪枝粒度,在50%稀疏度下仅损失0.001 CLIP分数。

Comments 15 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05981 2026-07-16 cs.CV cs.LG 版本更新 83%

Inverting the Streaming-Diffusion Bottleneck: Video-Rate MLLM-Conditioned Edit Diffusion on a Consumer GPU

基于视觉感知的多模态大语言模型条件编辑扩散的视频率流式风格化:蒸馏UNet + MLLM文本编码器上的非对称批处理推理

Yoshiyuki Ootani

机构 * Independent researcher(独立研究员)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对蒸馏扩散模型中文本编码器成为瓶颈的问题,提出一种结合非对称CUDA流水线、编译友好的ControlNet-LLLite重构和周期性条件刷新调度的流式管线,在消费级GPU上实现视频率实时风格化编辑。

Comments 14 pages, 4 figures, 13 tables. Code, evaluation harness, and the released Temporal LLLite adapter weights are at https://github.com/otanl/dreamlite-stream (also mirrored to Hugging Face and Zenodo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16241 2026-07-15 cs.CV 版本更新 83%

Structure-Semantic Co-optimized Latent Diffusion Model for Fast Visual Anagram Synthesis

结构-语义协同优化的潜扩散模型用于快速视觉字谜合成

Xiang Gao, Yunpeng Jia

机构 * School of Digital Media and Design Arts, Beijing University of Posts and Telecommunications(北京邮电大学数字媒体与设计艺术学院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出结构-语义协同优化框架S2CO-Anagram,通过空文本结构对齐、语义增强和注意力引导噪声融合,在极低计算成本下生成高分辨率、高视觉和谐度与语义保真度的视觉字谜图像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14147 2026-07-08 cs.CV 版本更新 83%

LaViDa-R1: Advancing Reasoning for Unified Multimodal Diffusion Language Models

LaViDa-R1:推进统一多模态扩散语言模型的推理

Shufan Li, Yuchen Zhu, Jiuxiang Gu, Kangning Liu, Zhe Lin, Yongxin Chen, Molei Tao, Aditya Grover, Jason Kuen

机构 * Adobe UCLA(加州大学洛杉矶分校) Georgia Tech(佐治亚理工学院)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 研究提出多模态通用推理dLLM LaViDa-R1,不同于现有工作,它以统一方式整合多任务,采用新颖统一训练后框架,集成监督微调与多任务强化学习,并运用多种训练技术,在多模态任务上展现强大性能。

Comments 28 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22972 2026-07-07 cs.CV 版本更新 83%

WorldMesh: Generating Navigable Multi-Room 3D Scenes via Mesh-Conditioned Image Diffusion

WorldMesh: 通过网格条件图像扩散生成可导航的多房间3D场景

Manuel-Andreas Schneider, Angela Dai

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 扩散模型 :diffusion(title);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出WorldMesh方法,通过网格条件图像扩散生成大规模多房间3D场景,结合结构化网格与真实外观合成,实现高丰富度和多样性的3D环境生成。

Comments Accepted to ECCV 2026. Project page: https://mschneider456.github.io/world-mesh/ Video: https://www.youtube.com/watch?v=MKMEbPT38-s Code: https://github.com/mschneider456/worldmesh

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14504 2026-07-07 cs.LG cs.AI cs.CV 版本更新 83%

Trust-Region Noise Search for Black-Box Alignment of Diffusion and Flow Models

基于信任区域的噪声搜索用于扩散和流模型的黑盒对齐

Niklas Schweiger, Daniel Cremers, Karnik Ram

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出一种基于信任区域的噪声搜索算法,用于对扩散和流模型进行黑盒对齐,通过优化噪声样本实现更好的生成效果,适用于多种生成任务。

Comments Preprint (shorter version accepted at ICLR ReaLM-GEN workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01651 2026-07-07 cs.CV 版本更新 83%

Diffusion Models are Open-World Affordance Learners: Leveraging Generative Priors for 3D Affordance Learning

扩散模型是开放世界的功能学习器:利用生成先验进行3D功能学习

Hanqing Wang, Zhenhao Zhang, Kaiyang Ji, Mingyu Liu, Wenti Yin, yuchao chen, Zhirui Liu, Xiangyu Zeng, Tianxiang Gui, Hangxing Zhang, Jiahao Yuan, Zhiqing Cui, Jiaxin Liu, Zhiyuan Ma, Hui Xiong

机构 * The Hong Kong University of Science and Technology(香港科技大学) ShanghaiTech University(上海科技大学) Zhejiang University(浙江大学) Nanjing University(南京大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究3D功能基础问题,利用文本到图像扩散模型提取先验知识,提出基于扩散的DAG框架用于3D功能预测,通过实验证明其优于现有方法且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11553 2026-07-07 cs.CV 版本更新 83%

AnyDesign: Versatile Area Fashion Editing via Mask-Free Diffusion

AnyDesign:通过无掩码扩散实现通用区域时尚编辑

Yunfang Niu, Dong Yi, Lingxiang Wu, Jie Peng, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Wuhan AI Research(武汉人工智能研究所) Wuhan University(武汉大学)

专题命中 扩散模型 :diffusion(title,abstract);image editing(abstract);分类 cs.CV

AI总结 研究时尚图像编辑,扩展数据集涵盖更多服装和复杂背景,提出基于扩散的AnyDesign方法,通过融合服装类型和特征实现无掩码编辑,实验表明该方法优于当代文本引导时尚编辑方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28417 2026-07-03 cs.CV 版本更新 83%

DiffRGD: An Inference-Time Diffusion Guidance Through Riemannian Gradient Descent

DiffRGD:通过黎曼梯度下降的推理时扩散引导

Jia-Wei Liao, Li-Xuan Peng, Mei-Heng Yueh, Min Sun, Cheng-Fu Chou, Jun-Cheng Chen

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出DiffRGD框架,通过黎曼梯度下降在球流形上求解约束优化,保持潜在高斯分布,提升图像恢复与条件生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27285 2026-07-02 cs.CV cs.CR 版本更新 83%

Rethinking Robust Adversarial Concept Erasure in Diffusion Models

重新思考扩散模型中的鲁棒对抗性概念擦除

Qinghong Yin, Yu Tian, Heming Yang, Xiang Chen, Xianlin Zhang, Yue Ming, Xueming Li, Yue Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua University(计算机科学与技术系,人工智能研究院,清华大学) University of Chinese Academy of Sciences(中国科学院大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 针对扩散模型中概念擦除的对抗训练忽视概念语义导致拟合不足的问题,提出语义引导的鲁棒对抗概念擦除方法S-GRACE,显著提升擦除性能26%并减少90%训练时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11925 2026-07-02 cs.CV 版本更新 83%

Continuous Speculative Decoding for Autoregressive Image Generation

连续推测解码用于自回归图像生成

Zili Wang, Zheng Zhang, Kun Ding, Qi Yang, Fei Li, Shiming Xiang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室) JD.COM Inc(京东集团股份有限公司) China Tower Corporation Limited(中国铁塔股份有限公司)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出连续推测解码方法,通过近似准则、去噪轨迹对齐和接受-拒绝采样,加速连续视觉自回归模型,实现2倍以上加速且保持生成质量。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06668 2026-06-29 cs.CV cs.LG eess.IV 版本更新 83%

StableMotion: One-Step Motion Estimation with Diffusion Prior

StableMotion: 基于扩散先验的单步运动估计

Ziyi Wang, Haipeng Li, Lin Sui, Tianhao Zhou, Hai Jiang, Lang Nie, Bing Zeng, Shuaicheng Liu

机构 * Yingcai Honors College, University of Electronic Science and Technology of China(电子科技大学英才实验学院) School of Information and Communication Engineering, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院) Paradigm Inc.(第四范式) School of Aeronautics and Astronautics, Sichuan University(四川大学航空航天学院) School of Artificial Intelligence, Chongqing University of Posts and Telecommunications(重庆邮电大学人工智能学院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出StableMotion框架,利用预训练图像扩散模型的几何和内容先验,通过自适应集成策略和单步推理设计,在图像矫正任务中实现高效、高保真的运动估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01014 2026-06-29 cs.CV 版本更新 83%

An Expectation-Maximization Algorithm for Training Clean Diffusion Models from Corrupted Observations

一种从损坏观测中训练清洁扩散模型的期望最大化算法

Weimin Bai, Yifei Wang, Wenzheng Chen, He Sun

机构 * Academy for Advanced Interdisciplinary Studies, Peking University(北京大学前沿交叉学科研究院) College of Future Technology, Peking University(北京大学未来技术学院) National Biomedical Imaging Center, Peking University(北京大学国家生物医学成像中心) Yuanpei College, Peking University(北京大学元培学院) State Key Laboratory of Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 提出EMDiffusion,一种期望最大化方法,通过交替重建和模型更新从损坏观测中训练扩散模型,在多种成像逆任务上达到新最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03448 2026-06-23 cs.CV cs.AI 版本更新 83%

Hierarchical Concept-to-Appearance Guidance for Multi-Subject Image Generation

多主体图像生成的层次化概念到外观引导

Yijia Xu, Zihao Wang, Haokun Gui, Jinshi Cui

机构 * Peking University(北京大学) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出层次化概念到外观引导框架(CAG),通过VAE dropout训练和对应感知掩码注意力模块,实现多主体图像生成中身份一致性和精确组合控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10389 2026-06-16 cs.CV cs.AI 版本更新 83%

Region-Adaptive Sampling for Diffusion Transformers

扩散变压器的区域自适应采样

Ziming Liu, Yifan Yang, Chengruidong Zhang, Yiqi Zhang, Lili Qiu, Yang You, Yuqing Yang

机构 * National University of Singapore(新加坡国立大学) Microsoft Research(微软研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出RAS,一种无需训练的自适应采样策略,通过动态分配不同采样比例到图像区域,实现扩散变压器2.36-2.51倍加速且质量损失极小。

Comments CVPR'26 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19115 2026-06-15 cs.CV 版本更新 83%

FBSDiff++: Improved Frequency Band Substitution of Diffusion Features for Efficient and Highly Controllable Text-Driven Image-to-Image Translation

FBSDiff++: 改进的扩散特征频带替换用于高效且高度可控的文本驱动图像到图像翻译

Xiang Gao, Yunpeng Jia

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出FBSDiff++框架,通过动态频带替换扩散特征,实现无需训练的文本驱动图像到图像翻译,支持外观、布局和轮廓引导,并大幅提升推理速度(8.9倍),支持任意分辨率输入和局部编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14096 2026-06-11 cs.CV 版本更新 83%

RSTR: Reducing SpatioTemporal Redundancy in Diffusion Transformers

RSTR: 减少扩散Transformer中的时空冗余

Ruitong Sun, Tianze Yang, Wei Niu, Jin Sun

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出RSTR框架,通过进化搜索和自适应秩分配联合减少扩散Transformer中的时空冗余,实现50%-70%计算节省并保持或提升生成质量。

Comments International Conference on Machine Learning (ICML)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02426 2026-06-10 cs.LG cs.CV 版本更新 83%

Breaking the Curse of Dimensionality: Diffusion Models Efficiently Learn Low-Dimensional Distributions

打破维度诅咒:扩散模型高效学习低维分布

Peng Wang, Huijie Zhang, Zekai Zhang, Siyi Chen, Yi Ma, Qing Qu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出新数学框架,证明扩散模型通过等价于子空间聚类,能以线性于内在维度的样本复杂度学习低维分布,避免维度诅咒。

Comments 37 pages, 8 figures, 2 tables, JMLR publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00273 2026-06-09 cs.CV cs.AI 版本更新 83%

When Do Diffusion Models learn to Generate Multiple Objects?

扩散模型何时学会生成多个物体?

Yujin Jeong, Arnas Uselis, Iro Laina, Seong Joon Oh, Anna Rohrbach

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Washington(华盛顿大学) University of Toronto(多伦多大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究探讨了扩散模型在多物体生成中的局限性,发现场景复杂度比概念不平衡更关键,且低数据条件下计数任务更难学习。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20963 2026-06-08 cs.LG cs.CV 版本更新 83%

Generalization of Diffusion Models Arises with a Balanced Representation Space

扩散模型的泛化源于平衡表示空间

Zekai Zhang, Xiao Li, Xiang Li, Lianghe Shi, Meng Wu, Molei Tao, Qing Qu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 通过分析两层ReLU去噪自编码器,证明记忆化导致局部尖峰表示,而泛化产生平衡表示,并在真实扩散模型中验证,提出基于表示的检测和编辑方法。

Comments Accepted at ICLR 2026. 40 pages, 19 figures. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18324 2026-06-16 cs.CV cs.AI cs.GR cs.LG stat.ML 版本更新 82%

Improved Baselines with Representation Autoencoders

改进的基于表示自动编码器的基线

Jaskirat Singh, Boyang Zheng, Zongze Wu, Richard Zhang, Eli Shechtman, Saining Xie

机构 * Adobe Research(Adobe研究院) ANU(澳大利亚国立大学) New York University(纽约大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.GR

AI总结 本文研究了基于表示自动编码器(RAE)的设计选择,发现三个见解,简化并改进了RAE。首先,研究了一种通用公式,将表示定义为最后k个编码器层的总和,而不是仅最终层。其次,研究了RAE与表示对齐(REPA)的假设,发现两者具有互补的工作机制。最后,改进了RAE在无分类器指导(CFG)中的表现,通过重新参数化DiT模型输出,实现了无需训练第二个模型的指导效果。RAEv2在ImageNet-256上达到了1.06的gFID,且训练效率显著提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21628 2026-08-14 cs.CR cs.LG 版本更新 82%

Noise as a Probe: Membership Inference Attacks on Diffusion Models Leveraging Initial Noise

噪声作为探针:利用初始噪声的扩散模型成员推断攻击

Puwei Lian, Yujun Cai, Songze Li, Bingkun Bao

机构 * Southeast University(东南大学) The University of Queensland(昆士兰大学) Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文提出利用扩散模型初始噪声中的残余语义信息进行成员推断攻击,揭示了微调模型在隐私保护方面的脆弱性。

Comments Accepted to 34th ACM International Conference on Multimedia (MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07039 2026-08-10 quant-ph cs.LG 版本更新 82%

Quantum Generative Diffusion Model: A Fully Quantum-Mechanical Model for Generating Quantum State Ensemble

量子生成扩散模型:一种用于生成量子态系综的全量子力学模型

Chuangtao Chen, Qinglin Zhao, MengChu Zhou, Zhimin He, Zhili Sun, Haozhen Situ

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出全量子力学模型QGDM,基于量子信道理论构建正向与反向过程,在多种量子态生成任务中性能优于现有模型,为量子生成建模提供了新框架。

Comments 31 pages, 15 tables. Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence. The supplementary material is included at the end of the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15844 2026-08-07 astro-ph.IM astro-ph.CO 版本更新 82%

Radio-Interferometric Image Reconstruction with Denoising Diffusion Restoration Models

利用去噪扩散恢复模型进行无线电干涉成像重建

Michel Morales, Emma Tolley, Remi Poitevineau

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于去噪扩散概率模型的无线电天空成像重建方法,通过训练DDPM并结合DDRM技术,在不依赖网格化可见度数据的情况下实现高保真重建,优于传统CLEAN方法。

Comments 11 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07008 2026-07-28 cs.LG 版本更新 82%

Exact Evaluation of the Accuracy of Diffusion Models for Inverse Problems with Gaussian Data Distributions

高斯数据分布反问题扩散模型精度的精确评估

Emile Pierret, Bruno Galerne

机构 * Université d’Orléans, Université de Tours, CNRS, IDP, UMR 7013(奥尔良大学、图尔大学、国家科学研究中心、IDP、UMR 7013) Institut universitaire de France (IUF)(法国国家科学院(IUF))

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

AI总结 研究高斯数据分布反问题中扩散模型精度,通过刻画迭代高斯过程及计算瓦瑟斯坦距离分析差异,比较两种算法,引入更精确的条件高斯扩散模型新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20955 2026-07-24 cs.CR cs.LG 版本更新 82%

Enhancing Membership Inference Attacks on Diffusion Models from a Frequency-Domain Perspective

从频域角度增强扩散模型的成员推理攻击

Puwei Lian, Yujun Cai, Songze Li, Bingkun Bao

机构 * Southeast University(东南大学) The University of Queensland(昆士兰大学) Hefei University of Technology(合肥工业大学) Engineering Research Center of Blockchain Application, Supervision and Management (Southeast University), Ministry of Education(区块链应用、监督与管理工程研究中心(东南大学),教育部)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 本文从频域角度揭示扩散模型处理高频信息的缺陷导致成员推理攻击误分类,并提出即插即用的高频滤波模块以提升攻击性能。

Comments Accepted to Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16947 2026-07-24 cs.RO cs.AI 版本更新 82%

Drive As You Like: Multi-Head Diffusion with Reinforcement Learning for Personalized Driving

随心所欲驾驶:基于强化学习的多头部扩散个性化驾驶

Fan Ding, Xuewen Luo, Fucai Ke, Hwa Hui Tew, Susilawati Susilawati, Vishnu Monn Baskaran, Junn Yong Loo

机构 * School of Information Technology, Monash University Malaysia(墨尔本大学马来西亚分校信息科技学院) Southwest University, China(西南大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究旨在解决自动驾驶规划器忽视人类驾驶行为多样性及难以理解用户意图的问题。提出基于强化学习的多策略框架,集成多头部扩散规划器与语义理解,采用两阶段训练范式。实验表明该方法在nuPlan基准测试中性能良好,能满足实时规划并对齐用户意图。

Comments Has been submitted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20666 2026-07-23 cs.LG cs.AI 版本更新 82%

Dominant vs. Dominated: Concept-Level Generative Collapse in Diffusion Models

主导与被主导:扩散模型中的概念级生成坍缩

Hayeon Jeong, Jong-Seok Lee

机构 * Yonsei University(延世大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)

AI总结 研究文本到图像扩散模型多概念生成中的DvD不平衡,引入DominanceBench,从数据和机制角度研究其成因,通过受控微调、交叉注意力及头部消融分析,揭示DvD是系统性概念级失败模式,为可靠可控多概念生成提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10552 2026-07-22 cs.NE 版本更新 82%

MindPilot: Closed-loop Visual Stimulation Optimization for Brain Modulation with EEG-guided Diffusion

MindPilot: 闭环视觉刺激优化用于EEG引导的脑调控

Dongyang Li, Kunpeng Xie, Mingyang Wu, Yiwei Kong, Jiahua Tang, Haoyang Qin, Chen Wei, Quanying Liu

专题命中 扩散模型 :diffusion(title);image generation(abstract);image synthesis(abstract)

AI总结 MindPilot通过EEG反馈实现闭环视觉刺激优化,推动非侵入性脑调控和双向脑机接口的发展。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏