arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-04 至 2026-06-04 共收录 1278 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 1 篇

2606.04479 2026-06-04 cs.CV cs.AI cs.CL 57%

Evaluating Reasoning Fidelity in Visual Text Generation

评估视觉文本生成中的推理保真度

Jiajun Hong, Jiawei Zhou

机构 * Stony Brook University(石桥大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 通过长文本渲染、事实知识探测、上下文理解和多步推理等任务,评估当前文本到图像模型在视觉文本生成中是否忠实保持推理能力,发现其常产生语义错误和逻辑不一致,与纯文本模型存在显著差距。

Comments Peer reviewed and accepted at CVPR 2026 at the GRAIL-V (Grounded Retrieval and Agentic Intelligence for Vision-Language) workshop (non-archival track)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 7 篇

2606.04457 2026-06-04 cs.CV 87%

Imagine Before You Draw: Visual Prompt Engineering for Image Generation

先构思再绘制:面向图像生成的视觉提示工程

Liyu Jia, Fengda Zhang, Jiachun Pan, Kesen Zhao, Saining Zhang, Wang Lin, Weijia Wu, Yue Liao, Aojun Zhou, Hanwang Zhang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 图像编辑 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)

AI总结 提出视觉提示工程(VPE),通过在单一模型内先生成视觉语义令牌作为中间计划,再生成完整图像,从而避免信息瓶颈,提升图像生成质量与编辑保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00801 2026-06-04 cs.CV cs.MM 81%

Med-Banana: Learning Quality-Controlled Medical Image Editing from Success-and-Failure Trajectories

Med-Banana:从成功与失败轨迹中学习质量可控的医学图像编辑

Zhihui Chen, Qingyuan Lei, Kai He, Yanrui Du, Mengling Feng

机构 * National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV、cs.MM

AI总结 提出Med-Banana框架,通过收集成功与失败编辑轨迹数据集Med-Banana-80K,联合训练编辑器、验证器和优化器,实现质量可控的医学图像编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03746 2026-06-04 cs.CV cs.AI cs.GR cs.LG 79%

Qwen-Image-Flash: Beyond Objective Design

Qwen-Image-Flash:超越目标设计

Tianhe Wu, Kun Yan, Zikai Zhou, Lihan Jiang, Jiahao Li, Jie Zhang, Kaiyuan Gao, Ningyuan Tang, Shengming Yin, Xiaoyue Chen, Xiao Xu, Yilei Chen, Yuxiang Chen, Yan Shu, Yixian Xu, Yanran Zhang, Zihao Liu, Zhendong Wang, Zekai Zhang, Deqing Li, Liang Peng, Yi Wang, Jingren Zhou, Chenfei Wu

机构 * alibaba-inc.com(阿里巴巴公司)

专题命中 图像编辑 :image generation(abstract);text-to-image(abstract);image editing(abstract);分类 cs.CV、cs.GR

AI总结 本文通过系统研究数据组成、教师指导和任务混合三个因素,提出Qwen-Image-Flash,表明有效的少步蒸馏不仅需要精心设计的目标,还需要对更广泛的训练流程进行原则性组织。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05142 2026-06-04 cs.CV cs.AI 57%

GeM-NR: Geometry-Aware Multi-View Editing for Nonrigid Scene Changes

GeM-NR:面向非刚性场景变化的几何感知多视角编辑

Josef Bengtson, Yaroslava Lochman, Fredrik Kahl

机构 * Chalmers University of Technology(查尔姆斯理工大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出GeM-NR,一种无需训练的快速灵活方法,通过深度图对齐、视角投影和条件细化实现多视角一致的通用非刚性图像编辑,支持几何和外观的显著变化。

Comments Project page: https://gem-nr.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04880 2026-06-04 cs.CV 57%

MAOAM: Unified Object and Material Selection with Vision-Language Models

MAOAM: 基于视觉语言模型的统一对象与材质选择

Jaden Park, Valentin Deschaintre, Jason Kuen, Kangning Liu, Iliyan Georgiev, Krishna Kumar Singh, Yong Jae Lee, Michael Fischer

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Adobe Research(Adobe研究)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出MAOAM框架,利用视觉语言模型和分割头,通过文本或点击交互实现对象和材质的精确选择,并设计数据生成流水线解决材质选择数据缺乏问题。

Comments Accepted to SIGGRAPH 2026 Conference. Project page: \href{https://jadenpark0.github.io/project_pages/maoam/}{here}

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06006 2026-06-04 cs.CV cs.AI cs.CL 57%

Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics

视觉语言模型能预测未来状态吗?从逆动力学引导世界模型

Yifu Qiu, Yftah Ziser, Anna Korhonen, Shay B. Cohen, Edoardo M. Ponti

机构 * Institute for Language, Cognition and Computation, University of Edinburgh(语言、认知与计算研究所,爱丁堡大学) Language Technology Lab, University of Cambridge(语言技术实验室,剑桥大学) NVIDIA(NVIDIA公司) University of Groningen(格罗宁根大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文发现视觉语言模型(VLM)难以直接进行前向动力学预测(FDP),但逆动力学预测(IDP)更容易学习,并利用IDP通过弱监督学习和推理时验证两种策略引导FDP,在Aurora-Bench上取得与最先进图像编辑模型竞争的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
1703.08001 2026-06-04 cs.CV cs.NA math.NA 57%

Nonlinear Spectral Image Fusion

非线性频谱图像融合

Martin Benning, Michael Möller, Raz Z. Nossek, Martin Burger, Daniel Cremers, Guy Gilboa, Carola-Bibiane Schönlieb

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文展示基于总变分正则化的非线性频谱分解框架在图像融合及更广泛的图像处理任务中的有效性,通过选择特定图像的频率转移特征如面部皱纹,实现图像编辑。

Comments 13 pages, 9 figures, submitted to SSVM conference proceedings 2017

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 1164 篇

2512.14099 2026-06-04 cs.CV 89%

ViewMask-1-to-3: Multi-View Consistent Image Generation via Multimodal Discrete Diffusion Models

ViewMask-1-to-3: 通过多模态离散扩散模型实现多视图一致图像生成

Ruishu Zhu, Zhihao Huang, Jiacheng Sun, Ping Luo, Hongyuan Zhang, Xuelong Li

机构 * Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出ViewMask-1-to-3,将多视图生成建模为离散序列预测问题,利用MAGVIT-v2视觉令牌和掩码令牌预测的离散扩散,通过迭代去掩码实现渐进式多视图生成,无需专门架构或3D几何先验,在GSO和3D-FUTURE基准上优于基线方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04264 2026-06-04 cs.CV 85%

UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation

UniCanvas: 一种基于扩散的图文联合生成统一模型

Zeyuan Yang, Hao-Wei Chen, Xueyang Yu, Yuncong Yang, Haoyu Zhen, Ziqiao Ma, Maohao Shen, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) University of Michigan(密歇根大学) MIT(麻省理工学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出UniCanvas,通过扩散模型在像素画布上以文本嵌入图像的方式实现图文联合生成,解决现有模型在视觉与文本生成上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28762 2026-06-04 cs.CV cs.AI cs.GR cs.LG 84%

On-the-fly Repulsion in the Contextual Space for Rich Diversity in Diffusion Transformers

上下文空间中的即时排斥以实现扩散变换器的丰富多样性

Omer Dahary, Benaya Koren, Daniel Garibi, Daniel Cohen-Or

机构 * Tel Aviv University(特拉维夫大学) Snap Research Israel(Snap以色列研究)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV、cs.GR

AI总结 针对文本到图像扩散模型多样性不足的问题,提出在扩散变换器的上下文空间中通过多模态注意力通道施加即时排斥,在不牺牲视觉保真度和语义一致性的前提下显著提升生成多样性,且计算开销小,适用于现代Turbo和蒸馏模型。

Comments SIGGRAPH 2026. Project page: https://contextual-repulsion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04299 2026-06-04 cs.CV cs.LG 83%

Efficient and Training-Free Single-Image Diffusion Models

高效且无需训练的单图像扩散模型

Haojun Qiu, Kiriakos N. Kutulakos, David B. Lindell

机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Vector Institute(向量研究所)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出一种基于多尺度补丁数据集的无训练单图像扩散模型,通过闭式最优去噪器实现高效生成,达到与训练模型相当的质量和多样性。

Comments CVPR 2026; Project Page: https://haojunqiu.github.io/efficient-SID/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05113 2026-06-04 eess.IV 82%

3D-GlioPREDICT: 3D Latent Diffusion for Post-Radiotherapy Brain MRI Prediction in Patients with Glioma

3D-GlioPREDICT: 用于胶质瘤患者放疗后脑MRI预测的3D潜在扩散模型

Nordin Belkacemi, Selena Huisman, Vera C. Keil, Joost J. C. Verhoeff, Szabolcs David

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract)

AI总结 提出一种3D潜在扩散框架,以空间分辨的体素级剂量分布为条件,结合预处理图像和随访时间,生成放疗后脑MRI,在公开数据集上优于2D方法。

Comments 12 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25050 2026-06-04 cs.RO 82%

DiscreteRTC: Discrete Diffusion Policies are Natural Asynchronous Executors

DiscreteRTC:离散扩散策略是自然的异步执行器

Pengcheng Wang, Kaiwen Hong, Chensheng Peng, Katherine Driggs-Campbell, Masayoshi Tomizuka, Chenfeng Xu, Chen Tang

机构 * UC Berkeley(加州大学伯克利分校) UIUC(伊利诺伊大学香槟分校) UT Austin(德克萨斯大学奥斯汀分校) UCLA(加州大学洛杉矶分校)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract)

AI总结 针对同步执行器在动态任务中的致命停顿问题,提出DiscreteRTC方法,利用离散扩散策略的原生修复能力实现异步执行,在动态模拟和真实操作任务中取得更高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04898 2026-06-04 cs.CV 79%

CDPM-Align: Multi-Scale Guidance-Aligned Diffusion Pretraining for Robust Few-Shot Anatomical Landmark Detection

CDPM-Align:用于鲁棒少样本解剖标志检测的多尺度引导对齐扩散预训练

Roberto Di Via, Irina Voiculescu, Francesca Odone, Vito Paolo Pastore

机构 * MaLGa DIBRIS, University of Genoa(DIBRIS,热那亚大学) University of Genoa(热那亚大学) Department of Computer Science, University of Oxford(奥大利大学计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出多尺度引导对齐的条件扩散预训练方法CDPM-Align,通过生成式预训练学习鲁棒表示,在少样本和低标注场景下提升解剖标志检测的准确性和不确定性。

Comments Accepted MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04107 2026-06-04 cs.CV 79%

Reflection Separation from a Single Image via Joint Latent Diffusion

基于联合潜在扩散的单图像反射分离

Zheng-Hui Huang, Zhixiang Wang, Yu-Lun Liu, Yung-Yu Chuang

机构 * Shanda AI Research Tokyo(Shanda AI Research东京) National Taiwan University(台湾大学) National Yang Ming Chiao Tung University(阳明交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出一种基于扩散模型的方法,通过联合生成透射和反射层、跨层自注意力机制、分离采样策略和潜在优化,解决强光或弱反射等极端条件下的单图像反射分离问题。

Comments CVPR 2026. Project page: https://brian90709.github.io/diff-reflection-separation/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15741 2026-06-04 cs.CV 79%

HyperDiT: Hyper-Connected Transformers for High-Fidelity Pixel-Space Diffusion

HyperDiT: 用于高保真像素空间扩散的超连接Transformer

Yu He, Lichen Ma, Zipeng Guo, Xinyuan Shan, Jingling Fu, Dong Chen, Junshi Huang, Yan Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对像素空间扩散模型中全局语义与细粒度细节难以兼顾的粒度困境,提出HyperDiT框架,通过超连接跨尺度交互和尺度感知旋转位置编码,结合预训练视觉基础模型的密集语义,在像素空间实现高保真生成,在ImageNet 256×256上取得1.56的SoTA FID。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20304 2026-06-04 cs.CV 79%

Transferable Multi-Bit Watermarking Across Frozen Diffusion Models via Latent Consistency Bridges

跨冻结扩散模型的可迁移多位水印:基于潜在一致性桥

Hong-Hanh Nguyen-Le, Van-Tuan Tran, Thuc D. Nguyen, Nhien-An Le-Khac

机构 * National Institute of Advanced Intelligence Science and Technology, Japan(日本国家先进人工智能科学与技术研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出DiffMark,一种即插即用的多位水印框架,通过潜在一致性模型实现高效训练,在单个前向传播中提取64位水印,速度提升45倍,并支持跨架构迁移。

Comments Accepted in Second Workshop on Technical AI Governance Research (TAIGR) @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23214 2026-06-04 cs.CV cs.LG eess.IV 79%

Plug-and-Play Diffusion Meets ADMM: Dual-Variable Coupling for Robust Medical Image Reconstruction

即插即用扩散遇见ADMM:双变量耦合用于鲁棒医学图像重建

Chenhe Du, Xuanyu Tian, Qing Wu, Muyu Liu, Jingyi Yu, Hongjiang Wei, Yuyao Zhang

机构 * ShanghaiTech University(上海科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出双耦合即插即用扩散(DC-PnPDP)框架,通过引入经典对偶变量提供积分反馈并采用频谱均匀化(SH)处理结构伪影,解决了现有PnP求解器的稳态偏差和幻觉问题,在CT和MRI重建中实现了最先进的保真度和加速收敛。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.12084 2026-06-04 cs.CV cs.LG cs.NA math.AP math.NA 79%

Networks for Nonlinear Diffusion Problems in Imaging

图像中非线性扩散问题的网络

Simon Arridge, Andreas Hauptmann

机构 * Department of Computer Science(计算机科学系;伦敦大学学院) University College London

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于非线性扩散过程的网络架构DiffNet,用于解决图像中的非线性扩散问题,该网络在可解释性和泛化能力方面优于传统卷积神经网络,并在非线性扩散逆问题上取得了与U-Net相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
1509.02223 2026-06-04 cs.CV cs.NA math.NA 79%

Diffusion tensor imaging with deterministic error bounds

具有确定性误差边界的扩散张量成像

Artur Gorokh, Yury Korolev, Tuomo Valkonen

机构 * Faculty of Physics, Lomonosov Moscow State University(莫斯科罗蒙诺索夫国立大学物理系) School of Engineering and Materials Science, Queen Mary University of London(伦敦女王玛丽大学工程与材料科学学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文在Banach格中利用偏序理论建模逆问题的误差,应用于扩散张量成像中复杂噪声建模问题,通过确定性误差边界方法简化非线性Stejskal-Tanner方程的处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
1605.04504 2026-06-04 math.NA cs.NA 79%

Effective numerical treatment of sub-diffusion equation with non-smooth solution

亚扩散方程的有效数值处理:非光滑解的情况

Zongze Yang, Jungang Wang, Yan Li, Yufeng Nie

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种高阶数值方法,结合Nystrom方法和紧凑有限差分法,有效处理非光滑解的亚扩散方程,具有高收敛性。

Comments 15 pages, 6 figures

Journal ref Zongze Yang, Jungang Wang, Yan Li & Yufeng Nie (2018): Effective numerical treatment of sub-diffusion equation with non-smooth solution, International Journal of Computer Mathematics, DOI: 10.1080/00207160.2018.1429599

详情

展开后加载摘要…

URL PDF HTML 收藏
1603.03196 2026-06-04 math.NA cs.NA 79%

A Numerical Approach for a General Class of the Spatial Segregation of Reaction-Diffusion Systems Arising in Population Dynamics

一种用于人口动力学中反应扩散系统空间分离一般类别的数值方法

Avetik Arakelyan, Rafayel Barkhudaryan

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种数值方法,用于求解反应扩散系统空间分离问题,证明了有限差分方案的存在性和唯一性,并通过迭代算法展示其一致性和稳定性,特别针对m=2的情况,引入粘度解概念并证明差分方案收敛于唯一粘度解。

Comments 25 pages, 8 figures, 2 tables. Key words and phrases. Free boundary, Two-phase obstacle problem, Reaction-diffusion systems, Finite difference method, Viscosity solution

详情

展开后加载摘要…

URL PDF HTML 收藏
1306.0707 2026-06-04 math.NA cs.NA 79%

On convergence of numerical algorithm of a class of the spatial segregation of reaction-diffusion system with two population densities

关于一类具有两个种群密度的反应扩散系统空间分离数值算法收敛性的研究

Avetik Arakelyan

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了具有两个种群密度的反应扩散系统空间分离的数值算法收敛性,证明了非负内部动态下的算法收敛性,并进行了计算测试。

Comments 13 pages, 8 figures, Free boundary, Two-phase membrane problem, Reaction-diffusion systems, Finite difference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05073 2026-06-04 cs.LG 78%

Learning What Not to Impute: An Uncertainty-Aware Diffusion Framework for Meaningful Missingness

学习什么不该插补:一种面向有意义缺失的不确定性感知扩散框架

Lixing Zhang, Yidong Ouyang, Weifu Li, Shixiang Zhu, Guang Cheng, Liyan Xie

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出Diff-Joint扩散框架,通过联合建模表格数据和潜在缺失掩码,交替进行条件采样和不确定性感知聚合,以区分有意义缺失和需插补的缺失,实现选择性插补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04974 2026-06-04 cs.CL 78%

SAID: Accelerating Diffusion-Based Language Models via Scaffold-Aware Iterative Decoding

SAID: 通过支架感知迭代解码加速基于扩散的语言模型

Na Li, Chengda Wang, Mingju Gao, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出SAID框架,通过将去噪计算重新分配给支架令牌来加速扩散语言模型,并引入CHLG为低置信度令牌分配额外步骤,在LLaDA模型上实现最高9.1倍加速且保持竞争性能。

Comments Code: https://github.com/TH-AI-Lab-PKU/SAID

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04964 2026-06-04 cs.CL 78%

SemBlock: Semantic Boundary Dynamic Blocks for Diffusion LLMs

SemBlock: 扩散语言模型的语义边界动态块

Xinrui Song, Zhuoran Wang, Mingju Gao, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出SemBlock框架,通过预测语义边界动态构建解码块,利用轻量预测器在冻结的LLaDA隐状态上训练,并在自然语言、数学和代码任务中优于固定块解码和AdaBlock。

Comments Code: https://github.com/TH-AI-Lab-PKU/SemBlock

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04939 2026-06-04 eess.AS 78%

UAT: Unified Audio-Text Diffusion for Audio Generation, Editing, and Captioning

UAT: 统一音频-文本扩散用于音频生成、编辑和字幕生成

Hui Wang, Yifan Yang, Zeyue Tian, Yuhang Jia, Jinghua Zhao, Long Zhou, Bing Han, Cheng Liu, Jiaming Zhou, Geng Tu, Yong Qin

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出UAT框架,通过连续潜扩散和掩码离散扩散实现音频生成、编辑和字幕生成的统一,在保持高保真音频合成的同时取得有竞争力的字幕性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04884 2026-06-04 cs.RO 78%

D$^3$-MoE:Dual Disentangled Diffusion Mixture-of-Experts for Style-Controllable End-to-End Autonomous Driving

D$^3$-MoE:面向风格可控的端到端自动驾驶的双解耦扩散混合专家模型

Renju Feng, Rukang Wang, Ning Xi, Jianguo Yu, Liping Lu, Pan Zhou, Duanfeng Chu

机构 * Intelligent Transportation Systems Research Center, Wuhan University of Technology(武汉理工大学智能交通系统研究中心) School of Mechanical and Electronic Engineering, Wuhan University of Technology(武汉理工大学机械电子工程学院) School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院) Hubei Key Laboratory of Distributed System Security, School of Cyber Science and Engineering, Huazhong University of Science and Technology(湖北省分布式系统安全重点实验室,华中科技大学网络空间安全学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出D$^3$-MoE框架,通过行为轴(扩散生成与选择解耦)和物理轴(纵向与横向专家解耦)的双重解耦,实现风格可控的端到端自动驾驶,在NAVSIM基准上达到SOTA规划性能。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04553 2026-06-04 eess.SP 78%

Robust Set-Membership Diffusion Normalization Subband Adaptive Filtering Algorithms Over Distributed Networks

分布式网络上的鲁棒集员扩散归一化子带自适应滤波算法

Yugang Han, Haiquan Zhao, Tongge Fu, Dongyu Tan

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对分布式网络中扩散子带算法鲁棒性不足的问题,提出基于中位数绝对偏差定理的鲁棒边界选择方法,实现抗脉冲噪声的扩散子带自适应滤波算法。

详情

展开后加载摘要…

URL PDF HTML 收藏