arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-19 至 2026-03-19 共收录 83 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 5 篇

2603.17828 2026-03-19 cs.CV 88%

TINA: Text-Free Inversion Attack for Unlearned Text-to-Image Diffusion Models

TINA:无文本逆向攻击用于未学习的文本到图像扩散模型

Qianlong Xiang, Miao Zhang, Haoyu Zhang, Kun Wang, Junhui Hou, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) City University of Hong Kong(香港城市大学) Shenzhen Loop Area Institute(深圳河套学院) Peng Cheng Laboratory(鹏城实验室) Shandong University(山东大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 TINA通过无文本逆向攻击揭示未学习模型中残留的视觉知识,挑战现有去概念化方法的局限性。

Comments 16 pages, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16830 2026-03-19 cs.CL 86%

PEPPER: Perception-Guided Perturbation for Robust Backdoor Defense in Text-to-Image Diffusion Models

PEPPER:基于感知的扰动用于文本到图像扩散模型的鲁棒后门防御

Oscar Chew, Po-Yi Lu, Jayden Lin, Kuan-Hao Huang, Hsuan-Tien Lin

机构 * Texas A&M University(德克萨斯A&M大学) National Taiwan University(台湾国立大学) University of Michigan(密歇根大学)

专题命中 文生图 :diffusion(title,abstract);text-to-image(title)

AI总结 PEPPER通过重写提示生成语义上不同但视觉上相似的描述,干扰输入提示中的触发器,提高文本到图像扩散模型的鲁棒性,尤其有效对抗基于文本编码器的攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05305 2026-03-19 cs.CV cs.AI 83%

Frequency Autoregressive Image Generation with Continuous Tokens

基于连续标记的频率自回归图像生成

Hu Yu, Hao Luo, Hangjie Yuan, Yu Rong, Jie Huang, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group, DAMO Academy(阿里巴巴集团,达摩院)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出频率自回归(FAR)范式,通过连续标记器构建图像,利用频谱依赖性提升生成效果,并在ImageNet上验证了其在图像生成中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17637 2026-03-19 cs.LG cs.CV 79%

DSS-GAN: Directional State Space GAN with Mamba backbone for Class-Conditional Image Synthesis

DSS-GAN:基于Mamba架构的定向状态空间GAN用于类条件图像合成

Aleksander Ogonowski, Konrad Klimaszewski, Przemysław Rokita

机构 * Warsaw University of Technology(华沙技术大学) National Centre for Nuclear Research(国家核物理研究所)

专题命中 文生图 :image synthesis(title,abstract);分类 cs.CV

AI总结 DSS-GAN引入了定向潜在路由机制,通过分解潜在向量并结合类别嵌入,提升图像合成的FID、KID和精度召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17895 2026-03-19 cs.CV 57%

A Creative Agent is Worth a 64-Token Template

一个创意代理值得一个64-token模板

Ruixiao Shi, Fu Feng, Yucheng Xie, Xu Yang, Jing Wang, Xin Geng

机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(1 南京大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(2 教育部新一代人工智能技术及其跨学科应用关键实验室(东南大学))

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出CAT框架,通过创意令牌化提升文本到图像生成的创造力,实现3.7倍速度提升和4.8倍计算成本降低,生成图像更受人类偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 4 篇

2603.17876 2026-03-19 cs.CV 83%

Edit Spillover as a Probe: Do Image Editing Models Implicitly Understand World Relations?

编辑溢出作为探测器:图像编辑模型是否隐式理解世界关系?

Guandong Li, Zhaobin Chu

机构 * iFLYTEK

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 研究探讨图像编辑模型中编辑溢出现象,通过系统框架评估不同模型的隐式世界理解能力,发现溢出率差异显著,且语义相关性溢出反映真实理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16967 2026-03-19 cs.CV cs.AI 79%

MSRAMIE: Multimodal Structured Reasoning Agent for Multi-instruction Image Editing

MSRAMIE:多模态结构推理代理用于多指令图像编辑

Zhaoyuan Qiu, Ken Chen, Xiangwei Wang, Yu Xia, Sachith Seneviratne, Saman Halgamuge

机构 * University Of Melbourne(墨尔本大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 MSRAMIE基于多模态大语言模型构建无需训练的代理框架,通过结构化多模态推理处理多指令图像编辑任务,提升复杂指令遵循度和完成概率,同时保持图像质量和一致性。

Comments 14 pages, 6 figures, 3 tables, appendix and references provided

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16944 2026-03-19 cs.CV cs.AI 79%

Omni IIE Bench: Benchmarking the Practical Capabilities of Image Editing Models

Omni IIE Bench:图像编辑模型实际能力的基准测试

Yujia Yang, Yuanxiang Wang, Zhenyu Guan, Tiankun Yang, Chenxi Bao, Haopeng Jin, Jinwen Luo, Xinyu Zuo, Lisheng Duan, Haijin Liang, Jin Ma, Xinming Wang, Ruiwen Tao, Hongzhu Yi

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent(腾讯)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出Omni IIE Bench,通过双轨诊断设计评估图像编辑模型在不同语义尺度任务中的一致性,揭示模型在低到高语义任务间性能显著下降的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14925 2026-03-19 cs.CV cs.GR 62%

Workflow-Aware Structured Layer Decomposition for Illustration Production

面向流程的结构化分层分解用于插图生产

Tianyu Zhang, Dongchi Li, Keiichi Sawada, Haoran Xie

机构 * Japan Advanced Institute of Science and Technology(日本科学技术先进研究院) Live2D Inc.(Live2D公司) Waseda University(早稻田大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV、cs.GR

AI总结 本文提出一种面向流程的结构化分层分解框架,用于动漫插图生产,通过分解线稿、平面色、阴影和高光等生产层,提升插图的可控性和生成质量。

Comments 17 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 48 篇

2309.00952 2026-03-19 cs.CL cs.AI 89%

Bridge Diffusion Model: Bridge Chinese Text-to-Image Diffusion Model with English Communities

桥扩散模型:将中文文本到图像扩散模型与英文社区相结合

Shanyuan Liu, Bo Cheng, Yuhang Ma, Liebucha Wu, Ao Ma, Xiaoyu Wu, Dawei Leng, Yuhui Yin

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(title,abstract);image generation(abstract)

AI总结 本文提出桥扩散模型,通过端到端结构学习中文语义并保持潜在空间与英文文本到图像模型的兼容性,实现中英文语义融合生成。

Comments Accepted as Oral at AAAI 2025. 8 pages, 5 figures. Published in Proceedings of the 39th AAAI Conference on Artificial Intelligence. Code: https://github.com/360CVGroup/Bridge_Diffusion_Model

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 39(5), 5541-5549 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17237 2026-03-19 cs.CV 83%

Mechanistic Interpretability of Diffusion Models: Circuit-Level Analysis and Causal Validation

扩散模型的机理可解释性:电路级分析与因果验证

Dip Roy

机构 * Computer Science and Engineering, Indian Institute of Technology, Patna, India(计算机科学与工程,印度理工学院,帕坦,印度)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 研究通过系统干预实验揭示扩散模型在合成与自然数据处理中的算法差异,发现真实人脸处理需更高计算复杂度的电路,识别出八种功能不同的注意力机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17968 2026-03-19 cs.CV 79%

Robust-ComBat: Mitigating Outlier Effects in Diffusion MRI Data Harmonization

Robust-ComBat: 降低扩散磁共振成像数据调和中的异常值影响

Yoan David, Pierre-Marc Jodoin, Alzheimer's Disease Neuroimaging Initiative, The TRACK-TBI Investigators

机构 * VitaLab, Dep of Computer Science, University of Sherbrooke(维塔实验室,计算机科学系,谢布罗什大学) Imeka Solutions Inc.(伊梅卡解决方案公司) Alzheimer’s Disease Neuroimaging Initiative(阿尔茨海默病影像化验倡议) The TRACK-TBI Investigators(TRACK-TBI研究组)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Robust-ComBat方法,通过引入MLP模型有效处理扩散MRI数据中的异常值问题,提升调和精度并保留疾病相关信号。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17825 2026-03-19 cs.CV 79%

Steering Video Diffusion Transformers with Massive Activations

通过大规模激活引导视频扩散变换器

Xianhang Cheng, Yujian Zheng, Zhenyu Xie, Tingting Liao, Hao Li

机构 * MBZUAI

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究视频扩散变换器中大规模激活的作用,提出STAS方法通过引导首帧和边界token的激活值提升视频生成质量与时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21592 2026-03-19 cs.CV 79%

Unifying Heterogeneous Degradations: Uncertainty-Aware Diffusion Bridge Model for All-in-One Image Restoration

统一异构退化:面向全场景图像修复的不确定性感知扩散桥模型

Luwei Tu, Jiawei Wu, Xing Luo, Zhi Jin

机构 * School of Intelligent Systems Engineering, Shenzhen Campus of Sun Yat-sen University, Shenzhen, Guangdong 518107, China(中山大学智能系统工程学院深圳校区) Department of Frontier Research, Peng Cheng Laboratory, Shenzhen, Guangdong 518055, China(鹏城实验室前沿研究部) Guangdong Provincial Key Laboratory of Fire Science and Technology, Guangzhou 510006, China(广东省消防科学与技术重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出UDBM模型,通过将全场景图像修复转化为随机传输问题,利用像素级不确定性引导修复过程,解决异构退化间的优化冲突问题,实现单步推理下的高性能修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17398 2026-03-19 cs.CV 79%

Motion-Adaptive Temporal Attention for Lightweight Video Generation with Stable Diffusion

面向轻量视频生成的运动自适应时间注意力机制

Rui Hong, Shuxue Quan

机构 * George Mason University(乔治·玛森大学) Independent Researcher(独立研究者)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于冻结Stable Diffusion模型的运动自适应时间注意力机制,通过动态调整时间注意力接收域,实现高运动序列局部关注与低运动序列全局关注,仅增加25.8M参数即在WebVid验证集上取得竞争性结果。

Comments 6 pages, 3 figures, 4 tables. Published at IS&T Electronic Imaging 2026, GENAI Track

Journal ref IS&T Electronic Imaging 2026, GENAI Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22057 2026-03-19 cs.CV cs.AI 79%

Unsupervised Decomposition and Recombination with Discriminator-Driven Diffusion Models

无监督分解与重组:基于判别器驱动的扩散模型

Archer Wang, Emile Anand, Yilun Du, Marin Soljačić

机构 * Research Laboratory of Electronics, MIT, Cambridge, MA 02139, USA(MIT电子研究实验室) Department of Physics, Massachusetts Institute of Technology, MIT, Cambridge, MA, USA(麻省理工学院物理系) NSF AI Institute for Artificial Intelligence(国家科学基金会人工智能与基本相互作用研究所) Kempner Institute, Harvard University, Cambridge, MA, USA(哈佛大学 Kempner 院) Google DeepMind, Mountain View, CA, USA(Google DeepMind) School of Computer Science, Georgia Institute of Technology, Atlanta, USA(佐治亚理工学院计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出基于判别器驱动的扩散模型,用于无监督分解和重组数据,通过对抗训练提升潜在因子发现和生成质量,实验显示在多个数据集上优于基线方法,且在机器人视频轨迹中实现新应用。

Comments 28 pages, 16 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22179 2026-03-19 cs.CV 79%

High-Fidelity Diffusion Face Swapping with ID-Constrained Facial Conditioning

高保真扩散面部交换与ID约束面部条件化

Dailan He, Xiahong Wang, Shulun Wang, Guanglu Song, Bingqi Ma, Hao Shao, Yu Liu, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多模态实验室) Vivix Group Limited(Vivix集团有限公司) Shenzhen Loop Area Institute(深圳河套学院) CPII under InnoHK(创新香港下的CPII)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种ID约束的面部条件化框架,通过解耦条件注入确保身份保持并优化属性对齐,结合身份和对抗损失提升生成质量,在定性和定量评估中均优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17049 2026-03-19 cs.CV cs.AI 79%

From Geometric Mimicry to Comprehensive Generation: A Context-Informed Multimodal Diffusion Model for Urban Morphology Synthesis

从几何模仿到综合生成:一种基于上下文的多模态扩散模型用于城市形态合成

Fangshuo Zhou, Huaxia Li, Liuchang Xu, Rui Hu, Sensen Wu, Liang Xu, Hailin Feng, Zhenhong Du

机构 * Zhejiang Agriculture and Forestry University(浙江农业与林业大学) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Zhejiang University of Technology(浙江工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ControlCity模型,通过多模态信息融合实现城市形态综合生成,提升了形态保真度和空间重叠度,实现了跨城市风格迁移和未知城市零样本生成。

Comments Accepted

Journal ref International Journal of Geographical Information Science (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17601 2026-03-19 math.AP math.OC q-bio.TO 78%

An optimal control approach to nonlinear wave speed selection in reaction-diffusion equations

非线性扩散方程中行波速度选择的最优控制方法

Rebecca M. Crossley, Carles Falco, Ruth E. Baker

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过最优控制方法重构变分原理,推导非线性偏微分方程中行波速度的下界,分析单物种模型和多物种系统,结合数值模拟验证结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17513 2026-03-19 cs.CR 78%

Proof-of-Authorship for Diffusion-based AI Generated Content

基于扩散模型的AI生成内容的作者证明

De Zhang Lee, Han Fang, Ee-Chien Chang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种作者证明框架,通过概率仲裁者量化声称的可信度,利用加密伪随机函数将随机种子与作者身份绑定,以解决AI生成内容的版权保护问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16885 2026-03-19 eess.SP cs.CL cs.HC cs.LG 78%

DECODE: Dual-Enhanced Conditioned Diffusion for EEG Forecasting

DECODE:双增强条件扩散用于脑电波预测

Mehran Shabanpour, Sadaf Khademi, Konstantinos N Plataniotis, Arash Mohammadi

机构 * Concordia Institute for Information Systems Engineering (CIISE), Concordia University, Canada. Department of Electrical Computer Engineering, University of Toronto, Canada

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 DECODE通过结合自然语言描述与历史信号的时序动态,实现对认知事件特定神经响应的预测,达到亚微伏精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21198 2026-03-19 math.NA cs.NA 78%

Optimal preconditioning techniques for finite volume approximation of three-dimensional conservative space-fractional diffusion equations

有限体积法求解三维保守空间分数扩散方程的最优预处理技术

Wei Qu, Siu-Long Lei, Sean Y. Hon, Yuan-Yuan Huang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于正弦变换的预处理方法,用于求解三维保守空间分数扩散方程的有限体积近似所得到的大型稠密三阶Toeplitz离散线性系统,证明了PCG和PGMRES方法具有线性收敛性,且迭代次数与矩阵规模无关。

Comments Revised version with updated funding information

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16898 2026-03-19 math.NA cs.NA math.OC 78%

Enhanced shape recovery in advection--diffusion problems via a novel ADMM-based CCBM optimization

通过一种新的基于ADMM的CCBM优化方法增强对流传输问题中的形状恢复

Elmehdi Cherrat, Lekbir Afraites, Julius Fergy Tiongson Rabago

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种基于耦合复边界方法的新型形状优化框架,用于解决由对流传输方程支配的几何反问题,通过构造复值状态变量的虚部作为成本函数,利用变分形式推导形状导数并提供显式表达式,采用Sobolev梯度方法进行优化,引入ADMM启发的数值方案以提高复杂边界和噪声下的重建能力。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02070 2026-03-19 cs.LG 78%

An Introduction to Flow Matching and Diffusion Models

流匹配与扩散模型简介

Peter Holderrieth, Ezra Erives

机构 * csail.mit.edu(麻省理工学院计算机科学与人工智能实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文介绍扩散和基于流的生成模型,涵盖数学基础、核心算法及图像视频生成方法,适合希望深入理解生成AI理论与实践的机器学习研究者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17965 2026-03-19 cs.CV 77%

LaDe: Unified Multi-Layered Graphic Media Generation and Decomposition

LaDe:统一的多层图形媒体生成与分解

Vlad-Constantin Lungu-Stan, Ionut Mironica, Mariana-Iuliana Georgescu

机构 * Adobe Research(Adobe研究院)

专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 LaDe通过结合LLM提示扩展器、4D RoPE位置编码的潜在扩散变换器和RGBA VAE,实现灵活的多层媒体设计生成与分解,提升文本到多层媒体设计的对齐能力。

Comments 18 pages (main + supp)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17586 2026-03-19 cond-mat.mtrl-sci physics.chem-ph physics.comp-ph 71%

Interface-dependent Phase Transitions and Ultrafast Hydrogen Superionic Diffusion of H2O Ice

界面依赖的相变和超快氢超离子扩散的H2O冰

Pengfei Hou, Yumiao Tian, Zifeng Liu, Junwen Duan, Hanyu Liu, Xing Meng, Russell J. Hemley, Yanming Ma

专题命中 扩散模型 :diffusion(title)

AI总结 研究通过结合神经网络和主动学习方法,揭示高压冰相中界面效应,发现界面可降低氢超离子转变温度并诱导bcc到fcc的相变,重新定义了冰的稳定性场。

Comments 30 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17735 2026-03-19 cs.CV 70%

TAPESTRY: From Geometry to Appearance via Consistent Turntable Videos

TAPESTRY:从几何到外观 via 一致的旋转台视频

Yan Zeng, Haoran Jiang, Kaixin Yao, Qixuan Zhang, Longwen Zhang, Lan Xu, Jingyi Yu

机构 * ShanghaiTech University(上海科技大学) Deemos Technology(德莫斯科技)

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 TAPESTRY通过基于显式3D几何的视频扩散方法生成高保真旋转台视频,用于驱动纹理合成和神经渲染,实现高质量3D重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16736 2026-03-19 cs.CV 57%

World Reconstruction From Inconsistent Views

从不一致视角重建世界

Lukas Höllein, Matthias Nießner

机构 * Technical University of Munich, Germany(慕尼黑技术大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种非刚性对齐方法,通过全局一致坐标框架生成清晰点云,提升视频扩散模型在3D世界重建中的性能。

Comments project website: https://lukashoel.github.io/video_to_world video: https://www.youtube.com/watch?v=qXnUwhVmBzA code: https://github.com/lukasHoel/video_to_world

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22977 2026-03-19 cs.CV 57%

HyperMotionX: The Dataset and Benchmark with DiT-Based Pose-Guided Human Image Animation of Complex Motions

HyperMotionX:基于DiT的Pose引导人体图像动画的Dataset和Benchmark

Shuolin Xu, Siming Zheng, Ziyi Wang, HC Yu, Jinwei Chen, Huaqi Zhang, Daquan Zhou, Tong-Yee Lee, Bo Li, Peng-Tao Jiang

机构 * Bournemouth University(伯恩茅斯大学) vivo BlueImage Lab, vivo Mobile Communication Co., Ltd(vivo 蓝影实验室,vivo 通信有限公司) Peking University(北京大学) National Cheng-Kung University(国立成功大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于DiT的高效人体动画生成基线和改进的RoPE模块,构建了HyperMotionX数据集和基准,提升了复杂人体运动动画的结构稳定性和外观一致性。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16927 2026-03-19 cs.CV eess.IV 57%

Leveraging Large Vision Model for Multi-UAV Co-perception in Low-Altitude Wireless Networks

利用大型视觉模型实现低空无线网络中多无人机协同感知

Yunting Xu, Jiacheng Wang, Ruichen Zhang, Changyuan Zhao, Yinqiu Liu, Dusit Niyato, Liang Yu, Haibo Zhou, Dong In Kim

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) Alibaba Cloud(阿里云) School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与技术学院) Department of Electrical and Computer Engineering, Sungkyunkwan University(成均馆大学电子与计算机工程系)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种通信高效的多无人机协同感知框架BHU,通过Top-K选择机制和Swin-large-based MaskDINO编码器提升感知性能,同时利用深度强化学习优化协作无人机选择和资源分配,实验表明在资源受限环境下感知性能提升超5%且通信开销降低85%。

详情

展开后加载摘要…

URL PDF HTML 收藏