arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-24 至 2026-03-24 共收录 12 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 12 篇

2603.20755 2026-03-24 cs.CV cs.AI 83%

Memory-Efficient Fine-Tuning Diffusion Transformers via Dynamic Patch Sampling and Block Skipping

通过动态补丁采样和块跳过实现高效的扩散变换器微调

Sunghyun Park, Jeongho Kim, Hyoungwoo Park, Debasmit Das, Sungrack Yun, Munawar Hayat, Jaegul Choo, Fatih Porikli, Seokeon Choi

机构 * Qualcomm AI Research(高通人工智能研究) KAIST(韩国科学技术院)

专题命中 效率与蒸馏 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出DiT-BlockSkip框架,通过动态补丁采样和块跳过减少内存使用,提升扩散变换器微调效率,实现设备端部署。

Comments Accepted to CVPR 2026; 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22248 2026-03-24 cs.LG cs.AI cs.IT math.IT stat.ML 78%

Confidence-Based Decoding is Provably Efficient for Diffusion Language Models

基于置信度的解码在扩散语言模型中具有可证明的效率

Changxiao Cai, Gen Li

机构 * Department of Industrial and Operations Engineering, University of Michigan(工业与运营工程系,密歇根大学) Department of Statistics and Data Science, The Chinese University of Hong Kong(统计与数据科学系,香港中文大学)

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 本文提出了一种基于熵和的解码策略,证明其在KL散度下具有ε精度,并在迭代次数上达到O(H(X0)/ε)的效率,适用于低熵数据分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22271 2026-03-24 cs.CV 57%

DUO-VSR: Dual-Stream Distillation for One-Step Video Super-Resolution

DUO-VSR:双流蒸馏用于一步视频超分辨率

Zhengyao Lv, Menghan Xia, Xintao Wang, Kwan-Yee K. Wong

机构 * The University of Hong Kong(香港大学) Huazhong University of Science and Technology(华中科技大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 DUO-VSR提出双流蒸馏策略,通过轨迹保留蒸馏、双流优化和偏好引导细化,解决视频超分辨率中训练不稳定和监督不足的问题,提升视觉质量和效率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21864 2026-03-24 cs.CV cs.AI 57%

Adaptive Video Distillation: Mitigating Oversaturation and Temporal Collapse in Few-Step Generation

自适应视频蒸馏:缓解少步生成中的过饱和与时间崩溃

Yuyang You, Yongzhi Li, Jiahui Li, Yadong Mu, Quan Chen, Peng Jiang

机构 * Peking University(北京大学) Kuaishou Technology(快手科技)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出针对视频扩散模型的自适应蒸馏框架,通过动态回归损失、时间正则化损失和推理时帧插值策略,提升少步视频生成的稳定性和感知真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21619 2026-03-24 cs.CV cs.AI 57%

Efficient Zero-Shot AI-Generated Image Detection

高效的人工智能生成图像检测

Ryosuke Sonoda, Ramya Srinivasan

机构 * Fujitsu Ltd., Japan(日本富士通株式会社) Fujitsu Research of America, Inc., USA(美国富士通研究公司)

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的图像检测方法,通过测量表示对结构化频率扰动的敏感性,实现对细微篡改的检测,方法计算效率高,检测速度比现有方法快一个到两个数量级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20690 2026-03-24 cs.CV 57%

MFSR: MeanFlow Distillation for One Step Real-World Image Super Resolution

MFSR:用于一步真实世界图像超分辨率的MeanFlow蒸馏

Ruiqing Wang, Kai Zhang, Yuanzhi Zhu, Hanshu Yan, Shilin Lu, Jian Yang

机构 * Nanjing University(南京大学) LIX, École Polytechnique, CNRS, IPP(巴黎高等学院LIX研究所、法国国家科学研究中心、ipp) Salesforce AI Research(Salesforce人工智能研究) Nanyang Technological University(南洋理工大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 MFSR提出一种单步蒸馏框架,通过MeanFlow作为学习目标,实现高效高质量的图像超分辨率,同时保留少量步骤的可选路径以进一步优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12060 2026-03-24 cs.LG cs.AI cs.CV 57%

Your VAR Model is Secretly an Efficient and Explainable Generative Classifier

你的VAR模型实际上是一个高效且可解释的生成分类器

Yi-Chung Chen, David I. Inouye, Jing Gao

机构 * Elmore Family School of Electrical and Computer Engineering(埃洛姆家族电气与计算机工程学院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于视觉自回归模型的新型生成分类器,引入A-VARC+提升准确率与推理速度,展示VAR方法在可解释性和灾难性遗忘抵抗方面的独特优势。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21782 2026-03-24 cs.LG 50%

Show Me What You Don't Know: Efficient Sampling from Invariant Sets for Model Validation

展示你所不知道的:用于模型验证的高效不变集采样

Armand Rousselot, Joran Wendebourg, Ullrich Köthe

机构 * CVL(计算机视觉与学习实验室) Heidelberg University(海德堡大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出一种无需训练的采样方法,通过预训练扩散模型揭示特征提取器的不变性,展示模型在不同数据变化下的表现。

Comments 19 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20223 2026-03-24 physics.optics 50%

Efficient first-principles inverse design of nanolasers

纳米激光器的高效原理性反向设计

Beñat Martinez de Aguirre Jokisch, Alexander Cerjan, Rasmus Ellebæk Christiansen, Jesper Mørk, Ole Sigmund, Steven G. Johnson

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出基于非线性Maxwell-Bloch方程和稳态ab initio激光理论的反向设计方法,用于优化纳米结构激光器,考虑空间孔燃烧修正、阈值效应、出射效率和增益扩散。

Journal ref Laser Photonics Reviews e01614 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14145 2026-03-24 cs.DC cs.AI 50%

DIP: Efficient Large Multimodal Model Training with Dynamic Interleaved Pipeline

DIP: 一种高效的大规模多模态模型训练方法,采用动态交错流水线

Zhenliang Xue, Hanpeng Hu, Xing Chen, Yimin Jiang, Yixin Song, Zeyu Mi, Yibo Zhu, Daxin Jiang, Yubin Xia, Haibo Chen

机构 * Institute of Parallel and Distributed Systems(并行与分布式系统研究所) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出DIP框架,通过分离不同模态计算和动态分割输入数据,提升大规模多模态模型训练效率,实验显示吞吐量提升达97.3%。

Comments To be published in ASPLOS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20859 2026-03-24 math.NA cs.NA 50%

Efficient Nehari manifold optimization algorithms for computing ground state solutions of nonlinear elliptic systems

高效Nehari流形优化算法用于计算非线性椭圆系统的基态解

Zhaoxing Chen, Wei Liu, Ziqing Xie, Wenfan Yi

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出了一种高效的Nehari流形优化算法,用于计算半线性椭圆系统的基态解,通过结合NMOM与Nesterov加速方法,改进了稳定性与计算效率。

Comments 26 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11571 2026-03-24 eess.SP 50%

A Fine-Grained 3D Radio Map Construction Paradigm with Ultra-Low Sampling Rates by Large Generative Models

一种基于大生成模型的细粒度3D无线电图构建范式,通过超低采样率

Zhiyuan Liu, Qingyu Liu, Shuhang Zhang, Hongliang Zhang, Lingyang Song

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出RadioLAM范式,利用大生成模型解决超稀疏采样问题,通过增强、生成和选举三个模块高效构建细粒度3D无线电图,实验证明其在0.1%采样率下性能优于现有方法。

Comments Accepted by IEEE JSAC

详情

展开后加载摘要…

URL PDF HTML 收藏