arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-24 至 2026-03-24 共收录 145 信号源:cs.CV, cs.GR, cs.MM

1. 图像修复 3 篇

2307.14436 2026-03-24 eess.IV cs.CV q-bio.QM 79%

Phenotype-preserving metric design for high-content image reconstruction by generative inpainting

为高内容图像重建设计的表型保持度量方法通过生成性图像修复

Vaibhav Sharma, Artur Yakimovich

机构 * Center for Advanced Systems Understanding (CASUS)(先进系统理解中心) Helmholtz-Zentrum Dresden-Rossendorf e. V. (HZDR)(德累斯顿-罗斯托克亥姆霍尔茨中心) Artificial Intelligence for Life Sciences CIC(生命科学人工智能中心) Institute of Computer Science, University of Wroclaw(沃里尼大学计算机科学学院)

专题命中 图像修复 :inpainting(title,abstract);分类 cs.CV

AI总结 本文通过生成性图像修复技术,设计了保持表型的度量方法,以提高高内容荧光显微镜图像的重建质量,通过量化修复区域的生物表型大小和数量来惩罚不良的图像修复。

Comments 8 pages, 3 figures, conference proceedings

Journal ref In Emerging Topics in Artificial Intelligence (ETAI) 2023 (Vol. 12655, pp. 7-14). SPIE

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01641 2026-03-24 cs.CV 79%

FideDiff: Efficient Diffusion Model for High-Fidelity Image Motion Deblurring

FideDiff:高效的高保真图像运动去模糊扩散模型

Xiaoyang Liu, Zhengyan Zhou, Zihang Xu, Jiezhang Cao, Zheng Chen, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Harvard University(哈佛大学)

专题命中 图像修复 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出FideDiff,一种高效的单步扩散模型,用于高保真图像运动去模糊。通过将运动去模糊转化为扩散过程,结合Kernel ControlNet和自适应时间步预测,提升了去模糊性能。

Comments Accepted to ICLR 2026. Code is available at https://github.com/xyLiu339/FideDiff

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08771 2026-03-24 cs.CV 57%

LinearSR: Unlocking Linear Attention for Stable and Efficient Image Super-Resolution

LinearSR: 解锁线性注意力以实现稳定且高效的图像超分辨率

Xiaohui Li, Shaobin Zhuang, Shuo Cao, Yang Yang, Yuandong Pu, Qi Qin, Siqi Luo, Bin Fu, Yihao Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) The Australian National University(澳大利亚国立大学)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 本文提出LinearSR框架,首次系统解决线性注意力在图像超分辨率中的关键挑战,通过改进的早停指导微调策略、SNR基专家混合架构和TAG指导范式,实现高质量与高效兼顾的超分辨率生成。

Comments Camera Ready of ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 个性化与一致性 5 篇

2603.21884 2026-03-24 cs.CV cs.AI cs.LG 79%

Not All Layers Are Created Equal: Adaptive LoRA Ranks for Personalized Image Generation

并非所有层都同等重要:面向个性化图像生成的自适应LoRA秩

Donald Shenaj, Federico Errica, Antonio Carta

机构 * University of Pisa(比萨大学) NEC Laboratories Europe(NEC 欧洲实验室)

专题命中 个性化与一致性 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出LoRA$^2$方法,通过自适应调整各层秩来优化个性化图像生成,实现性能与内存消耗的平衡,优于传统固定秩方法。

Comments Project page: https://donaldssh.github.io/NotAllLayersAreCreatedEqual/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03110 2026-03-24 cs.LG cs.CV 79%

WarmFed: Federated Learning with Warm-Start for Globalization and Personalization Via Personalized Diffusion Models

WarmFed: 通过个性化扩散模型实现全球化与个性化联邦学习的Warm-Start

Tao Feng, Jie Zhang, Xiangjian Li, Rong Huang, Huashan Liu, Zhijie Wang

专题命中 个性化与一致性 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出WarmFed,通过预训练初始化实现全球化与个性化模型的协同优化,采用LoRA生成个性化扩散模型,并结合服务器端微调与动态自我蒸馏提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11236 2026-03-24 cs.CV 70%

StyleQoRA: Quality-Aware Low-Rank Adaptation for Few-Shot Multi-Style Editing

StyleQoRA: 为少样本多风格编辑的高质量低秩适应

Cong Cao, Huanjing Yue, Yujie Xu, Xiaodong Xu

机构 * SenseTime Group(秒速科技集团) Imvision Tianjin University(天津大学) ACE Robotics(ACE机器人)

专题命中 个性化与一致性 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出StyleQoRA框架,通过自适应秩确定和混合专家LoRA设计,实现少样本多风格图像编辑的高质量适应,实验表明其参数更少却性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20307 2026-03-24 cs.CV cs.AI cs.MM cs.SD 62%

EARTalking: End-to-end GPT-style Autoregressive Talking Head Synthesis with Frame-wise Control

EARTalking:端到端的GPT风格自回归说话头合成与帧级控制

Yuzhe Weng, Haotian Wang, Yuanhong Yu, Jun Du, Shan He, Xiaoyan Wu, Haoran Xu

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Zhejiang University(浙江大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本文提出EARTalking,一种端到端的GPT风格自回归模型,用于交互式音频驱动说话头生成,通过引入帧级流式生成范式和Sink Frame Window Attention机制,实现高效可控的视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05905 2026-03-24 cs.CV 57%

SCAIL: Towards Studio-Grade Character Animation via In-Context Learning of 3D-Consistent Pose Representations

SCAIL:通过上下文学习3D一致姿态表示实现工作室级角色动画

Wenhao Yan, Sheng Ye, Zhuoyi Yang, Jiayan Teng, ZhenHui Dong, Kairui Wen, Xiaotao Gu, Yong-Jin Liu, Jie Tang

机构 * Tsinghua University(清华大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 SCAIL通过创新的3D姿态表示和全上下文姿态注入机制,提升角色动画的结构保真度和时间一致性,实现工作室级控制。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像生成评测 4 篇

2510.11026 2026-03-24 cs.CV 70%

GIR-Bench: Versatile Benchmark for Generating Images with Reasoning

GIR-Bench:用于生成图像的多功能基准

Hongxiang Li, Yaowei Li, Bin Lin, Yuwei Niu, Yuhang Yang, Xiaoshuang Huang, Jiayin Cai, Xiaolong Jiang, Yao Hu, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学) Xiaohongshu Inc.(小红书公司)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出GIR-Bench,从理解-生成一致性、文本到图像生成和多步骤编辑三个角度评估统一模型,揭示其在复杂视觉任务中的表现与不足。

Comments ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21937 2026-03-24 cs.CV 57%

MultiBind: A Benchmark for Attribute Misbinding in Multi-Subject Generation

MultiBind:多主体生成中属性误绑定的基准测试

Wenqing Tian, Hanyi Mao, Zhaocheng Liu, Lihua Zhang, Qiang Liu, Jian Wu, Liang Wang

机构 * New Laboratory of Pattern Recognition, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别新实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) The University of Chicago(芝加哥大学) ByteDance(字节跳动)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文提出MultiBind基准,用于评估多主体生成中属性误绑定问题,通过实体索引提示和混淆评估协议识别跨主体干扰模式,揭示传统指标无法检测的绑定失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20289 2026-03-24 cs.CV 57%

Remote Sensing Image Dehazing: A Systematic Review of Progress, Challenges, and Prospects

遥感图像去雾:进展、挑战与前景的系统综述

Heng Zhou, Xiaoxiong Liu, Zhenxi Zhang, Jieheng Yun, Chengyang Li, Yunchu Yang, Dongyi Xia, Chunna Tian, Xiao-Jun Wu

机构 * School of Artificial Intelligence and Computer Science(人工智能与计算机科学学院) Josef Kittler Research Institute on Artificial Intelligence(乔塞夫·基特勒人工智能研究所) School of Electronic Engineering(电子工程学院) College of Artificial Intelligence(人工智能学院) Aerospace Information Research Institute(航天信息研究所) Department of Computer Science(计算机科学系)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文系统综述了遥感图像去雾的研究进展、挑战与前景,总结了超过30种方法,分析了不同模型在性能上的差异,并提出了未来研究方向。

Comments 82 pages, 23 figures,

Journal ref ISPRS P&RS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15085 2026-03-24 cs.CV 57%

OCRGenBench: A Comprehensive Benchmark for Evaluating OCR Generative Capabilities

OCRGenBench: 一个全面的评估OCR生成能力的基准

Peirong Zhang, Haowei Xu, Jiaxin Zhang, Xuhan Zheng, Guitao Xu, Yuyi Zhang, Junle Liu, Zhenhua Yang, Wei Zhou, Lianwen Jin

机构 * South China University of Technology(南方科技大学) Cardiff University(卡迪夫大学)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文提出OCRGenBench,通过整合文本中心的T2I生成、文本编辑和OCR相关的图像到图像翻译任务,全面评估模型的视觉文本综合能力,揭示现有模型在文本定位、内容修改和密集文本处理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 效率与蒸馏 12 篇

2603.20755 2026-03-24 cs.CV cs.AI 83%

Memory-Efficient Fine-Tuning Diffusion Transformers via Dynamic Patch Sampling and Block Skipping

通过动态补丁采样和块跳过实现高效的扩散变换器微调

Sunghyun Park, Jeongho Kim, Hyoungwoo Park, Debasmit Das, Sungrack Yun, Munawar Hayat, Jaegul Choo, Fatih Porikli, Seokeon Choi

机构 * Qualcomm AI Research(高通人工智能研究) KAIST(韩国科学技术院)

专题命中 效率与蒸馏 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出DiT-BlockSkip框架,通过动态补丁采样和块跳过减少内存使用,提升扩散变换器微调效率,实现设备端部署。

Comments Accepted to CVPR 2026; 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22248 2026-03-24 cs.LG cs.AI cs.IT math.IT stat.ML 78%

Confidence-Based Decoding is Provably Efficient for Diffusion Language Models

基于置信度的解码在扩散语言模型中具有可证明的效率

Changxiao Cai, Gen Li

机构 * Department of Industrial and Operations Engineering, University of Michigan(工业与运营工程系,密歇根大学) Department of Statistics and Data Science, The Chinese University of Hong Kong(统计与数据科学系,香港中文大学)

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 本文提出了一种基于熵和的解码策略,证明其在KL散度下具有ε精度,并在迭代次数上达到O(H(X0)/ε)的效率,适用于低熵数据分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22271 2026-03-24 cs.CV 57%

DUO-VSR: Dual-Stream Distillation for One-Step Video Super-Resolution

DUO-VSR:双流蒸馏用于一步视频超分辨率

Zhengyao Lv, Menghan Xia, Xintao Wang, Kwan-Yee K. Wong

机构 * The University of Hong Kong(香港大学) Huazhong University of Science and Technology(华中科技大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 DUO-VSR提出双流蒸馏策略,通过轨迹保留蒸馏、双流优化和偏好引导细化,解决视频超分辨率中训练不稳定和监督不足的问题,提升视觉质量和效率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21864 2026-03-24 cs.CV cs.AI 57%

Adaptive Video Distillation: Mitigating Oversaturation and Temporal Collapse in Few-Step Generation

自适应视频蒸馏:缓解少步生成中的过饱和与时间崩溃

Yuyang You, Yongzhi Li, Jiahui Li, Yadong Mu, Quan Chen, Peng Jiang

机构 * Peking University(北京大学) Kuaishou Technology(快手科技)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出针对视频扩散模型的自适应蒸馏框架,通过动态回归损失、时间正则化损失和推理时帧插值策略,提升少步视频生成的稳定性和感知真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21619 2026-03-24 cs.CV cs.AI 57%

Efficient Zero-Shot AI-Generated Image Detection

高效的人工智能生成图像检测

Ryosuke Sonoda, Ramya Srinivasan

机构 * Fujitsu Ltd., Japan(日本富士通株式会社) Fujitsu Research of America, Inc., USA(美国富士通研究公司)

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的图像检测方法,通过测量表示对结构化频率扰动的敏感性,实现对细微篡改的检测,方法计算效率高,检测速度比现有方法快一个到两个数量级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20690 2026-03-24 cs.CV 57%

MFSR: MeanFlow Distillation for One Step Real-World Image Super Resolution

MFSR:用于一步真实世界图像超分辨率的MeanFlow蒸馏

Ruiqing Wang, Kai Zhang, Yuanzhi Zhu, Hanshu Yan, Shilin Lu, Jian Yang

机构 * Nanjing University(南京大学) LIX, École Polytechnique, CNRS, IPP(巴黎高等学院LIX研究所、法国国家科学研究中心、ipp) Salesforce AI Research(Salesforce人工智能研究) Nanyang Technological University(南洋理工大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 MFSR提出一种单步蒸馏框架,通过MeanFlow作为学习目标,实现高效高质量的图像超分辨率,同时保留少量步骤的可选路径以进一步优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12060 2026-03-24 cs.LG cs.AI cs.CV 57%

Your VAR Model is Secretly an Efficient and Explainable Generative Classifier

你的VAR模型实际上是一个高效且可解释的生成分类器

Yi-Chung Chen, David I. Inouye, Jing Gao

机构 * Elmore Family School of Electrical and Computer Engineering(埃洛姆家族电气与计算机工程学院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于视觉自回归模型的新型生成分类器,引入A-VARC+提升准确率与推理速度,展示VAR方法在可解释性和灾难性遗忘抵抗方面的独特优势。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21782 2026-03-24 cs.LG 50%

Show Me What You Don't Know: Efficient Sampling from Invariant Sets for Model Validation

展示你所不知道的:用于模型验证的高效不变集采样

Armand Rousselot, Joran Wendebourg, Ullrich Köthe

机构 * CVL(计算机视觉与学习实验室) Heidelberg University(海德堡大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出一种无需训练的采样方法,通过预训练扩散模型揭示特征提取器的不变性,展示模型在不同数据变化下的表现。

Comments 19 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20223 2026-03-24 physics.optics 50%

Efficient first-principles inverse design of nanolasers

纳米激光器的高效原理性反向设计

Beñat Martinez de Aguirre Jokisch, Alexander Cerjan, Rasmus Ellebæk Christiansen, Jesper Mørk, Ole Sigmund, Steven G. Johnson

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出基于非线性Maxwell-Bloch方程和稳态ab initio激光理论的反向设计方法,用于优化纳米结构激光器,考虑空间孔燃烧修正、阈值效应、出射效率和增益扩散。

Journal ref Laser Photonics Reviews e01614 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14145 2026-03-24 cs.DC cs.AI 50%

DIP: Efficient Large Multimodal Model Training with Dynamic Interleaved Pipeline

DIP: 一种高效的大规模多模态模型训练方法,采用动态交错流水线

Zhenliang Xue, Hanpeng Hu, Xing Chen, Yimin Jiang, Yixin Song, Zeyu Mi, Yibo Zhu, Daxin Jiang, Yubin Xia, Haibo Chen

机构 * Institute of Parallel and Distributed Systems(并行与分布式系统研究所) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出DIP框架,通过分离不同模态计算和动态分割输入数据,提升大规模多模态模型训练效率,实验显示吞吐量提升达97.3%。

Comments To be published in ASPLOS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20859 2026-03-24 math.NA cs.NA 50%

Efficient Nehari manifold optimization algorithms for computing ground state solutions of nonlinear elliptic systems

高效Nehari流形优化算法用于计算非线性椭圆系统的基态解

Zhaoxing Chen, Wei Liu, Ziqing Xie, Wenfan Yi

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出了一种高效的Nehari流形优化算法,用于计算半线性椭圆系统的基态解,通过结合NMOM与Nesterov加速方法,改进了稳定性与计算效率。

Comments 26 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11571 2026-03-24 eess.SP 50%

A Fine-Grained 3D Radio Map Construction Paradigm with Ultra-Low Sampling Rates by Large Generative Models

一种基于大生成模型的细粒度3D无线电图构建范式,通过超低采样率

Zhiyuan Liu, Qingyu Liu, Shuhang Zhang, Hongliang Zhang, Lingyang Song

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出RadioLAM范式,利用大生成模型解决超稀疏采样问题,通过增强、生成和选举三个模块高效构建细粒度3D无线电图,实验证明其在0.1%采样率下性能优于现有方法。

Comments Accepted by IEEE JSAC

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 其他图像生成 1 篇

2401.04317 2026-03-24 cs.CV cs.CL 57%

WiFi-GEN: High-Resolution Indoor Imaging from WiFi Signals Using Generative AI

WiFi-GEN:利用生成式人工智能进行高分辨率室内成像

Jianyang Shi, Bowen Zhang, Amartansh Dubey, Ross Murch, Liwen Jing

机构 * Pengcheng Laboratory(鹏城实验室) College of Big Data and Internet(大数据与互联网学院) Shenzhen Technology University(深圳技术大学) Department of Electrical Engineering(电子工程系) Indian Institute of Technology Delhi(印度理工学院德里分校) Department of Electronic and Computer Engineering(电子与计算机工程系) HKUST(香港科技大学) School of Computer Science and Technology(计算机科学与技术学院) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出WiFi-GEN,通过生成式人工智能将测量到的WiFi功率转换为高分辨率室内图像,其形状重建精度比物理模型方法高275%,且Frechet Inception Distance得分降低82%。

详情

展开后加载摘要…

URL PDF HTML 收藏