arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2537 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 2537 篇

2508.11211 2026-06-18 eess.IV cs.CV 版本更新 70%

Efficient Image-to-Image Schrödinger Bridge for CT Field of View Extension

面向CT视野扩展的高效图像到图像薛定谔桥

Zhenhao Li, Song Ni, Long Yang, Xiaojie Yin, Haijun Yu, Jiazhou Wang, Hongbin Han, Weigang Hu, Yixing Huang

机构 * Institute of Medical Technology, Peking University Health Science Center(北京大学人民医院医学技术研究所) Shanghai Cancer Center, Fudan University(复旦大学上海癌症中心) Department of Electrical and Computer Engineering, University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校电气与计算机工程系) Beijing Key Laboratory of Intelligent Neuromodulation and Brain Disorder Treatment(北京智能神经调控与脑疾病治疗重点实验室)

专题命中 效率与蒸馏 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出基于图像到图像薛定谔桥(I²SB)扩散模型的CT视野扩展框架,通过直接学习有限视野与扩展视野图像间的随机映射,实现单步快速推理,在精度和速度上均超越现有扩散模型。

Comments 12 pages

Journal ref IEEE Transactions on Radiation and Plasma Medical Sciences 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16131 2026-06-16 cs.CV cs.LG 新提交 70%

Shift-and-Sum Quantization for Visual Autoregressive Models

Shift-and-Sum 量化用于视觉自回归模型

Jaehyeon Moon, Bumsub Ham

机构 * Yonsei University(延世大学) Articron

专题命中 效率与蒸馏 :image generation(abstract);inpainting(abstract);分类 cs.CV

AI总结 提出针对视觉自回归模型的训练后量化框架,通过移位求和量化减少注意力值乘积误差,并采用重采样策略校准数据,在图像生成等任务上达到新最优。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26089 2026-06-02 cs.CV cs.AI 70%

Channel-wise Vector Quantization

通道级向量量化

Wei Song, Tianhang Wang, Yitong Chen, Tong Zhang, Zuxuan Wu, Min Li, Jiaqi Wang, Kaicheng Yu

机构 * Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Zhejiang University(浙江大学) Fudan University(复旦大学) JD.COM(京东公司) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出通道级向量量化(CVQ)代替补丁级量化,并基于此设计通道级自回归(CAR)模型,通过逐通道预测实现渐进式细节生成,在图像重建和文本到图像生成中取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17759 2026-05-27 cs.CR cs.CL cs.CV cs.LG stat.ML 70%

VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models

VERA-V:用于破解视觉语言模型的变分推断框架

Qilin Liao, Anamika Lochab, Ruqi Zhang

机构 * Department of Computer Science, Purdue University, USA(美国普渡大学计算机科学系)

专题命中 效率与蒸馏 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出VERA-V变分推断框架,通过联合后验分布生成隐蔽的文本-图像对抗输入,以系统性地发现视觉语言模型的多模态漏洞,在多个基准上攻击成功率最高提升53.75%。

Comments 18 pages, 7 Figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04533 2026-05-27 cs.CV 70%

TAG: Tangential Amplifying Guidance for Hallucination-Resistant Sampling

TAG: 切向放大引导用于抗幻觉采样

Hyunmin Cho, Donghoon Ahn, Susung Hong, Jee Eun Kim, Seungryong Kim, Kyong Hwan Jin

机构 * Korea University(韩国大学) University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出一种无需训练、与架构无关的即插即用引导方法TAG,通过放大估计分数的切向分量来纠正采样轨迹,减少语义不一致性并提高保真度。

Comments Accepted to ICML 2026 (Regular)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23582 2026-05-22 cs.CV 70%

RobuQ: Pushing DiTs to W1.58A2 via Robust Activation Quantization

RobuQ: 通过鲁棒激活量化推动DiTs至W1.58A2

Kaicheng Yang, Xun Zhang, Haotong Qin, Yucheng Lin, Kaisen Yang, Xianglong Yan, Yulun Zhang

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Tsinghua University, Beijing, China(清华大学)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出RobuQ框架,通过鲁棒激活量化技术,解决了DiTs在极低比特下的部署问题,实现了在子4比特量化配置下的最佳性能,首次在大规模数据集上实现了稳定且具有竞争力的图像生成。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12939 2026-05-14 cs.CV 70%

DirectTryOn: One-Step Virtual Try-On via Straightened Conditional Transport

DirectTryOn: 通过直线化条件传输实现一步虚拟试穿

Xianbing Sun, Jiahui Zhan, Liqing Zhang, Jianfu Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出通过直线化条件传输、服装保持损失和自一致性损失改进VTON,实现一步生成,提升效率与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09328 2026-05-12 cs.CV 70%

Noise-Started One-Step Real-World Super-Resolution via LR-Conditioned SplitMeanFlow and GAN Refinement

基于LR条件SplitMeanFlow和GAN精炼的噪声启动一步真实世界超分辨率

Wei Zhu, Kai Zhang, Yu Zheng, Lei Luo, Yong Guo, Jian Yang

机构 * Nanjing University of Science and Technology(南京理工大学) Nanjing University(南京大学) Huawei(华为)

专题命中 效率与蒸馏 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出SMFSR框架,通过LR条件SplitMeanFlow和GAN精炼实现噪声启动的一步真实世界超分辨率,保留扩散模型的随机噪声起点并提升生成效率与真实感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08174 2026-05-12 cs.LG cs.AI cs.CV 70%

CERSA: Cumulative Energy-Retaining Subspace Adaptation for Memory-Efficient Fine-Tuning

CERSA:累积能量保留子空间适应用于内存高效的微调

Jingze Ge, Xue Geng, Yun Liu, Wanqi Dong, Wang Zhe Mark, Min Wu, Ngai-Man Cheung, Bharadwaj Veeravalli, Xulei Yang

机构 * National University of Singapore(新加坡国立大学) Nankai University(南开大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 CERSA通过奇异值分解保留主成分以降低内存消耗,优于现有PEFT方法,适用于多种领域模型。

Comments 10 pages, 7 figures, supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07661 2026-05-11 cs.LG cs.CV 70%

Stochastic Transition-Map Distillation for Fast Probabilistic Inference

随机转移图蒸馏用于快速概率推断

George Rapakoulias, Peter Garud, Lingjiong Zhu, Panagiotis Tsiotras

机构 * Department of Aerospace Engineering, Georgia Institute of Technology(佐治亚理工学院航空航天工程系) Department of Computer Science, Georgia Institute of Technology(佐治亚理工学院计算机科学系) Department of Mathematics, Florida State University(佛罗里达州立大学数学系)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出STMD框架,通过蒸馏完整的转移图加速扩散模型推断并保持概率采样生成,无需预训练教师模型或轨迹模拟,理论上有收敛界支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21450 2026-04-24 cs.CV cs.AI cs.LG 70%

VARestorer: One-Step VAR Distillation for Real-World Image Super-Resolution

VARestorer: 一种一步式VAR蒸馏用于现实世界图像超分辨率

Yixuan Zhu, Shilin Ma, Haolin Wang, Ao Li, Yanzhe Jing, Yansong Tang, Lei Chen, Jiwen Lu, Jie Zhou

机构 * Tsinghua University(清华大学)

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出VARestorer,通过蒸馏预训练的文本到图像VAR模型,实现一步式图像超分辨率,解决迭代预测中的误差累积问题,提升效率与质量。

Comments Accepted in ICLR 2026. Code is available at https://github.com/EternalEvan/VARestorer

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14630 2026-04-22 cs.CV 70%

Adapting Self-Supervised Representations as a Latent Space for Efficient Generation

将自监督表示适配为潜在空间以实现高效生成

Ming Gui, Johannes Schusterbauer, Timy Phan, Felix Krause, Josh Susskind, Miguel Angel Bautista, Björn Ommer

机构 * Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Apple(苹果公司)

专题命中 效率与蒸馏 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出RepTok框架,通过自监督视觉Transformer生成单连续潜在token实现图像生成,通过微调语义token嵌入和生成解码器,提升重建精度并减少训练成本。

Comments ICLR 2026, Code: https://github.com/CompVis/RepTok

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24086 2026-04-21 cs.CV 70%

RainFusion2.0: Temporal-Spatial Awareness and Hardware-Efficient Block-wise Sparse Attention

RainFusion2.0: 基于时序-空间感知与硬件高效性的块状稀疏注意力

Aiyue Chen, Yaofu Liu, Junjian Huang, Guang Lian, Yiwu Yao, Wangli Lan, Jing Lin, Zhixin Ma, Tingting Zhou

机构 * Huawei Technologies Co., Ltd(华为技术有限公司) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出RainFusion2.0,通过块状均值代表token预测稀疏掩码、时空感知token排列及首帧sink机制,实现视频和图像生成模型的高效稀疏注意力,实验表明在保持视频质量的同时,达到80%的稀疏度和1.5~1.8倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15453 2026-04-20 cs.CV cs.AI cs.LG 70%

(1D) Ordered Tokens Enable Efficient Test-Time Search

(1D) 有序标记实现高效的测试时搜索

Zhitong Gao, Parham Rezaei, Ali Cy, Mingqiao Ye, Nataša Jovanović, Jesse Allardice, Afshin Dehghan, Amir Zamir, Roman Bachmann, Oğuzhan Fatih Kar

机构 * Swiss Federal Institute of Technology Lausanne (EPFL)(瑞士联邦理工学院洛桑分校) Apple(苹果公司)

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文研究了有序标记对测试时搜索能力的影响,发现粗到细的1D结构比传统2D网格结构更易进行搜索,通过实验验证了有序结构在生成过程中能提升测试时扩展性。

Comments Project page: https://soto.epfl.ch/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04018 2026-04-07 cs.CV 70%

1.x-Distill: Breaking the Diversity, Quality, and Efficiency Barrier in Distribution Matching Distillation

1.x-Distill: 突破分布匹配蒸馏中的多样性、质量和效率壁垒

Haoyu Li, Tingyan Wen, Lin Qi, Zhe Wu, Yihuang Chen, Xing Zhou, Lifei Zhu, Xueqian Wang, Kai Zhang

机构 * Tsinghua University(清华大学) Central Media Technology Institute, Huawei(华为中央媒体技术研究院)

专题命中 效率与蒸馏 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出1.x-Distill框架,通过引入教师CFG修改和分阶段聚焦蒸馏方法,突破传统整数步蒸馏限制,实现更高质量和多样性的蒸馏扩散模型生成。

Comments Project page: https://thu-accdiff.github.io/1.x-distill-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27684 2026-03-26 cs.CV 70%

Phased DMD: Few-step Distribution Matching Distillation via Score Matching within Subintervals

相位DMD:通过在子区间内进行分数匹配实现少步分布匹配蒸馏

Xiangyu Fan, Zesong Qiu, Zhuguanyu Wu, Fanzhou Wang, Zhiqian Lin, Tianxiang Ren, Dahua Lin, Ruihao Gong, Lei Yang

机构 * SenseTime Research(商汤科技研究院) Beihang University(北航大学)

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出Phased DMD,一种多步蒸馏框架,结合分步蒸馏与专家混合(MoE),提升模型容量并减少学习难度,通过分步分布匹配和子区间内分数匹配改进生成多样性与视觉保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16489 2026-03-18 cs.CV cs.AI 70%

Unlearning for One-Step Generative Models via Unbalanced Optimal Transport

通过不平衡最优传输实现一步生成模型的反学习

Hyundo Choi, Junhyeong An, Jinseong Park, Jaewoong Choi

机构 * Sungkyunkwan University(成均馆大学) Korea Institute for Advanced Study(韩国高级研究院)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出UOT-Unlearn框架,通过不平衡最优传输实现一步生成模型的反学习,平衡遗忘成本与f-散度惩罚,提升去学习效果和保留质量。

Comments 27 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15271 2026-03-17 cs.CV 70%

Flash-Unified: A Training-Free and Task-Aware Acceleration Framework for Native Unified Models

Flash-Unified: 一种无需训练且任务感知的加速框架用于原生统一模型

Junlong Ke, Zichen Wen, Boxue Yang, Yantai Yang, Xuyang Liu, Chenfei Liao, Zhaorun Chen, Shaobo Wang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Sichuan University(四川大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Chicago(芝加哥大学)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出FlashU框架,通过任务感知的网络剪枝和动态层跳过,减少统一模型的计算冗余,提升生成和理解任务的推理速度,实验表明在Show-o2数据集上加速1.78至2.01倍,保持SOTA性能。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11675 2026-03-13 cs.CV 70%

PROMO: Promptable Outfitting for Efficient High-Fidelity Virtual Try-On

PROMO: 可提示的高效高保真虚拟试衣

Haohua Chen, Tianze Zhou, Wei Zhu, Runqi Wang, Yandong Guan, Dejia Song, Yibo Chen, Xu Tang, Yao Hu, Lu Sheng, Zhiyong Wu

专题命中 效率与蒸馏 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 PROMO通过流匹配DiT框架和潜在多模态条件拼接,实现高效高保真虚拟试衣,平衡保真度与效率。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09488 2026-03-12 cs.CV 70%

Streaming Autoregressive Video Generation via Diagonal Distillation

通过对角蒸馏实现流式自回归视频生成

Jinxiu Liu, Xuanming Liu, Kangfu Mei, Yandong Wen, Ming-Hsuan Yang, Weiyang Liu

机构 * South China University of Technology(南方科技大学) Westlake University(西湖大学) Johns Hopkins University(约翰霍普金斯大学) University of California, Merced(加州大学默塞德分校) The Chinese University of Hong Kong(香港中文大学)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出对角蒸馏方法,通过不对称生成策略和隐式光学流建模,在减少计算步骤的同时提升视频生成的运动质量和效率。

Comments ICLR 2026 (31 pages, 10 figures, project page: https://spherelab.ai/diagdistill/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15971 2026-03-11 cs.LG cs.AI cs.CV cs.NE 70%

B-DENSE: Branching For Dense Ensemble Network Supervision Efficiency

B-DENSE:密集ense网络监督效率的分支方法

Cherish Puniani, Tushar Kumar, Arnav Bendre, Gaurav Kumar, Shree Singhi

机构 * Indian Institute of Technology, Roorkee(印度理工学院拉胡尔分校)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 B-DENSE通过多分支轨迹对齐方法,提升密集ense网络的监督效率,实现更高质量的图像生成。

Comments 11 pages, 5 figures, 4 algorithms and 2 tables. ICLR DeLTa 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07276 2026-03-10 cs.CV cs.LG stat.ML 70%

Variational Flow Maps: Make Some Noise for One-Step Conditional Generation

变分流映射:为一步条件生成引入噪声

Abbas Mammadov, So Takao, Bohan Chen, Ricardo Baptista, Morteza Mardani, Yee Whye Teh, Julius Berner

机构 * University of Oxford(牛津大学) California Institute of Technology(加州理工学院) University of Toronto(多伦多大学) NVIDIA(英伟达公司)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 变分流映射通过学习初始噪声分布,实现单步条件生成,提升逆问题求解效率和样本保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24240 2026-03-02 cs.CV 70%

Joint Geometric and Trajectory Consistency Learning for One-Step Real-World Super-Resolution

联合几何与轨迹一致性学习用于一步现实世界超分辨率

Chengyan Deng, Zhangquan Chen, Li Yu, Kai Zhang, Xue Zhou, Wang Zhang

机构 * University of Electronic Science(电子科学大学) Tsinghua University(清华大学) Nanjing University(南京大学)

专题命中 效率与蒸馏 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 GTASR通过引入轨迹对齐和双参考结构校正,解决现实世界超分辨率中的几何解耦和一致性漂移问题,实现高效且高质量的一步生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03442 2026-02-10 cs.CV 70%

MAMBO-G: Magnitude-Aware Mitigation for Boosted Guidance

MAMBO-G:基于幅度的提升引导抑制

Shangwen Zhu, Qianyu Peng, Zhilei Shu, Yuting Hu, Zhantao Yang, Han Zhang, Zhao Pu, Andy Zheng, Xinyu Cui, Jian Zhao, Ruili Feng, Fan Cheng

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) University of Waterloo(滑铁卢大学) Chinese Academy of Sciences(中国科学院) Zhongguancun Academy(中关村学院)

专题命中 效率与蒸馏 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 MAMBO-G通过动态优化引导幅度,显著降低计算成本,实现视频生成任务的高效加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05909 2026-02-06 cs.CV 70%

CLIP-Map: Structured Matrix Mapping for Parameter-Efficient CLIP Compression

CLIP-Map: 结构化矩阵映射用于参数高效的CLIP压缩

Kangjie Zhang, Wenxuan Huang, Xin Zhou, Boxiang Zhou, Dejia Song, Yuan Xie, Baochang Zhang, Lizhuang Ma, Nemo Chen, Xu Tang, Yao Hu, Shaohui Lin

机构 * East China Normal University(东华师范大学) Xiaohongshu Inc.(小红书公司) Beihang University(北航大学)

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 CLIP-Map通过结构化矩阵映射和克罗内克因子分解实现参数高效的CLIP压缩,有效保留原始权重信息并在高压缩比下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02571 2026-02-04 cs.LG cs.AI cs.CV 70%

Trajectory Consistency for One-Step Generation on Euler Mean Flows

Euler均流用于欧拉步生成的轨迹一致性

Zhiqi Li, Yuchen Sun, Duowen Chen, Jinjin He, Bo Zhu

机构 * College of Computing, Georgia Tech, Location, Country(计算学院,佐治亚理工学院)

专题命中 效率与蒸馏 :image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出Euler均流框架,通过线性替代物实现长时间轨迹一致性,提升生成稳定性与效率,减少训练时间和内存消耗。

Comments 40 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05150 2026-01-29 cs.CV 70%

TwinFlow: Realizing One-step Generation on Large Models with Self-adversarial Flows

TwinFlow: 在大模型上实现一步生成的自对抗流

Zhenglin Cheng, Peng Sun, Jianguo Li, Tao Lin

机构 * Inclusion AI Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Zhejiang University(浙江大学)

专题命中 效率与蒸馏 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 TwinFlow 提出了一种无需预训练教师模型和标准对抗网络的一步生成框架,实现了在大模型上高效生成,提升了推理效率并降低了计算成本。

Comments arxiv v1, accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17171 2026-01-28 cs.CV 70%

Generation then Reconstruction: Accelerating Masked Autoregressive Models via Two-Stage Sampling

生成然后重建:通过两阶段采样加速遮蔽自回归模型

Feihong Yan, Peiru Wang, Yao Zhu, Kaiyu Pang, Qingyan Wei, Huiqi Li, Linfeng Zhang

机构 * Beijing Institute of Technology(北京理工大学) EPIC Lab, SJTU(上海交通大学EPIC实验室) Tsinghua University(清华大学)

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 GtR通过两阶段采样加速遮蔽自回归模型,实现3.72倍速度提升并保持高质量生成。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17160 2026-01-22 cs.CV 70%

Can Synthetic Images Serve as Effective and Efficient Class Prototypes?

合成图像能否作为有效的高效类别原型?

Dianxing Shi, Dingjie Fu, Yuqiao Liu, Jun Wang

机构 * Beijing Research Institute of Uranium Geology(铀矿北京研究机构) Huazhong University of Science and Technology(华中科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Great Bay University(大湾大学)

专题命中 效率与蒸馏 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 LGCLIP通过大语言模型生成类别特定提示,利用扩散模型合成参考图像,以实现高效的零样本分类。

Comments Accepted by IEEE ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02594 2026-01-07 eess.IV cs.AI cs.CV 70%

Annealed Langevin Posterior Sampling (ALPS): A Rapid Algorithm for Image Restoration with Multiscale Energy Models

退火拉格朗日后验采样(ALPS):一种用于图像修复的多尺度能量模型快速算法

Jyothi Rikhab Chand, Mathews Jacob

机构 * University of Virginia(弗吉尼亚大学)

专题命中 效率与蒸馏 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 ALPS通过多尺度能量模型和退火拉格朗日后验采样,提升图像修复和MRI重建的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏