arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3055 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 128 篇

2607.05605 2026-07-08 cs.CV 新提交 57%

Patch Knowledge Transfer for Efficient AI-Generated Image Quality Assessment

用于高效人工智能生成图像质量评估的补丁知识转移

Jiquan Yuan

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 针对人工智能生成图像质量评估任务,主流方法存在计算成本高或评估准确性差的问题,提出基于知识蒸馏的补丁知识转移(PKT)框架,设计双模型架构,实验表明该框架能降低计算成本并平衡模型效率与评估准确性。

Comments 13 pages. ICME26 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03960 2026-07-07 cs.CV 新提交 57%

Reward Lightning: Fast Video Generation via Homologous Preference Distillation

奖励闪电:通过同源偏好蒸馏实现快速视频生成

Jiaxiang Cheng, Bing Ma, Xuhua Ren, Kai Yu, Peng Zhang, Tianxiang Zheng, Qinglin Lu

机构 * Tencent Hunyuan(腾讯混元)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 研究视频扩散模型中同时进行偏好对齐和蒸馏加速的挑战,提出统一框架Reward Lightning,利用同源原理在共享表示中对齐和加速模型,介绍潜在奖励模型和同源偏好蒸馏,实验证明其有效性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02220 2026-07-03 cs.CV 新提交 57%

DetailAnywhere: Fashion Detail Generation via Cross-Modal Feature Alignment Distillation

DetailAnywhere: 通过跨模态特征对齐蒸馏实现时尚细节生成

Zijun Li, Yimin Zhou, Jia Sun, Honglie Wang, Pengcheng Wei, Junlong Wu, Yongrui Heng, Jiyuan Wang, Huan Ouyang, Boheng Zhang, Huaiqing Wang, Dewen Fan, Qianqian Gan, Fan Yang, Tingting Gao

机构 * Kuaishou Technology(快手科技) AIM for Health Lab, Monash University(Monash大学AIM健康实验室)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对在线购物中用户关注服装细节(如领口、袖口、面料纹理)的需求,提出新任务“时尚细节生成”及基准FDBench,并设计跨模态特征对齐蒸馏(CFAD)方法,结合多模态扩散Transformer和一致性奖励模型,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00535 2026-07-02 cs.LG cs.AI cs.CV 新提交 57%

Flow-Map GRPO: Reinforcement Learning for Few-Step Flow-Map Generators via Anchored Stochastic Composition

Flow-Map GRPO:基于锚定随机组合的少步流映射生成器的强化学习

Zhiqi Li, Wen Zhang, Bo Zhu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 提出Flow-Map GRPO框架,通过锚定随机流映射组合(ASFMC)对确定性少步流映射生成器进行随机化,使其适用于强化学习后训练,并在FLUX文本到图像生成器上提升奖励和感知指标。

Comments 31 pages, 29 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18974 2026-06-26 cs.CV 新提交 57%

Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning

Visual-OPSD:用于高效统一多模态推理的跨模态在策略自蒸馏

Pengyu Li, Zhitao Gao, Lingling Zhang, Muye Huang, Yuanming Li, Fangzhi Xu, Jun Liu

机构 * Xi’an Jiaotong University(西安交通大学) MOE KLINNS Lab(MOE KLINNS实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室) Sun Yat-sen University(中山大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出Visual-OPSD方法,通过跨模态在策略自蒸馏,将多步扩散生成的可视化思维推理能力转移到纯文本学生模型,实现14.3倍加速且性能提升3.40个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25040 2026-06-25 cs.CV 新提交 57%

Chorus II: Cross-Request Sparsity Reuse for Efficient Image-to-Video Generation

Chorus II: 跨请求稀疏性重用用于高效图像到视频生成

Hao Liu, Chenghuan Huang, Hao Liu, Xing Cai, Chen Li, Ziyang Ma, Jing Lyu, Nong Xiao, Jiangsu Du

机构 * Sun Yat-sen University(中山大学) WeChat HPC, Tencent Inc.(腾讯微信高性能计算) WeChat Vision, Tencent Inc.(腾讯微信视觉)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对图像到视频生成中计算昂贵的问题,提出跨请求稀疏性重用框架,通过共享稀疏掩码重用避免在线预测,实现2.16倍加速且保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23743 2026-06-25 cs.CV cs.AI cs.LG 新提交 57%

Sol Video Inference Engine: Agent-Native Full-Stack Acceleration Framework for Efficient Video Generation

Sol视频推理引擎:面向高效视频生成的智能原生全栈加速框架

Yitong Li, Junsong Chen, Haopeng Li, Haozhe Liu, Jincheng Yu, Ligeng Zhu, Ping Luo, Song Han, Enze Xie

机构 * NVIDIA Research, Efficient AI Team & Singapore Lab(英伟达研究院高效AI团队及新加坡实验室) NVIDIA SANA Team(英伟达SANA团队) Codex GPT-Image2

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出Sol视频推理引擎,通过智能体驱动的缓存、稀疏注意力、令牌剪枝、量化和内核融合五种技术组合,针对具体模型、硬件和配置自动优化,实现视频扩散模型2倍以上加速且保持质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18478 2026-06-24 cs.CV 新提交 57%

Data-Forcing Distillation: Restoring Diversity and Fidelity in Few-Step Video Generation

数据强制蒸馏:恢复少步视频生成中的多样性和保真度

Siyi Chen, Shaowei Liu, Yixuan Jia, Zian Wang, Huan Ling, Qing Qu, Jun Gao

机构 * University of Michigan(密歇根大学) NVIDIA(英伟达) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对分布匹配蒸馏(DMD)在少步视频生成中出现的模式坍塌和过饱和问题,提出数据强制蒸馏(DFD)框架,通过教师评分差异引导学生接近真实数据分布,仅需一行代码修改即可恢复多样性和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22089 2026-06-23 cs.CV 新提交 57%

BAC-JEPA: Label-Efficient Breast Arterial Calcification Segmentation via Synthetic Mammography-Guided Supervision

BAC-JEPA: 通过合成乳腺X线摄影引导的标签高效乳腺动脉钙化分割

Scott Chase Waggener, Lakshman Tamil

机构 * Department of Computer Engineering University of Texas at Dallas Richardson, TX(计算机工程系)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 提出BAC-JEPA框架,利用合成动脉钙化图像和自监督视觉Transformer,实现无需像素级人工标注的乳腺动脉钙化分割,在BacSeg数据集上达到AUROC 0.8719。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21982 2026-06-23 cs.CV 新提交 57%

CoDMD: Copula-aware Distribution Matching Distillation for Fast Video Generation

CoDMD: 基于Copula感知的分布匹配蒸馏用于快速视频生成

Wenhu Zhang, Kun Cheng, Changyuan Wang, Shiyao Li, Yuechen Zhang, Wenbo Li, Jiajun Zha, Jingyi Zhang, Kang Zhao, Jiaya Jia

机构 * HKUST(香港科技大学) Wan Team, Alibaba Group(阿里巴巴集团万团队) THU(清华大学) CUHK(香港中文大学) XDU(西安电子科技大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对视频扩散模型少步蒸馏中分布匹配蒸馏(DMD)的结构缺陷,提出Copula感知的DMD(CoDMD),通过轻量关系正则化器利用分数估计构建样本间和帧间关系矩阵,实现4步生成,速度提升约25倍,VBench得分达84.87。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21705 2026-06-23 cs.CV 新提交 57%

Structural Assessment for Understanding and Guiding Dataset Distillation in Discrete Token Space

结构评估用于理解和指导离散令牌空间中的数据集蒸馏

Yue Cao, Jianyang Gu, Vyacheslav Kungurtsev, Yu Hu, Jozsef Hamari, Zheng Liu, Mohsen Zardadi

机构 * The University of British Columbia(不列颠哥伦比亚大学) The Ohio State University(俄亥俄州立大学) Czech Technical University in Prague(布拉格捷克理工大学) TerraSense Analytics(TerraSense Analytics公司)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文通过离散视觉分词器分析令牌组成结构,提出结构评分衡量令牌组合充分性,发现平衡的令牌组成提升蒸馏数据集性能,并指导扩散模型的数据集蒸馏。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19970 2026-06-19 cs.CV 新提交 57%

CrossFlow: One-Step Generation Across Latent and Pixel Spaces

CrossFlow: 跨潜在空间与像素空间的单步生成

Xiyuan Wang, Xiao Zhang, Yang Li, Ruoxi Jiang, Zhao Zhong, Liefeng Bo, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Tencent(腾讯) Fudan University(复旦大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出CrossFlow,一种跨空间流模型,将噪声潜在输入直接映射到像素图像,通过无速度单步目标实现潜在到像素的生成,并替代潜在扩散中的解码器,在ImageNet-1k上达到1.62 FID。

Comments Preprint, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18702 2026-06-18 cs.CV 新提交 57%

UniTemp: Unlocking Video Generation in Any Temporal Order via Bidirectional Distillation

UniTemp: 通过双向蒸馏实现任意时间顺序的视频生成

Lin Zhang, Sicheng Mo, Zefan Cai, Jinhong Lin, Zihao Lin, Jiuxiang Gu, Krishna Kumar Singh, Yuheng Li, Yin Li

机构 * University of Wisconsin Madison(威斯康星大学麦迪逊分校) Adobe Research(Adobe 研究院) University of California Los Angeles(加利福尼亚大学洛杉矶分校) University of California Davis(加利福尼亚大学戴维斯分校)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出UniTemp框架,通过双向蒸馏训练单个自回归模型,支持任意时间方向(前向、后向、中间插值)的视频生成,解决因果3D VAE在后向生成中的不连续性,提升可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12072 2026-06-11 cs.CV 新提交 57%

World Model Self-Distillation: Training World Models to Solve General Tasks

世界模型自蒸馏:训练世界模型以解决通用任务

Sebastian Stapf, Pablo Acuaviva Huertos, Aram Davtyan, Paolo Favaro

机构 * Department of Computer Science(计算机科学系)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出结合自蒸馏与强化学习的框架,从预训练视频生成器中提取任务解决能力,无需配对任务视频,在基准测试中超越原始模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11363 2026-06-11 cs.CV 新提交 57%

NSVQ: Mitigating Codebook Collapse by Stabilizing Encoder Drift in Vector Quantization

NSVQ: 通过稳定向量量化中的编码器漂移缓解码本崩溃

Hao Lu, Yongxin Guo, Onur Koyun, Zhengjie Zhu, Abbas Alili, Metin N. Gurcan

机构 * Wake Forest University School of Medicine(维克森林大学医学院) Advocate Health(倡导健康)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出NSVQ训练策略,通过非平稳嵌入损失、码本替换和分阶段编码器冻结,缓解大码本VQ中的码本崩溃,在ImageNet-1k上提升重建质量并保持100%码本利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08302 2026-06-09 cs.CV 新提交 57%

HACK++: Towards More Effective Head-Aware Key-Value Compression for Efficient Visual Autoregressive Modeling

HACK++:面向高效视觉自回归建模的更有效的头部感知键值压缩

Ziran Qin, Yuchen Jiang, Mingbao Lin, Youru Lv, Hang Guo, Wen Fei, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Rakuten(乐天) Tsinghua University(清华大学)

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 针对VAR模型跨尺度KV缓存导致的高计算和内存开销,提出无训练头部感知压缩框架HACK++,通过离线分类头部类型和自适应预算分配,在极低缓存预算下保持近无损生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19906 2026-08-21 cs.LG 新提交 50%

PETA:Parameter-Efficient Test-Time Adaptation for Virtual Screening

PETA:用于虚拟筛选的参数高效测试时自适应方法

Jia-Qi Lin, Yinghua Yao, Chang-Dong Wang, Yew-Soon Ong, Yuangang Pan

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本研究提出参数高效测试时自适应框架PETA,仅更新预训练虚拟筛选模型约0.03%的LayerNorm参数,在测试时通过构建特定负样本等方式自适应,性能优于预训练及全重训练基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19209 2026-08-21 physics.comp-ph physics.chem-ph 新提交 50%

Physics-Informed Neural Networks as Fast Surrogate Models for Electrochemical Flow Reactors

用于电化学流动反应器快速替代模型的物理信息神经网络

Eric Fernández-García, Miguel Modestino, Sergio Maldonado

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本研究提出物理信息神经网络(PINN),将其作为电化学流动反应器的快速替代模型,经验证精度高、速度快,为低计算成本的数字孪生建模提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19116 2026-08-20 cond-mat.mtrl-sci 新提交 50%

JANUS: A Multi-modal Foundation Neural Sampler for Disordered Materials

JANUS:面向无序材料的多模态基础神经采样器

Denis Blessing, Mouyang Cheng, Maximilian Schebek, Jutta Rogal, Mingda Li, Carles Domingo-Enrich, Yuanqi Du

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 研究人员开发JANUS多模态神经采样器,用于无序材料的热力学采样,其以远少于传统方法的能量评估次数重现平衡性质,可用于合金逆设计及半导体缺陷探索,为相关研究提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18954 2026-08-20 astro-ph.HE 新提交 50%

Constraining Cosmic-Ray Acceleration and Escape in Middle-Aged Supernova Remnants with GeV-TeV Gamma-Ray Observations

利用GeV-TeV伽马射线观测约束中年超新星遗迹中的宇宙射线加速与逃逸

Siyu Chen, Bing Theodore Zhang, Yi Xing, Siming Liu

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本研究通过对四个中年超新星遗迹的伽马射线辐射开展时变研究,结合多望远镜观测,约束了宇宙射线加速与逃逸参数,揭示逃逸宇宙射线对其甚高能辐射及中微子通量的重要影响。

Comments 11 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17022 2026-08-19 math.PR math.AP 新提交 50%

Sharp hypocoercive convergence estimates for underdamped Langevin dynamics with specular reflection

Hengrong Du, Qi Feng, Lingjiong Zhu

专题命中 效率与蒸馏 :diffusion(abstract)

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13932 2026-08-17 cs.LG 新提交 50%

Post-training Quantization for Hybrid Iterative Generative Models

混合迭代生成模型的训练后量化

Jing Gao, Junyi Wu, Wei Wang, Yan Yan, Yao Zhao

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学研究所) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 针对混合迭代生成模型训练后量化易引发模型崩溃的问题,提出HyGenQ框架,通过分层聚类解耦与缩放重校准,成功将其量化至8位精度且性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11019 2026-08-12 cs.LG 新提交 50%

DEFT: Data-Efficient Frequency-domain Top-k Sampling via Inverse Discrete Fourier Transform for Spatiotemporal Dynamical Systems Modeling

DEFT:用于时空动力系统建模的、基于逆离散傅里叶变换的数据高效频域Top-k采样方法

Hengbo Xiao, Jiale Liu, Jiahao Song, Guannan He

机构 * Peking University(北京大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 DEFT是一种频域数据采样方法,通过逆离散傅里叶变换生成物理一致的训练数据,可减少数据需求且提升泛化能力,在多个PDE及电池退化系统建模任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10384 2026-08-12 cs.LG 新提交 50%

Generator-Guided Inverse Sampling for Lévy-Driven Generative Models

用于Lévy驱动生成模型的生成器引导逆采样

Tianfu Qi, Jun Wang, Jun Zhang

机构 * University of Electronic Science and Technology of China(电子科技大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文针对Lévy驱动生成模型的非局域反向过程挑战,提出生成器引导的结构化逆采样器,将动力学分解为三类分量,结合神经网络与解析分布实现高效采样,在OFDM-SISO信道估计中表现出稳健性能与良好权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08638 2026-08-11 cs.SD cs.AI cs.CL 新提交 50%

CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents

CuteTTS:基于连续隐变量自回归建模的高效高保真语音合成

Yuqian Zhang, Yao Shi, Kexin Huang, Botian Jiang, Zhe Xu, Yiwei Zhao, Min Liang, Shuang Chen, Xipeng Qiu

机构 * Shanghai Innovation Institute(上海创新研究院) OPPO AI Center(OPPO人工智能中心) Fudan University(复旦大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 CuteTTS是结合语义对齐因果VAE隐变量等的连续自回归TTS系统,经引导步蒸馏后,在保持相当质量的同时降低了延迟,实现了高保真与低延迟的平衡。

Comments 20 pages, 6 figures, 10 tables. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08129 2026-08-11 cs.HC 新提交 50%

Understanding Security and Privacy Perceptions of Content Creators Regarding AI Labels of AI-Generated Content

理解内容创作者对AI生成内容的AI标签的安全与隐私认知

Shuning Zhang, Hui Wang, Rongjun Ma, Xin Yi, Kanye Ye Wang, Robert Xiao, Hewu Li

专题命中 效率与蒸馏 :image generation(abstract)

AI总结 本文通过对21位AIGC创作者访谈及多平台图像测试,揭示创作者对AI标签的认知偏差与规避行为,提出应开发适配创作者动机的隐式AI标签。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07648 2026-08-11 stat.ML cond-mat.dis-nn cond-mat.stat-mech cs.LG physics.comp-ph 新提交 50%

Leveraging generative models to assist Monte Carlo sampling

利用生成模型辅助蒙特卡洛采样

Marylou Gabrié

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本教程综述介绍了机器学习与计算统计物理交叉领域的新范式——用生成模型辅助蒙特卡洛采样,探讨相关方法方向及优劣势,为相关领域研究者提供入门基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07329 2026-08-10 math.OC math.AP 新提交 50%

Sampling and Optimization meet Enhanced Flows

采样与优化方法结合增强流

Yuan Gao, Siming He, Eitan Tadmor

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文针对采样与优化中核心的Gibbs概率测度计算问题,引入带增强耗散的输运-扩散动力学,设计了对应的采样数值算法与粒子系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06107 2026-08-07 cs.LG cs.NA math.NA 新提交 50%

Kastor: An efficient fine-tuning strategy for generative emulation of PDE simulations

Kastor:一种用于生成式模拟偏微分方程(PDE)仿真的高效微调策略

Guillaume Couairon, Alexis Jacq, Yu-Han Wu, Renu Singh, Yana Hasson, Quentin Berthet, Romuald Elie

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本研究提出Kastor微调策略,通过两阶段推理、均值预测正则化等方法改进物理基础模型,在The Well数据集上实现比Walrus更优的PDE仿真性能,降低预测误差并提升效率。

Comments 34 pages, 32 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05022 2026-08-06 cs.DS cs.NA math.NA math.PR math.ST stat.TH 新提交 50%

Exact simulation of diffusions and improved algorithms for log-concave sampling

扩散过程的精确模拟及对数凹采样的改进算法

Fan Chen, Sinho Chewi, Alexander Rakhlin, Matthew S. Zhang

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 该研究基于Girsanov定理的密度比无偏估计量,提出改进的扩散精确模拟及对数凹采样算法,优化了采样复杂度与维度依赖关系,还给出相关应用。

详情

展开后加载摘要…

URL PDF HTML 收藏