arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 115 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 115 篇

2608.12203 2026-08-13 cs.CV 新提交 57%

GeoFlow: Efficient Driving Video Generation via Geometry-Aligned Priors

GeoFlow:基于几何对齐先验的高效驾驶视频生成

Jiazheng Liu, Hang Li, Jiawei Zhang, Jiahe Li, Xiaohan Yu, Shengyin Fan, Jin Zheng, Xiao Bai

机构 * Beihang University(北京航空航天大学) Macquarie University(麦考瑞大学) Tianyi Transportation Technology Co., Ltd(天宜交通科技有限公司) Jiangxi Research Institute, Beihang University(北京航空航天大学江西研究院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 GeoFlow是一款新型驾驶视频生成框架,通过构建几何对齐先验分布替代标准高斯噪声初始化,可提升生成效率与少步生成质量,减少推理步骤。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09637 2026-08-11 cs.CV cs.AI 新提交 57%

DUET: A Diversity-Quality Duet of Distillation Experts for Two-Step Video Generation

DUET:用于两步视频生成的蒸馏专家的多样性-质量二重奏

Zian Li, Litong Gong, Borui Liao, Pengfei Liu, Xinyu Wang, Xinyuan Wei, Yifan Gao, Tiezheng Ge, Muhan Zhang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出DUET模型,通过噪声级专家二重奏协调两步视频生成中质量与多样性的权衡,经改进的DUET+进一步提升质量并保留多样性优势,效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03218 2026-08-05 cs.CV cs.AI 新提交 57%

Self-Supervised Representation-Guided Generative Dataset Distillation

自监督表示引导的生成式数据集蒸馏

Mingzhuo Li, Guang Li, Linfeng Ye, Jiafeng Mao, Takahiro Ogawa, Konstantinos N. Plataniotis, Miki Haseyama

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SRG框架,将SSL几何转化为扩散引导,通过分阶段引导策略实现数据集蒸馏,在多数据集和IPC设置下优于生成式基线,可跨预训练表示空间迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02504 2026-08-04 cs.CV 新提交 57%

Token Radius Attention for Efficient Video Generation

用于高效视频生成的 Token 半径注意力机制

Jiayu Chen, Zhikun Jiang, Maoliang Li, Jiayi Luo, Jiawei Yang, Zihao Zheng, Hengyi Zhang, Guojie Luo, Xiang Chen

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对视频扩散 Transformer 自注意力计算成本高的问题,提出 Token 半径注意力机制,在多种视频生成模型配置上实现了高效加速,同时保持了良好的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01288 2026-08-04 cs.CV 新提交 57%

TurboClear: One-Step Object-Effect Removal via Region-Calibrated Distribution Matching and Fusion

TurboClear:基于区域校准分布匹配与融合的单步对象-效果去除方法

Jiawei Guo, Junxian Li, Yixin Tang, Bingya Zhang, Jiaxin Lu, Yulun Zhang, Shangchen Zhou

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于SDXL的单步对象-效果去除模型TurboClear,通过区域校准分布匹配与可学习空间融合,大幅降低计算开销且保持良好视觉质量,效率优于相关基线方法。

Comments Code: https://github.com/GuoCalix/TurboClear

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00769 2026-08-04 cs.CV 新提交 57%

ChordVideo: One-Step, Training-Free, Temporally Consistent Video Editing via Low-Energy Transport

ChordVideo:基于低能量传输的一步式、无训练、时间一致的视频编辑

Zhiqiang Lao

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 ChordVideo扩展低能量原理到视频时间,通过共享噪声等技术解决ChordEdit的视频编辑时间问题,在TGVE/DAVIS上多指标提升,步数远少于多步编辑器

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00537 2026-08-04 cs.CV 新提交 57%

Hybrid-Domain Posterior Sampling for Inverse Problems via Latent Flow Matching

基于潜在流匹配的混合域后验采样用于逆问题

Hongjie Wu, Yiping Xie, Jiancheng Lv

机构 * College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 效率与蒸馏 :image synthesis(abstract);分类 cs.CV

AI总结 针对潜在流模型应用于逆问题的一阶流形盲区瓶颈,提出混合域后验采样框架,结合朗之万动力学与潜在对齐,在多类逆问题上取得新的最优性能。

Comments Accepted to ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28144 2026-07-31 eess.IV cs.CV 新提交 57%

ReGenVC: End-to-End Real-Time Generative Video Coding at Ultra-Low Bitrate

ReGenVC:超低位率下的端到端实时生成式视频编码

Zheyuan Zhang, Johnson Wu

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 ReGenVC是首个结合超低位率编码与实时解码的端到端生成式视频编解码器,通过技术优化实现24 fps输出,内存占用显著降低。

Comments 12 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27755 2026-07-31 cs.CV 新提交 57%

EgoGVAE: Ego-body Mesh Reconstruction via Guided Variational Autoencoder

EgoGVAE:基于引导变分自编码器的自我身体网格重建

Jaehun Jung, Wonjun Kim

机构 * Konkuk University(建国大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对仅用头部姿态重建全身网格的难题,提出EgoGVAE方法,通过引导变分自编码器实现一步采样,推理速度比扩散方法快50倍以上,在基准数据集上提升了重建性能。

Comments 18 pages, 6 figures, Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27113 2026-07-30 cs.CV 新提交 57%

Veritas++: Value-aware On-Policy Distillation for Perception-Enhanced AIGI Detection

Veritas++:面向感知增强的AIGI检测的值感知在线策略蒸馏

Hao Tan, Jun Lan, Zichang Tan, Ajian Liu, Zijian Yu, Chuanbiao Song, Huijia Zhu, Weiqiang Wang, Jun Wan, Zhen Lei

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences (UCAS)(中国科学院大学先进交叉科学学院) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院) Ant Group(蚂蚁集团) Sangfor Technologies Inc.(深信服科技股份有限公司)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 该研究针对现有AIGI检测模型的感知瓶颈,提出Veritas++框架,通过PoRL与VaOPD机制增强感知能力,提升了检测泛化性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24377 2026-07-28 cs.LG cs.AI cs.CV 新提交 57%

MXAttention: Data-Free Optimal Scaling and Pre-Normalization Quantization for MXFP4 Attention

MXAttention:用于MXFP4注意力的数据无关最优缩放和预归一化量化

Jianlin Yu, Jing Lin, Linghui Kong, Aiyue Chen, Weiyi Sun, Chenyu Zeng, Wangli Lan, Jinxi Li, Zhuo Zheng, Ziyang Yue, Danning Ke, Fei Yi, Tianchi Hu, Yuan Ding, Yiwu Yao, Junsong Wang

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对基于扩散的视频生成模型中注意力二次成本的瓶颈,提出MXAttention框架,通过引入通用最优缩放和预归一化量化组件,缩小了MXFP4与FP16的成像质量差距,提升了帧级相似度,且性能与强大基线竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21553 2026-07-24 cs.CV 新提交 57%

SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation

SANA-Video 2.0:具有注意力残差的混合线性注意力用于高效视频生成

Junsong Chen, Jincheng Yu, Yitong Li, Shuchen Xue, Haozhe Liu, Jingyu Xin, Yuyang Zhao, Tian Ye, Zhangjie Wu, Zian Wang, Daquan Zhou, Ping Luo, Song Han, Enze Xie

机构 * NVIDIA(英伟达)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 SANA-Video 2.0是一种混合视频扩散Transformer,采用混合线性-softmax注意力和块注意力残差,在单个GPU上生成高质量视频,成本大幅降低,实现可扩展长时、高分辨率视频生成,性能与大模型竞争且速度更快。

Comments 13 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20940 2026-07-24 cs.CV 新提交 57%

Ms. Forcing: Efficient Streaming Video Generation with Multi-Scale Patchification and Attention

Ms. Forcing:通过多尺度分块和注意力实现高效流视频生成

Zekun Li, Xiaoyan Cong, Hongyu Li, Zhiyang Dou, Chuan Guo, Abhay Mittal, Sizhe An, Srinath Sridhar

机构 * Brown University(布朗大学) Massachusetts Institute of Technology(麻省理工学院) Meta

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 研究针对流视频生成中传统方法的不足,提出Ms. Forcing范式,通过多尺度分块和注意力调整空间粒度,引入均匀噪声水平DMD减少不匹配,该方法提升了效率,在单个H200 GPU上性能显著优于Rolling Forcing。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18230 2026-07-21 cs.CV cs.AI 新提交 57%

Simple Domain Generalization for Strong Pixel-Level Image Tampering Detection in Modern VLMs

现代视觉语言模型中用于强像素级图像篡改检测的简单域泛化

Yi Tang, Xinyi Shang, Jiacheng Cui, Sondos Mahmoud Bsharat, Jiacheng Liu, Xiaohan Zhao, Tran Dinh Tien, Ahmed Elhagry, Salwa K. Al Khatib, Tianjun Yao, Yonina C. Eldar, Jing-Hao Xue, Hao Li, Salman Khan, Zhiqiang Shen

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University College London(伦敦大学学院) Weizmann Institute of Science(魏茨曼科学研究所)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 研究现代视觉语言模型中像素级图像篡改检测的域泛化,提出基于平衡小批量采样和后期注入策略的简单训练框架,大幅提升平均gIoU和cIoU,增强了篡改定位和分布外鲁棒性。

Comments Our code is available at https://github.com/VILA-Lab/PIXAR-DG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16361 2026-07-21 cs.CV 新提交 57%

Spatial Transport of Integration Error in Generative ODEs

生成常微分方程中积分误差的空间传输

Songheng Yin

机构 * Columbia University(哥伦比亚大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 研究生成常微分方程中积分误差的空间传输问题,通过带符号的源和传输计算,利用单步截断残差和结构破坏零值等方法分析误差,还发现训练惩罚注入变化可降误差,模型可据此训练改变。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14976 2026-07-17 cs.CV 新提交 57%

From Draft to Draft-Free: One-Step Video Object Removal via Privileged Distillation and Fast Planting

从带草稿到无草稿:通过特权蒸馏和快速植入实现一步视频对象移除

Zizhao Chen, Ping Wei, Guang Dai, Jingdong Wang, Mengmeng Wang

机构 * Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所) SGIT AI Lab, State Grid Corporation of China(国家电网公司SGIT人工智能实验室) Zhejiang University of Technology(浙江工业大学) Baidu(百度)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 研究视频对象移除问题,提出D2DF框架,通过特权蒸馏和自引导快速植入模块,将教师模型多步细化能力提炼到学生模型,实现一步视频对象移除,在质量和效率上优于传统及多步生成方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08766 2026-07-10 cs.CV 新提交 57%

OPSD-V: On-Policy Self-Distillation for Post-Training Few-Step Autoregressive Video Generators

OPSD-V:用于训练后少步自回归视频生成器的策略内自蒸馏

Hongyu Liu, Chun Wang, Feng Gao, Xuanhua He, Yue Ma, Ziyu Wan, Yong Zhang, Xiaoming Wei, Qifeng Chen

机构 * Meituan(美团) HKUST(香港科技大学) City University of Hong Kong(香港城市大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 研究针对训练后少步自回归视频生成器存在的问题,提出OPSD-V策略内自蒸馏范式。通过引入真实长视频数据提供监督,学生和教师模型按特定方式运行,应用该范式于相关模型后,实验及用户研究表明其在多方面有改进且更受青睐。

Comments Project page: https://meigen-ai.github.io/OPSD-V ; Code: https://github.com/MeiGen-AI/OPSD-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08020 2026-07-10 cs.CV 新提交 57%

SAGA: Stable Acceleration Guidance for Autoregressive Video Generation

SAGA:自回归视频生成的稳定加速引导

Thanh-Nhan Vo, Trong-Thuan Nguyen, Trung-Hoang Le, Tam V. Nguyen, Minh-Triet Tran

机构 * University of Science, VNU-HCM(越南胡志明市国家大学) Vietnam National University(越南国家大学) University of Dayton(Dayton 大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 研究自回归视频生成中因重复使用潜在变量致时间误差问题,提出SAGA方法,它整合加速域频谱引导目标与初始化策略,无需训练可直接用于现有模型,能提升时间质量、减少时间不稳定性并保持视觉保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06631 2026-07-09 cs.CV cs.AI cs.LG 新提交 57%

Dynamic-in-Few-Step: Unifying Dynamic Computation and Few-Step Distillation for Efficient Video Generation

动态少步长:统一动态计算与少步长蒸馏以实现高效视频生成

Yu Cheng, Siyue Yao, Zhongang Qi, Shanyan Guan, Wei Li, Fajie Yuan

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) BlueImage, vivo(蓝城图像,维沃) Xian Jiaotong-Liverpool University(西交利物浦大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对视频扩散模型计算成本高问题,提出将动态结构稀疏化融入蒸馏过程的加速框架,联合优化去噪步骤与模型稀疏性,引入相关策略和机制确保训练稳定,开发推理引擎,有效提升效率且保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06481 2026-07-08 cs.CV cs.AI 新提交 57%

Prompt-Adapter Context Routing for Parameter-Efficient Multi-Shot Long Video Extrapolation

用于参数高效多镜头长视频外推的提示适配器上下文路由

Anna Córdoba, Adam Puente Tercero, Nerea Angulo Hijo, Mar Linares Tercero, Julia Barrientos, Ainhoa Miranda, Jesús Olivera

机构 * Instituto de Investigación en Visión Artificial(人工视觉研究所)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 研究多镜头长视频外推问题,提出PACR-Video框架,通过冻结文本到视频扩散变换器,用低秩时间适配器及递归提示库增强,结合特定调优目标和调度,在多基准测试中优于多种基线,证明其能为长视频外推提供可控能力。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05605 2026-07-08 cs.CV 新提交 57%

Patch Knowledge Transfer for Efficient AI-Generated Image Quality Assessment

用于高效人工智能生成图像质量评估的补丁知识转移

Jiquan Yuan

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 针对人工智能生成图像质量评估任务,主流方法存在计算成本高或评估准确性差的问题,提出基于知识蒸馏的补丁知识转移(PKT)框架,设计双模型架构,实验表明该框架能降低计算成本并平衡模型效率与评估准确性。

Comments 13 pages. ICME26 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03960 2026-07-07 cs.CV 新提交 57%

Reward Lightning: Fast Video Generation via Homologous Preference Distillation

奖励闪电:通过同源偏好蒸馏实现快速视频生成

Jiaxiang Cheng, Bing Ma, Xuhua Ren, Kai Yu, Peng Zhang, Tianxiang Zheng, Qinglin Lu

机构 * Tencent Hunyuan(腾讯混元)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 研究视频扩散模型中同时进行偏好对齐和蒸馏加速的挑战,提出统一框架Reward Lightning,利用同源原理在共享表示中对齐和加速模型,介绍潜在奖励模型和同源偏好蒸馏,实验证明其有效性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02220 2026-07-03 cs.CV 新提交 57%

DetailAnywhere: Fashion Detail Generation via Cross-Modal Feature Alignment Distillation

DetailAnywhere: 通过跨模态特征对齐蒸馏实现时尚细节生成

Zijun Li, Yimin Zhou, Jia Sun, Honglie Wang, Pengcheng Wei, Junlong Wu, Yongrui Heng, Jiyuan Wang, Huan Ouyang, Boheng Zhang, Huaiqing Wang, Dewen Fan, Qianqian Gan, Fan Yang, Tingting Gao

机构 * Kuaishou Technology(快手科技) AIM for Health Lab, Monash University(Monash大学AIM健康实验室)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对在线购物中用户关注服装细节(如领口、袖口、面料纹理)的需求,提出新任务“时尚细节生成”及基准FDBench,并设计跨模态特征对齐蒸馏(CFAD)方法,结合多模态扩散Transformer和一致性奖励模型,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00535 2026-07-02 cs.LG cs.AI cs.CV 新提交 57%

Flow-Map GRPO: Reinforcement Learning for Few-Step Flow-Map Generators via Anchored Stochastic Composition

Flow-Map GRPO:基于锚定随机组合的少步流映射生成器的强化学习

Zhiqi Li, Wen Zhang, Bo Zhu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 提出Flow-Map GRPO框架,通过锚定随机流映射组合(ASFMC)对确定性少步流映射生成器进行随机化,使其适用于强化学习后训练,并在FLUX文本到图像生成器上提升奖励和感知指标。

Comments 31 pages, 29 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18974 2026-06-26 cs.CV 新提交 57%

Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning

Visual-OPSD:用于高效统一多模态推理的跨模态在策略自蒸馏

Pengyu Li, Zhitao Gao, Lingling Zhang, Muye Huang, Yuanming Li, Fangzhi Xu, Jun Liu

机构 * Xi’an Jiaotong University(西安交通大学) MOE KLINNS Lab(MOE KLINNS实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室) Sun Yat-sen University(中山大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出Visual-OPSD方法,通过跨模态在策略自蒸馏,将多步扩散生成的可视化思维推理能力转移到纯文本学生模型,实现14.3倍加速且性能提升3.40个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25040 2026-06-25 cs.CV 新提交 57%

Chorus II: Cross-Request Sparsity Reuse for Efficient Image-to-Video Generation

Chorus II: 跨请求稀疏性重用用于高效图像到视频生成

Hao Liu, Chenghuan Huang, Hao Liu, Xing Cai, Chen Li, Ziyang Ma, Jing Lyu, Nong Xiao, Jiangsu Du

机构 * Sun Yat-sen University(中山大学) WeChat HPC, Tencent Inc.(腾讯微信高性能计算) WeChat Vision, Tencent Inc.(腾讯微信视觉)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对图像到视频生成中计算昂贵的问题,提出跨请求稀疏性重用框架,通过共享稀疏掩码重用避免在线预测,实现2.16倍加速且保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23743 2026-06-25 cs.CV cs.AI cs.LG 新提交 57%

Sol Video Inference Engine: Agent-Native Full-Stack Acceleration Framework for Efficient Video Generation

Sol视频推理引擎:面向高效视频生成的智能原生全栈加速框架

Yitong Li, Junsong Chen, Haopeng Li, Haozhe Liu, Jincheng Yu, Ligeng Zhu, Ping Luo, Song Han, Enze Xie

机构 * NVIDIA Research, Efficient AI Team & Singapore Lab(英伟达研究院高效AI团队及新加坡实验室) NVIDIA SANA Team(英伟达SANA团队) Codex GPT-Image2

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出Sol视频推理引擎,通过智能体驱动的缓存、稀疏注意力、令牌剪枝、量化和内核融合五种技术组合,针对具体模型、硬件和配置自动优化,实现视频扩散模型2倍以上加速且保持质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18478 2026-06-24 cs.CV 新提交 57%

Data-Forcing Distillation: Restoring Diversity and Fidelity in Few-Step Video Generation

数据强制蒸馏:恢复少步视频生成中的多样性和保真度

Siyi Chen, Shaowei Liu, Yixuan Jia, Zian Wang, Huan Ling, Qing Qu, Jun Gao

机构 * University of Michigan(密歇根大学) NVIDIA(英伟达) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对分布匹配蒸馏(DMD)在少步视频生成中出现的模式坍塌和过饱和问题,提出数据强制蒸馏(DFD)框架,通过教师评分差异引导学生接近真实数据分布,仅需一行代码修改即可恢复多样性和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22089 2026-06-23 cs.CV 新提交 57%

BAC-JEPA: Label-Efficient Breast Arterial Calcification Segmentation via Synthetic Mammography-Guided Supervision

BAC-JEPA: 通过合成乳腺X线摄影引导的标签高效乳腺动脉钙化分割

Scott Chase Waggener, Lakshman Tamil

机构 * Department of Computer Engineering University of Texas at Dallas Richardson, TX(计算机工程系)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 提出BAC-JEPA框架,利用合成动脉钙化图像和自监督视觉Transformer,实现无需像素级人工标注的乳腺动脉钙化分割,在BacSeg数据集上达到AUROC 0.8719。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21982 2026-06-23 cs.CV 新提交 57%

CoDMD: Copula-aware Distribution Matching Distillation for Fast Video Generation

CoDMD: 基于Copula感知的分布匹配蒸馏用于快速视频生成

Wenhu Zhang, Kun Cheng, Changyuan Wang, Shiyao Li, Yuechen Zhang, Wenbo Li, Jiajun Zha, Jingyi Zhang, Kang Zhao, Jiaya Jia

机构 * HKUST(香港科技大学) Wan Team, Alibaba Group(阿里巴巴集团万团队) THU(清华大学) CUHK(香港中文大学) XDU(西安电子科技大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对视频扩散模型少步蒸馏中分布匹配蒸馏(DMD)的结构缺陷,提出Copula感知的DMD(CoDMD),通过轻量关系正则化器利用分数估计构建样本间和帧间关系矩阵,实现4步生成,速度提升约25倍,VBench得分达84.87。

详情

展开后加载摘要…

URL PDF HTML 收藏