arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2537 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 2537 篇

2308.14244 2023-08-29 cs.CV cs.GR 62%

HoloFusion: Towards Photo-realistic 3D Generative Modeling

Animesh Karnewar, Niloy J. Mitra, Andrea Vedaldi, David Novotny

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.GR

Comments ICCV 2023 conference; project page at: https://holodiffusion.github.io/holofusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.12865 2023-07-25 cs.CV cs.GR cs.LG 62%

NeRF-GAN Distillation for Efficient 3D-Aware Generation with Convolutions

Mohamad Shahbazi, Evangelos Ntavelis, Alessio Tonioni, Edo Collins, Danda Pani Paudel, Martin Danelljan, Luc Van Gool

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.09582 2023-07-20 cs.CV cs.GR 62%

Guided Linear Upsampling

Shuangbing Song, Fan Zhong, Tianju Wang, Xueying Qin, Changhe Tu

专题命中 效率与蒸馏 :image editing(abstract);分类 cs.CV、cs.GR

Comments ACM SIGGRAPH

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.18193 2023-04-03 cs.CV cs.GR cs.LG 62%

GVP: Generative Volumetric Primitives

Mallikarjun B R, Xingang Pan, Mohamed Elgharib, Christian Theobalt

专题命中 效率与蒸馏 :image synthesis(abstract);分类 cs.CV、cs.GR

Comments https://vcai.mpi-inf.mpg.de/projects/GVP/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.12480 2021-11-25 cs.CV cs.GR cs.LG 62%

Octree Transformer: Autoregressive 3D Shape Generation on Hierarchically Structured Sequences

Moritz Ibing, Gregor Kobsik, Leif Kobbelt

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
cs/0511032 2009-12-01 cs.GR cs.CV 62%

Spatiotemporal sensistivity and visual attention for efficient rendering of dynamic environments

Yang Li Hector Yee

专题命中 效率与蒸馏 :image synthesis(abstract);分类 cs.CV、cs.GR

Journal ref ACM Transactions on Graphics, 20(1), January 2001

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12232 2024-12-18 cs.CV cs.AI cs.LG 61%

You Only Submit One Image to Find the Most Suitable Generative Model

Zhi Zhou, Lan-Zhe Guo, Peng-Xiao Song, Yu-Feng Li

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV;diffusion(comments)

Comments Accepted by NeurIPS 2023 Workshop on Diffusion Models

详情

展开后加载摘要…

URL PDF HTML 收藏
1707.09958 2017-08-04 cs.CV 61%

(k,q)-Compressed Sensing for dMRI with Joint Spatial-Angular Sparsity Prior

Evan Schwab, René Vidal, Nicolas Charon

专题命中 效率与蒸馏 :diffusion(abstract,comments);分类 cs.CV

Comments To be published in the 2017 Computational Diffusion MRI Workshop of MICCAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09233 2026-08-14 cs.LG cs.CV 版本更新 57%

DreOPD: Degraded-Reference Extrapolative On-Policy Distillation for Flow-matching Models

DreOPD:用于流匹配模型的退化参考外推式在线策略蒸馏

Mingfeng Lin, Chengfei Cai, Lin Xu, Yuxiang Wei, Liang Han

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Zhejiang University(浙江大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 本研究提出用于流匹配模型的DreOPD方法,将隐式奖励外推转为闭式速度回归并引入退化参考强化对比,在单/多教师设置下,其平均性能优于OPD及多任务RL基线,多数指标超专用教师。

Comments project page: https://sleepy1231.github.io/DreOPD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12203 2026-08-13 cs.CV 新提交 57%

GeoFlow: Efficient Driving Video Generation via Geometry-Aligned Priors

GeoFlow:基于几何对齐先验的高效驾驶视频生成

Jiazheng Liu, Hang Li, Jiawei Zhang, Jiahe Li, Xiaohan Yu, Shengyin Fan, Jin Zheng, Xiao Bai

机构 * Beihang University(北京航空航天大学) Macquarie University(麦考瑞大学) Tianyi Transportation Technology Co., Ltd(天宜交通科技有限公司) Jiangxi Research Institute, Beihang University(北京航空航天大学江西研究院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 GeoFlow是一款新型驾驶视频生成框架,通过构建几何对齐先验分布替代标准高斯噪声初始化,可提升生成效率与少步生成质量,减少推理步骤。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02474 2026-08-13 cs.CV 版本更新 57%

EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation

EchoCache:面向高效音频驱动视频生成的能量引导跨模态缓存

Jiayu Chen, Xiaoyu Wu, Rongshan Gao, Maoliang Li, Zihao Zheng, Xinhao Sun, Hailong Zou, Guojie Luo, Xiang Chen

机构 * Peking University(北京大学) Taiyuan University of Technology(太原理工大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 EchoCache是一种能量引导跨模态缓存框架,通过利用音频时频能量锚点与动态缓存机制,在保持音频驱动视频生成质量的同时,实现了2.46倍的推理加速,优化了延迟-质量权衡。

Comments EchoCache is honored to be accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09637 2026-08-11 cs.CV cs.AI 新提交 57%

DUET: A Diversity-Quality Duet of Distillation Experts for Two-Step Video Generation

DUET:用于两步视频生成的蒸馏专家的多样性-质量二重奏

Zian Li, Litong Gong, Borui Liao, Pengfei Liu, Xinyu Wang, Xinyuan Wei, Yifan Gao, Tiezheng Ge, Muhan Zhang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出DUET模型,通过噪声级专家二重奏协调两步视频生成中质量与多样性的权衡,经改进的DUET+进一步提升质量并保留多样性优势,效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07136 2026-08-10 cs.CV 版本更新 57%

MotionStrata: Hierarchical Motion Latents for Compact Video Autoencoding

MotionStrata:用于紧凑视频自编码的分层运动隐变量

Wenzhang Sun, Huaize Liu, Chunfeng Wang, Biao Gong, Hao Li, Changqing Zou

机构 * University of Chinese Academy of Sciences(中国科学院大学) Li Auto Zhejiang Lab(浙江实验室) State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 MotionStrata将运动预算分为全局与详细运动,在不增维度下实现分层表示,压缩时重建质量优于其他方法,为紧凑视频自编码提供新设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19161 2026-08-06 cs.CV 版本更新 57%

Flash-VAED: Plug-and-Play VAE Decoders for Efficient Video Generation

Flash-VAED: 用于高效视频生成的即插即用VAE解码器

Lunjie Zhu, Yushi Huang, Xingtong Ge, Yufei Xue, Zhening Liu, Yumeng Zhang, Zehong Lin, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 Flash-VAED通过通道剪枝和分阶段运算优化,实现了高效视频生成的高质量与高速度平衡。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03218 2026-08-05 cs.CV cs.AI 新提交 57%

Self-Supervised Representation-Guided Generative Dataset Distillation

自监督表示引导的生成式数据集蒸馏

Mingzhuo Li, Guang Li, Linfeng Ye, Jiafeng Mao, Takahiro Ogawa, Konstantinos N. Plataniotis, Miki Haseyama

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SRG框架,将SSL几何转化为扩散引导,通过分阶段引导策略实现数据集蒸馏,在多数据集和IPC设置下优于生成式基线,可跨预训练表示空间迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02504 2026-08-04 cs.CV 新提交 57%

Token Radius Attention for Efficient Video Generation

用于高效视频生成的 Token 半径注意力机制

Jiayu Chen, Zhikun Jiang, Maoliang Li, Jiayi Luo, Jiawei Yang, Zihao Zheng, Hengyi Zhang, Guojie Luo, Xiang Chen

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对视频扩散 Transformer 自注意力计算成本高的问题,提出 Token 半径注意力机制,在多种视频生成模型配置上实现了高效加速,同时保持了良好的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01288 2026-08-04 cs.CV 新提交 57%

TurboClear: One-Step Object-Effect Removal via Region-Calibrated Distribution Matching and Fusion

TurboClear:基于区域校准分布匹配与融合的单步对象-效果去除方法

Jiawei Guo, Junxian Li, Yixin Tang, Bingya Zhang, Jiaxin Lu, Yulun Zhang, Shangchen Zhou

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于SDXL的单步对象-效果去除模型TurboClear,通过区域校准分布匹配与可学习空间融合,大幅降低计算开销且保持良好视觉质量,效率优于相关基线方法。

Comments Code: https://github.com/GuoCalix/TurboClear

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00769 2026-08-04 cs.CV 新提交 57%

ChordVideo: One-Step, Training-Free, Temporally Consistent Video Editing via Low-Energy Transport

ChordVideo:基于低能量传输的一步式、无训练、时间一致的视频编辑

Zhiqiang Lao

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 ChordVideo扩展低能量原理到视频时间,通过共享噪声等技术解决ChordEdit的视频编辑时间问题,在TGVE/DAVIS上多指标提升,步数远少于多步编辑器

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00537 2026-08-04 cs.CV 新提交 57%

Hybrid-Domain Posterior Sampling for Inverse Problems via Latent Flow Matching

基于潜在流匹配的混合域后验采样用于逆问题

Hongjie Wu, Yiping Xie, Jiancheng Lv

机构 * College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 效率与蒸馏 :image synthesis(abstract);分类 cs.CV

AI总结 针对潜在流模型应用于逆问题的一阶流形盲区瓶颈,提出混合域后验采样框架,结合朗之万动力学与潜在对齐,在多类逆问题上取得新的最优性能。

Comments Accepted to ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14749 2026-08-04 eess.AS cs.CV 版本更新 57%

WanSong v1.0 Technical Report

万松v1.0技术报告

Binghui Chen, Pandeng Li, Yu Liu, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对音乐生成难题,提出万松方法,它是基于扩散的模型,可直接生成高保真多语言长歌曲并输出双声道,通过步长蒸馏加快推理,为微调定制提供途径,助力下游编辑任务。

Comments Wan Team, Alibaba Group

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30239 2026-08-04 cs.CV 版本更新 57%

CA-World: Multi-Object Counterfactual Alignment for Efficient Interactive-Ready Reconstruction

SAM3D-Phys:迈向真实世界中的多物体交互仿真

Xin Dong, Weijian Deng, Lihan Zhang, Tianru Dai, Wenfeng Deng, Yansong Tang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Pengcheng Laboratory(鹏城实验室)

专题命中 效率与蒸馏 :inpainting(abstract);分类 cs.CV

AI总结 提出SAM3D-Phys框架,结合场景重建与SAM3D生成式先验,从部分观测中恢复完整可仿真物体几何,并通过物理约束优化和掩码引导外观蒸馏实现场景一致性,支持多物体同时交互仿真。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05372 2026-08-04 cs.CV cs.AI 57%

Two Steps Are All You Need: Efficient 3D Point Cloud Anomaly Detection with Consistency Models

两步即可:基于一致性模型的高效3D点云异常检测

Pranav A, Shashank B, Pranav Siddappa, Dominik Seuss, Minal Moharir, Subramanya KN

机构 * R.V. College of Engineering(R.V. 工程学院) Technical University of Applied Sciences Würzburg-Schweinfurt(Würzburg-Schweinfurt 应用科学大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于一致性学习的重建异常检测方法,通过简化推理过程提升效率,实现低延迟的3D点云异常检测,适用于资源受限设备。

Comments Accepted to CVPR 2026, at the 9th Workshop on Efficient Deep Learning for Computer Vision (ECV). To be published in the IEEE/CVF CVPR 2026 Workshop Proceedings

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 3479-3487

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25318 2026-08-03 cs.CV 版本更新 57%

Dataset Distillation Based on Saliency-Driven Prototype Alignment

超越背景偏差:用于数据集蒸馏的显著性驱动原型对齐

Yawen Zou, Wenqi Cai, Guang Li, Ling Xiao, Chunzhi Gu, Chao Zhang

机构 * University of Toyama(富山大学) Hokkaido University(北海道大学) University of Fukui(福井大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对数据集蒸馏中基于扩散方法的局限性,提出显著性驱动蒸馏框架,通过两步构建类判别潜在原型,增强代表性与泛化能力,实验证明其性能优于强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28144 2026-07-31 eess.IV cs.CV 新提交 57%

ReGenVC: End-to-End Real-Time Generative Video Coding at Ultra-Low Bitrate

ReGenVC:超低位率下的端到端实时生成式视频编码

Zheyuan Zhang, Johnson Wu

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 ReGenVC是首个结合超低位率编码与实时解码的端到端生成式视频编解码器,通过技术优化实现24 fps输出,内存占用显著降低。

Comments 12 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27755 2026-07-31 cs.CV 新提交 57%

EgoGVAE: Ego-body Mesh Reconstruction via Guided Variational Autoencoder

EgoGVAE:基于引导变分自编码器的自我身体网格重建

Jaehun Jung, Wonjun Kim

机构 * Konkuk University(建国大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对仅用头部姿态重建全身网格的难题,提出EgoGVAE方法,通过引导变分自编码器实现一步采样,推理速度比扩散方法快50倍以上,在基准数据集上提升了重建性能。

Comments 18 pages, 6 figures, Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27113 2026-07-30 cs.CV 新提交 57%

Veritas++: Value-aware On-Policy Distillation for Perception-Enhanced AIGI Detection

Veritas++:面向感知增强的AIGI检测的值感知在线策略蒸馏

Hao Tan, Jun Lan, Zichang Tan, Ajian Liu, Zijian Yu, Chuanbiao Song, Huijia Zhu, Weiqiang Wang, Jun Wan, Zhen Lei

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences (UCAS)(中国科学院大学先进交叉科学学院) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院) Ant Group(蚂蚁集团) Sangfor Technologies Inc.(深信服科技股份有限公司)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 该研究针对现有AIGI检测模型的感知瓶颈,提出Veritas++框架,通过PoRL与VaOPD机制增强感知能力,提升了检测泛化性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11654 2026-07-30 cs.CV 版本更新 57%

Kinetic Mining in Context: Few-Shot Action Synthesis via Text-to-Motion Distillation

上下文中的动作合成:通过文本到运动蒸馏实现少样本动作合成

Luca Cazzola, Ahed Alboody

机构 * University of Trento(特伦托大学) CESI LINEACT

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 KineMIC通过文本到运动蒸馏实现少样本动作合成,提升HAR识别准确率23.1%

Comments To appear in the proceedings of 28th International Conference on Pattern Recognition (ICPR 2026). For references, please cite the official proceedings version. Paper website: https://lucazzola.github.io/kinemic-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02294 2026-07-30 cs.CV 版本更新 57%

Improving Knowledge Distillation Under Unknown Covariate Shift Through Confidence-Guided Data Augmentation

通过置信度引导的数据增强改进未知协变量偏移下的知识蒸馏

Niclas Popp, Kevin Alexander Laube, Matthias Hein, Lukas Schott

机构 * Bosch Center for Artificial Intelligence(博世人工智能中心) University of Tübingen(图宾根大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对未知协变量偏移下知识蒸馏效果受限的问题,提出置信度引导的扩散数据增强策略,经实验验证可提升多数据集上的相关准确率与虚假特征得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24377 2026-07-28 cs.LG cs.AI cs.CV 新提交 57%

MXAttention: Data-Free Optimal Scaling and Pre-Normalization Quantization for MXFP4 Attention

MXAttention:用于MXFP4注意力的数据无关最优缩放和预归一化量化

Jianlin Yu, Jing Lin, Linghui Kong, Aiyue Chen, Weiyi Sun, Chenyu Zeng, Wangli Lan, Jinxi Li, Zhuo Zheng, Ziyang Yue, Danning Ke, Fei Yi, Tianchi Hu, Yuan Ding, Yiwu Yao, Junsong Wang

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对基于扩散的视频生成模型中注意力二次成本的瓶颈,提出MXAttention框架,通过引入通用最优缩放和预归一化量化组件,缩小了MXFP4与FP16的成像质量差距,提升了帧级相似度,且性能与强大基线竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21553 2026-07-24 cs.CV 新提交 57%

SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation

SANA-Video 2.0:具有注意力残差的混合线性注意力用于高效视频生成

Junsong Chen, Jincheng Yu, Yitong Li, Shuchen Xue, Haozhe Liu, Jingyu Xin, Yuyang Zhao, Tian Ye, Zhangjie Wu, Zian Wang, Daquan Zhou, Ping Luo, Song Han, Enze Xie

机构 * NVIDIA(英伟达)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 SANA-Video 2.0是一种混合视频扩散Transformer,采用混合线性-softmax注意力和块注意力残差,在单个GPU上生成高质量视频,成本大幅降低,实现可扩展长时、高分辨率视频生成,性能与大模型竞争且速度更快。

Comments 13 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏