arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2542 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 2542 篇

2603.21619 2026-03-24 cs.CV cs.AI 57%

Efficient Zero-Shot AI-Generated Image Detection

高效的人工智能生成图像检测

Ryosuke Sonoda, Ramya Srinivasan

机构 * Fujitsu Ltd., Japan(日本富士通株式会社) Fujitsu Research of America, Inc., USA(美国富士通研究公司)

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的图像检测方法,通过测量表示对结构化频率扰动的敏感性,实现对细微篡改的检测,方法计算效率高,检测速度比现有方法快一个到两个数量级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20690 2026-03-24 cs.CV 57%

MFSR: MeanFlow Distillation for One Step Real-World Image Super Resolution

MFSR:用于一步真实世界图像超分辨率的MeanFlow蒸馏

Ruiqing Wang, Kai Zhang, Yuanzhi Zhu, Hanshu Yan, Shilin Lu, Jian Yang

机构 * Nanjing University(南京大学) LIX, École Polytechnique, CNRS, IPP(巴黎高等学院LIX研究所、法国国家科学研究中心、ipp) Salesforce AI Research(Salesforce人工智能研究) Nanyang Technological University(南洋理工大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 MFSR提出一种单步蒸馏框架,通过MeanFlow作为学习目标,实现高效高质量的图像超分辨率,同时保留少量步骤的可选路径以进一步优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12060 2026-03-24 cs.LG cs.AI cs.CV 57%

Your VAR Model is Secretly an Efficient and Explainable Generative Classifier

你的VAR模型实际上是一个高效且可解释的生成分类器

Yi-Chung Chen, David I. Inouye, Jing Gao

机构 * Elmore Family School of Electrical and Computer Engineering(埃洛姆家族电气与计算机工程学院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于视觉自回归模型的新型生成分类器,引入A-VARC+提升准确率与推理速度,展示VAR方法在可解释性和灾难性遗忘抵抗方面的独特优势。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09465 2026-03-20 cs.CV 57%

OFTSR: One-Step Flow for Image Super-Resolution with Tunable Fidelity-Realism Trade-offs

OFTSR: 一种用于图像超分辨率的一步流方法,具有可调保真度-现实感权衡

Yuanzhi Zhu, Ruiqing Wang, Shilin Lu, Junnan Li, Hanshu Yan, Kai Zhang

机构 * Nanjing University(南京大学) Nanyang Technological University(南洋理工大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出OFTSR,一种基于流的图像超分辨率框架,通过可调保真度与现实感权衡实现一步生成。通过训练条件流模型并应用特殊约束,使学生模型预测与教师模型采样轨迹对齐,从而提升性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18572 2026-03-20 eess.IV cs.CV 57%

UEPS: Robust and Efficient MRI Reconstruction

UEPS:鲁棒且高效的MRI重建

Xiang Zhou, Hong Shang, Zijian Zhan, Tianyu He, Jintao Meng, Dong Liang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, China(深圳先进技术研究院,中国科学院,中国) School of Biomedical Engineering, Shenzhen University Medical School, Shenzhen University, China(生物医学工程学院,深圳大学医学院,深圳大学,中国) University of Chinese Academy of Sciences, China(中国科学院大学,中国) Faculty of Computer Science and Artificial Intelligence, Shenzhen University of Advanced Technology, China(计算机科学与人工智能学院,深圳先进技术大学,中国) State Key Laboratory of Biomedical Imaging Science and System, Chinese Academy of Sciences, China(生物医学成像科学与系统国家重点实验室,中国科学院,中国)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出UEPS框架,通过消除CSM依赖、渐进分辨率和稀疏注意力机制,提升MRI重建的鲁棒性和效率,在多种临床转移测试中表现优异。

Comments The document contains the main paper and additional experimental details in the supplementary material. Open-source code can be found at: https://github.com/HongShangGroup/UEPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14331 2026-03-19 cs.CV 57%

AvatarForcing: One-Step Streaming Talking Avatars via Local-Future Sliding-Window Denoising

AvatarForcing:通过局部-未来滑动窗口去噪实现一步流式谈话 avatars

Liyuan Cui, Wentao Hu, Wenyuan Zhang, Zesong Yang, Fan Shi, Xiaoqiang Liu

机构 * Zhejiang University(浙江大学) Beijing University of Posts and Telecommunications(北京邮电大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Tsinghua University(清华大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出AvatarForcing,一种一步流式扩散框架,通过局部-未来滑动窗口去噪实现高实时性谈话 avatars,实验证明其在34ms/帧下具备高质量视觉和唇同步性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01419 2026-03-19 cs.CV 57%

Towards One-step Causal Video Generation via Adversarial Self-Distillation

基于对抗自蒸馏的单步因果视频生成

Yongqi Yang, Huayang Huang, Xu Peng, Xiaobin Hu, Donghao Luo, Jiangning Zhang, Chengjie Wang, Yu Wu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Tencent YouTu Lab(腾讯优图实验室) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于蒸馏的高效因果视频生成框架,通过对抗自蒸馏策略提升生成质量,结合首帧增强策略减少误差传播,实验表明在单步和双步视频生成中优于现有方法。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15279 2026-03-17 cs.LG cs.CV 57%

Faster Inference of Flow-Based Generative Models via Improved Data-Noise Coupling

通过改进的数据-噪声耦合实现流基生成模型的更快推理

Aram Davtyan, Leello Tadesse Dadi, Volkan Cevher, Paolo Favaro

机构 * University of Bern(伯尔尼大学) EPFL(苏黎世联邦理工学院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出LOOM-CFM方法,通过优化 minibatch OT 跨 minibatch 的 assignments,提升流基生成模型在样本速度与质量间的平衡,支持高分辨率潜在空间合成和蒸馏初始化。

Comments Patched from ICLR2025. Code: https://github.com/araachie/loom-cfm

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13438 2026-03-17 cs.CV cs.AI 57%

Draft-and-Target Sampling for Video Generation Policy

视频生成策略的草稿与目标采样

Qikang Zhang, Yingjie Lei, Wei Liu, Daochang Liu

机构 * South China Normal University(华南师范大学) University of Western Australia(西澳大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种无训练的扩散推理范式,通过自play去噪方法提升视频生成效率,实验表明在三个基准上实现2.1倍加速,同时保持高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08629 2026-03-17 cs.CV 57%

Dynamic Mixture-of-Experts for Visual Autoregressive Model

动态专家混合模型用于视觉自回归模型

Jort Vincenti, Metod Jazbec, Guoxuan Xia

机构 * University of Amsterdam(阿姆斯特丹大学) UvA-Bosch Delta Lab(UvA-博斯奇Delta实验室) Imperial College London(伦敦帝国学院)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 本文提出一种动态专家混合路由机制,用于改进视觉自回归模型,通过规模感知阈值策略在不额外训练的情况下提升效率和质量,实现20%的FLOPs减少和11%的推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12036 2026-03-13 cs.CV physics.optics 57%

Single Pixel Image Classification using an Ultrafast Digital Light Projector

单像素图像分类使用超快数字光投影仪

Aisha Kanwal, Graeme E. Johnstone, Fahimeh Dehkhoda, Johannes H. Herrnsdorf, Robert K. Henderson, Martin D. Dawson, Xavier Porte, Michael J. Strain

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 本研究利用单像素成像技术与低复杂度机器学习模型,实现超快图像分类,通过空间时间变换避免图像重建,展示其在超快成像中的异常检测潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10893 2026-03-12 cs.CV 57%

S2D: Sparse to Dense Lifting for 3D Reconstruction with Minimal Inputs

S2D:基于稀疏到密集的3D重建方法,使用最少输入

Yuzhou Ji, Qijian Tian, He Zhu, Xiaoqi Jiang, Guangzhi Cao, Lizhuang Ma, Yuan Xie, Xin Tan

机构 * Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Chery Automobile(奇瑞汽车)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 S2D通过稀疏到密集的提升方法,在最少输入下实现高质量的3DGS重建,提升稀疏点云和3DGS的一致性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10583 2026-03-12 cs.CV 57%

Attribution as Retrieval: Model-Agnostic AI-Generated Image Attribution

属性作为检索:模型无关的AI生成图像属性

Hongsong Wang, Renxi Cheng, Chaolei Han, Jie Gui

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 本文提出了一种模型无关的AI生成图像归因方法LIDA,通过实例检索问题解决深度伪造检测和图像归因的挑战。

Comments To appear in CVPR 2026, Code is at https://github.com/hongsong-wang/LIDA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10340 2026-03-12 cs.CV cs.AI cs.RO cs.SY eess.SY 57%

Overcoming Visual Clutter in Vision Language Action Models via Concept-Gated Visual Distillation

通过概念门控视觉蒸馏克服视觉杂乱

Sangmim Song, Sarath Kodagoda, Marc Carmichael, Karthick Thiyagarajan

机构 * University of Technology Sydney(技术大学悉尼大学) Western Sydney University(西悉尼大学)

专题命中 效率与蒸馏 :inpainting(abstract);分类 cs.CV

AI总结 本研究提出概念门控视觉蒸馏方法,通过视觉蒸馏技术解决杂乱环境中视觉语言动作模型的精度-推理间隙问题,显著提升机器人操作的成功率。

Comments 7 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12229 2026-03-12 cs.CV 57%

Ultra-Low Bitrate Perceptual Image Compression with Shallow Encoder

超低比特率感知图像压缩与浅层编码

Tianyu Zhang, Dong Liu, Chang Wen Chen

机构 * University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种非对称极值图像压缩框架,利用浅层编码器和单步扩散解码器实现超低比特率下的高保真度重建,同时提升编码效率和解码速度。

Comments Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07799 2026-03-10 cs.CV cs.RO 57%

MWM: Mobile World Models for Action-Conditioned Consistent Prediction

MWM: 移动世界模型用于动作条件一致预测

Han Yan, Zishang Xiang, Zeyu Zhang, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机科学系)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 MWM提出了一种移动世界模型,通过两阶段训练框架和推理一致状态蒸馏提升动作条件一致性的图像目标导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07476 2026-03-10 cs.CV 57%

EVLF: Early Vision-Language Fusion for Generative Dataset Distillation

EVLF: 早期视觉-语言融合用于生成数据集蒸馏

Wenqi Cai, Yawen Zou, Guang Li, Chunzhi Gu, Chao Zhang

机构 * University of Toyama(东福冈大学) Hokkaido University(北海道大学) University of Fukui(福井大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 EVLF通过早期视觉-语言融合提升生成数据集蒸馏的语义准确性和视觉一致性。

Comments CVPR2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07192 2026-03-10 cs.CV 57%

FastSTAR: Spatiotemporal Token Pruning for Efficient Autoregressive Video Synthesis

FastSTAR: 空间时间令牌修剪用于高效的自回归视频合成

Sungwoong Yune, Suheon Jeong, Joo-Young Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 FastSTAR通过时空令牌修剪和部分更新机制,实现高效视频生成,在保持质量的同时提升处理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10466 2026-03-10 cs.LG cs.AI cs.CR cs.CV 57%

Efficient Semi-Supervised Adversarial Training via Latent Clustering-Based Data Reduction

通过基于潜在聚类的数据减少实现高效的半监督对抗训练

Somrita Ghosh, Yuelin Xu, Xiao Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA信息安全赫尔姆霍兹中心)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于潜在聚类的数据减少方法,有效降低半监督对抗训练的数据和计算需求,同时保持鲁棒性优势。

Comments Shorter version of this work accepted by NextGenAISafety Workshop at ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06449 2026-03-09 cs.CV 57%

CaTok: Taming Mean Flows for One-Dimensional Causal Image Tokenization

CaTok:通过Mean流平滑均值流以实现一维因果图像标记化

Yitong Chen, Zuxuan Wu, Xipeng Qiu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究所,复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 CaTok 通过 MeanFlow 解码器实现一维因果图像标记化,提升图像生成与重建性能。

Comments Project website is available in https://sharelab-sii.github.io/catok-web

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13669 2026-03-09 cs.CV cs.AI cs.LG 57%

CanvasMAR: Improving Masked Autoregressive Video Prediction With Canvas

CanvasMAR: 通过Canvas提升遮蔽自回归视频预测

Zian Li, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University, Beijing, China(人工智能研究院,北京大学,北京,中国) School of Intelligence Science and Technology, Peking University, Beijing, China(智能科学与技术学院,北京大学,北京,中国) State Key Laboratory of General Artificial Intelligence, Peking University, Beijing, China(通用人工智能国家重点实验室,北京大学,北京,中国)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 CanvasMAR通过引入canvas机制和运动感知采样顺序,提升视频生成的保真度和效率,实现更高质量的视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05503 2026-03-06 cs.CV 57%

Accelerating Text-to-Video Generation with Calibrated Sparse Attention

通过校准稀疏注意力加速文本到视频生成

Shai Yehezkel, Shahar Yadin, Noam Elata, Yaron Ostrovsky-Berman, Bahjat Kawar

机构 * Apple Tel Aviv University(苹果以色列大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 CalibAtt通过校准稀疏注意力提升文本到视频生成的效率,实现1.58倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01776 2026-03-06 cs.CL cs.AI cs.CV 57%

FreeAct: Freeing Activations for LLM Quantization

FreeAct: 为LLM量化释放激活

Xiaohao Liu, Xiaobo Xia, Manyi Zhang, Ji-Fu Li, Xianzhi Yu, Fei Shen, Xiu Su, See-Kiong Ng, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Huawei Technology(华为技术有限公司) Central South University(中央南大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 FreeAct通过放松静态转换约束,为LLM量化提供动态适应的激活转换方法,实现性能提升5.3%。

Comments 26 pages, 18 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05589 2026-03-06 cs.CV cs.AI cs.LG 57%

ReactDance: Hierarchical Representation for High-Fidelity and Coherent Long-Form Reactive Dance Generation

ReactDance: 基于分层表示的高保真且一致的长形式反应舞蹈生成

Jingzhong Lin, Xinru Li, Yuanyuan Qi, Bohao Zhang, Wenxiang Liu, Kecheng Tang, Wenxuan Huang, Xiangfeng Xu, Bangyan Li, Changbo Wang, Gaoqi He

机构 * East China Normal University(东华师范大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 ReactDance通过分层潜在空间和非自回归采样策略,提升长形式反应舞蹈生成的高保真度与时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04379 2026-03-05 cs.CV 57%

Helios: Real Real-Time Long Video Generation Model

Helios:实时长视频生成模型

Shenghai Yuan, Yuanyang Yin, Zongjian Li, Xinwei Huang, Xiao Yang, Li Yuan

机构 * Peking University(北京大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 Helios是首个无需并行框架、能实时生成长视频且质量媲美基线模型的14B视频生成模型。

Comments Page: pku-yuangroup.github.io/Helios-Page

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01515 2026-03-04 cs.CV 57%

FACE: A Face-based Autoregressive Representation for High-Fidelity and Efficient Mesh Generation

FACE:一种基于面部的自回归表示,用于高保真和高效的网格生成

Hanxiao Wang, Yuan-Chen Guo, Ying-Tian Liu, Zi-Xin Zou, Biao Zhang, Weize Quan, Ding Liang, Yan-Pei Cao, Dong-Ming Yan

机构 * CASIA UCAS VAST KAUST

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 FACE提出了一种基于面的自回归表示方法,通过在面级别生成网格,显著提高3D网格生成的效率和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01757 2026-03-03 cs.CV 57%

StepVAR: Structure-Texture Guided Pruning for Visual Autoregressive Models

StepVAR: 结构-纹理引导的视觉自回归模型剪枝

Keli Liu, Zhendong Wang, Wengang Zhou, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV

AI总结 StepVAR通过结合结构和纹理重要性,提出无需训练的token剪枝框架,实现视觉自回归模型的高效推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15657 2026-03-03 cs.LG cs.CV 57%

SoFlow: Solution Flow Models for One-Step Generative Modeling

SoFlow:用于一步生成建模的解流模型

Tianze Luo, Haotian Yuan, Zhuang Liu

机构 * Princeton University(普林斯顿大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 SoFlow通过引入流匹配损失和解一致性损失,实现从头开始的一步生成建模,提升生成性能并优化计算效率。

Comments Accepted to ICLR 2026. Our code is available at https://github.com/zlab-princeton/SoFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07399 2026-02-24 cs.CV cs.LG 57%

StreamDiffusionV2: A Streaming System for Dynamic and Interactive Video Generation

StreamDiffusionV2:动态交互视频生成的流式系统

Tianrui Feng, Zhi Li, Shuo Yang, Haocheng Xi, Muyang Li, Xiuyu Li, Lvmin Zhang, Keting Yang, Kelly Peng, Song Han, Maneesh Agrawala, Kurt Keutzer, Akio Kodaira, Chenfeng Xu

机构 * Stanford University(斯坦福大学) MIT(麻省理工学院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 StreamDiffusionV2通过无训练管道和系统级优化,实现了低延迟、高效率的实时视频生成,支持灵活的去噪步骤和多GPU扩展,推动生成直播的实用化和普及。

Comments Accepted by MLSys 2026. Project Page: http://streamdiffusionv2.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08318 2026-02-24 cs.CV 57%

LinVideo: A Post-Training Framework towards O(n) Attention in Efficient Video Generation

LinVideo: 一种面向高效视频生成的O(n)注意力后训练框架

Yushi Huang, Xingtong Ge, Ruihao Gong, Chengtao Lv, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学) Beihang University(北航) Sensetime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 LinVideo提出一种高效的无数据后训练框架,通过选择性迁移将部分自注意力模块替换为线性注意力,从而在保持性能的同时显著提升视频生成效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏