arXivDaily arXiv每日学术速递 周一至周五更新

作者

Kaiming He

Computer Vision

共收录 80
2607.09024 2026-07-13 cs.CV cs.AI 新提交

Video Generation Models are General-Purpose Vision Learners

视频生成模型是通用视觉学习者

Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander, Andrew Zisserman, Joao Carreira, Kaiming He, Misha Andriluka, Eduard Gabriel Bazavan, Andrei Zanfir, Cristian Sminchisescu

机构 * Google DeepMind(谷歌DeepMind)

AI总结 研究探讨计算机视觉中实现通用模型的催化剂,提出大规模文本到视频生成是预训练范式。介绍GenCeption模型,利用视频生成扩散主干定义感知模型。实验表明该模型在多任务中性能领先,有数据效率优势且具涌现行为,为通用视觉智能提供基础路径。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10938 2026-06-29 cs.CL cs.AI cs.LG 版本更新

ELF: Embedded Language Flows

ELF:嵌入式语言流

Keya Hu, Linlu Qiu, Yiyang Lu, Hanhong Zhao, Tianhong Li, Yoon Kim, Jacob Andreas, Kaiming He

机构 * MIT(麻省理工学院)

AI总结 本文提出ELF,一种基于连续时间流匹配的连续嵌入空间扩散模型,通过最小调整即可在离散领域有效工作,实验显示其在生成质量与采样步骤上优于现有模型。

Comments Tech report. arXiv v2: add distillation results in Appendix B. https://linlu-qiu.github.io/assets/html/elf_pd.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20329 2026-06-05 cs.CV cs.AI

Image Generators are Generalist Vision Learners

图像生成器是通用视觉学习者

Valentin Gabeur, Shangbang Long, Songyou Peng, Paul Voigtlaender, Shuyang Sun, Yanan Bao, Karen Truong, Zhicheng Wang, Wenlei Zhou, Jonathan T. Barron, Kyle Genova, Nithish Kannen, Sherry Ben, Yandong Li, Mandy Guo, Suhas Yogin, Yiming Gu, Huizhong Chen, Oliver Wang, Saining Xie, Howard Zhou, Kaiming He, Thomas Funkhouser, Jean-Baptiste Alayrac, Radu Soricut

机构 * Google(谷歌)

AI总结 本文研究了图像生成器在视觉理解中的通用学习能力,通过引入Vision Banana模型,展示了图像生成训练如何像语言模型预训练一样,使模型在多种视觉任务中取得最佳性能,证明了图像生成预训练在构建基础视觉模型中的核心作用。

Comments Project Page: http://vision-banana.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20399 2026-05-21 cs.LG

GeoPT: Scaling Physics Simulation via Lifted Geometric Pre-Training

GeoPT:通过提升几何预训练实现物理模拟的扩展

Haixu Wu, Minghao Guo, Zongyi Li, Zhiyang Dou, Mingsheng Long, Kaiming He, Wojciech Matusik

机构 * MIT CSAIL Tsinghua University(清华大学)

AI总结 本文提出GeoPT,一种基于提升几何预训练的通用物理模拟预训练模型,通过合成动态增强几何,实现动态感知的自监督学习,从而提升物理模拟的效率和效果。

Comments Project Page: https://physics-scaling.github.io/GeoPT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22158 2026-05-12 cs.CV

One-step Latent-free Image Generation with Pixel Mean Flows

无需潜在变量的一步图像生成:像素均值流

Yiyang Lu, Susie Lu, Qiao Sun, Hanhong Zhao, Zhicheng Jiang, Xianbang Wang, Tianhong Li, Zhengyang Geng, Kaiming He

机构 * MIT(麻省理工学院)

AI总结 本文提出像素均值流(pMF),通过分离网络输出空间与损失空间,实现无需潜在变量的一步图像生成,在ImageNet上取得优异结果。

Comments Tech report. Code at https://github.com/Lyy-iiis/pMF

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02012 2026-05-12 cs.CV cs.LG

Improved Mean Flows: On the Challenges of Fastforward Generative Models

改进的均值流:关于快速前向生成模型挑战的研究

Zhengyang Geng, Yiyang Lu, Zongze Wu, Eli Shechtman, J. Zico Kolter, Kaiming He

机构 * CMU(卡内基梅隆大学) MIT(麻省理工学院) Adobe(Adobe公司) THU(清华大学)

AI总结 本文改进了MeanFlow框架,通过重新参数化训练目标和指导机制,提升了训练稳定性与灵活性,实现了在ImageNet上的1.72 FID成绩。

Comments Technical report. Code at https://github.com/Lyy-iiis/imeanflow

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04770 2026-02-09 cs.LG cs.CV

Generative Modeling via Drifting

通过漂移进行生成建模

Mingyang Deng, He Li, Tianhong Li, Yilun Du, Kaiming He

机构 * MIT(麻省理工学院) Harvard University(哈佛大学)

AI总结 本文提出漂移模型,通过在训练过程中演进化分布实现一步生成,取得ImageNet上优异的生成效果。

Comments Project page: https://lambertae.github.io/projects/drifting/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13720 2026-01-08 cs.CV

Back to Basics: Let Denoising Generative Models Denoise

回归基础:让去噪生成模型去噪

Tianhong Li, Kaiming He

机构 * MIT(麻省理工学院)

AI总结 本文提出通过直接预测干净数据的JiT模型,在高维空间中实现有效的去噪生成模型,展示在ImageNet上取得竞争性结果。

Comments Tech report. Code at https://github.com/LTH14/JiT

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10953 2025-12-12 cs.LG cs.CV

Bidirectional Normalizing Flow: From Data to Noise and Back

双向归一化流:从数据到噪声和回

Yiyang Lu, Qiao Sun, Xianbang Wang, Zhicheng Jiang, Hanhong Zhao, Kaiming He

机构 * MIT(麻省理工学院) Tsinghua University(清华大学)

AI总结 本文提出BiFlow,一种无需精确解析反演的双向归一化流框架,通过学习反向模型提升生成质量并加速采样,实现更灵活的损失函数和架构,在生成建模中取得优异性能。

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14761 2025-11-19 cs.CV cs.AI cs.LG

ARC Is a Vision Problem!

Keya Hu, Ali Cy, Linlu Qiu, Xiaoman Delores Ding, Runqian Wang, Yeyin Eva Zhu, Jacob Andreas, Kaiming He

机构 * MIT(麻省理工学院)

Comments Technical Report. Project webpage: https://github.com/lillian039/VARC

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13129 2025-11-19 cs.CV

Is Noise Conditioning Necessary for Denoising Generative Models?

Qiao Sun, Zhicheng Jiang, Hanhong Zhao, Kaiming He

机构 * MIT(麻省理工学院)

Comments Update ImageNet experiments (SiT with CFG). Update Appendix

Journal ref Proceedings of the 42nd International Conference on Machine Learning (ICML), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09027 2025-07-25 cs.CV cs.AI cs.LG

Diffuse and Disperse: Image Generation with Representation Regularization

Runqian Wang, Kaiming He

机构 * MIT(麻省理工学院)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10622 2025-06-17 cs.LG cs.AI cs.CL cs.CV

Transformers without Normalization

Jiachen Zhu, Xinlei Chen, Kaiming He, Yann LeCun, Zhuang Liu

机构 * FAIR, Meta(FAIR与Meta公司) New York University(纽约大学) MIT(麻省理工学院) Princeton University(普林斯顿大学)

Comments CVPR 2025; Project page: https://jiachenzhu.github.io/DyT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13447 2025-05-20 cs.LG cs.CV

Mean Flows for One-step Generative Modeling

Zhengyang Geng, Mingyang Deng, Xingjian Bai, J. Zico Kolter, Kaiming He

机构 * CMU(卡内基梅隆大学) MIT(麻省理工学院)

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20283 2025-04-09 cs.CV cs.GR

TetSphere Splatting: Representing High-Quality Geometry with Lagrangian Volumetric Meshes

Minghao Guo, Bohan Wang, Kaiming He, Wojciech Matusik

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07596 2025-03-11 cs.LG cs.AI

Denoising Hamiltonian Network for Physical Reasoning

Congyue Deng, Brandon Y. Feng, Cecilia Garraffo, Alan Garbarz, Robin Walters, William T. Freeman, Leonidas Guibas, Kaiming He

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08632 2025-03-04 cs.CV cs.LG

A Decade's Battle on Dataset Bias: Are We There Yet?

Zhuang Liu, Kaiming He

Comments Published in ICLR 2025 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17437 2025-02-26 cs.LG cs.CV

Fractal Generative Models

Tianhong Li, Qinyi Sun, Lijie Fan, Kaiming He

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20510 2025-01-03 cs.CV

Physically Compatible 3D Object Modeling from a Single Image

Minghao Guo, Bohan Wang, Pingchuan Ma, Tianyuan Zhang, Crystal Elaine Owens, Chuang Gan, Joshua B. Tenenbaum, Kaiming He, Wojciech Matusik

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11838 2024-11-04 cs.CV

Autoregressive Image Generation without Vector Quantization

Tianhong Li, Yonglong Tian, He Li, Mingyang Deng, Kaiming He

Comments Neurips 2024 (Spotlight). Code: https://github.com/LTH14/mar

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03701 2024-11-04 cs.CV

Return of Unconditional Generation: A Self-supervised Representation Generation Method

Tianhong Li, Dina Katabi, Kaiming He

Comments Neurips 2024 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13863 2024-10-18 cs.CV cs.LG

Fluid: Scaling Autoregressive Text-to-image Generative Models with Continuous Tokens

Lijie Fan, Tianhong Li, Siyang Qin, Yuanzhen Li, Chen Sun, Michael Rubinstein, Deqing Sun, Kaiming He, Yonglong Tian

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20537 2024-10-01 cs.RO cs.CV cs.LG

Scaling Proprioceptive-Visual Learning with Heterogeneous Pre-trained Transformers

Lirui Wang, Xinlei Chen, Jialiang Zhao, Kaiming He

Comments See the project website (https://liruiw.github.io/hpt/) for code and videos

Journal ref Neurips 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16380 2024-05-28 cs.LG quant-ph

Dynamic Inhomogeneous Quantum Resource Scheduling with Reinforcement Learning

Linsen Li, Pratyush Anand, Kaiming He, Dirk Englund

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.14404 2024-01-26 cs.CV cs.LG

Deconstructing Denoising Diffusion Models for Self-Supervised Learning

Xinlei Chen, Zhuang Liu, Saining Xie, Kaiming He

Comments Technical report, 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1605.06409 2023-12-12 cs.CV

R-FCN: Object Detection via Region-based Fully Convolutional Networks

Jifeng Dai, Yi Li, Kaiming He, Jian Sun

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.00794 2023-03-31 cs.CV

Scaling Language-Image Pre-training via Masking

Yanghao Li, Haoqi Fan, Ronghang Hu, Christoph Feichtenhofer, Kaiming He

Comments Tech report; arXiv v2: update scaling results and add code repo

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.09113 2022-10-24 cs.CV cs.LG

Masked Autoencoders As Spatiotemporal Learners

Christoph Feichtenhofer, Haoqi Fan, Yanghao Li, Kaiming He

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.16527 2022-06-13 cs.CV

Exploring Plain Vision Transformer Backbones for Object Detection

Yanghao Li, Hanzi Mao, Ross Girshick, Kaiming He

Comments Tech report. arXiv v2: add RetinaNet results

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.06377 2021-12-21 cs.CV

Masked Autoencoders Are Scalable Vision Learners

Kaiming He, Xinlei Chen, Saining Xie, Yanghao Li, Piotr Dollár, Ross Girshick

Comments Tech report. arXiv v2: add more transfer learning results; v3: add robustness evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏