GEAR: Guided End-to-End AutoRegression for Image Synthesis
GEAR: 引导式端到端自回归图像合成
机构 * Peking University(北京大学) ; Tencent Hunyuan(腾讯混元)
AI总结 提出GEAR方法,通过表示对齐联合训练VQ分词器和自回归生成器,解决非可微索引导致的梯度问题,实现端到端优化,显著加速ImageNet gFID收敛并提升特征质量。
高校专区
GEAR: 引导式端到端自回归图像合成
机构 * Peking University(北京大学) ; Tencent Hunyuan(腾讯混元)
AI总结 提出GEAR方法,通过表示对齐联合训练VQ分词器和自回归生成器,解决非可微索引导致的梯度问题,实现端到端优化,显著加速ImageNet gFID收敛并提升特征质量。
RaBitQCache: 面向长上下文LLM推理中KVCache的旋转二值量化
机构 * School of Information, Renmin University of China(中国人民大学信息学院) ; Peking University(北京大学)
AI总结 针对长上下文大语言模型推理中KV缓存导致的瓶颈,提出RaBitQCache框架,利用随机旋转二值量化和高效二进制-INT4算术无偏估计注意力权重,实现自适应Top-p检索,加速推理并减少内存I/O。
Comments Accept by ICML 26
SyncCache: 利用非对称动力学实现快速音频驱动肖像动画
机构 * Shenzhen Graduate School, Peking University(北京大学深圳研究生院) ; Shanghai AI Laboratory(上海人工智能实验室) ; Tencent Hunyuan(腾讯混元) ; vivo
AI总结 提出SyncCache,一种针对DiT肖像动画的无训练缓存加速方法,通过空间非对称探测和模态解耦缓存利用非对称动力学,实现高达4.12倍加速且保持视觉保真度和音频对齐。
Comments ECCV 2026
从搜索到合成:训练大语言模型为零样本工作流生成器
机构 * School of Mathematics Science, Peking University(北京大学数学科学学院)
AI总结 提出MetaFlow,将工作流生成视为元学习问题,通过两阶段训练(监督微调+强化学习)使模型能生成可泛化的任务级工作流,在问答、代码生成和数学推理任务上实现零样本泛化。
Comments 35 pages, 8 figures