arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-15 至 2026-05-15 共收录 6 信号源:cs.CV, cs.GR, cs.MM

1. 效率与蒸馏 6 篇

2605.14333 2026-05-15 cs.CV 79%

InsightTok: Improving Text and Face Fidelity in Discrete Tokenization for Autoregressive Image Generation

InsightTok: 提高离散分词中文本和面部保真度以用于自回归图像生成

Yang Yue, Fangyun Wei, Tianyu He, Jinjing Zhao, Zanlin Ni, Zeyu Liu, Jiayi Guo, Lei Shi, Yue Dong, Li Chen, Ji Li, Gao Huang, Dong Chen

机构 * Tsinghua University(清华大学) Microsoft Research(微软研究院)

专题命中 效率与蒸馏 :image generation(title,abstract);分类 cs.CV

AI总结 InsightTok通过局部内容感知损失提升文本和面部保真度,在不牺牲通用重建质量的情况下优于现有分词器,从而推动离散图像生成的发展。

Comments Code and checkpoints are available at https://github.com/LeapLabTHU/InsightTok

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15178 2026-05-15 cs.CV 74%

SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer

SANA-WM:高效分钟级世界建模的混合线性扩散变换器

Haoyi Zhu, Haozhe Liu, Yuyang Zhao, Tian Ye, Junsong Chen, Jincheng Yu, Tong He, Song Han, Enze Xie

机构 * NVIDIA(英伟达)

专题命中 效率与蒸馏 :diffusion(title);分类 cs.CV

AI总结 SANA-WM通过混合线性注意力、双分支相机控制等设计,实现高效分钟级视频生成,提升效率与视觉质量。

Comments https://nvlabs.github.io/Sana/WM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14276 2026-05-15 stat.ML cs.LG 67%

Training-Free Generative Sampling via Moment-Matched Score Smoothing

无需训练的生成采样 via 动量匹配的分数平滑

Zhenyu Yao, Daniel Paulin

机构 * College of Computing and Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract)

AI总结 本文提出无需训练的动量匹配分数平滑过阻尼兰格-恩斯坦动力学(MM-SOLD),通过在采样轨迹中强制目标动量,实现高效的训练自由采样,实验显示其在CPU上能快速稳健地生成高质量样本。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17588 2026-05-15 cs.CV 57%

HERO: Hierarchical Extrapolation and Refresh for Efficient World Models

HERO:高效世界模型的分层外推与刷新

Quanjian Song, Xinyu Wang, Donghao Zhou, Jingyu Lin, Cunjian Chen, Yue Ma

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 HERO通过分层策略提升世界模型推理效率,采用补丁刷新和线性外推技术,在保持质量的同时实现1.73倍加速。

Comments 12 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22394 2026-05-15 cs.CV 57%

PacTure: Efficient PBR Texture Generation on Packed Views with Visual Autoregressive Models

PacTure:基于打包视角的高效PBR纹理生成方法

Fan Fei, Jiajun Tang, Fei-Peng Tian, Boxin Shi, Ping Tan

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,计算机学院,北京大学) National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(视觉技术国家工程研究中心,计算机学院,北京大学) The Hong Kong University of Science and Technology(香港科技大学) Light Illusions PKU-AI 2 Robotics Joint Lab of Embodied AI(北京大学人工智能2机器人联合实验室)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 PacTure通过引入视角打包技术,提升多视角生成的效率与一致性,结合自回归模型实现高效PBR纹理生成。

Comments Accepted by Computational Visual Media Journal (CVMJ) in Feb. 2026. 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13907 2026-05-15 stat.ML cs.AI cs.LG 50%

AIS: Adaptive Importance Sampling for Quantized RL

AIS: 量化强化学习中的自适应重要性采样

Jiajun Zhou, Wei Shao, Lingchao Zheng, Yuwei Fan, Ngai Wong

机构 * Huawei(华为) The University of Hong Kong(香港大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出AIS方法,通过动态调整重要性采样强度,解决量化强化学习中 rollout 与训练不匹配导致的策略梯度偏差问题,在保持FP8加速优势的同时,提升训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏