arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-21 至 2026-04-21 共收录 133 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 5 篇

2604.18575 2026-04-21 cs.CV 61%

ReCap: Lightweight Referential Grounding for Coherent Story Visualization

ReCap:轻量级指代 grounding 以实现连贯故事可视化

Aditya Arora, Akshita Gupta, Pau Rodriguez, Marcus Rohrbach

机构 * 1 Technical University of Darmstadt \& hessian.AI, Germany -2em

专题命中 个性化与一致性 :diffusion(abstract,comments);分类 cs.CV

AI总结 ReCap 提出一种轻量级框架,通过视觉锚点提升角色稳定性与视觉一致性,无需修改基础扩散模型,在两个故事可视化基准上取得新高。

Comments Diffusion Models, Story Visualization

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00296 2026-04-21 cs.CV 57%

TimeColor: Flexible Reference Colorization via Temporal Concatenation

TimeColor:通过时间拼接实现灵活的参考着色

Bryan Constantine Sadihin, Yihao Meng, Michael Hua Wang, Matteo Jiahao Chen, Hang Su

机构 * Computer Science and Technology(计算机科学与技术) Tsinghua University(清华大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 TimeColor通过时间拼接技术实现灵活的参考着色,利用显式每参考区域分配支持异构、可变数量的参考,提高颜色保真度、身份一致性和时间稳定性。

Comments Our project page is available at https://bconstantine.github.io/TimeColor/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16958 2026-04-21 cs.CV 57%

Self-Reasoning Agentic Framework for Narrative Product Grid-Collage Generation

具有自我推理代理机制的叙事产品网格-拼贴生成框架

Minyan Luo, Yuxin Zhang, Yifei Li, Xincan Wang, Fuzhang Wu, Tong-Yee Lee, Oliver Deussen, Weiming Dong

机构 * MAIS,Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所马克思主义学院) Tsinghua University(清华大学) Shanghai Theatre Academy(上海戏剧学院) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) National Cheng Kung University(国立成功大学) University of Konstanz(康斯坦茨大学)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 本文提出一种自我推理代理框架,用于生成叙事产品网格拼贴,通过构建产品叙事框架和约束-aware提示,提升视觉一致性和叙事丰富度。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像生成评测 3 篇

2602.06663 2026-04-21 cs.CV 79%

PlanViz: Evaluating Planning-Oriented Image Generation and Editing for Computer-Use Tasks

PlanViz: 评估面向计算机使用任务的图像生成与编辑

Junxian Li, Kai Liu, Leyang Chen, Weida Wang, Zhixin Wang, Jiaqi Xu, Fan Li, Renjing Pei, Linghe Kong, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Huawei Technologies Ltd(华为技术有限公司)

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV

AI总结 PlanViz旨在评估图像生成与编辑在计算机使用任务中的表现,通过设计日常生活中常见的子任务,如路线规划、工作图示和网页与UI显示,提出任务自适应评分体系PlanScore以评估生成图像的正确性、视觉质量和效率。

Comments The main part of our paper: PlanViz Code is at: https://github.com/lijunxian111/PlanViz Supplementary material is at: https://github.com/lijunxian111/PlanViz/releases/tag/v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26278 2026-04-21 cs.CV cs.CL 57%

ProfVLM: A lightweight video-language model for multi-view proficiency estimation

ProfVLM:一种轻量级视频-语言模型用于多视角技能评估

Edoardo Bianchi, Jacopo Staiano, Antonio Liotta

机构 * Free University of Bozen-Bolzano(博洛尼亚-博兹纳自由大学) University of Trento(特伦托大学)

专题命中 图像生成评测 :generative vision(abstract);分类 cs.CV

AI总结 本文提出ProfVLM,一种轻量级视频-语言模型,通过生成式视觉-语言建模实现多视角技能评估,兼具生成自然语言反馈与定量评分,参数更少且训练更快。

Journal ref Computer Vision and Image Understanding, Volume 268, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20360 2026-04-21 cs.CV 57%

EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning

EditVerse:通过上下文学习统一图像和视频编辑与生成

Xuan Ju, Tianyu Wang, Yuqian Zhou, He Zhang, Qing Liu, Nanxuan Zhao, Zhifei Zhang, Yijun Li, Yuanhao Cai, Shaoteng Liu, Daniil Pakhomov, Zhe Lin, Soo Ye Kim, Qiang Xu

机构 * Adobe Research(Adobe研究院) CUHK(中国香港大学) Johns Hopkins University(约翰霍普金斯大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文提出EditVerse框架,通过统一token序列实现图像和视频生成编辑,利用自注意力机制实现跨模态知识迁移,实验表明其在视频编辑任务中达到SOTA水平。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 效率与蒸馏 6 篇

2604.18168 2026-04-21 cs.CV 83%

Extending One-Step Image Generation from Class Labels to Text via Discriminative Text Representation

通过判别性文本表示将一类标签的一步图像生成扩展到文本

Chenxi Zhao, Chen Zhu, Xiaokun Feng, Aiming Hao, Jiashu Zhu, Jiachen Lei, Jiahong Wu, Xiangxiang Chu, Jufeng Yang

专题命中 效率与蒸馏 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出通过判别性文本表示将MeanFlow框架从固定类标签扩展到灵活文本输入,提升生成内容的丰富性,并在扩散模型上验证了方法的有效性。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05449 2026-04-21 cs.CV cs.AI 83%

DisCa: Accelerating Video Diffusion Transformers with Distillation-Compatible Learnable Feature Caching

DisCa:通过与知识蒸馏兼容的可学习特征缓存加速视频扩散变换器

Chang Zou, Changlin Li, Yang Li, Patrol Li, Jianbing Wu, Xiao He, Songtao Liu, Zhao Zhong, Kailin Huang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Hunyuan(腾讯文英) Xidian University(西安电子科技大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出一种与知识蒸馏兼容的可学习特征缓存机制,用于加速视频扩散变换器,通过轻量级可学习神经预测器提升高维特征演化过程的准确性,并采用保守的受限均值流方法实现更稳定无损的知识蒸馏,从而将加速边界推至11.8倍同时保持生成质量。

Comments 18 pages, 8 figures; cvpr2026 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24086 2026-04-21 cs.CV 70%

RainFusion2.0: Temporal-Spatial Awareness and Hardware-Efficient Block-wise Sparse Attention

RainFusion2.0: 基于时序-空间感知与硬件高效性的块状稀疏注意力

Aiyue Chen, Yaofu Liu, Junjian Huang, Guang Lian, Yiwu Yao, Wangli Lan, Jing Lin, Zhixin Ma, Tingting Zhou

机构 * Huawei Technologies Co., Ltd(华为技术有限公司) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与蒸馏 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出RainFusion2.0,通过块状均值代表token预测稀疏掩码、时空感知token排列及首帧sink机制,实现视频和图像生成模型的高效稀疏注意力,实验表明在保持视频质量的同时,达到80%的稀疏度和1.5~1.8倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17397 2026-04-21 cs.CV cs.AI 57%

Speculative Decoding for Autoregressive Video Generation

推测解码用于自回归视频生成

Yuezhou Hu, Jintao Zhang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文探讨了推测解码在自回归视频生成中的应用,通过引入SDVG框架,利用图像质量路由替代token验证,实现高效视频生成,同时保持高质量并提升生成速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02636 2026-04-21 cs.LG cs.CV 57%

Joint Distillation for Fast Likelihood Evaluation and Sampling in Flow-based Models

基于流模型的快速似然评估与采样联合蒸馏

Xinyue Ai, Yutong He, Albert Gu, Ruslan Salakhutdinov, J Zico Kolter, Nicholas Matthew Boffi, Max Simchowitz

机构 * Carnegie Mellon University(卡内基梅隆大学) Peking University(北京大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出F2D2框架,通过联合蒸馏减少流模型采样和似然评估的NFE数量,实现高效计算与高精度似然估计。

Comments Project page: https://kellyyutonghe.github.io/f2d2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18117 2026-04-21 cs.LG 50%

LoRaQ: Optimized Low Rank Approximation for 4-bit Quantization

LoRaQ:面向4位量化优化的低秩近似

Yann Bouquet, Alireza Khodamoradi, Sophie Yáng Shen, Kristof Denolf, Mathieu Salzmann

机构 * Computer Vision Laboratory, Ecole Polytechnique Fédérale de Lausanne, Lausanne, Switzerland(瑞士洛桑联邦理工学院计算机视觉实验室) Research and Advancement Development Team, Advanced Micro Devices, Inc, USA(美国高级微器件公司研发与进步发展团队)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 LoRaQ通过简化校准方法,实现了无需高精度分支的4位量化优化,首次提出全子16位流水线,提升Pixart-$Σ$和SANA模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他图像生成 1 篇

2604.17856 2026-04-21 cs.CV 74%

PlankFormer: Robust Plankton Instance Segmentation via MAE-Pretrained Vision Transformers and Pseudo Community Image Generation

PlankFormer:通过MAE预训练视觉变换器和伪社区图像生成实现鲁棒的浮游生物实例分割

Masaharu Miyazaki, Yurie Otake, Koichi Ito, Wataru Makino, Jotaro Urabe, Takafumi Aoki

机构 * Graduate School of Information Sciences, Tohoku University(东京大学信息科学研究生院) The Center for Ecological Research, Kyoto University(京都大学生态研究中心) Graduate School of Life Sciences, Tohoku University(东京大学生命科学研究生院)

专题命中 其他图像生成 :image generation(title);分类 cs.CV

AI总结 本文提出PlankFormer框架,通过生成伪社区图像和MAE预训练视觉变换器解决浮游生物实例分割中的数据不足和区分困难问题,实验表明其在高杂质密度环境下表现优异。

Comments Accepted to ICPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏