arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-08 至 2026-05-08 共收录 101 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 2 篇

2504.19455 2026-05-08 cs.CV 70%

Masked Language Prompting for Generative Data Augmentation in Few-shot Fashion Style Recognition

生成数据增强的掩码语言提示在少样本时尚风格识别中的应用

Yuki Hirakawa, Ryotaro Shimizu

机构 * ZOZO Research(ZOZO研究院)

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出掩码语言提示方法,通过掩码参考描述中的词并利用大语言模型生成多样且语义连贯的图像,提升少样本时尚风格识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05689 2026-05-08 cs.AI 50%

GCCM: Enhancing Generative Graph Prediction via Contrastive Consistency Model

GCCM: 通过对比一致性模型增强生成图预测

Shaozhen Ma, Wei Huang, Hanchen Wang, Dong Wen, Wenjie Zhang

机构 * University of New South Wales(新南威尔士大学) University of Technology Sydney(技术与科学大学)

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 GCCM通过引入对比一致性目标和特征扰动,解决图预测中对比学习易陷入捷径解的问题,提升预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像生成评测 4 篇

2605.06641 2026-05-08 cs.AI cs.CV 79%

GlazyBench: A Benchmark for Ceramic Glaze Property Prediction and Image Generation

GlazyBench:陶瓷釉料属性预测与图像生成的基准测试

Ziyu Zhai, Siyou Li, Juexi Shao, Juntao Yu

机构 * Queen Mary University of London(伦敦大学玛丽女王学院)

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV

AI总结 本文提出GlazyBench,首个用于AI辅助釉料设计的基准数据集,包含23148种真实釉料配方,支持釉料属性预测与图像生成任务,通过传统机器学习和大语言模型建立基线,展示出有前景但具挑战性的实验结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18181 2026-05-08 cs.CV 57%

MACE-Dance: Motion-Appearance Cascaded Experts for Music-Driven Dance Video Generation

MACE-Dance: 基于动作-外观级联专家的音乐驱动舞蹈视频生成

Kaixing Yang, Jiashu Zhu, Xulong Tang, Ziqiao Peng, Xiangyue Zhang, Puwei Wang, Jiahong Wu, Xiangxiang Chu, Hongyan Liu, Jun He

机构 * Renmin University of China(中国人民大学) AMAP, Alibaba Group(阿里集团AMAP) Wuhan University(武汉大学) Tsinghua University(清华大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出MACE-Dance框架,结合级联混合专家模型,实现音乐驱动的高质量舞蹈视频生成,通过动作和外观专家分别生成3D动作和视频,提升视觉一致性和动作真实感。

Comments Accepted by SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10248 2026-05-08 cs.CV cs.AI 57%

RobustSora: De-Watermarked Benchmark for Robust AI-Generated Video Detection

RobustSora:用于鲁棒AI生成视频检测的去水印基准

Zhuo Wang, Xiliang Liu, Ligang Sun

机构 * College of Computer Science, Beijing University of Technology(北京理工大学计算机学院)

专题命中 图像生成评测 :inpainting(abstract);分类 cs.CV

AI总结 本文提出RobustSora基准,通过6500个手动验证的视频评估AI生成视频检测的鲁棒性,发现水印操控影响检测准确率,强调水印意识在训练中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06856 2026-05-08 cs.LG math.DG 50%

Contact Wasserstein Geodesics for Non-Conservative Schrödinger Bridges

接触Wasserstein测地线用于非保守Schrödinger桥

Andrea Testa, Søren Hauberg, Tamim Asfour, Leonel Rozo

机构 * Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心) Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) Technical University of Denmark (DTU)(丹麦技术大学) Italian Institute of Artificial Intelligence (AI4I)(意大利人工智能研究所)

专题命中 图像生成评测 :image generation(abstract)

AI总结 本文提出非保守广义Schrödinger桥,通过接触哈密顿力学实现能量变化的桥模型,利用接触Wasserstein测地线实现高效计算,验证了其在流形导航、分子动力学预测和图像生成中的实用性。

Comments 44 pages, 21 figures, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 效率与蒸馏 5 篇

2605.06376 2026-05-08 cs.CV cs.AI 83%

Continuous-Time Distribution Matching for Few-Step Diffusion Distillation

连续时间分布匹配用于少步扩散蒸馏

Tao Liu, Hao Yan, Mengting Chen, Taihang Hu, Zhengrong Yue, Zihao Pan, Jinsong Lan, Xiaoyong Zhu, Ming-Ming Cheng, Bo Zheng, Yaxing Wang

机构 * VCIP, College of Computer Science, Nankai University(南开大学计算机科学学院VCIP) Alibaba Group(阿里巴巴集团) College of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 效率与蒸馏 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本文提出连续时间分布匹配(CDM),通过动态连续调度和连续时间对齐目标,改进少步扩散蒸馏,提升图像生成的视觉保真度,无需复杂辅助模块。

Comments 22pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06357 2026-05-08 cs.LG cs.AI cs.CV 57%

Memory Efficient Full-gradient Attacks (MEFA) Framework for Adversarial Defense Evaluations

内存高效的全梯度攻击(MEFA)框架用于对抗性防御评估

Yuan Du, Mitchel Hill, HanQin Cai

机构 * InnoPeak Technology(InnoPeak技术公司)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出MEFA框架,通过梯度检查点技术实现长净化轨迹的精确端到端梯度计算,提升对抗性防御评估的准确性,揭示了近似梯度评估的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15689 2026-05-08 cs.CV 57%

DOLLAR: Few-Step Video Generation via Distillation and Latent Reward Optimization

DOLLAR: 通过蒸馏和潜在奖励优化实现少步视频生成

Zihan Ding, Chi Jin, Difan Liu, Haitian Zheng, Krishna Kumar Singh, Qiang Zhang, Yan Kang, Zhe Lin, Yuchen Liu

机构 * Princeton University(普林斯顿大学) Adobe Research(Adobe研究)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出结合变分分数蒸馏和一致性蒸馏的方法,实现高质量且多样化的少步视频生成,并通过潜在奖励模型微调提升生成性能,实现高效生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06397 2026-05-08 quant-ph 50%

Photonic-Implemented Efficient Deep Quantum Neural Network via Virtual-Driven Hilbert Space Expansion

光子实现的高效深度量子神经网络通过虚拟驱动的希尔伯特空间扩展

Haoran Ma, Huihui Zhu, Zichao Zhao, Qishen Liang, Liao Ye, Baojie Hou, Jia Guo, Leong Chuan Kwek, Mile Gu, Jayne Thompson, Wei Luo, Yuehai Wang, Jianyi Yang

专题命中 效率与蒸馏 :image generation(abstract)

AI总结 本文提出一种基于光子的深度量子神经网络,通过输入复制和模式扩展实现希尔伯特空间扩展,有效实现非单位ary和非线性激活功能,降低资源消耗,适用于多种任务。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05606 2026-05-08 stat.ML cs.LG math.PR 50%

Variational Smoothing and Inference for SDEs from Sparse Data with Dynamic Neural Flows

变分平滑与SDEs从稀疏数据中推断的动态神经流

Yu Wang, Arnab Ganguly

机构 * Department of Mathematics(数学系) Louisiana State University(路易斯安那州立大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出基于动态神经流的变分平滑方法,通过条件后向时间分数建模SDEs,实现高效轨迹采样和参数估计,实验表明在非线性系统中具有更高的可扩展性。

Comments Yu Wang and Arnab Ganguly contributed equally to this work. Corresponding to Arnab Ganguly

详情

展开后加载摘要…

URL PDF HTML 收藏