arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-13 至 2026-03-13 共收录 70 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 4 篇

2603.03964 2026-03-13 cs.CV cs.AI 57%

BLOCK: An Open-Source Bi-Stage MLLM Character-to-Skin Pipeline for Minecraft

BLOCK:一个开源的双阶段MLLM字符到皮肤生成Minecraft pipeline

Hengquan Guo

专题命中 个性化与一致性 :text-to-image(abstract);分类 cs.CV

AI总结 BLOCK通过双阶段流程生成Minecraft皮肤,结合MLLM和FLUX.2模型,提出EvolveLoRA提升生成稳定性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像生成评测 4 篇

2505.18547 2026-03-13 cs.AI cs.CV 79%

Diffusion Blend: Inference-Time Multi-Preference Alignment for Diffusion Models

扩散混合:用于扩散模型的推理时间多偏好对齐

Min Cheng, Fatemeh Doudi, Dileep Kalathil, Mohammad Ghavamzadeh, Panganamala R. Kumar

机构 * Texas A&M University(德克萨斯大学阿姆斯特朗分校) Qualcomm AI Research(高通人工智能研究)

专题命中 图像生成评测 :diffusion(title,abstract);分类 cs.CV

AI总结 扩散混合通过混合反向扩散过程实现推理时间多偏好对齐,提升用户驱动的图像生成性能。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11846 2026-03-13 cs.CV 57%

ZeroSense:How Vision matters in Long Context Compression

ZeroSense:视觉在长上下文压缩中的作用

Yonghan Gao, Zehong Chen, Lijian Xu, Jingzhi Chen, Jingwei Guan, Xingyu Zeng

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出ZeroSense框架,通过解耦多模态大语言模型能力,评估视觉-文本压缩质量,并通过低语义相关性基准测试验证长上下文压缩效果与下游任务准确性之间的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11089 2026-03-13 cs.SD cs.MM eess.AS 57%

V2A-DPO: Omni-Preference Optimization for Video-to-Audio Generation

V2A-DPO:面向视频到音频生成的多偏好优化

Nolan Chan, Timmy Gang, Yongqian Wang, Yuzhe Liang, Dingdong Wang

专题命中 图像生成评测 :diffusion(abstract);分类 cs.MM

AI总结 V2A-DPO通过多偏好优化提升视频到音频生成的质量,结合AudioScore评分系统和课程学习策略,在VGGSound数据集上实现了优于DDPO和预训练基线的性能。

Comments Accepted at ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11414 2026-03-13 cs.CL cond-mat.mtrl-sci 50%

MaterialFigBENCH: benchmark dataset with figures for evaluating college-level materials science problem-solving abilities of multimodal large language models

MaterialFigBENCH:用于评估多模态大语言模型在大学级材料科学问题解决能力的基准数据集

Michiko Yoshitake, Yuta Suzuki, Ryo Igarashi, Yoshitaka Ushiku, Keisuke Nagato

专题命中 图像生成评测 :diffusion(abstract)

AI总结 MaterialFigBench是一个评估多模态大语言模型在材料科学问题中图表解读能力的基准数据集,通过137个问题测试模型在视觉理解和数值精度上的表现,揭示了当前模型在图表处理方面的不足。

Comments 27 pages, 4 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 效率与蒸馏 5 篇

2603.11607 2026-03-13 cs.CV 79%

DyWeight: Dynamic Gradient Weighting for Few-Step Diffusion Sampling

DyWeight: 动态梯度加权用于少步扩散采样

Tong Zhao, Mingkun Lei, Liangyu Yuan, Yanming Yang, Chenxi Song, Yang Wang, Beier Zhu, Chi Zhang

机构 * Zhejiang University(浙江大学) AGI Lab, Westlake University(西湖大学AGI实验室) TongJi University(同济大学) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 DyWeight通过动态梯度加权方法,提高了扩散采样效率,实现更少的函数评估和更稳定的生成效果。

Comments Code Link: see AGI-Lab/DyWeight" target="_blank" rel="noopener">https://github.com/Westlake-AGI-Lab/DyWeight

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25035 2026-03-13 cs.CL cs.AI cs.LG 78%

Ultra-Fast Language Generation via Discrete Diffusion Divergence Instruct

通过离散扩散发散指导实现超快语言生成

Haoyang Zheng, Xinyang Liu, Cindy Xiangrui Kong, Nan Jiang, Zheyuan Hu, Weijian Luo, Wei Deng, Guang Lin

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 DiDi-Instruct通过离散扩散发散指导实现高效语言生成,提供高达64倍的加速,同时保持高质量输出。

Comments [ICLR 2026] 38 pages, 7 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11675 2026-03-13 cs.CV 70%

PROMO: Promptable Outfitting for Efficient High-Fidelity Virtual Try-On

PROMO: 可提示的高效高保真虚拟试衣

Haohua Chen, Tianze Zhou, Wei Zhu, Runqi Wang, Yandong Guan, Dejia Song, Yibo Chen, Xu Tang, Yao Hu, Lu Sheng, Zhiyong Wu

专题命中 效率与蒸馏 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 PROMO通过流匹配DiT框架和潜在多模态条件拼接,实现高效高保真虚拟试衣,平衡保真度与效率。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12036 2026-03-13 cs.CV physics.optics 57%

Single Pixel Image Classification using an Ultrafast Digital Light Projector

单像素图像分类使用超快数字光投影仪

Aisha Kanwal, Graeme E. Johnstone, Fahimeh Dehkhoda, Johannes H. Herrnsdorf, Robert K. Henderson, Martin D. Dawson, Xavier Porte, Michael J. Strain

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 本研究利用单像素成像技术与低复杂度机器学习模型,实现超快图像分类,通过空间时间变换避免图像重建,展示其在超快成像中的异常检测潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18017 2026-03-13 cs.LG 50%

Strictly Constrained Generative Modeling via Split Augmented Langevin Sampling

通过分裂增广 Langevin 采样实现严格约束生成建模

Matthieu Blanke, Yongquan Qu, Sara Shamekh, Pierre Gentine

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出 CASAL 算法,通过变量分裂逐步强制约束,用于严格约束生成建模,提升物理系统预测精度和守恒量保持。

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏