BLOCK: An Open-Source Bi-Stage MLLM Character-to-Skin Pipeline for Minecraft
BLOCK:一个开源的双阶段MLLM字符到皮肤生成Minecraft pipeline
专题命中 个性化与一致性 :text-to-image(abstract);分类 cs.CV
AI总结 BLOCK通过双阶段流程生成Minecraft皮肤,结合MLLM和FLUX.2模型,提出EvolveLoRA提升生成稳定性与效率。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
BLOCK:一个开源的双阶段MLLM字符到皮肤生成Minecraft pipeline
专题命中 个性化与一致性 :text-to-image(abstract);分类 cs.CV
AI总结 BLOCK通过双阶段流程生成Minecraft皮肤,结合MLLM和FLUX.2模型,提出EvolveLoRA提升生成稳定性与效率。
扩散混合:用于扩散模型的推理时间多偏好对齐
机构 * Texas A&M University(德克萨斯大学阿姆斯特朗分校) ; Qualcomm AI Research(高通人工智能研究)
专题命中 图像生成评测 :diffusion(title,abstract);分类 cs.CV
AI总结 扩散混合通过混合反向扩散过程实现推理时间多偏好对齐,提升用户驱动的图像生成性能。
Comments Accepted at ICLR 2026
ZeroSense:视觉在长上下文压缩中的作用
专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV
AI总结 本文提出ZeroSense框架,通过解耦多模态大语言模型能力,评估视觉-文本压缩质量,并通过低语义相关性基准测试验证长上下文压缩效果与下游任务准确性之间的显著差异。
V2A-DPO:面向视频到音频生成的多偏好优化
专题命中 图像生成评测 :diffusion(abstract);分类 cs.MM
AI总结 V2A-DPO通过多偏好优化提升视频到音频生成的质量,结合AudioScore评分系统和课程学习策略,在VGGSound数据集上实现了优于DDPO和预训练基线的性能。
Comments Accepted at ICASSP2026
MaterialFigBENCH:用于评估多模态大语言模型在大学级材料科学问题解决能力的基准数据集
专题命中 图像生成评测 :diffusion(abstract)
AI总结 MaterialFigBench是一个评估多模态大语言模型在材料科学问题中图表解读能力的基准数据集,通过137个问题测试模型在视觉理解和数值精度上的表现,揭示了当前模型在图表处理方面的不足。
Comments 27 pages, 4 tables, 6 figures
DyWeight: 动态梯度加权用于少步扩散采样
机构 * Zhejiang University(浙江大学) ; AGI Lab, Westlake University(西湖大学AGI实验室) ; TongJi University(同济大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV
AI总结 DyWeight通过动态梯度加权方法,提高了扩散采样效率,实现更少的函数评估和更稳定的生成效果。
Comments Code Link: see AGI-Lab/DyWeight" target="_blank" rel="noopener">https://github.com/Westlake-AGI-Lab/DyWeight
通过离散扩散发散指导实现超快语言生成
专题命中 效率与蒸馏 :diffusion(title,abstract)
AI总结 DiDi-Instruct通过离散扩散发散指导实现高效语言生成,提供高达64倍的加速,同时保持高质量输出。
Comments [ICLR 2026] 38 pages, 7 figures, 13 tables
PROMO: 可提示的高效高保真虚拟试衣
专题命中 效率与蒸馏 :diffusion(abstract);image editing(abstract);分类 cs.CV
AI总结 PROMO通过流匹配DiT框架和潜在多模态条件拼接,实现高效高保真虚拟试衣,平衡保真度与效率。
Comments CVPR 2026
单像素图像分类使用超快数字光投影仪
专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV
AI总结 本研究利用单像素成像技术与低复杂度机器学习模型,实现超快图像分类,通过空间时间变换避免图像重建,展示其在超快成像中的异常检测潜力。
通过分裂增广 Langevin 采样实现严格约束生成建模
专题命中 效率与蒸馏 :diffusion(abstract)
AI总结 本文提出 CASAL 算法,通过变量分裂逐步强制约束,用于严格约束生成建模,提升物理系统预测精度和守恒量保持。
Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)