Inclusion AI推出了全扩散架构的文生图模型LLaDA-Image,其核心是6B参数的DiT,该模型从零开始训练,一套权重可同时支持文生图和指令图像编辑功能,还能蒸馏为仅需2-4个采样步的LLaDA-Image-Turbo。LLaDA-Image采用“先绘画,后理解语言”的训练策略,在预训练和中期阶段,超过90%的累计2.2亿训练样本均使用纯图片进行监督,以建立视觉先验。随后的SFT阶段,则使用经过校验的图文对来实现语言对齐。该模型在Qwen-Image-Bench中英文榜单的开源模型中均排名第一,在文字生成、指令编辑等任务上表现出色。此外,它还通过无参数RMSNorm确保训练稳定性,并采用TwinFlow技术实现快速蒸馏。目前,LLaDA-Image的模型权重、训练代码和完整配方已全部开源,且已适配SGLang推理框架。
