忘记密码?
其他方式登录

全扩散架构、无需图文对预训练,LLaDA杀穿开源文生图

2026年9月8日

详细介绍

先学会画,再学会听话。 LLaDA-Image 在预训练和中期训练阶段直接从图片学习视觉先验,超过 90% 的累计生成训练样本采用 image-only 监督;图文对则集中用于后续语言对齐。模型权重、训练代码和完整配方同步开放。

Qwen-Image-Bench 中英文综合成绩。模型按两条轨道的平均分排序;LLaDA-Image 在报告列出的开源模型中取得中英文双榜第一。

人物、动物、食物与风景等 LLaDA-Image 生成样例。

LLaDA-Image 的海报、文字渲染、艺术与设计类生成样例,展示模型覆盖多种视觉创作任务的定性效果。

LLaDA-Image 采用从理解到生成的全扩散架构:理解侧使用 LLaDA2.0-mini,这是一款拥有 16B 总参数、激活 1B 参数的混合专家(MoE)扩散语言模型(dLLM),负责理解指令;生成侧使用从零训练的 6B DiT,负责将理解结果转化为图像。同一套系统可同时支持文生图和指令图像编辑。

传统文生图路线通常从训练早期就把图片与文字说明绑定在一起。要让配对数据达到训练要求,还需要生成或人工补充详细 caption,并经过幻觉检测、文字转录校验和图文一致性过滤。

给定一张训练图片,系统先用冻结的 SigLIP-VQ 视觉编码器把它变成图像 token,再随机遮掉其中一部分。保留下来的稀疏视觉 token 与一条固定辅助指令一起进入冻结的多模态理解模型,形成 DiT 的条件;完整图片的 VAE 潜变量则作为生成目标。

全扩散架构、无需图文对预训练,LLaDA杀穿开源文生图

技术报告给出的 SFT 加权数据分布估计。训练内容覆盖自然、设计、人物与少量合成数据;图像预训练和中期训练只使用真实图像。

LLaDA-Image 的模型主体可以分为三部分:负责理解条件的 dLLM 视觉语言模型、连接理解与生成空间的轻量接口,以及真正生成图像的单流 DiT。

LLaDA-Image 架构。文本经 RQA、LLaDA2.0-mini 和 Connector 进入单流 DiT;编辑任务额外接收参考图像的语义特征和干净 VAE 潜变量。

理解模块建立在 LLaDA2.0-mini 扩散语言模型之上。它不只是把提示词变成一组静态文本嵌入,而是作为统一的多模态语义接口,处理文本、训练时的视觉条件和结构化推理信息。

视觉生成部分则是一套纯单流 DiT。文本条件 token、时间信息和图像 token 进入同一组 Transformer 模块,在每一层直接交互,最终预测 Flow Matching(流匹配)速度场。

生成和编辑共享同一个理解接口与 DiT 主干,但参考图片走的是一条独立通道。

这两类信号形成了互补:高层语义帮助模型理解编辑对象与指令,像素条件则强化身份、结构和纹理的一致性。两种参考信号一起进入同一个 DiT,使一套权重可以同时承担开放式生成与参考保持编辑。

改为吉卜力动画风格

把 “Stay /fresh” 改成 “Keep /fresh”

去掉女性身上的红色包

给手绘图上色:女孩肉色皮肤、黑发,小熊棕色

LLaDA-Image 指令图像编辑示例。

对于一个需要长程训练的 6B 参数 DiT,稳定的网络 scaling 和 gradient norm 是整套工程得以持续扩展的基础。

基础版 LLaDA-Image 追求完整的多步生成能力,技术报告把它列为 50 步采样。部署时,团队再用 TwinFlow 将它蒸馏为 LLaDA-Image-Turbo,把推理压缩到 2—4 步。

传统 DMD 为生成器和在线 fake-score 估计器分别维护相应角色;TwinFlow 则进一步思考,能否用一套共享主干完成这两项工作。

技术报告用 Qwen-Image-Bench 作为主要综合生成基准。该基准包含 1,000 条分层提示词,考察画面质量、美学、提示词对齐、现实世界保真和创意生成,并分别提供英文与中文评测。

Qwen-Image-Bench 部分模型结果,分数来自技术报告。各模型均采用标准推理设置和原始提示词进行比较。

文字生成方面,LLaDA-Image 在 LongText-Bench 英文和中文部分分别达到 0.923、0.913。在包含广告、海报、表情包和街景等多文字区域的 CVTG-2K 上,其平均单词准确率为 0.875、归一化编辑距离(NED)为 0.945、CLIPScore 为 0.818;在包含 2—5 个文字区域的不同难度设置下,单词准确率保持在 0.857—0.892

榜单成绩提供了一个醒目的结果,完整开放的训练链条进一步扩展了这项工作的研究价值。LLaDA-Image 把从 “图片如何变成视觉先验” 到 “模型如何压缩到 2—4 步” 的路径连了起来。

在 LLaDA-Image 开源之际,InclusionAI 与 SGLang 社区协作完成了 Day-0 推理适配。针对模型的多组件推理链路,双方完成了少步采样、序列并行和 FP8 推理等适配。基于 SGLang Diffusion,用户可通过同一套推理框架部署 Base、Turbo 及相应的 FP8 版本,支持文生图和图像编辑,并可通过兼容 OpenAI Images API 的接口提供服务。

LLaDA-Image 的核心路线可以压缩成八个字:先学会画,再学会听话。 纯图片承担大规模视觉先验学习,图文对集中完成语言对齐;生成、编辑与快速部署,则继续接到同一套系统中。

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

联系方式

赞赏支持

累计赞赏 0 积分 0 人支持
登录后赞赏

💬 发表评论