先学会画,再学会听话:LLaDA-Image 全栈开源,90% 纯图片训练打破文生图预训练定式
在大语言模型主导多模态技术的今天,文生图模型的训练范式似乎早已定型:从第一天起,图片就必须配上文字说明。图文对,被视作生成预训练不可动摇的“入场券”。 但 LLaDA-Image 想重新回答一个更基础的问题:图文对,真的必须从预训练第一天就上场吗? 今天,我们正式发布并开源 LLaDA-Image。这是一个 6B 参数的 Diffusion Transformer(DiT),它用一条“先学会画,再
Article
在大语言模型主导多模态技术的今天,文生图模型的训练范式似乎早已定型:从第一天起,图片就必须配上文字说明。图文对,被视作生成预训练不可动摇的“入场券”。
但 LLaDA-Image 想重新回答一个更基础的问题:图文对,真的必须从预训练第一天就上场吗?
今天,我们正式发布并开源 LLaDA-Image。这是一个 6B 参数的 Diffusion Transformer(DiT),它用一条“先学会画,再学会听话”的路线,在 Qwen-Image-Bench 上拿下了开源模型中英文双料第一。更关键的是,在累计 2.2 亿的训练样本中,超过 90% 采用纯图片监督——图文对被集中用在了后续的语言对齐阶段。
🤗 Hugging Face:
https://huggingface.co/collections/inclusionAI/llada-image
🤖 ModelScope:
https://modelscope.cn/collections/inclusionAI/LLaDA-Image
💻 GitHub:
https://github.com/inclusionAI/LLaDA-Image
📄 Tech Report:
https://arxiv.org/pdf/2609.03796
纯图片预训练(Image-Only Pretraining):视觉先验不依赖 Caption
传统文生图路线通常从训练早期就把图片与文字说明绑定在一起。要让配对数据达到训练要求,还需要生成或人工补充详细 Caption,并经过幻觉检测、文字转录校验和图文一致性过滤。
LLaDA-Image 换了一种分工:预训练和中期训练不把 Caption 作为条件,而是由图像自身产生条件信号;到了需要语言监督的 SFT 阶段,再引入图文对完成文本—视觉对齐。
在这套分工里,两类数据被放到了各自更擅长的位置。原始图像保留材质、光影、局部结构和小物体等完整视觉信息;文本描述则擅长提炼语义,把自然语言概念接入已经形成的视觉空间。
纯图片负责建立视觉世界,图文对负责把语言接入这个世界。
尤其在早期低分辨率训练中,直接从实际裁剪区域提取条件,可以让条件与 $256\times256$ 的训练目标天然对应,并保留更多有效细节。于是,未经文本配对的图片也能直接参与吞吐量最大的视觉学习阶段,高质量配对资源则集中用于后续语言对齐。
自条件学习(Self-Conditioning):
图像同时作为条件与目标
给定一张训练图片,系统先用冻结的 SigLIP-VQ 视觉编码器把它变成图像 Token,再随机遮掉其中一部分。保留下来的稀疏视觉 Token 与一条固定辅助指令一起进入冻结的多模态理解模型,形成 DiT 的条件;完整图片的 VAE 潜变量则作为生成目标。
换句话说,图像同时是条件的来源和完整生成目标:模型需要完成一个从局部视觉线索恢复完整图像的任务。
由于条件直接从裁剪后的图像提取,团队可以从高分辨率原图中随机截取原生分辨率为 256 x 256 或适度更大的局部区域,只做温和缩放后用于训练,从而在低分辨率预训练中保留更多局部细节。
到了中期训练,像素预算提升到约 512²,训练仍沿用图像自条件和遮挡补全,并开始采用多宽高比桶。模型先适应更高分辨率与不同画幅,再切换到文本条件,将分辨率适配和条件模态转换分成两个阶段,过渡也更加平滑。
统一生成与编辑
(Unified T2I & I2I):一个 DiT 的双模态
LLaDA-Image 的模型主体可以分为三部分:负责理解条件的 dLLM 视觉语言模型、连接理解与生成空间的轻量接口,以及真正生成图像的单流 DiT。
理解模块建立在 LLaDA2.0-mini 扩散语言模型之上。 它不只是把提示词变成一组静态文本嵌入,而是作为统一的多模态语义接口,处理文本、训练时的视觉条件和结构化推理信息。
语言模型与图像生成器分别面向语义理解和视觉去噪,二者需要一套专门接口完成表示转换。为此,团队在中间加入了两层桥梁:
RQA(Residual Query Adapter):在理解模型前放入一组可学习查询,通过交叉注意力从输入中提取与生成最相关的信息;
Transformer Connector:把理解模型的隐藏状态投影到 DiT 所需的条件空间。
视觉生成部分则是一套纯单流 DiT。文本条件 Token、时间信息和图像 Token 进入同一组 Transformer 模块,在每一层直接交互,最终预测流匹配(Flow Matching)速度场。
编辑时,参考图像不经过语言模型。生成和编辑共享同一个理解接口与 DiT 主干,但参考图片走的是一条独立通道。
编辑示例
编辑指令仍由 RQA—dLLM—Connector 路径处理;参考图则完全绕过语言模型,同时提供两类互补信息:
SigLIP-VQ 特征提供高层语义信息,帮助模型识别参考图里“是什么”;
干净的 FLUX2-VAE 潜变量直接提供像素级证据,帮助保留原有身份、结构、纹理与背景。
两种参考信号一起进入同一个 DiT,使一套权重可以同时承担开放式生成与参考保持编辑。编辑训练阶段,团队以 1:1 混合 T2I 与 I2I 数据,让生成与编辑在共享主干上协同演进。
LLaDA-Image 架构示意
TwinFlow 蒸馏(TwinFlow Distillation):从 50 步到 2–4 步
基础版 LLaDA-Image 追求完整的多步生成能力,技术报告把它列为 50 步采样。部署时,团队再用 TwinFlow 将它蒸馏为 LLaDA-Image-Turbo,把推理压缩到 2–4 步。
传统分布匹配蒸馏(DMD)通常需要同时维护一个生成器和一个独立的分布跟踪器,部署成本较高。TwinFlow 的做法更简洁:让同一个 DiT 主干同时承担生成和分布跟踪,只通过两个输出头区分角色。训练时按 1:2 的比例交替更新生成与跟踪分支;到了推理阶段,只保留生成头,另一路直接丢弃,部署开销与单头模型无异。
这样,Turbo 版在 2–4 步内即可获得接近基础版的生成质量,而没有增加任何推理成本。
训练稳定性:
无参数 RMSNorm 的工程选择
对于一个需要长程训练的 6B 参数 DiT,稳定的网络 Scaling 和梯度范数是整套工程得以持续扩展的基础。
团队在长程训练监控中发现,LayerNorm 或常规 RMSNorm 里的可学习参数会持续改变特征尺度;这种变化在深层网络和长训练周期中累积后,可能表现为 Scaling 波动,并在后期带来梯度范数快速上升。
基于这一发现,LLaDA-Image 将归一化层设为无仿射参数形式,在整套 DiT 中统一使用无可学习参数的 RMSNorm。这个改动看起来很小,却直接针对长程训练中逐步累积的尺度漂移:它按照均方根对特征做归一化,并以固定形式维持尺度一致性。
优化器方面,团队在所有生成训练阶段都采用 Muon,将其定位为训练系统中的工程选择;归一化层的无参数设计则直接负责改善 Scaling 与后期梯度范数的稳定性。
实测表现
在 Qwen-Image-Bench 上,LLaDA-Image 的英文、中文总分分别达到 53.53 和 53.38;按照报告列出的比较结果,两个语言版本均位列开源模型第一。
在最直观的参照系里,LLaDA-Image 在中英文两条轨道上的总分,均位于 GPT Image 1 与 Imagen 4.0 Ultra 之间;而在报告列出的开源模型中,英文总分领先。
分项表现:
文字生成:LongText-Bench 英文 0.923、中文 0.913;CVTG-2K 平均单词准确率 0.875;
指令编辑:GEdit-Bench 英文 7.336、中文 7.294;
传统诊断基准:GenEval 总分 0.85,DPG-Bench 总分 87.48。
Arena 评测:在 LLaDA Text-to-Image Arena 中,LLaDA-Image 和 Turbo 的 Bradley-Terry Elo 分别为 937.1 和 916.5。
全栈开源:模型、代码与配方
模型权重、训练代码与详细配方的同步开放,让从“图片如何变成视觉先验”到“模型如何压缩到 2–4 步”的全过程,都成为可以研究和继续推进的技术路径。
这次开放覆盖了五个关键环节:
模型权重:同时提供基础版与 Turbo 版;
训练与推理代码:开放模型训练和推理所需的核心实现;
数据构建与纯图片训练配方:包含图片筛选、256²预训练与多宽高比中期训练;
统一生成—编辑配方:包括文本对齐、高分辨率迁移,以及 T2I 与 I2I 1:1 混合的联合训练;
TwinFlow 蒸馏方案:公开从 50 步基础模型走向 2–4 步 Turbo 的少步生成路径。
这里的 6B 参数对应核心 DiT;完整系统还包括冻结的 LLaDA2.0-mini 理解骨干、视觉编码器、VAE、RQA 和 Connector。模块边界和各阶段配方一并给出,使研究者既可以观察完整系统如何协同,也可以按自身需求复用其中的纯图片预训练、统一编辑或少步蒸馏模块。
SGLang Day-0 支持 LLaDA-Image 推理
在 LLaDA-Image 开源之际,InclusionAI 与 SGLang 社区协作完成了 Day-0 推理适配。针对模型的多组件推理链路,双方完成了少步采样、序列并行和 FP8 推理等适配。基于 SGLang Diffusion,用户可通过同一套推理框架部署 Base、Turbo 及相应的 FP8 版本,支持文生图和图片编辑,并可通过兼容 OpenAI Images API 的接口提供服务。
结语:先学会画,再学会听话
LLaDA-Image 的核心路线可以压缩成八个字:先学会画,再学会听话。
纯图片承担大规模视觉先验学习,图文对集中完成语言对齐;生成、编辑与快速部署,则继续接到同一套系统中。当图文对不再是预训练的入场券,纯图片也就从“等待配上文字的数据”,变成了视觉生成预训练的主角。
报告也给出了下一步方向:继续扩展世界知识、提高长文本与多区域排版的稳定性,并推进原生 2K 生成。对于社区而言,这套开放框架也为后续探索留下了清晰接口。
Hugging Face:
https://huggingface.co/collections/inclusionAI/llada-image
ModelScope:
https://modelscope.cn/collections/inclusionAI/LLaDA-Image
GitHub:
https://github.com/inclusionAI/LLaDA-Image
arxiv:
https://arxiv.org/pdf/2609.03796
点击【阅读原文】,访问项目
Source: a public AI news aggregator. Copyright belongs to the original authors and outlets; this site only indexes and summarises. Contact us for removal.