一句话讲清楚 蚂蚁集团 InclusionAI 开源了 LLaDA-Image :一个 6B 参数的生图模型,训练全程 98% 用真实图像,先不配任何文字描述、只靠图片本身学会"怎么画",之后再补语言理解;文生图和图像编辑共用一个模型,在 Qwen-Image-Bench 的英文、中文两条赛道都拿下开源第一,训练代码和完整配方全部公开。

论文标题:LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes
论文链接:https://arxiv.org/abs/2609.03796
Github 链接:https://github.com/inclusionAI/LLaDA-Image
模型开源:https://huggingface.co/collections/inclusionAI/llada-image
先做一道论文开头出的题:下面这组图片里,哪些是真实照片?
论文在第 2 页给读者的挑战:找出图中的真实照片。人像、食物、街景、动物,看上去都像随手拍的生活照。
答案是:一张真的都没有。整版图片全部由 LLaDA-Image 生成,包括下面这些需要精准渲染中英文文字的海报、书法和展览卡片。
揭晓页:全部为模型生成。中英文字渲染是这类统一模型的常见短板,图中海报级排版和毛笔字都直接生成。
这份技术报告真正值得看的,是它把"怎么练出来的"整个摊开了:数据怎么筛、每个阶段用什么分辨率、优化器怎么选、怎么把推理压缩到 2-4 步,全部写成可复用的配方。它在 Qwen-Image-Bench 榜单上的位置如下,按两条赛道的平均分排序:
Qwen-Image-Bench 结果总览: LLaDA-Image 以英文 53.53 、中文 53.38 排在所有开源模型第一位。
图文配对数据为什么是个麻烦
主流的文生图模型,从 Stable Diffusion 到近两年的各家新模型,训练方式大同小异:拿几亿张图片,每张配一段文字描述,让模型学着"按文字画画"。这条路线的瓶颈恰恰在配对数据本身。
文字描述是昂贵的。给几亿张图写高质量描述,基本靠更大的视觉语言模型来标注,标完还要校验,标错的内容会原样教给模型。更隐蔽的问题是"有损"。文字描述说的是完整原图,但训练早期分辨率只有 256×256 。一张几千像素宽的原图压到这个尺寸,描述里提到的细节可能已经不存在。模型会学到"文字说有、图里没有"这类错位配对。
另一种常见做法是大量掺入合成的图-文对,早期指标爬得快,但合成图的瑕疵会一路传给下一代模型,真实感的天花板偏低。
LLaDA-Image 的思路是把两件事拆开:先不碰任何文字标注,只用图片本身把"怎么画"学会;理解文字这件事放到后面的阶段再补。整套生成训练用了约 2.2 亿个样本, 98% 是真实图像,九成以上的样本不带文字标注。
训练与发布路径:先微调理解模块(虚线,之后全程冻结),再依次进行纯图像预训练、纯图像中期训练、文生图配对训练、生成-编辑联合训练,最后蒸馏出 Turbo 版本。
模型架构:冻结的理解模块加一个从零训练的生成器
先补一句背景。 DiT ( Diffusion Transformer ,当前图像生成的主流骨干结构)的训练目标是流匹配:训练时把一张干净图像逐步加噪,网络学习在任意噪声程度下预测"指向干净图像的方向";生成时从纯噪声出发,按这个预测反复迭代几十轮,就能一步步去噪出图。所谓步数,指的就是去噪迭代的轮数。
LLaDA-Image 由三部分组成:负责理解输入的视觉语言模型( VLM )、负责画图的 6B 参数 DiT ,以及中间的连接模块。连接模块把理解结果翻译成指导画图的控制信息。
架构总览:理解模块全程冻结,连接模块把理解结果映射为生成条件;编辑时参考图经独立通路直接进入生成器,不经过理解模块。
理解模块用的是自家的 LLaDA2.0-Mini 。它属于 dLLM ( diffusion language model ,扩散式大语言模型),用逐步去噪的方式生成文本,与常见的逐词输出的自回归模型相区别。训练第一步先对它做思维链监督微调,用带推理步骤的数据把多模态理解能力再提一档;之后进入生成训练时,这个模块全程冻结,一个参数都不动。
为什么不继续微调理解模块?论文的取舍是保住它已有的多模态能力,生成所需的信息改由两个轻量模块来取。第一个是残差查询适配器( RQA ):在理解模块入口挂一组可学习的"提问"向量(查询 token ),主动扫描全部输入,先把与画图相关的信息摘要出来,再连同原输入一起送进理解模块。相当于给这个冻结模块外挂一条只服务于生成的旁路,不动它一个参数。第二个是浅层 Transformer 连接器:把理解模块的输出特征投影到生成器能用的空间。训练时只更新这两个模块和 DiT 本体。
图像编辑的设计更值得注意。参考图完全绕过理解模块,改走两条独立通路直接进 DiT 。一条用现成的开源视觉编码器 SigLIP-VQ 编码参考图的语义,经一个小分支转成 token 。另一条把参考图过 VAE (变分自编码器,把图像压缩成低维特征表示的模块,图像生成模型都在这个压缩表示上工作,而非直接处理原始像素),得到未加噪的干净压缩特征,与加噪中的目标图拼接。
两条通路互补:语义通路告诉模型"参考图里有什么",像素通路保住"哪些地方一个像素都不能动"。改哪里、留哪里分得比较开,而且不需要单独再养一个编辑模型。
只用图片怎么学会画图
纯图像预训练的核心问题是:没有文字描述,用什么告诉模型"该画什么"?论文的答案是让图像自己给自己当条件。
具体做法是:随机从原图裁一块区域,裁出来的块原生尺寸不大( 256×256 或略大),再轻轻压到 256×256 ;冻结的理解模块直接从这块图里提取语义特征作为条件, DiT 学着把这块图生成出来。因为裁块本身就小,压缩造成的损失远小于把整张图硬压下去。
但直接这么做会退化成复印:模型把输入原样抄一遍就够了。所以训练时对输入的图像特征做随机掩码,只保留一部分图像块,强迫模型根据可见部分推理出缺失内容:看到半张脸要能补出完整构图,看到屋檐要能补出房屋结构。这相当于把"复制"任务改造成了"完形填空"。
这套设计还有一层好处。常规配对训练里,整张图必须压到训练分辨率,否则图与文对不上;纯图像训练的条件来自图像自身,裁多大、压多少都可以自己定。模型在 256×256 的名义分辨率下,实际反复见过的是远超这个分辨率的局部细节。
预训练之后是同样形式的中期训练,训练分辨率提到 512×512 ,并开始按宽高比分组训练:把图按原始宽高比归入像素总量相近的组,只裁掉少量边缘,不再硬压成正方形。之后才进入配对的文生图训练:先在 512×512 一档建立图与文的对应,再升到 1024×1024 ,最后做针对文字渲染和人像的定向强化。分辨率提升和文字监督引入这两件事被分开处理,避免模型一次承受两个突变。
数据: 220M 样本, 98% 是真实照片
训练数据按内容分成四大类,人物类占比最高:
按监督微调权重估计的内容分布:人物占 37.2%,自然 26.6%、设计 26.4%,合成内容仅 9.9%。
这个分布里有两个数字值得留意。人物占 37.2%,是所有类别里最大的一块,说明人像生成被当作重点能力投入;合成内容只占 9.9%,主要用在需要渲染文字的场景。配对的图-文监督数据里,真实图像占比也始终保持在七成以上。
进入训练前的过滤分三步。先卡元数据:图像总像素要超过 1024²,且每像素至少摊到 0.15 字节的存储。压缩得太狠的图,细节早在保存时丢掉了,直接淘汰。美学过滤用评分模型 ArtiMuse 打美学分,低于 60 分的丢弃。质量过滤再用评分模型 DeQA-Score ,低于 4.0 分的丢弃。
过了筛的图再用两个模型标注: Qwen3.6-35B-A3B (总参数 35B 、每次激活约 3B )和 Qwen3-VL-235B-A22B-Instruct 。标注提示词要求忠实描述可见主体、属性、动作、空间关系和风格,图里的文字要逐字转写、保留原文。之后还要一个模型反过来对照图和描述,把出现幻觉物体、转写错误的描述全部扔掉。编辑类数据同样要做一致性检查,只保留方向正确、没有编造细节的指令对。
训练稳定性靠什么
从零训练一个 6B 的 DiT ,跑完预训练、中期训练、多阶段监督微调和蒸馏,稳定性是绕不开的坎。论文里三个选择值得单独说。
无参数 RMSNorm 。 DiT 里所有归一化层都换成了不带可学习缩放系数的 RMSNorm (只按数值均方根把激活拉回稳定区间,没有任何额外参数)。这个改动很小,但论文明确说它对长时间连续训练的稳定性帮助显著。生成器全程用 Muon 优化器,这是近一年在多个大模型训练中被验证过的选择。
偏向高噪声的采样。 均匀采样给每个噪声阶段同样多的练习量,但高噪声阶段画面还没成形,预测最难、错了会一路传导到最后;低噪声阶段画面基本确定,剩余修正量很小。 LLaDA-Image 用一种偏向高噪声区段的抽样分布分配训练量,把更多练习花在最容易出错的地方。
检查点合并。 训练接近收敛时,相邻检查点在基准上的得分会来回震荡,只挑一个检查点等于把采样的偶然波动固化下来。团队最终把多个相邻检查点的权重做了平均,各基准上的表现明显更稳。
编辑训练阶段还有一个细节:文生图和编辑数据按 1:1 混合喂入,给生成能力持续保温。只训编辑会让模型过拟合到分布窄得多的编辑任务上,把前面学到的生成能力丢掉一部分;掺着练相当于持续复习,让一个模型同时保住两种能力。
生成质量:赢在哪、输在哪
前面那张榜单图已经给出结论:开源第一,英文 53.53 分、中文 53.38 分,分别比此前的开源最高分模型 Z-Image Turbo 高 1.87 和 0.67 分。这个成绩是模型不加任何外挂跑出来的:没有提示词增强,推理时也没附加思考步骤。
Qwen-Image-Bench 英文赛道完整得分:闭源阵营里 GPT-Image 2 以 65.23 领先,开源阵营中 LLaDA-Image 以 53.53 居首。
英文赛道上,画面质量、美学、提示词对齐三个维度都是开源第一,创意生成在英文赛道也是开源第一。与闭源模型的差距集中在两个维度:真实世界合理性( 43.90 对 GPT-Image 2 的 59.40 )和创意生成( 51.09 对 75.34 )。按提示词精确作画这类能力已经追平了一部分闭源模型,但依赖世界知识和复杂创意的题,差距还很明显。
同一提示词下的跨模型对比:提示词对发丝、皮肤质感、光线做了极其具体的约束。 LLaDA-Image Turbo (左上)对人物姿态和整体氛围的还原因果相对完整。
文字渲染是另一个可以量化的维度。 LongText-Bench 考察长字符串的书写正确性, LLaDA-Image 拿 0.923 (英)和 0.913 (中),两种语言表现接近,但低于专攻文字渲染的 Qwen-Image 2512 ( 0.956/0.965 )。
复杂场景里的多块文字用 CVTG-2K 考察:一张图里出现两到五块文字(海报、广告、表情包),看每块的词准确率。 LLaDA-Image 平均词准确率 0.875 ,在全部对比模型里排第二;更难得的是稳定性,文字块从两块加到五块,准确率只从 0.892 降到 0.857 。
竖排题字这种最考验中文渲染的场景,效果可以直接看图。提示词要求画出两列竖排题诗"沾衣欲湿杏花雨,吹面不寒杨柳风":
浅绛山水画轴跨模型对比:提示词要求右上、左上两列竖排题诗并画出雨后山村。 LLaDA-Image Turbo (左上)完整写出两列题字;部分竞品出现字重复或漏写。
传统基准 GenEval 上总分 0.85 。它把提示词跟随拆成六个小项, LLaDA-Image 的属性-物体搭配(比如把"红色"正确安到"车"上)拿 0.84 ,是全部对比模型的并列最高;但计数只有 0.53 ,数数能力是明确的短板。论文自己也说, GenEval 这类老基准的区分度已经不高,分数只作参考。
编辑:一个模型同时管生成和改图
开源阵营里不少系统把文生图和编辑拆成两个模型, LLaDA-Image 选择共用一套权重。下面是八个编辑案例,改风格、改文字、删物体、换背景、添家具都覆盖了:
八个编辑案例:换风格、改文字、删物体、给线稿上色、加手势、换背景、添家具、换物品,未被要求修改的区域保持原样。
编辑评测用 GEdit-Bench : 606 个真实编辑案例、 11 类任务,中英双轨,每个输出按三个口径打分:语义一致与指令遵循( GSC )、感知质量与自然度( GPQ )、两者综合的总评( GO )。 LLaDA-Image 拿到英文 7.336 、中文 7.294 的总评。
这个分数放榜里不算领先, FireRed-Image-Edit ( 7.943 )、 Qwen-Image-Edit 2511 ( 7.877 )这些专用编辑模型都在它前面;但它是文生图和编辑共用一套权重跑出来的成绩,比前代 LLaDA 2.0 Uni ( 6.61/6.66 )高出约 0.7 分。
分维度看有个清晰的结构:语义一致( GSC ,英文 8.043 )明显强于感知质量( GPQ ,英文 7.182 )。也就是说,它对"该改什么"的理解比较到位,但改完之后的画面质感与专用编辑模型还有约 1 分的差距。论文把这个差距列为明确的改进方向。
GEdit-Bench 完整得分: GSC 衡量语义一致与指令遵循, GPQ 衡量感知质量, GO 为总评; LLaDA-Image 的 GSC 接近专用编辑模型, GPQ 偏弱。
Turbo :蒸馏到 2-4 步
基础版模型出图要走完几十轮去噪迭代。团队用自研的 TwinFlow 方法把它蒸馏成 LLaDA-Image Turbo , 2-4 步就能出图。
蒸馏的目标,是让学生模型用一步画出接近原模型几十步的效果。 TwinFlow 建立在分布匹配蒸馏( DMD2 )思路之上:除了学生,还要养一个"陪练"模型,专门模仿学生目前的出图水平。两者交替进步:学生试着骗过陪练,陪练努力识破学生,学生在被识破中变强。通常这需要养两个网络, TwinFlow 的做法是把两者塞进同一个 DiT :时间步取正号时走学生分支,取负号时走陪练分支,符号只是角色标记,两个输出头共享一个骨干。推理时只保留学生分支,陪练零开销。训练节奏上,学生与陪练按 1:2 交替更新,比 DMD2 原方案的 1:5 更省。蒸馏之后还有一轮强化微调收尾。
代价在数字里看得见: Turbo 在 Qwen-Image-Bench 英文赛道是 50.98 ,比基础版低 2.55 分。这是速度换质量的常规折衷,对交互式产品场景通常划算。
边界在哪
这份报告有个少见的优点:把取舍写得明明白白。真实数据主导的配方,早期基准分数爬得比合成数据路线慢,作者明确承认这一点,押注的是收敛后的真实感和上限。注意这仍是押注:"真实数据上限更高"在文中是观察加推断,尚未被严格证明,只是这篇报告用自己的结果投了赞成票。从结果看,真实感相关维度(美学、质量)确实强,而依赖世界知识的真实世界合理性维度还落后闭源模型一大截。这个差距部分来自知识覆盖,部分来自 6B 的模型容量,论文没有强行归因。
论文列出的未解决问题清单也很直白:计数与算术类能力弱;文字区域多、篇幅长时渲染稳定性会下降;训练时的标称分辨率是 1024×1024 ,原生 2K 生成还没做;更广的世界知识需要继续补。
对行业的意义可能在于配方本身: 2.2 亿样本、 98% 真实图像、九成以上不用标注,就把中英文生图和编辑评测做到了开源第一。这套配方靠的是冻结的理解模块搭配从零训练的 6B 生成器。数据标注预算被压到远低于同类工作的水平。不过有两点保留:其一,这次登顶用的榜单叫 Qwen-Image-Bench , Qwen 与 InclusionAI 同属阿里生态,第一名的含金量值得再用独立榜单交叉印证;其二,论文没有披露训练算力开销和成本,想完整复现的团队要先自行估算这笔账。团队一次放出四个权重文件(基础版、 Turbo 版及各自的 8 位低精度 FP8 版本),加上训练推理代码和每个阶段的超参数,把公开能给的部分都给了。


VIP复盘网