网易首页 > 网易号 > 正文 申请入驻

全扩散架构、无需图文对预训练,LLaDA杀穿开源文生图

0
分享至

先学会画,再学会听话。 LLaDA-Image 在预训练和中期训练阶段直接从图片学习视觉先验,超过 90% 的累计生成训练样本采用 image-only 监督;图文对则集中用于后续语言对齐。模型权重、训练代码和完整配方同步开放。



先看成绩:在 Qwen-Image-Bench 上,LLaDA-Image 的英文、中文总分分别达到,在技术报告列出的开源模型中拿下双榜第一。



Qwen-Image-Bench 中英文综合成绩。模型按两条轨道的平均分排序;LLaDA-Image 在报告列出的开源模型中取得中英文双榜第一。

榜单给出了它在主流模型中的量化坐标。再回到最直观的生成效果,先来做一道 “真假图片” 判断题。

下面这组图里,哪些是真实照片?



人物、动物、食物与风景等 LLaDA-Image 生成样例。

答案是:一张也没有

更关键的是,为这个 6B DiT 建立视觉先验时,团队没有把 caption 作为预训练条件:2.2 亿累计生成训练样本中,超过 90% 采用纯图片监督

从林间抓拍、家庭照片和街边市场,到雪山、洞穴与中式园林,这些看似来自手机或相机的画面,全部由同一个模型生成。换到海报、广告和中英文排版,它又能给出下面这样的结果:



LLaDA-Image 的海报、文字渲染、艺术与设计类生成样例,展示模型覆盖多种视觉创作任务的定性效果。

这套模型来自 Inclusion AI,名为LLaDA-Image。其核心是一套从零训练的6B 参数 Diffusion Transformer(DiT),一套权重统一支持文生图和指令图像编辑;进一步蒸馏得到的 LLaDA-Image-Turbo,只需2—4 个采样步

真正让这项工作显得不一样的,是它重新回答了一个基础问题:训练高质量文生图模型,图文对一定要从预训练第一天就上场吗?

LLaDA-Image 给出的答案是:可以先从图片本身建立视觉生成先验,再在后续 SFT 中使用经过描述与一致性检查的图文对完成语言对齐。换句话说,先学会画,再学会听话

这条路线从纯图片预训练一路延伸到语言对齐、统一生成 — 编辑训练和少步蒸馏。生成训练各阶段累计处理约 2.2 亿个样本,最终交出了开篇榜单所示的中英文双榜开源第一成绩。

  • GitHub:github.com/inclusionAI/LLaDA-Image
  • 模型:https://huggingface.co/collections/inclusionAI/llada-image
  • 魔搭:https://modelscope.cn/collections/inclusionAI/LLaDA-Image
  • arxiv:https://arxiv.org/pdf/2609.03796

后端和生成都是扩散模型

LLaDA-Image 采用从理解到生成的全扩散架构:理解侧使用LLaDA2.0-mini,这是一款拥有 16B 总参数、激活 1B 参数的混合专家(MoE)扩散语言模型(dLLM),负责理解指令;生成侧使用从零训练的 6B DiT,负责将理解结果转化为图像。同一套系统可同时支持文生图和指令图像编辑。

图文对,可能并不是生成训练的 “入场券”

传统文生图路线通常从训练早期就把图片与文字说明绑定在一起。要让配对数据达到训练要求,还需要生成或人工补充详细 caption,并经过幻觉检测、文字转录校验和图文一致性过滤。

LLaDA-Image 换了一种分工:预训练和中期训练不把 caption 作为条件,而是由图像自身产生条件信号;到了需要语言监督的 SFT 阶段,再引入图文对完成文本 — 视觉对齐。报告显示,团队在这一阶段使用 Qwen3.6-35B-A3B 和 Qwen3-VL-235B-A22B-Instruct 为图像生成描述,并进一步校验物体、属性、关系与文字转录。

在这套分工里,两类数据被放到了各自更擅长的位置。原始图像保留材质、光影、局部结构和小物体等完整视觉信息;文本描述则擅长提炼语义,把自然语言概念接入已经形成的视觉空间。

纯图片负责建立视觉世界,图文对负责把语言接入这个世界。

尤其在早期低分辨率训练中,直接从实际裁剪区域提取条件,可以让条件与 256 X 256 的训练目标天然对应,并保留更多有效细节。于是,未经文本配对的图片也能直接参与吞吐量最大的视觉学习阶段,高质量配对资源则集中用于后续语言对齐。

这套分工也对应着一种更灵活的数据组织方式:先让图片直接参与视觉学习,再把配对数据集中配置到语言对齐阶段。

完整流程可以概括为六个阶段:



这里的关键,是前两个生成阶段直接从图像自身获得条件信号。从方法接口看,图像通过基础质量筛选后即可参与预训练和中期训练;大模型 captioning 与图文对齐管线则在后续 SFT 阶段发挥作用。

一张图,同时提供 “题目” 和 “答案”

给定一张训练图片,系统先用冻结的 SigLIP-VQ 视觉编码器把它变成图像 token,再随机遮掉其中一部分。保留下来的稀疏视觉 token 与一条固定辅助指令一起进入冻结的多模态理解模型,形成 DiT 的条件;完整图片的 VAE 潜变量则作为生成目标。

换句话说,图片既是条件的来源,也是完整生成目标:模型需要完成一个从局部视觉线索恢复完整图像的任务

  • 条件和目标来自同一块实际训练图像,两者天然对齐;
  • 随机遮挡确保模型需要根据上下文推断完整内容;
  • 恢复缺失内容的目标驱动 DiT 学习物体结构、上下文关系与视觉组成规律;
  • 冻结视觉编码器和理解骨干,只更新 Residual Query Adapter(RQA)、连接器和视觉生成器。





技术报告给出的 SFT 加权数据分布估计。训练内容覆盖自然、设计、人物与少量合成数据;图像预训练和中期训练只使用真实图像。

这条 “视觉优先” 的路线让真实图像的优势随着训练推进逐步显现。报告称,以真实图像为主的配方能够持续提升生成真实感,并展现出更高的长期能力上限。SFT 阶段因此一直让真实图像占绝对多数,同时在后期定向增加文字密集图像与人像数据。

从统计口径看,报告所说的 2.2 亿样本是图像生成管线各阶段的累计样本处理量;理解骨干的 CoT SFT 采用独立口径统计。

一个模型,怎样同时负责生成和编辑?

LLaDA-Image 的模型主体可以分为三部分:负责理解条件的 dLLM 视觉语言模型、连接理解与生成空间的轻量接口,以及真正生成图像的单流 DiT。



LLaDA-Image 架构。文本经 RQA、LLaDA2.0-mini 和 Connector 进入单流 DiT;编辑任务额外接收参考图像的语义特征和干净 VAE 潜变量。

先理解,再交给 DiT 生成

理解模块建立在 LLaDA2.0-mini 扩散语言模型之上。它不只是把提示词变成一组静态文本嵌入,而是作为统一的多模态语义接口,处理文本、训练时的视觉条件和结构化推理信息。

语言模型与图像生成器分别面向语义理解和视觉去噪,二者需要一套专门接口完成表示转换。为此,团队在中间加入了两层桥梁:

  • RQA在理解模型前放入一组可学习查询,通过交叉注意力从输入中提取与生成最相关的信息;
  • Transformer Connector再把理解模型的隐藏状态投影到 DiT 所需的条件空间。

视觉生成部分则是一套纯单流 DiT。文本条件 token、时间信息和图像 token 进入同一组 Transformer 模块,在每一层直接交互,最终预测 Flow Matching(流匹配)速度场。

编辑时,参考图像不经过语言模型

生成和编辑共享同一个理解接口与 DiT 主干,但参考图片走的是一条独立通道。

编辑指令仍由 RQA—dLLM—Connector 路径处理;参考图则完全绕过语言模型,同时提供两类互补信息:

  • SigLIP-VQ 特征提供高层语义信息,帮助模型识别参考图里 “是什么”;
  • 干净的 FLUX2-VAE 潜变量直接提供像素级证据,帮助保留原有身份、结构、纹理与背景。

这两类信号形成了互补:高层语义帮助模型理解编辑对象与指令,像素条件则强化身份、结构和纹理的一致性。两种参考信号一起进入同一个 DiT,使一套权重可以同时承担开放式生成与参考保持编辑。

编辑训练阶段,团队以 1:1 混合 T2I 与 I2I 数据。文生图样本在这里相当于 “能力回放”,持续巩固模型的开放生成、画质和文本对齐能力,让生成与编辑在共享主干上协同演进。

下面是报告中的四组编辑示例:



LLaDA-Image 指令图像编辑示例。

训练稳定性:为什么要拿掉 Norm 里的可学习参数?

对于一个需要长程训练的 6B 参数 DiT,稳定的网络 scaling 和 gradient norm 是整套工程得以持续扩展的基础。

团队在长程训练监控中发现,LayerNorm 或常规 RMSNorm 里的可学习参数会持续改变特征尺度;这种变化在深层网络和长训练周期中累积后,可能表现为 scaling 波动,并在后期带来gradient norm(梯度范数)快速上升

基于这一发现,LLaDA-Image 将归一化层设为无仿射参数形式,在整套 DiT 中统一使用无可学习参数的 RMSNorm。这个改动看起来很小,却直接针对长程训练中逐步累积的尺度漂移:它按照均方根对特征做归一化,并以固定形式维持尺度一致性。

优化器方面,团队在所有生成训练阶段都采用Muon,将其定位为训练系统中的工程选择;归一化层的无参数设计则直接负责改善 scaling 与后期 gradient norm 的稳定性。



临近收敛时,团队合并相邻训练状态的权重,以平滑不同 mini-batch 数据构成带来的指标波动。这些渐进训练、时间步采样和 checkpoint 处理共同组成了完整工程流程;其中,无可学习参数的 RMSNorm专门改善长程训练中的 scaling 与 gradient norm 稳定性。

从 50 步到 2—4 步:同一个 DiT 的 “正负两班制”

基础版 LLaDA-Image 追求完整的多步生成能力,技术报告把它列为 50 步采样。部署时,团队再用 TwinFlow 将它蒸馏为 LLaDA-Image-Turbo,把推理压缩到 2—4 步。

TwinFlow 建立在分布匹配蒸馏(DMD)之上。传统 DMD 训练通常同时需要:

  • 一个冻结的真实分布 score 模型;
  • 一个在线跟踪学生分布的 fake-score 模型;
  • 一个真正要部署的生成器。

传统 DMD 为生成器和在线 fake-score 估计器分别维护相应角色;TwinFlow 则进一步思考,能否用一套共享主干完成这两项工作。

TwinFlow 最巧妙的地方,可以概括成同一个 DiT 的 “正负两班制”:正时间负责生成,负时间负责跟踪学生分布。 具体来说, +t表示生成器更新,-t表示 fake-score 更新;两者共享主干、使用两个输出头,训练时以 1:2 的比例交替更新生成器与 fake-score 分支。

到了推理阶段,系统只保留生成头,fake-score 输出头完成训练使命后退出,部署开销与单生成头保持一致。

在 Qwen-Image-Bench 上,基础版的英文、中文总分分别为 53.53 和 53.38;4 步评测的 Turbo 则达到 50.98 和 50.27。同一模型家族由此形成两种互补部署档位:基础版侧重完整质量,Turbo 侧重推理速度。

九成样本不带文本,最终做到了什么?

技术报告用 Qwen-Image-Bench 作为主要综合生成基准。该基准包含 1,000 条分层提示词,考察画面质量、美学、提示词对齐、现实世界保真和创意生成,并分别提供英文与中文评测。

下面进一步选取报告中分数相近的部分开源与闭源模型进行比较:



Qwen-Image-Bench 部分模型结果,分数来自技术报告。各模型均采用标准推理设置和原始提示词进行比较。

最直观的参照是:把开源与闭源模型放进同一张榜单,LLaDA-Image 在中英文两条轨道上的总分,均位于 GPT Image 1 与 Imagen 4.0 Ultra 之间。

在报告列出的开源模型中,LLaDA-Image 的英文总分领先第二名 Z-Image-Turbo 1.87 分,中文领先 0.67 分;质量、美学和提示词对齐三个分项,在中英文开源模型中也均排名第一。

文字生成方面,LLaDA-Image 在 LongText-Bench 英文和中文部分分别达到0.923、0.913。在包含广告、海报、表情包和街景等多文字区域的 CVTG-2K 上,其平均单词准确率为、归一化编辑距离(NED)为 0.945、CLIPScore 为;在包含 2—5 个文字区域的不同难度设置下,单词准确率保持在 0.857—0.892。

指令编辑方面,LLaDA-Image 在 GEdit-Bench 英文、中文轨道上的总分分别为。这组结果展示了一套共享权重同时完成文生图与双语图像编辑的能力,也体现了统一模型路线的价值。

报告还给出了两个传统诊断基准:GenEval 总分为0.85,DPG-Bench 总分为。其中 GenEval 的单物体和双物体得分分别为 1.00 和 0.98,属性绑定为 0.84;计数能力目前为 0.53,也是后续可以继续提升的方向。

“全栈开源”,这次具体开放了什么?

榜单成绩提供了一个醒目的结果,完整开放的训练链条进一步扩展了这项工作的研究价值。LLaDA-Image 把从 “图片如何变成视觉先验” 到 “模型如何压缩到 2—4 步” 的路径连了起来。

具体来看,这次开放覆盖了五个关键环节:



这里的 6B 参数对应核心 DiT;完整系统还包括冻结的 LLaDA2.0-mini 理解骨干、视觉编码器、VAE、RQA 和 Connector。模块边界和各阶段配方一并给出,使研究者既可以观察完整系统如何协同,也可以按自身需求复用其中的纯图片预训练、统一编辑或少步蒸馏模块。

“开源 SOTA” 的口径同样清晰:它指 LLaDA-Image 在技术报告所列模型及标准评测设置下,取得 Qwen-Image-Bench 英文、中文开源模型第一。与此同时,同一套权重还覆盖双语长文本渲染与指令图像编辑,形成了从综合生成、文字能力到编辑能力的完整验证。

报告也给出了下一步方向:继续扩展世界知识、提高长文本与多区域排版的稳定性,并推进原生 2K 生成。对于社区而言,这套开放框架也为后续探索留下了清晰接口。

SGLang Day-0 支持 LLaDA-Image 推理

在 LLaDA-Image 开源之际,InclusionAI 与 SGLang 社区协作完成了 Day-0 推理适配。针对模型的多组件推理链路,双方完成了少步采样、序列并行和 FP8 推理等适配。基于 SGLang Diffusion,用户可通过同一套推理框架部署 Base、Turbo 及相应的 FP8 版本,支持文生图和图像编辑,并可通过兼容 OpenAI Images API 的接口提供服务。

结语

LLaDA-Image 的核心路线可以压缩成八个字:先学会画,再学会听话。 纯图片承担大规模视觉先验学习,图文对集中完成语言对齐;生成、编辑与快速部署,则继续接到同一套系统中。

模型权重、训练代码与详细配方的同步开放,让这个 6B DiT 从图片出发、走过语言对齐与统一编辑、最终落到 2—4 步部署的全过程,都成为可以研究和继续推进的技术路径。

当图文对不再是预训练的入场券,纯图片也就从 “等待配上文字的数据”,变成了视觉生成预训练的主角。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
U20亚预赛冷门不断:卫冕冠军无缘出线 越南“降级”

U20亚预赛冷门不断:卫冕冠军无缘出线 越南“降级”

体坛周报
2026-09-07 10:59:10
《我的前半生》马伊琍戏中儿子考入中戏!帅气少年迎新晚会秀空翻惊艳

《我的前半生》马伊琍戏中儿子考入中戏!帅气少年迎新晚会秀空翻惊艳

手工制作阿歼
2026-09-07 17:15:54
这些“啼笑皆非”的穿帮镜头,如今个个成了经典,你都看过哪些?

这些“啼笑皆非”的穿帮镜头,如今个个成了经典,你都看过哪些?

莹莹的历史说
2026-09-06 04:36:27
王楚钦再创历史,将成第一个把世界第一拱手送给日本的国乒运动员

王楚钦再创历史,将成第一个把世界第一拱手送给日本的国乒运动员

人类的关注
2026-09-06 04:32:21
70年未见!超强厄尔尼诺逼近,联合国发警告:4900万人或面临断粮

70年未见!超强厄尔尼诺逼近,联合国发警告:4900万人或面临断粮

梦想的现实
2026-09-07 20:11:36
曝75岁郭台铭出轨,女方身份被扒,50岁离异带娃,但手握“王牌”

曝75岁郭台铭出轨,女方身份被扒,50岁离异带娃,但手握“王牌”

暖心萌阿菇凉
2026-08-15 16:59:54
曾说自己实力不够⋯北欧混血的她回来了!

曾说自己实力不够⋯北欧混血的她回来了!

孤独的独角兽影视
2026-09-07 10:20:15
拉什福德重焕新生:曼联省下1亿英镑,战术升级成进攻利刃

拉什福德重焕新生:曼联省下1亿英镑,战术升级成进攻利刃

星耀国际足坛
2026-09-07 22:08:52
美网女单再爆冷门:上届亚军阿尼西莫娃0-2出局,郑钦文连赢7局逆转凯斯杀进美网16强

美网女单再爆冷门:上届亚军阿尼西莫娃0-2出局,郑钦文连赢7局逆转凯斯杀进美网16强

林子说事
2026-09-07 10:42:27
成龙确诊ADHD,粉丝心疼极了

成龙确诊ADHD,粉丝心疼极了

大爱三湘
2026-09-05 22:24:19
赴韩留学生后续曝光,郑某文文纠葛不是秘密,有人第一时间怀疑他

赴韩留学生后续曝光,郑某文文纠葛不是秘密,有人第一时间怀疑他

江启
2026-08-28 09:28:15
给胖东来供货十七年的牟强说,这里一边是天堂,一边是地狱。天堂是账期短,货款七天左右就能到账,地狱则是...

给胖东来供货十七年的牟强说,这里一边是天堂,一边是地狱。天堂是账期短,货款七天左右就能到账,地狱则是...

LULU生活家
2026-09-07 20:11:19
随着斯瓦泰克2-0晋级!16强敲定!郑钦文和教练有可能做出3大调整

随着斯瓦泰克2-0晋级!16强敲定!郑钦文和教练有可能做出3大调整

宝哥精彩赛事
2026-09-07 01:53:36
全国理发店开始倒闭潮!明明没电商冲击,为何还会自己干到黄?

全国理发店开始倒闭潮!明明没电商冲击,为何还会自己干到黄?

史之铭
2026-09-08 00:41:14
这也太像了!河北女篮小将长相酷似孙颖莎 连发型都一样 本人回应

这也太像了!河北女篮小将长相酷似孙颖莎 连发型都一样 本人回应

念洲
2026-09-07 16:38:42
圈内最渣女演员私生活混乱,曾与17名男性无缝衔接

圈内最渣女演员私生活混乱,曾与17名男性无缝衔接

看尽落尘花q
2026-07-25 08:31:02
专家犀利发声:灵活就业者缴职工社保,看似保障,实则是变相剥夺

专家犀利发声:灵活就业者缴职工社保,看似保障,实则是变相剥夺

偷喝一口奶
2026-09-06 08:54:31
赌王千金何超仪又爆猛料:陈子聪重病得治全靠雇人去地府叫魂!

赌王千金何超仪又爆猛料:陈子聪重病得治全靠雇人去地府叫魂!

陈意小可爱
2026-09-06 04:14:39
惠州女子被控“发视频寻衅滋事”遭羁押608天后检方撤诉,获43.68万元国家赔偿

惠州女子被控“发视频寻衅滋事”遭羁押608天后检方撤诉,获43.68万元国家赔偿

封面新闻
2026-09-07 20:34:09
谁才是真正的周期之王?

谁才是真正的周期之王?

雪球
2026-09-05 12:15:10
2026-09-08 03:03:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13940文章数 142729关注度
往期回顾 全部

科技要闻

小米澎程N90 Max定价26.99万元

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

体育要闻

压哨避开CBA选秀规则?NBL香港金牛队已为男篮国手王俊杰报备合同

娱乐要闻

热搜第一,演员李沐宸致歉

财经要闻

证监会原副主席王建军一审被判无期徒刑

汽车要闻

智能可变大空间SUV 小米澎程系列车型上市 20.99万起

态度原创

房产
艺术
游戏
数码
军事航空

房产要闻

10万人吃瓜!三亚这个楼盘,法拍网上卖疯了!

艺术要闻

太罕见!苏轼这幅字流落民间900年,险些被当废纸卖掉……

鸣潮费大劲捏出来的清冷师尊,咋就变成了哦齁剑仙?

数码要闻

欧洲空调市场起飞!美的小米TCL狂卷IFA:国产技术降维打击

军事要闻

媒体:中美战区司令会晤释放的信号 台湾要听懂

无障碍浏览 进入关怀版