网易首页 > 网易号 > 正文 申请入驻

文生图Scaling新变量,被字节Seed团队发现了

0
分享至



文生图模型一直在扩展模型、数据和算力,但训练图像所配 Caption 的信息量,却很少被作为一个独立变量系统研究。ByteDance Seed 团队发现:自然语言 Caption 变长,并不意味着模型获得了更多可用的视觉监督;相比长度,Caption 中与图像绑定的信息量更能预测扩散模型最终达到的训练损失。

基于这一发现,团队提出 Structured Prompt,并从 Diffusability 与 Promptability 两侧共同提升文本条件,最终在复杂组合、推理和世界知识生成任务上取得显著提升。



论文 Figure 1|自然语言长度很快饱和;结构化条件持续增加图像信息,并沿统一关系降低扩散训练损失。

过去几年,文生图模型的进步几乎沿着一条熟悉的路线展开:更大的模型、更多的数据,以及更高的训练算力。

但文生图与语言模型之间存在一个容易被忽略的差异。语言模型可以直接从文本序列中进行自监督学习;文生图模型则依赖图像与 Caption 的配对,学习 “什么样的文字对应什么样的视觉内容”。图像中可能包含大量物体、属性、位置、动作和关系,但只有被 Caption 准确描述并清晰绑定的部分,才能作为文本条件监督传递给模型。

于是,一个基础问题出现了:除了继续扩大模型、数据和算力,我们能否通过增加 Caption 所携带的图像信息,让生成模型学得更好?

在这项新工作中,ByteDance Seed 团队研究了这一问题。核心结论可以概括为一句话:

真正随文本条件扩展的,不是 Caption 的 token 数量,而是其中可被模型利用的图像信息。



  • 论文标题: Scaling Properties of Text Conditioning in Visual Generation
  • 作者: Zilong Chen, Chaorui Deng, Kunchang Li, Hongyi Yuan, Haoqi Fan 机构: ByteDance Seed
  • 论文:https://arxiv.org/abs/2607.29679
  • 项目主页:https://heheyas.github.io/context-scaling
  • 代码:https://github.com/heheyas/context-scaling
  • 模型:https://huggingface.co/collections/heheyas/context-scaling
  • 在线 Demo:https://heheyas-context-scaling.hf.space/
  • Hugging Face Paper:https://huggingface.co/papers/2607.29679

Prompt 变长了,

为什么模型没有变强?

一个直觉做法,是把训练 Caption 或用户 Prompt 写得更长、更详细。更多 token 看起来应该意味着更多监督,也应该帮助模型生成更复杂的图像。

实验却给出了不同答案。在多种现有开源文生图系统上,自然语言 Prompt 随长度增加很快饱和,最终输出甚至低于各自最短 Prompt 的表现。即使专门在同一套长文本 Caption 上训练扩散模型,收益也十分有限。

为了把这个现象看得更清楚,团队设计了一个固定骨干网络的图像重建实验。对于同一张参考图像,团队从同一份完整标注出发,生成四个详细程度逐渐增加的自然语言 Caption,再使用相同的 Qwen-Image 模型和随机种子尝试还原该图像。这些 Caption 描述相同的实体和关系,后续版本主要通过补充和展开自然语言表达来增加长度。

令人意外的是,Caption 虽然显著变长,图像重建质量却几乎不再提高。新增的 prose 更多是在解释、改写或连接已经出现的内容,并没有持续增加新的、可稳定使用的视觉变量。



论文 Figure 3|固定骨干重建实验:NL Caption 继续变长后重建趋于饱和,逐步恢复 SP 字段则持续改善。

这说明,Caption 长度只是一个很弱的代理变量。一个文本可以写得很长,却仍然没有清楚说明:某个属性属于哪个物体、两个物体是什么关系、各自位于哪里,以及它们在画面中的前后层次。

如何衡量 Caption 里真正的图像信息?

如果 token 数量不足以衡量监督强弱,就需要直接测量 Caption 中与图像绑定的信息。为此,团队从已有工作中改造了两个互补指标:Grounded Perplexity Gain(GPG)和 Effective Detailness(ED)。

GPG:图像让 Caption 变得 “更可预测” 多少。

GPG 是一个需要读取模型 token 概率的白盒指标。对于同一句 Caption,团队分别让一个冻结的视觉语言模型看到和看不到配对图像,并计算图像出现后 Caption 内容 token 的对数似然提升。若 Caption 中包含大量与该图像紧密绑定的信息,看到图像应当显著提高模型对这些 token 的预测能力。

ED:Caption 覆盖了多少可靠的图像属性。

ED 是一个不依赖 token 概率的黑盒语义指标。它分别从图像和 Caption 中提取带有实体上下文的属性,再计算 Caption 属性的准确率与图像属性的召回率。最终采用更重视准确率的 F0.5,对 Caption 中没有图像依据的描述施加更强惩罚。

两个指标从不同角度刻画同一个问题:GPG 关注图像与文本之间的统计依赖,ED 关注 Caption 是否准确覆盖了可验证的视觉内容。



论文 Figure 6|GPG 与 ED 的定义及测量趋势。

Caption 信息量可以预测扩散模型的训练损失

接下来,团队固定图像、模型架构、初始化方式、优化配置和训练预算,只改变训练 Caption。整个实验包含 15 种 Caption 配置:三个不同长度的自然语言版本、六个逐步恢复字段的 Structured Prompt 版本,以及六个空间表达或字段遮蔽变体。每种配置都从同一个 BAGEL continued-training checkpoint 出发,独立训练一个扩散模型。

结果显示,自然语言 Caption 的 token 数与训练结果并不存在统一关系;但当横轴换成 Caption 信息量后,不同格式和详细程度的配置落在了高度规律的曲线上:

  • 收敛后的 diffusion loss 与 GPG 近似呈线性关系,Pearson r = -0.984;
  • 收敛后的 diffusion loss 与 ED 呈幂律趋势,log-log 空间中的 Pearson r = -0.971;
  • GPG 与 ED 对不同 Caption 配置的排序也高度一致,Spearman ρ = 0.96。

团队将其称为 text conditioning 的 scaling properties。它不是一个对所有模型都成立的理论定律,而是在固定架构与训练 recipe 下得到的经验标定。但它带来了两个直接价值。

第一,它把 Caption 信息量从一个模糊的 “数据质量” 概念,变成了可以控制和测量的训练变量:在模型、图像和算力不变时,信息量能够预测模型最终达到的训练损失。

第二,完成一次标定后,可以在同一训练 recipe 下先用 GPG 或 ED 比较候选 Caption 方案,再决定是否投入昂贵的扩散模型训练。对未参与拟合的六个 Caption 变体,两个指标仍能较准确地预测其收敛损失。



论文 Figure 7|在固定训练 recipe 下,收敛损失随 Caption 信息量呈现稳定关系。

Structured Prompt:

让信息不仅更多,而且更容易被模型使用

前面的实验揭示了一个关键点:仅仅增加自然语言 prose 并不够,新增信息还需要以稳定、明确的方式组织起来。

因此,团队提出 Structured Prompt(SP),用结构化 JSON 表示一张图像中的视觉变量。它包含三个层次:

  • 全局层:画面意图、场景、氛围、风格、光照和摄影信息;
  • 元素层:每个主体的身份、属性、动作、位置、可选深度和局部摄影信息;
  • 关系层:不同元素之间的位置、遮挡、交互和语义关系。

与自由文本相比,SP 的关键不只是 “JSON” 这一外观,而是让不同视觉变量进入稳定的命名字段,减少属性归属、空间关系和对象绑定上的歧义。在固定骨干重建实验中,随着 SP 字段逐步恢复,重建质量持续提高;在完整训练 sweep 中,字段覆盖增加也同步提高 GPG、ED,并降低收敛后的 diffusion loss。



论文 Figure 5|Structured Prompt 将全局、元素级和跨元素视觉变量组织到命名字段中。

为了在大规模训练数据上生成完整 SP,团队构建了一套 image-to-SP 标注流水线。通用 VLM 负责全局语义和局部内容,Sapiens 补充人体姿态证据,DepthAnything V2 提供相对深度,SAM 2.1 提供掩码与遮挡线索,最后再由 VLM 将这些信息统一整理为一致的完整 SP。



论文 Figure 8|VLM 与姿态、深度、分割专家共同构建完整 Structured Prompt。

团队将一个 Caption 表示能够向扩散模型暴露并组织图像监督的能力称为 Diffusability。SP 提升的正是这一侧:在不改变扩散模型架构的情况下,让模型从文本条件中学到更多、更明确的视觉变量。

Promptability:

有了好的结构,还需要 LLM 把它填好

训练时可以从配对图像中提取完整 SP,但实际生成时只有用户的一句话,没有参考图像或 oracle 标注。系统还需要一个 LLM prompter,把用户请求扩展成详细、连贯、且不违反原始约束的 SP。

团队把这种从用户请求实例化结构化条件的能力称为 Promptability。端到端生成质量取决于两侧共同作用:

Generation Quality = Diffusability × Promptability

这里的乘号是一种组织视角,而不是拟合得到的数学乘法公式:Diffusability 描述扩散模型能够从 Caption 表示中学到什么,Promptability 描述 LLM 在推理时能否真正填出高质量的 Caption 实例。



论文 Figure 4|Structured Prompt 连接标注、测量、diffuser 训练、prompter 训练与最终生成。

首先,团队固定 SP schema 和 Qwen-Image diffuser,只替换零样本 LLM prompter。随着 Qwen3.5 从 0.8B 扩展到 397B,thinking 模式下的 GenEval++ 从 46.4% 提升到 86.8%。除最小模型容易在思考过程中重复并无法输出有效 JSON 外,chain-of-thought 在其他尺度上都带来进一步提升。这说明,通用 LLM 的模型能力和推理能力,可以通过 Caption 接口直接转化为更好的图像生成结果。

但零样本 LLM 仍然倾向于生成信息不足、构图较简单的 SP。为进一步提高 Promptability,团队采用三阶段训练:

  1. SFT 学习扩散模型所期望的 SP 内容分布,而不只是 JSON 格式;
  2. Cold-start 从带有配对图像的 privileged reasoning traces 中蒸馏 “如何仅根据用户请求推导 SP”;
  3. RFT 在 prompter 自己生成并渲染的 rollout 上继续优化,由 verifier 筛选高置信轨迹,再通过 image-conditioned teacher 的 on-policy self-distillation 提供稠密 token 监督。

消融实验表明,三阶段承担不同作用:SFT 带来最大的单阶段结构提升,cold-start 加强从用户请求到 SP 的推导,而 verifier-gated OPSD 在 prompter 自身分布上取得最强结果。



论文 Figure 9|固定 schema 与 diffuser 后,生成质量随 LLM prompter 尺度和 reasoning mode 提升。



论文 Figure 10|SFT、cold-start 与 verifier-gated RFT 三阶段 prompter 训练。

结构化表示,

也让生成过程更容易迭代修正

SP 的字段化表示还有一个自然优势:当生成图像出现错误时,系统可以定位并修改相应的对象、属性、关系或布局字段,而不是重新改写整段自然语言 Prompt。

基于此,团队构建了 refine-render-judge 循环。每一轮中,prompter 根据用户请求和历史反馈生成或修订 SP,固定 diffuser 渲染图像,在线 judge 再针对 Prompt 遵循、结构和视觉质量给出 PASS/FAIL 与具体问题。若失败,下一轮只需围绕相关字段进行调整。

实验显示,增加迭代预算能够继续提高结构、对齐和 GSB 表现;但有效推理长度并不长。对于训练后的 prompter,即使允许最多 8 轮,平均也只使用 2.31 轮;从 Tmax = 4 增加到 8,收益已经很小。这表明,文生图确实受益于迭代纠错,但在当前设置下并不需要很长的 prompt-side reasoning trajectory:修复主要规格错误后,额外轮次会迅速饱和。



论文 Figure 14|Refine-render-judge 的 agentic 推理循环。



论文 Figure 15|循环能够修正对象拆分、关系和整体布局问题。

同一套 Qwen-Image,

结构化接口带来了多大提升?

最终系统由 SP-trained diffuser 与训练后的 LLM prompter 组成。它在几乎所有报告指标上领先所比较的开源权重模型,并在大多数评测上达到或超过所比较的闭源系统,优势在组合、推理和世界知识任务上尤其明显。

更关键的是 matched control。为了排除 “只是多训练了一些” 的解释,团队使用完全相同的 Qwen-Image 架构、训练图像、训练阶段和预算,额外训练了一套始终使用自由自然语言 Caption 的系统。结果如下:



论文 Table 2|与代表性文生图系统的完整对比。截图保留论文中的评测定义、加粗与脚注。

Matched NL 的额外训练确实带来了一些提升,但远不足以复现 SP 系统的结果。这说明,收益不能简单归因于更大的 backbone 或更多训练,而与 prompter 和 diffuser 之间所使用的结构化 Caption 接口密切相关。



论文 Figure 11|复杂空间关系、数量和属性绑定的定性对比。

下一步不只是 scale 模型,

也要 scale 条件本身

这项工作的出发点很简单:对于文生图模型,Caption 不是无关紧要的元数据,而是图像内容进入文本条件学习的主要接口。

当 Caption 只是变长时,新增 token 可能只是改写和铺陈;当图像信息被准确提取、清晰绑定并稳定组织时,同一个生成模型才能从中学习更多。GPG 和 ED 让这种信息成为可测量的变量,Structured Prompt 提高 Diffusability,LLM scaling、post-training 和短程 agentic refinement 则提高 Promptability。

因此,文生图的下一步 scaling 不应只关注 “负责渲染的模型有多大”,还应关注:

传递给模型的文本条件,究竟携带了多少它真正能够学习和使用的图像信息?

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中国女篮决战美国队,首发五人大调整,输20分以内就算赢

中国女篮决战美国队,首发五人大调整,输20分以内就算赢

宗介说体育
2026-09-04 14:13:51
图个好回忆:孙宇晨前女友景甜,当年腾讯靠它迷倒多少网吧少年?

图个好回忆:孙宇晨前女友景甜,当年腾讯靠它迷倒多少网吧少年?

17173游戏网
2026-09-03 18:48:07
中央汇金资管2026半年报退出四家化学制药企业前十大流通股东

中央汇金资管2026半年报退出四家化学制药企业前十大流通股东

终南听雨
2026-09-04 13:48:37
一月捐人疑吐槽韩红基金会!停捐后立马被电话追问原因,平时一个电话都没

一月捐人疑吐槽韩红基金会!停捐后立马被电话追问原因,平时一个电话都没

小徐讲八卦
2026-09-04 07:32:44
强肝冠军!不是枸杞,也不是山药,而是每家厨房里最不起眼的普通食材!

强肝冠军!不是枸杞,也不是山药,而是每家厨房里最不起眼的普通食材!

小谈食刻美食
2026-09-04 09:24:39
上海男子让儿子走路16分钟上学,开家长会才知:他成全班特殊存在

上海男子让儿子走路16分钟上学,开家长会才知:他成全班特殊存在

金哥说新能源车
2026-09-04 18:20:06
大快人心!坐牢20年不算完,美国法院:你的公民身份,我们收回了

大快人心!坐牢20年不算完,美国法院:你的公民身份,我们收回了

怪味历史连连看
2026-09-02 23:30:05
南大老师PPT称“没Token的计算机专业学生应立即退学” 老师课堂实录:有困难找老师,不会真让退学的

南大老师PPT称“没Token的计算机专业学生应立即退学” 老师课堂实录:有困难找老师,不会真让退学的

红星新闻
2026-09-04 18:24:55
太平洋岛国呼吁未来提前24小时通知试射活动,外交部回应

太平洋岛国呼吁未来提前24小时通知试射活动,外交部回应

澎湃新闻
2026-09-04 16:43:03
官方通报“青岛一火锅店锅底爬出大量活蛆”:情况属实,已依法立案调查

官方通报“青岛一火锅店锅底爬出大量活蛆”:情况属实,已依法立案调查

上观新闻
2026-09-04 18:18:24
国务院原副总理余秋里:秘书官至正国级,唯一儿子最终娶了元帅之女

国务院原副总理余秋里:秘书官至正国级,唯一儿子最终娶了元帅之女

春秋砚
2026-09-04 06:45:21
SK海力士涨幅扩大至5%

SK海力士涨幅扩大至5%

每日经济新闻
2026-09-04 13:26:06
玉渊谭天丨中国为什么对G20这场会未发表公报表示遗憾

玉渊谭天丨中国为什么对G20这场会未发表公报表示遗憾

环球网资讯
2026-09-03 23:06:06
暴雨大暴雨、降温近10度,新一轮冷空气6日来,台风杜鹃将生成?

暴雨大暴雨、降温近10度,新一轮冷空气6日来,台风杜鹃将生成?

环球科学猫
2026-09-04 12:43:38
王思聪换不动了:懒懒可能是最后一任,不是因为她有多特别

王思聪换不动了:懒懒可能是最后一任,不是因为她有多特别

阿废冷眼观察所
2026-09-04 18:00:22
豆包手机,搭载长鑫科技LPDDR5X内存!系国产10667Mbps高速率LPDDR5X芯片首次量产应用

豆包手机,搭载长鑫科技LPDDR5X内存!系国产10667Mbps高速率LPDDR5X芯片首次量产应用

每日经济新闻
2026-09-04 12:44:25
65岁刘德华登新闻联播冲上热搜:四十载沉淀,影协副主席职位加身

65岁刘德华登新闻联播冲上热搜:四十载沉淀,影协副主席职位加身

行者聊官
2026-09-04 17:29:47
记者:只要出现任何一点不合穆帅心意的事情,一切就会彻底失控

记者:只要出现任何一点不合穆帅心意的事情,一切就会彻底失控

懂球帝
2026-09-04 14:32:11
今天凌晨突然去世,昨天还跳舞呢!提醒:每降低1℃,风险增加9%

今天凌晨突然去世,昨天还跳舞呢!提醒:每降低1℃,风险增加9%

垚垚分享健康
2026-09-04 09:13:13
即将上大三的女孩突患血液疾病,得知需要骨髓移植时母亲慌了:孩子不是自己亲生,希望能找到她的亲生父母

即将上大三的女孩突患血液疾病,得知需要骨髓移植时母亲慌了:孩子不是自己亲生,希望能找到她的亲生父母

极目新闻
2026-09-03 21:56:08
2026-09-04 19:39:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13921文章数 142729关注度
往期回顾 全部

科技要闻

OpenAI深夜王炸!GPT-6 Astra来了

头条要闻

男子被诊断"胃癌"切除整个胃 化验结果却显示没癌细胞

头条要闻

男子被诊断"胃癌"切除整个胃 化验结果却显示没癌细胞

体育要闻

小卡来去10首轮,快船7年彩礼一场空

娱乐要闻

古天乐公司欠债1.49亿

财经要闻

姚洋:刺激消费要守住两个“大西瓜”

汽车要闻

小米与中创新航、欣旺达动力达成战略合作

态度原创

艺术
手机
本地
时尚
公开课

艺术要闻

米芾唯一存世的隶书作品,功力深厚、古意盎然,每个字都足够震撼

手机要闻

IDC赶在苹果发布会前发报告:iPhone折叠屏均价或达2550美元!

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

夏天上衣不要只穿黑色或白色,试试这几件彩色T恤,亮眼又减龄

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版