随手先关注,不错过每日AI热讯速递
①
9 月 20 日,阿里 Qwen 团队开源了统一图像生成与编辑模型Qwen-Image-2.1,权重同步上线 Hugging Face、GitHub 与 ModelScope[2][4]。
Qwen 官方给出的定位是「a unified text-to-image generation and image editing model」——一个把文生图与图像编辑合并进同一模型的统一模型[2]。
体量是这次发布最受关注的一点:视觉生成部分只有 70 亿参数,由32 层 Single-Stream DiT构成[2][4]。
Qwen 同时说明,该模型可以在3090 这类消费级显卡上运行[4]。
![]()
图:优化机制示意图(来源:Qwen 官方仓库[1])
②
最实用的一项能力是原生 RGBA 透明图层(在红绿蓝三色之外额外保存透明度通道,图层可单独抠出或叠加):模型可以直接生成带透明通道的图,也能在透明层上隔离物体或改写文字[4]。
编辑时它一次最多接受10 张参考图,用于合影合成、虚拟试穿与房间布置;圈选、涂抹或独立掩码用来指定改动区域[4]。
推理效率上的改动也被官方点出:Qwen 表示架构调整配合 KV Cache(推理时把已处理内容的中间结果存下来复用,避免重复计算),可以加快推理速度,在多参考图场景下尤其明显[4]。
![]()
图来源:Hugging Face 模型卡分享封面[2]
③
官方对这款模型的自我评价是「balances generation quality, inference efficiency, and versatility」——在生成质量、推理效率与通用性之间取得平衡[2]。
Qwen 同时宣称,它「beats most closed models on Qwen's own benchmark」——在 Qwen 自建基准上超过多数闭源模型[4]。
限定条件很清晰:这句结论建立在厂商自有基准之上,独立第三方评测尚未出炉[4]。
渠道侧的反馈是可见的:该模型在 Hugging Face 模型页获得803 个赞,页面同时标注任务类型为 Text-to-Image、标签含 rgba 与 image-editing[2]。
![]()
图来源:Hugging Face Space 分享封面[3]
④
版权条件是商用路上最直接的一道门槛:模型采用qwen-research 研究许可禁止商业使用,企业用户须向 Qwen 单独申请授权[4]。
体量的另一面:7B 让本地部署变得现实,但它也意味着极端复杂的生成任务未必追得上更大规模的闭源模型,官方没有公布逐项对比数据[2][4]。
「开源」在这里指权重开放,与「可自由商用」是两件事——研究许可会限制企业直接把它接入生产链路[4]。
可以预期的下一步是独立评测许可调整:第三方复现一旦出现,这款 7B 模型的真实位置才会从厂商口径变成公共结论[4]。
参考来源:
[1] QwenLM/Qwen-Image-2.1(官方代码仓库)https://github.com/QwenLM/Qwen-Image-2.1
[2] Qwen/Qwen-Image-2.1(官方模型卡)https://huggingface.co/Qwen/Qwen-Image-2.1
[3] Qwen-Image-2.1 - a Hugging Face Space by Qwen(官方在线 Demo)https://huggingface.co/spaces/Qwen/Qwen-Image-2.1
[4] Alibaba's open-weight Qwen-Image-2.1 claims to beat closed models in image generation with just 7 billion parametershttps://the-decoder.com/alibabas-open-weight-qwen-image-2-1-claims-to-beat-closed-models-in-image-generation-with-just-7-billion-parameters/
欢迎点赞、分享、推荐
一起拥抱AI
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.