吴怼怼 ISSUE 01 · 2026.08 一个被用滥了的词 大模型的 「开源」 到底开了什么? 能聊天、能下载、能商用、能复现, 是四件不同的事。 ? WEIGHTS CODE DATA 别只问“开没开”,要问“开到哪一层”。 向下拆解
01 / 先纠正一个误会
“开放使用”
不是“开放源头”
软件的源代码,是人写下的完整指令;模型的能力,却是从海量数据和训练过程里“长”出来的。
所以,一个大模型的“源”,不只是一份 Python 代码。至少还包括模型权重、架构、训练代码、数据信息、超参数和计算过程。只开放其中一部分,却统一称为“开源”,会把完全不同的开放程度混在一起。
免费网页 ≠ 开源 开放 API ≠ 开放模型 开放权重 ≠ 完整复现
02 / 解剖一个大模型
所谓“开源”
至少有七层
逐张点击卡片。越往后,开放的不是“更多文件”,而是更多理解、修改与重造的能力。
OPEN LAYER / 01 产品入口 / API 你能用 网页、App 或 API 只是“入口”。 你在调用别人的模型,并没有拿到它。 免费,也不等于开源。 01 产品入口 / API 你能用 → 点击拆开这一层
OPEN LAYER / 02 模型权重 你能拥有 权重是训练后学到的数值参数。 拿到它,通常能本地部署、量化或微调; 但它更像“烤好的蛋糕”,不是配方。 02 模型权重 你能拥有 → 点击拆开这一层
OPEN LAYER / 03 推理与部署代码 你能跑 加载权重、切分专家、分配显存、提供服务。 这些代码决定模型能不能真正落地, 也决定运行成本。 03 推理与部署代码 你能跑 → 点击拆开这一层
OPEN LAYER / 04 架构与技术报告 你能看懂 网络结构、注意力机制、参数规模与训练方法。 知道原理,不代表已经拿到完整实现, 更不代表可以复现。 04 架构与技术报告 你能看懂 → 点击拆开这一层
OPEN LAYER / 05 训练 / 后训练代码 你能改造 预训练、微调、强化学习、数据配比与超参数。 往往只开放其中一段, 或只给伪代码和方法描述。 05 训练 / 后训练代码 你能改造 → 点击拆开这一层
OPEN LAYER / 06 训练数据与处理流程 你能追溯 数据从哪里来,如何清洗、去重、配比与标注? 它深刻影响模型能力与偏见, 却通常是最不透明的一层。 06 训练数据与处理流程 你能追溯 → 点击拆开这一层
OPEN LAYER / 07 完整复现条件 你能重造 中间检查点、优化器状态、训练日志和算力配置。 能复现,才接近软件世界里的 “拿到源代码”。 07 完整复现条件 你能重造 → 点击拆开这一层
03 / 三个中国模型样本
同样叫开源,
交出的东西并不一样
依次点击三张卡片,查看 DeepSeek-R1、Kimi K2.5 与 Qwen3 的开放范围与许可证。
CASE / 01 / R1 DeepSeek 已经开放 + R1 / R1-Zero 权重 + 多款蒸馏模型 + 推理示例与技术论文 + 商业使用与衍生权利 仍未完整开放 — 完整原始训练语料 — 端到端训练流水线 — 全量数据清洗与训练日志 LICENSE MIT 一句话判断 你能把“成品大脑”搬回家并改造, 但还不能完整重走它的成长过程。 CASE / 01 DeepSeek R1 高自由度的开放权重 ↑ 点击上推,查看它到底开了什么
CASE / 02 / K2.5 Kimi 已经开放 + 模型权重 + 部署与使用指南 + 技术说明 + 一般商业使用与修改权 仍未完整开放 — 完整预训练数据 — 端到端训练代码 — 完整后训练样本与实验记录 LICENSE Modified MIT 一句话判断 超 1 亿月活或月收入超 2000 万美元时, 商业产品界面需显著展示 Kimi K2.5。 CASE / 02 Kimi K2.5 开放权重 + 品牌触发条款 ↑ 点击上推,查看它到底开了什么
CASE / 03 / Qwen3 千问 已经开放 + 多尺寸模型权重 + Base 与后训练版本 + 推理、部署与微调生态 + 宽松商业许可 仍未完整开放 — 完整预训练数据清单 — 从零训练的生产流水线 — 完整中间状态与训练日志 LICENSE Apache 2.0 一句话判断 开放了许多可改造的起点, 但开放生态仍不等于开放整个生产过程。 CASE / 03 千问 Qwen3 多尺寸 Apache 2.0 开放权重 ↑ 点击上推,查看它到底开了什么
一张表看懂差别 ● 明确开放 ◐ 有条件/部分开放 — 未完整公开 开放项 R1 K2.5 Qwen3 可下载权重 ● ● ● 可自行部署 ● ● ● 宽松商业使用 ● ◐ ● 基础模型 Base ◐ — ● 完整预训练数据 — — — 端到端训练复现 — — — 代表性公开版本的结构化判断;不同版本许可可能不同。 资料截至 2026.08.13,不构成法律意见。
04 / 那还能叫“开源”吗? 更准确的说法, 往往是“开放权重” OSI 的《开源 AI 定义 1.0》要求四种自由: 使用、研究、修改与分享;同时要求足够的数据信息、 完整训练与运行代码,以及模型参数。 按这个尺度,当前许多“开源大模型”更接近 open weights:成品可以下载和改造, 但通往成品的全部原料与生产线并未完整公开。 关键不是争一个标签, 而是把开放到哪一层说清楚。 “ 开放权重 能不能叫开源? 点击,看看一条更严格的界线 +
既然没“全开”,
为什么仍然重要?
01
主权
企业能把模型部署在自己的设备和数据边界内,不必把每次请求交给外部平台。
02
成本
可以量化、裁剪、选择推理框架,长期成本不再完全由单一 API 定价决定。
03
改造
可以做领域微调、蒸馏和安全控制,把通用模型变成自己的生产工具。
04
竞争
开放权重把先进能力变成公共起点,迫使整个行业更快、更便宜、更透明。
05 / 下次看到“开源”
别问开没开。
连续追问这 5 件事。
答案会比任何宣传标签都更接近真相。
01
权重能下载吗?
还是只能通过网页或 API 使用?
02
许可证允许什么?
能否商用、修改、再分发、蒸馏?有没有规模门槛?
03
开放的是 Base 还是 Chat?
基础权重更适合深度改造;对话版更接近拿来即用。
04
训练过程公开到哪一步?
有论文、有样例,还是有完整代码、参数与中间状态?
05
数据能被追溯和复现吗?
有没有来源、比例、清洗、去重与标注方法?
THE BOTTOM LINE 今天的大模型开源, 大多开的是 “使用与改造的入口”, 还不是 “完整复制智能的配方”。 技术资产、复现程度、法律权利, 应该分开说清楚。 ↗ 转发给那个总说“开源模型”的朋友
吴怼怼
把技术热词,拆成可以判断的事实。
主要资料:DeepSeek-R1 官方仓库;MoonshotAI Kimi-K2.5 官方仓库与许可;Qwen3 官方发布说明;OSI《开源 AI 定义 1.0》。
编辑与设计:吴怼怼 · 资料截至 2026.08.13 · 不构成法律意见
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.