2026年,AI产业最焦虑的事情不是模型能力不够,而是算力快用不起了。
一个AI智能体处理一次用户请求,后台打包发送的可能是几十万字的完整对话历史。从业者的普遍感受是:原本指望AI降本增效,但高昂的算力开销反而成了新的成本压力。大模型越用越重,商业化的账越来越难算平。
当算力成本从技术问题变成生存问题,杭州的芯片公司给出了一套截然不同的解题思路。它叫中昊芯英,它不做GPU,做TPU。一群海归战队工程师,决定重新定义AI算力的成本结构。
![]()
一、TPU凭什么比GPU更懂大模型?
要理解中昊芯英为什么选TPU,得先理解TPU和GPU的根本区别。
GPU发展了三十多年,硬件架构和软件栈的优化空间基本挖掘殆尽,后续升级主要靠先进制程硬拉。而TPU从诞生之初就只为一件事而生——深度学习的张量计算。
“TPU芯片本身就是为了大规模深度学习模型设计的,所以它比GPU无论是硬件还是软件栈,都更适合运行当前的大语言模型。”中昊芯英创始人杨龚轶凡说。
这种专用优势是直接的、显而易见的。在同等功耗下,TPU的算力密度更高,控制开销更小,更多资源集中在计算和通信上。同样的模型计算能力,TPU的功耗可以做到对标海外同期先进GPU产品的70%左右。
当客户通过API调用模型服务时,他们不关心底层跑的是GPU还是TPU,只关心百万Token的成本和生成速度。这给了TPU一个绕过生态短板、直接切入市场的机会。
二、从“刹那”到“须臾”,技术的飞跃发展
2023年,中昊芯英成功流片国内首枚高性能TPU芯片“刹那”并实现量产。这是中国首枚量产的高性能TPU架构AI专用大芯片,拥有全自研的IP核、指令集与计算平台。从算子层面看,国产化率达100%,没有买任何数字IP,所有核心IP都是自己一行一行代码写出来的。
![]()
中国首枚高性能TPU AI专用算力芯片刹那®图
![]()
中昊芯英新一代高性能TPU AI专用算力芯片须臾®图
2026年6月,第二代芯片“须臾”发布。单芯片算力达896TFLOPS,是“刹那”的3倍;功耗仅600W,比同性能传统芯片降低50%。
但这组数字的真正意义不在参数本身,而在于它回答了AI产业最核心的问题:算力能不能更便宜?
答案是:能。在同规模大模型推理场景下,中昊芯英平台的百万Token成本仅为海外主流GPU方案的35%-50%。“须臾”的研发目标就是大幅压低单位词元成本,实现从一代到二代直接减半。
三、跑通商业化,技术只是起点
过去两年,中昊芯英在技术上证明了自己,芯片流片成功、量产交付、性能对标国际主流产品、成本优势显著……但芯片行业有一个残酷的真相,那就是技术领先和商业成功之间,隔着一条巨大的鸿沟。
2026年7月,中昊芯英与杭州电信、中兴通讯联合打造的华东首个国产TPU千卡智算集群正式落地。一期采用1024片“刹那”芯片,算力规模达400P,实现了从芯片到服务器的全链路国产化。经过数月联合调优,通过PD分离等技术手段,词元输出效率提升超过10倍,百万词元成本从约100元降至10元以内。
![]()
技术验证完成了,数据也跑出来了。但成本降下来了,客户不会自动上门。真正的考验,从这一刻才刚刚开始。
杨龚轶凡在采访中谈到,从第一个客户到规模化复制,其实是一个渐变过程。从第一个客户开始,不停地适配、优化、迭代软件栈,让他逐步认可,然后慢慢拓展到更多客户。客户的认可是规模化复制的前提。这个过程没有捷径,需要时间,需要耐心,需要把每一个客户服务好。
目前,中昊芯英的产品已部署于由江西上饶、深圳联通、天津移动、太极股份等政府机构、运营商及科技企业等建设的多个超大规模智算中心。软件层面已完成Qwen全系列、DeepSeek、GLM等数十款大模型的深度适配。千卡集群在持续产出数据,客户在持续验证,二期的万卡规划已在路上。
技术是一张入场券,商业化的路,是一步一步走出来的。中昊芯英正在走这条路。
![]()
四、一个赛道,需要一群人的同行
当被问到“TPU在国内是否已经有了跟随者、中昊芯英的先发优势能维持多久”时,杨龚轶凡的回答出人意料,他不是强调壁垒,而是呼唤同行。
“我们做TPU,是想把TPU做成AI界的X86。产业要发展,必然有很多玩家一起推动,不可能只有中昊芯英一家完成。如果在国内TPU未来只有我们一家,我认为这个赛道永远发展不起来。”
这番话背后是一种罕见的产业观。大多数芯片公司恨不得把所有对手挡在门外,中昊芯英却在主动邀请更多玩家入场。它甚至不介意跟随者,因为它深知,一个产业的标准只能由一群人共同定义,一家公司撑不起一个赛道。没有竞争,就没有人才的流动;没有多元的探索,就没有生态的繁荣。中昊芯英想要的,不是独占一个市场,而是定义一条技术路线。
“我们不太关心自己有多少先发优势或者先发优势能维持多久,”杨龚轶凡说,“我们关心的是这一代芯片能不能适配好国内的模型,下一代芯片能不能做到领先,再下一代芯片能不能在世界领先的玩家中拔得头筹。用最好的技术和最适配国产模型的设计,帮助国产模型实现最优性价比的算力,这才是我们真正关心的事情。”
![]()
这不仅仅是技术自信,更是一种战略选择。当算力从“奢侈品”变成“水电煤”,当百万Token成本从百元降到十元以内,AI的规模化落地或许真的不远了。而中昊芯英的野心,不是成为一家独大的“中国英伟达”,而是让TPU成为“AI界的X86”。一个开放的、共生的、由一群中国公司共同撑起的产业底座。
中昊芯英证明了,不一定非要走GPU。中昊芯英也不介意TPU的路上的人越来越多。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.