![]()
智东西
作者 程茜
编辑 李水青
智东西9月20日报道,今日,阶跃星辰发布新一代MoE旗舰模型Step 5 Preview。该模型专为真实世界Agentic任务打造,总参数量600B、激活参数27B,支持100万Token上下文窗口,原生支持文本与视觉输入。
在全球AI榜单Artificial Analysis Intelligence Index中,Step 5 Preview得分44分,位居开源模型第三,排在其前面的开源模型是Qwen3.8 Max(0902)、GLM-5.3(max)。
![]()
根据阶跃公开的基准测试结果,Step 5 Preview在Agent长周期CLI任务测试、金融投资研究评测FrontierFinance,以及跨领域深度研究评测DRACO等测试中优于Kimi K3、GLM‑5.3,略逊色于GPT-6 Astra或Claude Opus 5。
根据Artificial Analysis的榜单,该模型的输出速度为100 token/秒,排名第6。
![]()
在成本方面,据阶跃官方数据,Step 5 Preview单任务成本为Claude Opus 5(max)的1/8。Artificial Analysis的数据显示,前者单次总开销0.71美元(约合人民币4.76元),后者为5.86美元(约合人民币39.25元)。
![]()
Step 5 Preview的价格为每百万token输入价格(缓存未命中)7元、输入价格(缓存命中)0.35元、输出价格20元。对比来看,该模型的价格可对标DeepSeek-V4-Pro-0813的高峰时段。
![]()
智东西体验Step 5 Preview后发现,该模型擅长理解复杂任务、分步骤落地执行、文档转PPT、视觉网页、3D交互、模拟推演等多种真实的工作场景,可处理图片、文字、3D等混合的复杂需求,并独立输出可用结果。
但在对视觉设计要求更复杂的场景,其产出形式缺少多元化视觉素材,需要用户介入迭代指令,才能达到更为理想的设计效果。
Step 5 Preview目前已全量开放,将于10月15日开源。
国内开放平台 API 接入:https://platform.stepfun.com/
国外开放平台 API 接入:https://platform.stepfun.ai/
Studio平台在线体验地址:studio.stepfun.com
一、实测四大案例:博客一键变PPT,7轮模拟经营后直出可交互复盘网页
智东西体验了Step 5 Preview在执行多轮长任务、抽象提示词理解、原生视觉等方面的能力,大部分任务一次输出即可完成。
我们将Step 5 Preview的博客链接上传,让其直接生成面向非技术人员的PPT。可以看出,整个PPT内容重点明确、风格统一,在关键的数据上有突出显示,并且在每页PPT的下方还为演示者划了重点。
不过稍显美中不足的是,PPT的表现形式都是在文字的样式、大小上下功夫,没有图表、配图等多元化的设计。
![]()
第二个案例,智东西上传了一个抽象的提示词“一曲流动的诗篇:驾驭风与线条,在由光影变幻、斑斓色块、温柔记忆与空灵旋律交织的梦幻图景中缓缓穿行。”Step 5 Preview先自己拆解需求,将提示词进行了扩写然后生成对应的视觉网页。
不过网页初版的背景较为单调,只有鼠标对应划过位置会产生光晕。智东西进一步要求它背景要更具设计感,结合文字内容的元素设计。Step 5 Preview重新生成的页面中,文字会随鼠标滚动出现,且背景的色调、元素也会伴随文字变化。
![]()
第三个案例是让Step 5 Preview使用Three.js开发卡帕多奇亚热气球交互场景的网页应用,并要增加不同的交互按钮、互动流畅。
从该模型一次生成的效果来看,整个画面都基本符合需求,在功能框中,用户可以调整风向、日照时间、热气球数量,并实时查看效果。
![]()
最后是一个复杂项目,让Step 5 Preview帮智东西模拟经营一家新式茶饮小店。
Step 5 Preview扮演创业模拟Agent,进行分步规划。该模型经营过程划分为7轮,分别为商业模式与选址策略、选址落地与证照办理、产品体系与定价策略、供应链搭建与首批备货、装修动线与设备采购、开业引爆与人员就位、终局报告。
在模拟过程中,Step 5 Preview在每一轮都会提出多个方案,并同步输出每个方案对应的详细内容与简单直接的决策核心要素、给出建议,并在智东西选择方案后再进行推进。
与此同时,当智东西选定某一方案并给出如“运营经验少,想寻求自主运营投入最少的方案”的理由时,Step 5 Preview会在接下来的多轮决策中基于此提出建议。
![]()
最终根据模型估算,这家茶饮小店达成月净利2.5万元,账户留存现金18.6万元,同时积攒了1450名排队等候的学生客群。
![]()
最后,Step 5 Preview还能把前述的所有决策流程生成一个交互式的产品,将所有方案的侧重点、可复用的结论都进行总结提炼。
![]()
二、22小时优化GPU内核,峰值性能提升至508 TFLOPS
阶跃官方也放出不少Step 5 Preview的案例。
在真实软件工程方面,Step 5 Preview可以进行Web开发与视觉设计。如下面的案例就是模型基于一张照片生成的可编辑3D环境,用户可以在带摆放反馈的情况下移动和旋转家具或以第一人称视角参观房间。
![]()
第二个案例是基于历史资料构建的交互式历史图册,其以一本1922年的旅行指南为基础,通过路线、车站、行程规划与票价计算重建九广铁路,让档案资料的呈现形式更生动。
![]()
在长程任务执行中,阶跃选择了优化GPU Kernel、训练数据流程两个场景。
首先是优化GPU Kernel案例,Step 5 Preview在24小时内,在一张NVIDIA H100 GPU上从零开始优化一个MLA GPU内核。该模型自主修改、运行内核并测量吞吐量,经过约22小时将峰值性能提升至508 TFLOPS,超越Claude Opus 5的493 TFLOPS。
![]()
其次是优化后训练数据流程,Step 5 Preview在24小时内,通过自动化后训练提升了Qwen3-30B-A3B基础模型在AIME24上的表现。经过后训练,模型在AIME24官方测试集上的准确率由53.3%提升至60%,表现与Claude Opus 5持平,消耗的token更少。
![]()
除了编程,在没有做任何Pokémon专项优化的情况下,Step 5 Preview还在Pokémon Red游戏中,持续完成超过3000 Turns,累计交互接近600万Tokens。
这一游戏的难点在于需要持续推进一个很远的目标,模型需要记住之前获得的信息、管理资源、完成相互依赖的任务,并在原有计划行不通时重新调整。对于人类玩家来说,完成主线通常需要约26小时。
![]()
此外,Step 5 Preview还可以实现大规模研究、结构化分析、交互式报告等。
![]()
三、Agent长周期CLI、金融投资等任务,表现优于Kimi K3、GLM‑5.3
阶跃公开的第三方以及其内部基准测试中,Step 5 Preview与GPT‑6 Astra、Claude Opus 5、Kimi K3、GLM‑5.3进行了对比。
在Agent长周期CLI任务测试、金融投资研究评测FrontierFinance,以及跨领域深度研究评测DRACO等多个测试中,Step 5 Preview的表现都优于Kimi K3、GLM‑5.3,仅次于GPT-6 Astra或Claude Opus 5。
![]()
在真实任务场景,阶跃内部构建了测试集StepCodeBench。
该测试集覆盖553个独立代码仓库、9类任务、20个应用领域和33种编程语言。基于该评测,Step 5 Preview在整体任务成功率和跨场景稳定性等方面的综合得分为49分,超过Kimi K3、GLM‑5.3。
![]()
根据博客信息,在获得开发文档和用户授权后,Step 5 Preview可以直接调用相机、COM端口、截图和模拟鼠标输入,完成设备侧的开发与调试。
例如下面的案例就是Step 5 Preview连续工作超过3小时,根据设备反馈不断编写、运行并修改代码。Step 5 Preview根据自然语言需求,自主阅读ESP32设备及相关API开发文档,将一块ESP32-S3开发板改造成支持蓝牙按键与语音输入的Vibe Coding键盘。
![]()
在金融领域,阶跃构建了FinStepBench-LiveSearch、FinStepBench-CorporateValuation、FinStepBench-DeepResearch三项内部测试,考察模型是否具备扎实的金融专业知识,是否能够建立跨行业之间的因果联系,以及是否能在信息不完整、数据口径不一致的情况下借助工具完成严谨分析和建模。
再加上,Step 5 Preview在金融领域的信息检索、估值和完整金融研究流程上得分较高。在外部基准测试FrontierFinance中,该模型的得分仅次于Claude Opus 5。
![]()
结语:大模型竞赛从算力军备赛转向算力转化率之争
阶跃的博客中提到,过去,大模型Scaling的核心逻辑是用更多计算换取更强智能,但随着模型规模和任务复杂度持续增长,计算成本也被同步放大,Scaling的核心关注变成如何更高效地把计算转化成模型能力。
这也是其从Step 3.5 Flash、Step 3.7 Flash到Step 5 Preview持续探索的问题。他们认为,下一阶段的Scaling,不只是更多计算,也包括更高效率的计算。
可以看出,未来大模型竞赛的核心不仅是原始算力的军备竞赛,还包括算力转化率竞赛。谁能用更少的激活计算,输出更强真实世界任务能力,就能更适配Agent时代的产业落地趋势,效率已成为大模型的核心命题。
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.