Featured image of post 阶跃星辰发布Step 5 Preview:600B参数MoE模型,性能对标国际巨头,国产开源第三

阶跃星辰发布Step 5 Preview:600B参数MoE模型,性能对标国际巨头,国产开源第三

国产MoE旗舰模型Step 5 Preview发布,总参数600B激活27B,成本仅为Claude Opus 5的1/8。

阶跃星辰发布新一代旗舰模型Step 5 Preview

阶跃星辰发布新一代旗舰模型Step 5 Preview
阶跃星辰发布新一代旗舰模型Step 5 Preview|新闻截图

阶跃星辰于2026年9月20日正式发布新一代MoE(Mixture of Experts,专家混合)旗舰模型Step 5 Preview。该模型专为真实世界Agent任务设计,具备大参数规模与高效率激活特性。核心硬信息如下:

  • 发布时间:2026年9月20日
  • 新版本:Step 5 Preview(预览版)
  • 价格策略:输入(缓存未命中)7元/百万token,输入(缓存命中)0.35元/百万token,输出20元/百万token
  • 可用时间:即日起开放API接入;2026年10月15日开源
  • 权重开放:预览版可通过平台API调用,正式版将开源

模型核心参数:总参数量6000亿(600B),激活参数270亿(27B),支持100万Token上下文窗口,原生支持文本与视觉输入。

全球榜单 impressive 排名:开源第三,性能逼近商业巨头

全球榜单 impressive 排名:开源第三,性能逼近商业巨头
全球榜单 impressive 排名:开源第三,性能逼近商业巨头|新闻截图

Step 5 Preview在权威AI评估榜单Artificial Analysis Intelligence Index中олучив 44分,位居全球开源模型第三位,仅次于Qwen3.8 Max(0902)与GLM-5.3(max)。其输出速度达100 token/秒,位列榜单第6。

关键对比数据呈现明显反差:模型性能仅略逊于GPT-6 Astra或Claude Opus 5等国际顶尖商业模型,但成本压低至其1/8——单次调用开销仅0.71美元(约4.76元人民币),而Claude Opus 5为5.86美元(约39.25元人民币)。

基准测试中,Step 5 Preview在Agent长周期CLI任务、金融投资研究评测FrontierFinance、跨领域深度研究评测DRACO等测试中优于Kimi K3与GLM-5.3。其在StepCodeBench(覆盖553个代码仓库、20个应用领域)中综合得分为49分,体现跨场景稳定性优势。22小时GPU Kernel优化案例中,其峰值性能达508 TFLOPS,反超Claude Opus 5的493 TFLOPS。

多场景实测:从PPT生成到3D交互,Agent能力突出

多场景实测:从PPT生成到3D交互,Agent能力突出
多场景实测:从PPT生成到3D交互,Agent能力突出|新闻截图

调研显示,Step 5 Preview在真实任务中展现较强的多模态理解与流程化执行能力:

  • 内容转换:可将博客直接生成结构清晰、重点突出的PPT(缺陷为视觉素材单一)
  • 视觉网页生成:对抽象提示词(如"一曲流动的诗篇")可拆解需求并生成动态交互页面
  • 3D开发:使用Three.js生成卡帕多奇亚热气球交互场景,支持风向、日照等参数实时调整
  • 复杂模拟:完成7轮新式茶饮小店经营模拟,输出含现金流、客群、方案复盘的完整报告

软件工程能力方面,模型可在24小时内自主优化GPU内核,亦可开发ESP32设备驱动,实现蓝牙按键与语音输入一体化改造。在无专项优化前提下,于《宝可梦红》游戏中完成超3000回合、近600万Tokens连续交互,体现长程任务记忆与计划调整能力。

模型总参数量激活参数单次成本(美元)单次成本(人民币)Art. Index得分开源状态
Step 5 Preview600B27B0.714.764410月15日开源
Claude Opus 5(max)未公开未公开5.8639.25>44闭源
Kimi K3未公开未公开未公开未公开<44未公开
GLM-5.3(max)未公开未公开未公开未公开>44部分开源
Qwen3.8 Max(0902)未公开未公开未公开未公开>44部分开源

落地建议:谁该立刻试用,谁可再观望

落地建议:谁该立刻试用,谁可再观望
落地建议:谁该立刻试用,谁可再观望|新闻截图

适合立即试用的群体:

  • 需要处理长上下文(≥10万token)文案生成、流程自动化或多模态任务的企业与开发者
  • 注重成本敏感型Agent部署场景,如金融研究辅助、教育模拟推演、CLI任务编排
  • 希望用开源方案替换部分商业API调用以控制长期成本的技术团队

建议再观望的场景:

  • 对视觉生成多样性要求极高、当前场景仍频繁依赖人工迭代的设计类工作
  • 依赖完整闭源生态(如特定企业级SSO、硬件驱动认证)的严苛生产环境
  • 需要官方SLA保障的金融服务客户,可待正式版开源稳定运行3个月后再评估

写在最后

Step 5 Preview标志着国产大模型从"参数竞赛"转向"算力转化率"竞争——通过MoE架构实现600B总参数与27B激活参数的巧妙平衡,使模型在维持高分数的同时显著压降推理成本。当效率成为Agent时代落地方针,这类高效能模型将成为产业智能化的 viable 基石。