模型

StepFun: Step 3.7 Flash

仅 API 开源 可商用
— · Apache-2.0 · 196B + 1.8B (ViT) / 激活 11B · 上下文 256K
能做什么
Agent工作流多模态理解视觉编程编程开发智能客服
部署门槛
高端 24G+
≥ 128GB
上下文
256K
token 窗口
参数
196B + 1.8B (ViT)
MoE · 激活 11B

01基础参数

参数规模
196B + 1.8B (ViT)
上下文窗口
256K
输入模态
image / text / video
可生成
text
模型系列
开源许可
Apache-2.0
主要语言
en

02MoE 架构说明

MoE 混合专家 总参 196B + 1.8B (ViT) · 激活 11B
部署门槛按「激活参数」计算,不等同于总参数量——这是 MoE 模型更易部署的关键。

03部署门槛详情

硬件等级 高端 24G+ · 最低显存 128GB

04Benchmark 评测

待补充

05适用场景

✓ 适用
生产级多模态Agent工作流、高频工具调用与终端自动化、原生多模态理解与代码生成、长文档分析与视觉搜索增强
✗ 不适用
纯文本轻量级对话场景、中文为主的内容创作

06部署与限制

⚙ 本地部署建议
BF16权重约380GB,Q4量化约112GB。建议使用4×H100或A100(80GB)多卡部署(TP=4),可通过vLLM、SGLang、llama.cpp等框架加载。本地工作站场景需至少128GB统一内存。Hugging Face提供BF16、FP8、NVFP4及GGUF等多种量化版本。
⚠ 已知限制
主要为英文优化,中文能力未详细披露。模型规模庞大(198B参数),本地部署门槛极高,需多卡高端GPU或128GB以上大内存设备。

07详细介绍

来源:OpenRouter API(scraper 采集,2026-06-30)

Step 3.7 Flash 是阶跃星辰(StepFun)于 2026 年 5 月发布并开源的一款面向生产级 Agent 的高效稀疏 MoE 多模态大模型。模型总参数量达 198B(含 196B 语言骨干与 1.8B 视觉编码器),但得益于稀疏 MoE 架构,每次推理仅激活约 11B 参数,最高生成速度可达 400 Tokens/s,在高频多轮 Agent 场景中具有显著效率优势。该模型支持 256K 上下文窗口,并提供三档可调推理强度(低/中/高),便于在速度、成本与推理深度间灵活平衡。

该模型原生支持图像、视频等多模态输入,能够直接理解 UI 界面、图表、文档和自然场景,并将其转化为结构化结果与可执行任务。围绕 Agent、Coding 和 Search 工作流深度优化,Step 3.7 Flash 在工具调用与编排可靠性上表现突出:Toolathlon 得分 49.5%,ClawEval-1.1 得分 67.1%,SWE-Bench PRO 得分 56.3%。它已适配 Claude Code、OpenClaw、Hermes Agent 等主流 Agent 框架,并支持云端与本地部署。模型采用 Apache-2.0 协议完全开源,提供 BF16、FP8、NVFP4 及 GGUF 等多种量化版本。

OpenRouter Provider 比价

共 3 家 provider(2026-06-30 采集),按输入价升序:

Provider输入(USD/1M)输出(USD/1M)量化上下文
StepFun0.21.15fp8256K
DeepInfra0.21.15unknown262144
Novita0.21.15fp8262144

代表价(满血最低):DeepInfra 输入 0.2 / 输出 1.15 USD/1M。各 provider 价格一致,无降本空间。

08官方资源

09同类模型