我拿StepFun跑了三周Agent任务,把DeepSeek暂时放一边了

流云 2026-06-22 457 0条评论
摘要: ...

上个月有个做AI应用开发的朋友跟我说,他们团队把主力模型从某海外大模型换成了StepFun的Step 3.7 Flash,API成本直接砍掉了一半多,响应速度还变快了。

我当时第一反应是:“StepFun?没听过啊。”

后来一查才发现,这家公司2023年才成立,2026年1月刚融了超50亿人民币,估值冲到120亿美元。6月初,他们的Step 3.7 Flash在Artificial Analysis输出速度榜上以409 tokens/s拿了主流模型第一。发布才两天就冲上了OpenRouter Trending全球第二

用了一段时间之后,我对它的判断是:它不是那种“什么都能聊”的通用模型,是那种“你让它干活它真能干完”的生产力模型。

一、它跟DeepSeek、GPT到底有什么不一样?

StepFun最核心的产品是Step 3.7 Flash,2026年5月29日发布并开源。它的参数配置很有意思:总参数1960亿,但每次推理只激活110亿。最高生成速度每秒400个token,支持256k上下文

翻译成人话就是:它跑得飞快,但算力成本很低

它的定位非常明确——面向生产级Agent场景。什么叫“生产级”?就是你不是拿它来聊天的,是拿它来干活的。处理财报、跑多步搜索、操作并发编码Agent,这些才是它设计出来要做的事

跟DeepSeek V4 Flash、MiniMax M2.7这些同类模型对比,有开发者在社区实测后表示,Step 3.7 Flash在速度和响应体验上有明显优势。而且它原生支持图片和视频理解,能直接处理UI界面、文档图表

有一个细节让我印象很深:它可以在信息不完整的时候主动发起联网搜索和视觉搜索进行交叉验证,确认事实后再返回结果。这种“不确定就自己去查”的能力,在Agent场景里确实实用。

二、我拿它干了什么

第一件事:做一份行业分析PPT。

我让模型输入“做一份美伊局势的分析PPT”,它直接并行生成了四个不同风格、不同配色的版本,每个版本六到八页完整成稿,单个版本生成耗时在数十秒量级。这速度确实比我用过的其他模型快不少。

第二件事:对接API跑了一个自动化任务。

StepFun的API兼容OpenAI规范,这意味着你现有的OpenAI代码几乎可以零成本迁移。我试了一下,只需要把base_url改成https://api.stepfun.com/v1,把api_key换成StepFun的Key,再把model改成step-3.7-flash,其他代码一行不用改

我用Python跑了一个需要调用外部API的多步任务,模型在工具调用上确实稳定,没有出现跑偏或者卡死的情况。官方数据显示,Step 3.7 Flash在ClawEval-1.1上得分67.1%,远超第二名59.8%。在多工具协同的Toolathlon上也拿到了49.5%

第三件事:视频理解。

Step 3.7 Flash支持在对话上下文中传入视频链接,模型自动读取视频内容并进行理解。我传了一个产品演示视频的链接,让它总结核心功能点,它确实能抓取到关键信息,不像有些模型只能处理图片。

三、Step Plan:新的计费模式,搞清楚了

StepFun在2026年6月18日把计费方式从“按请求次数”升级成了“Credit月池”

新的Token Plan计费逻辑是:1M Credit = 1元,额度按月发放,月末清零。如果当月额度用完了,可以买“加油包”补充,周期单独30天

具体价格方面,Step 3.7 Flash的输入价格大概是1.35元/1M tokens,输出价格8.1元/1M tokens。还有个更便宜的Step 3.5 Flash,输入0.09美元/M、输出0.30美元/M

另外,免费用户每30天能拿到5美元的额度。对于个人开发者来说,这个免费额度足够跑不少测试了。

如果你之前用的是旧版Coding Plan,注意它已经停止续订了,当前周期到期后必须升级到Token Plan。升级后到期时间不变,额度按整月发放

四、它跟其他国产模型比,位置在哪?

目前国产大模型有几个路线:DeepSeek主打极致性价比,智谱GLM主打通用能力,MiniMax在视频和多模态上发力。StepFun走的是另一条路——Agent优先

Step 3.7 Flash在Artificial Analysis的输出速度榜上排主流模型第一,在智能体任务上排第25/290。整体智能排名第48/378,编程能力第53/315。这个数据说明它在速度上是顶尖的,在智能体相关任务上也处于中上游。

有开发者评价StepFun 3.5是他的“daily driver”,说“even vs Qwen3.6 27B”也很能打。另一个开发者把它跟DeepSeek V4 Flash对比后认为,“速度和响应体验上具备明显优势”

但StepFun也有明显的短板:生态还不够完善。有分析指出,StepFun在开发者生态和社区建设上跟头部玩家还有差距。毕竟公司才成立三年,积累需要时间。

五、什么人适合用、什么人不适合

适合的:

  • 做AI Agent应用的开发者:Step 3.7 Flash就是为Agent场景设计的,工具调用稳定、速度快、成本低

  • 需要处理多模态内容(图、表、UI、视频)的项目:原生多模态支持,不需要额外接视觉MCP中转

  • 想把现有OpenAI代码迁移到国产模型的团队:API兼容OpenAI规范,迁移成本极低

  • 对API成本敏感的个人开发者或小团队:免费用户每30天5美元额度,付费价格也比海外模型便宜不少

  • 需要高频、多轮调用的生产环境:400 tokens/s的速度,256k上下文,确实能扛住高频调用

不太适合的:

  • 只需要简单问答的轻度用户:杀鸡用牛刀,豆包或文心一言就够了

  • 对社区生态和工具链有极高要求的开发者:StepFun的生态还在建设中,跟OpenAI、DeepSeek还有差距

  • 需要极致艺术审美的图像生成:StepFun的文生图能力在发展中,Midjourney在这方面仍然是天花板

六、说句实在话

用了几周之后,我对StepFun最深的感受是:它不是那种让你“哇”一下的产品,是那种让你“嗯,确实好用”的产品。

它不像Midjourney那样在审美上惊艳,也不像ChatGPT那样在对话上流畅。它在做一件更务实的事——让AI Agent能稳定、快速、低成本地完成真实工作

400 tokens/s的速度,1960亿参数只激活110亿的高效架构,兼容OpenAI的API规范,原生多模态支持——这些加在一起,让StepFun成为一个“能干活”的模型。

它不完美。生态还在建设中,社区活跃度不如头部玩家,文档的完整度也有提升空间。但它的方向是对的——让AI从“回答问题”进化到“完成工作”

如果你在做AI Agent相关的开发,或者想把现有项目迁移到国产模型上降低成本,StepFun值得花点时间试试。免费用户每30天5美元的额度,够你跑完整个验证流程了。

文章版权及转载声明:

作者:流云本文地址:https://www.sanwenge.com/post/1174.html发布于 2026-06-22
文章转载或复制请以超链接形式并注明出处三文阁