已经实测了,可以用多模态,文字,语音,图像各种模型。
响应大概 5 秒内能返回,挺快的,至于后续人多了会不会卡,现在还不确定,反正免费 Token 大家用力蹬起来。
活动链接大家可以用我的邀请链接: https://platform.stepfun.com/?invite_code_v2=MODLTTUN
也让我沾沾光,哈哈
StepFun Step Plan API 模型测试报告
- 测试时间:2026-09-20 11:38:39 CST (Asia/Shanghai)(报告更新于 2026-09-20 11:40:07 CST (Asia/Shanghai))
- Endpoint:
https://api.stepfun.com/step_plan/v1/chat/completions
- 认证:Bearer (
box-secrets.json → card.STEPFUN_API_KEY,全程脱敏,未写入本报告)
- 测试图:
/workspace/step-plan-test.png( 200×80 PNG ,红色圆 + 标签 42)
摘要
类别 |
通过 |
失败 |
合计 |
|---|
文本冒烟 |
5 |
0 |
5 |
多模态视觉 |
2 |
0 |
2 |
视觉答案正确(含「 42 」) |
2 |
0 |
2 |
- 总体判定:通过 — 全部文本模型成功;视觉至少一次成功且答对
文本冒烟结果
提示词:要求精确回复 TEXT_OK(允许附带 reasoning ;判定:HTTP 200 且 assistant 内容非空或有可用输出)。参数:max_tokens=96,temperature=0。
模型 |
HTTP |
延迟(s) |
finish_reason |
prompt |
completion |
total |
内容摘要(~80) |
成功 |
错误 |
|---|
step-5-preview |
200 |
36.791 |
stop |
22 |
23 |
45 |
TEXT_OK |
✅ |
— |
step-3.7-flash |
200 |
1.992 |
stop |
23 |
56 |
79 |
TEXT_OK |
✅ |
— |
step-3.5-flash |
200 |
1.295 |
stop |
23 |
62 |
85 |
TEXT_OK |
✅ |
— |
step-3.5-flash-2603 |
200 |
1.398 |
stop |
23 |
81 |
104 |
TEXT_OK |
✅ |
— |
step-router-v1 |
200 |
1.452 |
stop |
488 |
40 |
528 |
TEXT_OK |
✅ |
— |
多模态(视觉)结果
内容:text + image_url( data URL base64 PNG ,detail=low)。问题:图中数字/标签是什么?只答该内容。
说明:首次用 max_tokens=64 时,两模型 finish_reason=length,content 被截断在推理中间(未露出最终答案)。随后以 max_tokens=256(step-3.7-flash 另加 reasoning_effort=low)重试,均成功返回 42。下表为重试结果。
模型 |
HTTP |
延迟(s) |
finish_reason |
prompt |
completion |
total |
内容摘要 |
成功 |
答对 42 |
备注 |
错误 |
|---|
step-3.7-flash |
200 |
3.98 |
stop |
462 |
56 |
518 |
42 |
✅ |
✅ |
max_tokens=256; reasoning_effort=low |
— |
step-5-preview |
200 |
4.895 |
stop |
202 |
65 |
267 |
42 |
✅ |
✅ |
max_tokens=256 |
— |
首次视觉截断记录(供对照)
模型 |
HTTP |
延迟(s) |
finish_reason |
completion |
内容摘要(截断) |
|---|
step-3.7-flash |
200 |
2.186 |
length |
64 |
The user wants me to identify the number in the image. 1. *Analyze the image: |
step-5-preview |
200 |
4.895 |
length |
64 |
The user is asking what number or label is in the image. The image shows a pink/ |
其他模型
- 跳过 step-image-edit-2:官方文档将其列为文生图/图像编辑模型,chat/completions 请求形态与快速冒烟路径不明确,为避免无效烧 token 未调用。
- 跳过 stepaudio-*:音频端到端模型需要 modalities/audio 等专用字段与音频样本,本次仅做文本与视觉冒烟。
备注与选型
step-5-preview (文本):可用;延迟约 36.791s ; HTTP 200 ;回复 TEXT_OK。
step-3.7-flash (文本):可用;延迟约 1.992s ; HTTP 200 ;回复 TEXT_OK。
step-3.5-flash (文本):可用;延迟约 1.295s ; HTTP 200 ;回复 TEXT_OK。
step-3.5-flash-2603 (文本):可用;延迟约 1.398s ; HTTP 200 ;回复 TEXT_OK。
step-router-v1 (文本):可用;延迟约 1.452s ; HTTP 200 ;回复 TEXT_OK。
step-3.7-flash (视觉):成功且识别到 42;延迟约 3.98s 。
step-5-preview (视觉):成功且识别到 42;延迟约 4.895s 。
文档侧:step-3.7-flash 旗舰多模态推理,适合 agent/coding/视觉;step-3.5-flash / step-3.5-flash-2603 偏高速 agent/coding ;step-router-v1 为 Step Plan 智能路由(不支持图像输入);step-5-preview 文档示例支持图文。
推理模型在视觉场景下建议 max_tokens ≥ 128–256 ,否则易在 reasoning 阶段被 length 截断;可用 reasoning_effort=low 缩短思考。
step-router-v1 本次纯文本正常,但 prompt_tokens=488 (明显高于其他 ~22–23 ),可能含路由侧额外上下文。
错误原文(已脱敏)
本次最终结果无失败错误体(首次视觉仅为 length 截断,非 HTTP 错误)。
结论(日常使用推荐)
日常主力( agent/coding + 需要视觉):step-3.7-flash — 文本 ~2s 级,视觉可正确 OCR ,建议配合 reasoning_effort=low/medium 与充足 max_tokens。
高频/省延迟文本与 agent:step-3.5-flash(~1.3s )或 step-3.5-flash-2603(~1.4s ),本次均精确返回 TEXT_OK。
质量优先预览:step-5-preview 文本可用但冷启动较慢(本次 ~37s ),视觉正确;适合非延迟敏感任务。
智能路由纯文本:step-router-v1 可用;勿传图片(文档明确不支持)。
图像编辑 / 音频:本次跳过;有专用需求再按官方 image/audio API 单独测。
文本成功:step-5-preview, step-3.7-flash, step-3.5-flash, step-3.5-flash-2603, step-router-v1
视觉正确:step-3.7-flash, step-5-preview
脱敏原始结果:/workspace/step-plan-test-results.json、/workspace/step-plan-vision-retry.json