真实工程任务-添加功能,DeepSeek-V4 Flash Vision Exp,Grok 4.6,GPT-5.6 Luna,GPT-5.6 Sol,Gemini 3.7 Flash横向对比

bamboo2026 2026-08-23 16:37 1

项目



  1. DeepSWE UI 是一个基于 FastAPI、React、TypeScript、Vite、Pier 和 Docker 的本地管理平台,用于运行、监控、对比和重试 DeepSWE 基准测试任务。


测试题与分析结果




  1. 20260822给deep-swe-UI添加手动价格修改



    1. 我发现https://models.dev拉取的模型价格不一定是对的,我需要这里加入价格编辑功能





  2. 整体测试结果






































































    1. 模型及配置 主动测试完成度 人工验证 耗时 倍率 / 计费方式 费用 Token 消耗 请求数
      sol xhigh 后端 + 前端类型 + 实际UI测试 ^-^ 通过 26 分钟 0.21 倍率 1.10 元 6.08M 51 次
      luna max 后端 + 前端类型 + 实际UI测试 ^-^ 通过 39 分钟 0.45 倍率 0.13 元 9,630,861 105 次
      grok4.6 medium 后端 + 前端类型测试(无实测) ^-^ 通过 22 分钟 0.30 倍率 0.57 元 3,096,058 39 次
      gemini3.7 medium 后端 + 前端类型测试(无实测) ^-^ 通过 50 分钟 反重力 CPA 免费 - 110 次
      deepseek-v4-flash-vision-exp max 后端 + 前端类型 + 实际UI测试 ^-^ 通过 10 分钟 波谷价格 0.5 倍率 0.99 元 11,159,516 106 次





  3. 请求与响应分析对比




    1. 模型名称测试上下文范围首字延迟 (TTFT) (短上下文 / 100k+ 上下文)长输出吞吐量 (TPS) (大文本生成速度)缓存命中率 (Cache Hit)综合性能评级
      DeepSeek-V4 Flash Vision Exp~28.5k → 156.6k0.8s ~ 1.8s / 2.0s ~ 3.0s (极快)100 ~ 116 tokens/s (极快)98.5% ~ 99.96%S+ (断层第一)
      Grok 4.6~29.5k → 107.4k7.2s ~ 10s / 10s ~ 14s (正常)50 ~ 65 tokens/s (快)94.0% ~ 99.9%A (单次偶发超时)
      GPT-5.6 Luna~27.1k → 137.5k5.1s ~ 8.5s / 9.0s ~ 12.5s (良好)44 ~ 50 tokens/s (平稳)95.0% ~ 99.7%A (均衡稳定)
      GPT-5.6 Sol~74.2k → 141.9k8.5s ~ 12s / 12.0s ~ 17s (中等)35 ~ 50 tokens/s (平稳)95.5% ~ 99.8%B+ (偶有大延迟)
      Gemini 3.7 Flash~28.4k → 134.1k5.5s ~ 8.8s / 24s ~ 38s (急剧恶化)60 ~ 96 tokens/s (爆发快)90.0% ~ 97.9%B- (超长文首字极慢)





  4. 代码质量对比(GPT-5.6 Sol分析对比)












































































    1. 排名 候选 正确性 35 校验 15 前端 15 测试 15 维护 10 风险 10 总分
      1 deepseekv4 34 10 12 15 9 9 89
      2 sol 28 15 15 13 8 8 87
      3 grok4.6 31 14 11 12 9 7 84
      4 luna 24 11 11 11 9 8 74
      5 gemini3.7 26 9 13 10 3 2 63





本次任务的整体结论



  1. 在综合代码质量、推理性能、任务耗时与成本各维度后,综合表现由高到低依次为:

    DeepSeek-V4 Flash Vision Exp > GPT-5.6 Sol > Grok 4.6 > GPT-5.6 Luna > Gemini 3.7 Flash

    • 最佳综合表现者(全能断层第一)DeepSeek-V4 Flash Vision Exp

    • 最佳代码严谨度GPT-5.6 Sol

    • 最高性价比(极低花费)GPT-5.6 Luna

    • 表现垫底Gemini 3.7 Flash(代码质量与长文本首字延迟均不理想)



最新回复 (1)
  • leonvxe 08-23 18:01
    1

    最近看论坛 v4flash 还有什么牛来 都能轻松秒掉 5.6 sol,这是真的吗 ^-^

* 帖子来源Linux.do
返回