OpenCode Go 的 DeepSeek V4 Flash 跑分神鬼二象性

花白 2026-08-08 21:21 1

用 Go 订阅的 V4F 跑了两次 TerminalBench 2.1 (官方的 0731 检查点 ~82.7%) ,第一次 75.28% ,第二次暴降到 64.04% ,这下真不知道为什么了^-^。

最新回复 (11)
  • 菜籽 08-08 21:23
    1

    上游有很多provider ,给你路由到奇怪的供应商了

  • 3GZ 08-08 21:23
    2

    其实挺正常的,小模型质量就是不太稳定,会有性能波动。跑分本来就是要多次采样,取平均分。

  • 花白 楼主 08-08 21:24
    3

    我看官方说要跑五次算方差,所以在跑第三次。

  • CyreneNight 08-08 21:25
    4

    应该是路由到神秘团队部署的神秘自托管模型了吧

  • 菜籽 08-08 21:26
    5

    周五我就发现opencode 质量不稳定,今天研究了一天,opencode 预览版flash和正式版混用(找到确凿证据)多个provider(确凿证据),路由到量化(猜测)

  • 初九猫 08-08 21:26
    6



    DeepSeek跑分的波动本来也不小

  • 忍者熊 08-08 21:52
    7

    opencode go订阅也一样吗,我记得之前看过opencode官方文档中有介绍,go订阅中的deepseek是调用官方的,现在改了吗

  • 菜籽 08-08 22:15
    8

    go 没测那么仔细,但是我 糖果题claude code 里面答不对,建议买官方API,官方API我10次9次都是对的

  • ppdx 08-08 22:18
    9

    佬友跑完了吗 ^-^

    感觉opencodego 已经不是一个不错的选择了。

  • crazycrazyshui 08-08 22:21
    10

    13是比较正常的,你看5.6也有10%,使用起来的感觉其实更像是preview和GA版的差异了

  • wanmu 08-08 22:25
    11

    我昨天测官 api 10 次 3 对


    go 是 10 次 4 对


    是 opencode 这个 harness 的问题吗 ^-^

* 帖子来源Linux.do
返回