用了 DeepSeek 20亿+ tokens 体感 v4.1 flash 和 GPT-5.6 SOL High 接近

shanyuhai 2026-09-20 10:55 1


在实际的思考链中发现 DeepSeek v4.1 flash 可能基本能力差一点,但配上合适的单元测试和 E2E 模拟真机测试工程化,经过超级雷霆大思考(普遍 5-10M tokens)最后结果很好,考虑周全。


唯一的问题是一个需求实现下来成本 1块+,和 GPT 价格接近了,而且我基本上是梁文谷时期采用,换上高峰期估计和 Pro 20x 价格打平了。

最新回复 (8)
  • shanyuhai 楼主 09-20 11:02
    1

    感觉如果后续把 DeepSeek 作为主力,得适当减少自动化测试的广度了,尤其是对生成效果的校验。

  • huyl 09-20 11:04
    2

    目前深度试用一周了,感觉还是可以的,解决一些小的bug方面没发现有什么问题。就是耗时较长。官方确实贵,半个小时用了我45块钱,现在只能找低价中转用一用

  • sg8011 09-20 11:05
    3

    用command code ,cline,opencode的套餐试试,降低成本

  • kxians 09-20 11:05
    4

    唉,这些套餐智力和速度上都不如官方

  • shanyuhai 楼主 09-20 11:06
    5

    之前考虑过,但是感觉成本不是很好控制,因为官方缓存基本可以干到 99%+ ,很少见到更低的了。如果缓存丢失,那可能消耗更高了。

  • shanyuhai 楼主 09-20 11:08
    6

    是的,我也有在白嫖商汤的免费,感觉智力下降就是太多,而且我当前随便一跑测试集就是 2M tokens 了,并发马上就 429 了 ^-^


    之前没有领 gemini 鸡蛋的时候还用用,现在基本闲置了。

  • kxians 09-20 11:13
    7

    嗯, 所以说不能光看模型id,即使官方都有降智,第三方更是把基线拉下来了,完全不是一个东西了

  • shenhe 09-20 11:28
    8

    主要是神鬼莫测,v4.1f的智商忽高忽低,当然gpt更甚,有些时候甚至他是4o

* 帖子来源Linux.do
返回