One Shot评测越看越没意义了,而且看的很烦

csgobad 2026-08-01 11:04 1

这几天在X一直看到各种拿dsv4f来对比opus5/fable/gpt-5.6-sol这类模型然后一直重复着dsv4f水平还差远什么的,开始觉得很烦躁了







最主要原因就是这些视觉评测和实际体验差别太大了,我过去一周用opus5都用了快60B token的实际体感就是“过度思考”的模型,我发现这种过度思考模型在这种“一句话评测”里面确实会表现的最“惊艳”因为他总是会帮你完成很多你没要求的细节


但是这种过度思考在真实使用的场景就是每回合思考非常多非常慢,甚至有些简单的东西他都过度思考,常常去多做一些事情,以至于现在用这些模型你还得额外规范他什么东西别碰别做,用起来就是很不爽


gpt-5.6-sol好一些但也是会过度思考,最近用比较少只用了600m


老实说最近用的最爽反而是grok-4.5所以觉得如果dsv4f能有差不多的速度之上再聪明一点那就是很好用的模型了

最新回复 (2)
  • Cnc_cbz 08-01 11:14
    1

    是的,日常开发gpt5.6 就是很难用,一个简单需求跑个十几分钟^-^

  • xuecl 08-01 12:32
    2

    开max了?


    opus4.7之后的opus系列我一直觉得默认的high就是最佳effort挡位。后面两档性能提升微小(甚至有反效果),还会慢一大截,token消耗也多一大截。

* 帖子来源Linux.do
返回