关于降智版astra的实际能力

Lody 2026-09-11 10:46 1

目前已知只是鹈鹕画不对,但是有没有佬对降智模型做更多测评?

比如实际coding能力和不降智版的区别,降智后的模型与gpt-5.6-sol比哪个更聪明?


附上刚出来的逆天鹈鹕:


最新回复 (11)
  • RzMY 09-11 10:47
    1

    据说是4o,Luna画的都比这个好

  • yipgnnkg 09-11 10:48
    2

    降智是换模型,量化影响不会太大,一般路由luna或差不多的模型

  • Lody 楼主 09-11 10:49
    3

    4o上下文只有128k,不可能啊

  • YaLei Li 09-11 10:49
    4

    我刚测试了一下,出来的效果和这个一样,昨天还是好的,同一个号同一个ip

  • lohas 09-11 10:50
    5



    我已经降的号,在跑这个问题。



    最重要的放前面
    有一个水杯配对游戏。共有 4 种不同颜色的水杯,每种颜色各有两个。将同色的两个水杯分别放在上下两层,因此
    上下两层各有 4 个水杯。下层 4 个水杯按某个未知顺序排列,挑战者无法看到它们;上层水杯的颜色和位置则完
    全可见。游戏开始后,挑战者可以反复进行以下操作:

    1. 向裁判询问当前有多少个位置满足“上下两个水杯颜色相同”。裁判只回答匹配位置的总数,不透露具体是哪些位置;
    2. …
  • lohas 09-11 10:51
    6

    我也是昨天很正常,今天就不行变傻了

  • a12908 09-11 10:51
    7

    如果你真想知道 那我就告诉你我的实际测试

    一晚上花了pro的70%额度修一个bug修不好 连luna都不如 纯纯弱智 说4o都高估它了

    切换成V4.1f后五分钟解决

    已经彻底失望了 那天后就不登录了 啥时候解决再说吧

  • jv-kssma 09-11 10:55
    8

    糖果測試不如5.5


    糖果測試在5.5時代主要用來測思考會不會在512被截斷,當5.5思考沒有被截斷時,是可以回答正確的。

    5.6和astra就更不要說了


    但降智的astra是連糖果題都會做錯的,反正我是不敢用,畢竟是公司項目

  • lohas 09-11 10:58
    9

    Selected model is at capacity. Please try a different model.


    今天老是这个提示

  • 时牧 09-11 10:59
    10

    降智后就都不是astra这个模型了,如果是在astra的基础上降智那还好一点

  • koumoe 09-11 11:59
    11

    实际测试是路由到luna 糖果题固定29

* 帖子来源Linux.do
返回