GPT-6 Astra与中转站

William 2026-09-06 19:33 1

本只是想测试GPT-6 Astra, 测试的是静态分析能力, 使用的是GLM 5.3写的有bug的着色器demo. 因为之前GPT 5.6 Sol一直失败无法找到bug, 这次想看一下是否进步, 相关可以关之前帖子:



现在论坛上很多人都没有自己的基准测试, 都只是用鹈鹕之类的进行测试, 这样的测试好处是个小学生都看得出来好坏, 但比较局限在视觉上, 现实中, 尤其是写代码时, 更重要的其实是推理能力, 很多实际场景也是修改bug, 添加功能, 迁移代码的场景.
之前都是写demo, 现在在研究一个模型的理解和分析能力.
测试用之前编写的有问题的着色器学习的demo(GLM 5.3最喜欢写小bug), 大概1…


一直有在用FastAI, 前几天关于是否掺水的争论, 讨论很激烈, 我也觉得不太可能掺水,不过现在测试时遇到的情况让我有些困惑. 使用FastAI还是一直无法找出bug, 试了五六次(使用了0.06x OpenAI 福利分组,也使用0.2的普通分组).


听说any的可以用了, 虽然不稳定, 也跑了两次, 都能找到bug.


对比了Token的输入量都是一样的, 应该都是GPT-6, 没有掺水, 但是结果就是如此, 现暂时无法判断.


如果以any的为参考, 这次GPT-6 Astra是有进步,接下来还要找难度更大试题

最新回复 (1)
  • Guowu 09-11 23:52
    1

    同样有此困惑,之前不到2级用不了any,没有参考,最近可以用了之后,我特意测了,岂不是不止是fastAI,我常用的另外2家也一样(TrueSOTA、奇点),我专门测了GPT-6 Astra,用blender建模,没有要给比得过any的,差距不是一星半点。我目前的没找到不掺水的,佬们如果有啥建议可以评论

* 帖子来源Linux.do
返回