gpt-6-astra 的 516 降智问题比 gpt-5.6-sol 严重的多

Hao 2026-09-05 23:42 1

这是使用 gpt-6-astra medium/high/xhigh 的请求中统计来的推理 tokens 分布情况。可以看到 516/1034/1552 这些 518k-2 的位置出现的次数明显高于其他位置。说明 gpt-6-astra 的推理截断降智问题非常严重。



作为对比,可以查看这个帖子中关于 gpt-5.6-sol 的推理 tokens 分布统计



下图展示了 3 万余条正常在 Codex 中使用 gpt-5.6-sol 产生的请求的推理 tokens 分布情况。该图中排除了推理 tokens 为 0 的样本,其在 medium/high/xhigh 中占比分别是 11.4% / 17.1% / 15.2%.
观察到 516 推理截断问题仍然存在。图中可以看到(尤其是 medium)在 516、1034、1552 等位置,请求数量明显高于附…
最新回复 (6)
  • shuxing ji 09-05 23:50
    1

    感觉已经不能当bug看待了,事实上很多完整的长思考也满足这个规律,只是n足够大,回答质量也没有问题,比如这里就是n=55


  • Zulove 09-05 23:52
    2

    的确是,我也遇到了,我在测试糖果题目时常常复现516

  • Hao 楼主 09-05 23:56
    3

    应该不是 bug,多半是 OpenAI 节省算力的一个机制。但实际体验是只要发生了截断,推理链条不完整,效果就会变得非常差。不完整的推理链条会导出特别离谱的结果,简单来说,实际使用过程中,推理被截断到 516 的效果可能还不如只推理 100 个 tokens 但是不被截断的效果好。

  • Kassdin 09-05 23:57
    4

    为什么要截断推理的tokens,作为节省算力的策略的话也太暴力了

  • Hao 楼主 09-05 23:58
    5

    这就得去 X 上面问奥特曼或者 tibo,这个截断机制是 gpt-5.5 时代就有的。 ^-^

  • jyeric 09-06 01:17
    6

    确实astra 516截断出现的特别明显,不知道有什么好办法优化

* 帖子来源Linux.do
返回