有一事不解,是绝大多数都是许愿 AI?

sampeng 2026-09-13 10:54 1

v2 好像还好,隔壁 linux.do 的帖子 80%都是在测试模型有没降智

我用了一年除了 sonnet3.x-4.x 突然开始我说 a ,他做 b 以外这种明显的。其他基本没有感觉到啊…忘记做漏做都是自己没说清楚的。给我的感觉就是我要没提他做了是惊喜,没做是我没说清楚。只要把我说了的都稳定快速做完就是好模型。

或许这种所为的脑子不好使就是模型幻觉在 coding 里面的表现?

然后我就想到会不会是都在许愿编程?用的人自己并不清楚正确的是什么结果,或者就是一句话帮我做个登录,帮我搞一下支付,帮我做 xx 功能这样?
最新回复 (9)
  • jackzhou968 09-13 10:55
    1
    有更好的模型, 觉得以前的模型不好用了
  • nsjs 09-13 11:30
    2
    开发三步骤嘛,提需求,实现,判定正确性。 判定很难的,没这能力就只好依赖 ai 了…… 而且现在很多人用来做整个产品,或多或少都有这方面问题的
  • sampeng 楼主 09-13 11:33
    3
    @nsjs 我个人非常不看好一个/glob 就不管了…我拿一个帐号来试过,他是会自己验证。写出来的东西都是啥啊…我再拿个 ai 来接着写都看不懂怎么修 bug 。
  • Antihank 09-13 11:45
    4
    我没看到使用 Anthropic 模型的人有提出,基本上都是使用 Openai 模型的人在抱怨这个现象。
  • nsjs 09-13 11:57
    5
    @sampeng 做自己懂的东西是的,毕竟自己知道应该做成什么样。 现在有了 agent 之后,可以用来做更大的,超出自己知识和精力范围之外的东西了。 超出知识范围还好,可以学,超出精力范围就实在没有办法了,只能靠 agent 了。 所以模型智力很重要嘛,但这么多的人测智力的大多都是跟风图一乐而已,自己的那半亩地都种不好的
  • jonty 09-13 14:55
    6
    @Antihank #4 opus4.7 出来那时候不少人抱怨吧。
  • idealhs 09-13 15:29
    7
    你自己测一下醍醐不就知道了
    前两天 Astra 高负载的时候,多少人用 Astra 被路由到 5.5 mini 了
    你感受不到 != 不存在
  • FTJ 09-13 15:29
    8
    倒不完全是许愿。我的体验是,从 Opus 4.7 之后各家模型都有个毛病:回复越来越“工程师黑话化”。给个需求,开发完甩回来一堆编程术语,还混着它自己起的各种函数名、模块名,想看懂它改了哪里、怎么改的,成本非常高。功能是做了,但人和 AI 之间反而更难沟通了。
  • lel020 09-14 12:18
    9
    对我来说 AI 智商最重要的体现在于听懂我的要求,遵守 skill 约束,
    差不多的指令和 skill 环境,某天开始纠正 AI 的理解和实现次数明显变多,尤其是我都不用明说什么问题,说 AI 有问题 AI 就知道是什么问题但下次还犯,这种情况越来越多,那就是降智了,
    代码质量之类的反而很难体现智商,
* 帖子来源V2EX
返回