Qwen3.8目前只有流口水的水平

黄叶点子 2026-07-19 21:35 1

我做了两个测试,都是实际应用场景。

第一个测试是让它更新Python Workout中的过时的代码,替换为Python 3.12版本的代码,并生成最终的EPUB电子书。过程中反复偷懒、曲解用户需求。导致大量返工,最后消耗了大量token,得出的结果不尽如人意。

第二个测试是我给他一些Python知识点的Anki卡片,让他校对其中有没有知识性错误。这哥们直接生造了一个Python语法,并言之凿凿地说一张正常的卡片有知识性错误。被打脸之后,秒道歉。

我觉得这两个任务难度不高,复杂度稍微有一点。但也不是很高。但是模型最后的表现让我感到非常失望。阿里还是那个阿里。

附图一张

最新回复 (10)
  • PEScn 07-19 21:52
    1

    还没做完后训练就端出来了嘛……感觉太急着上线证明什么东西了……

  • xiao-gy 07-19 21:55
    2

    笑死我了这个打码的内容,一眼就看出来了^-^

  • 哎呀肚子疼 07-19 21:55
    3

    生造了一个Python语法



    有点离谱了,这种幻觉对 coding 来说有点严重吧

  • 🌟𝗦̘̚𝘂̘̚𝗽̘̚𝗲̘̚𝗿̘̚𝗻̘̚𝗼̘̚𝘃̘̚𝗮̘̚ 07-19 21:56
    4

    coding我没试过,试了下文字似乎有提升

  • 项太傅 07-19 22:01
    5

    不会差的,是时候加仓阿里巴巴了。

  • penny66 07-19 22:04
    6

    现在加仓太急促了 就算相信也需要等第一波预期过了再说

  • ensemble 07-19 22:18
    7

    估计被kimi k3压力到了,这俩定位很像。甚至可能阿里也准备搞个开源最大模型的噱头,结果被kimi k3抢先了。

  • Fernando Mayert MD 07-19 22:23
    8

    目前来看,能做好模型的都是新创公司。国内的阿里巴巴、腾讯和字节;国外的Google、Meta的主要模型都是二流。这再次让我想起那本神作《创新者的窘境》

  • 无痕 07-19 22:23
    9

    阿里的模型指令遵循和意图识别都不太好

  • 黄叶点子 楼主 07-19 22:24
    10

    (帖子已被作者删除)

* 帖子来源Linux.do
返回