qwen 3.8 max 给我的感觉很割裂

AAAAAAAAAAAA 2026-08-08 12:29 1

感觉这个模型在非代码类文本工作表现极佳,甚至我可以说是我用过最棒的模型之一,能媲美opus4.6和GPT 4.5。


写代码的表现也勉勉强强,前端审美算是在线。


但是agent方面表现的很糟糕,经常出现找不到文件,懒得调用skill,甚至经常出现死循环,我感觉agent能力和参数量是它1/10的v4 flash差不多了,相当愚蠢。

(harness是阿里自家的qoder,可能和这个也有关系吧)


有佬也有这种感觉的吗?

最新回复 (12)
  • tuozhwei 08-08 12:38
    1

    非代码类文本工作表现极佳



    展开说说非代码类文本工作表现极佳是指哪些方面?

  • AAAAAAAAAAAA 楼主 08-08 12:42
    2

    文本生成,创意写作方面。3.8max输出的文本质量是极高的,而且没有普遍的ai口癖。直接可用性非常之高,很多时候不需要人类介入修改。

  • undefined 08-08 12:45
    3

    叠甲,叠甲,我没用过这个!!但其他的我用过一些。


    咦,被指控蒸馏了那么多其他家,居然没ai口癖,奇迹耶

    看来大概是没蒸,蒸感觉蒸不出这个德行的。


    =====补充一下

    蒸不蒸真的无所谓的。

    其实我倒是希望这些个厂商能蒸个或者争个世界第一出来。(两者都行)

  • 咪叭 08-08 12:46
    4

    审美,还有艺术方面还行吧


    写代码 查bug就是很糟糕


    而且很贵,缓存率糟糕,还有外审

  • davidsolomon 08-08 12:47
    5

    用tokenplan 感觉比k3贵很多很多,有没有什么渠道推荐呢?

  • 星辰此渊 08-08 12:48
    6

    给我点头肯用用

    让我也尝尝

    虽然大概率有甲 ^-^

  • AAAAAAAAAAAA 楼主 08-08 12:48
    7

    Qoder CN 新用户直接送800次调用,充59再送2000次。但是只能在qoder里用,我感觉这是个相当糟糕的harness

  • AAAAAAAAAAAA 楼主 08-08 12:51
    8

    其实我偏向于qwen没怎么蒸,或者是蒸馏技术太垃圾^-^


    因为这个模型确实没有GPT、claude的口癖(或者很少),而且agent方面很垃圾。


    我觉得anthropic指控阿里蒸馏,更多的只是为了给美国防部指控阿里是涉军企业打配合,毕竟a​^-^也拿不出什么实质性的证据

  • NascentSoul 08-08 12:55
    9

    模型是真的好用,已经取代 Gemini 来搜资料了,不如豆包来源丰富,但比豆包聪明太多了。

  • NascentSoul 08-08 12:57
    10

    阿里应该学 META,强制收集自家员工工作的时序行为轨迹,用于大模型训练,把 agent 好好搞一搞。

  • tuozhwei 08-08 12:58
    11

    意思是拿来写长篇小说方面不错吗?

  • AAAAAAAAAAAA 楼主 08-08 13:15
    12

    理论上是的,但是我没试写小说,不过整体模型文风在线,逻辑也在线,应该是问题不大的

* 帖子来源Linux.do
返回