模型能力大讨论

未央 2026-08-01 22:37 1

跟大家讨论一下目前比较火的几种模型的能力

不看评分,跑分这东西太虚了,大家看实际体验,如果用过某几种模型对比感受可以说一说


热门模型:deepseek-v4-falsh , claude-opus-5 , fable5 , gpt-5.6-sol , grok4.5 , kimi-k3

嗯差不多这些,哦对了,加一个glm-5.2,感觉glm5.2都要成计量单位了,比他强的我才爱用 ^-^


比如从前端,后端,规划,写小说(润色,写公文)等角度来比较


欢迎大家讨论,不同任务可能表现也不一样


涉及要写代码的我一般还是在用claude-fable5,review可能用gpt5.6 感觉还是比其他模型强一些的

普通问答的话grok4.5的速度和准确度都还能让人满意

写小说或者润色之类的就不知道哪个模型好了

k3也是一直没使用,听说他前端强。

最新回复 (8)
  • 卡里姆•汗 08-01 22:41
    1

    目前来说,我的体验是,k3>dsv4flash,然后grok4.5(未降至前)>glm5.2,其他的模型没有深度使用过

  • igg8 08-01 22:46
    2

    glm5.2不能爽用啊,大佬有渠道没

  • 卡里姆•汗 08-01 22:47
    3

    没有,我是官方max订阅的,现在官方涨价直接跑路了

  • czm995212 08-01 22:53
    4

    我的个人感受是国产模型的跑分高是建立在更长思考时间的基础上,慢的一批,光思考不干事.Grok简单任务那是真的又快又好,codex唯一真神,又快又好又便宜,无论是最近的无限重置还是超低倍率的中转站.

  • event 08-01 22:56
    5

    实测下来Grok在中坚任务中,犯错误的概率最低,修正错误的能力最好。任务的流畅度、使用的流畅度、沟通的流畅度都是最好的。缺点就是语法怪怪的,有时候给出的结论是先分再总需要适应。

  • 远坂凛的宠物 08-01 23:12
    6

    codex的高上限+低单价不也是雷霆大思考+过度关注执行细节的赛博强迫症+语文是数学老师教的换来的吗……


    每天都得用,看到它说话就影响心情。


    不是容错率非常低的写代码任务我宁可用grok、国模甚至gemini


    国模我一般不咋骂它,可能因为用国模的时候都是逆向之类的场景,不用盯着它高血压


    grok主要是最近都在干细活,没时间狠狠蹬,别的不说写刘备文真是一绝。


    fable嘛就那一点点额度,还没碰到过上限

  • 不想当韭菜的牛马 08-02 00:58
    7

    播客音频转录及字幕文稿翻译,grok4.5 远不如 Gemini 3.6 flash.


    opus5 GPT-5.6-sol ,

    k3,

    Sonnet5 GPT 5.6- terra ,


    Gemini 3.6 flash grok4.5.

  • xhc861 08-02 00:59
    8

    dsv40731在复杂任务上处理能力并不理想

* 帖子来源Linux.do
返回