【gemini 和gpt都是垃圾】一个真实复杂搜索任务场景,主流大模型评测

jcc 2026-08-27 08:42 1

这几天陪孩子搭乐高,有个零件丢了,想要补件。于是问ai确认一下零件型号


提示词:乐高42232这个科技旗舰的第85部说明书里面。的那个齿轮是什么齿轮?把型号给我


各模型的表现如下,使用手机app,使用常用的模式和思考深度


从弱到强排序


第一个gemini

使用3.1pro,扩展思考模式


这是唯一的连说明书都不看的,纯垃圾



第二个

trae work手机版,云端模式,加qwen3.8max

虽然下载了pdf,但是后续的任务执行的各种绕,各种出错,现在还没跑完,懒得等了先排在倒数第二吧。有结果了再更新


结果最终是对的,消耗了1000多积分,约等于5天的签到额度。消耗有点大,不过这几个里只有trae是纯免费的,靠签到的额度跑的。其他的都是花钱订阅的



第三个

聊天模式的gpt,sol,加极高思考

速度还算比较快,下载了pdf,但是找错了零件



第四个

k3的非集群模式,极致思考,标准上下文长度


下载pdf找对了零件,而且相对比较快


最后一个,本次的最佳模型

grok,使用专家模式(没用heavy和build,就是专家模式)


下载了pdf找对了零件,而且任务完成的飞快

最新回复 (8)
  • 咪叭 08-27 09:26
    1

    grok是这样的,找东西我爱让它找。


    之前找个comfyui缺失插件,grok没找着,但是差了一点


    gemini直接偷懒不找硬编,我怀疑gemini ai studio系统提示词有问题

  • jcc 楼主 08-27 09:31
    2

    但是gpt这么拉是没想到的


    两个国模都能找对了,gpt翻车了

  • eguhz 08-27 09:33
    3

    佬 可以贴一下正确答案 后续可以当作测试题来验证产品了 ^-^

  • jcc 楼主 08-27 09:36
    4

    回答出来了 94925 这个的,应该就是对的,我看这个确实是一样的零件


    回答其他的应该不对

  • scp3500 08-27 09:58
    5

    佬我用api的gpt terra high试了一下105秒

  • jcc 楼主 08-27 10:20
    6

    这个和harness有关系


    理论上,虽然需要下载需要多步骤,但是任务不算很难,不需要复杂的逻辑


    只不过,app里面,gpt过于自信了,执行很快,下载pdf,找到了对应的东西,然后看了之后就给结果了。其他几个,在给出结论之前,会更多的进行图片的裁剪和仔细的比对确认。然后才给结果

  • scp3500 08-27 10:24
    7

    还真是,试了几个其他模型发都现会直接看图片判断齿数

  • jcc 楼主 08-27 10:29
    8

    感觉grok真是不错


    搜的多,步骤也多,执行的很仔细也会自己检查复核,然后最终跑下来也很快


    gpt那是傻快,靠省略了仔细核对的步骤才快的,结果就不稳了

* 帖子来源Linux.do
返回