做了个大模型视觉能力检测的小工具

Nanami_Chiaki 2026-07-23 12:41 1

SkalskiP on X: "I’m both impressed and disappointed by Gemini 3.6 Flash faster, cheaper, and uses fewer tokens then Gemini 3.5 Flash. noticeably worse at object detection. often returns one general box instead of several precise ones. feels lazy. prompt: detect banana tree ↓ deep dive https://t.co/YREla5HVHx" / X 看到有人分享这条帖子,于是让ai搓了一个单html工具,能够让ai给画面中的物体打标并渲染出来。

index.7z (6.6 KB)

简单测试了几个模型,结果如下:

3.1pro



kimi2.6



3.6f



3.5f lite



gpt-free网页不知道什么模型



sonnet5官网


可以看得出来gemini系的模型的视觉能力确实遥遥领先。欢迎大家在下面补充自己拥有的多模态模型的测试结果

最新回复 (16)
  • Nanami_Chiaki 楼主 07-23 12:42
    1

    grok4.5

  • 老火面 07-23 12:53
    2

    这不是B站的up纳豆奶奶吗?

    有点意思,等我晚上回去研究研究。

  • Nanami_Chiaki 楼主 07-23 12:55
    3

    感觉不太像噢。这是我之前找过很久没找到的悬案,顺手拿来测试了

  • voeid 07-23 12:55
    4

    Gemini为数不多的强项了,视觉能力还是很强的

  • albert 07-23 12:57
    5

    看起来很实用,收藏了,感谢大佬^-^

  • Autsun 07-23 14:19
    6

    这张图原图有吗,我试试本地跑的量化版qwen3.6 35BA3B

  • Nanami_Chiaki 楼主 07-23 14:31
    7



    佬可以试试。不过这个检测结果不一定能真实代表模型视觉能力,我感觉即使它看懂了图片,但不一定能精确标注出物体的位置,也就是说结果好的一定是好,但结果差的不一定差

  • Autsun 07-23 14:33
    8

  • Autsun 07-23 14:34
    9

    Qwen3.6-35B-A3B-UD-Q5_K_M

  • Nanami_Chiaki 楼主 07-23 14:39
    10



    还有一张是这个,好久之前就在找了不过没找到真正的源头

  • Autsun 07-23 14:41
    11

    5090跑的,模型都加载在显存上,为了速度(大概250t/s左右),如果只是为了能跑起来,那差一些的显卡也能跑,这种moe模型可以把权重卸载,然后只在GPU上跑激活专家,其他放在内存上跑(内存不够好像还会swap吧)就不怎么可用了

  • Autsun 07-23 14:41
    12

    5090D,32G的版本,不是dd也不是满血5090

  • Autsun 07-23 14:43
    13

  • Nanami_Chiaki 楼主 07-23 14:58
    14



    哈几米3.6f的结果。



    3.5flash light的结果(我才发现先前用的web端都没开拓展思考,不过估计影响不大)

  • Autsun 07-23 15:00
    15

    不知道哈吉米的flash是什么规模的模型,也没有开源,我这边之前有gemma4的模型测试,现在这个千问的模型正在用,不好切换,先不测了,估计是差不多,当时是感觉千问的好一点才用的千问

  • Nanami_Chiaki 楼主 07-23 15:00
    16



    这个是3.1pro开拓展思考。感觉哈几米框的范围就特别精准,偏移不会特别大

* 帖子来源Linux.do
返回