DeepSeek V4.1 Flash多模态视觉测试

Mozi 2026-09-11 21:09 1

这次更新带来的提升简直就是魔法!不过,视觉方面的差距还不是一般的大

这次 Deepseek 终于发布统一多模态模型了。上一次的 V4 Vision 还是拼接多模态

粗略测试一下这个多模态视觉是什么水平?让佬友在使用DeepSeek视觉的时候有一个底


SVG复刻肯定还是不如Gemini的


用来理解现实世界问题也挺大



错误


手指的问题能稳定做对了


正确


正确



这道题比较难,做不对于符合预期


逻辑表达式提取完全错误


这道题答对了,这非常意外。而且重复测试也是对的


这个验证码题目少选了一个


这些题目错了,那更难的题就不用测了


价格还是挺贵的,像这样纯聊天的方式都可以花掉1块钱,好在Open Code现在挺便宜


感觉是和 Gemini 2.5 Pro。差不多的水平,略微强一点点


题目来源https://linux.do/t/topic/286836


接下来测试computer use,测试题库ScreenSpot-Pro里面的 Windows 端 Blender前15题,这个难度对于这个模型还是太高了,估计顶多做一点安卓端的视觉定位还得是最简单的

15道题就对了2道题,Gemini只错两道题时间还短得多.不过比起V4 vision一道对不了,还是好一些

最新回复 (18)
  • Sam Altman 09-11 21:16
    1

    听我说谢谢你,因为有你,温暖了四季

  • lemos 09-11 21:18
    2

    这视觉能力,写代码够用不?

  • Mozi 楼主 09-11 21:19
    3

    写代码可以用,只要不做复杂操作就行。像Codex那种直接控制你的电脑鼠标键盘完成所有操作,这个模型是绝对不行的

  • yi guy 09-11 21:22
    4



    就这个题,单从图片来说,就是天王老子来了,也是左边橙色球大啊

  • 𝓏𝓱𝒶𝓷𝓎𝓾𝓍 09-11 21:23
    5

    要是有豆包的视觉就好了 ^-^

  • 09-11 21:25
    6

    其实我觉得它的视觉能力已经够强了,感觉Opus5都没它强,关键是它能不能、会不会用其他工具去对图片进行处理,弥补它能力的缺失,像楼主那道识别时间的,接入个harness给它的时候它会自己去裁剪、放大图片去处理,最终还是可以正确答对

  • Mozi 楼主 09-11 21:28
    7

    比OPUS5强那是绝对不可能

    时间那道题已经是对于当前模型来说非常简单的题了,还要调用很多次工具浪费一大堆Token才能做对肯定是很牵强的

    视觉强的模型,我都是考下面的这些题




    37460.94 3 读出秒表的秒数



    526.3s 或 526.4s



    还有Computer Use,这是目前所有注重视觉的模型都在重点训练的,而这个模型肯定是一点都没训练

  • 点点点…点娘! 09-11 21:33
    8

    感觉就是入门水平的多模态

    能看网页测试就行的水平

  • chris 09-11 21:37
    9

    絕無可能比 opus5 強,昨天就測過在 omp 裡 snapcompact 後的細密字形識別,尤其是數字類跟第一梯隊還差很多,語義理解倒是沒太大問題。

  • 西小罗 09-11 21:41
    10

    (帖子已被作者删除)

  • monoe 09-11 21:42
    11

    佬友对国模目前视觉能力有没有大致的排行榜,大概有gemini几成水平

  • 09-11 21:43
    12









    单单看这几道题呢?它这些都是不用任何工具直接视觉+thinking做出来的,你换个Claude Code CLI或者其他的harness分分钟给你做出来,因为它会用工具去处理图像

  • Mozi 楼主 09-11 21:43
    13

    那肯定是千问啊

    千问3.8 27B都有非常够用的视觉的水平

    3.8 Max已经是和Gemini同一个等级

  • hujiansir 09-11 21:43
    14

    相比glm-5.3-flash,哪个视觉更好啊

  • Mozi 楼主 09-11 21:46
    15

    Claude本来就在很多视觉排行榜里排在比较后面啊

    弱的模型调用工具能做得出来,强的模型调用工具能做出来更难的题目

  • 白学森 09-11 21:47
    16

    终于找到这个水表题了


    感觉 ds 的多模态还是刚起步,思路很新颖(vit),但是实际落地下来还不太成熟的样子

  • 09-11 21:47
    17

    所以我说的就是纯视觉能力,纯视觉上v4.1还是可以比它强的,不否认只要用起工具它完全可以做到,但是纯用视觉就不行

  • Mozi 楼主 09-11 21:48
    18

    而且视觉能力现在computer use要占一半才行

    这个对很多工程应用是非常重要的

    你可以用这个模型测一下Computer Use,我记得Claude的模型在这些题库的测试跑分都还是比较高的


* 帖子来源Linux.do
返回