deepseek 视觉能力好拉呀

Jack min 2026-09-14 22:28 1

如图

今天用 deepseek 解释数学题把我气坏了,原来是根本就没识别对图像。

gpt 对比 deepseek 对手写矩阵笔记识别测试

补充 kimi 测试结果






识别出了点问题,但还算成功


补充千问 qwen 测试



第一个成功了,第二个矩阵识别失败


原图 模型思考时间要很久,欢迎大家测试

最新回复 (13)
  • 佬友记 09-14 22:32
    1

    gpt还是权威,deepseek就是瞎编,没想到kimi也这么强,小看了

  • 咪叭 09-14 22:33
    2

    deepseek主打一个优惠降本,视觉模型的参数量没有那么高,


    另外可以试着排查一下,图片的分辨率参数是否正确(虽然默认是高清原图


    而且deepseek刚做视觉没多久,估计还不够好

  • RzMY 09-14 22:33
    3

    这种问题可以请Gemini,Gemini擅长多模态,而且数学能力还不错,免费且量大管饱

  • zhy 09-14 22:33
    4

    我记得以前deepseek我输入一张图片以后,居然会识别不了其中存在文字,当时都震惊我了,感觉现在已经好一些了

  • 佬友记 09-14 22:34
    5

    很早之前的版本用的是ocr,现在是多模态

  • Jack min 楼主 09-14 22:37
    6

    谢谢,刚拿 gemini 识别成功,速度不错

  • 09-14 22:42
    7

    这图你给AI看确实很难看出来,但是你给它配个harness,它可能就会给你对图片进行处理然后识别出正常内容后再去思考,可能效果会好些。而如果想要直接识别出来,确实就得拿视觉能力强一些的模型,比如Gemini

  • ychell 09-14 22:50
    8

    你拿gpt的视觉能力要求ds那确实为难ds了,gpt的视觉能力一直都是最顶那档的

  • unsafetrait 09-14 22:51
    9

    其实视觉上最好的是GEMINI,国产最好应该是KIMI或QWEN,然后才是GLM,最后是DeepSeek,没错它的视觉是很差,简单说就是个大号的OCR甚至不如OCR,基本上还是要靠日志的,有点半残的残疾带眼睛的GLM 5.3的意思,但是GPT其实视觉上不如GEMINI或CLAUDE模型,GPT也是出名的视觉小垃圾

  • SwiftUI 09-14 22:52
    10

    如图,拍了一个答辩画质但是真人肯定能认出来是啥的图
    [image]
    以Gemini 3.8flash跑五次的答案为基准
    得分分别如下(一共5题 测试五次)
    [image]
    [image]
    其中名字后面的是渠道(带O的是Opencode G是bigmodel D是deepseek官方 N是我自己反代的各种套餐比如antigravity和opencode还有commandcode)



    可以试试Qwen3.8flash 这个我测试印刷文本识别仅次于Gemini 不知道对于这种手写的准确度咋样

  • 乌雅·兆惠 09-14 22:53
    11

    有时识别不出文字,清晰的电脑字体

  • ychell 09-14 22:55
    12

    gemini就不说了,确实视觉很强,所以我说gpt是最顶级那档的,Claude我记得4.5时期视觉很拉的,现在赶上来了嘛

  • unsafetrait 09-15 07:06
    13

    还是不太行,我们做过大量测试,GPT的视觉比DEEPSEEK肯定好,但是和GLM差不多的级别,属于半斤八两,看不懂游戏截图、错误位置、看不懂游戏特效,就最新的GPT6也一样的,这块似乎他们就没怎么去改过


    KIMI K3可以看懂,QWEN可以看懂,最强还是GEMINI,看懂了,还帮你分析 ^-^

* 帖子来源Linux.do
返回