多模态小测:DeepSeek 视图模式翻车,豆包竟成黑马?

风 云雨 2026-06-18 19:35 1


今天 DeepSeek 突然内测「视图模式」,我好奇之下顺手测了把多模态识图能力,顺便拉上几位国产选手和 Gemini 来场简单测试。结果…… 小鲸鱼连梁叔叔(梁文锋)都没认出来,反倒是豆包让我刮目相看。





测试场景




  • 任务:识别图片中的人物(梁文锋)从 Google 上随便找的一个图片。




  • 参赛模型



    • DeepSeek V4.1 Flash (疑似)

    • 豆包(Instant)

    • Kimi 2.6

    • MiniMax M3

    • Gemini 3.1 Pro






结果速览






































模型 识别结果 评价
DeepSeek V4.1 Flash ^-^ 未认出 200 多 B 的参数量加上 Thinking,连 “梁叔叔” 都没认出来
豆包 ^-^ 正确 出乎意料地准,字节 To C 果然有两把刷子
Kimi ^-^ 不错 表现可圈可点
MiniMax ^-^ 翻车 一如既往的…… 糟糕
Gemini 3.1 Pro ^-^ 答错 意外翻车,没想到 Gemini 连多模态也没赢



原始截图


豆包 测试结果



DeepSeek 视图模式测试结果



Kimi 测试结果



MiniMax 测试结果



Gemini 3.1 Pro 测试结果





简单点评



  • DeepSeek:虽然大众期待度高,但视图模式刚内测,识别能力还有待打磨,至少这次 “人脸识别” 没及格。

  • 豆包:本次最大惊喜,字节在端侧和多模态上的积累确实扎实。

  • Kimi:稳扎稳打,保持中上水平。

  • MiniMax:需要加油,几乎每次测试都垫底。

  • Gemini:本以为会轻松获胜,结果翻车,真的是 ** 美国豆包 **。




小结



一次不严谨但有趣的 “认人” 小测试。在细粒度视觉识别上,各家的差距比想象中更大。

如果你也在用视图模式,不妨自己测测看 —— 说不定你的 “梁叔叔” 能认出来呢?^-^





(注:本文仅为个人体验,不代表模型最终能力,测试版本和 prompt 可能影响结果。)

最新回复 (19)
  • 兰兰 06-18 19:43
    1

    据说这个多模态的模型是lite小模型(?)所以未必有200+b?


    以及豆包和kimi应该是有联网?具体看看思维链吧。


    我倒觉得多模态能不能看出来人是谁都无所谓,主要看有了多模态以后的UI能力有没有提升




    以及kimi和豆包的数据量恐怕没那么小哦

  • 风 云雨 楼主 06-18 19:43
    2

    豆包敢卖会员,还是在To C 有积累和自信的。

    豆包 手机端确实符合使用自觉。

  • Doori Kiss 06-18 19:44
    3

    豆包的多模态一直是强项啊。我记得它们还有实时屏幕阅读服务

  • Snowl 06-18 19:44
    4

    豆包的多模态好应该没有意外

    seedance视频生成模型就很惊艳

  • 风 云雨 楼主 06-18 19:44
    5

    kimi没有联网,我把联网关闭了。

    豆包是Instant 模式,没有思考过程。

    deepseek flash v4 的基模是200多B,基膜应该没有改变吧

  • 兰兰 06-18 19:45
    6

    具体不清楚,记得当时刚灰度的时候,多模态好像是个小模型,输出比flash还快一倍())

  • 风 云雨 楼主 06-18 19:46
    7



    kimi纯靠自己知识库的

  • 雪梨纽西兰希思露甘奶迪 06-18 19:48
    8

    Gemini真是美国唐包了,怎么会变成这样!

  • 风 云雨 楼主 06-18 19:48
    9

    比Flash还小,deepseek 练个这么小的多模态模型应该没有用吧

  • Yunfei Chen 06-18 19:49
    10



    哈哈哈..

  • 兰兰 06-18 19:49
    11

    或许有,应该是选择了新的技术,搞个小模型和同体量比较一下,看看能不能走这条路


    但目前看来是数据库太小了

  • SC 06-18 19:50
    12

    vision banana 已经证明了生图模型是通用视觉模型… 字节生图积累还是很深

  • 项太傅 06-18 19:51
    13

    豆包的识图一直都很强,后面降智了,现在是阉割的。

  • 风 云雨 楼主 06-18 19:52
    14



    nano banana 也不行,真成美国豆包了

  • 无敌暴龙战士 06-18 19:52
    15

    豆包识别图片我个人感觉是最强的那个梯队了。比gemini和gpt都强一点

  • Cartoon 06-18 19:53
    16

    用bot接的Mimo-v2.5试了下,好像也识别不出来

  • tomfly 06-18 19:55
    17

    到底是他们之间谁蒸馏了谁,gemini的答案简直了。

  • hohoho 06-18 19:55
    18



    网页版的

  • HLAIA光子 06-18 19:57
    19



    严格来讲你比的不是多模态,而是知识库 ^-^

    测试多模态,我建议佬可以从形状、空间、物品区分、样式描述这些方面切入

* 帖子来源Linux.do
返回