对于瞎子模型的识图有什么解决办法?

nianshou 2026-09-03 18:22 1

还是用mcp那一套吗?QQ群聊天听说用子代理?

最新回复 (4)
  • 蒹葭 09-03 18:24
    1



    一个主模型,一个代理模型专门识图

  • 09-03 18:39
    2

    你子代理和 mcp 不都是委托其他视觉模型进行识图吗?本质上是一样的,只是上下文管理和调用方式的区别,没有多模态的模型其实用哪种方式都不如原生多模态,当然有些情况下也不一定。要说其他方法的话,纯文本的图片有 OCR,还有一些像素级识别然后靠“猜”,当然最直接的肯定就是委托其他视觉模型了

  • HeriX 09-03 18:49
    3

    [开源]一个让cc cx opencode等工具“长眼睛”的mcp,增强识图能力 - 开发调优 - LINUX DO


    其实现在模型绝大多数都有多模态了


    就连deepseek和glm这两个旗舰没有多模态的, 都有多模态flash了


    可以预见不久以后, 纯文本模型会越来越少

  • 长夜 09-03 18:52
    4

    deepseek一般会选择直接call gpt 5.6 luna过来识图(如果它发现你电脑上有codex的话)。


* 帖子来源Linux.do
返回