[开源]Visual-Enhancement-mcp,一个增强cc cx识图能力的mcp

火之神神乐 2026-06-01 15:49 1

本帖使用社区开源推广,符合推广要求。我申明并遵循社区要求的以下内容:



  • 我的帖子已经打上 开源推广 标签:

  • 我的开源项目完整开源,无未开源部分:

  • 我的开源项目已链接认可 LINUX DO 社区:

  • 我帖子内的项目介绍,AI 生成、润色内容部分已截图发出:

  • 以上选择我承诺是永久有效的,接受社区和佬友监督:


以下为项目介绍正文内容,AI 生成、润色内容已使用截图方式发出


最近在cc 和cx使用第三方模型的时候会出现一个问题,就是如果有些模型不支持识图的话,还得去别的地方把图像结果识别出来,再粘贴给cc cx或者opencode用,这样可能用的时间比较长,还比较繁琐。


然后我就自己vibing code了一个mcp


安全性:运行在本地,不会泄露重要信息和key


需要准备一个多模态识图能力的小模型,把这个小模型配置上去即可,然后就可以在cc cx中直接调用mcp,进行快速的开发了。

项目地址:GitHub - goehou/Visual-Enhancement-mcp: MCP stdio server for image recognition via an existng vision model · GitHub

欢迎各位佬提出意见,谢谢!

最新回复 (19)
  • Junerver 06-01 18:51
    1

    在cc里使用貌似不太行?还是我的用法不对?我用的是mimo-v2.5-pro,不支持图片,用佬友这个mcp工具配置的 mimo-v2.5,在cc里发送图片还是会出现报错:


    ● There's an issue with the selected model (mimo-v2.5-pro). It may not exist or you may not have access to it. Run /model to pick a different model.

  • 焕昭君 06-02 00:22
    2



    今天找到的,我在翻找GitHub看到新鲜的,readme最后的Linuxdo

    ,看着好像还不错,就是不知道还有没有其他机制,比如超时、重试等。

    还有可惜是不支持Anthropic接口^-^




    现在有新的问题,就是这个图片识别模型用啥好呢?^-^

    国产模型哪家强?我知道的有mimo2.5、kimi、豆包、glm、千问




    对了,好像根本没有发布到NPM仓库?!


    mcp-vision-server?npm publish?

  • 火之神神乐 楼主 06-02 09:10
    3

    这个报错貌似是cc配置的模型的报错,大概率是模型没有映射成功

  • 火之神神乐 楼主 06-02 09:11
    4

    多模态的话可以用qwen-3.5,我是公司部署的,感觉识图能力不错,之前也体验过kimi k2.5 感觉千问和kimi多模态模型都做的很不错

  • 火之神神乐 楼主 06-02 09:12
    5

    npm还没有发布 等再完善完善再发(我是菜鸟

  • BigDream 06-02 09:27
    6

    看着还不错 等佬发布后 我来试试

  • 火之神神乐 楼主 06-02 09:29
    7

    好的 我再打磨打磨给他发布了 感谢支持

  • Junerver 06-02 11:12
    8

    模型映射没问题,因为pro不支持图片内容,正常在pro中发图片就会出现这种结果,可能只通过mcp无法解决

  • 火之神神乐 楼主 06-02 11:14
    9

    看下我的项目简介,应该是你得配置一个支持识图的多模态小模型才行

  • 焕昭君 06-02 11:16
    10

    额,你没发布我们怎么用,想用就得下载到本地,没有迁移性。

    实在有人忍无可忍了,fork一份仓库,抢注名字发布到npm仓库了,等你回过头想用这个名字不行了 ^-^ ^-^




    建议是先发个0.X的版本,给大伙测试一下。对了npx安装的mcp用最新版本的比如在名字后面加一个@latest,你后续直接更新版本,大伙能直接用到最新版本的。

    我都不知道你担心啥 ^-^

  • Junerver 06-02 11:21
    11



    已经配置了,不知道为什么不行

  • 火之神神乐 楼主 06-02 11:22
    12

    行 我研究研究 先发一版(手动狗头

  • 火之神神乐 楼主 06-02 11:23
    13

    mimo是多模态吗?佬可以看下他支持不支持识图

  • Junerver 06-02 11:26
    14

    mimo-v2.5 是多模态,感官上是发送后mcp没有介入,直接将带图片消息传递给了 mimo-v2.5-pro,然后导致出错

  • 火之神神乐 楼主 06-02 11:28
    15

    那应该是模型没调用mcp的问题吧 跟mcp是没关系吗(我是菜鸟

  • Junerver 06-02 11:36
    16

    还是存在问题的,使用智谱的识图mcp时是可以拦截图片交由mcp的识图处理的,智谱不支持多模态也是通过mcp来实现的外挂识别。


    关闭智谱的mcp用佬友这个,无法做到同等效果。

  • 火之神神乐 楼主 06-02 11:40
    17

    我后面再优化优化 看看怎么回事 我调用的时候也没出现这个问题 感谢反馈

  • 焕昭君 06-02 15:35
    18

    我用的是 mimo-v2.5-pro,在 cc 里发送图片还是会出现报错:




    型映射没问题,因为 pro 不支持图片内容,正常在 pro 中发图片就会出现这种结果



    我也遇到这个问题,不过后面因为mimo2.5pro工程化能力太差,很容易一个问题卡住导致上下文越来越长越差,我还是润回ds4pro了。

    然后ds4pro在cc直接粘贴图片发送,是能正常调用MCP的。

    我猜猜原因是当你粘贴图片发送消息的时候会进行一轮带图API请求,而mimo2.5pro直接在路由层拒绝了所以就返回一个通用的cc报错。(我猜的,佐证可以自己抓包cc看一下)

    然后如果你经常用ds4pro的话,试过粘贴图片发给deepseek api,它是不会在api层面报错任何,直接静默,而对文字照常处理;你问它图片它会瞎鸡巴乱说。

    我觉得关键点就是这里了──ds api不会对带图的Anthropic请求拒绝,然后呢没拒绝,ds就能顺利接下来使用MCP处理图片了。




    我用的另外一个识图mcp,虽然不同但同理,因为楼主这个MCP都没发包npm,我也又不想下到本地用。


    {
    "command": "uvx",
    "args": [
    "--refresh",
    "mimo-image-recognition-mcp"
    ],
    "env": {
    "MIMO_API_KEY": "你的KEY",
    "MIMO_API_BASE": "https://api.xiaomimimo.com/v1",
    "MIMO_MODEL": "mimo-v2.5"
    }
    }

    mimo-image-recognition-mcp 这个我是先知道的,当初我发现mimo2.5pro居然不支持图片,我还以为能呢比ds4pro多模态强,后面报错才重新看官网发现只能mimo2.5…

    然后顺便发现了这个MCP,可惜就是只能用MIMO模型


    我就试着搜索一下更好了,就发现楼主这个了,可以支持任意openAI兼容格式的API,但还是可惜没发包没法用…

  • Junerver 06-02 15:39
    19

    我回退到用 ccr 了,直接ccr里指定 v2.5 了

* 帖子来源Linux.do
返回