[开源]一个让cc cx opencode等工具“长眼睛”的mcp,增强识图能力

火之神神乐 2026-06-20 21:43 1

本帖使用社区开源推广,符合推广要求。我申明并遵循社区要求的以下内容:



  • 我的帖子已经打上 开源推广 标签:

  • 我的开源项目完整开源,无未开源部分:

  • 我的开源项目已链接认可 LINUX DO 社区:

  • 我帖子内的项目介绍,AI 生成、润色内容部分已截图发出:

  • 以上选择我承诺是永久有效的,接受社区和佬友监督:

    以下为项目介绍正文内容,AI 生成、润色内容已使用截图方式发出


接上篇帖子[开源]Visual-Enhancement-mcp,一个增强cc cx识图能力的mcp

需求场景是,如果我们配置了不支持多模态的模型(比如glm 5.2)到各种工具中,但是我们又想让自己的开发工具有视觉识别功能的时候,可以用这个mcp来实现工具的识图功能。

我后面对这个MCP进行了npm的推送和发布,现在各位佬可以不用拷贝代码到本地自己配置了,可以直接用nmp配置

具体可以参考

GitHub - goehou/Visual-Enhancement-mcp: MCP stdio server for image recognition via an existng vision model 一个可以增强claude code/codex/opencode识图能力的MCP · GitHub readme中的你用的各种AI工具的配置方法

拿cc举例一下 可以直接写入mcp,参考下面的格式

{

“mcpServers”: {

“mcp-vision-server”: {

“command”: “npx”,

“args”: [

“-y”,

“mcp-vision-server”,

“–api-base-url”, “https://your-api.example.com”,

“–api-path”, “/v1/chat/completions”,

“–api-key”, “sk-xxxx”,

“–model”, “your-vision-model”,

“–timeout-ms”, “60000”,

“–max-tokens”, “4096”

]

}

}

}

在新的版本中0.1.3增加了maxtoken的参数设置,可在配置中直接传参数,如果不传就默认是4096。

这里感谢 @huan ^-^ ^-^

huan佬的深度使用和指导后,给我一个npm发包的指引以及后续提出的issue来完善项目。感谢佬的指导 ^-^

然后多模态识图模型可以选择(自己用的一些,可能不全 佬们可以自己配置看看什么模型更强) Qwen3.5-397B |
MiniMax-M3
| kimi k2.7 | grok 4.3等等

最新回复 (1)
  • 焕昭君 06-20 23:51
    1

    挺好用的一个MCP工具的



    拿 cc 举例一下 可以直接写入 mcp, 参考下面的格式



    这个其实可以用md代码块语法,代码围栏包裹起来的。



    深度使用



    这里有一份我基于你这MCP在实战使用的一段提示词规则,可参考:


    - 所有图片输入 → 自动调用 vision MCP(analyze 有理解能力 / ocr 只提取文字),分析用户意图后自行决定 prompt 中是否补充上下文:纯识图/独立描述无需上下文;如涉及代码还原、调试、对比、定向提取、设计修改时必须携带相关工程背景。

    这下agent就很会用这工具了,而且还会自主决策判断是否要加上下文补充,并且也举例了一些常见场景。

    这也就是为什么我说能遇到maxtoken的这个bug问题出现,因为agent真的有在给加长一段的上下文输入

* 帖子来源Linux.do
返回