本帖使用社区开源推广,符合推广要求。我申明并遵循社区要求的以下内容:
- 我的帖子已经打上 开源推广 标签: 是
- 我的开源项目完整开源,无未开源部分: 是
- 我的开源项目已链接认可 LINUX DO 社区: 是
- 我帖子内的项目介绍,AI 生成、润色内容部分已截图发出: 是
- 以上选择我承诺是永久有效的,接受社区和佬友监督: 是
以下为项目介绍正文内容,AI 生成、润色内容已使用截图方式发出
接上篇帖子[开源]Visual-Enhancement-mcp,一个增强cc cx识图能力的mcp
需求场景是,如果我们配置了不支持多模态的模型(比如glm 5.2)到各种工具中,但是我们又想让自己的开发工具有视觉识别功能的时候,可以用这个mcp来实现工具的识图功能。
我后面对这个MCP进行了npm的推送和发布,现在各位佬可以不用拷贝代码到本地自己配置了,可以直接用nmp配置
具体可以参考
GitHub - goehou/Visual-Enhancement-mcp: MCP stdio server for image recognition via an existng vision model 一个可以增强claude code/codex/opencode识图能力的MCP · GitHub readme中的你用的各种AI工具的配置方法
拿cc举例一下 可以直接写入mcp,参考下面的格式
{
“mcpServers”: {
“mcp-vision-server”: {
“command”: “npx”,
“args”: [
“-y”,
“mcp-vision-server”,
“–api-base-url”, “https://your-api.example.com”,
“–api-path”, “/v1/chat/completions”,
“–api-key”, “sk-xxxx”,
“–model”, “your-vision-model”,
“–timeout-ms”, “60000”,
“–max-tokens”, “4096”
]
}
}
}
在新的版本中0.1.3增加了maxtoken的参数设置,可在配置中直接传参数,如果不传就默认是4096。
这里感谢 @huan ^-^ ^-^
huan佬的深度使用和指导后,给我一个npm发包的指引以及后续提出的issue来完善项目。感谢佬的指导 ^-^
然后多模态识图模型可以选择(自己用的一些,可能不全 佬们可以自己配置看看什么模型更强) Qwen3.5-397B |
MiniMax-M3 | kimi k2.7 | grok 4.3等等