Hello-Multimodal —— 一个让第三方AI大模型在Claude Code下拥有“看图”、“生图”能力的“多模态”SKILL

七滴眼泪 2026-06-12 13:14 1

本帖使用社区开源推广,符合推广要求。我申明并遵循社区要求的以下内容:



  • 我的帖子已经打上 开源推广 标签:

  • 我的开源项目完整开源,无未开源部分:

  • 我的开源项目已链接认可 LINUX DO 社区:

  • 我帖子内的项目介绍,AI生成、润色内容部分已截图发出:

  • 以上选择我承诺是永久有效的,接受社区和佬友监督:


以下为项目介绍正文内容,AI生成、润色内容已使用截图方式发出




大家在用入Claude Code时,如果接入DeepSeek等文本大模型无法视觉理解,使用原生 Claude大模型也不支持图片生成。


闲来无事,做了个Hello-Multimodal SKILL解决了这个问题:给没有 vision 的模型补上视觉理解,给 Claude Code 补上生图能力。




两大能力




  • 视觉理解 —— 主模型不支持图片时自动接管,分析截图、流程图、文档配图、嵌入图片。支持单图和批量目录扫描。




  • 图片生成 —— Claude Code 本身没有生图能力,所有生图需求自动路由到配置的 GPT 多模态模型(如 gpt-image-2)。






主要特点


1. 视觉理解


 你:"请分析这张截图的 UI 布局"
Claude Code 发现当前模型没有 vision → 自动调 Hello-Multimodal 技能 → GPT-5.4 看图 → 返回结果
全程你没有切换模型,也没有报错。


2. 生图能力



  • 支持参考图编辑 —— 支持传入参考图编辑

  • 支持语义画幅分析 —— 跟据语义分析编辑、生图

  • 支持以图生图 —— 这个没啥介绍的,都懂

  • 支持单图/多图生成 —— 串行多图生成,每张独立 timeout

  • 自适应超时 —— 按输出分辨率自动缩放(220s~600s)

  • 4K 分辨率 —— --max-resolution 4k(需要渠道支持)

  • 长 prompt 支持 —— --prompt-file 从文件读取,或 --prompt - 从 stdin 管道传入,避免 CLI 转义问题


3. 智能路由


如果使用了本地路由把 DeepSeek 映射成 claude-opus模型,Claude Code 看到模型名以为有 vision,实际没有依然会无法识图。


Hello-Multimodal 技能不认模型名,只认实际能力。发请求 → 失败 → 自动降级。无论本地路由代理怎么映射都不影响。


4. 多渠道优先级 Fallback


最多可以配置 3 个渠道,按渠道升序尝试:


 渠道1 (priority=1) 失败 → 渠道2 (priority=2) 失败 → 渠道3 (priority=3)

每个渠道内有独立的 retry_count 重试,视觉和生图可以分别开关(vision: true/falsegenerate: true/false),API key 也可以独立配置(image_api_keyapi_key 分离)。


5. 更多功能



  • --thinking low/medium/high:推理预算,复杂合成/精确标签/图表场景提升质量

  • --seed 42:半确定性输出,可复现结果

  • 结构化JSON输出:每次生成返回完整 attempt trace,机器可读,方便调试和链式调用

  • 跨请求冷却:防止限流雪崩,可配置 cooldown 间隔

  • 永久性错误快速失败:400/401/402/403 等立即停止,不浪费重试次数和 token

  • --dry-run:不实际请求,预览配置和参数,用于调试




如何配置


把仓库里的 config.example.json 改名为 config.json,填入 API 信息:


 {
"channels": [
{
"name": "GPT 渠道",
"base_url": "https://xxx.com",
"api_key": "sk-xxx",
"model": "gpt-5.4",
"image_model": "gpt-image-2",
"image_api_key": "sk-img-yyy",
"vision": true,
"generate": true,
"priority": 1
}
],
"defaults": {
"max_tokens": 4096,
"timeout_seconds": 300,
"retry_count": 2
}
}



  • vision: true = 此渠道可用于视觉理解




  • generate: true = 此渠道可用于图片生成




  • priority 越小越优先




  • image_api_key / image_base_url 可选,不填则复用主 key 和 base_url




支持最多 3 个渠道按优先级 fallback。生图可以单独配置 api_key 和 base_url,适配独立计费分组。




安装方法


建议把仓库地址扔给AI,让AI帮你安装技能。


https://github.com/hellowind777/hello-multimodal


配置完成后正常使用 Claude Code,视觉和生图任务会自动路由。


如何使用


安装好本技能后,并配置好对应的gpt模型API信息,然后新开claude code窗口直接使用自然语言对话就可以识别图片和生成图片。




声明:本技能由AI生成且公开开源,不含有任何盗取API的代码和功能,如果使用后导致API被盗与本技能无关。请自行斟酌。




使用效果图如下:






我的其他项目分享


1、hello2cc —— 一个让第三方AI大模型在Claude Code下拥有“原生”使用体验的插件

2、HelloAGENTS — 一个可以纠正GPT黑话,全自动维护知识库/任务分层/质量约束/恢复/12命令/14技能,不仅仅是能干活的工作流

3、更多项目开发中……

最新回复 (3)
  • floralsei 06-12 22:33
    2

    大佬更新了,速度来抢占第一,躺这了 ^-^

  • makemake 06-13 17:49
    3

    大佬的这个skill思路很值得参考

  • 哈总 06-13 22:00
    4

    这个思路是挺好的, 在目前glm编码强,没有识图生图能力非常实用。


    我觉得更通用点就是多LLM混合, 比如gemini前端挺好, gpt后端好,也可以混合着用, 用各个llm的长处。

* 帖子来源Linux.do
返回