本帖使用社区开源推广,符合推广要求。我申明并遵循社区要求的以下内容:
- 我的帖子已经打上 开源推广 标签: 是
- 我的开源项目完整开源,无未开源部分: 是
- 我的开源项目已链接认可 LINUX DO 社区: 是
- 我帖子内的项目介绍,AI生成、润色内容部分已截图发出: 是
- 以上选择我承诺是永久有效的,接受社区和佬友监督: 是
以下为项目介绍正文内容,AI生成、润色内容已使用截图方式发出
大家在用入Claude Code时,如果接入DeepSeek等文本大模型无法视觉理解,使用原生 Claude大模型也不支持图片生成。
闲来无事,做了个Hello-Multimodal SKILL解决了这个问题:给没有 vision 的模型补上视觉理解,给 Claude Code 补上生图能力。
两大能力
主要特点
1. 视觉理解
你:"请分析这张截图的 UI 布局"
Claude Code 发现当前模型没有 vision → 自动调 Hello-Multimodal 技能 → GPT-5.4 看图 → 返回结果
全程你没有切换模型,也没有报错。
2. 生图能力
- 支持参考图编辑 —— 支持传入参考图编辑
- 支持语义画幅分析 —— 跟据语义分析编辑、生图
- 支持以图生图 —— 这个没啥介绍的,都懂
- 支持单图/多图生成 —— 串行多图生成,每张独立 timeout
- 自适应超时 —— 按输出分辨率自动缩放(220s~600s)
- 4K 分辨率 ——
--max-resolution 4k(需要渠道支持)
- 长 prompt 支持 ——
--prompt-file 从文件读取,或 --prompt - 从 stdin 管道传入,避免 CLI 转义问题
3. 智能路由
如果使用了本地路由把 DeepSeek 映射成 claude-opus模型,Claude Code 看到模型名以为有 vision,实际没有依然会无法识图。
Hello-Multimodal 技能不认模型名,只认实际能力。发请求 → 失败 → 自动降级。无论本地路由代理怎么映射都不影响。
4. 多渠道优先级 Fallback
最多可以配置 3 个渠道,按渠道升序尝试:
渠道1 (priority=1) 失败 → 渠道2 (priority=2) 失败 → 渠道3 (priority=3)
每个渠道内有独立的 retry_count 重试,视觉和生图可以分别开关(vision: true/false,generate: true/false),API key 也可以独立配置(image_api_key 与 api_key 分离)。
5. 更多功能
--thinking low/medium/high:推理预算,复杂合成/精确标签/图表场景提升质量
--seed 42:半确定性输出,可复现结果
- 结构化JSON输出:每次生成返回完整 attempt trace,机器可读,方便调试和链式调用
- 跨请求冷却:防止限流雪崩,可配置 cooldown 间隔
- 永久性错误快速失败:400/401/402/403 等立即停止,不浪费重试次数和 token
--dry-run:不实际请求,预览配置和参数,用于调试
如何配置
把仓库里的 config.example.json 改名为 config.json,填入 API 信息:
{
"channels": [
{
"name": "GPT 渠道",
"base_url": "https://xxx.com",
"api_key": "sk-xxx",
"model": "gpt-5.4",
"image_model": "gpt-image-2",
"image_api_key": "sk-img-yyy",
"vision": true,
"generate": true,
"priority": 1
}
],
"defaults": {
"max_tokens": 4096,
"timeout_seconds": 300,
"retry_count": 2
}
}
vision: true = 此渠道可用于视觉理解
generate: true = 此渠道可用于图片生成
priority 越小越优先
image_api_key / image_base_url 可选,不填则复用主 key 和 base_url
支持最多 3 个渠道按优先级 fallback。生图可以单独配置 api_key 和 base_url,适配独立计费分组。
安装方法
建议把仓库地址扔给AI,让AI帮你安装技能。
https://github.com/hellowind777/hello-multimodal
配置完成后正常使用 Claude Code,视觉和生图任务会自动路由。
如何使用
安装好本技能后,并配置好对应的gpt模型API信息,然后新开claude code窗口直接使用自然语言对话就可以识别图片和生成图片。
声明:本技能由AI生成且公开开源,不含有任何盗取API的代码和功能,如果使用后导致API被盗与本技能无关。请自行斟酌。
使用效果图如下:



我的其他项目分享
1、hello2cc —— 一个让第三方AI大模型在Claude Code下拥有“原生”使用体验的插件
2、HelloAGENTS — 一个可以纠正GPT黑话,全自动维护知识库/任务分层/质量约束/恢复/12命令/14技能,不仅仅是能干活的工作流
3、更多项目开发中……