我用一个 skill 把视觉活外包了(模型看不了图) - 子舒的博客

神奇的哆啦z梦 2026-08-10 16:34 1


主力模型不支持多模态?不换模型也能识图——我把图片外包给了多模态 API,一个 skill 搞定。



我目前使用的 AI 工具是 Zcode,然后搭配 Opencode Go 套餐里面的 deepseek-v4-flash 模型。性价比很高,速度和模型能力都非常棒,所以被我当成主力模型。


但是它存在一个巨大的问题就是不支持多模态,官网目前好像是支持视觉识别了,但是我是调用了 api 在第三方客户端。而我恰好非常需要这个场景,所以我就想了一个办法,如果能在不更改当前会话模型的情况下,进行图片识别,那就很完美。


首先我想到了利用 skills,调用多模态模型工具去识别图片,把识别到的结果返回给当前会话模型。


这个思路听着简单,但一开始我也有点拿不准:skill 这东西,说白了就是给模型的一份 Markdown 说明书,它本身不会"跑在别的模型上"。真正干活的是当前模型——它照着说明书,用自己手头的工具(比如跑个 Python 脚本)去调外部 API。


也就是说,关键不是 skill 本身多厉害,而是它能不能把"调用外部多模态模型"这件事,变成当前模型随手就能做的动作。


于是整个流程就成了这样:



  1. 使用者发给客户端一张图,但当前模型没眼睛,图片直接被省略,只留下一个文件路径

  2. 模型发现自己看不了图,翻开这份说明书:哦,要先跑一下 analyze_image.py

  3. 脚本把图片 base64 编码,POST 给多模态模型(我用的是 DashScope 的 qwen3.7-plus,走 Anthropic 兼容接口)

  4. 多模态模型看完图,返回一段文字描述

  5. 当前模型拿着这段文字,继续帮使用者干活


整个链路对使用者来说来说是无感的,图还是那张图,任务还是那个任务,中间只是多了一个"帮我看了看"的环节。


代码上其实就两个文件:一个 SKILL.md 负责告诉模型"什么时候该用、怎么用",一个 analyze_image.py 负责真正调 API。配置放在 config.json 里,填上 API key 就行。


而且兼容了不同 API 格式,不管是 OpenAI 格式还是 Anthropic 都可以兼容,参考下面的说明文档即可。


具体代码我也已经开源出来了,下载到你的AI Agent目录下即可,README 中也有详细说明,如果有类似的需求可以试试看。


我目前搭配的是阿里百炼的 qwen3.7-plus,效果非常不错。


Github: https://github.com/anghunk/image-analysis-fallback


可以手动下载,也可以通过指令下载


git clone https://github.com/anghunk/image-analysis-fallback.git ~/.zcode/skills/image-analysis-fallback




这是一个从 https://zishu.me/blog/skills-image-analysis-fallback.html 下的原始话题分离的讨论话题
最新回复 (11)
  • 西瓜炸了 08-10 16:40
    1

    咦…这就是去试试,我看看怎么个事

  • 尺素失续 08-10 17:18
    3

    本质上是让另一个模型把图片解释成文字教给主模型

  • U8仰望 08-10 17:56
    4

    新建文件夹之前,先到站里搜一下,说不定能节约很多时间和token呢

  • 杨沉香 08-10 18:49
    5

    可以用opencode go 的 mimo-v2.5 来当视觉模型 也很便宜大碗

  • 神奇的哆啦z梦 楼主 08-11 10:19
    6

    哈哈,这个工具也是让AI五分钟写的,文章倒是花了我半个小时遣词造句

  • 神奇的哆啦z梦 楼主 08-11 10:19
    7

    只做图片分析用量还是很小的,所有直接用效果比较好的了

  • yangshan 08-11 10:51
    8

    能用来pdf转latex吗,

    没用过qwen,有没有免费薅的途径

  • david 08-13 14:15
    9

    大佬,这个思路还是不错的,就是不知道截图转代码效果会怎么样

  • taikong 08-14 13:43
    10

    确实 mimo-v2.5 是优解

  • su 08-14 17:46
    11

    佬,这个是本地版本的,如果有一个newapi的网关怎么处理呢?我看有些中转站,deepseek-v4,glm-5.2也支持图片识别,不知道是什么原理

  • EthanYe 08-20 12:18
    12

    我记得git上有个claude image视觉插件,然后你去买个qwen最便宜的,有100万token模型,一张图大概几百token,随便用。用不完的。

* 帖子来源Linux.do
返回