给你的deepseek装上看图的眼睛

walker93 2026-08-06 16:13 1

背景


deepseek v4 flash正式版出来以后,开了opencode go,使用起来很不错,量大管饱。但是问题也逐渐出现了:1.不支持传入图片;2.有时候执行过程中会自己抓截图,这时候任务就会中断,很耽误事情。这时候我尝试过用mimo v2.5,但是效果确实不太好。正好今天看到有人介绍可以两个模型组合来做,那我就在考虑能不能组合一下mimo v2.5和deepseek v4 flash,正好都在套餐里面,也都是量大管饱的模型。


初次尝试


刚开始想写skill,测试也可以,但是在实际使用时,还没来得及调用skill,任务就已经报错结束了,单纯的skill不行


最终成果


后面跟AI一顿交流,通过本地代理的方式实现了,实现效果如下:


使用方法


下载下面的文件


识图skill - 副本.zip (34.6 KB)


前提




  • 本地安装有python




  • 配置config,在config/config.json里面配置api_key,默认我配置了opencode的路径,你也可以配置其他支持OpenAI compatible模式的站点




双击启动start_proxy.bat


也可以配置成开机启动


修改deepseek的baseurl


我使用的是cursor++,把baseurl换成start_proxy.bat启动后提醒你修改的地址




结语


这其实对于任何非多模态的都可以用,相当于做了个多模态兜底

最新回复 (9)
  • d_benson 08-06 16:14
    1

    为什么ds一直不支持多模态,我觉得多模态很好用啊

  • GGMouseKing 08-06 16:15
    2

    记得前两天在站里刷到一个CPA插件,直接在网关路由相关请求

  • wade 08-06 16:22
    3

    直接做成一个mcp不就行了吗?有多模态需求就调用mcp

  • Windsland 08-06 16:25
    4

    据说不是主线,会做,但是不会把重心放在这里

  • zczy999 08-06 16:27
    5

    算力不足啊 之前不是融资内容泄漏了 说是融来的钱大部分都要买英伟达的卡

  • sakura0v0 08-06 16:28
    6

    佬友你用的这个是啥agent啊 看着界面好干净清爽啊

  • walker93 楼主 08-06 16:31
    7

    这样应该会跟skill出现一样的问题,当模型遇到图片,还没调用到mcp的时候,就已经报错结束了,不会给你机会再去调用MCP

  • SafariBest 08-06 17:44
    8

    还是建议 直接使用多模态的模型,外接其他可以识图的模型其实相当于 一个瘸子给瞎子指路,传话的时候容易出现理解偏差

  • pineapple 08-06 17:45
    9

    opencodego 不是有gpt-5.6-luna,多模态模型,价格也便宜

* 帖子来源Linux.do
返回