使用 deepseek,外接视觉模型有什么好的便宜的方案推荐

foryou2023 2026-08-07 16:21 1

deepseek 不是多模态,在实际的使用中写 UI 确实差点意思,感觉好麻烦,特别是调 UI 的时候,感觉不好沟通。


目前实践制作 UI 的流程是让 deepseek 绘制 ascii UI 布局,确定布局之后,就整理提示词使用 gemini 的


stitch 制作原型图,原型图确定了再回到 deepseek 里面制作界面。


实际的过程中就会遇到一些小问题,比如网站 一下 UI 细节或者按钮的大小不一致,deepseek 无法看到,文字


描述的话,deepseek 没有办法一次性搞定。


所以想求一个比较好的使用方案能解决 deepseek 做 UI 视觉上面碰到的问题。

最新回复 (6)
  • smy14520 08-07 16:26
    1
    claude code 中使用 智谱的视觉 mcp 多模模型可以自己选一个也可以用 智谱自己的 4.6v
  • foryou2023 楼主 08-07 16:29
    2
    @smy14520 感谢,我去试试
  • yinyu 08-07 16:29
    3
    我自己做了个 OCR 的脚本其实就是调用视觉模型,我可以分享下经验,我试过百炼的 qwen3.6-flash 但是不够 flash ,中大的一张图就得花十秒左右。我让 codex 写脚本测试了 groq/cerabras/google 提供的视觉模型,最终发现同样的图,最快并且准确的最高(因为我是识别理财平台的持仓之类的一些信息,准确度很重要)的是
    ~/.hammerspoon master* ❯ cat remote_ocr.lua|grep gemini
    M.model = "gemini-3.5-flash-lite"
    ~/.hammerspoon master* ❯


    如果你对数字不敏感,其实 groq 和 cerebras 的视觉模型能够更快,描述一个布局什么的,小意思。

    但是其实。你也可以让 Agent 通过 MCP 直接链接浏览器,这样就可以更具体的知道真实效果。
  • l84 08-07 16:43
    4
    sensenova
  • CykaBlyat 08-07 16:46
    5
    我是调用了火山的豆包识图
  • foryou2023 楼主 08-07 17:06
    6
    @yinyu
    @l84
    @CykaBlyat 感谢回复
* 帖子来源V2EX
返回