当前多模态模型哪个比较好

Llliao 2026-09-03 23:00 1

平时做点 Electron 和 Tauri 轻量应用,主力是 Zcode 加 glm5.3,然后想要个多模态模型辅助,用来给主模型当审美参考 辅助打磨 UI 界面和开发网页这些,现在用的 mimo2.5 当视觉辅助,但是和 glm5.3 配合起来老是有些 bug,看了下主要是 mimo 对界面的识别没有那么精准导致 glm5.3 会用其他方法校准浪费时间和 token,现在在考虑哈基米和豆包,想问问佬友们有什么推荐

最新回复 (9)
  • Linus Torvalds 09-03 23:01
    1

    glm-5.3-flash就是多模态


    cc/gpt都支持,kimi-k3、deepseek-v4-flash-vision-exp、qwen


    gemini速度快

  • 讲呢啲 09-03 23:04
    2

    meta的muse spark也挺快的,opencode里有。

  • Llliao 楼主 09-03 23:04
    3

    这个我也试过,调低思考强度之后还是会雷霆大思考,通过子代理派出去识图经常要等很久

  • Linus Torvalds 09-03 23:05
    4

    辅助打磨 UI 界面和开发网页



    那就选gemini呗,海鲜市场才几块钱一年,不稳就是咯

  • Llliao 楼主 09-03 23:08
    5

    佬 识别的精准度怎么样,因为 Zcode 有时候看做的 UI 好不好是通过控制电脑截图然后发给辅助模型识别的,有时候还会点击应用按钮切换页面截图识别多个 UI 有没有出错,点击位置判断和判断 UI 有没有问题全靠辅助模型,如果辅助模型给出的结论有问题就会误导主模型

  • 讲呢啲 09-03 23:19
    6

    单从识图来看,我觉得muse spark 1.3跟5.6-luna效果差不多,我之前用来做过图片分析标记,就是opencode go有并发限制,不能高频调用。

  • Llliao 楼主 09-03 23:26
    7

    好 谢谢佬 我再研究研究 因为还有点审美要求和偶尔生图做素材的需求 看下来是哈基米和火山两家的套餐可以满足

  • weq 09-03 23:43
    8

    还犹豫什么?你只有哈基米能选了啊,多模态这一块就哈基米和豆包,但你的需求还需要审美参考辅助UI打磨还有开发网页这些肯定需要个前端强的AI啊,那不就只有哈基米了

  • Llliao 楼主 09-03 23:51
    9

    开发是 glm5.3,视觉模型主要作用是给出精准的图片描述和审美的参考,不参与开发代码的,因为我的 Hermes 的视觉辅助模型之前一直用的 seed2.0pro,感觉不差,不考虑代码开发的情况下,现在主要是看哈基米领先豆包最新的旗舰多不多,,火山有 API 可以稳定调用 包括语音识别转录这些模型,哈基米如果不是领先豆包特别多的话那火山的综合下来应该会更好一点

* 帖子来源Linux.do
返回