Ollma Cloud 也上glm-5.3-flash了,量给的还可以。

LLMcoder 2026-08-27 13:59 1

ollama cloud今天上的glm-5.3-flash, 测试了一下,速度没问题,用量还可以,默认思考强度的时候5h用量能到2000次请求, 后来开了max强度之后,5h也能到1300次请求。 我的平均上下文长度在60k左右。但是统计用量的时候发现ollama cloud可能是不带cache的,所以每次提交上下文长度要控制住,这是提升ollama用量的关键。



最新回复 (7)
  • glovey 08-27 14:13
    1

    佬,glm 5.3 flash 实际效果咋样呀?和dp v4 flash相比呢?

  • derekamz 08-27 14:14
    2

    ollama只是不返回cache信息,还是有cache的。他家的计费模式的问题。

  • Sam Altman 08-27 14:16
    3

    他家要是没缓存我测下来一周能跑出几百刀了,我才不信 Ollama 有这么良心

  • LLMcoder 楼主 08-27 14:18
    4

    5.3 flash就是前面1周ox alpha, 比glm5.2好用,更不用说dsf了

  • LLMcoder 楼主 08-27 14:21
    5

    首token就是稍慢呗,合作方机房可能是自己家的?不开缓存也是之前国内阿里coding plan的打法,能省不少显存,也许是算的这个账

  • leonvxe 08-27 14:29
    6

    求教如何开通的 pro, 搜了一下好像说需要开个招商visa

  • LLMcoder 楼主 08-27 14:32
    7

    是要找个卡来订阅,不好找就海鲜市场看看,有代充吧

* 帖子来源Linux.do
返回