想做一个中转站评测网站,佬友们最想看到哪些数据?

sherard 2026-08-26 19:50 1

大家好,我们最近在考虑做一个面向 AI 中转站的模型对比和评测网站。


现在市面上的中转站越来越多,各家的线路、价格、倍率和使用规则也不太一样。很多信息只看宣传页面很难判断,往往要实际充值、连续使用一段时间后,才能知道高峰期稳不稳定、响应速度怎么样、扣费是否清楚。


所以我们想尝试做一个相对公开、持续更新的评测网站,让大家在选择和充值之前,能先看到一些真实的测试数据,也能对比不同模型在真实使用场景下的输出效果。


目前初步想到的评测方向包括:



  • 稳定性:请求成功率、超时率、429/5xx 错误率、高峰期表现

  • 响应速度:首 Token 延迟、完整响应时间、输出速度

  • 价格与扣费:公开价格、实际扣费、Token 统计是否一致

  • 功能表现:上下文长度、缓存、流式输出、工具调用、多模态等

  • 能力一致性:同一模型在不同时段的表现是否存在明显波动,以及是否存在掺水情况

  • 兼容性:Claude Code、Codex、Cherry Studio、CC Switch 等工具的接入体验

  • 服务体验:文档完整度、故障公告、客服响应和退款规则

  • 用户反馈:真实使用评价、常见问题和踩坑记录


不过这些暂时都只是我们的初步想法。与其闭门造车,我们更想先听听真正使用中转站的佬友们怎么说:



  1. 选择中转站时,你最看重哪三项指标?

  2. 有哪些数据是你希望评测网站长期自动监测的?

  3. 你曾经踩过哪些坑,希望评测网站能提前发现?

  4. 你更想看综合排名,还是稳定性、速度、价格等分类排行?

  5. 第一批希望评测哪些站点、模型或线路?

  6. 除了评测之外,你还希望网站提供什么功能?


可以直接自由回复,也可以参考下面的格式:


最关注的指标:


踩过的坑:


其他建议:


另外,这个网站如果由 TrueSOTA 发起,大家可能会担心“既当选手又当裁判”,这个问题我们也提前考虑到了。


如果项目落地,TrueSOTA 自己也会放进同一套规则里接受测试。我们希望尽量采用自动化监测,公开测试方法、测试时间和原始数据,避免由我们主观打分;被测站点如需对异常数据进行说明,相关记录也会公开保留。


这次主要想向佬友们收集需求:你最关心什么、踩过什么坑,都欢迎直接说。我们会整理评论区的高频建议,作为第一版评测方案的参考。

最新回复 (16)
  • BenSu 08-26 19:54
    1

    最关注的指标:模型是否掺水


    踩过的坑:fable5 做出来一个白底白字网页你敢信?一查果然…水的一塌糊涂!

  • yyz82 08-26 19:57
    2

    定时检测掺水率,为什么不爱用中转就是因为太多中转掺水了,比如sol掺luna,见证过无数了

    其次就是价格 ,太贵的不用(没明显优势为什么要用你的)

    还有缓存率,一些中转站的模型倍率明面上低,但缓存率低的离谱,最终的实际费用消耗会非常高

  • neoily 08-26 20:02
    3

    佬 我比较在意速率,吐字太慢的中转站直接ps了,比较要上班的,上班不可能慢慢等着,那就被开了。。。。。

  • coldtearsyy 08-26 20:05
    4

    有的站专门开一个分组交到测评网站检测 如何避免

  • Enze 08-26 20:05
    5

    我发起过相关的讨论: 如果没有一个可信的第三方持续对中转站进行审计和监测,那中转站就永远无法在争议中证明自己


    先解决这个第三方的信任问题,再考虑测评哪些数据





    感觉评测还是得是 non-profit org,甚至数据也要是去中心化的,不然造假很容易,无论是评测方还是中转站



    @ylxmf2005


    这是个游走在法律边缘的行业,所以此处的信任应该和其它的代价挂钩,我建议邀请一些自身的长期声誉可能比短期的商业利益更重要的人来作为第一批成员,例如一些中文社区站长如本站的、隔壁的,例如一些科技类网红。


    解决了这个第三方的信任问题后,怎么测评怎么对抗都变得简单纯粹了,否则测再多都是不可信的。

  • Ricardo. 08-26 20:06
    6

    佬咱们的想法不谋而合了,我比较在意缓存率,所以做了一个缓存率的对比网站。可以在选用中转站之前根据模型/分组倍率和缓存率计算实际倍率来判断哪一家中转站比较实惠。


    【公益推广】缓存成本计算器—一眼看出实际倍率

  • ylxmf 08-26 20:12
    7

    支持,感觉评测还是得是 non-profit org,甚至数据也要是去中心化的,不然造假很容易,无论是评测方还是中转站

  • 林克 08-26 20:14
    8

    1. 模型是否被替换,账号是否被标记(风控)导致降智

    2. 稳定性,是混池还是pro20x池,这对用户成本(缓存率)影响很大

    3. 耗时,首字要求不高,3-5秒都能接受,但总耗时要达标

    4. 倍率0.2 0.3其实都还好,只要缓存率+延时上来了,都能接受

  • heymeow 08-26 20:15
    9

    降智,掺水,首字,缓存,x小时可用率,是否注入系统提示词之类的


    掺水/降智方面如果做持续检测建议挂一个openrouter的key作为对照组,我可以提供技术支持

  • CIack 08-26 20:21
    10

    模型有没有掺水,主要就看这个了吧

  • dataflow 08-26 20:21
    11

    支持這個想法,無論怎麼評測,沒有信用就沒有閱讀的價值

  • soul0932 08-26 20:22
    12

    1 模型有没有掺水,比如luna冒充sol

    2 首字延迟,token速度

    3 真实缓存率

    4 最后就是价格了,前三点做到的情况下,明码标价,价高价低都可以,让消费者自己选

  • 佛克斯 08-26 20:23
    13

    1. 我们如何信任你?

    2. 你们如何避免特调KEY

  • 111zaka 08-26 20:24
    14

    主要想看模型智商对不对,能不能做对糖果测试题

  • heymeow 08-26 20:25
    15

    信任问题的解决我有一个提议 随时允许第三方复核,例如提供原检测器链接,第三方检测网站,降智题目帖子出处,然后声明好多久做一次检测,在检测后的多少分钟内如果测出问题随时可对峙,如何留存完整证据之类的

  • TeainfrostOUO 08-26 20:27
    16

    兼容性能不能加个rikkahub?好多中转反代出来的格式都用不了

* 帖子来源Linux.do
返回