在线体验 16K token/s 的新大模型部署架构

netox 2026-08-07 09:46 1

在 HN 上看到 AMD 收购那家把模型权重烧到芯片里的 taalas 的消息, 考虑到 gpt 5.6 相比 gpt 5.5 实际体验并没有多在的改进, 感觉或许把权重烧到芯片里, 没准是条路子

帖子里有他们的模型架构体验接口, 自己试了下, 16k token/s, 不敢想象要是有 gpt5.5 这样的模型这么快, 体验得多么好了


https://chatjimmy.ai/
最新回复 (29)
  • cowcomic 08-07 10:03
    1
    我印象他们家好像都是做小模型的,之前都是 10B 以内的
    最近好像放话要做 qwen3.6-27b 的,不知道进展如何
  • netox 楼主 08-07 10:27
    2
    @cowcomic HN 上原贴说下一代芯片正在做, 估计模型可能也会他们自己训练或者跟 AMD 一起搞, 利用 AMD 自己的技术(我记得 2022 年 AMD 还收购了 PENSANDO 这家做 DPU 的公司), 这样的话估计搞集群肯定就不只 27B 了
  • SmiteChow 08-07 10:30
    3
    不可能的,一天一个模型可以,一天一个芯片?
  • dreamdragon 08-07 10:34
    4
    有正常逻辑想不到的使用场景吗,这个确实很反常
  • netox 楼主 08-07 10:40
    5
    @SmiteChow 为什么会一天一个模型? 如果有个高速 gpt 5.5 级别的模型, 感觉还行? 而且它技术上可以把权重换掉, 只不过相对麻烦
  • ddoki 08-07 10:51
    6
    @dreamdragon 智能客服场景,小模型加高速输出。那可以承担的并发就很客观,降本肯定能做到
  • litian98 08-07 11:25
    7
    这个模型确实快,但是智能太差了,基本感觉用不了的样子,最简单的那些常识性问题能回答得差不多,但是稍微复杂一点点的问题就不行了
  • javalaw2010 08-07 11:32
    8
    我: “你好”
    AI: “很好”

    ————————————

    虽然目前体验智能不佳,但是等大模型发展到一定阶段,确实是一个很好的方向
  • NoDataNoBB 08-07 11:42
    9
    确实是个好主意
  • ayyll 08-07 11:56
    10
    @litian98 还行?我让它写个快排 Generated in 0.036s
  • june4 08-07 12:19
    11
    @SmiteChow 象 ds v4 flash 这种的,已经过了那个可用门槛,只要够快和便宜,哪怕落后点又怎么,毕竟不是什么任务都要顶级模型才能完成
  • nightlight9 08-07 13:49
    12
    确实非常快,但是有点蠢
  • est 08-07 13:56
    13
    @SmiteChow @litian98 @dreamdragon

    我觉得这个模型最适合的场景是 自动驾驶决策。

    https://blog.est.im/2026/stderr-11
  • BingoXuan 08-07 14:00
    14
    @cowcomic
    deepseek 激活也是 13B 。这时候就是 xilinx 出马了,通过 pcie 重新烧录权重数据。那样 n 张互联就能跑 deepseek v4 flash 0731 了。主要问题是如何把权重数据变成可烧录。
  • cowcomic 08-07 14:05
    15
    @netox
    @BingoXuan
    芯片群的方式感觉效率损失会很严重,之前看到的都还是单芯片的策略
  • fnd 08-07 14:06
    16
    快是真快,但是错误也有点离谱,胡说八道。
  • holystrike 08-07 14:13
    17
    “详细列出任天堂自创办以来发布的所有游戏”

    :很难!由于有超过 3000 多款游戏发布,以下是近似完整的游戏列表:
    xxxx
    yyyy
    zzzz

    Generated in 0.119s • 14,024 tok/s

    完全来不及反应一次出完。滚轮拨了好几圈到顶部看结果。

    “不要只说难,要全部列出来”

    (没了)
  • Raw778 08-07 14:27
    18
    快是真的快,蠢也是真的蠢,全是胡说八道。
  • WayneCmd 08-07 14:28
    19
    我要来经典一下了:

    不过如果未来能够完全实现的话,时间的维度就可以像是被压缩的无法感知了,自动驾驶,预测未来
  • timethinker 08-07 15:27
    20
    我想到了《 2001 太空漫游》里面的 HAL9000 被戴夫鲍曼一张一张的拔下了存储卡的画面。
  • netox 楼主 08-07 15:50
    21
    @cowcomic 总感觉估计跟推理集群类似, 高速网络互联, 就跟 Nvidia 之前收购 mellanox 类似, 感觉 amd 会不会觉得是 GPU 这条路无法超越她亲戚了, 找条别的路子来搞, 万一成了呢
  • PerFectTime 08-07 16:28
    22
    token 快又没啥用,不准生成的再多也是辣鸡
  • yinyu 08-07 16:39
    23
    You
    你是什么模型,1000 字介绍下。

    Chat Jimmy
    Jimmy
    我想提供一个全面而且有趣的 1000 字介绍。


    首先,我是基于人工智能的语言模型,能够理解自然语言和生成人类语言的文本。我的主要功能是回答问题、生成文本内容、并且可以进行人工智能相关任务。

    🔥✨✨✨✨✨✨
    Generated in 0.004s • 14,579 tok/s


    ═══════════════分隔符═══════════════
    你就说快不快吧.jpg
  • YUCOAT 08-07 16:43
    24
    应该是一个很小很小的模型,用作实验性质的。
    要是把几十 B 甚至几百 B 的大模型烧制到芯片里面,情况可能又不一样了
  • xuwuruoshui 08-07 16:47
    25
  • JohnHaruhi 08-07 17:00
    26
    感觉能达到当年 gpt3.5 的水平
  • JohnHaruhi 08-07 17:01
    27
    已经很强了
  • JohnHaruhi 08-07 17:05
    28
    但最先进的模型都是 T 级别了,单颗芯片烧得下吗?
  • mxT52CRuqR6o5 08-07 19:37
    29
    要是战未来的话,我觉得不如忆阻器
    不过忆阻器也有点过于未来了,要把忆阻器用好大概率需要针对忆阻器的特性开发特定的算法,可能整个 AI 生态都要重建
* 帖子来源V2EX
返回