谷歌开源Diffusion Gemma,可在h100上跑出1000tps

ZackWill 2026-06-11 01:34 1



Blazing fast inference: By shifting the decode bottleneck from memory-bandwidth to compute, DiffusionGemma generates up to 4x faster token output on dedicated GPUs. (1000+ tokens per second on a single NVIDIA H100, 700+ tokens per second on NVIDIA GeForce RTX 5090).


一些补充


Diffusion是一种不同于主流文本大模型Next Token Predict的模型架构,常用于图片生成领域中。NTP是从左向右逐个token生成的,而Diffusion则是给定一块空白区域,模型预测这片区域的每个位置可能的内容,并一次次进行纠错,最终生成完整内容。

最新回复 (13)
  • Bisquiz 06-11 01:36
    1

    文字都能 diffusion 吗,突然感觉脑袋好痒

  • ZackWill 楼主 06-11 01:37
    2

    其实原理基本一样,只不过从图片的连续空间变成了文本的离散空间

  • lueluelue 06-11 01:38
    3

    我去,这么强吗这么强吗?谷歌竟然开始做出来能用的 Diffusion 模型了

  • apparition 06-11 01:39
    4

    嗯…嗯? 26B-A4B?

    上下文 256K





    为了速度性能大幅劣化?

  • 杨密 06-11 01:40
    5

    去年春季也有个扩散模型,生成文字的。吹了一阵风,没后续了。

    我还挺期待的。

  • 欣欣|林可欣 06-11 01:41
    6

    25年就有了,基于2.5Pro




    ​1500t每秒


    新版英伟达也支持

    基于gemma4

  • 欣欣|林可欣 06-11 01:43
    7

    本来gemma4就仍然是2.5pro水准 在特定领域已经是很棒的了 凡事考虑需求,你要真追求强大,2.5早就不是最好选择了 ^-^



    [!quote]

    补充一下,31b接近2.5Pro水准


  • JARK006 06-11 01:45
    8

    之前也出现过manba的线性注意力架构,生成速度也快,对于超长上下文的优势非常大,可惜也没啥下文了

  • apparition 06-11 01:46
    9

    不行,我要追求不可能三角

    速度快、性能好且价格便宜 ^-^

  • Bisquiz 06-11 01:47
    10

    道理我都懂,但是第一眼看到很难想象给文本去噪的场面)

    另外 diffusion 和 transformer 并不在一个层次呀,sd3 现在也是 transformer 架构的,猜你想说 auto-regression

    二编:百度了一下,DiffusionGemma 似乎也是transformer

  • ZackWill 楼主 06-11 01:50
    11

    文本一般是给部分片段加上mask,然后从全覆盖开始一点一点训。和transformer对比确实不对,应该是diffusion和ntp/ar对比

  • beautifulrem 06-11 01:51
    12

    扩散大模型早就有了,欧洲那边早年有做的,做出来特别厉害,要速度有速度,要质量有速度,你别管出来的结果好不好,就问你快不快吧。


    顺带一提扩散模型的Token输出动画可以做的很炫酷,是一种介于流式和非流式之间的输出,每个字从乱码崩成正常文字挺酷的

  • xinxinzi 06-11 02:51
    13

    但是当时测试才有2.5flash的水平好像,反正比当时的pro模型差一些,emm,好像比flash模型还差一些,不过对于那时候来说是真的快

* 帖子来源Linux.do
返回