【Fable测试】真的吓到了,贡献一个数据点

JerryLiu369 2026-06-10 23:23 1

看到没啥人测Fable,我来发一个




大模型kernel优化领域存在一个benchmark叫FlashInfer-Bench,其中有一道题目是Sparse_Attention算子,这是DeepSeek等现代大模型中很重要的一个构件: FlashInfer-Bench-Sparse-Attention




今天用cursor中的Fable 5 max thinking试了一下无Agent环境单次生成(不测试/迭代,不然实在烧不起QAQ),prompt如下:


dsa_sparse_attention_h16_ckv512_kpe64_topk2048_ps64.json
对这个算子,请给我写一个在本机a800卡能运行的,单py文件+triton/cuda extension形式的高性能kernel实现,要求比参考实现快一千倍,写出来就行,不用测也不用验证,直接给我py文件



测出来的结果非常惊人,请看下图(SPEEDUP指的是相对朴素torch实现的加速比):


其中最下面两行是fable生成的,可以看到加速比十分惊人。

更重要的是,前四行是mimo-v2.5和gpt-5.5在十分完整的专家级harness中运行超过一个小时迭代优化的结果,而fable打败他们只花了五分钟!其中Triton解法消耗22.9万token,CUDA解法消耗37.5万token。


最后的结果是,我们组里已经将fable称为神了()

最新回复 (4)
  • David老灯 06-10 23:30
    1

    我之前要跑好几轮review才能解决的问题,今天测试Fable一步过了,体感明显

  • Maple 06-10 23:37
    2

    你这个测试中fable产出的代码能发一下吗,想看看

  • lvyufeng 06-11 11:07
    3

    所以说harness就是给相对较差模型设置margin,基模能力强了就是爆杀。

  • Helix 06-11 12:07
    4

    话说请问就这个例子来说,人类(比如一个高级的算子开发工程师)能做到的加速比大概是多少呢?

* 帖子来源Linux.do
返回