fable 5.1 用了一天,顺手整理下这次发布的关键信息

MaskerPRC 2026-09-03 20:24 1

昨天 Anthropic 发了 fable 5.1 ,没怎么铺垫就直接上了 API 。我手头有些日常脚本跑在 API 上,就顺手试了一天,把官方信息和我自己的感受整理一下,给还在观望的朋友省点翻文档的时间。


先说官方数据(省得大家去翻 changelog ):



  • Terminal-Bench-Science 52.6%,上一代是 24.7%,接近翻倍。这提升幅度说实话有点夸张,我自己还没在专业场景里复现到这个程度

  • 缓存读取价格降了 75%。对我们这种跑长对话、反复带大上下文的用法,这个比模型本身的提升更实惠

  • 官方说 Agent 类任务的总成本最高能省 45%,来源就是缓存降价加上减少无效轮次

  • API id 是 claude-fable-5-1 ,价格表上没动标准定价


我实际用下来的几点观察:



  1. 最明显的感受是废话少了,让它改代码它就改代码,输出里那些"好的,我来帮你……"之类的客套明显少了,token 消耗肉眼可见地降

  2. 长上下文下找东西比上代准。我扔了一个几千行的旧项目让它定位配置项,一次性命中,上代要来回确认两三次

  3. 缓存这个事情要自己会用,prompt 结构乱的话省钱效果会打折


另外这次还同步发了个叫 Mythos 5.1 的,和 fable 5.1 同权重,但只开放给审核/评测机构做对齐研究,普通用户拿不到,大家看到的 benchmark 数字里有一部分就是它跑的。


总结:如果你已经在用 API 跑 agent 类任务,值得切过去试试,成本大概率是降的;纯聊天用途提升感知不大。有别的使用场景的欢迎交流,我这边也就跑了一天,样本量有限,拍砖随意。

最新回复 (2)
  • VeryZero 09-04 09:04
    1
    几千行的项目定位一个配置还不能一次命中,这是认真的吗?
  • MaskerPRC 楼主 09-04 13:31
    2
    这里是我表述不严谨,抱歉。实际情况是那个项目我自己写过一部分,对结构有先验,知道配置大概在哪一层,模型实际是返了一次确认路径才命中的,不是纯靠模型一次到位。拿这个当「长上下文能力提升」的证据确实夸大了,样本就一天,大家参考时打个折扣看。
* 帖子来源V2EX
返回