:fire:【大模型系列35.1】opus-4.8用于Claude Code写作评价

dwqxq1 2026-05-29 06:50 1

opus-4.8用于Claude Code写作评价


4.8写作测试,2个梦境,解梦,原文400字,回答1万字左右

以下仅讨论Claude Code,因为Claude web和app加载rules等不方便,我没用web或app写作,Claude Code的系统提示词里有多处要求简洁,如果模型本身也偏简洁(例如4.7),两个buff叠加,就容易不说人话


①4.8-max测试:30分钟,消耗5x5h的9%


写作比较正常,说人话,4.8明显比4.7好,4.8与4.6相比谁好还需要更多测试


LiveBench的4.8的语言分仍然低于4.6,而4.7语言分非常低,只略强于4.1,远低于4.5和4.6:LiveBench




LMArena上4.7的写作也远低于4.6:LLM Leaderboard - Best Text & Chat AI Models Compared







4.8max速度明显比4.6max,4.7max更慢,4.6极少能思考到30分钟,不知道是4.8的tps低造成的,还是连续思考能力强造成的

参考Reddit也在吐槽速度慢的问题:https://www.reddit.com/r/ClaudeCode/comments/1tqfiw2/


4.6单价比4.7贵4倍,4.8单价应该跟4.7差不多,远低于4.6,参考我这篇:🔥【省钱系列15】还在用opus4.6吗,Claude Code里4.6消耗速度是4.7的4倍


4.8是30分钟消耗9%,相当于5小时消耗90%,就是单线程max effort即便一分钟不停歇,也用不完5x。而4.6大概1.5-2小时就能用光100%


②4.8-ultracode测试:20-30分钟,消耗5x5h的19%


写的很抽象,不说人话,这一档显然使用了与max不同的系统提示词或workflow,与写作兼容性极差,而且非常贵,没必要使用


其他


4.8比4.6,4.7多个特征,就是喜欢在结尾加一句提问,类似chatgpt那种套路


最后发张梗图,祝佬友用4.8愉快地写作


最新回复 (8)
  • dwqxq1 楼主 05-29 06:51
    2

    我近期其他帖子


    .🔥【AI大战系列10】用非洲草原生态解释中美AI竞争(狮子王版)

    .🔥【图像视频系列8】关于Gemini-omni-flash,你想知道的一切




    .🔥【大模型系列35】关于Opus-4.8,你想知道的一切【更新写作能力评估】

    .🔥【大模型系列34.3】为什么Google从AI老二变老三了?怎样完美错过Agent时代第一阶段

    .🔥【大模型系列34.2】逆水行舟,不进则退:评Google在IO 26大会表现和未来预测

    .🔥【大模型系列34.1】gemini-3.5起,谷歌狂砍Pro会员额度,田忌赛马耍猴惹众怒

    .🔥【大模型系列34】关于gemini-3.5-flash,pro和Google IO 26,你想知道的一切【更新Arena,AAnalysis评分】

    .🔥【大模型系列34.0】Gemini-3.5预热贴,新$100的5x会员,veo4,3.5flash涨价3倍,Pro会员额度砍到1/4膝盖斩

    .🔥【大模型系列33】关于Deepseek V4,你想知道的一切

    .🔥【大模型系列32】关于GPT 5.5,你想知道的一切【速度/价格2倍,性能超Opus4.7】

    .🔥【大模型系列31】关于Claude Opus-4.7,你想知道的一切【260418更新LMArena评分】

    .🔥【大模型系列30】关于Claude Mythos,现在知道的一切【更新244页模型卡】




    .🔥【省钱系列15】还在用opus4.6吗,Claude Code里4.6消耗速度是4.7的4倍

    .🔥【省钱系列13】Claude Code Max砍额度了?到底是怎么算的?独家解方程得真相

    .🔥【省钱系列12】【底楼更新第一次续费遭遇】尼区买Timon信用卡教程,$77买Claude Max 5x,$152买20x,$12买Pro,封号退到卡

    .🔥【省钱系列11】我做的Claude Code Saver,争取做最强CC额度监控+省钱插件【预告贴】

    .🔥【省钱系列10】Claude Code Max,Codex Team最新渠道研究

    .🔥【省钱系列9】Claude Code Opus额度的秘密:2api的刀,与CC官方刀,此刀非彼刀,又被宰一刀

    .【省钱系列8.10】Claude Code Max,Opus4.6,OAuth直连拼车方案的实践研究

    .^-^【省钱系列8】Claude Code,Opus-4.6的渠道研究【9k浏览】




    L站opus-4.8相关帖子汇总(按时间顺序从新到老)


    .感觉这次opus 4.8又能说人话了

    .Opus 4.8蒸馏了DeepSeek...

    .Opus 4.8连红绿色盲都答不上来了?

    .https://linux.do/t/topic/2264746

    .测试Opus 4.8的三个问题

    .Claude Opus4.8官方公告机翻

    .claude-opus-4-8蒸馏了太多qwen模型,导致自我认知出了问题,基本认为自己是qwen

    .claude opus 4.8 出了

  • Kemou 05-29 07:17
    3

    佬,能用上次那个拟合工具测测 4.8 官方刀消耗价格么

  • 炫彩小鱼干 05-29 07:51
    4

    实际用了用,之前用4.6来学习和解释概念,明显感觉4.8还是有很难受的口癖


    作为参考, opus 4.6



    opus 4.7



    而且有个轻微歧义的地方,4.6完全理解我回答的是更之前的一个问题,4.8就完全没理解

  • smartcat 05-29 14:28
    5

    测试了一下4.7和4.8针对同一份提示词写的文章的同一个段落:

    4.7




    4.8




    没有用4.6测试,但是就这一段我怎么感觉4.7写得更好呢 ^-^

  • Huagnqf 05-29 15:02
    6

    就这个截图我感觉我更喜欢4.8一些。句子长短的节奏更舒服,也会少了些没用的话。

  • A.Ziegler 05-29 17:02
    7

    刚好今天也重度使用对比了一下,我习惯使用co-work,然后甩给大模型上下文,让它帮我在做决定时给出一些参考。我发现claude发现4.6的情商完爆4.8。感觉4.8就像一个无情的代码机器,非常工科思维,只讲逻辑。但是4.6的话,它会有一些情商在里边,让你感受到它是懂人情世故的。

  • A.Ziegler 06-01 17:11
    8

    佬啥时候测评一下4.8的耐用度,我感觉切成这个模型之后,我的额度根本用不完。

  • Geist 08-21 16:11
    9

    从 4.7 开始不说人话真的很明显,生成的各种文档基本都是机翻中文,人根本看不懂

* 帖子来源Linux.do
返回