DeepSeek V4 Flash-0731 个人向使用体验

Timoris 2026-08-02 22:02 1

【叠甲:科研民工一枚,不是专业评测人员,哪家便宜好用用哪家,希望国模越来越好,仅从个人角度讲讲DS V4 Flash使用体验】



高强度使用了两天 OpenCode 上的 DeepSeek V4 Flash。Codex 据说目前还有适配问题,我暂时没试,这里认真说一下实际体验。


我手头有两个难度中等的科研项目,不算特别复杂,但也绝不是简单脚本。


此前主要使用 Sol 和 Opus 开发,现在交给 DS Flash 接手维护和继续推进。


整体而言实际使用体验明显优于 GPT-5.3,在上下文较短、任务边界清晰的情况下,表现几乎可以接近 GPT-5.4-xhigh 和 Luna Max,远强于今年 4 月版本的 Flash 和 Pro。


不过仍然不如 GPT-5.5 和 GLM-5.2,距离 K3、Sol 也还有比较明显的差距。考虑到它只有约 13B 激活参数,这个结果其实已经相当夸张


比较明显的缺点:




  1. 需求拆解和任务规划能力偏弱。使用者最好自己在 Prompt 中完成较清晰的 Plan,不能完全指望它主动把复杂任务拆好




  2. 在长工作流中很容易逐渐偏离原始目标




  3. 执行质量非常依赖项目文档是否清晰




  4. 用户需要自己判断手动压缩 Context 的时机。上下文持续膨胀而只依赖自动压缩时,幻觉明显增加




比较明显的优点:




  1. 便宜。OpenCode 的 5 美元套餐按额度粗略换算,甚至接近 3000 美元的 Fable API 用量或 1600 美元的 Sol API 用量




  2. 在如此便宜的前提下,能力却已经接近 GPT-5.4,性价比非常离谱




  3. 因为足够便宜,可以放心让它跑大量实验、补测试、读代码、做重复性修改,不必吃百家饭,时刻计算 Token 成本




  4. 还是便宜




DS Flash 目前还不适合作为完全放手不管的主力 Coder,但非常适合由用户(或更高级模型)负责规划和把控方向,再让它承担具体执行工作。


希望梁圣继续发力,让 8 月的新版 V4 Pro 达到 Grok 4.5 水平,到时候我大概就可以全面替换掉 OA 全家桶了

最新回复 (19)
  • Timoris 楼主 08-02 22:05
    1

    实验室目前还有 2 个同门也都在我的蛊惑下尝试了 V4 ,反馈是在已经被 Sol 和 Opus 开发得七七八八的项目里让 DS 接着跑效果很好,有一人还找到了 2 个之前 Sol 修不了的 Bug。


    但从 0 开始全让 DS 接管项目还没试过


    这几天太忙,等做完 Revision 会试一下


    另外,可以给大家说一个好玩的


    在我师兄某天看世界杯熬夜蹲点拿到 Review 意见时,他随手把 Review 扔进了 VSCode ,让 Fable 看着改改,给点 Revision 和实验计划就去睡了


    结果第二天下午他起来的时候,Fable 已经把 Rebuttal、Revision、Revision 要补的实验、Revision 要加的 Baseline 和 Reference 全都做好了,接近 80% 可用的状态


    目前个人脑测一下,除了 Sol、Fable、K3 外应该没有模型能做到


    希望 DS 早日入此境界

  • PongPong 08-02 22:06
    2

    在用这个养马,便宜的智能才是好智能啊!

  • calendar 08-02 22:06
    3


    1. 因为足够便宜,可以放心让它跑大量实验、补测试、读代码、做重复性修改,不必吃百家饭,时刻计算 Token 成本



    真的可以吗 ^-^


    最近做实验用的都是 5.6sol,用起来很省心(除了结果不说人话),担心用了别的模型实验会乱做

  • Draw 08-02 22:07
    4

    这个参数数基本代表它长任务不行的,中短任务还蛮好用的

  • mumuzhi wong 08-02 22:07
    5

    确实,优点就是便宜和速度快,要说吊打谁谁谁,都是吹牛

  • Timoris 楼主 08-02 22:09
    6

    你可以给项目另开一个分支专门用 DS 试一下,至少我的项目在短上下文下是没什么问题

    如果经济条件允许的话,那当然还是 Sol 更好

    顺带一提,我之前有过用 GLM 5.2 替换 Sol 结果把项目搞崩的经历

  • 傻强 08-02 22:11
    7

    没有经费顾虑的话肯定全部sol更好啊

  • 傻强 08-02 22:13
    8

    我也有gpt搞半天没解决的bug然后ds给我解决了的情况,ai怎么说呢感觉随机性还是太大,都有自己擅长的,不过ds模型这么小真的感觉很有东西。

  • scvxzf 08-02 22:15
    9

    我在大约40000行的仓库中测试,之前是openai维护的,可用性不太好。

    有文档库引导,开启了子代理。负责是挺负责不用goal都能一次干一个多小时,就是看了文档也容易会注意不到,经常会忙头不顾尾。

    塞入大量审计测试的话速度也就慢下来了,和tps 10%的sol high差不多了,不过有opencode go在token消耗也确实便宜就是了,准备拿去喂龙虾“?”

  • Huagnqf 08-02 22:18
    10

    我是用grill+trelliis+ds,。

    长任务基本都落实了,我今天跑了近4亿的tokens,也都没有上下文腐烂现象。

    而且由于ds速度太快,反而比sol体验要好。

  • neteroster 08-02 22:18
    11

    我试了一些基本任务,实话实说我不太敢让他跑正经的实验


    主要的问题是喜欢猜,Prompt 里面只要没有完全明确的地方,或者稍有模糊的地方,就会猜,然后出现两种结果



    • 猜了某些参数/假设后实验直接崩了/跑不起来:这种还不错,起码你知道出了问题

    • 猜了,改了某些东西,实验跑起来,然而某些假设不是预期的(或者说他做出的一些假设不正确),也没明确说明:我最怕这个,v4f GA 在不少任务中有这个倾向‘


    整体感觉接近 GLM-5.2 级别


    然后就是世界知识了,这个也是老生常谈的。所以我这段时间一直觉得以后模型很可能会越来越两级分化(现在已经有这个趋势)



    • 左边:模型便宜,执行力很好,Agent 能力很强,硬推理能力也不错,但是知识和OOD泛化不行,但对于多数非垂类大众领域够用(例如写网页、普通的业务逻辑),现在代表就是 v4f GA, grok 4.5(实际现在很多人是适合用这类模型但是之前没有很好的选择的,现在/未来会越来越多选择

    • 右边:模型很贵,规模很大,对比左侧模型的优点就是世界知识和领域知识强,OOD泛化好,可以做比较深的垂类任务(代表就是5.6sol/fable/k3)

  • beibeizi 08-02 22:20
    12

    按照这个体验方式 缩小自动压缩+superpowers 非常完美

  • 安和 08-02 22:21
    13

    deepseekv4 flash和claude opus 5 一起用,至少思考时间没那么长,我觉得这个算是优势,claude code里面还是觉得原生好用

  • Timoris 楼主 08-02 22:26
    14



    不管怎么蹬都无法用到 5h 的 limit

    简直是无尽资源点

  • igg8 08-02 22:48
    15

    效果怎么样?我也准备搞一个了。谢谢

  • PongPong 08-02 22:54
    16

    感觉挺不错的,够聪明。我看了一下,缓存率也还算比较高。

  • ppdx 08-02 22:56
    17

    除了 Sol、Fable、K3 外应该没有模型能做到



    脑测一下,我觉得除了肥波,其他俩也很难做到。

  • PongPong 08-02 22:57
    18

    但是我感觉让让它改正经的项目还是不太行。它跟 Luna 相比,还是不太喜欢调我给的那些技能,感觉可能是 Deepseek 根据那些 Terminal 工具做的一些特化。比如我安装了那 fast context MCP,它还是喜欢 find 和 grep. 但是它真的足够快, 所以用起来还是挺爽的。

  • PongPong 08-02 22:58
    19

    然后很离谱的是,我发现它有时候有一些神之异手,莫名其妙就找到了一些文件。感觉找上下文还是有一手的,可以作为子代理。

* 帖子来源Linux.do
返回