没有人发现DeepSeek V4 Flash 0731/Pro 0813 的无思考能力强到离谱么?

LingEasy 2026-08-23 18:05 1

没有人发现DeepSeek V4 Flash 0731/Pro 0813 的无思考能力强到离谱么?

大部分人都在关注他们的天花板能力 也就是max思考。

但是我作为研究ai agent 以及 llm记忆方面的体会来说

deepseek v4 flash 0731 在无思考 LLM记忆分析总结上的能力强的恐怖。

甚至远比GPT luna 的 low middle 和 terra的 low 强悍的多。


重点是 速度。无思考情况下 简单提示词 总3Ktokens情况下。缓存命中(1000tokens提示词+2000tokens分析内容)。deepseek 简直是飞的速度和超强总结。 任何其他模型在走对应流程的情况下。基本上等同判死刑。

另外还不错的 是 qwen 3.5 flash 的无思考 qwen3.5的无思考能力远大于3.6 (3.7 3.8没有测试 不做评论,当时是对比deepseek 老的 v4 flash 比 中文上比ds好)。

但是现在ds在全语言上 无思考都很强。


之前codex雷达里也放过编码方面测试 现在去掉了,当时v4 flash pro的无思考 50分。而 luna low 8分。

最新回复 (7)
  • Winters 08-23 18:11
    1

    也就是说,如果只是进行分析总结的话,那么其实用无思考模式更好?好奇啥原理?

  • LingEasy 楼主 08-23 18:12
    2

    不是一个概念。不是无思考更好。而是比如你每次发送一次对话进行一次记忆预判。者是需要结合上下文分析 判断可能需要搜索的关键字来搜索记忆动态注入。这个情况下 如果前置模型速度很慢,就完全等于不可用。所以必须快 而且尽可能判断准确。这种特殊情况 而非是常规综合情况

  • wox 08-23 18:14
    3

    自从有了思考模型,都没用过无思考的模型了

    感觉有些简单的回答,思维链也没什么实际价值

  • 冰原Bill 08-23 18:17
    4

    那不就是评判模型的直觉了么?

    考虑到参数量,如果模型的直觉体感很强,有可能是过拟合了。在非常规的场景下纠偏能力可能就很弱。

  • 板栗君 08-23 18:26
    5

    玩酒馆的来说一下:如果任务只是简单的总结,那其实是LLM很轻松就能做到的基础任务,开思考反而可能搞歪。因为它会根据上下文进行推理,导致‘改写’的可能。

  • LingEasy 楼主 08-23 20:07
    6

    重点是,前提条件是特殊场景。比如对时间特别敏感的场景。不允许你思考。你如何选择?这时候Deepseek 毋容置疑很强。所以我一开始举例就是 那 前置记忆向量文字生成判断是否需要检索以及检索后的筛选作为条件。这个条件下 你如果发送一个请求。等他思考一分钟才能实际输出提示词提交给模型 等于这个功能没有任何意义。总时长不能超过5-7秒。不允许思考

  • DoBest 08-23 21:09
    7

    过多推理也许会产生幻觉吧,人也一样,想太多总顾左右而言他,哈哈

* 帖子来源Linux.do
返回