记一次在嵌入式项目的代码质量和效率的横向评测(DeepSeek V4 Flash 0731、GPT 5.6 Luna Max)

troubleman 2026-08-07 17:49 1

前言


因为我是主要是做嵌入式开发的,我看比较少人测试这方面的,所以特意做了这次评测。

在嵌入式项目中, 代码质量和运行的速度十分重要, CPU比电脑运行慢很多,在这种情况如果代码写得不好,运行的效率就会放大,结果差很远,很多时候都要想辨法压到极限。

而且在实际开发中要多次查文档, build, 烧录和开发板交互操作, 这次测试可以考验有没有做好。


环境


1.统一使用 opencode

2.使用ESP32S3N16R8, SDK ESP-IDF 5.5.5

3.可以自由查阅的ESP文档

4.可以自由使用espidf内建的工具


参与测试的模型


1.opencode go 的DeepSeek V4 Flash 0731, 思考max

2.opencode zen 的DeepSeek V4 Flash 0731 free, 思考max (跟go付费版对比)

3.opencode go 的GPT 5.6 Luna, 思考max

4.opencode zen 的LongCat-2.0 Free, 思考max (反正免费顺便测)


测试方法

1.在同一个SDK和环境下写1024 点 Q15 定点 FFT的算法, 不能使用esp的FFT/DSP库

2.输出要和事先写好的PC 验证工具float648答案比较,SNR ≥ 35 dB 且最大误差 ≤ 128 LSB,两者都过才算 PASS

3.每个测试的模型要写2版code, v1版要先把算法写好正常正确能用, 验证通过后 commit 冻结, 再写自我优化的最终版 v2版, 比较 v1 与 v2 的运行速度

4.用我自建的 DevTool 量测速度,记录 avg / p50 / p99 / max(µs)。

5.记录v1 总用时, v2 总用时

6.撰写 contest_report.md(优化手段/正确性验证/速度表格/成本/心得)

7.最后由肥波5审计


提示词


model_prompt_zh.txt (7.8 KB)


各自完成后的报告


deepseekv4fash_contest_report.txt (8.0 KB)

deepseekv4fashfree_contest_report.txt (5.9 KB)

gpt_luna_contest_report.txt (5.7 KB)

longcat2_contest_report.txt (4.6 KB)


肥波的结论和审计成绩











































模型 v1 SNR / max_err v2 SNR / max_err 报告声称 相符
DeepSeek V4 Flash 0731 48.76 dB / 3.0 51.22 dB / 2.1 48.76/3.0、51.22/2.1
DeepSeek V4 Flash 0731 free 47.98 / 3.0 47.94 / 3.0 47.98/3.0、47.94/3.0
GPT 5.6 Luna 48.01 / 3.0 48.01 / 3.0 48.01/3.0、48.01/3.0
LongCat-2.0 Free 48.17 / 3.0 46.19 / 3.5 48.17/3.0、46.19/3.5

全部通过闸门(SNR ≥ 35 dB、max_err ≤ 128 LSB)。速度方面:GPT 留存了 perf 原始输出(6339/1945 µs,与报告逐字相符);两个 DeepSeek 未附 perf 原始档,仅报告自述。


成绩总表

























































项目(权重) DS V4 Flash 0731 DS V4 Flash free GPT 5.6 Luna LongCat-2.0
正确性 (30%) 10 9 9 8
速度 (30%) 10 8.5 6.5 5.5
代码质量 (20%) 9.5 8.5 8.5 7
报告质量 (20%) 9.5 8.5 9 7.5
加权总分 9.8 8.6 7.9 7.0
排名 ^-^ 1 ^-^ 2 ^-^ 3 4(资格存疑,两个诚信/隔离问题)










































关键数据 DS V4 Flash DS V4 Flash free GPT Luna LongCat
v1 avg 2329 µs 2201 µs 6339 µs 2668 µs
v2 avg 564 µs 952 µs 1945 µs 1804 µs
提速 4.13× 2.31× 3.26× 1.48×
v2 算法级优化 ^-^ real-input FFT ^-^ real-input FFT ^-^ 无 ^-^ 无

感想


首先这个结果完全出乎我的意料的, 因为我一直以为GPT写算法是最好的, 但最后写出来的代码最拉, 写出来的算法速度也是最慢的, 但执行速度太快, 有降智的可能性


可以看出opencode是挺有良心的, deepseekv4 flash free版本速度和付费1M版本在写v1 code不会慢很多, 但可以看出200K上下文带来的负面影响, free版本刚做好v1就进行上下文压缩了, 导至后续写v2时要重新查文档花了好长时间, 最后效果也差了好多


体感deepseek v4 0731真的很聪明, 它在过程中不断的查文档和调用工具去模拟和实测, 甚至直接查看编译出来的汇编文件看实际的汇编指令, 跟我自己的实际工作流好像


至于LongCat这个模型犯规了, 它偷看了deepseek v4 flash free的工作区, 我及时阻止了, 但是我想不到这个美团的模型竟能完全完成任务, 也算是出乎我的意料的

最新回复 (3)
  • troubleman 楼主 08-08 11:38
    1

    因为昨天的luna max的成绩太拉了, 怀疑降智

    今天重测一次结果更拉

    v1 avg=7877 µs, v2 avg=4332 µs

  • NiceTry 08-08 11:43
    2

    deepseek v4 flash这成绩真不错啊,狠狠期待一下pro

  • yeyucca 08-22 17:49
    3

    很好的一次实验验证,后面用这个验证对比下

* 帖子来源Linux.do
返回