全程纯粹用V4-Flash和5.6Luna做游戏的复杂Mod到底是什么水平?我的评价:两个流口水玩意😅

哦吼这是什么呐? 2026-08-10 01:59 1

V4-Flash最经典的表现就是:

发现报错 → 找到一个看起来有关的东西 → 马上改。

小修改、明确改动,它确实快。

但是让它自己负责一个大型 Mod 的机制分析和整体实现,特别容易变成:

看到哪修哪,修完一个又制造三个。

研究半天,自己都写:

“我不确定这样是否正确。”

下一句:

“我决定直接按这个方案实现。”

左右脑互搏了半天,终于开写了,然后一进去一看,完全就没解决问题这是。

Luna表面上看起来,似乎更能理解大型项目架构。

但是不仅喜欢过度设计,整出来一堆功能,本地化门禁,双分辨率QA,静态门禁什么的,也不知道在搞啥

最他娘的抽象的是他娘的憋了半天最后

告诉我:

“已完成完整重构,静态验证全部通过。”

然后我进游戏一看,他娘的我让他设计的UI就是个几乎是空的半成品。

这俩流口水玩意给我做mod,从两千多错误到5000,然后上万了。

真就是修一个创造三个,结果最后还是把烂摊子给Sol,最后才终于是修好了。


我甚至让 Sol 看了这两个模型的实际制作过程,它给的评价是:



















































































能力 DeepSeek V4 Flash GPT Luna
明确小修改 8.5/10 7.5/10
快速写代码 9/10 7/10
日志找直接错误 7/10 8/10
根因分析 5/10 7/10
多文件联动 5.5/10 7.5/10
理解大型 Mod 架构 5/10 8/10
保持用户原始设计意图 5.5/10 6.5/10
参考别的 Mod 后重新设计 5/10 7/10
GUI/UX 产品判断 5/10 6.5/10
避免瞎猜 4/10 6/10
避免过度设计 8/10 3.5/10
进度报告可信度 6/10 5.5/10
大型 Mod 总负责人 4.5/10 7/10
有人盯着当执行 Agent 8/10 8/10

所以——

Tibo,到底啥时候重置啊?!^-^

最新回复 (7)
  • yeluo001 08-10 02:01
    1

    这种极度便宜的模型就不用想着自己甩手掌控的情况下干复杂的活

  • 哦吼这是什么呐? 楼主 08-10 02:07
    2

    其实我也算不上纯粹甩手掌柜。

    我都是先开Plan,把需求、参考 Mod、禁止事项、验收标准都说清楚,让模型自己出实施计划,我确认之后再让它执行。

    最后这俩流口水玩意最抽象的地方就是,计划是它自己出的,我也确认过,执行的时候还能一路跑偏,给我搞出半成品都不算的东西。

  • CNk Yuw 08-10 02:14
    3

    这两个模型执行点简单任务,例如人工实时配合改代码那种是方便的,但是长时间agent或者vibe coding就差了

  • liansishen 08-10 02:20
    4

    这么看来这两个模型确实适合当打手

  • 火鸡味锅巴 08-10 02:20
    5

    可不可以让sol当监工出方案,交给luna执行呢,需要怎么操作

  • 冰原Bill 08-10 02:22
    6

    毕竟是(相当于)免费的模型,已经能作为日常copilot了

  • 哦吼这是什么呐? 楼主 08-10 02:23
    7

    我感觉其实也有可能是因为P社mod这领域其实也没那么热门的原因,所以这俩模型可能跑分确实不错,但是这考验的不属于一般编程和Agent执行能力。

* 帖子来源Linux.do
返回