dsh-tui + deepseek v4.1-flash 测试,官方api暗箱操作降智?

Herbivore 2026-09-11 01:51 1

在win11用dsh-tui画的,感觉挺强的呀,自己画完会自己截图review自己改

我甚至觉得是不是针对鹈鹕做了训练了?效果这么好?




前端测试


Prompt:创建一个HTML内容是 SVG 绘制一个鹈鹕骑自行车的 2D 动画






Prompt:创建一个HTML内容是 SVG 绘制一个秦始皇骑北极熊的 2D 动画






过程


中途我发现他能自己放大图片去review,自己去补充修复细节,这是基础操作么??




推理测试


但是水杯题他算的还是有问题,只能说v4.1-flash适合做agent用,不适合做推理逻辑 ^-^

正确答案:8




使用场景畅想


dsv4.1-flash不是干活很快么?能不能在Orca或者Herdr里面,让codex(gpt-5.6-sol)去指挥dsh-tui(dsv4.1-flash)干活,再让codex(gpt-5.6-terra)去验收

最新回复 (7)
  • 爱伦·坡 09-11 02:04
    1

    让codex(gpt-5.6-sol)去指挥dsh-tui(dsv4.1-flash)干活,再让codex(gpt-5.6-terra)去验收



    我一直都是这么干的,感觉还不错,不过我是让sol验收的

  • ZluBfo 09-11 02:11
    2

    刚刚测的





  • 09-11 10:10
    3

    workbuddy的,北极熊那个不行,其他两个还可以:

    鹈鹕骑自行车:



    秦始皇骑北极熊(离谱哈哈哈):



    水杯题,推理逻辑其实还行,感觉是抽卡的:

  • Herbivore 楼主 09-13 20:16
    4

    deepseek 官方api的v4.1-flash模型这两天降智了?

    这俩天各跑了一次秦始皇骑北极熊 肉眼可见的变得拉胯,都是跑max强度




    9月11号晚上:相同提示词,人物画的是啥啊…比10号晚上画的拉胯多了,前进方向也是错的,左下角的“熊字”也被遮挡住文字




    9月13号晚上:相同提示词,人物画的还是比10号晚上的烂,前进方向是对了,但北极熊怎么少了一块?标语也画得很廉价




    9月13号晚上:相同提示词,不死心选择high又跑了一次,效果更烂了,人物的腿呢?环境也不跟随着前进方向变了…




    说实话,心里有点失望,10号晚上我还以为能从gpt换到deepseek来的,这俩天肉眼可见的效果拉胯,怎么敢切换到deepseek v4.1-flash?满打满算模型发布到现在还没一周吧?

  • Herbivore 楼主 09-13 20:37
    5

    最后一个测试就是high,很明显比max更拉跨,人物的腿都不见了

  • refalogy 09-13 20:40
    6

    模型输出本来就有随机性,除非训练很充分输出很稳定,或者大量采样。我自己用感觉没怎么降智吧

  • Herbivore 楼主 09-13 20:43
    7

    工具调用也变得拉胯,10号他还会自己放大截图去查看效果(人物、北极熊的拼接边界问题),但是后面几次测试,他只看图片完不完整,并不会去放大查看效果,直接输出结果了

* 帖子来源Linux.do
返回