这里为什么感觉没人讨论国产模型。我发现 qwen 和豆包系列模型问题好多,生产直接没法用

rizon 2026-09-09 12:33 1

对话类产品。
生产环境过去一直在用豆包,但是豆包 ttft 越来越大已经没法用了,所以想换 qwen 。
而且豆包还有概率出现脱靶问题和工具调用幻觉问题

结果 qwen3.7 plus 输出总是半截就中断,概率非常大没法用。
换成 3.8 max ,先是专属 endpoint 输出内容缺少 role ,这事我就排查了很久。
然后换成 dashscope 域继续用想着没事了,结果发现模型带图时输出质量严重下滑,区分不出注释内容和对话内容的角色概念。

搞得我现在一个没得用。做角色扮演对话还有什么好的选择吗
最新回复 (51)
  • rizon 楼主 09-09 12:37
    1
    好吧,这会排查到原因了 。
    thinking:{type:disabled} 关闭思维链会导致思维链进入正文。
  • hhsd 09-09 13:53
    2
    能上 v2 的 谁手上还没有个 gpt 了 再不济也有中转 图豆包会流口水么
  • catinsides 09-09 13:56
    3
    部分国产模型向来是跑分没输过,体验没赢过,一用一个不吱声。以前好歹便宜量大,现在定价比国外的还贵,几个问题就用完 5 小时额度,让我再买是不可能了。
  • lmmlwen 09-09 14:06
    4
    羊粪蛋子表面光,比如城市下水道,比如甲醛大白菜,比如 ChinaGT 也与老大爷救援人员
  • 7gugu 09-09 14:13
    5
    国产模型推荐 GLM 5.3 ,比肩 5.6 terra ,ttft 也更快
  • yyttrr 09-09 14:17
    6
    一直用 deepseek,平时 flash,负责紧急问题开一下 pro,也够用了,而且响应速度很快.最大的方便是每个月报销的时候直接能开发票,财务报销流程效率很多,其他同事用 claude 或者 gpt 的没发票流程复杂一些
  • justxwy 09-09 15:43
    7
    qwen 3.8 max 我和我同事都非常好评啊,写代码很厉害。
  • kimhooo 09-09 15:47
    8
    “生产直接没法用”——谜底就在谜面上
  • ebushicao 09-09 15:54
    9
    国产模型只需要看 glm 、kimi 、deepseek ,图像和视频方面倒是可以看豆包。
  • FreshOldMan 09-09 15:54
    10
    能用最好的,肯定不用排第二的啊
  • wat4me 09-09 16:09
    11
    国产只看 glm kimi DeepSeek ,qwen 的优势是小模型厉害,可以在特定领域微调
  • mechunjun 09-09 16:10
    12
    因为不在意,因为不在乎
  • mechunjun 09-09 16:10
    13
    来自 claude max 20x 和 chatgpt pro 20x 双持用户
  • wang9571 09-09 16:13
    14
    喜欢什么用什么呗,有什么好讨论的
  • jacketma 09-09 16:13
    15
    一言难尽吧,算力和算法都有差距,主要还是有参照物,如果没有海外模型的能力对比,国模也挺好的
  • rizon 楼主 09-09 16:18
    16
    @justxwy 常规使用没问题,但是在一些细节上 bug 挺多。也不知道为什么,是上线前测试 case 没覆盖吗。感觉 AI 时代各种大厂产品的可靠性都在下降。

    比如已经和 售后确认过的 qwen3.8max 的 maas endpoint 确实有某些情况下输出缺失 role 字段的 bug 。
  • maocat 09-09 16:27
    17
    使用的问题,openai 这些模型是不吐思考内容的,所以用他们的框架没问题,模型在进步,框架也在变,虽然明着说支持 openai sdk 格式,qwen ,ds 或多或少都有些问题,比如 ds 要求执行 tool 带上思考内容,或者每次执行都会先吐一段思考内容,再执行工具,这些 case
  • latifrons 09-09 16:38
    18
    因为没法用,所以没人讨论
  • rizon 楼主 09-09 16:46
    19
    @maocat 是这样的,国内想找一个真的能用的模型其实选择范围非常小。看着百花齐放,但是线上产品想要换个模型的时候真能换的基本没有。

    而且因为参数兼容和模型内部的一些各自特性换模型时还很容易出事故。

    为此我专门做了一模型 api 兼容性测试网站: https://llmapicheck.dev/
  • maocat 09-09 17:08
    20
    @rizon #19 你这个工具。。。我得打击你一下,有很多服务商不允许跨域调用的
  • dryadent 09-09 17:10
    21
    因为我没在生产环境用啊,gpt 6 都一堆问题,更何况这些蒸馏的
  • crackself 09-09 17:11
    22
    v 友要生产力的,逗乐子看郭德纲于谦比国模更具性价比
  • rizon 楼主 09-09 17:16
    23
    @maocat 哈,是有这个问题,所以按说还得加自定义代理功能。另外我后面打算支持在服务器终端上跑,这样延迟测试也更准一些
  • rizon 楼主 09-09 17:19
    24
    @dryadent
    @crackself 哎,没得选啊,实时对话产品延迟敏感, 还有成本问题。如果有好的低延迟、低成本的 gpt 模型选择就好了。
  • pmer 09-09 17:21
    25
    要区分下具体模型,至少 seedance2.0/2.5 能打的,它是属于豆包系列模型(对外品牌名称)
  • ReinXD 09-09 17:22
    26
    @rizon 那也应该选 deepseek 不是 qwen ,qwen infra 水平真得不敢恭维
  • ovtfkw 09-09 17:23
    27
    k3 呢 直接不是说吊打 opus 吗 现在如何了
  • f1ynnv2 09-09 17:38
    28
    豆包只在用语音识别
  • alsas 09-09 17:44
    29
    因为默认不能用
  • lovelive1024 09-09 17:45
    30
    如果是角色扮演用 ds 啊,那些玩酒馆的人很多都是用 ds
  • qaq13037 09-09 18:04
    31
    评论区怎么那么多崇洋媚外的,2026 年 9 月了,还搁这国模不可用呢? glm 、kimi 、deepseek 最新模型哪个不比你们当年吹的 opus4.6 强一个档?当年吹的像神一样的东西,放到国产上就成屎了对吗?
  • wy315700 09-09 18:07
    32
    国产模型这么多,你好歹用几个能打的啊,用 qwen 和豆包干活是几个意思
  • suxiaozi 09-09 18:30
    33
    我也是做 AI 产品的,这些模型已经让我泣不成声!😮‍💨
  • tianjiyao 09-09 18:47
    34
    我用 DeepSeek 的 API 感觉还是挺稳定的,qwen 的用过质量一般般。豆包的就是搞笑的。。。上不了台面
  • NQ 09-09 19:20
    35
    用国模不如直接把钱丢水里,后者最多是短痛😁
  • rizon 楼主 09-09 19:54
    36
    @ReinXD
    @lovelive1024
    ds 是纯文本模型,不是多模态的。这就导致图像类的请求我得路由到其他模型或者图片转文字(损失细节)。所以只能说没什么更好的选择的话只能考虑 ds 了。
  • rizon 楼主 09-09 19:55
    37
    @wy315700 可以给推荐一下。ttft 足够低,最好是支持视觉理解的。
  • rizon 楼主 09-09 19:56
    38
    @suxiaozi
    @tianjiyao
    看到大家都是这个共识我就放心了,我一直以为是自己工程上做的还是不够好。不然怎么一直没看到人说国产不好,我一度怀疑是自己的问题
  • sommio 09-09 20:08
    39
    @rizon deepseek-v4.1-flash-expires-on-0910 和 deepseek-v4-flash-vision-exp 都支持多模态,明天 v4.1-flash 就要发正式版 + 降价了, 而且 ttft 都在 1s 以内;
  • sommio 09-09 20:11
    40
    role-play 要做好点还是得靠自托管微调模型吧?
    常规模型感觉最好还是 DeepSeek 了
  • rizon 楼主 09-09 20:33
    41
    @sommio 我看看 4.1 这个。 确实微调最好。但是 GPU 成本感觉有些高,一个 27b 以上模型满足并发和 ttft 需求的话 gpu 成本也不低
  • lovelive1024 09-09 20:37
    42
    @rizon #36 ds 有多模态模型啊,而且明天出 4.1 也支持多模态
  • garinluo 09-09 20:38
    43
    正常,看模型的投入就知道了。
  • rizon 楼主 09-09 20:54
    44
    @sommio 谢谢推荐 ds ,没想到都出了 vision 版了。明天做一下线上 case 回归看看。

    视觉版本的结构化输出支持上不完善。不过倒不是很大的问题。
  • rizon 楼主 09-09 20:55
    45
    @lovelive1024 嗯嗯,谢谢,看到了。明天试试。不知道它的视觉版内部怎么实现的,结构化输出支持的不太完善,倒不是太大问题。
  • yungo8 09-09 21:01
    46
    3.8max 还行,其它就差点意思,主要问题是高峰期时额度烧的太快了
  • issakchill 09-09 23:05
    47
    你的后半句恰恰就回答了前半句
  • Msxx 09-09 23:24
    48
    你都知道生产不能直接用了,还有什么可讨论的呢?另外,国模的隐私问题值得重点关注。国外大模型受环大陆监管,国内的大模型是 AI 之光是对抗老美的桥头堡,隐私和数据安全这些东西压根都不会放到台面上来说。
  • 5GA 09-09 23:36
    49
    看着讨论氛围,感觉人人都是顶尖开发者,日常处理开发的都是了不得的产品,非顶尖非 Top 不行。
  • zedpass 09-10 01:06
    50
    我用 3.7 plus 做 agent 产品没遇到你说的这些问题啊,不过模型确实性价比一般,主要是几个月不更新了,这个能力配不上定价
  • ascend13 09-10 02:40
    51
    这种提升生产力的肯定用最好的,从不考虑国模
* 帖子来源V2EX
返回