腾讯 Hy3 到底什么水平?

jiashuaibei 2026-08-19 16:32 1

WorkBuddy 中 Hy3 免费了那么久,实际能力表现怎么样呢?腾讯有在好好做模型吗?
最新回复 (18)
  • killva4624 08-19 16:35
    1
    朋友以上,恋人未满。
  • xndeye 08-19 17:12
    2
    和豆包坐一桌的水平
  • 92Developer 08-19 17:13
    3
    路边一条[我没试过,感觉]
  • HappyAndSmile 08-19 17:15
    4
    聊都没人聊的水平
  • goumadantui 08-19 17:16
    5
    每次在 codebuddy 用,都要排队,导致从来没用过
  • nonewind 08-19 17:18
    6
    这是我在真实项目中,使用 gpt 5.6 sol High 作为裁判出题,然后让子模型执行两轮测试,最终裁判给出的排名以及分数;两轮测试分别对应: 第一轮测试代码检索与补丁设计,第二轮测试故障审查、修正能力及完成步数等指标。两轮均只读,最终按第一轮 30%、第二轮 70% 加权记分,结果如下:

    | 排名 | 模型 | 第一轮 30% | 第二轮 70% | 最终分 |
    |---:|---|---:|---:|---:|
    | 1 | **DeepSeek-V4-Flash (Go)** | 81 | 83 | **82.4** |
    | 2 | **Qwen3.7-Plus (Go)** | 84 | 77 | **79.1** |
    | 3 | **GPT-5.6 Luna (ChatGPT)** | 79 | 79 | **79.0** |
    | 4 | **Hy3 (Go)** | 71 | 75 | **73.8** |
    | 5 | **MiMo-V2.5-Pro (Go)** | 70 | 69 | **69.3** |
    | 6 | **MiniMax-M3 (TokenPlan)** | 84 | 57 | **65.1**
  • nonewind 08-19 17:23
    7
    |@nonewind 只针对真实项目,代码能力,不包含多模态能力;
  • xiaoao4568 08-19 17:23
    8
    我经常用,不太聪明,但是免费呀。
  • Felldeadbird 08-19 17:26
    9
    我个人觉得 HY3 还行。做前端没太多问题。后端够用。

    但是理解水平有点不行,有时候会误解需求。然后代码能力需要 review ,有时候会设计很蠢的逻辑。
  • karocXing 08-19 17:39
    10
    WorkBuddy 里每天都签到,用一下,攒攒积分。
    活能干,约束也能都遵守。
    不过有个问题,可能是用的软件开发团队这个专家团,然后干活的时候经常会创建,删除文件,经常一干两三个小时后,回收站就几百上千的文件了。
    没具体了解原因,不过有两次把 .git 目录给删了。😄 后来约束了下,没再犯了。
  • lucays 08-19 17:51
    11
    可以很明确说不如 ds v4 flash 0731
    但是免费呀
  • yangg 08-19 18:04
    12
    国产刚出的 glm-5.3 拉的屎,还不提示,codex 看的时候都会顺便提示:
    另外,OpenCode 那个诊断会话里执行 cat ~/.claude/settings.json 时把一个 API token 显示在了工具输出中。建议删除该会话记录并轮换该 token 。
  • Ravenddd 08-19 18:12
    13
    用了 2 个星期挺好用, 之前用 GLM5.2, 感觉能用 hy3 平替一下(也就一下), 但是这几天降智严重
    主要是太啰嗦了, 思考又多又慢, 虽然配合 work buddy 的记忆挺好, 但是费时间
  • anheiyouxia 08-19 18:15
    14
    我用来写代码,在 cnb 上可以免费用,并且有 vscode 插件可以用,codex 额度用完后等重置期间就用 hy3,感受就是,能写代码,能改 bug,一定程度上能完成需求,但是写的代码那叫一个烂啊,有时候一个功能写出来改 bug 改半天,叫他改自己写的 bug,经常信誓旦旦地说他写的代码没问题,是我自己没更新,或者缓存问题,或者我看错了,总是要告诉他就是他代码问题,都更新了,没缓存,他才能再找一轮最后确认 bug,但是总要改几次才能改完,有时候一个需求,做出来的效果不是我期望的,让她改,她又改成一坨屎.等 codex 额度恢复后,这类反复修改的问题,都是让 codex 重做.

    但是有时候一些功能也能很好地做好,就很随机的样子,如果不是因为免费,而且 codex,我真不想用他,但是应急的时候用它也确实挺好的
  • longaiwp 08-19 18:24
    15
    @nonewind 这个测试符合我的体验感
  • dimlau 08-19 19:22
    16
    我在测试纯聊天的 mcp 的时候用过 hy3 ,聊饥荒竟然触发了规定不给输出了??
  • mingtdlb 08-20 09:04
    17
    @xndeye #2 可拉到吧,比豆包差几个等级,git 都玩不明白。豆包是不怎么样,但没你们说的那么不堪,当然是 api ,不是网页那玩意。
  • superfatboy 08-20 09:09
    18
    感觉不如 dsv4 ,不过是免费的,还能凑乎用
* 帖子来源V2EX
返回