听说 hy4 数学很强

sparklydream 2026-08-29 22:15 1

rt,感觉目前国内只有hy在认真做数学。包括 hyra、推进三维Blaschke–Lebesgue问题这些成果。


但是 frontiermath 上并没有测 hy,现在上面最强的国模还是 qwen3.8max,但也就 gpt5.4 差不多的水平,好像还比 5.4 差一点。


有没有懂ai4math的佬说一下国内这些模型的数学能力为什么不如oa,hy的数学是什么水平,以及还有多久的差距

最新回复 (10)
  • Eevee 08-29 22:17
    1

    这问题很刁钻啊


    懂数学的佬


    不一定知道为什么不如 o 和 A


    更不一定知道还有多久的差距


    这是不可量化的


    至少我是这么觉得的

  • 08-29 22:18
    2

    deepseek 不是主打数学和逻辑吗?

  • sparklydream 楼主 08-29 22:21
    3

    我的感觉是 dpsk 自从 v4 开始就逐渐转向 agentic coding 为中心了,v4 preview 到 GA 也只是说 agent 能力大幅提高。而且在 frontiermath 上也是一坨,甚至不如 glm

  • linuxbest 08-29 22:22
    4

    感觉ysy来tx之后,hunyuan势头很猛啊

  • Kassdin 08-29 22:23
    5

    deepseek上一次主动汇报数学能力还是在v3.2吧

  • Florian 08-29 22:28
    6

    请问 “听说很强” 从何而来呢?在做数学不等于数学很强,hy 到现在一共解决了多少问题呢?数学能力强的前提是基础模型强,在打数学 benchmark 之前先要在那些通用 benchmark 上赶超吧,这些上面现在都差得远,数学怎么可能强呢。


    目前所有吹数学强的国产模型,之前的 qwen max(号称 imo 能拿奖牌还是啥),后来的 k3(x 上有人吹,我专门还开了个 200 块的套餐),没有一个是 research 级别能用的,做本科数学题目都费劲。


    反正国模在通用 benchmark 上没刷分刷过 gpt 之前,我是不会再尝试用国模做数学了。


    顺便说一句,国模数学最接近 gpt 的时候,还是 deepseek R1 那会,后来只能说是走远了。

  • 08-29 22:31
    7

    ^-^往之前看不上的coding方向走了是吧,感觉其实一直做下去,做出一个数学和逻辑很强的模型也是很有用的

  • BOOSTMEISTER 2014 DH 08-29 22:37
    8

    没研究过 ai4math,但有一些信息是可以提供的


    数学能力靠后训练,后训练吃计算资源。这是最直观的链。


    然后 Openai 不用说了,后训练厉害,luna 这种都能很强。A\其实 4.7 之前数学都不行,到 4.8 才算打平手,fable5 赶超,但 token 消耗量大。


    看看 K3 系列下一个版本怎么样吧。我觉得可能稍微能期待一下。


    qwen3.8max 确实是相对好的了。


    别忘了还有普通模型上还有 GPT PRO、Gemini DeepThink(现在估计没了)

  • Florian 08-29 22:42
    9

    后训练比起预训练的消耗,基本上可以忽略不计吧

  • ℬ𝒶𝒾𝒲𝒶𝓃 08-29 22:45
    10

    以前大家讨论模型的数学能力,因为数学这东西天然好判断对错,标准明确,所以早期大家普遍在这一领域发力。


    后来去提升代码能力,一是因为代码数据天然多、质量高,二来也有明确的好坏标准,而且需求巨大,比数学更加容易判断对错,还有编译器、类型检查、格式化等工具直接纠正很多错误节省人力。


    由此可知,凡是具备明确是非、可量化、需求旺盛的领域,AI 都会越来越擅长,超越人类。


    而需要带有审美、感性、主观体验和人类共情的领域(艺术创作、文学表达、情感伦理判断等等等),没有唯一正确的答案,也难以用统一标准衡量,短期里 AI 还无法替代的

* 帖子来源Linux.do
返回