我觉得目前小模型的训练方向都跑偏了

qdwang 2026-09-25 17:59 1

小模型(<10B 的模型)都学着 qwen 去卷 agentic 了。但是编程的人,总会用更大的模型来达到高效率。


反而小模型应该深耕的语言方向,移动端对话方向,都荒废了。


测了近 10 个最新的小模型,只有 Gemma4 E4B 能做好我需求的特定模版下的翻译加分析句子任务。


一个个 benchmark 分数越来越高,却都忽略了最原本的语言能力。

最新回复 (5)
  • Yuk1Nooo 09-25 21:08
    1楼
    我觉得 op 在一定程度上有点倒果为因了,因为小模型也都是用更大的模型当教师模型训/蒸馏出来的。不过当前确实存在如 op 所说的问题。
  • yexiaoqi 09-25 21:55
    2楼
    大模型还没内卷到一定的高度,小模型方向就不会定型吧
  • qdwang 楼主 09-26 11:06
    3楼
    @Yuk1Nooo 嗯嗯
  • cccn 09-26 19:47
    4楼
    顺便问下。哪个小模型的英文教学能力比较强
  • qdwang 楼主 09-26 20:46
    5楼
    @cccn 我测下来,语言方面 10B 以下的,应该 E4B 是第一了。有条件的话,你可以试试 K2-Horizon-7B ,这个应该更强,但是官方版 llama.cpp 还没支持,所以我还没测过。
* 帖子来源V2EX
返回