很强,很强!
大量使用了KataGo的训练思路,目前使用了64通道、6层残差网络的小模型,Value 和 Policy 双头,200万条训练数据,2轮训练,NN/MCTS混合策略64步模拟已经超过了小白瞎鸡儿玩的水准。
目前理论跑通,下一步把6b(这里的b指的是ResNet层数,不是Billion)的模型训练到差不多分数后,扩展残差层和输入通道。
最后目标是纯网络一步输出,不搜索,直接一步前向传播直接到胃。
向大佬学习一下