模型训练从零训练一个小 LLM04 - 从单卡到多卡On this page04 - 从单卡到多卡 这一篇把 03 篇的 train.py 改成能在多张卡上跑,产出 train_ddp.py。同时要回答一个问题:多卡到底快了多少,代价是什么。 这也是整个专题里唯一必须真开多卡才能验的一篇。原理和账我会算清楚,但最终那张实测表得在租来的机器上填。 前置:03 篇的单卡训练已经跑通。 零、开始之前:多卡在并行什么