К этому еще добавлю, что для multi GPU сервера я бы обязательно смотрел на топологию PCI Express. Само наличие двух или четырех мощных GPU еще не означает, что они смогут эффективно обмениваться данными между собой. Если обучение идет через PyTorch DDP и каждая карта обрабатывает свою часть batch, обмен градиентами становится постоянной операцией. Тут уже важны количество линий PCI Express, архитектура процессора и то, как именно GPU подключены к CPU. При неудачной топологии часть производительности можно потерять именно на передаче данных. То же касается системной памяти. Если используется несколько GPU, 64 ГБ RAM может оказаться мало даже при нормальном объеме VRAM. Датасет, кеш, процессы подготовки данных и несколько worker процессов тоже потребляют память. Для серьезного обучения я бы уже смотрел 128 или 256 ГБ RAM. Еще один момент это NVMe. Если несколько GPU одновременно ждут данные с диска, дорогие видеокарты начинают простаивать. Поэтому для обучения на больших датасетах я бы проверял не только модель GPU, но и скорость чтения, количество NVMe и то, как организовано хранение исходных данных.
|