Если задача связана с LLM, я бы смотрел не только на объем VRAM. Для инференса важны пропускная способность памяти, поддерживаемая точность вычислений и количество одновременных запросов. При большой нагрузке дополнительная память расходуется на KV cache, поэтому карта, на которой модель просто запускается, не всегда подойдет для нормальной работы с несколькими пользователями. Для небольших и средних моделей хорошим вариантом выглядит RTX 5090 с 32 ГБ GDDR7. Она поддерживает FP4 и FP8 и подходит для инференса, LoRA и QLoRA. В Hostkey такие серверы можно арендовать как с выделенным физическим сервером, так и в виртуальном варианте с GPU passthrough. В последнем случае видеокарта целиком закрепляется за виртуальной машиной и не делится между пользователями.
|