Trenowanie dużych modeli
Trenowanie dużego modelu oznacza wiele GPU pracujących razem nad jednym zadaniem. Przebieg jest tak szybki jak jego najwolniejsze ogniwo, więc sieć i pamięć mają takie samo znaczenie jak model GPU.
Co jest najważniejsze
Przepustowość GPU–GPU
Wewnątrz serwera GPU SXM połączone przez NVLink komunikują się znacznie szybciej niż karty PCIe. Najwięcej zyskują zadania intensywnie wykorzystujące komunikację.
Sieć klastra
Między serwerami InfiniBand lub dobrze zbudowana sieć RoCE utrzymują GPU w pełnym obciążeniu. Zapytaj, jaką sieć faktycznie obejmuje oferta klastra.
Pamięć na GPU
Więcej HBM na GPU oznacza większe partie lub mniej fragmentów modelu. Sprawdź VRAM przed porównaniem cen.
Ciągła dostępność mocy
Trening wymaga wielu GPU w tym samym miejscu i w tym samym czasie, więc potwierdzona dostępność ma takie samo znaczenie jak cena.
Typowa konfiguracja
Nowe GPU do centrów danych (klasy Hopper lub Blackwell) w formacie SXM, po osiem na węzeł, połączone przez InfiniBand lub odpowiednik, w jednym regionie.
Jak to się zwykle kupuje
Często wybiera się moc rezerwowaną lub z zobowiązaniem albo dedykowany klaster, ponieważ przebiegi są długie i wymagają gwarantowanej dostępności. Bare metal jest popularny ze względu na kontrolę i stałą wydajność.
Częste błędy
- Porównywanie cen za GPU bez sprawdzenia połączeń międzywęzłowych.
- Zakładanie, że cena z cennika oznacza, że GPU będą wolne w wybranym terminie.
- Pomijanie kosztów egress i pamięci masowej dla checkpointów i zbiorów danych.
Pojęcia, które warto znać
To ogólne wskazówki, a nie rekomendacja konkretnego dostawcy ani ceny. Sprawdź bieżące oferty i potwierdź dostępność oraz warunki u dostawcy.
Chcesz zobaczyć prawdziwe opcje?
Zobacz śledzone oferty z ich źródłami i datami albo poproś asystenta Kova o dobór rozmiaru.
