Træning af store modeller
Træning af en stor model betyder, at mange GPU’er arbejder sammen på ét job. Kørslen er kun så hurtig som det langsomste led, så netværk og hukommelse betyder lige så meget som GPU-modellen.
Det vigtigste
GPU-til-GPU-båndbredde
Inde i en server kommunikerer NVLink-forbundne SXM-GPU’er langt hurtigere end PCIe-kort. Kommunikationstunge job har størst gavn af det.
Netværk i clusteren
På tværs af servere holder InfiniBand eller et velbygget RoCE-fabric GPU’erne beskæftiget. Spørg, hvilket netværk et cluster-tilbud reelt omfatter.
Hukommelse pr. GPU
Mere HBM pr. GPU betyder større batchstørrelser eller færre shards. Kontrollér VRAM, før du sammenligner priser.
Sammenhængende kapacitet
Træning kræver mange GPU’er samme sted på samme tid, så bekræftet tilgængelighed betyder lige så meget som prisen.
En typisk opsætning
Nyere datacenter-GPU’er (Hopper- eller Blackwell-klassen) i SXM-formfaktor, otte pr. node, forbundet med InfiniBand eller tilsvarende, i én region.
Sådan købes det typisk
Reserveret eller bunden kapacitet eller en dedikeret cluster er almindeligt, fordi kørslerne er lange og kræver garanteret tilgængelighed. Bare metal er populært på grund af kontrol og ensartet ydeevne.
Almindelige fejl
- At sammenligne priser pr. GPU uden at kontrollere interconnect.
- At antage, at en listepris betyder, at GPU’erne er ledige på din startdato.
- At ignorere omkostninger til egress og lagring af checkpoints og datasæt.
Begreber, du bør kende
Dette er generel vejledning, ikke en anbefaling af en bestemt udbyder eller pris. Se de aktuelle tilbud, og bekræft tilgængelighed og vilkår med udbyderen.
Klar til at se på reelle muligheder?
Se fulgte tilbud med deres kilder og datoer, eller bed Kova om at dimensionere det for dig.
