Glossario
Il linguaggio della capacità di calcolo.
51 termini, dalle GPU e dalle reti ai data center e ai modelli di acquisto, spiegati senza gergo.
Hardware
A100La GPU NVIDIA per data center della generazione Ampere, predecessore dell’H100.AcceleratoreUn chip progettato per accelerare carichi di lavoro specifici, come quelli di IA. Le GPU sono gli acceleratori più noti; ne esistono altri, tra cui le TPU e i chip di IA personalizzati.B200Una GPU NVIDIA per data center della generazione Blackwell, l’architettura che succede a Hopper.FLOPSOperazioni in virgola mobile al secondo: una misura della capacità di elaborazione grezza, spesso indicata in teraflop o petaflop.GPUUn’unità di elaborazione grafica: un chip progettato per eseguire molti calcoli in parallelo. Le GPU sono l’hardware principale per addestrare ed eseguire i modelli di IA.H100La GPU per data center di NVIDIA della generazione Hopper, molto usata per l’addestramento e l’inferenza dell’IA. È disponibile in diversi form factor, tra cui SXM e PCIe.H200Una GPU NVIDIA della generazione Hopper che abbina l’architettura di calcolo dell’H100 a una memoria più ampia e più veloce.HBMHigh Bandwidth Memory: memoria impilata, posta accanto al chip della GPU, in modo che i dati possano spostarsi da e verso di esso molto rapidamente.Larghezza di banda della memoriaQuanti dati una GPU può leggere dalla propria memoria o scrivervi ogni secondo, di solito misurati in terabyte al secondo.MI300XL’acceleratore AMD Instinct MI300X per data center, pensato per l’IA e per il calcolo ad alte prestazioni.PCIePCI Express: la connessione standard tra una GPU e il resto di un server. Le GPU PCIe si inseriscono come schede.SXMIl form factor con socket di NVIDIA per le GPU, montato direttamente sulla scheda del server e progettato per NVLink e per una potenza più elevata.Tensor CoreUnità specializzate all’interno delle GPU NVIDIA che eseguono il calcolo matriciale al centro dell’IA molto più velocemente dei core di uso generale.VRAMLa memoria di una GPU, misurata in gigabyte. Contiene i pesi del modello, i dati di lavoro e le cache mentre la GPU è in funzione.
Rete
InfiniBandUna tecnologia di rete ad alte prestazioni, con latenza molto bassa, molto usata per collegare i server nei cluster di addestramento dell’IA.NVLinkIl collegamento ad alta velocità di NVIDIA che connette le GPU direttamente tra loro all’interno di un server, molto più veloce del bus PCIe standard.NVSwitchUn chip switch che permette a ogni GPU di un server collegato con NVLink di comunicare con ogni altra GPU a piena velocità.RoCERDMA over Converged Ethernet: un modo per ottenere, su reti Ethernet, trasferimenti diretti di memoria in stile InfiniBand.
Carichi di lavoro IA
AddestramentoInsegnare a un modello elaborando grandi quantità di dati e regolandone i parametri. Richiede molte GPU che lavorano insieme per giorni o settimane.Fine-tuningAddestrare ulteriormente un modello esistente su un insieme di dati più piccolo e specifico per adattarlo a un compito.InferenzaEseguire un modello addestrato per produrre risposte o previsioni per gli utenti.KV cacheMemoria che conserva i risultati intermedi dell’attention mentre un modello linguistico genera testo, così da non doverli ricalcolare.MIGMulti-Instance GPU: una funzione NVIDIA che divide una GPU in più GPU più piccole e isolate.Precisione (FP8, BF16, FP16)Il formato numerico usato per i calcoli. Una precisione più bassa, come FP8, usa meno memoria ed è più veloce, a costo di una certa accuratezza numerica.
Data center
ColocationAffittare spazio, alimentazione e raffreddamento in un data center altrui per ospitare il proprio hardware.Densità dei rackQuanta potenza ogni rack di server può fornire e raffreddare, misurata in kilowatt per rack.Megawatt (MW)Un’unità di potenza pari a un milione di watt. La capacità di un data center viene di solito descritta in megawatt di potenza disponibile.PUEPower Usage Effectiveness: l’energia totale della struttura divisa per l’energia usata dalle apparecchiature IT. Un valore più vicino a 1 significa che si spende meno energia per funzioni accessorie come il raffreddamento.Raffreddamento a liquidoRimozione del calore con un liquido invece che con l’aria, a livello del chip o dell’intero rack. Gestisce densità di potenza molto più elevate dell’aria.RegioneUn’area geografica in cui un provider offre capacità, come una città, un’area metropolitana o un paese.Residenza dei datiIl requisito che i dati siano archiviati ed elaborati in un paese o in una regione specifici.TDPThermal design power: la quantità di calore che un chip è progettato per produrre e, all’incirca, la potenza che assorbe sotto carico, in watt.
Acquistare capacità di calcolo
Bare metalNoleggiare un intero server fisico, senza alcun livello di virtualizzazione tra te e l’hardware.Capacità riservata (reserved)Impegnarsi a usare capacità di calcolo per un periodo fisso, spesso di mesi, in cambio di un prezzo più basso o di una disponibilità garantita.ClusterUn gruppo di server collegati da una rete veloce in modo da lavorare insieme a un unico lavoro.Durata con impegnoIl periodo di tempo per cui un acquirente accetta di pagare la capacità, per esempio uno, tre o dodici mesi.EgressI dati in uscita dalla rete di un provider, che alcuni provider fanno pagare per gigabyte.GPU-hourUna GPU usata per un’ora. È l’unità standard per confrontare i prezzi della capacità di calcolo.HyperscalerUn provider cloud molto grande, come i principali cloud pubblici, che gestisce data center su scala globale.NeocloudUn provider cloud più recente, specializzato in infrastrutture per GPU e IA anziché in servizi cloud generici.NodoUn server di un cluster. Un nodo GPU contiene in genere più GPU, di solito otto.On-demandNoleggiare capacità di calcolo a ore o a minuti, senza impegni a lungo termine. Puoi avviare e fermare quando vuoi, in base alla disponibilità.SLAService level agreement: l’impegno scritto di un provider su aspetti come l’uptime, con rimedi in caso di mancato rispetto.Spot (interrompibile)Capacità in eccesso offerta a prezzo scontato che il provider può riprendersi con breve preavviso.
Kovara
Compute IndexIl benchmark di Kovara per i prezzi e la disponibilità della capacità di calcolo, calcolato a partire da contributi indipendenti dei provider con una metodologia pubblicata.FixingUn valore di benchmark ufficiale pubblicato dal Compute Index, registrato con la versione della metodologia usata e mai riscritto senza dichiararlo.Grado di confidenzaLa valutazione A–D di Kovara su quanto un fatto sia supportato: A altamente verificato, B evidenze solide, C evidenze incomplete, D stima o non verificato.Prezzo indicativoUna stima in tempo reale che non è stata pubblicata come fixing ufficiale. È etichettata come indicativa, così non viene mai scambiata per un fixing.Prezzo normalizzatoUn prezzo convertito in un’unità comune, come i dollari statunitensi per GPU-hour, in modo che offerte diverse possano essere confrontate.Stato di disponibilitàSe un’offerta è Disponibile, Limitata o Non disponibile, oppure sconosciuta quando la fonte non lo dice.Verified ProviderUn provider la cui identità è stata esaminata da una persona di Kovara. Lo stato non viene mai concesso automaticamente.
Manca un termine?
Chiedi a Kova di spiegarti qualsiasi cosa su chip, reti o data center, oppure dicci che cosa aggiungere.
