Glossaire
Le langage de la capacité de calcul.
51 termes allant des GPU et des réseaux aux centres de données et aux modèles d’achat, expliqués sans jargon.
Matériel
A100Le GPU NVIDIA pour centres de données de la génération Ampere, prédécesseur du H100.AccélérateurUne puce conçue pour accélérer des charges de travail spécifiques, comme l’IA. Les GPU sont les accélérateurs les plus connus ; il en existe d’autres, notamment les TPU et les puces d’IA personnalisées.B200Un GPU NVIDIA pour centres de données de la génération Blackwell, l’architecture qui succède à Hopper.Bande passante mémoireLa quantité de données qu’un GPU peut lire dans sa mémoire ou y écrire chaque seconde, généralement mesurée en téraoctets par seconde.FLOPSOpérations en virgule flottante par seconde : une mesure du débit de calcul brut, souvent exprimée en téraflops ou en pétaflops.GPUUn processeur graphique : une puce conçue pour exécuter de nombreux calculs en parallèle. Les GPU sont le principal matériel pour entraîner et exécuter des modèles d’IA.H100Le GPU pour centres de données de NVIDIA de la génération Hopper, largement utilisé pour l’entraînement et l’inférence de l’IA. Il existe en plusieurs facteurs de forme, dont SXM et PCIe.H200Un GPU NVIDIA de la génération Hopper qui associe l’architecture de calcul du H100 à une mémoire plus grande et plus rapide.HBMHigh Bandwidth Memory : mémoire empilée placée à côté de la puce GPU, afin que les données puissent circuler très rapidement vers la puce et depuis celle-ci.MI300XL’accélérateur AMD Instinct MI300X pour centres de données, destiné à l’IA et au calcul haute performance.PCIePCI Express : la connexion standard entre un GPU et le reste d’un serveur. Les GPU PCIe se branchent sous forme de cartes.SXMLe facteur de forme de GPU à socket de NVIDIA, monté directement sur la carte du serveur et conçu pour NVLink et une puissance plus élevée.Tensor CoreDes unités spécialisées à l’intérieur des GPU NVIDIA qui effectuent le calcul matriciel au cœur de l’IA bien plus rapidement que les cœurs à usage général.VRAMLa mémoire d’un GPU, mesurée en gigaoctets. Elle contient les poids du modèle, les données de travail et les caches pendant que le GPU fonctionne.
Réseau
InfiniBandUne technologie réseau haute performance, à très faible latence, largement utilisée pour relier les serveurs dans les clusters d’entraînement d’IA.NVLinkLa liaison haute vitesse de NVIDIA qui relie les GPU directement entre eux à l’intérieur d’un serveur, bien plus rapide que le bus PCIe standard.NVSwitchUne puce de commutation qui permet à chaque GPU d’un serveur relié par NVLink de communiquer avec tous les autres GPU à pleine vitesse.RoCERDMA over Converged Ethernet : un moyen d’obtenir, sur des réseaux Ethernet, des transferts directs de mémoire de type InfiniBand.
Charges de travail d’IA
EntraînementEntraîner un modèle en traitant de grandes quantités de données et en ajustant ses paramètres. Cela nécessite de nombreux GPU qui travaillent ensemble pendant des jours ou des semaines.Fine-tuningPoursuivre l’entraînement d’un modèle existant sur un jeu de données plus petit et spécifique afin de l’adapter à une tâche.InférenceExécuter un modèle entraîné pour produire des réponses ou des prédictions destinées aux utilisateurs.KV cacheMémoire qui stocke les résultats intermédiaires de l’attention pendant qu’un modèle de langage génère du texte, afin qu’ils n’aient pas à être recalculés.MIGMulti-Instance GPU : une fonction de NVIDIA qui divise un GPU en plusieurs GPU plus petits et isolés.Précision (FP8, BF16, FP16)Le format numérique utilisé pour les calculs. Une précision plus faible, comme le FP8, utilise moins de mémoire et s’exécute plus vite, au prix d’une certaine perte d’exactitude numérique.
Centres de données
ColocationLouer de l’espace, de l’alimentation électrique et du refroidissement dans le centre de données d’un tiers pour héberger votre propre matériel.Densité des racksLa puissance que chaque rack de serveurs peut fournir et refroidir, mesurée en kilowatts par rack.Megawatt (MW)Une unité de puissance égale à un million de watts. La capacité d’un centre de données est généralement décrite en mégawatts de puissance disponible.PUEPower Usage Effectiveness : l’énergie totale de l’installation divisée par l’énergie consommée par les équipements IT. Une valeur plus proche de 1 signifie que moins d’énergie est consacrée aux usages annexes, comme le refroidissement.Refroidissement liquideÉvacuation de la chaleur au moyen d’un liquide plutôt que de l’air, soit au niveau de la puce, soit à l’échelle du rack. Elle permet de gérer des densités de puissance bien plus élevées qu’avec l’air.RégionUne zone géographique dans laquelle un fournisseur propose de la capacité, comme une ville, une zone métropolitaine ou un pays.Résidence des donnéesL’exigence que les données soient stockées et traitées dans un pays ou une région précis.TDPThermal design power : la quantité de chaleur qu’une puce est conçue pour produire et, approximativement, la puissance qu’elle consomme en charge, en watts.
Acheter de la capacité de calcul
Bare metalLouer un serveur physique entier, sans couche de virtualisation entre vous et le matériel.Capacité réservéeS’engager à utiliser de la capacité de calcul pour une durée fixe, souvent de plusieurs mois, en échange d’un prix plus bas ou d’une disponibilité garantie.ClusterUn groupe de serveurs reliés par un réseau rapide afin de pouvoir travailler ensemble sur une même tâche.Durée avec engagementLa durée pendant laquelle un acheteur accepte de payer la capacité, par exemple un, trois ou douze mois.EgressLes données qui sortent du réseau d’un fournisseur, que certains fournisseurs facturent au gigaoctet.GPU-hourUn GPU utilisé pendant une heure. C’est l’unité standard pour comparer les prix de la capacité de calcul.HyperscalerUn très grand fournisseur de cloud, comme les principaux clouds publics, qui exploite des centres de données à l’échelle mondiale.NeocloudUn fournisseur de cloud plus récent, spécialisé dans l’infrastructure GPU et d’IA plutôt que dans les services cloud généralistes.NœudUn serveur d’un cluster. Un nœud GPU contient généralement plusieurs GPU, le plus souvent huit.On-demandLouer de la capacité de calcul à l’heure ou à la minute, sans engagement à long terme. Vous pouvez démarrer et arrêter quand vous le souhaitez, sous réserve de disponibilité.SLAAccord de niveau de service : l’engagement écrit d’un fournisseur sur des points tels que l’uptime, avec des recours en cas de non-respect.Spot (interruptible)Capacité excédentaire proposée à prix réduit, que le fournisseur peut reprendre avec un court préavis.
Kovara
Compute IndexLe benchmark de Kovara pour les prix et la disponibilité de la capacité de calcul, calculé à partir de contributions indépendantes de fournisseurs selon une méthodologie publiée.FixingUne valeur de benchmark officielle publiée par le Compute Index, enregistrée avec la version de la méthodologie utilisée et jamais réécrite en silence.Niveau de confianceL’évaluation A–D de Kovara indiquant dans quelle mesure un fait est étayé : A hautement vérifié, B preuves solides, C preuves incomplètes, D estimation ou non vérifié.Prix indicatifUne estimation en direct qui n’a pas été publiée comme fixing officiel. Elle est étiquetée comme indicative afin de ne jamais être confondue avec un fixing.Prix normaliséUn prix converti dans une unité commune, comme les dollars américains par GPU-hour, afin de pouvoir comparer différentes offres.Statut de disponibilitéIndique si une offre est disponible, limitée ou indisponible, ou inconnue lorsque la source ne le précise pas.Verified ProviderUn fournisseur dont l’identité a été examinée par une personne chez Kovara. Ce statut n’est jamais attribué automatiquement.
Il manque un terme ?
Demandez à Kova de vous expliquer tout ce qui concerne les puces, les réseaux ou les centres de données, ou dites-nous ce qu’il faut ajouter.
