Glossar
Die Sprache der Rechenleistung.
51 Begriffe von GPUs und Netzwerken bis zu Rechenzentren und Beschaffungsmodellen, ohne Fachjargon erklärt.
Hardware
A100Die Rechenzentrums-GPU von NVIDIA der Ampere-Generation, der Vorgänger der H100.B200Eine NVIDIA-Rechenzentrums-GPU der Blackwell-Generation, der Nachfolgearchitektur von Hopper.BeschleunigerEin Chip, der bestimmte Workloads wie KI beschleunigen soll. GPUs sind die bekanntesten Beschleuniger; zu den weiteren zählen TPUs und eigens entwickelte KI-Chips.FLOPSGleitkommaoperationen pro Sekunde: ein Maß für den reinen Rechendurchsatz, häufig in Teraflops oder Petaflops angegeben.GPUEin Grafikprozessor: ein Chip, der dafür gebaut ist, viele Berechnungen parallel auszuführen. GPUs sind die wichtigste Hardware für das Training und den Betrieb von KI-Modellen.H100Die Rechenzentrums-GPU von NVIDIA der Hopper-Generation, die häufig für KI-Training und Inferenz eingesetzt wird. Sie ist in mehreren Formfaktoren erhältlich, darunter SXM und PCIe.H200Eine NVIDIA-GPU der Hopper-Generation, die die Rechenarchitektur der H100 mit größerem und schnellerem Speicher kombiniert.HBMHigh Bandwidth Memory: gestapelter Speicher direkt neben dem GPU-Chip, damit Daten sehr schnell dorthin und von dort zurück übertragen werden können.MI300XDer Rechenzentrums-Beschleuniger AMD Instinct MI300X für KI und Hochleistungsrechnen.PCIePCI Express: die Standardverbindung zwischen einer GPU und dem Rest eines Servers. PCIe-GPUs werden als Steckkarten eingesetzt.SpeicherbandbreiteWie viele Daten eine GPU pro Sekunde aus ihrem Speicher lesen oder in ihn schreiben kann, üblicherweise gemessen in Terabyte pro Sekunde.SXMDer Formfaktor von NVIDIA für gesockelte GPUs, die direkt auf der Server-Platine montiert werden und für NVLink und eine höhere Leistungsaufnahme ausgelegt sind.Tensor CoreSpezialisierte Einheiten in NVIDIA-GPUs, die die Matrixrechnungen im Kern der KI weitaus schneller ausführen als Allzweckkerne.VRAMDer Speicher einer GPU, gemessen in Gigabyte. Er enthält die Modellgewichte, Arbeitsdaten und Caches, solange die GPU läuft.
Netzwerk
InfiniBandEine Hochleistungs-Netzwerktechnologie mit sehr niedriger Latenz, die häufig zur Verbindung von Servern in Clustern für das KI-Training eingesetzt wird.NVLinkDie Hochgeschwindigkeitsverbindung von NVIDIA, die GPUs innerhalb eines Servers direkt miteinander verbindet und deutlich schneller ist als der Standard-PCIe-Bus.NVSwitchEin Switch-Chip, über den jede GPU in einem per NVLink verbundenen Server mit jeder anderen GPU mit voller Geschwindigkeit kommunizieren kann.RoCERDMA over Converged Ethernet: eine Möglichkeit, direkte Speicherübertragungen im InfiniBand-Stil über Ethernet-Netzwerke zu erreichen.
KI-Workloads
Fine-tuningWeitertrainieren eines bestehenden Modells mit einem kleineren, spezifischen Datensatz, um es an eine Aufgabe anzupassen.InferenzAusführen eines trainierten Modells, um Antworten oder Vorhersagen für Nutzer zu erzeugen.KV cacheSpeicher, der Zwischenergebnisse der Attention ablegt, während ein Sprachmodell Text erzeugt, damit sie nicht neu berechnet werden müssen.MIGMulti-Instance GPU: eine NVIDIA-Funktion, die eine GPU in mehrere isolierte, kleinere GPUs aufteilt.Präzision (FP8, BF16, FP16)Das Zahlenformat, das für Berechnungen verwendet wird. Eine niedrigere Präzision wie FP8 benötigt weniger Speicher und läuft schneller, geht aber mit gewissen Einbußen bei der numerischen Genauigkeit einher.TrainingTrainieren eines Modells durch die Verarbeitung großer Datenmengen und die Anpassung seiner Parameter. Dafür sind viele GPUs erforderlich, die tage- oder wochenlang zusammenarbeiten.
Rechenzentren
ColocationMieten von Stellfläche, Strom und Kühlung in einem fremden Rechenzentrum, um die eigene Hardware unterzubringen.DatenresidenzDie Vorgabe, dass Daten in einem bestimmten Land oder einer bestimmten Region gespeichert und verarbeitet werden.FlüssigkeitskühlungWärmeabfuhr mit einer Flüssigkeit statt mit Luft, entweder am Chip oder am gesamten Rack. Sie bewältigt deutlich höhere Leistungsdichten als Luft.Megawatt (MW)Eine Leistungseinheit, die einer Million Watt entspricht. Die Kapazität eines Rechenzentrums wird üblicherweise in Megawatt verfügbarer Leistung angegeben.PUEPower Usage Effectiveness: die gesamte Energie einer Anlage geteilt durch die von der IT-Ausstattung verbrauchte Energie. Ein Wert näher an 1 bedeutet, dass weniger Energie für Nebenverbraucher wie die Kühlung aufgewendet wird.Rack-DichteWie viel Leistung jedes Server-Rack bereitstellen und kühlen kann, gemessen in Kilowatt pro Rack.RegionEin geografisches Gebiet, in dem ein Anbieter Kapazität anbietet, etwa eine Stadt, eine Metropolregion oder ein Land.TDPThermal Design Power: die Wärmemenge, die ein Chip nach seiner Auslegung erzeugt, und in etwa die Leistung, die er unter Last aufnimmt, in Watt.
Rechenleistung kaufen
Bare metalMieten eines gesamten physischen Servers ohne Virtualisierungsschicht zwischen Ihnen und der Hardware.ClusterEine Gruppe von Servern, die über ein schnelles Netzwerk verbunden sind, damit sie gemeinsam an einer Aufgabe arbeiten können.EgressDaten, die das Netzwerk eines Anbieters verlassen; manche Anbieter berechnen dies pro Gigabyte.GPU-hourEine GPU, die eine Stunde lang genutzt wird. Sie ist die Standardeinheit zum Vergleich von Preisen für Rechenleistung.HyperscalerEin sehr großer Cloud-Anbieter, etwa die großen öffentlichen Clouds, der Rechenzentren im globalen Maßstab betreibt.KnotenEin Server in einem Cluster. Ein GPU-Knoten enthält in der Regel mehrere GPUs, üblicherweise acht.Laufzeit mit BindungDer Zeitraum, für den ein Käufer die Zahlung für Kapazität zusagt, zum Beispiel ein, drei oder zwölf Monate.NeocloudEin neuerer Cloud-Anbieter, der sich auf GPU- und KI-Infrastruktur spezialisiert hat statt auf allgemeine Cloud-Dienste.On-demandStunden- oder minutenweises Mieten von Rechenleistung ohne lange Bindung. Sie können nach Belieben starten und stoppen, vorbehaltlich der Verfügbarkeit.Reservierte KapazitätDie Verpflichtung, Rechenleistung für eine feste Laufzeit, oft mehrere Monate, zu nutzen, im Austausch gegen einen niedrigeren Preis oder garantierte Verfügbarkeit.SLAService-Level-Agreement: die schriftliche Zusage eines Anbieters zu Aspekten wie der Uptime, mit Abhilfen bei Nichteinhaltung.Spot (unterbrechbar)Überschüssige Kapazität, die mit Preisabschlag angeboten wird und die der Anbieter kurzfristig zurückholen kann.
Kovara
Compute IndexDer Benchmark von Kovara für Preise und Verfügbarkeit von Rechenleistung, berechnet aus unabhängigen Beiträgen von Anbietern nach einer veröffentlichten Methodik.FixingEin offizieller, veröffentlichter Benchmark-Wert des Compute Index, erfasst mit der verwendeten Methodikversion und nie stillschweigend überschrieben.Indikativer PreisEine Live-Schätzung, die nicht als offizielles Fixing veröffentlicht wurde. Sie ist als indikativ gekennzeichnet, damit sie nie mit einem Fixing verwechselt wird.KonfidenzgradDie A–D-Bewertung von Kovara dazu, wie gut eine Tatsache belegt ist: A hochgradig verifiziert, B starke Belege, C unvollständige Belege, D Schätzung oder nicht verifiziert.Normalisierter PreisEin Preis, der in eine gemeinsame Einheit umgerechnet wurde, etwa US-Dollar pro GPU-hour, damit unterschiedliche Angebote verglichen werden können.VerfügbarkeitsstatusOb ein Angebot „Verfügbar“, „Eingeschränkt“ oder „Nicht verfügbar“ ist oder unbekannt, wenn die Quelle dazu nichts angibt.Verified ProviderEin Anbieter, dessen Identität von einer Person bei Kovara geprüft wurde. Der Status wird nie automatisch vergeben.
Fehlt ein Begriff?
Bitten Sie Kova, Ihnen alles zu Chips, Netzwerken oder Rechenzentren zu erklären, oder sagen Sie uns, was wir ergänzen sollen.
