Słownik
Język mocy obliczeniowej.
51 pojęć, od GPU i sieci po centra danych i modele zakupu, wyjaśnionych bez żargonu.
Hardware
A100GPU NVIDIA generacji Ampere do centrów danych, poprzednik H100.AkceleratorUkład zaprojektowany do przyspieszania określonych obciążeń, takich jak AI. GPU to najbardziej znane akceleratory; inne to m.in. TPU i niestandardowe układy AI.B200GPU NVIDIA do centrów danych z generacji Blackwell, architektury będącej następczynią Hopper.FLOPSOperacje zmiennoprzecinkowe na sekundę: miara surowej przepustowości obliczeniowej, często podawana w teraflopach lub petaflopach.GPUProcesor graficzny: układ zaprojektowany do wykonywania wielu obliczeń równolegle. GPU to główny sprzęt do trenowania i uruchamiania modeli AI.H100GPU NVIDIA generacji Hopper do centrów danych, szeroko stosowany do trenowania i inferencji AI. Występuje w kilku formatach, w tym SXM i PCIe.H200GPU NVIDIA generacji Hopper, który łączy konstrukcję obliczeniową H100 z większą i szybszą pamięcią.HBMHigh Bandwidth Memory: pamięć w stosach umieszczona obok układu GPU, dzięki czemu dane mogą bardzo szybko do niego trafiać i z niego wychodzić.MI300XAkcelerator AMD Instinct MI300X do centrów danych, przeznaczony do AI i obliczeń wysokiej wydajności.PCIePCI Express: standardowe połączenie między GPU a resztą serwera. GPU PCIe montuje się jako karty.Przepustowość pamięciIlość danych, jaką GPU może co sekundę odczytać z pamięci lub do niej zapisać, zwykle mierzona w terabajtach na sekundę.SXMFormat GPU NVIDIA montowany w gnieździe bezpośrednio na płycie serwera, zaprojektowany z myślą o NVLink i wyższym poborze mocy.Tensor CoreWyspecjalizowane jednostki w GPU NVIDIA, które wykonują obliczenia macierzowe, stanowiące serce AI, znacznie szybciej niż rdzenie ogólnego przeznaczenia.VRAMPamięć GPU mierzona w gigabajtach. Przechowuje wagi modelu, dane robocze i bufory podczas pracy GPU.
Sieci
InfiniBandWysokowydajna technologia sieciowa o bardzo niskich opóźnieniach, szeroko stosowana do łączenia serwerów w klastrach treningowych AI.NVLinkSzybkie połączenie NVIDIA, które łączy GPU bezpośrednio ze sobą wewnątrz serwera, znacznie szybsze niż standardowa magistrala PCIe.NVSwitchUkład przełączający, który pozwala każdemu GPU w serwerze połączonym przez NVLink komunikować się z każdym innym GPU z pełną szybkością.RoCERDMA over Converged Ethernet: sposób na uzyskanie bezpośrednich transferów pamięci w stylu InfiniBand w sieciach Ethernet.
Obciążenia AI
Fine-tuningDalsze trenowanie istniejącego modelu na mniejszym, specyficznym zbiorze danych, aby dostosować go do zadania.InferencjaUruchamianie wytrenowanego modelu w celu generowania odpowiedzi lub predykcji dla użytkowników.KV cachePamięć przechowująca pośrednie wyniki mechanizmu uwagi podczas generowania tekstu przez model językowy, aby nie trzeba było ich ponownie obliczać.MIGMulti-Instance GPU: funkcja NVIDIA, która dzieli jeden GPU na kilka odizolowanych mniejszych GPU.Precyzja (FP8, BF16, FP16)Format liczbowy używany w obliczeniach. Niższa precyzja, np. FP8, zużywa mniej pamięci i działa szybciej kosztem pewnej utraty dokładności numerycznej.TreningUczenie modelu przez przetwarzanie dużych ilości danych i dostosowywanie jego parametrów. Wymaga wielu GPU pracujących razem przez dni lub tygodnie.
Centra danych
Chłodzenie ciecząOdprowadzanie ciepła za pomocą cieczy zamiast powietrza, na poziomie układu lub całej szafy. Radzi sobie ze znacznie większą gęstością mocy niż powietrze.ColocationWynajem powierzchni, zasilania i chłodzenia w cudzym centrum danych w celu umieszczenia własnego sprzętu.Gęstość szafIle mocy może dostarczyć i odprowadzić w postaci ciepła każda szafa serwerowa, mierzone w kilowatach na szafę.Megawatt (MW)Jednostka mocy równa milionowi watów. Pojemność centrum danych opisuje się zwykle w megawatach dostępnej mocy.PUEPower Usage Effectiveness: całkowita energia obiektu podzielona przez energię zużywaną przez sprzęt IT. Wartość bliższa 1 oznacza, że mniej energii idzie na koszty dodatkowe, takie jak chłodzenie.RegionObszar geograficzny, w którym dostawca oferuje moc, np. miasto, aglomeracja lub kraj.Rezydencja danychWymóg przechowywania i przetwarzania danych w określonym kraju lub regionie.TDPThermal design power: ilość ciepła, jaką układ ma wytwarzać zgodnie z projektem, i w przybliżeniu moc pobierana pod obciążeniem, w watach.
Zakup mocy obliczeniowej
Bare metalWynajem całego fizycznego serwera bez warstwy wirtualizacji między tobą a sprzętem.ClusterGrupa serwerów połączonych szybką siecią, aby mogły wspólnie pracować nad jednym zadaniem.EgressDane opuszczające sieć dostawcy, za które niektórzy dostawcy pobierają opłatę za gigabajt.GPU-hourJeden GPU używany przez jedną godzinę. To standardowa jednostka do porównywania cen mocy obliczeniowej.HyperscalerBardzo duży dostawca chmury, np. jedna z głównych chmur publicznych, prowadzący centra danych w skali globalnej.Moc rezerwowanaZobowiązanie do korzystania z mocy obliczeniowej przez stały okres, często kilka miesięcy, w zamian za niższą cenę lub gwarantowaną dostępność.NeocloudNowszy dostawca chmury, który specjalizuje się w infrastrukturze GPU i AI zamiast w chmurowych usługach ogólnego przeznaczenia.Okres z zobowiązaniemOkres, za który kupujący zgadza się płacić za moc, np. jeden, trzy lub dwanaście miesięcy.On-demandWynajem mocy obliczeniowej na godziny lub minuty bez długiego zobowiązania. Możesz uruchamiać i zatrzymywać, kiedy chcesz, w miarę dostępności.SLAUmowa o poziomie usług: pisemne zobowiązanie dostawcy dotyczące np. dostępności usługi, z rekompensatą w razie jego niedotrzymania.Spot (z możliwością przerwania)Wolna moc oferowana z rabatem, którą dostawca może odebrać z krótkim wyprzedzeniem.WęzełJeden serwer w klastrze. Węzeł GPU zawiera zwykle kilka GPU, najczęściej osiem.
Kovara
Cena orientacyjnaBieżący szacunek, który nie został opublikowany jako oficjalny fixing. Jest oznaczony jako orientacyjny, aby nigdy nie pomylić go z fixingiem.Cena znormalizowanaCena przeliczona na wspólną jednostkę, np. dolary amerykańskie za GPU-hour, aby można było porównywać różne oferty.Compute IndexBenchmark Kovara dla cen i dostępności mocy obliczeniowej, obliczany na podstawie niezależnych danych od dostawców według opublikowanej metodologii.FixingOficjalna opublikowana wartość benchmarku z Compute Index, zapisana wraz z użytą wersją metodologii i nigdy nie nadpisywana po cichu.Ocena pewnościOcena Kovara w skali A–D, opisująca, jak dobrze fakt jest poparty: A wysoce zweryfikowane, B mocne dowody, C niepełne dowody, D szacunek lub niezweryfikowane.Status dostępnościCzy oferta jest Dostępna, Ograniczona czy Niedostępna, albo nieznana, gdy źródło tego nie podaje.Verified ProviderDostawca, którego tożsamość sprawdził pracownik Kovara. Status nigdy nie jest przyznawany automatycznie.
Brakuje jakiegoś pojęcia?
Poproś asystenta Kova o wyjaśnienie czegokolwiek na temat układów, sieci czy centrów danych albo powiedz nam, co dodać.
