Ordlista
Språket för beräkningskapacitet.
51 begrepp från GPU:er och nätverk till datacenter och köpmodeller, förklarade utan jargong.
Hardware
A100NVIDIA:s datacenter-GPU av Ampere-generationen, föregångaren till H100.AcceleratorEtt chip som är utformat för att snabba upp specifika arbetslaster, till exempel AI. GPU:er är de mest kända acceleratorerna; andra är TPU:er och specialbyggda AI-chip.B200En NVIDIA-GPU för datacenter av Blackwell-generationen, efterföljararkitekturen till Hopper.FLOPSFlyttalsoperationer per sekund: ett mått på rå beräkningsprestanda, ofta angivet i teraflops eller petaflops.GPUEn grafikprocessor: ett chip byggt för att köra många beräkningar parallellt. GPU:er är den viktigaste hårdvaran för att träna och köra AI-modeller.H100NVIDIA:s datacenter-GPU av Hopper-generationen, som används i stor utsträckning för AI-träning och inferens. Den finns i flera formfaktorer, bland annat SXM och PCIe.H200En NVIDIA-GPU av Hopper-generationen som kombinerar H100:s beräkningsarkitektur med större och snabbare minne.HBMHigh Bandwidth Memory: staplat minne placerat bredvid GPU-chippet så att data kan flyttas till och från det mycket snabbt.MI300XAMD:s accelerator Instinct MI300X för datacenter, avsedd för AI och högprestandaberäkningar.MinnesbandbreddHur mycket data en GPU kan läsa från eller skriva till sitt minne varje sekund, oftast mätt i terabyte per sekund.PCIePCI Express: standardanslutningen mellan en GPU och resten av en server. PCIe-GPU:er ansluts som kort.SXMNVIDIA:s sockelmonterade formfaktor för GPU:er, monterad direkt på ett serverkort och utformad för NVLink och högre effekt.Tensor CoreSpecialiserade enheter i NVIDIA-GPU:er som utför matrisberäkningarna i kärnan av AI betydligt snabbare än kärnor för allmänna ändamål.VRAMMinnet på en GPU, mätt i gigabyte. Det rymmer modellvikter, arbetsdata och cacheminnen medan GPU:n körs.
Nätverk
InfiniBandEn högpresterande nätverksteknik med mycket låg latens, som används i stor utsträckning för att koppla ihop servrar i kluster för AI-träning.NVLinkNVIDIA:s höghastighetslänk som kopplar ihop GPU:er direkt med varandra inuti en server, mycket snabbare än den vanliga PCIe-bussen.NVSwitchEtt switchchip som låter varje GPU i en server med NVLink kommunicera med alla andra GPU:er i full hastighet.RoCERDMA over Converged Ethernet: ett sätt att få direkta minnesöverföringar i stil med InfiniBand över Ethernet-nätverk.
AI-arbetslaster
Fine-tuningFortsatt träning av en befintlig modell på en mindre, specifik datamängd för att anpassa den till en uppgift.InferensAtt köra en tränad modell för att ta fram svar eller förutsägelser åt användare.KV cacheMinne som lagrar mellanresultat från uppmärksamhetsberäkningen medan en språkmodell genererar text, så att de inte behöver beräknas om.MIGMulti-Instance GPU: en NVIDIA-funktion som delar upp en GPU i flera isolerade, mindre GPU:er.Numerisk precision (FP8, BF16, FP16)Det talformat som används för beräkningar. Lägre precision som FP8 använder mindre minne och går snabbare, till priset av viss numerisk noggrannhet.TräningAtt lära upp en modell genom att bearbeta stora mängder data och justera dess parametrar. Det kräver många GPU:er som arbetar tillsammans i dagar eller veckor.
Datacenter
ColocationAtt hyra utrymme, effekt och kylning i någon annans datacenter för att hysa din egen hårdvara.DatalokaliseringKravet att data lagras och behandlas i ett visst land eller en viss region.Megawatt (MW)En effektenhet som motsvarar en miljon watt. Ett datacenters kapacitet beskrivs oftast i megawatt tillgänglig effekt.PUEPower Usage Effectiveness: anläggningens totala energi delad med den energi som IT-utrustningen använder. Ett värde närmare 1 betyder att mindre energi går åt till sådant som kylning.RacktäthetHur mycket effekt varje serverrack kan förses med och kylas för, mätt i kilowatt per rack.RegionEtt geografiskt område där en leverantör erbjuder kapacitet, till exempel en stad, ett storstadsområde eller ett land.TDPThermal design power: den värmemängd ett chip är konstruerat att avge, och ungefär den effekt det drar under last, i watt.VätskekylningAtt föra bort värme med vätska i stället för luft, antingen vid chippet eller över hela racket. Det klarar betydligt högre effekttätheter än luft.
Köpa beräkningskapacitet
Bare metalAtt hyra en hel fysisk server utan virtualiseringslager mellan dig och hårdvaran.Bunden periodDen tid som en köpare åtar sig att betala för kapacitet, till exempel en, tre eller tolv månader.ClusterEn grupp servrar som är sammankopplade med ett snabbt nätverk så att de kan arbeta tillsammans på ett jobb.EgressData som lämnar en leverantörs nätverk, något som vissa leverantörer tar betalt för per gigabyte.GPU-hourEn GPU som används i en timme. Det är standardenheten för att jämföra priser på beräkningskapacitet.HyperscalerEn mycket stor molnleverantör, till exempel de stora publika molnen, som driver datacenter i global skala.NeocloudEn nyare molnleverantör som är specialiserad på GPU- och AI-infrastruktur snarare än på molntjänster för allmänna ändamål.NodEn server i ett kluster. En GPU-nod rymmer oftast flera GPU:er, vanligen åtta.On-demandAtt hyra beräkningskapacitet per timme eller minut utan långsiktigt åtagande. Du kan starta och stoppa när du vill, i mån av tillgänglighet.Reserverad kapacitetAtt åta sig att använda beräkningskapacitet under en fast period, ofta flera månader, i utbyte mot ett lägre pris eller garanterad tillgänglighet.SLAService level agreement: en leverantörs skriftliga åtagande om till exempel drifttid, med kompensation om det inte uppfylls.Spot (avbrytbar)Ledig kapacitet som erbjuds till rabatt och som leverantören kan ta tillbaka med kort varsel.
Kovara
Compute IndexKovaras benchmark för priser och tillgänglighet på beräkningskapacitet, beräknad från oberoende leverantörsbidrag med en publicerad metodik.FixingEtt officiellt publicerat benchmarkvärde från Compute Index, registrerat med den metodikversion som användes och aldrig omskrivet i tysthet.Indikativt prisEn löpande uppskattning som inte har publicerats som officiell fixning. Den märks som indikativ så att den aldrig förväxlas med en sådan.KonfidensgradKovaras gradering A–D av hur väl en uppgift stöds: A väl verifierad, B starka belägg, C ofullständiga belägg, D uppskattning eller overifierad.Normaliserat prisEtt pris omräknat till en gemensam enhet, till exempel US-dollar per GPU-hour, så att olika erbjudanden kan jämföras.TillgänglighetsstatusOm ett erbjudande är Tillgängligt, Begränsat eller Ej tillgängligt, eller okänt när källan inte anger det.Verified ProviderEn leverantör vars identitet har granskats av en person på Kovara. Statusen beviljas aldrig automatiskt.
Saknar du ett begrepp?
Be Kova förklara vad som helst om chip, nätverk eller datacenter, eller berätta vad vi borde lägga till.
