Att köra modeller (inferens)
Inferens körs kontinuerligt när du väl har användare. Den begränsas oftast av minne snarare än av ren beräkningskraft, och kostnaden beror på hur många förfrågningar varje GPU kan hantera.
Det viktigaste
Minneskapacitet
Modellvikterna och KV-cachen måste rymmas i VRAM. Långa kontexter och många samtidiga användare får cachen att växa snabbt.
Minnesbandbredd
Att generera text token för token begränsas ofta av hur snabbt minnet kan läsas, så bandbredden påverkar hastigheten kraftigt.
Region och latens
Att köra nära dina användare sänker latensen, och regler för datalokalisering kan bestämma regionen åt dig.
Flexibel skalning
Trafiken går upp och ned. Att kunna lägga till eller ta bort GPU:er spelar större roll än för en fast träningskörning.
En typisk uppsättning
En till åtta GPU:er per modellreplik, valda så att vikter och cache ryms med marginal. GPU:er med mer minne kan köra större modeller på färre kort.
Så köps det oftast
En blandning är typisk: reserverad eller bunden kapacitet för baslasten och on-demand för toppar. Spot passar bara arbete som tål avbrott.
Vanliga misstag
- Att dimensionera enbart för vikterna och glömma KV-cachen.
- Att välja den billigaste regionen utan att kontrollera latensen till användarna.
- Att förlita sig på spotkapacitet för trafik som möter användare.
Begrepp att känna till
Det här är allmän vägledning, inte en rekommendation av en viss leverantör eller ett visst pris. Kontrollera aktuella erbjudanden och bekräfta tillgänglighet och villkor med leverantören.
Redo att titta på verkliga alternativ?
Se spårade erbjudanden med källor och datum, eller be Kova dimensionera åt dig.
