Betjening av modeller (inferens)
Inferens kjører kontinuerlig når du først har brukere. Den begrenses vanligvis av minne snarere enn rå datakraft, og kostnaden avhenger av hvor mange forespørsler hver GPU kan betjene.
Det viktigste
Minnekapasitet
Modellvektene og KV-cachen må få plass i VRAM. Lange kontekster og mange samtidige brukere får cachen til å vokse raskt.
Minnebåndbredde
Tekstgenerering token for token begrenses ofte av hvor raskt minnet kan leses, så båndbredden påvirker hastigheten sterkt.
Region og forsinkelse
Å kjøre nær brukerne gir lavere forsinkelse, og regler om datalagringssted kan bestemme regionen for deg.
Fleksibel skalering
Trafikken går opp og ned. Å kunne legge til eller fjerne GPU-er betyr mer enn for en fast treningskjøring.
Et typisk oppsett
Én til åtte GPU-er per modellreplika, valgt slik at vekter og cache får god plass. GPU-er med mer minne kan betjene større modeller på færre kort.
Slik kjøpes det vanligvis
En blanding er typisk: reservert eller bundet kapasitet for grunnlast og on-demand for topper. Spot passer bare for arbeid som tåler avbrudd.
Vanlige feil
- Å dimensjonere bare for vektene og glemme KV-cachen.
- Å velge den billigste regionen uten å sjekke forsinkelsen til brukerne.
- Å basere seg på spotkapasitet for trafikk mot brukere.
Begreper du bør kjenne
Dette er generell veiledning, ikke en anbefaling av en bestemt leverandør eller pris. Se aktuelle tilbud og bekreft tilgjengelighet og vilkår med leverandøren.
Klar til å se på reelle alternativer?
Se sporede tilbud med kilder og datoer, eller be Kova dimensjonere det for deg.
