Servering af modeller (inferens)
Inferens kører løbende, når du først har brugere. Den er som regel begrænset af hukommelse snarere end rå regnekraft, og omkostningen afhænger af, hvor mange forespørgsler hver GPU kan betjene.
Det vigtigste
Hukommelseskapacitet
Modelvægtene og KV-cachen skal kunne være i VRAM. Lange kontekster og mange samtidige brugere får cachen til at vokse hurtigt.
Hukommelsesbåndbredde
Generering af tekst token for token er ofte begrænset af, hvor hurtigt hukommelsen kan læses, så båndbredden har stor betydning for hastigheden.
Region og latenstid
Kørsel tæt på dine brugere sænker latenstiden, og regler for dataopbevaring kan fastlægge regionen for dig.
Fleksibel skalering
Trafikken stiger og falder. Muligheden for at tilføje eller fjerne GPU’er betyder mere end ved en fast træningskørsel.
En typisk opsætning
En til otte GPU’er pr. modelreplika, valgt så vægte plus cache har god plads. GPU’er med mere hukommelse kan servere større modeller på færre kort.
Sådan købes det typisk
En blanding er typisk: reserveret eller bunden kapacitet til grundbelastningen og on-demand til spidsbelastninger. Spot passer kun til arbejde, der kan tåle afbrydelser.
Almindelige fejl
- At dimensionere kun til vægtene og glemme KV-cachen.
- At vælge den billigste region uden at kontrollere latenstiden til brugerne.
- At basere brugervendt trafik på spotkapacitet.
Begreber, du bør kende
Dette er generel vejledning, ikke en anbefaling af en bestemt udbyder eller pris. Se de aktuelle tilbud, og bekræft tilgængelighed og vilkår med udbyderen.
Klar til at se på reelle muligheder?
Se fulgte tilbud med deres kilder og datoer, eller bed Kova om at dimensionere det for dig.
