Modellen bedienen (inferentie)
Inferentie draait continu zodra u gebruikers hebt. Ze wordt meestal eerder begrensd door geheugen dan door ruwe rekenkracht, en de kosten hangen af van hoeveel verzoeken elke GPU kan bedienen.
Wat het meest telt
Geheugencapaciteit
De modelgewichten en de KV-cache moeten in het VRAM passen. Lange contexten en veel gelijktijdige gebruikers laten de cache snel groeien.
Geheugenbandbreedte
Het token voor token genereren van tekst wordt vaak begrensd door hoe snel het geheugen kan worden gelezen, dus de bandbreedte heeft grote invloed op de snelheid.
Regio en latentie
Dicht bij uw gebruikers draaien verlaagt de latentie, en regels voor dataresidentie kunnen de regio voor u vastleggen.
Flexibel schalen
Verkeer stijgt en daalt. GPU’s kunnen toevoegen of verwijderen is belangrijker dan bij een vaste trainingsrun.
Een typische opzet
Eén tot acht GPU’s per modelreplica, zo gekozen dat gewichten plus cache ruim passen. GPU’s met meer geheugen kunnen grotere modellen op minder kaarten bedienen.
Hoe het meestal wordt ingekocht
Een mix is gebruikelijk: gereserveerde of vastgelegde capaciteit voor de basislast en on-demand voor pieken. Spot is alleen geschikt voor werk dat onderbrekingen verdraagt.
Veelgemaakte fouten
- Alleen dimensioneren voor de gewichten en de KV-cache vergeten.
- De goedkoopste regio kiezen zonder de latentie naar gebruikers te controleren.
- Vertrouwen op spotcapaciteit voor verkeer van eindgebruikers.
Termen om te kennen
Dit is algemene informatie, geen aanbeveling voor een specifieke aanbieder of prijs. Bekijk de actuele aanbiedingen en bevestig beschikbaarheid en voorwaarden bij de aanbieder.
Klaar om naar echte opties te kijken?
Bekijk gevolgde aanbiedingen met hun bronnen en data, of laat Kova de dimensionering voor u doen.
