Mallien tarjoaminen (inferenssi)
Inferenssi pyörii jatkuvasti, kun sinulla on käyttäjiä. Sen rajoitteena on yleensä muisti eikä raaka laskentateho, ja kustannukset riippuvat siitä, kuinka monta pyyntöä kukin GPU pystyy palvelemaan.
Mikä on tärkeintä
Muistikapasiteetti
Mallin painojen ja KV-välimuistin on mahduttava VRAM-muistiin. Pitkät kontekstit ja monet samanaikaiset käyttäjät kasvattavat välimuistia nopeasti.
Muistin kaistanleveys
Tekstin tuottaminen token kerrallaan rajoittuu usein siihen, kuinka nopeasti muistista voi lukea, joten kaistanleveys vaikuttaa nopeuteen voimakkaasti.
Alue ja viive
Ajaminen lähellä käyttäjiäsi pienentää viivettä, ja tietojen sijaintia koskevat säännöt voivat määrätä alueen puolestasi.
Joustava skaalaus
Liikenne nousee ja laskee. GPU:iden lisäämisen tai poistamisen mahdollisuus on tärkeämpi kuin kiinteän kokoisessa koulutusajossa.
Tyypillinen kokoonpano
Yhdestä kahdeksaan GPU:ta mallin replikaa kohti, valittuna niin, että painot ja välimuisti mahtuvat reilusti. Suuremman muistin GPU:t voivat palvella suurempia malleja vähemmillä korteilla.
Miten se yleensä hankitaan
Tyypillistä on yhdistelmä: reserved-kapasiteetti tai sitoumukseen perustuva kapasiteetti peruskuormalle ja on-demand huipuille. Spot sopii vain työlle, joka sietää keskeytyksiä.
Yleiset virheet
- Mitoitus vain painojen mukaan ja KV-välimuistin unohtaminen.
- Edullisimman alueen valinta tarkistamatta käyttäjien suuntaan syntyvää viivettä.
- Spot-kapasiteetin varassa toimiminen käyttäjille suunnatussa liikenteessä.
Tärkeät termit
Tämä on yleinen ohje, ei suositus tietylle toimittajalle tai hinnalle. Tarkista nykyiset tarjoomat ja vahvista saatavuus ja ehdot toimittajan kanssa.
Valmis tarkastelemaan todellisia vaihtoehtoja?
Katso seuratut tarjoomat lähteineen ja päivämäärineen tai pyydä Kova-agenttia mitoittamaan se sinulle.
