AI-arbeidslaster
KV-cache
Minne som lagrer mellomresultater fra oppmerksomhetsmekanismen mens en språkmodell genererer tekst, slik at de ikke må beregnes på nytt.
Hvorfor det er viktig
KV-cachen vokser med kontekstlengden og antall samtidige brukere, og avgjør ofte hvor mange forespørsler en GPU kan betjene.
Vil du ha et grundigere svar?
Be Kova forklare KV-cache i sammenheng med arbeidslasten din. Møt Kova →
