AI-workloads
KV cache
Hukommelse, der gemmer mellemresultater fra attention, mens en sprogmodel genererer tekst, så de ikke skal beregnes igen.
Hvorfor det er vigtigt
KV-cachen vokser med kontekstlængden og antallet af samtidige brugere og afgør ofte, hvor mange forespørgsler en GPU kan betjene.
Vil du have et mere dybdegående svar?
Bed Kova om at forklare KV cache i sammenhæng med din workload. Mød Kova →
