AI-workloads
KV cache
Geheugen dat tussenresultaten van attention opslaat terwijl een taalmodel tekst genereert, zodat ze niet opnieuw berekend hoeven te worden.
Waarom het ertoe doet
De KV-cache groeit met de contextlengte en het aantal gelijktijdige gebruikers, en bepaalt vaak hoeveel verzoeken een GPU kan bedienen.
Gerelateerde termen
Wilt u een diepgaander antwoord?
Vraag Kova om KV cache uit te leggen in de context van uw workload. Maak kennis met Kova →
