Carichi di lavoro IA
KV cache
Memoria che conserva i risultati intermedi dell’attention mentre un modello linguistico genera testo, così da non doverli ricalcolare.
Perché conta
La KV cache cresce con la lunghezza del contesto e con il numero di utenti simultanei, e spesso decide quante richieste una GPU può servire.
Vuoi una risposta più approfondita?
Chiedi a Kova di spiegare «KV cache» nel contesto del tuo carico di lavoro. Conosci Kova →
