KI-Workloads
KV cache
Speicher, der Zwischenergebnisse der Attention ablegt, während ein Sprachmodell Text erzeugt, damit sie nicht neu berechnet werden müssen.
Warum das wichtig ist
Der KV-Cache wächst mit der Kontextlänge und der Zahl gleichzeitiger Nutzer und entscheidet oft darüber, wie viele Anfragen eine GPU bedienen kann.
Möchten Sie eine ausführlichere Antwort?
Bitten Sie Kova, KV cache im Kontext Ihres Workloads zu erklären. Lernen Sie Kova kennen →
