AI-arbetslaster
KV cache
Minne som lagrar mellanresultat från uppmärksamhetsberäkningen medan en språkmodell genererar text, så att de inte behöver beräknas om.
Varför det spelar roll
KV-cachen växer med kontextlängden och antalet samtidiga användare, och avgör ofta hur många förfrågningar en GPU kan hantera.
Vill du ha ett djupare svar?
Be Kova förklara KV cache utifrån din arbetslast. Möt Kova →
