AI वर्कलोड
KV कैश
वह मेमोरी जो भाषा मॉडल के टेक्स्ट जनरेट करते समय अटेंशन के मध्यवर्ती परिणाम रखती है, ताकि उन्हें दोबारा गणना न करनी पड़े।
यह क्यों मायने रखता है
KV कैश कॉन्टेक्स्ट की लंबाई और एक साथ मौजूद उपयोगकर्ताओं की संख्या के साथ बढ़ता है, और अक्सर तय करता है कि एक GPU कितने अनुरोध सर्व कर सकता है।
और गहराई से जवाब चाहिए?
Kova से कहें कि वह आपके वर्कलोड के संदर्भ में KV कैश समझाए। Kova से मिलें →
