मॉडल सर्व करना (इन्फ़रेंस)
उपयोगकर्ता आने के बाद इन्फ़रेंस लगातार चलता है। यह आमतौर पर कच्चे कंप्यूट के बजाय मेमोरी से सीमित होता है, और लागत इस पर निर्भर करती है कि हर GPU कितने अनुरोध सर्व कर सकता है।
सबसे ज़्यादा क्या मायने रखता है
मेमोरी क्षमता
मॉडल वेट और KV कैश VRAM में फ़िट होने चाहिए। लंबे कॉन्टेक्स्ट और कई एक साथ मौजूद उपयोगकर्ता कैश को तेज़ी से बढ़ाते हैं।
मेमोरी बैंडविड्थ
टेक्स्ट को टोकन-दर-टोकन जनरेट करना अक्सर इस बात से सीमित होता है कि मेमोरी कितनी तेज़ी से पढ़ी जा सकती है, इसलिए बैंडविड्थ का गति पर गहरा असर पड़ता है।
रीजन और लेटेंसी
अपने उपयोगकर्ताओं के पास चलाने से लेटेंसी कम होती है, और डेटा रेज़िडेंसी के नियम आपके लिए रीजन तय कर सकते हैं।
लचीली स्केलिंग
ट्रैफ़िक घटता-बढ़ता है। किसी तय ट्रेनिंग रन की तुलना में यहाँ GPU जोड़ने या हटाने की क्षमता ज़्यादा मायने रखती है।
एक सामान्य सेटअप
प्रति मॉडल रेप्लिका एक से आठ GPU, ऐसे चुने गए कि वेट और कैश आराम से फ़िट हों। अधिक मेमोरी वाले GPU कम कार्ड पर बड़े मॉडल सर्व कर सकते हैं।
इसे आमतौर पर कैसे ख़रीदा जाता है
आमतौर पर एक मिश्रण होता है: बेसलाइन लोड के लिए रिज़र्व्ड या कमिटेड क्षमता और पीक के लिए ऑन-डिमांड। स्पॉट केवल उस काम के लिए ठीक है जो रुकावट सह सकता है।
आम गलतियाँ
- केवल वेट के लिए आकार तय करना और KV कैश को भूल जाना।
- उपयोगकर्ताओं तक लेटेंसी जाँचे बिना सबसे सस्ता रीजन चुनना।
- उपयोगकर्ताओं से जुड़े ट्रैफ़िक के लिए स्पॉट क्षमता पर निर्भर रहना।
जानने लायक शब्द
यह सामान्य मार्गदर्शन है, किसी ख़ास प्रोवाइडर या कीमत की सिफ़ारिश नहीं। मौजूदा ऑफ़रिंग देखें और प्रोवाइडर से उपलब्धता और शर्तों की पुष्टि करें।
असली विकल्प देखने के लिए तैयार हैं?
ट्रैक की गई ऑफ़रिंग उनके स्रोतों और तारीखों के साथ देखें, या Kova से आकार तय करने को कहें।
