बड़े मॉडल की ट्रेनिंग
बड़े मॉडल की ट्रेनिंग का मतलब है कई GPU का एक जॉब पर साथ काम करना। रन उतना ही तेज़ होता है जितनी उसकी सबसे धीमी कड़ी, इसलिए नेटवर्क और मेमोरी उतने ही मायने रखते हैं जितना GPU मॉडल।
सबसे ज़्यादा क्या मायने रखता है
GPU-से-GPU बैंडविड्थ
सर्वर के भीतर NVLink से जुड़े SXM GPU, PCIe कार्ड की तुलना में कहीं तेज़ी से संवाद करते हैं। संचार-प्रधान जॉब को सबसे ज़्यादा फ़ायदा होता है।
क्लस्टर नेटवर्किंग
सर्वरों के बीच InfiniBand या अच्छी तरह बना RoCE फ़ैब्रिक GPU को व्यस्त रखता है। पूछें कि क्लस्टर ऑफ़र में वास्तव में कौन-सा नेटवर्क शामिल है।
प्रति GPU मेमोरी
प्रति GPU अधिक HBM का मतलब है बड़े बैच साइज़ या कम शार्ड। कीमतों की तुलना से पहले VRAM जाँचें।
एक साथ उपलब्ध क्षमता
ट्रेनिंग के लिए एक ही जगह और एक ही समय पर कई GPU चाहिए, इसलिए पुष्ट उपलब्धता उतनी ही मायने रखती है जितनी कीमत।
एक सामान्य सेटअप
हाल के डेटा सेंटर GPU (Hopper- या Blackwell-श्रेणी) SXM फ़ॉर्म फ़ैक्टर में, प्रति नोड आठ, InfiniBand या समकक्ष से जुड़े, एक ही रीजन में।
इसे आमतौर पर कैसे ख़रीदा जाता है
रिज़र्व्ड या कमिटेड क्षमता या डेडिकेटेड क्लस्टर आम है, क्योंकि रन लंबे होते हैं और उन्हें गारंटीड उपलब्धता चाहिए। नियंत्रण और एक जैसे परफ़ॉर्मेंस के लिए बेयर मेटल लोकप्रिय है।
आम गलतियाँ
- इंटरकनेक्ट जाँचे बिना प्रति-GPU कीमतों की तुलना करना।
- यह मान लेना कि सूचीबद्ध कीमत का मतलब है कि GPU आपकी तारीख पर शुरू करने के लिए ख़ाली हैं।
- चेकपॉइंट और डेटासेट के लिए ईग्रेस और स्टोरेज लागत को नज़रअंदाज़ करना।
जानने लायक शब्द
यह सामान्य मार्गदर्शन है, किसी ख़ास प्रोवाइडर या कीमत की सिफ़ारिश नहीं। मौजूदा ऑफ़रिंग देखें और प्रोवाइडर से उपलब्धता और शर्तों की पुष्टि करें।
असली विकल्प देखने के लिए तैयार हैं?
ट्रैक की गई ऑफ़रिंग उनके स्रोतों और तारीखों के साथ देखें, या Kova से आकार तय करने को कहें।
