تقديم النماذج (الاستدلال)
يعمل الاستدلال باستمرار بمجرد أن يكون لديكم مستخدمون. وعادةً ما يكون محدودًا بالذاكرة لا بقدرة الحوسبة الخام، وتتوقف التكلفة على عدد الطلبات التي تستطيع كل وحدة GPU خدمتها.
ما يهم أكثر
سعة الذاكرة
يجب أن تتسع أوزان النموذج وذاكرة KV المؤقتة في VRAM. وتنمو الذاكرة المؤقتة بسرعة مع السياقات الطويلة وكثرة المستخدمين المتزامنين.
عرض النطاق الترددي للذاكرة
غالبًا ما يكون توليد النص رمزًا تلو الآخر محدودًا بسرعة قراءة الذاكرة، لذا يؤثر عرض النطاق الترددي بقوة في السرعة.
المنطقة وزمن الاستجابة
التشغيل قرب مستخدميكم يخفض زمن الاستجابة، وقد تفرض قواعد إقامة البيانات المنطقة عليكم.
توسع مرن
ترتفع حركة البيانات وتنخفض. والقدرة على إضافة وحدات GPU أو إزالتها أهم مما في عملية تدريب ثابتة.
إعداد نموذجي
من واحدة إلى ثماني وحدات GPU لكل نسخة من النموذج، تُختار بحيث تتسع الأوزان والذاكرة المؤقتة براحة. ويمكن لوحدات GPU ذات الذاكرة الأكبر تقديم نماذج أكبر على بطاقات أقل.
كيف يُشترى عادةً
المزيج هو المعتاد: سعة محجوزة أو ملتزم بها للحمل الأساسي، والاستخدام عند الطلب لأوقات الذروة. ولا يناسب السعر الفوري إلا العمل الذي يتحمل المقاطعة.
أخطاء شائعة
- تحديد الحجم للأوزان فقط مع نسيان ذاكرة KV المؤقتة.
- اختيار أرخص منطقة دون التحقق من زمن الاستجابة للمستخدمين.
- الاعتماد على السعة الفورية لحركة البيانات الموجهة للمستخدمين.
مصطلحات ينبغي معرفتها
هذه إرشادات عامة، وليست توصية بمزود أو سعر بعينه. راجعوا العروض الحالية وأكّدوا التوفر والشروط مع المزود.
هل أنتم مستعدون للاطلاع على خيارات حقيقية؟
اطلعوا على العروض المتتبعة مع مصادرها وتواريخها، أو اطلبوا من Kova تحديد الحجم لكم.
