Model sunma (çıkarım)
Çıkarım, kullanıcılarınız olduğu andan itibaren sürekli çalışır. Genellikle ham işlem gücünden çok bellekle sınırlıdır ve maliyet, her GPU’nun kaç isteğe hizmet verebildiğine bağlıdır.
En önemli olan
Bellek kapasitesi
Model ağırlıkları ve KV önbelleği VRAM’e sığmalıdır. Uzun bağlamlar ve çok sayıda eşzamanlı kullanıcı önbelleği hızla büyütür.
Bellek bant genişliği
Metni token token üretmek çoğu zaman belleğin ne kadar hızlı okunabildiğiyle sınırlıdır; bu nedenle bant genişliği hızı güçlü biçimde etkiler.
Bölge ve gecikme
Kullanıcılarınıza yakın çalışmak gecikmeyi azaltır ve veri yerelliği kuralları bölgeyi sizin yerinize belirleyebilir.
Esnek ölçekleme
Trafik artar ve azalır. GPU ekleyip çıkarabilmek, sabit bir eğitim çalışmasına göre daha önemlidir.
Tipik bir kurulum
Model kopyası başına bir ila sekiz GPU; ağırlıklar ve önbellek rahatça sığacak şekilde seçilir. Daha büyük bellekli GPU’lar daha büyük modelleri daha az kartla sunabilir.
Genellikle nasıl satın alınır
Karma bir yapı tipiktir: temel yük için rezerve veya taahhütlü kapasite, zirveler için isteğe bağlı kapasite. Spot yalnızca kesintiye dayanabilen işlere uygundur.
Yaygın hatalar
- Yalnızca ağırlıklara göre boyutlandırıp KV önbelleğini unutmak.
- Kullanıcılara gecikmeyi kontrol etmeden en ucuz bölgeyi seçmek.
- Kullanıcıya dönük trafik için spot kapasiteye güvenmek.
Bilinmesi gereken terimler
Bu genel bir rehberdir; belirli bir sağlayıcı veya fiyat için öneri değildir. Güncel teklifleri kontrol edin ve kullanılabilirliği ve koşulları sağlayıcıyla teyit edin.
Gerçek seçeneklere bakmaya hazır mısınız?
Takip edilen teklifleri kaynakları ve tarihleriyle görün ya da boyutlandırmayı Kova’ya bırakın.
