Obsługa modeli (inferencja)
Inferencja działa nieprzerwanie, gdy masz już użytkowników. Zwykle ogranicza ją pamięć, a nie surowa moc obliczeniowa, a koszt zależy od tego, ile zapytań może obsłużyć każdy GPU.
Co jest najważniejsze
Pojemność pamięci
Wagi modelu i KV cache muszą zmieścić się w VRAM. Długie konteksty i wielu jednoczesnych użytkowników szybko powiększają bufor.
Przepustowość pamięci
Generowanie tekstu token po tokenie jest często ograniczone szybkością odczytu pamięci, więc przepustowość silnie wpływa na szybkość.
Region i opóźnienia
Uruchamianie blisko użytkowników zmniejsza opóźnienia, a przepisy o rezydencji danych mogą z góry wyznaczyć region.
Elastyczne skalowanie
Ruch rośnie i spada. Możliwość dodawania lub usuwania GPU ma większe znaczenie niż przy stałym przebiegu treningowym.
Typowa konfiguracja
Od jednego do ośmiu GPU na replikę modelu, dobranych tak, aby wagi i bufor swobodnie się zmieściły. GPU z większą pamięcią mogą obsługiwać większe modele na mniejszej liczbie kart.
Jak to się zwykle kupuje
Typowe jest połączenie: moc rezerwowana lub z zobowiązaniem dla obciążenia bazowego i on-demand dla szczytów. Spot nadaje się tylko do pracy, która toleruje przerwy.
Częste błędy
- Dobieranie rozmiaru tylko pod wagi i zapominanie o KV cache.
- Wybieranie najtańszego regionu bez sprawdzenia opóźnień do użytkowników.
- Opieranie ruchu od użytkowników na mocy spot.
Pojęcia, które warto znać
To ogólne wskazówki, a nie rekomendacja konkretnego dostawcy ani ceny. Sprawdź bieżące oferty i potwierdź dostępność oraz warunki u dostawcy.
Chcesz zobaczyć prawdziwe opcje?
Zobacz śledzone oferty z ich źródłami i datami albo poproś asystenta Kova o dobór rozmiaru.
