Servire i modelli (inferenza)
L’inferenza gira in modo continuo una volta che hai degli utenti. Di solito è limitata dalla memoria più che dalla capacità di calcolo grezza, e il costo dipende da quante richieste ogni GPU riesce a servire.
Che cosa conta di più
Capacità di memoria
I pesi del modello e la KV cache devono entrare nella VRAM. Contesti lunghi e molti utenti simultanei fanno crescere rapidamente la cache.
Larghezza di banda della memoria
Generare testo token per token è spesso limitato dalla velocità con cui si può leggere la memoria, perciò la larghezza di banda incide molto sulla velocità.
Regione e latenza
Eseguire vicino ai tuoi utenti riduce la latenza, e le regole sulla residenza dei dati possono stabilire la regione al posto tuo.
Scalabilità flessibile
Il traffico sale e scende. Poter aggiungere o rimuovere GPU conta più che in un’esecuzione di addestramento di dimensioni fisse.
Una configurazione tipica
Da una a otto GPU per replica del modello, scelte in modo che pesi e cache entrino con margine. Le GPU con più memoria possono servire modelli più grandi con meno schede.
Come si acquista di solito
Di solito si usa una combinazione: capacità riservata (reserved) o con impegno di durata per il carico di base e on-demand per i picchi. Lo spot si adatta solo a lavori che tollerano le interruzioni.
Errori comuni
- Dimensionare solo per i pesi e dimenticare la KV cache.
- Scegliere la regione più economica senza controllare la latenza verso gli utenti.
- Affidarsi alla capacità spot per il traffico rivolto agli utenti.
Termini da conoscere
Questa è una guida generale, non una raccomandazione per un provider o un prezzo specifico. Controlla le offerte attuali e conferma disponibilità e condizioni con il provider.
Vuoi vedere le opzioni reali?
Guarda le offerte monitorate con le relative fonti e date, oppure chiedi a Kova di dimensionarlo per te.
