Servir modelos (inferência)
A inferência roda continuamente quando há usuários. Costuma ser limitada pela memória, e não pela capacidade computacional bruta, e o custo depende de quantas requisições cada GPU consegue atender.
O que mais importa
Capacidade de memória
Os pesos do modelo e o KV cache precisam caber na VRAM. Contextos longos e muitos usuários simultâneos fazem o cache crescer rapidamente.
Largura de banda de memória
Gerar texto token a token costuma ser limitado pela velocidade de leitura da memória, por isso a largura de banda afeta muito a velocidade.
Região e latência
Rodar perto dos seus usuários reduz a latência, e as regras de residência de dados podem definir a região por você.
Escalonamento flexível
O tráfego sobe e desce. Poder adicionar ou remover GPUs importa mais do que em uma execução de treinamento fixa.
Uma configuração típica
De uma a oito GPUs por réplica do modelo, escolhidas para que os pesos e o cache caibam com folga. GPUs com mais memória podem servir modelos maiores com menos placas.
Como costuma ser comprado
Uma combinação é típica: capacidade reserved ou com compromisso para a carga de base e on-demand para os picos. Spot só é adequado para trabalhos que toleram interrupções.
Erros comuns
- Dimensionar apenas para os pesos e esquecer o KV cache.
- Escolher a região mais barata sem verificar a latência até os usuários.
- Depender de capacidade spot para tráfego voltado aos usuários.
Termos para conhecer
Esta é uma orientação geral, não uma recomendação de um provedor ou preço específico. Consulte as ofertas atuais e confirme a disponibilidade e as condições com o provedor.
Pronto para ver opções reais?
Veja as ofertas acompanhadas, com suas fontes e datas, ou peça à Kova para fazer o dimensionamento para você.
