Servicio de modelos (inferencia)
La inferencia se ejecuta de forma continua en cuanto tienes usuarios. Suele estar limitada por la memoria más que por la capacidad de cómputo bruta, y el costo depende de cuántas solicitudes puede atender cada GPU.
Lo que más importa
Capacidad de memoria
Los pesos del modelo y la caché KV deben caber en la VRAM. Los contextos largos y muchos usuarios simultáneos hacen crecer la caché con rapidez.
Ancho de banda de memoria
Generar texto token a token suele estar limitado por la rapidez con la que se puede leer la memoria, así que el ancho de banda influye mucho en la velocidad.
Región y latencia
Ejecutar cerca de tus usuarios reduce la latencia, y las normas de residencia de datos pueden determinar la región por ti.
Escalado flexible
El tráfico sube y baja. Poder añadir o quitar GPU importa más que en una ejecución de entrenamiento de tamaño fijo.
Una configuración típica
De una a ocho GPU por réplica del modelo, elegidas para que los pesos y la caché quepan con holgura. Las GPU con más memoria pueden servir modelos más grandes con menos tarjetas.
Cómo se suele comprar
Lo habitual es combinar: capacidad reservada o con compromiso para la carga base y on-demand para los picos. Spot solo es adecuado para trabajos que toleran interrupciones.
Errores frecuentes
- Dimensionar solo para los pesos y olvidar la caché KV.
- Elegir la región más barata sin comprobar la latencia hacia los usuarios.
- Depender de la capacidad spot para el tráfico dirigido a los usuarios.
Términos que conviene conocer
Esta es una guía general, no una recomendación sobre un proveedor o un precio concretos. Consulta las ofertas actuales y confirma la disponibilidad y las condiciones con el proveedor.
¿Quieres ver opciones reales?
Consulta las ofertas en seguimiento con sus fuentes y fechas, o pide a Kova que lo dimensione por ti.
