Glosario
El lenguaje de la capacidad de cómputo.
51 términos, desde las GPU y las redes hasta los centros de datos y los modelos de compra, explicados sin jerga.
Hardware
A100La GPU para centros de datos de NVIDIA de la generación Ampere, predecesora de la H100.AceleradorUn chip diseñado para acelerar cargas de trabajo específicas, como las de IA. Las GPU son los aceleradores más conocidos; entre los demás figuran las TPU y los chips de IA personalizados.Ancho de banda de memoriaLa cantidad de datos que una GPU puede leer de su memoria o escribir en ella cada segundo, que suele medirse en terabytes por segundo.B200Una GPU de NVIDIA para centros de datos de la generación Blackwell, la arquitectura sucesora de Hopper.FLOPSOperaciones de coma flotante por segundo: una medida del rendimiento de cálculo bruto, que suele expresarse en teraflops o petaflops.GPUUna unidad de procesamiento gráfico: un chip diseñado para ejecutar muchos cálculos en paralelo. Las GPU son el hardware principal para entrenar y ejecutar modelos de IA.H100La GPU para centros de datos de NVIDIA de la generación Hopper, muy utilizada para el entrenamiento y la inferencia de IA. Se ofrece en varios factores de forma, entre ellos SXM y PCIe.H200Una GPU de NVIDIA de la generación Hopper que combina el diseño de cómputo de la H100 con una memoria más grande y más rápida.HBMHigh Bandwidth Memory: memoria apilada situada junto al chip de la GPU para que los datos puedan entrar y salir de él con mucha rapidez.MI300XEl acelerador para centros de datos Instinct MI300X de AMD, orientado a la IA y a la computación de alto rendimiento.PCIePCI Express: la conexión estándar entre una GPU y el resto de un servidor. Las GPU PCIe se insertan como tarjetas.SXMEl factor de forma de GPU con zócalo de NVIDIA, montado directamente en la placa del servidor y diseñado para NVLink y para una mayor potencia.Tensor CoreUnidades especializadas dentro de las GPU de NVIDIA que realizan el cálculo matricial en el que se basa la IA mucho más rápido que los núcleos de uso general.VRAMLa memoria de una GPU, medida en gigabytes. Contiene los pesos del modelo, los datos de trabajo y las cachés mientras la GPU está en funcionamiento.
Redes
InfiniBandUna tecnología de redes de alto rendimiento y muy baja latencia, muy utilizada para conectar servidores en los clusters de entrenamiento de IA.NVLinkEl enlace de alta velocidad de NVIDIA que conecta las GPU directamente entre sí dentro de un servidor, mucho más rápido que el bus PCIe estándar.NVSwitchUn chip conmutador que permite que cada GPU de un servidor conectado con NVLink se comunique con todas las demás GPU a plena velocidad.RoCERDMA over Converged Ethernet: una forma de obtener, en redes Ethernet, transferencias directas de memoria al estilo de InfiniBand.
Cargas de trabajo de IA
EntrenamientoEnseñar a un modelo procesando grandes cantidades de datos y ajustando sus parámetros. Requiere muchas GPU trabajando juntas durante días o semanas.Fine-tuningSeguir entrenando un modelo existente con un conjunto de datos más pequeño y específico para adaptarlo a una tarea.InferenciaEjecutar un modelo entrenado para generar respuestas o predicciones para los usuarios.KV cacheMemoria que almacena los resultados intermedios de la atención mientras un modelo de lenguaje genera texto, para que no haya que volver a calcularlos.MIGMulti-Instance GPU: una función de NVIDIA que divide una GPU en varias GPU más pequeñas y aisladas.Precisión (FP8, BF16, FP16)El formato numérico que se usa en los cálculos. Una precisión menor, como FP8, usa menos memoria y es más rápida, a costa de cierta exactitud numérica.
Centros de datos
ColocationAlquilar espacio, energía y refrigeración en el centro de datos de un tercero para alojar tu propio hardware.Densidad de racksLa potencia que cada rack de servidores puede suministrar y refrigerar, medida en kilovatios por rack.Megavatio (MW)Una unidad de potencia equivalente a un millón de vatios. La capacidad de un centro de datos suele describirse en megavatios de potencia disponible.PUEPower Usage Effectiveness: la energía total de la instalación dividida entre la energía que consumen los equipos de TI. Un valor más cercano a 1 indica que se destina menos energía a consumos auxiliares, como la refrigeración.Refrigeración líquidaExtracción del calor con un líquido en lugar de aire, ya sea en el chip o en todo el rack. Admite densidades de potencia mucho mayores que el aire.RegiónUn área geográfica en la que un proveedor ofrece capacidad, como una ciudad, un área metropolitana o un país.Residencia de datosEl requisito de que los datos se almacenen y se procesen en un país o una región específicos.TDPPotencia de diseño térmico: la cantidad de calor que un chip está diseñado para generar y, aproximadamente, la potencia que consume bajo carga, en vatios.
Compra de capacidad de cómputo
Bare metalAlquilar un servidor físico completo, sin ninguna capa de virtualización entre tú y el hardware.Capacidad reservadaComprometerse a usar capacidad de cómputo durante un plazo fijo, a menudo de meses, a cambio de un precio más bajo o de una disponibilidad garantizada.ClusterUn grupo de servidores conectados por una red rápida para que puedan trabajar juntos en una misma tarea.EgressDatos que salen de la red de un proveedor, y por los que algunos proveedores cobran por gigabyte.GPU-hourUna GPU utilizada durante una hora. Es la unidad estándar para comparar precios de capacidad de cómputo.HyperscalerUn proveedor de nube de gran tamaño, como las principales nubes públicas, que opera centros de datos a escala global.NeocloudUn proveedor de nube más reciente, especializado en infraestructura de GPU y de IA en lugar de servicios de nube de uso general.NodoUn servidor de un cluster. Un nodo de GPU suele contener varias GPU, normalmente ocho.On-demandAlquilar capacidad de cómputo por horas o por minutos, sin compromisos a largo plazo. Puedes iniciar y detener el uso cuando quieras, según la disponibilidad.Plazo con compromisoEl periodo durante el cual un comprador acepta pagar por la capacidad, por ejemplo uno, tres o doce meses.SLAAcuerdo de nivel de servicio: el compromiso por escrito de un proveedor sobre aspectos como el tiempo de actividad, con medidas de reparación si no se cumple.Spot (interrumpible)Capacidad excedente que se ofrece con descuento y que el proveedor puede recuperar con poco preaviso.
Kovara
Compute IndexEl benchmark de Kovara para los precios y la disponibilidad de la capacidad de cómputo, calculado a partir de contribuciones independientes de proveedores con una metodología publicada.Estado de disponibilidadSi una oferta está Disponible, Limitada o No disponible, o es desconocida cuando la fuente no lo indica.FixingUn valor de benchmark oficial publicado por el Compute Index, registrado con la versión de la metodología utilizada y que nunca se reescribe en silencio.Nivel de confianzaLa clasificación A–D de Kovara sobre en qué medida está respaldado un dato: A altamente verificado, B evidencia sólida, C evidencia incompleta, D estimación o sin verificar.Precio indicativoUna estimación en vivo que no se ha publicado como fixing oficial. Se etiqueta como indicativa para que nunca se confunda con uno.Precio normalizadoUn precio convertido a una unidad común, como dólares estadounidenses por GPU-hour, para que se puedan comparar distintas ofertas.Verified ProviderUn proveedor cuya identidad ha revisado una persona de Kovara. Esta condición nunca se concede de forma automática.
¿Falta algún término?
Pide a Kova que te explique cualquier cosa sobre chips, redes o centros de datos, o dinos qué debemos incluir.
