Glossário
A linguagem da computação.
51 termos, de GPUs e redes a data centers e modelos de compra, explicados sem jargão.
Hardware
A100A GPU de data center da geração Ampere da NVIDIA, antecessora da H100.AceleradorUm chip projetado para acelerar cargas de trabalho específicas, como IA. As GPUs são os aceleradores mais conhecidos; outros incluem TPUs e chips de IA personalizados.B200Uma GPU de data center da NVIDIA da geração Blackwell, a arquitetura sucessora da Hopper.FLOPSOperações de ponto flutuante por segundo: uma medida da vazão computacional bruta, muitas vezes expressa em teraflops ou petaflops.GPUUnidade de processamento gráfico: um chip feito para executar muitos cálculos em paralelo. As GPUs são o principal hardware para treinar e executar modelos de IA.H100A GPU de data center da geração Hopper da NVIDIA, muito usada em treinamento e inferência de IA. Existe em vários formatos, incluindo SXM e PCIe.H200Uma GPU da geração Hopper da NVIDIA que combina o design computacional da H100 com memória maior e mais rápida.HBMHigh Bandwidth Memory: memória empilhada colocada ao lado do chip da GPU para que os dados entrem e saiam dele muito rapidamente.Largura de banda de memóriaQuantos dados uma GPU consegue ler ou gravar na sua memória por segundo, geralmente medido em terabytes por segundo.MI300XO acelerador de data center Instinct MI300X da AMD para IA e computação de alto desempenho.PCIePCI Express: a conexão padrão entre uma GPU e o resto de um servidor. As GPUs PCIe são encaixadas como placas.SXMO formato de GPU em soquete da NVIDIA, montado diretamente na placa do servidor e projetado para NVLink e maior potência.Tensor CoreUnidades especializadas dentro das GPUs NVIDIA que executam a matemática de matrizes no centro da IA muito mais rápido que núcleos de uso geral.VRAMA memória de uma GPU, medida em gigabytes. Ela armazena os pesos do modelo, os dados de trabalho e os caches enquanto a GPU funciona.
Redes
InfiniBandUma tecnologia de rede de alto desempenho com latência muito baixa, muito usada para conectar servidores em clusters de treinamento de IA.NVLinkA conexão de alta velocidade da NVIDIA que liga as GPUs diretamente entre si dentro de um servidor, muito mais rápida que o barramento PCIe padrão.NVSwitchUm chip de switch que permite que cada GPU de um servidor conectado por NVLink se comunique com todas as outras GPUs em velocidade máxima.RoCERDMA over Converged Ethernet: uma forma de obter transferências diretas de memória no estilo InfiniBand em redes Ethernet.
Cargas de trabalho de IA
Fine-tuningTreinar mais um modelo existente com um conjunto de dados menor e específico para adaptá-lo a uma tarefa.InferênciaExecutar um modelo treinado para produzir respostas ou previsões para os usuários.KV cacheMemória que armazena resultados intermediários da atenção enquanto um modelo de linguagem gera texto, para que não precisem ser recalculados.MIGMulti-Instance GPU: um recurso da NVIDIA que divide uma GPU em várias GPUs menores e isoladas.Precisão (FP8, BF16, FP16)O formato numérico usado nos cálculos. Uma precisão menor, como FP8, usa menos memória e roda mais rápido, com algum custo em exatidão numérica.TreinamentoEnsinar um modelo processando grandes volumes de dados e ajustando seus parâmetros. Exige muitas GPUs trabalhando juntas durante dias ou semanas.
Data centers
ColocationAlugar espaço, energia e resfriamento no data center de outra empresa para abrigar seu próprio hardware.Densidade por rackQuanta potência cada rack de servidores consegue fornecer e resfriar, medida em quilowatts por rack.Megawatt (MW)Uma unidade de potência igual a um milhão de watts. A capacidade de um data center costuma ser descrita em megawatts de potência disponível.PUEPower Usage Effectiveness: a energia total da instalação dividida pela energia usada pelos equipamentos de TI. Um valor mais próximo de 1 significa menos energia gasta com custos indiretos como o resfriamento.RegiãoUma área geográfica onde um provedor oferece capacidade, como uma cidade, uma região metropolitana ou um país.Resfriamento líquidoRemoção de calor com líquido em vez de ar, seja no chip, seja em todo o rack. Suporta densidades de potência muito maiores que o ar.Residência de dadosA exigência de que os dados sejam armazenados e processados em um país ou região específicos.TDPThermal design power: a quantidade de calor que um chip foi projetado para produzir e, aproximadamente, a potência que consome sob carga, em watts.
Compra de capacidade computacional
Bare metalAlugar um servidor físico inteiro, sem camada de virtualização entre você e o hardware.Capacidade reservedComprometer-se a usar capacidade computacional por um prazo fixo, muitas vezes de meses, em troca de um preço menor ou de disponibilidade garantida.ClusterUm grupo de servidores conectados por uma rede rápida para que possam trabalhar juntos em uma mesma tarefa.EgressDados que saem da rede de um provedor, cobrados por gigabyte por alguns provedores.GPU-hourUma GPU usada durante uma hora. É a unidade padrão para comparar preços de computação.HyperscalerUm provedor de nuvem muito grande, como as principais nuvens públicas, que opera data centers em escala global.NeocloudUm provedor de nuvem mais recente, especializado em GPU e infraestrutura de IA em vez de serviços de nuvem de uso geral.NóUm servidor em um cluster. Um nó de GPU normalmente contém várias GPUs, geralmente oito.On-demandAlugar capacidade computacional por hora ou por minuto, sem compromisso longo. Você pode iniciar e parar quando quiser, sujeito à disponibilidade.Prazo comprometidoO período pelo qual um comprador concorda em pagar pela capacidade, como um, três ou doze meses.SLAAcordo de nível de serviço: o compromisso por escrito de um provedor sobre itens como disponibilidade, com compensações se não for cumprido.Spot (interruptível)Capacidade ociosa oferecida com desconto, que o provedor pode retomar com pouca antecedência.
Kovara
Compute IndexO benchmark da Kovara para preços e disponibilidade de computação, calculado a partir de contribuições independentes de provedores com uma metodologia publicada.FixingUm valor oficial de benchmark publicado pelo Compute Index, registrado com a versão da metodologia usada e nunca reescrito silenciosamente.Nível de confiançaA classificação de A a D da Kovara sobre o quanto um fato é sustentado: A altamente verificado, B evidência sólida, C evidência incompleta, D estimativa ou não verificado.Preço indicativoUma estimativa ao vivo que não foi publicada como fixing oficial. É identificada como indicativa para nunca ser confundida com um.Preço normalizadoUm preço convertido para uma unidade comum, como dólares americanos por GPU-hour, para que ofertas diferentes possam ser comparadas.Status de disponibilidadeSe uma oferta está Disponível, Limitada ou Indisponível, ou desconhecida quando a fonte não informa.Verified ProviderUm provedor cuja identidade foi analisada por uma pessoa da Kovara. O status nunca é concedido automaticamente.
Falta algum termo?
Peça à Kova para explicar qualquer coisa sobre chips, redes ou data centers, ou diga o que devemos acrescentar.
