Quando se fala em eficiência de servidores, é comum pensar apenas em consumo de energia ou utilização da CPU. Na prática, o conceito é muito mais amplo.

Um servidor eficiente precisa entregar a capacidade necessária ao workload utilizando adequadamente processamento, memória, armazenamento, rede, energia e espaço físico.

Eficiência não significa simplesmente consumir menos.

O objetivo é obter o melhor equilíbrio entre desempenho, utilização dos recursos, consumo de energia, capacidade e custo total da infraestrutura.

O que significa eficiência de um servidor?

A eficiência de um servidor pode ser analisada sob diferentes perspectivas.

Tipo de eficiência O que representa
Computacional Capacidade de processamento entregue em relação aos recursos disponíveis.
Energética Quantidade de capacidade ou desempenho obtido em relação à energia consumida.
Utilização Quanto da capacidade instalada realmente é utilizada pelos workloads.
Econômica Capacidade entregue em relação ao custo total de aquisição e operação.

Um servidor pode ser excelente em uma dessas métricas e ruim em outra. Por isso, a análise precisa considerar a aplicação e o ambiente em que o equipamento será utilizado.

Baixa utilização não significa necessariamente eficiência

Um servidor com CPU constantemente em baixa utilização não é necessariamente eficiente.

Ele pode simplesmente estar superdimensionado para o workload.

Imagine um servidor com grande quantidade de processadores, memória e discos executando uma aplicação que utiliza apenas uma pequena parcela dessa capacidade durante praticamente todo o tempo.

A aplicação pode funcionar perfeitamente, mas parte do investimento e da capacidade instalada permanece ociosa.

Da mesma maneira, utilização elevada da CPU não significa automaticamente ineficiência. Um servidor pode trabalhar intensamente e ainda estar perfeitamente dimensionado para executar determinada carga.

Não existe uma porcentagem universal de utilização que determine se um servidor é eficiente.

CPU: utilização não conta toda a história

A utilização da CPU é uma das primeiras métricas analisadas quando existe problema de desempenho, mas ela não deve ser interpretada isoladamente.

Uma CPU pode apresentar baixa utilização porque o servidor está esperando outro componente.

O gargalo pode estar em:

  • memória RAM;
  • storage;
  • rede;
  • banco de dados;
  • software;
  • latência externa;
  • I/O wait;
  • desempenho single-thread.

Também é importante considerar que processadores diferentes podem apresentar características muito distintas em número de núcleos, frequência, cache, arquitetura, IPC e consumo.

Por isso, simplesmente comparar quantidade de núcleos ou porcentagem de utilização pode produzir conclusões erradas.

Memória RAM: capacidade e configuração importam

A quantidade de memória disponível pode afetar diretamente o desempenho de diversos workloads.

Quando falta RAM, o sistema operacional ou hypervisor pode recorrer a mecanismos como paging ou swapping, utilizando armazenamento para compensar a falta de memória física. Como storage possui características de latência muito diferentes da RAM, isso pode provocar grande queda de desempenho.

Por outro lado, instalar muito mais memória do que o workload utiliza também representa capacidade ociosa e investimento desnecessário.

Em servidores enterprise, não importa apenas a quantidade total de memória. Também devem ser considerados:

  • quantidade de processadores instalados;
  • canais de memória;
  • distribuição dos DIMMs;
  • frequência;
  • rank;
  • capacidade dos módulos;
  • RDIMM, LRDIMM ou outro tipo suportado;
  • arquitetura NUMA.
Mais memória não significa automaticamente mais desempenho.

A capacidade precisa ser adequada ao workload e os módulos devem ser distribuídos corretamente de acordo com a arquitetura do servidor e dos processadores.

NUMA e servidores com múltiplos processadores

Em servidores com múltiplos sockets, a arquitetura de memória merece atenção especial.

Em sistemas NUMA (Non-Uniform Memory Access), cada processador possui acesso preferencial à memória associada aos seus próprios canais.

Quando um processador precisa acessar memória ligada ao outro socket, podem existir diferenças de latência e largura de banda.

Hypervisors, sistemas operacionais e aplicações modernas possuem mecanismos para trabalhar com NUMA, mas configurações inadequadas de máquinas virtuais, CPU ou memória podem reduzir o desempenho.

Em ambientes virtualizados e bancos de dados de grande porte, compreender a topologia NUMA pode ser tão importante quanto simplesmente aumentar a quantidade de RAM.

Storage pode limitar todo o servidor

Um servidor com processadores rápidos e grande quantidade de memória pode apresentar baixo desempenho se o sistema de armazenamento não conseguir entregar dados na velocidade exigida pelo workload.

Entre as tecnologias mais comuns estão:

Tecnologia Principal característica
HDD Alta capacidade e baixo custo por TB.
SSD SATA/SAS Baixa latência e maior quantidade de IOPS que discos mecânicos.
NVMe Arquitetura baseada em PCIe, alto paralelismo, baixa latência e alto desempenho.

A tecnologia correta depende do workload. Grandes repositórios de dados podem priorizar capacidade por TB, enquanto bancos de dados e aplicações transacionais podem depender muito mais de IOPS e latência.

Um storage lento também pode fazer com que processadores permaneçam esperando dados, reduzindo a utilização efetiva da capacidade computacional disponível.

A rede também pode ser o gargalo

Em servidores conectados a storage externo, clusters, sistemas de backup ou ambientes virtualizados, a rede pode limitar o desempenho da infraestrutura.

Uma análise deve considerar:

  • velocidade das interfaces;
  • 1GbE, 10GbE, 25GbE, 40GbE ou 100GbE;
  • quantidade de interfaces;
  • agregação de links;
  • latência;
  • utilização dos uplinks;
  • configuração dos switches;
  • arquitetura da rede.

Instalar CPUs mais rápidas ou mais memória não resolve um workload limitado pela capacidade da rede.

Virtualização e consolidação de servidores

A virtualização é uma das ferramentas mais importantes para aumentar a utilização da infraestrutura física.

Em vez de manter diversos servidores físicos executando individualmente workloads leves, é possível consolidar múltiplas máquinas virtuais em hosts com capacidade suficiente.

Isso pode reduzir:

  • quantidade de servidores físicos;
  • consumo de energia;
  • necessidade de refrigeração;
  • espaço ocupado em racks;
  • quantidade de fontes e conexões;
  • complexidade física da infraestrutura.

Porém, consolidação excessiva também pode gerar problemas.

CPU, RAM, storage e rede passam a ser compartilhados entre diversos workloads. Se o host for dimensionado incorretamente, pode ocorrer contenção de recursos.

Consolide até onde desempenho, redundância e disponibilidade permitirem.

TDP não é o consumo elétrico do servidor

Um erro comum é utilizar o TDP do processador como se ele representasse diretamente o consumo elétrico do servidor.

TDP (Thermal Design Power) é uma especificação relacionada ao projeto térmico do processador e não representa, por si só, o consumo total do equipamento.

O consumo real de um servidor depende de diversos componentes:

  • processadores;
  • quantidade de memória;
  • HDDs e SSDs;
  • GPUs e aceleradores;
  • controladoras;
  • placas de rede;
  • ventiladores;
  • fontes de alimentação;
  • carga de trabalho.

Dois servidores com processadores de TDP semelhante podem apresentar consumo total bastante diferente dependendo da configuração e utilização.

Fontes de alimentação e eficiência energética

Fontes de alimentação também possuem perdas durante a conversão da energia elétrica.

A eficiência varia conforme o projeto da fonte e sua carga de operação. Por isso, instalar uma fonte com potência muito superior à necessária não significa automaticamente que o servidor será mais eficiente.

Em servidores enterprise também é comum utilizar fontes redundantes. Dependendo da plataforma, podem existir diferentes modos de operação e gerenciamento de redundância.

Ao analisar energia, considere:

  • potência das fontes;
  • quantidade de fontes;
  • modo de redundância;
  • carga real do equipamento;
  • eficiência das fontes;
  • perfil de energia configurado na BIOS;
  • recursos de gerenciamento de energia do processador;
  • consumo em idle e sob carga.

Refrigeração também faz parte da eficiência

Praticamente toda a energia elétrica consumida pelo servidor termina sendo convertida em calor e precisa ser removida do ambiente.

Por isso, consumo elétrico e refrigeração estão diretamente relacionados.

Uma infraestrutura eficiente deve considerar:

  • fluxo de ar correto;
  • temperatura de entrada dos equipamentos;
  • organização do rack;
  • corredores frio e quente;
  • blanking panels em posições vazias, quando aplicável;
  • obstruções ao fluxo de ar;
  • estado dos ventiladores;
  • densidade térmica do rack.

Um servidor operando com entrada de ar inadequada pode aumentar a velocidade dos ventiladores, consumir mais energia e trabalhar em condições térmicas menos favoráveis.

Servidor novo é sempre mais eficiente?

Não necessariamente quando a análise considera o custo total.

Gerações mais recentes normalmente incorporam melhorias arquiteturais e podem oferecer maior desempenho por watt, maior densidade de processamento e novas tecnologias.

Isso não significa, entretanto, que substituir automaticamente todo servidor de geração anterior seja economicamente justificável.

Se um equipamento existente ou usado atende completamente ao workload e possui custo de aquisição significativamente menor, ele pode continuar sendo uma solução economicamente eficiente.

Por outro lado, em ambientes que operam 24 horas por dia, com alta utilização e grande quantidade de servidores, diferenças de desempenho por watt podem adquirir peso muito maior no custo total.

A resposta depende do workload.

O custo adicional de uma geração mais recente precisa ser comparado com os ganhos reais de desempenho, capacidade, energia, refrigeração e vida útil esperada.

Antes de substituir o servidor, descubra o gargalo

Trocar hardware sem identificar o componente que limita o desempenho pode resultar em investimento sem benefício real.

Antes de decidir por um upgrade ou substituição, monitore o servidor ao longo de um período representativo do workload.

Entre as métricas importantes estão:

  • utilização da CPU;
  • frequência e comportamento dos processadores;
  • CPU Ready, Steal Time ou métricas equivalentes em virtualização;
  • memória utilizada;
  • paging e swapping;
  • IOPS;
  • latência de storage;
  • throughput de armazenamento;
  • utilização da rede;
  • temperaturas;
  • velocidade dos ventiladores;
  • consumo elétrico;
  • utilização ao longo do tempo.

Ferramentas do sistema operacional e do hypervisor podem ser combinadas com plataformas de gerenciamento do próprio servidor, como iDRAC, HPE iLO e IPMI, dependendo do fabricante e modelo.

O gargalo nem sempre está onde parece

Um servidor lento não significa necessariamente falta de CPU.

Alguns exemplos:

Sintoma Possível causa
CPU baixa e aplicação lenta Storage, rede, software ou dependência externa
Swap/paging elevado Memória física insuficiente ou configuração inadequada
Alta latência de disco Storage saturado, RAID, discos ou workload inadequado à tecnologia
VMs lentas com host carregado Contenção de CPU, RAM, storage ou rede
Ventiladores em alta rotação Carga elevada, temperatura, airflow ou configuração térmica

O diagnóstico correto permite direcionar o investimento para o componente que realmente limita a infraestrutura.

Eficiência também significa analisar o TCO

TCO (Total Cost of Ownership) representa o custo total de possuir e operar a infraestrutura durante determinado período.

Uma análise de TCO pode incluir:

  • aquisição do servidor;
  • processadores e memória;
  • storage;
  • placas e componentes;
  • energia elétrica;
  • refrigeração;
  • espaço físico;
  • manutenção;
  • peças de reposição;
  • licenciamento;
  • capacidade de expansão;
  • vida útil esperada.
O servidor mais barato para comprar não necessariamente é o mais barato para operar.

Mas o servidor que consome menos energia também não necessariamente possui o menor TCO.

É o conjunto desses fatores que deve orientar a decisão.

Checklist para melhorar a eficiência dos servidores

01. Meça a utilização real antes de comprar ou substituir hardware.

02. Identifique se o gargalo está em CPU, memória, storage, rede ou software.

03. Verifique se a quantidade de memória é adequada ao workload.

04. Confira a distribuição dos DIMMs e canais de memória.

05. Analise NUMA em servidores multi-socket e ambientes virtualizados.

06. Meça IOPS e latência antes de concluir que falta processamento.

07. Verifique se a rede está limitando storage, backup ou virtualização.

08. Consolide workloads quando houver capacidade e redundância suficientes.

09. Revise perfis de energia e configurações de BIOS.

10. Verifique fontes, redundância e consumo real.

11. Analise airflow, temperatura e refrigeração.

12. Compare upgrades e substituições utilizando TCO, não apenas preço ou consumo.

Quando realmente vale trocar um servidor?

A substituição pode fazer sentido quando a plataforma existente não consegue mais atender adequadamente ao workload ou quando suas limitações aumentam significativamente o custo operacional.

Alguns fatores que podem justificar uma nova geração incluem:

  • capacidade de CPU insuficiente;
  • limite de memória;
  • necessidade de maior desempenho por núcleo;
  • necessidade de PCIe ou NVMe de gerações mais recentes;
  • GPUs ou aceleradores não suportados pela plataforma;
  • necessidade de interfaces de rede mais rápidas;
  • consumo elétrico elevado em relação à capacidade entregue;
  • limitações de expansão;
  • requisitos de firmware, software ou segurança;
  • custo crescente de manutenção.

Em outros casos, um upgrade de memória, CPU, SSD, NVMe ou interface de rede pode prolongar significativamente a vida útil da plataforma por um investimento muito menor.

Qual é o servidor mais eficiente?

Não existe uma resposta universal.

Um servidor destinado a virtualização possui necessidades diferentes de um servidor de banco de dados, storage, backup, Inteligência Artificial ou aplicação web.

Por isso, eficiência deve ser analisada em função do trabalho que a infraestrutura precisa executar.

O servidor mais eficiente não é necessariamente o que consome menos energia.

É aquele que entrega o workload necessário com o melhor equilíbrio entre desempenho, utilização, consumo e custo total.

Servidores e componentes enterprise na Rukam

A Rukam trabalha com servidores, storages, switches e componentes enterprise de fabricantes como Dell, HPE, Lenovo, Cisco, Supermicro e outras plataformas corporativas.

Uma plataforma existente pode muitas vezes receber upgrades de processadores, memória, armazenamento ou interfaces de rede e continuar atendendo adequadamente ao workload.

Em outros projetos, a substituição por outra geração ou arquitetura pode ser a alternativa mais adequada.

Os equipamentos e componentes são avaliados e testados antes da comercialização, com atenção à procedência e à compatibilidade da configuração.

O objetivo não deve ser simplesmente escolher o servidor mais novo ou o mais barato, mas encontrar a plataforma que entregue a capacidade necessária com o melhor equilíbrio entre desempenho, expansão, consumo e investimento.