Quando se fala em eficiência de servidores, é comum pensar apenas em consumo de energia ou utilização da CPU. Na prática, o conceito é muito mais amplo.
Um servidor eficiente precisa entregar a capacidade necessária ao workload utilizando adequadamente processamento, memória, armazenamento, rede, energia e espaço físico.
O objetivo é obter o melhor equilíbrio entre desempenho, utilização dos recursos, consumo de energia, capacidade e custo total da infraestrutura.
O que significa eficiência de um servidor?
A eficiência de um servidor pode ser analisada sob diferentes perspectivas.
| Tipo de eficiência | O que representa |
|---|---|
| Computacional | Capacidade de processamento entregue em relação aos recursos disponíveis. |
| Energética | Quantidade de capacidade ou desempenho obtido em relação à energia consumida. |
| Utilização | Quanto da capacidade instalada realmente é utilizada pelos workloads. |
| Econômica | Capacidade entregue em relação ao custo total de aquisição e operação. |
Um servidor pode ser excelente em uma dessas métricas e ruim em outra. Por isso, a análise precisa considerar a aplicação e o ambiente em que o equipamento será utilizado.
Baixa utilização não significa necessariamente eficiência
Um servidor com CPU constantemente em baixa utilização não é necessariamente eficiente.
Ele pode simplesmente estar superdimensionado para o workload.
Imagine um servidor com grande quantidade de processadores, memória e discos executando uma aplicação que utiliza apenas uma pequena parcela dessa capacidade durante praticamente todo o tempo.
A aplicação pode funcionar perfeitamente, mas parte do investimento e da capacidade instalada permanece ociosa.
Da mesma maneira, utilização elevada da CPU não significa automaticamente ineficiência. Um servidor pode trabalhar intensamente e ainda estar perfeitamente dimensionado para executar determinada carga.
CPU: utilização não conta toda a história
A utilização da CPU é uma das primeiras métricas analisadas quando existe problema de desempenho, mas ela não deve ser interpretada isoladamente.
Uma CPU pode apresentar baixa utilização porque o servidor está esperando outro componente.
O gargalo pode estar em:
- memória RAM;
- storage;
- rede;
- banco de dados;
- software;
- latência externa;
- I/O wait;
- desempenho single-thread.
Também é importante considerar que processadores diferentes podem apresentar características muito distintas em número de núcleos, frequência, cache, arquitetura, IPC e consumo.
Por isso, simplesmente comparar quantidade de núcleos ou porcentagem de utilização pode produzir conclusões erradas.
Memória RAM: capacidade e configuração importam
A quantidade de memória disponível pode afetar diretamente o desempenho de diversos workloads.
Quando falta RAM, o sistema operacional ou hypervisor pode recorrer a mecanismos como paging ou swapping, utilizando armazenamento para compensar a falta de memória física. Como storage possui características de latência muito diferentes da RAM, isso pode provocar grande queda de desempenho.
Por outro lado, instalar muito mais memória do que o workload utiliza também representa capacidade ociosa e investimento desnecessário.
Em servidores enterprise, não importa apenas a quantidade total de memória. Também devem ser considerados:
- quantidade de processadores instalados;
- canais de memória;
- distribuição dos DIMMs;
- frequência;
- rank;
- capacidade dos módulos;
- RDIMM, LRDIMM ou outro tipo suportado;
- arquitetura NUMA.
A capacidade precisa ser adequada ao workload e os módulos devem ser distribuídos corretamente de acordo com a arquitetura do servidor e dos processadores.
NUMA e servidores com múltiplos processadores
Em servidores com múltiplos sockets, a arquitetura de memória merece atenção especial.
Em sistemas NUMA (Non-Uniform Memory Access), cada processador possui acesso preferencial à memória associada aos seus próprios canais.
Quando um processador precisa acessar memória ligada ao outro socket, podem existir diferenças de latência e largura de banda.
Hypervisors, sistemas operacionais e aplicações modernas possuem mecanismos para trabalhar com NUMA, mas configurações inadequadas de máquinas virtuais, CPU ou memória podem reduzir o desempenho.
Em ambientes virtualizados e bancos de dados de grande porte, compreender a topologia NUMA pode ser tão importante quanto simplesmente aumentar a quantidade de RAM.
Storage pode limitar todo o servidor
Um servidor com processadores rápidos e grande quantidade de memória pode apresentar baixo desempenho se o sistema de armazenamento não conseguir entregar dados na velocidade exigida pelo workload.
Entre as tecnologias mais comuns estão:
| Tecnologia | Principal característica |
|---|---|
| HDD | Alta capacidade e baixo custo por TB. |
| SSD SATA/SAS | Baixa latência e maior quantidade de IOPS que discos mecânicos. |
| NVMe | Arquitetura baseada em PCIe, alto paralelismo, baixa latência e alto desempenho. |
A tecnologia correta depende do workload. Grandes repositórios de dados podem priorizar capacidade por TB, enquanto bancos de dados e aplicações transacionais podem depender muito mais de IOPS e latência.
Um storage lento também pode fazer com que processadores permaneçam esperando dados, reduzindo a utilização efetiva da capacidade computacional disponível.
A rede também pode ser o gargalo
Em servidores conectados a storage externo, clusters, sistemas de backup ou ambientes virtualizados, a rede pode limitar o desempenho da infraestrutura.
Uma análise deve considerar:
- velocidade das interfaces;
- 1GbE, 10GbE, 25GbE, 40GbE ou 100GbE;
- quantidade de interfaces;
- agregação de links;
- latência;
- utilização dos uplinks;
- configuração dos switches;
- arquitetura da rede.
Instalar CPUs mais rápidas ou mais memória não resolve um workload limitado pela capacidade da rede.
Virtualização e consolidação de servidores
A virtualização é uma das ferramentas mais importantes para aumentar a utilização da infraestrutura física.
Em vez de manter diversos servidores físicos executando individualmente workloads leves, é possível consolidar múltiplas máquinas virtuais em hosts com capacidade suficiente.
Isso pode reduzir:
- quantidade de servidores físicos;
- consumo de energia;
- necessidade de refrigeração;
- espaço ocupado em racks;
- quantidade de fontes e conexões;
- complexidade física da infraestrutura.
Porém, consolidação excessiva também pode gerar problemas.
CPU, RAM, storage e rede passam a ser compartilhados entre diversos workloads. Se o host for dimensionado incorretamente, pode ocorrer contenção de recursos.
TDP não é o consumo elétrico do servidor
Um erro comum é utilizar o TDP do processador como se ele representasse diretamente o consumo elétrico do servidor.
TDP (Thermal Design Power) é uma especificação relacionada ao projeto térmico do processador e não representa, por si só, o consumo total do equipamento.
O consumo real de um servidor depende de diversos componentes:
- processadores;
- quantidade de memória;
- HDDs e SSDs;
- GPUs e aceleradores;
- controladoras;
- placas de rede;
- ventiladores;
- fontes de alimentação;
- carga de trabalho.
Dois servidores com processadores de TDP semelhante podem apresentar consumo total bastante diferente dependendo da configuração e utilização.
Fontes de alimentação e eficiência energética
Fontes de alimentação também possuem perdas durante a conversão da energia elétrica.
A eficiência varia conforme o projeto da fonte e sua carga de operação. Por isso, instalar uma fonte com potência muito superior à necessária não significa automaticamente que o servidor será mais eficiente.
Em servidores enterprise também é comum utilizar fontes redundantes. Dependendo da plataforma, podem existir diferentes modos de operação e gerenciamento de redundância.
Ao analisar energia, considere:
- potência das fontes;
- quantidade de fontes;
- modo de redundância;
- carga real do equipamento;
- eficiência das fontes;
- perfil de energia configurado na BIOS;
- recursos de gerenciamento de energia do processador;
- consumo em idle e sob carga.
Refrigeração também faz parte da eficiência
Praticamente toda a energia elétrica consumida pelo servidor termina sendo convertida em calor e precisa ser removida do ambiente.
Por isso, consumo elétrico e refrigeração estão diretamente relacionados.
Uma infraestrutura eficiente deve considerar:
- fluxo de ar correto;
- temperatura de entrada dos equipamentos;
- organização do rack;
- corredores frio e quente;
- blanking panels em posições vazias, quando aplicável;
- obstruções ao fluxo de ar;
- estado dos ventiladores;
- densidade térmica do rack.
Um servidor operando com entrada de ar inadequada pode aumentar a velocidade dos ventiladores, consumir mais energia e trabalhar em condições térmicas menos favoráveis.
Servidor novo é sempre mais eficiente?
Não necessariamente quando a análise considera o custo total.
Gerações mais recentes normalmente incorporam melhorias arquiteturais e podem oferecer maior desempenho por watt, maior densidade de processamento e novas tecnologias.
Isso não significa, entretanto, que substituir automaticamente todo servidor de geração anterior seja economicamente justificável.
Se um equipamento existente ou usado atende completamente ao workload e possui custo de aquisição significativamente menor, ele pode continuar sendo uma solução economicamente eficiente.
Por outro lado, em ambientes que operam 24 horas por dia, com alta utilização e grande quantidade de servidores, diferenças de desempenho por watt podem adquirir peso muito maior no custo total.
O custo adicional de uma geração mais recente precisa ser comparado com os ganhos reais de desempenho, capacidade, energia, refrigeração e vida útil esperada.
Antes de substituir o servidor, descubra o gargalo
Trocar hardware sem identificar o componente que limita o desempenho pode resultar em investimento sem benefício real.
Antes de decidir por um upgrade ou substituição, monitore o servidor ao longo de um período representativo do workload.
Entre as métricas importantes estão:
- utilização da CPU;
- frequência e comportamento dos processadores;
- CPU Ready, Steal Time ou métricas equivalentes em virtualização;
- memória utilizada;
- paging e swapping;
- IOPS;
- latência de storage;
- throughput de armazenamento;
- utilização da rede;
- temperaturas;
- velocidade dos ventiladores;
- consumo elétrico;
- utilização ao longo do tempo.
Ferramentas do sistema operacional e do hypervisor podem ser combinadas com plataformas de gerenciamento do próprio servidor, como iDRAC, HPE iLO e IPMI, dependendo do fabricante e modelo.
O gargalo nem sempre está onde parece
Um servidor lento não significa necessariamente falta de CPU.
Alguns exemplos:
| Sintoma | Possível causa |
|---|---|
| CPU baixa e aplicação lenta | Storage, rede, software ou dependência externa |
| Swap/paging elevado | Memória física insuficiente ou configuração inadequada |
| Alta latência de disco | Storage saturado, RAID, discos ou workload inadequado à tecnologia |
| VMs lentas com host carregado | Contenção de CPU, RAM, storage ou rede |
| Ventiladores em alta rotação | Carga elevada, temperatura, airflow ou configuração térmica |
O diagnóstico correto permite direcionar o investimento para o componente que realmente limita a infraestrutura.
Eficiência também significa analisar o TCO
TCO (Total Cost of Ownership) representa o custo total de possuir e operar a infraestrutura durante determinado período.
Uma análise de TCO pode incluir:
- aquisição do servidor;
- processadores e memória;
- storage;
- placas e componentes;
- energia elétrica;
- refrigeração;
- espaço físico;
- manutenção;
- peças de reposição;
- licenciamento;
- capacidade de expansão;
- vida útil esperada.
Mas o servidor que consome menos energia também não necessariamente possui o menor TCO.
É o conjunto desses fatores que deve orientar a decisão.
Checklist para melhorar a eficiência dos servidores
01. Meça a utilização real antes de comprar ou substituir hardware.
02. Identifique se o gargalo está em CPU, memória, storage, rede ou software.
03. Verifique se a quantidade de memória é adequada ao workload.
04. Confira a distribuição dos DIMMs e canais de memória.
05. Analise NUMA em servidores multi-socket e ambientes virtualizados.
06. Meça IOPS e latência antes de concluir que falta processamento.
07. Verifique se a rede está limitando storage, backup ou virtualização.
08. Consolide workloads quando houver capacidade e redundância suficientes.
09. Revise perfis de energia e configurações de BIOS.
10. Verifique fontes, redundância e consumo real.
11. Analise airflow, temperatura e refrigeração.
12. Compare upgrades e substituições utilizando TCO, não apenas preço ou consumo.
Quando realmente vale trocar um servidor?
A substituição pode fazer sentido quando a plataforma existente não consegue mais atender adequadamente ao workload ou quando suas limitações aumentam significativamente o custo operacional.
Alguns fatores que podem justificar uma nova geração incluem:
- capacidade de CPU insuficiente;
- limite de memória;
- necessidade de maior desempenho por núcleo;
- necessidade de PCIe ou NVMe de gerações mais recentes;
- GPUs ou aceleradores não suportados pela plataforma;
- necessidade de interfaces de rede mais rápidas;
- consumo elétrico elevado em relação à capacidade entregue;
- limitações de expansão;
- requisitos de firmware, software ou segurança;
- custo crescente de manutenção.
Em outros casos, um upgrade de memória, CPU, SSD, NVMe ou interface de rede pode prolongar significativamente a vida útil da plataforma por um investimento muito menor.
Qual é o servidor mais eficiente?
Não existe uma resposta universal.
Um servidor destinado a virtualização possui necessidades diferentes de um servidor de banco de dados, storage, backup, Inteligência Artificial ou aplicação web.
Por isso, eficiência deve ser analisada em função do trabalho que a infraestrutura precisa executar.
É aquele que entrega o workload necessário com o melhor equilíbrio entre desempenho, utilização, consumo e custo total.
Servidores e componentes enterprise na Rukam
A Rukam trabalha com servidores, storages, switches e componentes enterprise de fabricantes como Dell, HPE, Lenovo, Cisco, Supermicro e outras plataformas corporativas.
Uma plataforma existente pode muitas vezes receber upgrades de processadores, memória, armazenamento ou interfaces de rede e continuar atendendo adequadamente ao workload.
Em outros projetos, a substituição por outra geração ou arquitetura pode ser a alternativa mais adequada.
Os equipamentos e componentes são avaliados e testados antes da comercialização, com atenção à procedência e à compatibilidade da configuração.
O objetivo não deve ser simplesmente escolher o servidor mais novo ou o mais barato, mas encontrar a plataforma que entregue a capacidade necessária com o melhor equilíbrio entre desempenho, expansão, consumo e investimento.
