Os SSDs (Solid State Drives) transformaram o desempenho de computadores, servidores e sistemas de armazenamento. Por utilizarem memória flash NAND em vez de componentes mecânicos, oferecem baixa latência, altas taxas de transferência e elevado número de operações de entrada e saída por segundo (IOPS).
Mas uma dúvida continua sendo muito comum:
A resposta não pode ser dada simplesmente em anos. A vida útil depende da tecnologia da memória NAND, da quantidade de dados gravados, do tipo de carga de trabalho, da capacidade da unidade, do controlador e, principalmente, da especificação de endurance definida pelo fabricante.
Em ambientes corporativos, duas métricas são especialmente importantes para entender essa durabilidade: TBW (Terabytes Written) e DWPD (Drive Writes Per Day).
Por que um SSD se desgasta?
A memória flash NAND utilizada nos SSDs é não volátil: ela consegue manter os dados armazenados mesmo quando o equipamento está desligado.
Entretanto, as células NAND possuem um número limitado de ciclos de programação e apagamento, conhecidos como ciclos P/E (Program/Erase).
Cada vez que dados são gravados, apagados e novamente gravados, parte dessa capacidade de endurance é consumida.
Isso não significa que todas as células sejam utilizadas de maneira desordenada. Os controladores modernos empregam diversas técnicas para distribuir as gravações e administrar o desgaste da memória.
Por isso, para avaliar a durabilidade de um SSD, é muito mais útil analisar sua endurance especificada do que tentar determinar uma vida útil genérica em anos.
O que determina a vida útil de um SSD?
Diversos fatores influenciam a durabilidade de uma unidade. Entre os principais estão:
- tecnologia da memória NAND;
- capacidade do SSD;
- volume diário de gravações;
- tipo de workload;
- TBW;
- DWPD;
- over-provisioning;
- eficiência do controlador e firmware;
- temperatura de operação;
- qualidade da alimentação elétrica;
- ambiente e condições de utilização.
Em servidores e storages, o perfil da carga de trabalho pode ser tão importante quanto a capacidade do SSD.
Um servidor utilizado predominantemente para leitura pode consumir muito pouca endurance, enquanto bancos de dados, virtualização, logs, cache e outras aplicações write-intensive podem produzir grandes volumes de gravação diariamente.
O que é TBW?
TBW significa Terabytes Written, ou terabytes gravados.
É uma medida de endurance que indica a quantidade acumulada de dados que uma unidade foi projetada para suportar em gravações dentro das condições especificadas pelo fabricante.
Por exemplo, se determinado SSD possui endurance especificada em:
aproximadamente 3,5 petabytes de dados gravados
É importante entender que atingir o TBW especificado não significa que o SSD deixará de funcionar naquele instante.
O TBW é uma referência de endurance definida pelo fabricante e frequentemente está associado às condições da garantia. Ultrapassar esse valor significa que a unidade passou da quantidade de gravações para a qual aquela endurance foi especificada.
Em aplicações críticas, portanto, o consumo da endurance deve ser acompanhado preventivamente.
O que é DWPD?
DWPD significa Drive Writes Per Day, ou gravações completas da unidade por dia.
Essa métrica é particularmente comum em SSDs enterprise. Ela indica quantas vezes a capacidade total do SSD pode ser gravada diariamente durante determinado período de endurance ou garantia.
Por exemplo, considere um SSD de:
3,84 TB × 365 dias × 5 anos = 7.008 TB
Isso corresponde a aproximadamente 7 PB de gravações.
Agora considere a mesma capacidade com especificação de 3 DWPD:
3,84 TB × 3 × 365 × 5 = 21.024 TB
Isso corresponde a aproximadamente 21 PB de gravações.
Essa diferença mostra por que dois SSDs de exatamente 3,84 TB podem possuir características, aplicações e valores bastante diferentes.
TBW e DWPD são a mesma coisa?
Não, embora estejam diretamente relacionados.
O TBW expressa a quantidade total acumulada de dados que pode ser gravada segundo a especificação de endurance.
O DWPD relaciona essa endurance à capacidade da unidade e ao período considerado.
TBW = capacidade × DWPD × 365 × anos
Por isso, conhecer apenas a capacidade de um SSD não é suficiente para determinar se ele é adequado para determinado servidor ou aplicação.
Dois SSDs com a mesma capacidade e interface podem ter níveis de endurance muito diferentes.
SSD Read Intensive, Mixed Use e Write Intensive
Em ambientes enterprise, é comum encontrar SSDs classificados conforme o perfil de utilização para o qual foram projetados.
Read Intensive (RI)
São unidades destinadas principalmente a aplicações com predominância de leitura e menor volume de gravações. São comuns em workloads nos quais os dados são consultados com frequência, mas modificados com menor intensidade.
Mixed Use (MU)
São projetados para cargas mais equilibradas entre leitura e escrita. Podem ser utilizados em diversos ambientes de virtualização, aplicações corporativas e bancos de dados, dependendo do workload.
Write Intensive (WI)
São SSDs desenvolvidos para suportar volumes elevados de gravação. São indicados para aplicações nas quais a endurance é particularmente importante, como determinadas cargas de banco de dados, cache, logging e processamento intensivo de dados.
Essa classificação ajuda a explicar por que não devemos escolher um SSD enterprise somente pela capacidade e pela interface.
SLC, MLC, TLC e QLC: qual a diferença?
A tecnologia da memória NAND também influencia a endurance, capacidade e custo do SSD.
SLC (Single-Level Cell) armazena um bit por célula e historicamente oferece elevada endurance, porém possui custo muito alto por capacidade.
MLC (Multi-Level Cell) aumenta a densidade armazenando mais informações por célula, reduzindo o custo em relação ao SLC.
TLC (Triple-Level Cell) armazena três bits por célula e tornou-se extremamente comum devido ao equilíbrio entre capacidade, desempenho e custo.
QLC (Quad-Level Cell) armazena quatro bits por célula, permitindo maior densidade e menor custo por capacidade, mas geralmente com menor endurance de gravação quando comparada a tecnologias menos densas.
Entretanto, analisar somente o tipo de NAND também pode ser enganoso. Controlador, firmware, over-provisioning, gerenciamento da memória e características específicas da unidade têm grande influência sobre sua endurance real e sobre o workload para o qual ela foi projetada.
O que é over-provisioning?
Um SSD pode possuir memória NAND adicional reservada internamente e não disponibilizada diretamente ao usuário. Essa área é conhecida como over-provisioning.
Ela auxilia o controlador em tarefas como:
- gerenciamento de blocos;
- substituição de células desgastadas;
- garbage collection;
- wear leveling;
- manutenção do desempenho;
- gerenciamento da endurance.
SSDs enterprise frequentemente utilizam estratégias de over-provisioning adequadas às cargas de trabalho para as quais foram projetados.
Como o SSD controla o desgaste da memória?
Os SSDs modernos utilizam diversos mecanismos internos para prolongar a vida útil e preservar a integridade dos dados.
Wear leveling
O wear leveling distribui as gravações entre as células disponíveis para evitar que determinadas regiões da memória NAND sejam excessivamente utilizadas enquanto outras permanecem praticamente intactas.
ECC
Os mecanismos de Error Correction Code (ECC) permitem detectar e corrigir determinados erros durante a leitura dos dados. À medida que a NAND envelhece, o gerenciamento de erros torna-se ainda mais importante.
Gerenciamento de blocos defeituosos
O controlador identifica blocos que não devem mais ser utilizados e os retira de operação, utilizando áreas de reserva quando necessário. Esse processo ocorre internamente e faz parte do gerenciamento normal da unidade.
TRIM e garbage collection
O comando TRIM permite que o sistema operacional informe ao SSD quais blocos lógicos não contêm mais dados válidos. O controlador utiliza essas informações em conjunto com processos internos, como garbage collection, para administrar a memória flash e preparar espaço para futuras gravações.
Como verificar o desgaste de um SSD?
Em vez de tentar prever a vida útil apenas pela idade da unidade, o ideal é analisar os indicadores disponibilizados pelo próprio SSD.
Dependendo da interface, fabricante e equipamento, essas informações podem ser obtidas através de SMART, NVMe SMART/Health Information, ferramentas do fabricante ou sistemas de gerenciamento do servidor.
Entre os indicadores úteis podem estar:
- quantidade total de dados gravados;
- percentual de endurance utilizado;
- vida útil restante estimada;
- erros de mídia;
- blocos defeituosos;
- temperatura;
- horas de operação;
- eventos críticos;
- erros não corrigíveis.
Os nomes e a forma de apresentar essas informações variam conforme fabricante, protocolo e modelo.
Em servidores Dell PowerEdge, HPE ProLiant, Lenovo, Supermicro e outras plataformas, ferramentas de gerenciamento também podem apresentar informações sobre o estado das unidades instaladas.
Um SSD usado pode ainda ter muita vida útil?
A idade cronológica não revela sozinha quanto da endurance de um SSD foi consumida.
Uma unidade que permaneceu anos em um ambiente predominantemente de leitura pode apresentar desgaste muito menor que outra utilizada durante um período relativamente curto em uma aplicação com gravação intensiva.
Por isso, na avaliação de um SSD enterprise usado, é importante considerar, sempre que as informações estiverem disponíveis:
modelo + capacidade + interface + endurance especificada + histórico de utilização + indicadores de saúde
Esse é um dos motivos pelos quais simplesmente classificar uma unidade como “nova” ou “usada” diz pouco sobre seu estado técnico.
SSD enterprise e SSD de consumo são iguais?
Não.
Embora possam utilizar tecnologias semelhantes, SSDs destinados a servidores e storages podem possuir características específicas para operação corporativa, incluindo diferentes níveis de endurance, firmware, proteção contra perda de energia, gerenciamento de erros, telemetria e comportamento adequado a controladoras e sistemas de armazenamento.
Além disso, compatibilidade é fundamental.
Interface e formato físico iguais não garantem necessariamente que qualquer SSD seja adequado a qualquer servidor ou storage.
É preciso considerar fatores como:
- SAS, SATA ou NVMe;
- velocidade da interface;
- formato físico;
- geração do servidor;
- backplane;
- controladora;
- firmware;
- carrier ou caddy;
- requisitos específicos da plataforma.
MTBF significa que um SSD vai durar milhões de horas?
Não.
MTBF (Mean Time Between Failures) é uma medida estatística utilizada para expressar confiabilidade em uma população de dispositivos sob determinadas condições.
Um SSD especificado com milhões de horas de MTBF não está sendo anunciado como uma unidade que funcionará individualmente durante centenas de anos.
MTBF e endurance também representam conceitos diferentes. A endurance está relacionada principalmente à capacidade de suportar gravações na memória flash, enquanto MTBF é uma métrica estatística de confiabilidade.
Por isso, não devemos utilizar MTBF isoladamente para calcular quantos anos um SSD individual irá durar.
SSD é mais confiável que HDD?
SSD e HDD utilizam tecnologias muito diferentes.
Como não possui discos giratórios, motores e cabeças mecânicas de leitura, o SSD elimina vários componentes móveis sujeitos a desgaste e danos mecânicos.
Além disso, normalmente oferece vantagens importantes em:
- latência;
- IOPS;
- velocidade de acesso;
- consumo de energia;
- resistência a vibração e impacto;
- densidade de desempenho.
Por outro lado, HDDs continuam sendo extremamente relevantes em aplicações que exigem grande capacidade com menor custo por terabyte.
Portanto, a escolha entre SSD e HDD deve considerar o workload, capacidade necessária, desempenho, endurance, redundância e custo total da solução.
Então, quanto tempo dura um SSD?
Não existe uma resposta universal como cinco, dez ou vinte anos.
Para aplicações profissionais, a pergunta mais adequada é:
Para responder, considere principalmente:
capacidade + TBW + DWPD + workload + indicadores de saúde + ambiente de operação
Em servidores e storages, escolher corretamente o tipo de SSD pode ser mais importante do que simplesmente escolher a maior capacidade disponível.
Um SSD Read Intensive pode ser perfeitamente adequado para determinada aplicação e inadequado para outra com gravação intensiva. Da mesma forma, pagar por uma unidade Write Intensive pode não trazer benefício quando o workload é predominantemente de leitura.
SSDs enterprise na Rukam
A Rukam trabalha com SSDs enterprise SAS, SATA e NVMe para servidores e sistemas de storage, incluindo unidades de diferentes capacidades e níveis de endurance.
Os equipamentos e componentes são avaliados e testados antes da comercialização, com atenção à compatibilidade com plataformas corporativas.
Ao escolher um SSD para servidor, não considere apenas capacidade e preço. Interface, endurance, workload e compatibilidade fazem parte da especificação correta da solução.
