Hay una pregunta que casi todo el mundo hace al contratar copias de seguridad: si mi servidor ocupa 200 GB y quiero guardar treinta copias diarias, ¿necesito seis terabytes? La respuesta es que no, y entender por qué cambia por completo cómo diseñas tu política de retención.

La idea, sin tecnicismos

Un sistema de copias moderno no guarda ficheros enteros: parte los datos en bloques pequeños, calcula una huella digital de cada bloque y guarda solo los bloques que no tenía ya. Cuando un bloque se repite, en lugar de duplicarlo apunta al que ya existe.

La consecuencia es directa. En un servidor típico, entre una copia y la siguiente cambia una fracción muy pequeña de los datos: unos registros de sistema, la base de datos, algún fichero nuevo. El sistema operativo, las librerías, el código de la aplicación y la mayoría de los documentos son idénticos, así que no se vuelven a escribir.

Los números reales

En nuestra infraestructura, un servidor de 200 GB con actividad normal deja unos 2 a 5 GB de bloques nuevos por copia diaria. Treinta copias no ocupan 6 TB: ocupan del orden de 250 a 350 GB en total, contando la copia inicial completa.

Y hay un segundo efecto que se nota más: la deduplicación funciona entre servidores distintos. Si tienes diez máquinas con el mismo Debian, el sistema base se guarda una sola vez para las diez. En un parque homogéneo, eso multiplica el ahorro.

Lo que esto te permite hacer

Aquí está la parte práctica. Como el histórico cuesta poco, puedes permitirte una retención larga sin que el presupuesto se dispare. Y una retención larga es exactamente lo que te salva en los dos escenarios que más duelen: el ransomware que llevaba semanas dentro, y el error de datos que nadie detectó hasta el cierre del mes.

Con siete días de histórico, ambos casos acaban mal. Con treinta o noventa, tienes a dónde volver.

Las limitaciones honestas

La deduplicación no es magia, y conviene saber cuándo no ayuda:

  • Datos ya comprimidos o cifrados (vídeo, imágenes, archivos zip) apenas deduplican, porque cada versión es completamente distinta a nivel de bloque.
  • Bases de datos muy activas reescriben mucho, así que su tasa de cambio real es mayor que la de un servidor web estático.
  • El primer respaldo es completo y no se beneficia de nada. Es el único que tarda.

La contrapartida que nadie menciona

Como los bloques se comparten, un bloque corrupto afectaría a todas las copias que lo referencian. Por eso un sistema serio hace verificación periódica de integridad: relee los bloques almacenados, comprueba las huellas y avisa si algo no cuadra.

Si evalúas un servicio de copias, pregunta si verifica la integridad del almacén y con qué frecuencia. Es la pregunta que separa un almacén de copias de un montón de ficheros.

Cómo lo aplicamos

Nuestras copias de seguridad usan deduplicación en bloque con verificación de integridad programada. Por eso podemos ofrecer retenciones largas a precios razonables, y por eso el panel te muestra los bloques nuevos de cada copia: es la métrica que de verdad indica si tus datos están cambiando y si el sistema sigue funcionando.