≡En resumen
- Deduplicar es guardar cada dato una sola vez y apuntar a esa copia desde todos los lugares donde se repite.
- En almacenamiento trabaja con fragmentos y huellas hash; en un CRM, con claves como el email o el dominio.
- El ahorro depende del tipo de datos: enorme en máquinas virtuales y backups, escaso en vídeo o datos cifrados.
- No es lo mismo que comprimir: la compresión reduce redundancia dentro de un fichero y la deduplicación entre muchos.
- Una lista de contactos deduplicada mejora las métricas, evita envíos repetidos y ahorra licencias.
01 ¿Qué es la deduplicación de datos?
El término se usa en dos contextos. En sistemas y copias de seguridad, la deduplicación trabaja a nivel de ficheros o bloques de bytes para ahorrar disco. En gestión de datos y marketing, deduplicar significa detectar y fusionar registros que representan a la misma persona o empresa en una base de datos, un CRM o una lista de suscriptores. Ambos comparten la idea, pero las técnicas son distintas.
02 Cómo funciona la deduplicación en almacenamiento
-
1
Trocear
El sistema divide los datos en fragmentos (chunks): ficheros completos o bloques de unos pocos KB.
-
2
Calcular la huella
A cada fragmento se le aplica una función hash, como SHA-256, que genera un identificador casi único.
-
3
Consultar el índice
Se busca esa huella en un índice de fragmentos ya guardados.
-
4
Guardar o referenciar
Si la huella es nueva, se almacena el fragmento; si ya existe, solo se guarda un puntero a la copia existente.
-
5
Comprimir (opcional)
Los fragmentos únicos pueden comprimirse después para ahorrar todavía más espacio.
03 Tipos de deduplicación
| Criterio | Tipo | Cómo funciona | Pros y contras |
|---|---|---|---|
| Granularidad | A nivel de archivo | Compara ficheros completos (single-instance storage) | Sencillo y rápido; si cambia un byte, el fichero entero cuenta como nuevo |
| Granularidad | Bloque de tamaño fijo | Trocea en bloques iguales, por ejemplo de 4 KB | Eficiente; pierde coincidencias si se inserta contenido y se desplazan los bloques |
| Granularidad | Bloque de tamaño variable | Corta los bloques según el contenido con una ventana deslizante | Máximo ahorro; más uso de CPU |
| Momento | En línea (inline) | Deduplica mientras escribe | No ocupa espacio de más; puede ralentizar la escritura |
| Momento | Posproceso | Deduplica después, en tareas programadas | No afecta a la escritura; necesita espacio temporal |
| Lugar | En origen o en destino | En el equipo que genera el dato o en el almacenamiento de backup | En origen ahorra red; en destino no carga al cliente |
La deduplicación de Windows Server, por ejemplo, funciona en posproceso: optimiza los ficheros de un volumen en segundo plano, guarda los fragmentos únicos en un almacén de fragmentos y deja en su lugar referencias. Los programas de copia de seguridad modernos suelen hacerlo en origen, para enviar por la red solo los bloques que el destino todavía no tiene.
04 Cuánto espacio ahorra la deduplicación
30-50 %
Ahorro típico en documentos de usuario (Office, fotos, música, vídeo)
Fuente: Microsoft Learn, Data Deduplication Overview
70-80 %
Ahorro típico en recursos compartidos de despliegue de software
Fuente: Microsoft Learn, Data Deduplication Overview
80-95 %
Ahorro típico en bibliotecas de virtualización (ISO, discos virtuales)
Fuente: Microsoft Learn, Data Deduplication Overview
50-60 %
Ahorro típico en un servidor de ficheros de uso general
Fuente: Microsoft Learn, Data Deduplication Overview
05 Deduplicación vs compresión vs backup incremental
| Técnica | Qué elimina | Alcance | Ejemplo |
|---|---|---|---|
| Deduplicación | Fragmentos idénticos repetidos | Entre muchos ficheros o copias | El mismo PDF guardado 100 veces se almacena una |
| Compresión | Redundancia dentro de un mismo fichero | Fichero a fichero | Un TXT de 10 MB se queda en 2 MB en un ZIP |
| Backup incremental | Ficheros que no han cambiado desde la última copia | Entre copias sucesivas | Solo se copian los ficheros modificados ayer |
Las tres se combinan: un buen sistema de backup hace copias incrementales, deduplica los bloques repetidos entre días y equipos y comprime lo que queda. Por eso las copias diarias de una web o de un servidor ocupan mucho menos que la suma de sus tamaños. Si gestionas una web, en nuestra guía de mantenimiento web verás cada cuánto conviene hacer copias y cómo comprobar que se pueden restaurar.
06 Deduplicación de registros en un CRM o una lista de email
En una base de datos de clientes los duplicados no son copias exactas: «Ana López», «[email protected]» y «A. López, Empresa SL» pueden ser la misma persona. Aquí deduplicar consiste en encontrar esas coincidencias, decidir qué registro manda y fusionar el resto. HubSpot, por ejemplo, evita duplicados de contactos usando el email y de empresas usando el dominio, según su documentación de ayuda.
-
1
Normaliza
Pasa emails a minúsculas, quita espacios, unifica prefijos de teléfono y formatos de nombre y empresa.
-
2
Busca coincidencias exactas
Mismo email, mismo NIF o mismo teléfono normalizado.
-
3
Busca coincidencias aproximadas
Nombres parecidos con la misma empresa o el mismo código postal, revisados por una persona.
-
4
Define reglas de fusión
Qué registro sobrevive y qué campo gana en cada caso: el más reciente, el más completo o el de la fuente más fiable.
-
5
Evita que vuelvan
Campos únicos, validación en formularios e importaciones que actualizan en lugar de crear.
07 Ventajas y desventajas de la deduplicación
| Ventajas | Desventajas |
|---|---|
| Menos espacio y menor coste de almacenamiento en la nube | Consume CPU y memoria para calcular y buscar huellas |
| Copias de seguridad más rápidas y menos tráfico de red | Restaurar puede ser más lento porque hay que reconstruir los ficheros |
| Se pueden guardar más versiones históricas con el mismo disco | Si se corrompe un fragmento compartido, afecta a todos los ficheros que lo usan |
| En un CRM, una vista única de cada cliente | Fusionar mal dos registros distintos es difícil de deshacer |
08 Herramientas para deduplicar
| Herramienta | Ámbito | Qué hace |
|---|---|---|
| Deduplicación de datos de Windows Server | Almacenamiento | Optimiza volúmenes de ficheros en posproceso |
| ZFS | Almacenamiento | Sistema de ficheros con deduplicación de bloques opcional |
| Borg y restic | Copias de seguridad | Backups deduplicados y cifrados de código abierto |
| Excel y Google Sheets | Listas | Función «Quitar duplicados» sobre las columnas elegidas |
| Herramientas de duplicados del CRM | CRM | Detectan y fusionan contactos o empresas repetidos |
| OpenRefine | Limpieza de datos | Agrupa valores parecidos para unificarlos |
Cuando los datos viven en varios sistemas propios (ERP, tienda online, CRM, formularios) y cada uno crea sus duplicados, la solución duradera es una capa de integración que normalice y deduplique en la entrada. Es un trabajo típico de desarrollo web a medida, y también un paso previo de cualquier data warehouse fiable.
Preguntas frecuentes sobre Deduplicación
Es una técnica que detecta datos repetidos, guarda una sola copia y sustituye las demás por referencias, para ahorrar espacio sin perder información.
Sirve para reducir el almacenamiento y el tráfico de las copias de seguridad y, en bases de datos o CRM, para que cada cliente aparezca una sola vez.
La compresión reduce la redundancia dentro de un fichero; la deduplicación elimina fragmentos idénticos repetidos entre muchos ficheros o copias. Se pueden usar juntas.
Es la que elimina duplicados en el momento de escribir los datos, antes de guardarlos. La alternativa es el posproceso, que deduplica después en tareas programadas.
Depende de los datos. Microsoft cifra el ahorro típico en un 30-50 % para documentos de usuario y en un 80-95 % para bibliotecas de máquinas virtuales.
Normalizando emails y teléfonos, buscando coincidencias exactas y aproximadas, fusionando según reglas claras y validando los formularios para que no se creen de nuevo.
Sí, si el sistema está bien diseñado: usa huellas hash robustas y, en muchos casos, verifica los bytes reales. El riesgo está en que un fragmento dañado afecta a todos los ficheros que lo comparten, por eso conviene mantener copias adicionales.
Fuentes consultadas
Sobre el autor
Germán Gutiérrez
Development Manager en appyweb
Dirige el equipo de desarrollo de appyweb: aplicaciones web y móviles, SaaS, integraciones y arquitectura de software.
Ver perfil en LinkedIn ↗