DICCIONARIO · D

Deduplicación

La deduplicación es una técnica que detecta y elimina copias repetidas de datos para conservar una sola instancia y sustituir el resto por referencias. Se usa en almacenamiento y copias de seguridad para ahorrar espacio y ancho de banda, y en bases de datos, CRM y listas de email para que cada cliente aparezca una sola vez.

Germán Gutiérrez Escrito por Germán Gutiérrez 6 min de lectura
Ficha rápida
En inglés
Data deduplication o dedupe
Ámbitos
Almacenamiento y backups; bases de datos, CRM y listas de contactos
Niveles
Archivo (single-instance storage), bloque de tamaño fijo y bloque de tamaño variable
Cómo detecta duplicados
Huellas hash de cada fragmento, por ejemplo SHA-256
Ahorro típico (Microsoft)
30-50 % en documentos de usuario y 80-95 % en bibliotecas de virtualización

≡En resumen

  • Deduplicar es guardar cada dato una sola vez y apuntar a esa copia desde todos los lugares donde se repite.
  • En almacenamiento trabaja con fragmentos y huellas hash; en un CRM, con claves como el email o el dominio.
  • El ahorro depende del tipo de datos: enorme en máquinas virtuales y backups, escaso en vídeo o datos cifrados.
  • No es lo mismo que comprimir: la compresión reduce redundancia dentro de un fichero y la deduplicación entre muchos.
  • Una lista de contactos deduplicada mejora las métricas, evita envíos repetidos y ahorra licencias.

01 ¿Qué es la deduplicación de datos?

El término se usa en dos contextos. En sistemas y copias de seguridad, la deduplicación trabaja a nivel de ficheros o bloques de bytes para ahorrar disco. En gestión de datos y marketing, deduplicar significa detectar y fusionar registros que representan a la misma persona o empresa en una base de datos, un CRM o una lista de suscriptores. Ambos comparten la idea, pero las técnicas son distintas.

02 Cómo funciona la deduplicación en almacenamiento

  1. 1

    Trocear

    El sistema divide los datos en fragmentos (chunks): ficheros completos o bloques de unos pocos KB.

  2. 2

    Calcular la huella

    A cada fragmento se le aplica una función hash, como SHA-256, que genera un identificador casi único.

  3. 3

    Consultar el índice

    Se busca esa huella en un índice de fragmentos ya guardados.

  4. 4

    Guardar o referenciar

    Si la huella es nueva, se almacena el fragmento; si ya existe, solo se guarda un puntero a la copia existente.

  5. 5

    Comprimir (opcional)

    Los fragmentos únicos pueden comprimirse después para ahorrar todavía más espacio.

03 Tipos de deduplicación

Criterio Tipo Cómo funciona Pros y contras
Granularidad A nivel de archivo Compara ficheros completos (single-instance storage) Sencillo y rápido; si cambia un byte, el fichero entero cuenta como nuevo
Granularidad Bloque de tamaño fijo Trocea en bloques iguales, por ejemplo de 4 KB Eficiente; pierde coincidencias si se inserta contenido y se desplazan los bloques
Granularidad Bloque de tamaño variable Corta los bloques según el contenido con una ventana deslizante Máximo ahorro; más uso de CPU
Momento En línea (inline) Deduplica mientras escribe No ocupa espacio de más; puede ralentizar la escritura
Momento Posproceso Deduplica después, en tareas programadas No afecta a la escritura; necesita espacio temporal
Lugar En origen o en destino En el equipo que genera el dato o en el almacenamiento de backup En origen ahorra red; en destino no carga al cliente
Formas de clasificar la deduplicación de datos

La deduplicación de Windows Server, por ejemplo, funciona en posproceso: optimiza los ficheros de un volumen en segundo plano, guarda los fragmentos únicos en un almacén de fragmentos y deja en su lugar referencias. Los programas de copia de seguridad modernos suelen hacerlo en origen, para enviar por la red solo los bloques que el destino todavía no tiene.

04 Cuánto espacio ahorra la deduplicación

30-50 %

Ahorro típico en documentos de usuario (Office, fotos, música, vídeo)

Fuente: Microsoft Learn, Data Deduplication Overview

70-80 %

Ahorro típico en recursos compartidos de despliegue de software

Fuente: Microsoft Learn, Data Deduplication Overview

80-95 %

Ahorro típico en bibliotecas de virtualización (ISO, discos virtuales)

Fuente: Microsoft Learn, Data Deduplication Overview

50-60 %

Ahorro típico en un servidor de ficheros de uso general

Fuente: Microsoft Learn, Data Deduplication Overview

05 Deduplicación vs compresión vs backup incremental

Técnica Qué elimina Alcance Ejemplo
Deduplicación Fragmentos idénticos repetidos Entre muchos ficheros o copias El mismo PDF guardado 100 veces se almacena una
Compresión Redundancia dentro de un mismo fichero Fichero a fichero Un TXT de 10 MB se queda en 2 MB en un ZIP
Backup incremental Ficheros que no han cambiado desde la última copia Entre copias sucesivas Solo se copian los ficheros modificados ayer
Tres técnicas para reducir datos que se suelen confundir

Las tres se combinan: un buen sistema de backup hace copias incrementales, deduplica los bloques repetidos entre días y equipos y comprime lo que queda. Por eso las copias diarias de una web o de un servidor ocupan mucho menos que la suma de sus tamaños. Si gestionas una web, en nuestra guía de mantenimiento web verás cada cuánto conviene hacer copias y cómo comprobar que se pueden restaurar.

06 Deduplicación de registros en un CRM o una lista de email

En una base de datos de clientes los duplicados no son copias exactas: «Ana López», «[email protected]» y «A. López, Empresa SL» pueden ser la misma persona. Aquí deduplicar consiste en encontrar esas coincidencias, decidir qué registro manda y fusionar el resto. HubSpot, por ejemplo, evita duplicados de contactos usando el email y de empresas usando el dominio, según su documentación de ayuda.

  1. 1

    Normaliza

    Pasa emails a minúsculas, quita espacios, unifica prefijos de teléfono y formatos de nombre y empresa.

  2. 2

    Busca coincidencias exactas

    Mismo email, mismo NIF o mismo teléfono normalizado.

  3. 3

    Busca coincidencias aproximadas

    Nombres parecidos con la misma empresa o el mismo código postal, revisados por una persona.

  4. 4

    Define reglas de fusión

    Qué registro sobrevive y qué campo gana en cada caso: el más reciente, el más completo o el de la fuente más fiable.

  5. 5

    Evita que vuelvan

    Campos únicos, validación en formularios e importaciones que actualizan en lugar de crear.

07 Ventajas y desventajas de la deduplicación

Ventajas Desventajas
Menos espacio y menor coste de almacenamiento en la nube Consume CPU y memoria para calcular y buscar huellas
Copias de seguridad más rápidas y menos tráfico de red Restaurar puede ser más lento porque hay que reconstruir los ficheros
Se pueden guardar más versiones históricas con el mismo disco Si se corrompe un fragmento compartido, afecta a todos los ficheros que lo usan
En un CRM, una vista única de cada cliente Fusionar mal dos registros distintos es difícil de deshacer
Pros y contras de deduplicar

08 Herramientas para deduplicar

Herramienta Ámbito Qué hace
Deduplicación de datos de Windows Server Almacenamiento Optimiza volúmenes de ficheros en posproceso
ZFS Almacenamiento Sistema de ficheros con deduplicación de bloques opcional
Borg y restic Copias de seguridad Backups deduplicados y cifrados de código abierto
Excel y Google Sheets Listas Función «Quitar duplicados» sobre las columnas elegidas
Herramientas de duplicados del CRM CRM Detectan y fusionan contactos o empresas repetidos
OpenRefine Limpieza de datos Agrupa valores parecidos para unificarlos
Herramientas habituales según el tipo de deduplicación

Cuando los datos viven en varios sistemas propios (ERP, tienda online, CRM, formularios) y cada uno crea sus duplicados, la solución duradera es una capa de integración que normalice y deduplique en la entrada. Es un trabajo típico de desarrollo web a medida, y también un paso previo de cualquier data warehouse fiable.

Preguntas frecuentes sobre Deduplicación

Es una técnica que detecta datos repetidos, guarda una sola copia y sustituye las demás por referencias, para ahorrar espacio sin perder información.

Sirve para reducir el almacenamiento y el tráfico de las copias de seguridad y, en bases de datos o CRM, para que cada cliente aparezca una sola vez.

La compresión reduce la redundancia dentro de un fichero; la deduplicación elimina fragmentos idénticos repetidos entre muchos ficheros o copias. Se pueden usar juntas.

Es la que elimina duplicados en el momento de escribir los datos, antes de guardarlos. La alternativa es el posproceso, que deduplica después en tareas programadas.

Depende de los datos. Microsoft cifra el ahorro típico en un 30-50 % para documentos de usuario y en un 80-95 % para bibliotecas de máquinas virtuales.

Normalizando emails y teléfonos, buscando coincidencias exactas y aproximadas, fusionando según reglas claras y validando los formularios para que no se creen de nuevo.

Sí, si el sistema está bien diseñado: usa huellas hash robustas y, en muchos casos, verifica los bytes reales. El riesgo está en que un fragmento dañado afecta a todos los ficheros que lo comparten, por eso conviene mantener copias adicionales.

Fuentes consultadas

Germán Gutiérrez

Sobre el autor

Germán Gutiérrez

Development Manager en appyweb

Dirige el equipo de desarrollo de appyweb: aplicaciones web y móviles, SaaS, integraciones y arquitectura de software.

Ver perfil en LinkedIn ↗

Términos relacionados

Ver todos los términos →
B Backup Un backup es una copia de seguridad de datos guardada en un soporte o lugar distinto del original para poder restaurarlos si se pierden, se borran o quedan inutilizados. Es la principal defensa ante averías, errores humanos, robos y ransomware, y la base de cualquier plan de continuidad de un negocio. D Database Una database (base de datos, en español) es un conjunto organizado de datos almacenado de forma electrónica y gestionado por un software llamado SGBD, que permite guardarlos, consultarlos y actualizarlos con rapidez. Está detrás de casi cualquier aplicación: una tienda online, un CRM o una app bancaria dependen de una base de datos para funcionar. C CRM Un CRM (Customer Relationship Management) es la estrategia y, sobre todo, el software con el que una empresa centraliza los datos y el historial de sus clientes y contactos para gestionar ventas, marketing y atención. Sirve para que nadie pierda un lead, para saber en qué punto está cada oportunidad y para vender más a quien ya es cliente. B Big Data Big data (macrodatos) son conjuntos de datos tan grandes, rápidos o variados que no se pueden almacenar ni analizar con herramientas tradicionales, y el conjunto de tecnologías para procesarlos a escala. Importa porque permite detectar patrones, predecir comportamientos y entrenar modelos de inteligencia artificial. D Data Warehouse Un data warehouse (almacén de datos) es un sistema que reúne datos de varias fuentes de una empresa, los limpia y los organiza de forma histórica para analizarlos y generar informes. Importa porque ofrece una única versión fiable de las cifras del negocio y es la base del business intelligence y de los cuadros de mando. W Website Backup Un website backup es una copia de seguridad completa de un sitio web, con sus archivos y su base de datos, guardada fuera del servidor para poder restaurarlo tras un hackeo, un error o la caída del hosting. Solo sirve si es automática, se conserva en otro lugar y se ha comprobado que se puede restaurar.

Cuéntanos tu proyecto. Te respondemos en 48 h.

Auditoría gratuita de IA, campañas, web y SEO, con prioridades y cifras reales de tu negocio.

✓ Sin compromiso ✓ Respuesta en 48 h laborables ✓ Un consultor senior, no un bot
WA WhatsApp