DICCIONARIO · O

Observabilidad

La observabilidad es la capacidad de entender qué ocurre dentro de un sistema de software a partir de los datos que emite (logs, métricas y trazas), incluso ante fallos que nadie había previsto. A diferencia de la monitorización clásica, no se limita a alertar de lo conocido: permite preguntar por qué algo falla y encontrar la causa en minutos.

Germán Gutiérrez Escrito por Germán Gutiérrez 6 min de lectura
Ficha rápida
Tipo
Práctica de ingeniería de software y operaciones
Origen del término
Teoría de control: Rudolf E. Kálmán, 1960
Señales principales
Logs, métricas y trazas (más perfiles, en desarrollo en OpenTelemetry)
Estándar abierto
OpenTelemetry, proyecto de la CNCF nacido de OpenTracing y OpenCensus
OpenTelemetry en la CNCF
Aceptado el 7 de mayo de 2019, graduado el 11 de mayo de 2026

≡En resumen

  • Un sistema es observable cuando puedes explicar su comportamiento solo con los datos que emite, sin desplegar código nuevo.
  • La monitorización te avisa de que algo va mal; la observabilidad te ayuda a descubrir por qué.
  • Los tres pilares son logs (eventos), métricas (números en el tiempo) y trazas (el recorrido de cada petición).
  • OpenTelemetry es el estándar abierto y neutral para instrumentar aplicaciones y enviar datos a cualquier herramienta.
  • En un SaaS, la observabilidad reduce el tiempo de detección y resolución de incidencias y protege los acuerdos de servicio.

01 ¿Qué es la observabilidad?

El término viene de la teoría de control. En 1960, el ingeniero Rudolf E. Kálmán definió un sistema como observable cuando su estado interno puede determinarse a partir de sus salidas. La ingeniería de software adoptó la idea con el auge de los microservicios y la nube, cuando una sola petición empezó a atravesar decenas de componentes y los paneles de CPU y memoria dejaron de bastar para entender los fallos.

02 Observabilidad vs monitorización

Aspecto Monitorización Observabilidad
Pregunta que responde ¿Está funcionando? ¿Se ha superado un umbral? ¿Por qué no funciona? ¿Qué tienen en común las peticiones lentas?
Tipo de problemas Conocidos de antemano (known unknowns) Imprevistos (unknown unknowns)
Datos Conjunto predefinido de métricas y comprobaciones Telemetría rica y correlacionada: logs, métricas, trazas con contexto
Forma de trabajar Paneles y alertas fijas Exploración: filtrar, agrupar y comparar datos al vuelo
Relación Es una parte de la observabilidad La incluye y la amplía
Diferencias entre monitorización y observabilidad

03 Los pilares: logs, métricas y trazas

01

Logs

Registros con fecha y nivel de gravedad de lo que ha pasado: «pago rechazado para el pedido 1234». Mejor en formato estructurado (JSON) que en texto libre.

02

Métricas

Valores numéricos agregados en el tiempo: peticiones por segundo, latencia p95, uso de memoria. Baratas de almacenar y perfectas para alertas.

03

Trazas

El recorrido de una petición concreta por todos los servicios, dividido en tramos (spans) con su duración. Muestran dónde se pierde el tiempo.

04

Perfiles

Consumo de CPU y memoria a nivel de función. OpenTelemetry los trata como señal en desarrollo.

El valor no está en cada señal por separado, sino en correlacionarlas: saltar de una alerta de latencia (métrica) a las trazas lentas de ese minuto y, desde una traza, a los logs de esa petición gracias a un identificador común. Para eso hace falta instrumentar el código de forma coherente, sobre todo en el back end, donde ocurren la mayoría de los cuellos de botella.

04 OpenTelemetry: el estándar abierto de observabilidad

OpenTelemetry (OTel) es un marco de código abierto para generar, recoger y exportar telemetría. Nació de la fusión de dos proyectos anteriores, OpenTracing y OpenCensus, y es un proyecto de la Cloud Native Computing Foundation (CNCF). Su principal ventaja es la neutralidad: instrumentas tu aplicación una vez y envías los datos al backend que quieras, de código abierto o comercial, sin atarte a un proveedor. OpenTelemetry no almacena ni visualiza datos: eso lo hacen otras herramientas.

7 may 2019

OpenTelemetry es aceptado en la CNCF

Fuente: CNCF

26 ago 2021

pasa a la fase de incubación

Fuente: CNCF

11 may 2026

alcanza el nivel de proyecto graduado

Fuente: CNCF

Pieza Qué hace
API y SDK por lenguaje Permiten crear trazas, métricas y logs desde el código (Java, Python, Go, JavaScript, .NET, PHP y otros)
Instrumentación automática Captura sin tocar código las llamadas HTTP, a bases de datos y a colas de frameworks populares
Collector Agente o pasarela que recibe, filtra, enriquece y reenvía la telemetría
OTLP Protocolo estándar para transportar los datos entre componentes y backends
Señales Trazas, métricas, logs y baggage (contexto compartido) estables; perfiles en desarrollo
Piezas principales de OpenTelemetry

05 Cómo implantar observabilidad en una aplicación o SaaS

  1. 1

    Define qué es «funcionar bien»

    Fija objetivos de nivel de servicio (SLO): por ejemplo, el 99,9 % de los pagos responde en menos de 2 segundos.

  2. 2

    Instrumenta con OpenTelemetry

    Empieza por la instrumentación automática y añade tramos manuales en los procesos de negocio críticos.

  3. 3

    Estructura los logs

    Formato JSON, niveles coherentes e identificador de traza en cada línea para poder correlacionar.

  4. 4

    Centraliza en un backend

    Envía todo por el Collector a una plataforma donde consultar y relacionar las señales.

  5. 5

    Crea paneles y alertas por síntomas

    Alerta de lo que nota el usuario (errores, latencia) y no de cada pico de CPU.

  6. 6

    Revisa tras cada incidencia

    Si no pudiste responder una pregunta con los datos disponibles, añade la instrumentación que faltaba.

Ejemplo · Ejemplo: SLO y presupuesto de errores

Un SaaS fija un SLO de disponibilidad del 99,9 % mensual para su API. En un mes de 30 días eso deja un «presupuesto de errores» de 43,2 minutos (30 × 24 × 60 × 0,001). Si una incidencia consume 30 minutos, el equipo sabe que le quedan 13 y prioriza estabilidad sobre nuevas funciones hasta el mes siguiente. Sin métricas fiables de disponibilidad y latencia, este cálculo es imposible: por eso los SLO y la observabilidad van de la mano.

En infraestructuras con Kubernetes o varios servicios en cloud hosting, las trazas distribuidas son casi imprescindibles. Y los datos acaban en un dashboard compartido entre desarrollo, soporte y negocio.

06 Herramientas, costes y errores frecuentes

01

Código abierto

Prometheus para métricas, Jaeger para trazas y Grafana para visualizar son combinaciones habituales, gratuitas pero con coste de operación.

02

Plataformas comerciales

Soluciones SaaS de observabilidad que integran las tres señales. Casi todas aceptan datos de OpenTelemetry.

03

Observabilidad de IA

En aplicaciones con modelos de lenguaje se suman señales como tokens consumidos, latencia por llamada y calidad de las respuestas.

  • ✓Guardar todos los logs de depuración en producción: el coste crece más rápido que el valor.
  • ✓Etiquetar métricas con identificadores únicos (usuario, pedido): dispara la cardinalidad y la factura.
  • ✓Muestrear las trazas sin criterio y perder justo las de los errores.
  • ✓Crear decenas de alertas que nadie atiende.
  • ✓Registrar datos personales o secretos en los logs, con riesgo legal y de seguridad.

La observabilidad se diseña mejor desde el principio que añadida tras la primera caída. Por eso la incluimos en cualquier proyecto de desarrollo de software SaaS y de desarrollo de aplicaciones web a medida. Si estás en la fase de idea, la guía sobre cómo crear un SaaS explica dónde encaja en el stack.

Preguntas frecuentes sobre Observabilidad

Es la capacidad de entender el estado interno de un sistema de software a partir de los datos que emite, como logs, métricas y trazas, para diagnosticar problemas, incluso los que no se habían previsto.

La monitorización vigila indicadores definidos de antemano y avisa cuando algo sale de rango; la observabilidad permite explorar los datos para descubrir por qué ocurre un problema nuevo. La monitorización es una parte de la observabilidad.

Logs, métricas y trazas. Los logs registran eventos, las métricas miden valores en el tiempo y las trazas siguen el recorrido de cada petición entre servicios.

Es un estándar y conjunto de herramientas de código abierto de la CNCF para generar, recoger y exportar telemetría a cualquier backend. Nació de la fusión de OpenTracing y OpenCensus.

No. OpenTelemetry genera y transporta los datos; Prometheus, Jaeger, Grafana o las plataformas comerciales los almacenan, consultan y visualizan.

Un SLO (objetivo de nivel de servicio) es la meta interna de fiabilidad de un servicio, como que el 99,9 % de las peticiones respondan bien en un mes. Se mide con las métricas que proporciona la observabilidad y es más exigente que el SLA pactado con el cliente.

Depende del volumen de datos. Las herramientas de código abierto no tienen licencia pero sí coste de operación, y las comerciales suelen cobrar por datos ingeridos, hosts o usuarios.

Sí, en versión ligera: logs estructurados, métricas de latencia y errores y alertas por síntomas. Se amplía con trazas cuando la aplicación crece.

Fuentes consultadas

Germán Gutiérrez

Sobre el autor

Germán Gutiérrez

Development Manager en appyweb

Dirige el equipo de desarrollo de appyweb: aplicaciones web y móviles, SaaS, integraciones y arquitectura de software.

Ver perfil en LinkedIn ↗

Términos relacionados

Ver todos los términos →
K Kubernetes Kubernetes (K8s) es una plataforma de código abierto que orquesta aplicaciones en contenedores: decide en qué servidores se ejecutan, las escala según la carga, las reinicia si fallan y las actualiza sin cortes. Google la liberó en 2014 y hoy la mantiene la Cloud Native Computing Foundation (CNCF). Es el estándar para operar microservicios en la nube. B Back end El back end es la parte de una web o aplicación que se ejecuta en el servidor y que el usuario no ve: la lógica de negocio, la base de datos, la autenticación y las API que entregan la información al navegador o a la app. Sin back end no hay registros, pagos, búsquedas ni contenidos dinámicos. A API Una API (Application Programming Interface, interfaz de programación de aplicaciones) es un conjunto de reglas y puntos de acceso que permite que dos programas se comuniquen: uno pide datos o acciones y el otro responde en un formato acordado, sin que ninguno conozca el código interno del otro. Es lo que conecta webs, apps, pasarelas de pago e inteligencia artificial. C Cloud Hosting El cloud hosting (alojamiento en la nube) es un tipo de hosting en el que una web o aplicación se ejecuta sobre recursos virtualizados de una red de servidores de un proveedor, en lugar de sobre una única máquina física. Permite ampliar o reducir potencia según la demanda y pagar por uso, con más disponibilidad que un hosting tradicional. D Dashboard Un dashboard es un panel visual que reúne en una sola pantalla los indicadores más importantes de un negocio, una campaña o un sistema, para entender de un vistazo cómo van y decidir rápido. En español se traduce como panel de control, tablero de control o cuadro de mando, y suele actualizarse automáticamente desde las fuentes de datos. B Big Data Big data (macrodatos) son conjuntos de datos tan grandes, rápidos o variados que no se pueden almacenar ni analizar con herramientas tradicionales, y el conjunto de tecnologías para procesarlos a escala. Importa porque permite detectar patrones, predecir comportamientos y entrenar modelos de inteligencia artificial.

Cuéntanos tu proyecto. Te respondemos en 48 h.

Auditoría gratuita de IA, campañas, web y SEO, con prioridades y cifras reales de tu negocio.

✓ Sin compromiso ✓ Respuesta en 48 h laborables ✓ Un consultor senior, no un bot
WA WhatsApp