≡En resumen
- Un sistema es observable cuando puedes explicar su comportamiento solo con los datos que emite, sin desplegar código nuevo.
- La monitorización te avisa de que algo va mal; la observabilidad te ayuda a descubrir por qué.
- Los tres pilares son logs (eventos), métricas (números en el tiempo) y trazas (el recorrido de cada petición).
- OpenTelemetry es el estándar abierto y neutral para instrumentar aplicaciones y enviar datos a cualquier herramienta.
- En un SaaS, la observabilidad reduce el tiempo de detección y resolución de incidencias y protege los acuerdos de servicio.
01 ¿Qué es la observabilidad?
El término viene de la teoría de control. En 1960, el ingeniero Rudolf E. Kálmán definió un sistema como observable cuando su estado interno puede determinarse a partir de sus salidas. La ingeniería de software adoptó la idea con el auge de los microservicios y la nube, cuando una sola petición empezó a atravesar decenas de componentes y los paneles de CPU y memoria dejaron de bastar para entender los fallos.
02 Observabilidad vs monitorización
| Aspecto | Monitorización | Observabilidad |
|---|---|---|
| Pregunta que responde | ¿Está funcionando? ¿Se ha superado un umbral? | ¿Por qué no funciona? ¿Qué tienen en común las peticiones lentas? |
| Tipo de problemas | Conocidos de antemano (known unknowns) | Imprevistos (unknown unknowns) |
| Datos | Conjunto predefinido de métricas y comprobaciones | Telemetría rica y correlacionada: logs, métricas, trazas con contexto |
| Forma de trabajar | Paneles y alertas fijas | Exploración: filtrar, agrupar y comparar datos al vuelo |
| Relación | Es una parte de la observabilidad | La incluye y la amplía |
03 Los pilares: logs, métricas y trazas
Logs
Registros con fecha y nivel de gravedad de lo que ha pasado: «pago rechazado para el pedido 1234». Mejor en formato estructurado (JSON) que en texto libre.
Métricas
Valores numéricos agregados en el tiempo: peticiones por segundo, latencia p95, uso de memoria. Baratas de almacenar y perfectas para alertas.
Trazas
El recorrido de una petición concreta por todos los servicios, dividido en tramos (spans) con su duración. Muestran dónde se pierde el tiempo.
Perfiles
Consumo de CPU y memoria a nivel de función. OpenTelemetry los trata como señal en desarrollo.
El valor no está en cada señal por separado, sino en correlacionarlas: saltar de una alerta de latencia (métrica) a las trazas lentas de ese minuto y, desde una traza, a los logs de esa petición gracias a un identificador común. Para eso hace falta instrumentar el código de forma coherente, sobre todo en el back end, donde ocurren la mayoría de los cuellos de botella.
04 OpenTelemetry: el estándar abierto de observabilidad
OpenTelemetry (OTel) es un marco de código abierto para generar, recoger y exportar telemetría. Nació de la fusión de dos proyectos anteriores, OpenTracing y OpenCensus, y es un proyecto de la Cloud Native Computing Foundation (CNCF). Su principal ventaja es la neutralidad: instrumentas tu aplicación una vez y envías los datos al backend que quieras, de código abierto o comercial, sin atarte a un proveedor. OpenTelemetry no almacena ni visualiza datos: eso lo hacen otras herramientas.
7 may 2019
OpenTelemetry es aceptado en la CNCF
Fuente: CNCF
26 ago 2021
pasa a la fase de incubación
Fuente: CNCF
11 may 2026
alcanza el nivel de proyecto graduado
Fuente: CNCF
| Pieza | Qué hace |
|---|---|
| API y SDK por lenguaje | Permiten crear trazas, métricas y logs desde el código (Java, Python, Go, JavaScript, .NET, PHP y otros) |
| Instrumentación automática | Captura sin tocar código las llamadas HTTP, a bases de datos y a colas de frameworks populares |
| Collector | Agente o pasarela que recibe, filtra, enriquece y reenvía la telemetría |
| OTLP | Protocolo estándar para transportar los datos entre componentes y backends |
| Señales | Trazas, métricas, logs y baggage (contexto compartido) estables; perfiles en desarrollo |
05 Cómo implantar observabilidad en una aplicación o SaaS
-
1
Define qué es «funcionar bien»
Fija objetivos de nivel de servicio (SLO): por ejemplo, el 99,9 % de los pagos responde en menos de 2 segundos.
-
2
Instrumenta con OpenTelemetry
Empieza por la instrumentación automática y añade tramos manuales en los procesos de negocio críticos.
-
3
Estructura los logs
Formato JSON, niveles coherentes e identificador de traza en cada línea para poder correlacionar.
-
4
Centraliza en un backend
Envía todo por el Collector a una plataforma donde consultar y relacionar las señales.
-
5
Crea paneles y alertas por síntomas
Alerta de lo que nota el usuario (errores, latencia) y no de cada pico de CPU.
-
6
Revisa tras cada incidencia
Si no pudiste responder una pregunta con los datos disponibles, añade la instrumentación que faltaba.
Un SaaS fija un SLO de disponibilidad del 99,9 % mensual para su API. En un mes de 30 días eso deja un «presupuesto de errores» de 43,2 minutos (30 × 24 × 60 × 0,001). Si una incidencia consume 30 minutos, el equipo sabe que le quedan 13 y prioriza estabilidad sobre nuevas funciones hasta el mes siguiente. Sin métricas fiables de disponibilidad y latencia, este cálculo es imposible: por eso los SLO y la observabilidad van de la mano.
En infraestructuras con Kubernetes o varios servicios en cloud hosting, las trazas distribuidas son casi imprescindibles. Y los datos acaban en un dashboard compartido entre desarrollo, soporte y negocio.
06 Herramientas, costes y errores frecuentes
Código abierto
Prometheus para métricas, Jaeger para trazas y Grafana para visualizar son combinaciones habituales, gratuitas pero con coste de operación.
Plataformas comerciales
Soluciones SaaS de observabilidad que integran las tres señales. Casi todas aceptan datos de OpenTelemetry.
Observabilidad de IA
En aplicaciones con modelos de lenguaje se suman señales como tokens consumidos, latencia por llamada y calidad de las respuestas.
- ✓Guardar todos los logs de depuración en producción: el coste crece más rápido que el valor.
- ✓Etiquetar métricas con identificadores únicos (usuario, pedido): dispara la cardinalidad y la factura.
- ✓Muestrear las trazas sin criterio y perder justo las de los errores.
- ✓Crear decenas de alertas que nadie atiende.
- ✓Registrar datos personales o secretos en los logs, con riesgo legal y de seguridad.
La observabilidad se diseña mejor desde el principio que añadida tras la primera caída. Por eso la incluimos en cualquier proyecto de desarrollo de software SaaS y de desarrollo de aplicaciones web a medida. Si estás en la fase de idea, la guía sobre cómo crear un SaaS explica dónde encaja en el stack.
Preguntas frecuentes sobre Observabilidad
Es la capacidad de entender el estado interno de un sistema de software a partir de los datos que emite, como logs, métricas y trazas, para diagnosticar problemas, incluso los que no se habían previsto.
La monitorización vigila indicadores definidos de antemano y avisa cuando algo sale de rango; la observabilidad permite explorar los datos para descubrir por qué ocurre un problema nuevo. La monitorización es una parte de la observabilidad.
Logs, métricas y trazas. Los logs registran eventos, las métricas miden valores en el tiempo y las trazas siguen el recorrido de cada petición entre servicios.
Es un estándar y conjunto de herramientas de código abierto de la CNCF para generar, recoger y exportar telemetría a cualquier backend. Nació de la fusión de OpenTracing y OpenCensus.
No. OpenTelemetry genera y transporta los datos; Prometheus, Jaeger, Grafana o las plataformas comerciales los almacenan, consultan y visualizan.
Un SLO (objetivo de nivel de servicio) es la meta interna de fiabilidad de un servicio, como que el 99,9 % de las peticiones respondan bien en un mes. Se mide con las métricas que proporciona la observabilidad y es más exigente que el SLA pactado con el cliente.
Depende del volumen de datos. Las herramientas de código abierto no tienen licencia pero sí coste de operación, y las comerciales suelen cobrar por datos ingeridos, hosts o usuarios.
Sí, en versión ligera: logs estructurados, métricas de latencia y errores y alertas por síntomas. Se amplía con trazas cuando la aplicación crece.
Fuentes consultadas
Sobre el autor
Germán Gutiérrez
Development Manager en appyweb
Dirige el equipo de desarrollo de appyweb: aplicaciones web y móviles, SaaS, integraciones y arquitectura de software.
Ver perfil en LinkedIn ↗