Part 14 · Observability & Production Debugging
Part 14 / 14.1

Telemetry architecture và debugging workflow

Observability là khả năng trả lời câu hỏi mới từ system outputs; không phải cài một dashboard rồi gọi là xong.

01

Observability Signals

Logs, metrics, traces, profiles, events và correlation.

02

SLI, SLO & Alerting

Error budgets, burn rates, actionable alerts và user outcomes.

03

Metrics & Prometheus

Counters, gauges, histograms, RED/USE, cardinality và PromQL.

03A

Grafana Dashboards & Alerting

Data sources, variables, panels, provisioning, dashboard design và alert lifecycle.

04

Logging & Audit

Structured events, privacy, sampling, retention và integrity.

05

Tracing & OpenTelemetry

Context, spans, sampling, collectors, messaging và baggage.

06

Continuous Profiling

CPU, allocation, locks, wall time và production-safe profiling.

07

JVM & Tomcat Diagnostics

Heap/GC/threads, connector, accept queue, pool và graceful shutdown.

08

Dependencies & Saturation

DB/HTTP pools, DNS/TLS, queues, cache and downstream diagnosis.

09

Incident Response

Triage, command roles, mitigation, communication và recovery.

10

Postmortem & Telemetry Ops

Learning, actions, retention, cost, quality and governance.

← Tổng quanBắt đầu chương 01 →