Telemetry architecture và debugging workflow
Observability là khả năng trả lời câu hỏi mới từ system outputs; không phải cài một dashboard rồi gọi là xong.
Observability Signals
Logs, metrics, traces, profiles, events và correlation.
02SLI, SLO & Alerting
Error budgets, burn rates, actionable alerts và user outcomes.
03Metrics & Prometheus
Counters, gauges, histograms, RED/USE, cardinality và PromQL.
03AGrafana Dashboards & Alerting
Data sources, variables, panels, provisioning, dashboard design và alert lifecycle.
04Logging & Audit
Structured events, privacy, sampling, retention và integrity.
05Tracing & OpenTelemetry
Context, spans, sampling, collectors, messaging và baggage.
06Continuous Profiling
CPU, allocation, locks, wall time và production-safe profiling.
07JVM & Tomcat Diagnostics
Heap/GC/threads, connector, accept queue, pool và graceful shutdown.
08Dependencies & Saturation
DB/HTTP pools, DNS/TLS, queues, cache and downstream diagnosis.
09Incident Response
Triage, command roles, mitigation, communication và recovery.
10Postmortem & Telemetry Ops
Learning, actions, retention, cost, quality and governance.