Supplement · Microsoft Azure
30 câu hỏi từ platform đến incident
Trả lời theo requirement → lựa chọn/trade-off → failure mode → evidence. Follow-up kiểm tra khả năng áp dụng, không chỉ nhớ tên dịch vụ.
Platform, organization và identity
1. Region, availability zone và region pair khác nhau thế nào?
Region là deployment/data location; zone là failure domain trong region; region pair là quan hệ platform cho một số dịch vụ, không tự tạo workload DR. Follow-up: service không hỗ trợ zone thì đáp ứng RTO bằng cách nào?
2. Shared responsibility thay đổi từ VM sang PaaS ra sao?
Microsoft nhận thêm OS/runtime/platform operations; khách hàng vẫn sở hữu identity, data, configuration, application và recovery validation. Follow-up: ai chịu trách nhiệm patch dependency trong application?
3. Vì sao không sao chép org chart vào management group hierarchy?
Org chart đổi nhanh và không phản ánh policy archetype; hierarchy sâu làm inheritance/debug khó. Follow-up: tiêu chí nào đáng tạo management group mới?
4. Subscription là boundary gì?
Là boundary về billing, quota, access và policy, đồng thời giảm blast radius. Nó không phải network/data isolation tự động. Follow-up: khi nào tách workload thành subscription riêng?
5. Landing zone khác subscription trống?
Landing zone gồm operating model, identity, connectivity, management, governance, security và automation để workload deploy an toàn. Follow-up: subscription vending cần output gì?
6. Entra role và Azure RBAC role khác gì?
Entra roles quản directory objects; Azure RBAC quản Azure resources/data actions ở scope. Follow-up: Global Administrator có mặc định đọc mọi storage account không?
7. PIM giảm risk nào và không giảm risk nào?
Giảm standing privilege bằng activation có thời hạn/audit; không sửa role quá rộng, compromised active session hay approval hình thức. Follow-up: activation policy cho Owner nên có gì?
8. System-assigned và user-assigned managed identity?
System-assigned cùng lifecycle resource; user-assigned độc lập và tái sử dụng. Reuse quá rộng tăng blast radius. Follow-up: deployment slot nên chia identity thế nào?
9. Key Vault có loại bỏ secret rotation problem?
Không; nó quản storage/access/version nhưng producer, rotation workflow và consumer reload vẫn cần thiết kế. Follow-up: chứng minh rotation không downtime ra sao?
10. Break-glass account phải được vận hành thế nào?
Cloud-only, tách dependency thường ngày, strong authentication, sealed procedure, alert mọi use và test định kỳ. Follow-up: test mà không tạo false incident thế nào?
Governance, networking, compute và data
11. Azure Policy khác RBAC?
RBAC giới hạn principal actions; Policy đánh giá/enforce resource state bất kể principal có quyền. Follow-up: policy deny có chặn Owner không?
12. Audit, deny, modify và deployIfNotExists dùng khi nào?
Audit đo; deny chặn; modify đổi request/state hỗ trợ; DINE deploy related resource khi thiếu. Hai effect sau cần identity/remediation. Follow-up: rollout deny an toàn thế nào?
13. Exemption tốt cần metadata gì?
Owner, scope, rationale, category, compensating control, approval và expiry. Follow-up: ai review exemption sắp hết hạn?
14. Hub-spoke giải quyết gì và tạo risk gì?
Tập trung transit, shared services và inspection; tạo hub bottleneck, route complexity và central dependency. Follow-up: kiểm chứng asymmetric routing bằng evidence nào?
15. VNet peering có transitive không?
Không mặc định; spoke A không đi spoke B qua hub chỉ vì đều peer. Cần NVA/Route Server/vWAN và routing thích hợp. Follow-up: gateway transit ảnh hưởng gì?
16. Private endpoint có tự làm PaaS private hoàn toàn?
Không; còn public access setting, DNS resolution, route/NSG behavior và client paths. Follow-up: on-prem resolve private endpoint thế nào?
17. Chọn VM, App Service, Container Apps, Functions hay AKS?
Dựa trên control, workload shape, portability, scaling, networking và operations maturity. AKS không mặc định tốt hơn managed app platform. Follow-up: khi nào không nên dùng AKS?
18. Autoscale có thay capacity planning không?
Không; autoscale trễ, chịu quota/provisioning time và có thể overload downstream. Follow-up: chọn metric và upper bound thế nào?
19. AKS managed nghĩa Microsoft chịu trách nhiệm gì?
Microsoft quản hosted control plane; khách hàng quản workload, node strategy, Kubernetes config, network/security, upgrades và capacity. Follow-up: PodDisruptionBudget không bảo vệ trường hợp nào?
20. LRS, ZRS, GRS và GZRS khác gì?
Khác failure domain và geo-copy; geo replication thường async. Chọn theo durability, availability, RPO, access và cost. Follow-up: replication có thay backup không?
21. Cosmos DB partition key quan trọng thế nào?
Nó quyết định distribution, transaction scope, hotspot, scale và cost. Key cardinality thấp/skew gây hot partition. Follow-up: evidence nào nhận biết skew?
Reliability, SecOps, DR và FinOps
22. SLA của nhiều services có bằng workload SLO?
Không; topology serial/parallel, dependencies, application behavior và operational recovery quyết định end-to-end availability. Follow-up: tính composite SLA serial ra sao?
23. Quota gây incident dù CPU thấp thế nào?
Scale/deploy/failover bị chặn bởi regional vCPU, public IP, SKU hoặc API limits; current instances vẫn nhàn. Follow-up: quota nào phải kiểm tra trước DR?
24. Retry khi nào làm outage nặng hơn?
Khi lỗi non-transient, retry đồng bộ không jitter, request không idempotent hoặc downstream đã saturated. Follow-up: retry budget nằm ở layer nào?
25. Defender for Cloud và Sentinel khác gì?
Defender tập trung cloud posture/workload protection; Sentinel là SIEM/SOAR thu thập, correlate và orchestrate response. Follow-up: recommendation nào không nên auto-remediate?
26. Metrics, logs và traces dùng khác nhau ra sao?
Metrics rẻ và tốt cho trend/alert; logs giàu context/query; traces nối distributed request. Correlation IDs và synchronized time rất quan trọng. Follow-up: absence of logs được alert thế nào?
27. Alert tốt cần thuộc tính gì?
User impact/action rõ, severity, owner, runbook, threshold/window, dedup và tested notification. Follow-up: giảm alert fatigue mà không che incident thế nào?
28. DR runbook tối thiểu gồm gì?
Trigger/authority, dependency order, data state, capacity/quota, traffic switch, validation, communication, rollback/failback. Follow-up: tabletop không chứng minh được điều gì?
29. Rehost và replatform trade-off?
Rehost nhanh nhưng mang technical debt/cost; replatform tận dụng managed service nhưng tăng change/testing. Follow-up: wave đầu nên chọn workload nào?
30. Reservation có phải bước FinOps đầu tiên?
Không; cần allocation/visibility, remove waste và rightsize trước, rồi cam kết cho baseline ổn định. Follow-up: unit cost metric của workload là gì?