
Câu hỏi cần giải quyết
Dashboard tổng chỉ cho biết dịch vụ chậm nhưng không đủ điểm đo để xác định sự cố nằm tại access, WAN, cloud hay application tier.
- Người dùng truy cập dịch vụ qua nhiều loại đường truyền
- SLA cần được kiểm tra liên tục thay vì chỉ khi có sự cố
- Điểm đo phải giúp phân định từng đoạn của service path
Cách tiếp cận kỹ thuật
Thiết kế service test theo hành trình người dùng, đồng bộ thời gian, thu thập baseline trước khi đặt ngưỡng và liên kết cảnh báo với path metadata.
Chọn hành trình dịch vụ
Xác định client site, đích dịch vụ, DNS, proxy và các đoạn mạng có thể tạo suy giảm.
Đặt probe có chủ đích
Mỗi điểm đo phải trả lời được một câu hỏi khoanh vùng, không chỉ tăng số lượng dashboard.
Thu baseline
Đo theo giờ và ngày đủ dài để nhận diện chu kỳ trước khi đặt threshold hoặc cam kết báo cáo.
Thiết kế vòng xử lý
Cảnh báo dẫn tới path, test chi tiết và phép đo xác nhận sau khi đội vận hành khắc phục.
Dữ liệu và đầu ra cần giữ lại
Ba đầu ra phục vụ quyết định
KPI gắn với từng service path thay vì một số trung bình
Ngưỡng cảnh báo dựa trên baseline theo site
Báo cáo có dữ liệu phục vụ khoanh vùng và kiểm chứng phục hồi
Phạm vi của kết luận
Đây là kịch bản tham chiếu. Tần suất đo, SLA và ngưỡng chỉ có giá trị khi được thống nhất theo dịch vụ và dữ liệu nền thực tế.
