Giảm nhiễu cảnh báo trước khi nghĩ đến machine learning
Mô hình phát hiện bất thường không cứu được một hệ thống cảnh báo đã hỏng từ gốc. Ba việc phải làm với dữ liệu vận hành trước khi nói đến AIOps.
Yêu cầu phổ biến nhất chúng tôi nhận được về AIOps là: “giúp giảm số cảnh báo”. Nhưng phần lớn trường hợp, vấn đề không nằm ở thuật toán mà ở việc cảnh báo được đặt trên chỉ số máy móc chứ không phải trên trải nghiệm người dùng.
Việc thứ nhất: dọn ngưỡng cảnh báo cũ
Một hệ thống vận hành nhiều năm thường tích lũy hàng trăm rule không ai dám tắt. Bước đầu luôn là thống kê: rule nào bắn nhiều nhất, rule nào chưa từng dẫn đến hành động nào. Nhóm thứ hai nên bị xoá, không phải đưa vào mô hình.
Việc thứ hai: chuẩn hoá dữ liệu
- Log, metric và trace phải có chung định danh dịch vụ và môi trường.
- Sự kiện cần mốc thời gian nhất quán — lệch giờ giữa các nguồn phá vỡ mọi phân tích tương quan.
- Thay đổi hệ thống (deploy, cấu hình) cũng là dữ liệu vận hành, cần đưa vào cùng kho sự kiện.
Việc thứ ba: xác định ca sử dụng cụ thể
“Phát hiện bất thường” là mục tiêu quá rộng để triển khai. Ca sử dụng đầu tiên nên hẹp và đo được: gom nhóm cảnh báo cùng nguyên nhân, hoặc phát hiện tăng độ trễ trước ngưỡng cứng. Khi mô hình chứng minh được giá trị trên một ca cụ thể, việc mở rộng dễ thuyết phục hơn nhiều.
Machine learning làm rõ tín hiệu, nó không tạo ra tín hiệu ở nơi không có.



