AppCarrier — FPT-IS Next Gen ServiceFPT-ISNEXT GEN SERVICE
Liên hệ tư vấn
AIOps·Soạn: [Ngày đăng]·6 phút đọc

Giảm nhiễu cảnh báo trước khi nghĩ đến machine learning

Mô hình phát hiện bất thường không cứu được một hệ thống cảnh báo đã hỏng từ gốc. Ba việc phải làm với dữ liệu vận hành trước khi nói đến AIOps.

AIO
Đội AIOps — FPT-IS Next Gen Service
Vận hành thông minh
Giảm nhiễu cảnh báo trước khi nghĩ đến machine learning

Yêu cầu phổ biến nhất chúng tôi nhận được về AIOps là: “giúp giảm số cảnh báo”. Nhưng phần lớn trường hợp, vấn đề không nằm ở thuật toán mà ở việc cảnh báo được đặt trên chỉ số máy móc chứ không phải trên trải nghiệm người dùng.

Việc thứ nhất: dọn ngưỡng cảnh báo cũ

Một hệ thống vận hành nhiều năm thường tích lũy hàng trăm rule không ai dám tắt. Bước đầu luôn là thống kê: rule nào bắn nhiều nhất, rule nào chưa từng dẫn đến hành động nào. Nhóm thứ hai nên bị xoá, không phải đưa vào mô hình.

Việc thứ hai: chuẩn hoá dữ liệu

Việc thứ ba: xác định ca sử dụng cụ thể

“Phát hiện bất thường” là mục tiêu quá rộng để triển khai. Ca sử dụng đầu tiên nên hẹp và đo được: gom nhóm cảnh báo cùng nguyên nhân, hoặc phát hiện tăng độ trễ trước ngưỡng cứng. Khi mô hình chứng minh được giá trị trên một ca cụ thể, việc mở rộng dễ thuyết phục hơn nhiều.

Machine learning làm rõ tín hiệu, nó không tạo ra tín hiệu ở nơi không có.
#AIOps#Observability#Alerting#MTTR
← Tất cả bài viếtLiên hệ đội kỹ thuật

Bài liên quan

Related

Error budget: cách chúng tôi cân tốc độ phát hành và độ ổn định
SRE
Error budget: cách chúng tôi cân tốc độ phát hành và độ ổn định
Di trú theo đợt: chia nhỏ để không đánh cược cả hệ thống
Migration
Di trú theo đợt: chia nhỏ để không đánh cược cả hệ thống
Landing zone: những quyết định khó sửa nếu làm sai từ đầu
Cloud Platform
Landing zone: những quyết định khó sửa nếu làm sai từ đầu