AI Infrastructure·Soạn: [Ngày đăng]·6 phút đọc
GPU đắt, nhưng GPU chờ việc còn đắt hơn
Vì sao chỉ số cần theo dõi trên một cluster huấn luyện không phải là số GPU, mà là tỷ lệ sử dụng thực tế và thời gian chờ hàng đợi.
GPU
Đội AI Infrastructure — FPT-IS Next Gen Service
Hạ tầng AI
Một cluster GPU được đầu tư đúng cấu hình vẫn có thể mang lại hiệu quả thấp, nếu phần lớn thời gian card ở trạng thái chờ dữ liệu hoặc chờ được cấp phát.
Hai điểm nghẽn thường gặp
- Pipeline dữ liệu không đủ nhanh: GPU xử lý xong batch trước khi batch sau kịp nạp.
- Không có scheduler và hạn mức theo nhóm: một job lớn chiếm toàn bộ tài nguyên, các job ngắn xếp hàng nhiều giờ.
Suy luận là bài toán khác với huấn luyện
Với phục vụ mô hình, chỉ số quan trọng chuyển sang độ trễ và chi phí trên mỗi yêu cầu. Quantization, batching động và chọn đúng runtime suy luận thường mang lại cải thiện lớn hơn việc bổ sung phần cứng.
#GPU#MLOps#Scheduler#Inference



