Tối 18/11, hàng loạt dịch vụ phổ biến như ChatGPT, X (Twitter), các website thương mại và ứng dụng lớn đồng loạt mất kết nối. Nguyên nhân nhanh chóng được xác nhận đến từ Cloudflare – công ty đang xử lý hơn 20% lưu lượng Internet toàn cầu.
Cloudflare giải thích nguyên nhân sự cố
Theo CEO Matthew Prince, đây là một trong những lần gián đoạn nghiêm trọng nhất mà Cloudflare gặp phải kể từ năm 2019. Trái với suy đoán về tấn công mạng hay lỗi AI, vấn đề lại xuất phát từ lỗi cấu hình trong hệ thống quản lý bot (Bot Management) của công ty.
Trong quá trình cập nhật phần mềm, hệ thống đã vô tình tạo ra số lượng lớn bản sao dữ liệu. Điều này khiến:
Bộ nhớ bị đầy
Bộ đệm (buffer) bị tràn
Hệ thống điều phối lưu lượng khách hàng tê liệt
Các bộ lọc bot hoạt động sai, chặn nhầm các yêu cầu truy cập hợp lệ
Hậu quả là người dùng trên toàn cầu không thể truy cập nhiều nền tảng, gây ra tình trạng “sập mạng dây chuyền” vì Cloudflare đóng vai trò hạ tầng trung gian của vô số website.
Sự cố lan rộng toàn cầu
Do Cloudflare đảm nhiệm khoảng 1/5 lưu lượng Internet, lỗi lần này gây hiệu ứng domino tương tự những đợt ngừng hoạt động lớn từng xảy ra với AWS hay Microsoft Azure. Nhiều khu vực ghi nhận tình trạng không thể truy cập website, API và dịch vụ nền tảng trong nhiều phút.
Cloudflare cam kết khắc phục
Sau khi khắc phục thành công, Cloudflare cho biết họ sẽ:
Tăng cường bảo vệ và kiểm soát với các cấu hình tự động
Triển khai cơ chế kill switch toàn cầu, giúp tắt nhanh các tính năng gây lỗi
Rà soát toàn bộ hệ thống Bot Management để tránh lặp lại sự cố tương tự
Đại diện công ty cũng cam kết cải thiện quy trình thử nghiệm trước khi phát hành, hạn chế tối đa các lỗi phát sinh trong tương lai.
Viết bình luận