Amazon EKS
TrialNền tảng
Dịch vụ Kubernetes được AWS quản lý để chạy và vận hành các cụm container.
Vì sao ở đây
Xếp vào Trial: 6 bài bằng chứng từ 2 nguồn, chủ yếu là cập nhật framework, 4 bài trong 30 ngày qua. Độ tin cậy 52%.
Bằng chứng (6)
- 8The New Stack·10/8/2026breakthroughEKS rút ngắn thời gian kéo image container dung lượng lớn
Bài viết cho biết các image container phục vụ suy luận ML dung lượng lớn trên Amazon EKS từng mất vài phút để kéo về, làm chậm việc sẵn sàng của pod và khiến GPU nhàn rỗi. Bằng cách thiết kế lại quy trình pull để tận dụng tốt hơn băng thông mạng, thông lượng lưu trữ và năng lực tính toán sẵn có, nhóm đã rút thời gian kéo image nhiều GB xuống còn vài giây; các cải tiến này hiện có mặc định trong EKS Auto Mode và đã được đóng góp ngược dòng cho containerd và SOCI snapshotter.
- 6InfoQ·26/7/2026framework_updateAmazon EKS bổ sung khả năng quay lui phiên bản Kubernetes
Amazon EKS hiện hỗ trợ quay lui phiên bản Kubernetes, cho phép người dùng đưa control plane của cụm về phiên bản trước đó trong vòng 7 ngày sau khi nâng cấp. Tính năng này nhằm giảm rủi ro khi nâng cấp cụm tại chỗ và giúp đội ngũ khôi phục nhanh hơn nếu bản cập nhật gây ra sự cố.
- 7The New Stack·19/7/2026open_sourceTác tử giám sát node EKS của AWS giúp GPU tự phục hồi
AWS mô tả cách hãng xây dựng và mở mã nguồn EKS Node Monitoring Agent để phát hiện lỗi node và ghi Kubernetes NodeConditions, từ đó kích hoạt Karpenter tự động thay thế node. Hệ thống này nhắm tới các cụm EKS quy mô lớn, nơi lỗi phần cứng GPU và các lỗi hạ tầng khác xảy ra thường xuyên, đồng thời rút ra các bài học về phát hiện sự cố, hợp đồng API và độ trễ khắc phục ở quy mô lớn.
- 5The New Stack·17/7/2026framework_updateBài học vận hành controller Kubernetes ở quy mô lớn
Bài viết giải thích cách các controller Kubernetes biến ý định khai báo thành trạng thái được thực thi, và vì sao việc này khó hơn nhiều ở quy mô lớn khi cache trễ, đối tượng thay đổi liên tục và tính đúng đắn phụ thuộc vào cái nhìn đầy đủ toàn hệ thống. Nội dung tập trung vào hai controller của Amazon EKS: Network Policy Controller để thực thi lưu lượng trong cụm và VPC Resource Controller để gán security group AWS cho các pod được chọn.
- 8The New Stack·10/7/2026framework_updateAWS học được gì về lỗi theo vùng khi vận hành Kubernetes ở quy mô rất lớn
AWS cho biết việc vận hành Amazon EKS trên quy mô hàng triệu cụm đã buộc hãng phải thiết kế lại khả năng chịu lỗi của control plane trước các sự cố theo vùng. Bài học chính là tính ổn định tĩnh: khi một vùng gặp sự cố, hệ thống nên ngừng phản ứng dây chuyền, giữ nguyên năng lực hiện có và chuyển lưu lượng sang vùng khác thay vì kích hoạt lỗi lan truyền.
- 7The New Stack·30/6/2026framework_updateAmazon EKS vận hành Kubernetes ở quy mô lớn như thế nào
Amazon chia sẻ các bài học khi vận hành Kubernetes ở quy mô đội hình rất lớn trên hàng trăm nghìn cụm ở nhiều khu vực AWS. Bài viết nhấn mạnh các mô hình tăng độ bền cho control plane của EKS, gồm sao lưu, khôi phục và quản lý thành viên etcd tự động để tránh lỗi nhỏ biến thành sự cố diện rộng.