FPT Kubernetes Engine v2.13.2: Nâng cấp vận hành Cloud-Native, tối ưu GPU cho AI Workload

FPT Kubernetes Engine v2.13.2: Nâng cấp vận hành Cloud-Native, tối ưu GPU cho AI Workload

Tác giả: FPT Cloud
11:38 17/07/2026

Bản cập nhật FPT Kubernetes Engine (mFKE) v2.13.2 chính thức ra mắt, mang đến giải pháp toàn diện giúp doanh nghiệp tối ưu hóa chi phí vận hành nền tảng điện toán đám mây. Trọng tâm của phiên bản này là các nâng cấp đột phá về quản lý tài nguyên vi xử lý đồ họa (GPU), ra mắt dịch vụ sao lưu và khôi phục dữ liệu (Backup & Recovery) chuyên sâu, cùng khả năng hỗ trợ các phiên bản Kubernetes mới nhất.

Trong bối cảnh bùng nổ của trí tuệ nhân tạo (AI), Machine Learning và Big Data, các doanh nghiệp đang phải đối mặt với hai thách thức lớn: làm sao tối ưu chi phí cho hệ thống hạ tầng GPU đắt đỏ và bảo vệ an toàn cho khối lượng dữ liệu khổng lồ. Việc sử dụng các dòng GPU cao cấp cho những tác vụ nhỏ không chỉ gây lãng phí ngân sách mà còn làm giảm hiệu quả đầu tư (ROI). Cùng với đó, các phương pháp bảo vệ dữ liệu truyền thống trên môi trường container dần bộc lộ hạn chế, đòi hỏi một cơ chế chuyên sâu và có mức độ tự động hóa cao hơn.

Để tháo gỡ những điểm nghẽn này và hỗ trợ doanh nghiệp vận hành tối ưu hơn, FPT Kubernetes Engine v2.13.2 mang đến hàng loạt cải tiến kỹ thuật quan trọng dưới đây:

Bổ sung Kubernetes phiên bản mới  

FPT Kubernetes Engine v2.13.2 bổ sung hỗ trợ Kubernetes v1.34, v1.33 và v1.32 cho việc tạo cluster mới, giúp khách hàng có thêm lựa chọn phiên bản phù hợp với yêu cầu ứng dụng, môi trường vận hành và chính sách nâng cấp nội bộ.

Khách hàng có thể nâng cấp Kubernetes theo hai cách: nâng cấp thủ công (manual upgrade) hoặc tự động nâng cấp cluster (cluster auto-upgrade). Điều này giúp đội ngũ vận hành chủ động hơn trong việc kiểm soát lịch nâng cấp, giảm thao tác thủ công và chuẩn hóa vòng đời cluster theo kế hoạch của doanh nghiệp.

Ra mắt Backup & Recovery cho Persistent Volumes 

Phiên bản mới bổ sung tính năng sao lưu và khôi phục (Backup & Recovery) cho Persistent Volumes, giúp bảo vệ dữ liệu của các workload như cơ sở dữ liệu, hàng đợi, bộ nhớ đệm hoặc các dịch vụ dữ liệu chạy trên Kubernetes (database, queue, cache...).

Thay vì chỉ dựa vào PVC Snapshot, doanh nghiệp có thể tạo bản sao lưu cho dữ liệu trên Persistent Volumes, khôi phục dữ liệu khi cần, theo dõi trạng thái backup job và tổng hợp báo cáo backup/recovery trên giao diện quản trị tập trung. Cập nhật này giúp giảm rủi ro mất dữ liệu, rút ngắn thời gian phục hồi khi xảy ra lỗi ứng dụng, lỗi vận hành hoặc sự cố dữ liệu.

Từ phiên bản này, PVC Snapshot bắt đầu được ngừng phát triển và sẽ được loại bỏ trong thời gian tới. Hệ thống không hỗ trợ tạo mới PVC Snapshot, trong khi các snapshot hiện có vẫn có thể truy cập đến thời điểm được quy định. FPT Cloud khuyến nghị khách hàng chuyển sang Backup & Recovery để bảo vệ dữ liệu Persistent Volumes ổn định và tập trung hơn.

Bổ sung NVIDIA L4 GPU Flavor 

FPT Kubernetes Engine v2.13.2 bổ sung lựa chọn worker sử dụng NVIDIA L4 GPU, bên cạnh các dòng GPU Cloud hiện có như NVIDIA A30, A80, H100 và H200.

NVIDIA L4 phù hợp với các tác vụ cần tăng tốc xử lý bằng GPU nhưng không đòi hỏi cấu hình quá cao. Đây là lựa chọn phù hợp cho các bài toán như suy luận AI, phục vụ mô hình, xử lý dữ liệu theo lô, xử lý video, phân tích hình ảnh, nhận diện đối tượng, OCR hoặc các tác vụ GPU có mức tiêu thụ tài nguyên vừa phải.

Với NVIDIA L4, doanh nghiệp có trong tay giải pháp cân bằng hoàn hảo giữa hiệu năng và chi phí, đặc biệt hữu ích khi cần triển khai đồng thời nhiều AI model hoặc endpoint xử lý mà vẫn phải tối ưu hóa ngân sách.

Nâng tầm quản trị và tối ưu vận hành GPU Workload 

Nhằm mang lại trải nghiệm vận hành linh hoạt nhất, FPT Kubernetes Engine v2.13.2 cung cấp loạt cải tiến cho GPU workload, giúp khách hàng giảm thao tác quản trị và tối ưu khả năng phân bổ tài nguyên theo nhu cầu thực tế:

  • Managed-install Driver: Cho phép cập nhật phiên bản GPU Driver sau khi cluster đã được tạo. Thay vì phải tạo lại node pool để triển khai driver mới, khách hàng có thể quản lý driver thông qua GPU Operator, từ đó giảm thao tác vận hành và hạn chế gián đoạn khi cần cập nhật driver/CUDA để tương thích với AI framework, model runtime hoặc các yêu cầu bảo mật mới.
  • MIG GPU Sharing Strategy: Hỗ trợ trên Kubernetes v1.34, cho phép chia một GPU vật lý thành nhiều phần tài nguyên độc lập. Nhờ đó, nhiều workload có thể cùng sử dụng GPU hiệu quả hơn, giảm lãng phí tài nguyên khi một tác vụ chỉ cần sử dụng một phần năng lực GPU.
  • Dynamic Resource Allocation (DRA): Là cơ chế phân bổ tài nguyên động của Kubernetes, cho phép cấp phát GPU linh hoạt hơn theo thuộc tính, nhu cầu workload hoặc số lượng container trong pipeline. Tính năng này phù hợp với các AI workload có nhu cầu tài nguyên thay đổi theo model, batch size hoặc quy mô xử lý.

Bản phát hành FPT Kubernetes Engine v2.13.2 đánh dấu một bước tiến quan trọng trong việc hoàn thiện hệ sinh thái điện toán đám mây cho doanh nghiệp số. Thay vì chỉ đơn thuần mở rộng tài nguyên, phiên bản lần này tập trung giải quyết trực tiếp bài toán hiệu quả vận hành, mang lại lợi ích “kép”: vừa đảm bảo hệ thống vận hành an toàn, tối đa hóa hiệu năng xử lý cho các ứng dụng phức tạp, vừa tối ưu hóa chỉ số ROI cho toàn bộ hạ tầng công nghệ.

Tìm hiểu về giải pháp FPT Kubernetes Engine tại đây 

Liên hệ với chúng tôi để được tư vấn chi tiết về các giải pháp, dịch vụ của FPT Cloud:  

block right