Kai là AI agent Kubernetes của CloudThinker. Nó phát hiện sự cố, tìm nguyên nhân gốc, khắc phục trong sandbox và kiểm chứng bản vá — theo chính sách của đội ngũ bạn, với thông tin xác thực cấp theo tác vụ và nhật ký kiểm toán chống giả mạo. Kỹ sư “ở trên vòng lặp”, không còn phải trực đêm.
Hoạt động với EKS, GKE, AKS và cluster tự quản lý. Không cần thông tin xác thực cố định.
Cluster mở rộng nhanh hơn tốc độ con người vận hành chúng. Tín hiệu ngày một nhiều; băng thông của đội on-call thì không.
Kai chạy vòng lặp DARV — Detect, Analyze, Remediate, Verify — để một sự cố Kubernetes đi từ lúc báo động đến bản vá đã được chứng minh, mà không cần con người có mặt ở mọi bước.
01
02
03
04
Chưa quen với vòng lặp DARV? Đọc giải thích về vòng lặp DARV.
Kai không được trao chìa khóa ngay ngày đầu. Mọi runbook bắt đầu ở L1 — điều tra và đề xuất. Khi nó tạo được lòng tin trong môi trường của bạn, bạn nâng nó lên hành-động-có-phê-duyệt, rồi tới tự động trong một hàng rào đã định nghĩa. Lòng tin được cấp theo từng runbook, từng cluster, chứ không phải tất cả cùng lúc.
Cơ chế tự chủ tăng dần hoạt động ra saoTrao quyền truy cập Kubernetes production cho một AI agent chỉ an toàn khi nền tảng được xây dựng cho việc đó. Quyền của Kai được cấp theo tác vụ, giới hạn phạm vi, chạy trong sandbox, mã hóa dữ liệu và ghi nhật ký — từ đầu đến cuối.
Không có quyền truy cập cluster cố định. Kai chỉ nhận thông tin xác thực có phạm vi giới hạn được cấp ngay tại thời điểm công việc và thu hồi ngay sau đó.
Tìm hiểu thêmThông tin xác thực nằm trong một môi trường cô lập, không bao giờ nằm trong prompt. Mọi hành động đều có thể đảo ngược và được kiểm soát.
Tìm hiểu thêmDữ liệu nhạy cảm — secret, PII trong log — được mã hóa (tokenize) theo cách xác định ngay tại điểm xuất dữ liệu, trước khi chạm tới bất kỳ mô hình nào.
Tìm hiểu thêmMọi phát hiện, quyết định và hành động đều được ghi vào một nhật ký kiểm toán mà bạn có thể phát lại phục vụ tuân thủ và điều tra hậu sự cố.
Tìm hiểu thêmVận hành Kubernetes tự động là để một AI agent tự điều tra và xử lý các vấn đề của cluster — CrashLoopBackOff, OOMKilled, rollout thất bại, pod pending, cảnh báo nhiễu — thay vì chỉ hiển thị chúng trên dashboard cho con người tự khắc phục. Kai của CloudThinker chạy trọn vòng lặp DARV (Detect, Analyze, Remediate, Verify) theo chính sách của đội ngũ, với thông tin xác thực được cấp phát theo từng tác vụ, thực thi trong sandbox, mã hóa dữ liệu nhạy cảm theo cách xác định và nhật ký kiểm toán chống giả mạo — để kỹ sư "ở trên vòng lặp" thay vì bị cuốn vào từng sự cố.
Một trợ lý chỉ gợi ý lệnh rồi chờ bạn tự chạy; Kai khép kín cả vòng lặp. Nó suy luận trên trạng thái thực tế của cluster, đề xuất hoặc thực thi phương án khắc phục bên trong sandbox với thông tin xác thực có phạm vi giới hạn được cấp ngay tại thời điểm tác vụ, rồi kiểm chứng rằng bản vá thực sự có hiệu lực — sau đó ghi lại nhật ký kiểm toán. Bạn quyết định mức độ tự chủ cho từng môi trường, từ chỉ-thông-báo cho tới hoàn toàn tự động trong một hàng rào an toàn.
Chỉ trong đúng mức độ tự chủ mà bạn thiết lập. Với cơ chế tự chủ tăng dần, mọi hành động mới bắt đầu ở L1 (Kai điều tra và đề xuất). Khi một runbook chứng minh được độ tin cậy, bạn nâng nó lên L2 (hành động có phê duyệt, thông qua một yêu cầu thay đổi có phạm vi rõ ràng), rồi tới L3–L4 (tự động trong một hàng rào đã định nghĩa). Mọi hành động đều có thể đảo ngược, được giới hạn bằng thông tin xác thực cấp theo tác vụ và được ghi vào nhật ký kiểm toán chống giả mạo.
Những công việc "day-2" thường ngày của cluster: pod CrashLoopBackOff và OOMKilled, deployment và rollback thất bại hoặc bị kẹt, pod pending và các vấn đề lập lịch/áp lực node, request và limit tài nguyên cấu hình sai, bất thường của HPA và autoscaling, lỗi ingress và mạng, câu hỏi về RBAC và drift, cũng như tối ưu chi phí/rightsizing giữa các namespace. Kai tương quan tín hiệu, tìm nguyên nhân gốc, khắc phục và kiểm chứng.
Có. Kai kết nối với hệ thống observability và cảnh báo của bạn (Prometheus, Grafana, Datadog, Alertmanager, PagerDuty) và các cluster của bạn (EKS, GKE, AKS, cluster tự quản lý) thông qua CloudThinker Connections. Nó tiếp nhận chính tín hiệu bạn đang có sẵn thay vì bắt bạn thay thế bất kỳ thứ gì.
An toàn khi nền tảng được thiết kế cho việc đó. Kai không bao giờ nắm giữ thông tin xác thực cluster cố định — quyền truy cập được cấp phát theo từng tác vụ, giới hạn đúng phạm vi công việc và nằm bên trong sandbox chứ không nằm trong prompt. Dữ liệu nhạy cảm được mã hóa (tokenize) theo cách xác định ngay tại điểm xuất dữ liệu, và mọi hành động đều được ghi vào nhật ký kiểm toán chống giả mạo. Đó chính là khác biệt giữa một AI agent vận hành Kubernetes tự động và một script chạy không có giám sát.
Kết nối một cluster và xem Kai phát hiện, phân tích, khắc phục và kiểm chứng — theo chính sách của bạn, với nhật ký kiểm toán đầy đủ. Dùng thử miễn phí hoặc đặt một buổi demo.
Muốn trao đổi trước? Liên hệ đội ngũ của chúng tôi.