Bỏ qua để đến nội dung

Người vận hành hạ tầng

Học deploy, backup, cảnh báo và restore drill theo phân quyền vận hành riêng.

  • Xác minh channel test, đích nhận và audit mà không để lộ secret.
  • Phân biệt probe dịch vụ với độ mới của dữ liệu game.
  • Thực hiện backup/restore drill trên bản sao cô lập và đo RPO/RTO.

Ai dùng được

Đây là quyền endpoint theo backend/src/admin_portal/core/permissions.py; các thao tác nhạy cảm như PII có kiểm tra step-up riêng. Super Admin vượt ma trận bằng quyền khẩn cấp.

Tài nguyên endpointHành động cầnVai trò được backend cho phép
infra_health READ Super Admin, Game Owner, Live Ops, Economy Admin, Auditor

Bảng dưới đây lấy quyền endpoint từ dữ liệu permissions.json do T.3 sinh trực tiếp từ backend. Grant không tự đảm bảo menu hoặc feature flag đang bật.

Bảng permission mô tả grant endpoint; menu, điều kiện module, scope game và MFA còn được kiểm tra riêng. Release Engineer không có grant trong ma trận Portal; quyền deploy/host phải được tổ chức cấp ngoài Portal.

  1. Hướng dẫn triển khai — 20 phút
  2. Google Play & Cloud — 15 phút
  3. Bảo vệ khóa và backup — 15 phút
  4. Khôi phục thảm họa — 20 phút
  5. Sự cố thường gặp — 15 phút

Mục tiêu: Kiểm tra cấu hình channel và nút gửi thử trong môi trường cô lập.

Dữ liệu chuẩn bị: channel test_t5_ops_channel; chat/email sandbox do tổ chức cấp, không ghi secret vào tài liệu

Vai trò cần: Người vận hành được cấp quyền kênh

Các bước (chỉ dev/staging):

  1. Xác nhận endpoint/backend dev và kênh nhận test.
  2. Kiểm tra loại channel, đích nhận và người phụ trách.
  3. Dùng Send test khi được phép; xác nhận event trong Audit Log.

Kết quả mong đợi: Thông báo test đến đúng đích hoặc trả lỗi có thể chẩn đoán; secret không xuất hiện trong log.

Mục tiêu: Phân biệt probe hệ thống với dữ liệu nghiệp vụ.

Dữ liệu chuẩn bị: game test_t5_ops_game; dashboard/health test data

Vai trò cần: Người vận hành; Portal READ theo grant được cấp

Các bước (chỉ dev/staging):

  1. Mở Health và ghi tình trạng từng nguồn.
  2. Đối chiếu timestamp với Dashboard cho cùng game.
  3. Chuyển cảnh báo tới owner theo runbook, không tự sửa event.

Kết quả mong đợi: Báo cáo có nguồn, timestamp và owner chịu trách nhiệm.

Mục tiêu: Thực hiện drill chỉ trên backup copy và sandbox.

Dữ liệu chuẩn bị: backup copy test_t5_ops_backup; credentials dev do tổ chức cấp

Vai trò cần: Người vận hành hạ tầng được phân công

Các bước (chỉ dev/staging):

  1. Kiểm tra khóa/manifest và tính toàn vẹn bản copy.
  2. Chạy runbook restore trong sandbox cô lập.
  3. Xác nhận health, migration và checklist dọn; lưu kết quả không kèm secret.

Kết quả mong đợi: Drill có kết quả, RPO/RTO đo được và dữ liệu sandbox được xử lý theo chính sách.

  • Tôi biết cách xác nhận đúng game/scope trước thao tác.
  • Tôi phân biệt quyền đọc, ghi, publish và mutation.
  • Tôi biết khi nào cần reason, MFA step-up hoặc duyệt độc lập.
  • Tôi chỉ dùng dữ liệu test và biết cách dừng/chuyển escalations.
  • Dán bot token, SMTP password hoặc private identity vào log/tài liệu.
  • Kết luận dữ liệu mới chỉ từ health endpoint xanh.
  • Dùng backup copy chưa xác minh hoặc restore sai đích.
  • Thử gửi alert ra channel thật thay vì channel sandbox.

Áp dụng cho Portal v1.2.2