Chuyển đến nội dung chính
Mọi tính năng AI trong CyberOS — phản hồi Genie/CUO, chạy kỹ năng, hỏi đáp KB, và @genie trong CHAT — đều đi qua AI Gateway. Bạn không bao giờ phải quản lý khóa API riêng cho từng tính năng hay bận tâm tính năng nào dùng model gì. Thay vào đó, gateway xử lý định tuyến nhà cung cấp, thực thi ngân sách token theo gói của bạn, ẩn danh PII trước khi bất kỳ dữ liệu nào rời khỏi tenant của bạn, và ghi một dòng chi phí cho mỗi yêu cầu để bạn luôn biết đã chi tiêu bao nhiêu và vì sao.
Tất cả các tính năng AI của CyberOS (Genie/CUO, chạy kỹ năng, hỏi đáp KB, CHAT @genie) đều dùng AI Gateway — không có khóa API riêng nào cần quản lý theo từng tính năng. AI Gateway là một module P0, hiện đang được triển khai.

Định tuyến model và nhà cung cấp

Gateway định tuyến mọi yêu cầu suy luận qua ba nhóm nhà cung cấp dựa trên cài đặt cư trú dữ liệu (data residency) và năng lực cần thiết.

Anthropic Claude

Các model Claude (Haiku, Sonnet, Opus) cho tác vụ suy luận đối thoại và ngữ cảnh dài. Được dùng cho các lớp alias chat-smart và chat-reason.

OpenAI

Dòng GPT cho các lớp alias chat-fast và tạo ảnh. Có sẵn ở khu vực cư trú us-1 và sg-1.

AWS Bedrock

Điểm cuối Bedrock theo khu vực cho tenant sg-1, eu-1, us-1 và vn-1. Giữ dữ liệu bên trong khu vực tuân thủ của bạn khi Bedrock là nhà cung cấp trong phạm vi.

Phân giải alias model

Bạn và các agent tham chiếu model theo alias, không phải theo model ID thô. Gateway phân giải alias thành điểm cuối cụ thể phù hợp với khu vực cư trú của bạn.

Cư trú × nhà cung cấp

Cài đặt cư trú dữ liệu của bạn (chọn khi đăng ký và bị khóa sau đó) quyết định gateway dùng điểm cuối nhà cung cấp nào, giữ dữ liệu trong khu vực tuân thủ của bạn.
Yêu cầu không bao giờ được tự động định tuyến lại sang nhà cung cấp bên ngoài khu vực cư trú của bạn — kể cả khi nhà cung cấp gặp sự cố. Gateway chuyển sang chế độ suy giảm (degraded) và trả về lỗi rõ ràng thay vì âm thầm vượt qua ranh giới dữ liệu.

Kiểm soát chi phí theo tenant

Hạn ngạch token AI hàng tháng

Ngân sách token của bạn được đặt theo bậc gói. Gateway kiểm tra hạn ngạch còn lại trước mỗi yêu cầu, chứ không phải sau.
Khi hạn ngạch tháng của bạn cạn kiệt, yêu cầu trả về lỗi 402 COST_CAP_EXCEEDED với thông báo rõ ràng. Yêu cầu không bao giờ bị âm thầm hủy hoặc tính phí — giới hạn là chặn cứng, không phải cảnh báo nhẹ.

Thực thi giới hạn chi phí

Gateway sử dụng mô hình kế toán hai bước:
1

Kiểm tra trước khi gọi

Trước khi chuyển tiếp yêu cầu tới nhà cung cấp, gateway kiểm tra sổ cái chi phí của tenant. Nếu chi phí token ước tính vượt quá ngân sách còn lại, yêu cầu bị từ chối ngay lập tức và không có cuộc gọi nào tới nhà cung cấp.
2

Giữ chi phí

Với các yêu cầu vượt qua bước kiểm tra trước, gateway đặt một khoản giữ chi phí 60 giây trên số tiền ước tính. Điều này ngăn các yêu cầu đồng thời cộng dồn vượt giới hạn trước khi đối soát.
3

Đối soát sau khi gọi

Sau khi nhà cung cấp phản hồi, gateway đối soát lượng token thực tế đã dùng so với khoản giữ và ghi một dòng chi phí cuối cùng vào sổ cái. Khoản giữ được giải phóng và số dư đang chạy của bạn được cập nhật.

Sổ cái chi phí

Mỗi yêu cầu AI đều tạo ra một dòng chi phí mà bạn có thể xem trong bảng điều khiển thanh toán. Mỗi dòng ghi lại:
  • Tenant và module — module CyberOS nào đã kích hoạt yêu cầu (ví dụ: chat, skill, kb)
  • Persona của agent — biến thể CUO hoặc kỹ năng đã tạo ra cuộc gọi
  • Model đã dùng — alias đã phân giải và nhà cung cấp
  • Số lượng token — token đầu vào, token đầu ra và tổng chi phí bằng USD
  • Đường dẫn failover — yêu cầu đã đi đến nhà cung cấp chính hay dự phòng
  • Trạng thái cache — phản hồi có được phục vụ từ cache hay không (không tính phí cho cache hit)

Ẩn danh PII

Gateway tự động quét mọi prompt và mọi phản hồi của nhà cung cấp để tìm PII trước khi ghi log, cache, hoặc ghi dòng audit. Việc ẩn danh diễn ra trong tiến trình — PII không bao giờ đến được pipeline log hoặc kho trace AI LangSmith ở dạng chưa ẩn danh.

Những gì được coi là PII

Mục tiêu recall của ẩn danh PII là ≥ 99,5%. Bộ quy tắc ẩn danh giống với bộ được dùng trong pipeline log OBS, vì vậy dòng audit AI và log vận hành của bạn xử lý PII nhất quán.

Bảng điều khiển sử dụng

Mở Settings → AI Usage trong bảng điều khiển CyberOS để xem:

Tiêu thụ token

Tổng token đang chạy cho chu kỳ thanh toán hiện tại, hạn ngạch còn lại, và biểu đồ phân tích theo ngày.

Chi phí theo module

Chi tiêu token phân tích theo module CyberOS (chat, skill, kb, v.v.) để bạn thấy tính năng nào tốn nhiều chi phí AI nhất.

Chi phí theo kỹ năng

Với các tenant dùng kỹ năng tùy chỉnh, phân tích chi phí theo từng kỹ năng giúp bạn nhận diện các quy trình tự động hóa đắt đỏ.

Người dùng hàng đầu

Danh sách xếp hạng thành viên (hoặc persona của agent) theo mức tiêu thụ token trong kỳ — hữu ích để phát hiện các phiên agent chạy mất kiểm soát.

Xem sổ cái chi phí

Bạn có thể truy vấn các dòng chi phí riêng lẻ từ bảng điều khiển thanh toán hoặc qua API GraphQL:

Failover nhà cung cấp

Gateway tự động xử lý sự suy giảm của nhà cung cấp để các quy trình của bạn tiếp tục chạy.
Trường failoverPath trong mỗi dòng chi phí ghi lại yêu cầu đã dùng nhà cung cấp chính hay dự phòng, để bạn thấy tác động của sự cố nhà cung cấp trong sổ cái chi phí.

Không lưu trữ dữ liệu (Zero-data-retention, ZDR)

Với các tenant thuộc gói có ZDR (Enterprise), gateway định tuyến yêu cầu đến các nhà cung cấp có thỏa thuận ZDR, nghĩa là nhà cung cấp không lưu giữ prompt hoặc completion của bạn để huấn luyện hoặc ghi log ở phía họ. Quyết định định tuyến ZDR được ghi vào mỗi dòng audit.