LLM Gateway: Cổng API, định tuyến và chi phí

Một API để kết nối mô hình, định tuyến và theo dõi chi phí

Vào trang chủ llmgateway.io
Báo hỏng
llmgateway.io
LLM Gateway screenshot

LLM Gateway là cổng API mã nguồn mở giúp ứng dụng kết nối với nhiều nhà cung cấp mô hình ngôn ngữ. Công cụ tập trung việc định tuyến, quản lý khóa và phân tích mức sử dụng, phù hợp với nhóm muốn đổi mô hình và theo dõi chi phí mà không duy trì nhiều tích hợp riêng.

LLM Gateway dùng để làm gì? Một ví dụ dễ hiểu

Giả sử ứng dụng chăm sóc khách hàng dùng một mô hình để phân loại câu hỏi và mô hình khác để soạn câu trả lời. Ứng dụng gửi yêu cầu đến LLM Gateway; cổng chuyển yêu cầu tới nhà cung cấp rồi trả kết quả về. Tại điểm trung gian này, bạn cũng xem được chi phí và độ trễ của từng lần gọi.

Đây là lớp hạ tầng, không phải một mô hình tự tạo câu trả lời. Sản phẩm do Polar Lights LLC vận hành, chủ yếu dành cho lập trình viên và nhóm nền tảng. Giao diện Lounge riêng cho phép thử mô hình trong trình duyệt.

Kết nối ứng dụng và kiểm tra yêu cầu đầu tiên

Làm theo hướng dẫn bắt đầu chính thức:

  1. Đăng nhập bảng điều khiển, tạo dự án và lấy khóa API của gateway. Lưu khóa ở phía máy chủ.
  2. Chọn tín dụng trả trước hoặc thêm khóa nhà cung cấp của bạn trong Provider Keys. Khóa gateway xác thực ứng dụng; khóa nhà cung cấp kết nối với tài khoản bên đó.
  3. Chọn ID mô hình đang có và kiểm tra đầu vào, khả năng cùng giới hạn ngữ cảnh.
  4. Đặt URL cơ sở của ứng dụng khách tương thích OpenAI thành https://api.llmgateway.io/v1. Với HTTP, gửi modelmessages tới /chat/completions bằng xác thực Bearer.
  5. Kiểm tra nội dung trả về, sau đó đối chiếu nhà cung cấp, token, độ trễ và chi phí trên bảng điều khiển.

Hãy thử dữ liệu đại diện trước khi chuyển lưu lượng thật. API tương thích không có nghĩa mọi mô hình hỗ trợ cùng tham số và công cụ.

Đổi mô hình và xử lý lỗi nhà cung cấp

Một tích hợp chung giúp so sánh mô hình theo từng tác vụ. Định tuyến có thể chọn nhà cung cấp khả dụng và thử lại yêu cầu lỗi qua phương án phù hợp khác. Quy tắc định tuyến vẫn phụ thuộc vào nhà cung cấp và giới hạn của họ, không bảo đảm dịch vụ tuyệt đối không gián đoạn.

Phân tích sử dụng giúp tìm mô hình tốn tiền hoặc lời gọi chậm. Hạn mức và quy tắc truy cập theo khóa hỗ trợ tách ứng dụng, giới hạn mô hình hoặc nhà cung cấp được phép dùng. Bộ nhớ đệm có thể giảm xử lý lặp lại, nhưng bộ nhớ đệm phản hồi của gateway khác bộ nhớ đệm prompt của nhà cung cấp. Hiệu quả phụ thuộc cấu hình và kiểu yêu cầu.

Phân biệt miễn phí, BYOK và tín dụng

Kiểm tra ngày 10 tháng 9 năm 2026: dịch vụ lưu trữ tiêu chuẩn không thu phí nền tảng cho định tuyến BYOK; bạn trả tiền suy luận trực tiếp cho nhà cung cấp. FAQ giá nêu phí 5% khi mua tín dụng. Lưu toàn bộ nội dung là tùy chọn, tính thêm 0,01 USD mỗi triệu token. Trang giá còn nêu phí quốc tế 1,5% cho thẻ ngoài Mỹ; Enterprise cần báo giá.

Xem giá hiện hành và tính riêng token đầu vào, đầu ra. Tài khoản miễn phí không làm mọi mô hình trở thành miễn phí. DevPass và gói trò chuyện có điều kiện riêng. Mức USD không phải giá cuối cùng bằng đồng Việt Nam hay xác nhận mọi phương thức thanh toán địa phương.

Khi nào nên tự lưu trữ gateway?

Tài liệu tự triển khai có Docker, Compose và Kubernetes. Hệ thống cần các dịch vụ ứng dụng, PostgreSQL, Redis và thông tin xác thực nhà cung cấp. Nhóm của bạn chịu trách nhiệm vận hành, sao lưu, cập nhật và phân quyền.

Gateway dùng AGPLv3; tính năng doanh nghiệp trong ee/ có giấy phép thương mại riêng. Tự lưu trữ phù hợp khi cần kiểm soát hạ tầng và có khả năng vận hành. Điều đó không tự động chạy mô hình trên máy chủ của bạn: yêu cầu gửi đến nhà cung cấp bên ngoài vẫn được xử lý tại đó.

Kiểm tra lưu dữ liệu và giới hạn gọi

Mặc định chỉ lưu siêu dữ liệu. Tổ chức tiêu chuẩn có thể bật lưu nội dung đầy đủ. Responses API có ngoại lệ: phản hồi đã lưu được giữ 30 ngày độc lập với cài đặt tổ chức. Dùng store: false để tắt việc lưu này và đọc quy tắc lưu giữ.

Chính sách riêng tư cho biết gateway không dùng nội dung khách hàng để huấn luyện mô hình. Nhà cung cấp được chọn có chính sách riêng. Ngoài ra còn có giới hạn tổ chức, đồng thời và nhà cung cấp. Hạn mức mô hình miễn phí phụ thuộc trạng thái tín dụng. Với lỗi 429, cần chờ trước khi thử lại và kiểm soát số yêu cầu đồng thời.

Câu hỏi thường gặp

Có dùng miễn phí được không?

Định tuyến BYOK miễn phí, nhưng nhà cung cấp có thể thu phí suy luận. Tín dụng và lưu nội dung đầy đủ được tính riêng.

Có giữ tích hợp OpenAI hiện tại được không?

Có thể dùng API tương thích với URL cơ sở, khóa gateway và mô hình được hỗ trợ. Hãy kiểm thử tính năng trước khi chuyển đổi.

Tự lưu trữ có giữ toàn bộ xử lý trong máy của tôi không?

Không. Bạn lưu trữ gateway; mô hình bên ngoài vẫn xử lý yêu cầu tại nhà cung cấp.

Prompt có luôn được loại khỏi lưu trữ không?

Không thể khẳng định cho mọi API. Responses API có quy tắc 30 ngày riêng và tùy chọn store: false.

Tài nguyên chính thức và cộng đồng

FirecrawlMiễn phí một phần
Chuyển website thành Markdown sạch hoặc dữ liệu có cấu trúc cho tác nhân AI, RAG và tự động hóa.
API và hạ tầng mô hình AIAPI tìm kiếm và thu thập dữ liệu web cho AIMở