LLM Gateway:统一大模型 API 网关与费用管理

统一接入多家大模型,管理路由、密钥与调用成本

访问官网 llmgateway.io
llmgateway.io
LLM Gateway screenshot

LLM Gateway 是面向开发者和团队的开源大模型 API 网关,把多家模型服务商的接入、请求路由、密钥管理和用量分析集中到一个入口。对于需要同时使用不同模型的 AI 应用,它能减少重复对接工作,也让每次调用的费用和延迟更容易查清楚。

LLM Gateway 是干什么的?用一个例子看懂

假设你在开发一个智能客服:先让一个模型判断用户的问题类型,再让另一个模型生成回复。如果分别连接每家服务商,就要维护多套接口配置、密钥和账单。LLM Gateway 相当于应用与模型之间的“统一接线台”:应用把请求交给它,它再转给指定或符合路由条件的服务商,并把结果返回。

因此,它的核心价值是帮助你调用和管理模型,而不是自己训练出一个新模型。官方运营方是 Polar Lights LLC,主要面向 AI 应用开发者、需要多模型接入的产品团队,以及负责费用和基础设施的平台工程团队。官网另有 Lounge 浏览器试用界面,方便先体验模型。

从创建密钥到完成第一次 API 调用

按照官方快速入门,可以用以下流程完成首次接入:

  1. 登录控制台,创建项目并取得 LLM Gateway API Key。把密钥保存在服务端环境变量中。
  2. 选择充值额度调用,或在 Provider Keys 中添加自己的模型服务商密钥。网关密钥用于应用访问网关,服务商密钥用于网关访问你的上游账户,两者用途不同。
  3. 从当前模型目录选择模型 ID,确认输入类型、上下文长度和所需能力符合任务。
  4. 使用兼容 OpenAI 的客户端,把基础地址改为 https://api.llmgateway.io/v1,使用网关密钥。直接发 HTTP 请求时,向 /chat/completions 提交包含 modelmessages 的 JSON,并使用 Bearer 认证。
  5. 检查返回的模型消息,再到控制台核对实际服务商、Token、延迟和费用。用真实业务样例测试后,再迁移正式流量。

统一接口可以减少改造量,但不同模型仍可能有不同的参数、工具调用和多模态能力。不能仅因为接口兼容,就假设所有功能可以原样迁移。

切换模型、故障转移与重复请求优化

在同一个接入方式下更换模型,有助于比较不同任务的成本和效果。对于存在多个可用服务商的模型,网关可以根据路由规则选择服务商;发生错误时,还支持自动重试和备用服务商切换。具体行为以路由文档为准,仍取决于可用上游及其限制,不能理解为永不失败的承诺。

控制台的请求记录和分析可以帮助团队定位“哪个模型花钱最多”“哪条调用路径变慢”。网关密钥的用量限制与访问规则,则有助于把不同应用分开管理,并约束模型或服务商的使用范围。缓存适合减少重复工作,但网关响应缓存和上游提示词缓存不是同一回事,实际收益取决于请求、配置及模型支持情况。

免费、自带密钥和充值调用分别怎么收费?

截至 2026 年 9 月 10 日,标准托管服务的 BYOK(自带服务商密钥)路由不收平台费用,模型推理费用直接支付给对应服务商。使用预付额度时,模型按服务商费率计费,官方定价 FAQ 说明购买额度时收取 5% 平台手续费。

如果启用完整请求与响应保存,还会产生每百万 Token 0.01 美元的可选存储费用。定价页另外注明非美国银行卡有 1.5% 国际手续费;企业方案需要询价。以上是官网列示条件,不代表已核实所有地区的付款可用性。购买前应查看最新定价,不要把“免费网关账户”理解为“所有模型免费”。

费用分析应结合输入与输出 Token、实际模型和调用量。DevPass 与聊天订阅有各自的使用条件,不能直接套用标准 API 额度方案的规则。

自托管适合谁?部署网关不等于本地运行模型

官方自托管指南提供 Docker、Docker Compose 和 Kubernetes 路径。系统涉及网关及应用服务、PostgreSQL、Redis 和模型服务商凭据。选择自托管后,团队需要自行负责部署、备份、升级和权限管理。

网关代码采用 AGPLv3,ee/ 目录中的企业功能存在单独的商业许可边界。自托管适合希望掌握基础设施、同时具备运维能力的团队;托管服务则更适合希望先把应用接起来的开发者。

要特别分清:把网关部署在自己的服务器上,只是掌握了请求转发与管理这一层。只要选择的是外部模型服务商,模型推理仍在对应服务商处进行。

上线前看清数据保留与调用限制

默认的数据保留方式是仅保存元数据,例如模型、Token、费用和延迟;标准按量组织可以选择保存完整请求。不过 Responses API 有独立规则:已存储的响应数据会保留 30 天,不受组织“仅元数据”设置的排除;需要退出这项存储时,应在请求中使用 store: false。实际接入时应核对数据保留文档

隐私政策说明,LLM Gateway 不用客户的提示词和响应训练模型,但请求仍会发送给你选择的服务商,并受到对方的数据处理政策约束。处理敏感内容时,需要同时评估网关和上游。

免费模型的调用额度与账号充值状态有关,此外还有组织、并发和上游限制。遇到 429 时,应结合限流说明处理退避与并发控制,而不是简单认为充值后就能无限调用。

常见问题

LLM Gateway 可以免费使用吗?

可以免费使用 BYOK 路由,但上游模型仍按其规则收费。充值额度和可选完整数据存储另有费用,免费模型也有调用限制。

现有 OpenAI 接口项目可以接入吗?

可以使用兼容接口,更换基础地址、网关密钥和受支持的模型 ID。迁移前仍需检查模型能力,并完成一次真实请求与结果验证。

自托管后,数据就完全不会发送到外部吗?

不是。自托管的是网关系统;请求如果路由到外部模型服务商,仍会由该服务商处理。

默认不保存提示词,是否适用于所有接口?

不能这样概括。普通请求默认采用仅元数据模式,但 Responses API 有独立的 30 天存储规则,需要用 store: false 退出。

官方资源与开发者社区