
LLM Gateway:统一大模型 API 网关与费用管理
统一接入多家大模型,管理路由、密钥与调用成本

LLM Gateway 是面向开发者和团队的开源大模型 API 网关,把多家模型服务商的接入、请求路由、密钥管理和用量分析集中到一个入口。对于需要同时使用不同模型的 AI 应用,它能减少重复对接工作,也让每次调用的费用和延迟更容易查清楚。
LLM Gateway 是干什么的?用一个例子看懂
假设你在开发一个智能客服:先让一个模型判断用户的问题类型,再让另一个模型生成回复。如果分别连接每家服务商,就要维护多套接口配置、密钥和账单。LLM Gateway 相当于应用与模型之间的“统一接线台”:应用把请求交给它,它再转给指定或符合路由条件的服务商,并把结果返回。
因此,它的核心价值是帮助你调用和管理模型,而不是自己训练出一个新模型。官方运营方是 Polar Lights LLC,主要面向 AI 应用开发者、需要多模型接入的产品团队,以及负责费用和基础设施的平台工程团队。官网另有 Lounge 浏览器试用界面,方便先体验模型。
从创建密钥到完成第一次 API 调用
按照官方快速入门,可以用以下流程完成首次接入:
- 登录控制台,创建项目并取得 LLM Gateway API Key。把密钥保存在服务端环境变量中。
- 选择充值额度调用,或在 Provider Keys 中添加自己的模型服务商密钥。网关密钥用于应用访问网关,服务商密钥用于网关访问你的上游账户,两者用途不同。
- 从当前模型目录选择模型 ID,确认输入类型、上下文长度和所需能力符合任务。
- 使用兼容 OpenAI 的客户端,把基础地址改为
https://api.llmgateway.io/v1,使用网关密钥。直接发 HTTP 请求时,向/chat/completions提交包含model和messages的 JSON,并使用 Bearer 认证。 - 检查返回的模型消息,再到控制台核对实际服务商、Token、延迟和费用。用真实业务样例测试后,再迁移正式流量。
统一接口可以减少改造量,但不同模型仍可能有不同的参数、工具调用和多模态能力。不能仅因为接口兼容,就假设所有功能可以原样迁移。
切换模型、故障转移与重复请求优化
在同一个接入方式下更换模型,有助于比较不同任务的成本和效果。对于存在多个可用服务商的模型,网关可以根据路由规则选择服务商;发生错误时,还支持自动重试和备用服务商切换。具体行为以路由文档为准,仍取决于可用上游及其限制,不能理解为永不失败的承诺。
控制台的请求记录和分析可以帮助团队定位“哪个模型花钱最多”“哪条调用路径变慢”。网关密钥的用量限制与访问规则,则有助于把不同应用分开管理,并约束模型或服务商的使用范围。缓存适合减少重复工作,但网关响应缓存和上游提示词缓存不是同一回事,实际收益取决于请求、配置及模型支持情况。
免费、自带密钥和充值调用分别怎么收费?
截至 2026 年 9 月 10 日,标准托管服务的 BYOK(自带服务商密钥)路由不收平台费用,模型推理费用直接支付给对应服务商。使用预付额度时,模型按服务商费率计费,官方定价 FAQ 说明购买额度时收取 5% 平台手续费。
如果启用完整请求与响应保存,还会产生每百万 Token 0.01 美元的可选存储费用。定价页另外注明非美国银行卡有 1.5% 国际手续费;企业方案需要询价。以上是官网列示条件,不代表已核实所有地区的付款可用性。购买前应查看最新定价,不要把“免费网关账户”理解为“所有模型免费”。
费用分析应结合输入与输出 Token、实际模型和调用量。DevPass 与聊天订阅有各自的使用条件,不能直接套用标准 API 额度方案的规则。
自托管适合谁?部署网关不等于本地运行模型
官方自托管指南提供 Docker、Docker Compose 和 Kubernetes 路径。系统涉及网关及应用服务、PostgreSQL、Redis 和模型服务商凭据。选择自托管后,团队需要自行负责部署、备份、升级和权限管理。
网关代码采用 AGPLv3,ee/ 目录中的企业功能存在单独的商业许可边界。自托管适合希望掌握基础设施、同时具备运维能力的团队;托管服务则更适合希望先把应用接起来的开发者。
要特别分清:把网关部署在自己的服务器上,只是掌握了请求转发与管理这一层。只要选择的是外部模型服务商,模型推理仍在对应服务商处进行。
上线前看清数据保留与调用限制
默认的数据保留方式是仅保存元数据,例如模型、Token、费用和延迟;标准按量组织可以选择保存完整请求。不过 Responses API 有独立规则:已存储的响应数据会保留 30 天,不受组织“仅元数据”设置的排除;需要退出这项存储时,应在请求中使用 store: false。实际接入时应核对数据保留文档。
隐私政策说明,LLM Gateway 不用客户的提示词和响应训练模型,但请求仍会发送给你选择的服务商,并受到对方的数据处理政策约束。处理敏感内容时,需要同时评估网关和上游。
免费模型的调用额度与账号充值状态有关,此外还有组织、并发和上游限制。遇到 429 时,应结合限流说明处理退避与并发控制,而不是简单认为充值后就能无限调用。
常见问题
LLM Gateway 可以免费使用吗?
可以免费使用 BYOK 路由,但上游模型仍按其规则收费。充值额度和可选完整数据存储另有费用,免费模型也有调用限制。
现有 OpenAI 接口项目可以接入吗?
可以使用兼容接口,更换基础地址、网关密钥和受支持的模型 ID。迁移前仍需检查模型能力,并完成一次真实请求与结果验证。
自托管后,数据就完全不会发送到外部吗?
不是。自托管的是网关系统;请求如果路由到外部模型服务商,仍会由该服务商处理。
默认不保存提示词,是否适用于所有接口?
不能这样概括。普通请求默认采用仅元数据模式,但 Responses API 有独立的 30 天存储规则,需要用 store: false 退出。
官方资源与开发者社区
- 官方文档:查询接口能力与接入说明。
- GitHub 开源仓库:查看代码、许可和提交问题。
- 官方 Discord 社区:向团队与其他开发者交流使用问题。
- 服务状态页:检查故障与运行状态。





