LLM Gateway: API unificata, modelli e costi

Una sola API per modelli, instradamento e analisi dei costi

Vai al sito llmgateway.io
llmgateway.io
LLM Gateway screenshot

LLM Gateway è un gateway API open source per collegare un'applicazione a più fornitori di modelli linguistici. Centralizza instradamento, credenziali e analisi dei consumi: è utile quando un progetto usa modelli diversi e gestire integrazioni e fatture separate diventa complicato.

A cosa serve, spiegato con un esempio

Un'applicazione di assistenza potrebbe usare un modello per classificare una richiesta e un altro per scrivere la risposta. LLM Gateway riceve le chiamate dell'applicazione, le inoltra al fornitore e restituisce il risultato. In questo punto di passaggio puoi anche controllare costo e latenza.

Non è un modello autonomo, ma un componente infrastrutturale gestito da Polar Lights LLC. Si rivolge a sviluppatori e team di piattaforma. L'interfaccia separata Lounge consente di provare i modelli nel browser.

Collegare il progetto e verificare la prima risposta

Segui la guida iniziale:

  1. Accedi alla dashboard, crea un progetto e ottieni una chiave API del gateway, da conservare sul server.
  2. Usa crediti prepagati oppure aggiungi le tue chiavi dei fornitori in Provider Keys. La chiave gateway autentica l'applicazione; quella del fornitore collega il relativo account.
  3. Scegli un modello disponibile e verifica formati, capacità e finestra di contesto.
  4. Imposta https://api.llmgateway.io/v1 nel client compatibile con OpenAI. Per HTTP, invia model e messages a /chat/completions con autenticazione Bearer.
  5. Controlla il messaggio restituito e poi fornitore, token, latenza e costo nella dashboard.

Prima di spostare traffico reale, prova richieste rappresentative. La compatibilità dell'API non rende identiche le funzioni di tutti i modelli.

Cambiare modello e reagire agli errori

L'API unificata semplifica il confronto tra modelli. L'instradamento può selezionare un fornitore e ritentare richieste fallite su alternative idonee. Le regole di routing dipendono però dai fornitori disponibili e dai loro limiti: non sono una garanzia di assenza di guasti.

Le analisi evidenziano modelli costosi e chiamate lente. Limiti di utilizzo e regole sulle chiavi aiutano a separare applicazioni e restringere l'accesso a modelli o fornitori. La cache può ridurre lavoro ripetuto; la cache delle risposte del gateway e quella dei prompt del fornitore hanno funzionamenti distinti e richiedono configurazioni adatte.

Costi e confini dell'offerta gratuita

Verifica del 10 settembre 2026: nel servizio ospitato standard il routing BYOK non ha commissioni di piattaforma, mentre l'inferenza si paga al fornitore. Per i crediti, la FAQ indica una commissione del 5 % all'acquisto. La conservazione facoltativa dei contenuti completi aggiunge 0,01 USD per milione di token. La pagina segnala anche l'1,5 % internazionale per carte non statunitensi; Enterprise richiede un preventivo.

Consulta i prezzi aggiornati e considera token in ingresso e in uscita. Un account gratuito non rende gratuiti tutti i modelli. DevPass e abbonamenti chat hanno condizioni proprie. Gli importi in USD non sono un listino italiano in euro né confermano ogni metodo di pagamento locale.

Quando scegliere il self-hosting

La guida al self-hosting comprende Docker, Compose e Kubernetes. Servono i componenti applicativi, PostgreSQL, Redis e le credenziali dei fornitori. Il team assume gestione, backup, aggiornamenti e permessi.

Il gateway è sotto AGPLv3, con licenza commerciale separata per le funzioni enterprise in ee/. È una scelta per chi necessita controllo infrastrutturale e dispone di competenze operative. Ospitare il gateway non significa eseguire localmente i modelli: le richieste verso fornitori esterni vengono ancora elaborate da loro.

Controllare conservazione e limiti

Per impostazione predefinita si conservano metadati. Le organizzazioni standard possono attivare i contenuti completi. La Responses API segue una regola distinta: le risposte memorizzate restano 30 giorni indipendentemente dall'impostazione; store: false disattiva questo salvataggio. Leggi le regole di conservazione.

La privacy policy esclude l'uso dei contenuti dei clienti per addestrare modelli del gateway; i fornitori applicano politiche proprie. Esistono inoltre limiti di organizzazione, concorrenza e fornitore. Le quote dei modelli gratuiti dipendono dallo stato dei crediti. Gestisci gli errori 429 con attese e parallelismo controllato.

Domande frequenti

È gratuito?

Il routing BYOK è gratuito; l'inferenza del fornitore può essere a pagamento. Crediti e conservazione completa opzionale hanno costi separati.

Posso riutilizzare l'integrazione OpenAI?

Sì, con URL base, chiave gateway e modello supportato. Verifica prima le funzioni specifiche.

Con il self-hosting tutti i dati restano sul mio server?

No. Il gateway è locale alla tua infrastruttura, ma un modello esterno continua a ricevere le richieste instradate.

I prompt non vengono mai salvati?

Non è una regola universale. La Responses API ha una conservazione separata di 30 giorni, disattivabile con store: false.

Risorse ufficiali e community