
LLM Gateway: API unificata, modelli e costi
Una sola API per modelli, instradamento e analisi dei costi

LLM Gateway è un gateway API open source per collegare un'applicazione a più fornitori di modelli linguistici. Centralizza instradamento, credenziali e analisi dei consumi: è utile quando un progetto usa modelli diversi e gestire integrazioni e fatture separate diventa complicato.
A cosa serve, spiegato con un esempio
Un'applicazione di assistenza potrebbe usare un modello per classificare una richiesta e un altro per scrivere la risposta. LLM Gateway riceve le chiamate dell'applicazione, le inoltra al fornitore e restituisce il risultato. In questo punto di passaggio puoi anche controllare costo e latenza.
Non è un modello autonomo, ma un componente infrastrutturale gestito da Polar Lights LLC. Si rivolge a sviluppatori e team di piattaforma. L'interfaccia separata Lounge consente di provare i modelli nel browser.
Collegare il progetto e verificare la prima risposta
Segui la guida iniziale:
- Accedi alla dashboard, crea un progetto e ottieni una chiave API del gateway, da conservare sul server.
- Usa crediti prepagati oppure aggiungi le tue chiavi dei fornitori in Provider Keys. La chiave gateway autentica l'applicazione; quella del fornitore collega il relativo account.
- Scegli un modello disponibile e verifica formati, capacità e finestra di contesto.
- Imposta
https://api.llmgateway.io/v1nel client compatibile con OpenAI. Per HTTP, inviamodelemessagesa/chat/completionscon autenticazione Bearer. - Controlla il messaggio restituito e poi fornitore, token, latenza e costo nella dashboard.
Prima di spostare traffico reale, prova richieste rappresentative. La compatibilità dell'API non rende identiche le funzioni di tutti i modelli.
Cambiare modello e reagire agli errori
L'API unificata semplifica il confronto tra modelli. L'instradamento può selezionare un fornitore e ritentare richieste fallite su alternative idonee. Le regole di routing dipendono però dai fornitori disponibili e dai loro limiti: non sono una garanzia di assenza di guasti.
Le analisi evidenziano modelli costosi e chiamate lente. Limiti di utilizzo e regole sulle chiavi aiutano a separare applicazioni e restringere l'accesso a modelli o fornitori. La cache può ridurre lavoro ripetuto; la cache delle risposte del gateway e quella dei prompt del fornitore hanno funzionamenti distinti e richiedono configurazioni adatte.
Costi e confini dell'offerta gratuita
Verifica del 10 settembre 2026: nel servizio ospitato standard il routing BYOK non ha commissioni di piattaforma, mentre l'inferenza si paga al fornitore. Per i crediti, la FAQ indica una commissione del 5 % all'acquisto. La conservazione facoltativa dei contenuti completi aggiunge 0,01 USD per milione di token. La pagina segnala anche l'1,5 % internazionale per carte non statunitensi; Enterprise richiede un preventivo.
Consulta i prezzi aggiornati e considera token in ingresso e in uscita. Un account gratuito non rende gratuiti tutti i modelli. DevPass e abbonamenti chat hanno condizioni proprie. Gli importi in USD non sono un listino italiano in euro né confermano ogni metodo di pagamento locale.
Quando scegliere il self-hosting
La guida al self-hosting comprende Docker, Compose e Kubernetes. Servono i componenti applicativi, PostgreSQL, Redis e le credenziali dei fornitori. Il team assume gestione, backup, aggiornamenti e permessi.
Il gateway è sotto AGPLv3, con licenza commerciale separata per le funzioni enterprise in ee/. È una scelta per chi necessita controllo infrastrutturale e dispone di competenze operative. Ospitare il gateway non significa eseguire localmente i modelli: le richieste verso fornitori esterni vengono ancora elaborate da loro.
Controllare conservazione e limiti
Per impostazione predefinita si conservano metadati. Le organizzazioni standard possono attivare i contenuti completi. La Responses API segue una regola distinta: le risposte memorizzate restano 30 giorni indipendentemente dall'impostazione; store: false disattiva questo salvataggio. Leggi le regole di conservazione.
La privacy policy esclude l'uso dei contenuti dei clienti per addestrare modelli del gateway; i fornitori applicano politiche proprie. Esistono inoltre limiti di organizzazione, concorrenza e fornitore. Le quote dei modelli gratuiti dipendono dallo stato dei crediti. Gestisci gli errori 429 con attese e parallelismo controllato.
Domande frequenti
È gratuito?
Il routing BYOK è gratuito; l'inferenza del fornitore può essere a pagamento. Crediti e conservazione completa opzionale hanno costi separati.
Posso riutilizzare l'integrazione OpenAI?
Sì, con URL base, chiave gateway e modello supportato. Verifica prima le funzioni specifiche.
Con il self-hosting tutti i dati restano sul mio server?
No. Il gateway è locale alla tua infrastruttura, ma un modello esterno continua a ricevere le richieste instradate.
I prompt non vengono mai salvati?
Non è una regola universale. La Responses API ha una conservazione separata di 30 giorni, disattivabile con store: false.
Risorse ufficiali e community
- Documentazione: API e integrazioni.
- GitHub: codice, licenze e segnalazioni.
- Discord: confronto con team e sviluppatori.
- Stato del servizio: problemi operativi.





