OVHcloud pubblica l'architettura per Langfuse self-hosted su MKS con AI Endpoints
OVHcloud descrive come installare Langfuse su Managed Kubernetes Service per tracciare token e costi di AI Endpoints senza far uscire i prompt dall'infrastruttura.
Redazione UptimeMag · 23 luglio 2026 · 2 minuti di lettura

OVHcloud ha pubblicato il 23 luglio 2026 un'architettura di riferimento per installare Langfuse, piattaforma open source di osservabilità per applicazioni LLM, sopra il proprio Managed Kubernetes Service (MKS). L'obiettivo dichiarato è tracciare consumo di token, latenza e costo per modello di ogni chiamata ad AI Endpoints, il servizio di inferenza OpenAI-compatibile di OVHcloud, senza far uscire prompt o risposte dall'infrastruttura controllata dal cliente.
Come funziona il flusso dati
OVHcloud Managed Kubernetes Service (MKS) solleva dall'onere operativo di gestire il control plane Kubernetes: node pool, aggiornamenti e alta disponibilità sono gestiti da OVHcloud, mentre resta il pieno controllo su cosa gira sui nodi worker. È il luogo naturale per eseguire un'applicazione stateless come i processi web e worker di Langfuse, mentre le componenti stateful vivono nei servizi gestiti OVHcloud accanto al cluster. Ogni dipendenza stateful – Postgres, Valkey, ClickHouse, object storage – è un servizio gestito OVHcloud esterno al cluster, raggiunto via TLS.
Il punto tecnico che interessa chi deve mettere in produzione questa pipeline è la separazione fra chiamata applicativa e tracciamento: l'SDK OpenAI con il wrapper Langfuse esporta in background, via OpenTelemetry, un batch di span verso l'endpoint /api/public/otel/v1/traces, senza bloccare la risposta già consegnata all'applicazione. Il worker Langfuse legge poi la coda su Valkey, recupera il batch da object storage e scrive i record di trace e generazione su ClickHouse con modello, conteggio token, latenza e prezzi.
Dimensionamento del cluster
Per il test, OVHcloud indica due node pool separati: uno di sistema (np-system, 3 nodi flavor B3-8) per Traefik e cert-manager, e uno dedicato al carico applicativo (np-workload, 1 nodo flavor B3-16) per i pod web e worker di Langfuse. A questi si aggiungono tre database gestiti — PostgreSQL 17 su piano Business, Valkey 8.1 su piano Business e ClickHouse 25.8 su piano Production — più un bucket S3-compatibile per lo storage degli oggetti.
Prezzi dei modelli via API pubblica
Il catalogo all'indirizzo https://catalog.endpoints.ai.ovh.net/rest/v1/models_v2 fornisce informazioni e metadati sui modelli di AI Endpoints, incluse le liste di modelli, le funzionalità supportate, i prezzi e i metadati specifici per ciascun modello. L'uso della Catalog API è richiesto in questa architettura per prelevare il blocco di pricing e registrare il prezzo di ciascun modello in Langfuse, che calcola poi automaticamente il costo delle chiamate. La chiamata non richiede autenticazione ed è pensata per popolare tabelle di prezzo locali in modo periodico, mentre l'API di inferenza vera e propria resta quella usata dall'applicazione a ogni richiesta.
Per chi gestisce già cluster MKS con carichi AI Endpoints, la guida completa con manifest YAML e script di installazione è disponibile sul blog OVHcloud.
Testo redatto con il supporto dell'intelligenza artificiale e verificato dalla redazione (AI Act, art. 50).