SGLang su GPU VPS: come servire LLM in self-hosting con Docker
Contabo pubblica la guida per installare SGLang via Docker su un GPU VPS: continuous batching, RadixAttention e API compatibile OpenAI.
Redazione UptimeMag · 5 ottobre 2026 · 2 minuti di lettura

Contabo ha pubblicato sul proprio blog una guida operativa per installare SGLang, un server di inferenza open source per modelli linguistici di grandi dimensioni, su un'istanza GPU VPS. Interessa a chi deve servire un LLM a più utenti o applicazioni contemporaneamente senza passare da un'API a pagamento per token.
Cosa risolve SGLang
Un modello caricato con uno script base gestisce una richiesta alla volta: con più utenti in parallelo le richieste si accodano e la GPU resta sotto utilizzata. SGLang è un framework di serving open source che esegue modelli linguistici di grandi dimensioni rapidamente sulla propria GPU, gestendo batching, caching e output strutturato, ed espone un'API compatibile OpenAI.
Il meccanismo centrale è il continuous batching: le nuove richieste entrano in un batch già in esecuzione appena si libera spazio, invece di aspettare che finisca la richiesta più lenta. La funzione distintiva è RadixAttention: la cache KV dei prompt condivisi (stesso system prompt, stesso documento) viene memorizzata in una struttura ad albero e riusata invece di essere ricalcolata ogni volta. Il server supporta inoltre modelli quantizzati, tensor parallelism su più GPU, decoding speculativo e famiglie di modelli aperti come Llama, Qwen e DeepSeek.
Installazione in sintesi
La guida procede per passi con Docker: pull dell'immagine ufficiale lmsysorg/sglang, avvio del container con docker run --gpus all puntando a un modello Hugging Face (l'esempio usa Qwen2.5-7B-Instruct), verifica con curl http://localhost:30000/health, passaggio a Docker Compose con chiave API, ed esposizione HTTPS tramite reverse proxy Caddy, lasciando il firewall chiuso sulla porta 30000 e aperto solo su 80/443.
Dimensionamento hardware
Il vincolo di partenza è la VRAM: il peso di un modello si stima moltiplicando i parametri per i byte per parametro. Un modello da 70 miliardi di parametri richiede circa 140 GB a 16 bit, circa 70 GB a 8 bit e circa 35 GB a 4 bit. Più VRAM libera significa cache più ampia, quindi più richieste concorrenti e contesti più lunghi.
Il prodotto usato come riferimento
Contabo propone per questo scenario il proprio GPU VPS con NVIDIA RTX PRO 6000 Blackwell Server Edition dedicata. Sul listino ufficiale, verificato il 5 ottobre 2026, la configurazione comprende 96 GB di VRAM GDDR7, 24.064 core CUDA, 120 TFLOPS FP32 e 1.597 GB/s di banda, abbinati a 18 vCPU, 96 GB di RAM e 900 GB di storage NVMe. Il prezzo di listino è 999,00 euro al mese IVA esclusa (799,20 euro al mese IVA inclusa per i primi 24 mesi secondo il piano biennale mostrato in home page), con traffico illimitato soggetto a fair use e disponibilità nelle region Europa e US Central. Le istanze partono già con Ubuntu 24.04, CUDA e nvidia-container-toolkit preinstallati.
1PrimeCDN e gli altri prodotti Prime Software non sono citati in questo articolo.
Testo redatto con il supporto dell'intelligenza artificiale e verificato dalla redazione (AI Act, art. 50).