KoboldCpp su VPS: come far girare un LLM in locale con CPU o GPU
Contabo pubblica una guida passo-passo per installare KoboldCpp su un VPS Linux e servire modelli GGUF via web e API.
Redazione UptimeMag · 7 ottobre 2026 · 2 minuti di lettura

Contabo ha pubblicato sul proprio blog una guida operativa per installare KoboldCpp su un VPS Linux e trasformarlo in un server LLM privato, con interfaccia web e API compatibile OpenAI. Interessa chi vuole testare modelli open-weight senza affidarsi a un'API esterna, mantenendo i dati sul proprio server.
KoboldCpp è un programma a file singolo che carica modelli in formato GGUF e si basa su llama.cpp, il motore C++ dietro molti strumenti di inferenza locale. Il progetto è mantenuto da uno sviluppatore noto come Concedo (LostRuins su GitHub) sotto licenza AGPLv3. L'ultima release stabile è la 1.122.1, pubblicata il 26 settembre 2026, che rimuove alcuni log superflui e introduce un agente integrato con nove strumenti e un prompt di sistema di circa 2.000 token, secondo le note di rilascio su GitHub.
L'installazione in sintesi
La guida di Contabo usa un ambiente di prova con Ubuntu 24.04, 6 vCPU e 11 GiB di RAM. I passaggi: connessione SSH, verifica risorse con free -h && df -h / && nproc, installazione di curl e tmux, download del binario koboldcpp-linux-x64-nocuda (circa 130 MB, build senza CUDA per server privi di GPU NVIDIA), download di un modello di prova (Qwen2.5-0.5B-Instruct in quantizzazione Q4_K_M) e avvio dentro una sessione tmux con --usecpu --host 127.0.0.1 --port 5001 --contextsize 2048. L'accesso avviene poi tramite tunnel SSH sulla porta 5001.
Quanta RAM serve
Per modelli quantizzati a 4 bit con contesto di 2048 token, la wiki di KoboldCpp indica queste soglie minime di RAM:
| Parametri modello | RAM minima indicativa |
|---|---|
| 7 miliardi | 8 GB |
| 13 miliardi | 16 GB |
| 30 miliardi | 32 GB |
| 65 miliardi | 64 GB |
Su CPU la velocità di generazione resta bassa: la guida la definisce adatta a un singolo utente o a un piccolo team, non a un servizio di chat per molti utenti in produzione. Per modelli più grandi o risposte più rapide, Contabo propone il proprio GPU VPS con una scheda NVIDIA RTX PRO 6000 da 96 GB di VRAM abbinata a 18 vCPU e 96 GB di RAM, dove un modello da 70 miliardi di parametri in 4-bit (circa 40 GB di pesi) entra interamente in VRAM.
La guida raccomanda di impostare sempre --host esplicitamente: nella versione 1.122.1 un avvio senza questo flag accettava comunque connessioni sull'indirizzo di rete del server, pur mostrando "localhost" nel log.
Testo redatto con il supporto dell'intelligenza artificiale e verificato dalla redazione (AI Act, art. 50).