Quanta VPS serve per un agente AI: la distinzione che conta è API o modello locale
Contabo pubblica una guida di sizing per VPS che ospitano agenti AI: la scelta tra chiamare un'API esterna o eseguire il modello in locale cambia tutto.
Redazione UptimeMag · 29 luglio 2026 · 3 minuti di lettura

Chi deve mettere in produzione un agente AI su un VPS si scontra subito con una domanda che precede qualsiasi scelta di hardware: l'agente chiama un'API esterna (OpenAI, Claude, Gemini) oppure esegue il modello in locale? Una guida pubblicata il 29 luglio sul blog di Contabo prova a dare numeri concreti a questa distinzione, con una tabella di sizing pensata per chi deve dimensionare il server prima di ordinarlo, non dopo.
Agenti API-driven: la configurazione resta leggera
Quando l'agente si limita a orchestrare chiamate verso un provider esterno, il VPS esegue solo un processo di coordinamento: un database Postgres o SQLite, un dashboard web, qualche container Docker per i sandbox. Il calcolo pesante - l'inferenza vera e propria - resta sul cluster GPU del provider API, non sul server del cliente.
Per Paperclip, la piattaforma di orchestrazione multi-agente, la documentazione ufficiale indica un minimo di 1 vCPU e 1-2 GB di RAM, ma la soglia realistica per uso in produzione con circa 20 agenti concorrenti, database Postgres e dashboard attivo sale a 4 vCPU e 8 GB RAM, con 80 GB di storage NVMe. Hermes Agent, pensato per un singolo agente, ha un minimo ancora più basso: 1 vCPU e 1 GB RAM se tutta l'inferenza viene instradata verso API esterne. Il prodotto indicato per questa fascia è il Cloud VPS 4, che secondo il listino ufficiale Contabo offre 4 vCPU, 8 GB RAM e 100 GB SSD a 5,50 euro al mese IVA inclusa (prezzo per i primi 24 mesi).
Browser automation e RAG alzano l'asticella
Gli agenti che navigano autonomamente il web - ricerca lead, scraping, compilazione form via Playwright o Selenium - cambiano il quadro: ogni istanza headless di Chromium consuma da sola 1-2 GB di RAM. Il minimo pratico per uno stack con automazione browser sale quindi a 16 GB, prodotto consigliato Cloud VPS 6.
Stesso discorso per le pipeline RAG con database vettoriale (Qdrant, ChromaDB, Weaviate): una collezione media, tra 100.000 e un milione di vettori, richiede 2-4 GB di RAM aggiuntiva e 50-100 GB di storage extra per indice ed embedding. Uno stack RAG completo - agenti più database vettoriale più pipeline di embedding - è comodo con 16 GB RAM e 200 GB NVMe.
Inferenza locale: qui serve la GPU
Chi sceglie di eseguire il modello in locale - tipicamente via Ollama, vLLM o llama.cpp - lo fa per motivi di compliance o privacy dei dati, oppure perché i costi per token delle API diventano rilevanti su scala. In questo caso il VPS diventa il server di inferenza e la RAM richiesta salta da poche unità di GB a 16-64 GB a seconda della dimensione del modello.
| Dimensione modello (quantizzazione Q4) | VRAM richiesta | GPU di riferimento |
|---|---|---|
| 7B | 8-12 GB | RTX 5080 (16 GB) o superiore |
| 13B | 16-20 GB | RTX 5080 stretta, RTX 5090 (32 GB) più comoda |
| 34B | 24-32 GB | RTX 5090 (32 GB) |
| 70B+ | 48+ GB | RTX PRO 6000 Blackwell (96 GB) o multi-GPU |
Per un modello 7B via Ollama affiancato agli agenti, la guida indica 8 vCPU, 32 GB RAM e 200 GB NVMe, con GPU opzionale; per 13B e oltre servono 8+ vCPU, 64 GB+ RAM, 500 GB+ NVMe e una GPU dedicata da 16 a 48 GB di VRAM, tipicamente su linea Cloud VDS o GPU VPS.
Un dettaglio che riguarda chi lavora con clienti europei vincolati al GDPR: ospitare un agente API-driven su un VPS Contabo nell'hub EU di Lauterbourg mantiene lo strato di orchestrazione, lo stato dell'agente e i dati del cliente su infrastruttura tedesca, anche se le chiamate al modello vanno verso Anthropic o OpenAI - una posizione di data-residency che non richiede inferenza locale né un server da 32 GB.
Paperclip e Hermes Agent sono applicazioni 1-Click disponibili su VPS e VDS Contabo; Cloud VPS, Cloud VDS e GPU VPS sono prodotti Prime Software.
Testo redatto con il supporto dell'intelligenza artificiale e verificato dalla redazione (AI Act, art. 50).