Guide

Quanta VPS serve per un agente AI: la distinzione che conta è API o modello locale

Contabo pubblica una guida di sizing per VPS che ospitano agenti AI: la scelta tra chiamare un'API esterna o eseguire il modello in locale cambia tutto.

Redazione UptimeMag · 29 luglio 2026 · 3 minuti di lettura

Quanta VPS serve per un agente AI: la distinzione che conta è API o modello locale

Chi deve mettere in produzione un agente AI su un VPS si scontra subito con una domanda che precede qualsiasi scelta di hardware: l'agente chiama un'API esterna (OpenAI, Claude, Gemini) oppure esegue il modello in locale? Una guida pubblicata il 29 luglio sul blog di Contabo prova a dare numeri concreti a questa distinzione, con una tabella di sizing pensata per chi deve dimensionare il server prima di ordinarlo, non dopo.

Agenti API-driven: la configurazione resta leggera

Quando l'agente si limita a orchestrare chiamate verso un provider esterno, il VPS esegue solo un processo di coordinamento: un database Postgres o SQLite, un dashboard web, qualche container Docker per i sandbox. Il calcolo pesante - l'inferenza vera e propria - resta sul cluster GPU del provider API, non sul server del cliente.

Per Paperclip, la piattaforma di orchestrazione multi-agente, la documentazione ufficiale indica un minimo di 1 vCPU e 1-2 GB di RAM, ma la soglia realistica per uso in produzione con circa 20 agenti concorrenti, database Postgres e dashboard attivo sale a 4 vCPU e 8 GB RAM, con 80 GB di storage NVMe. Hermes Agent, pensato per un singolo agente, ha un minimo ancora più basso: 1 vCPU e 1 GB RAM se tutta l'inferenza viene instradata verso API esterne. Il prodotto indicato per questa fascia è il Cloud VPS 4, che secondo il listino ufficiale Contabo offre 4 vCPU, 8 GB RAM e 100 GB SSD a 5,50 euro al mese IVA inclusa (prezzo per i primi 24 mesi).

Browser automation e RAG alzano l'asticella

Gli agenti che navigano autonomamente il web - ricerca lead, scraping, compilazione form via Playwright o Selenium - cambiano il quadro: ogni istanza headless di Chromium consuma da sola 1-2 GB di RAM. Il minimo pratico per uno stack con automazione browser sale quindi a 16 GB, prodotto consigliato Cloud VPS 6.

Stesso discorso per le pipeline RAG con database vettoriale (Qdrant, ChromaDB, Weaviate): una collezione media, tra 100.000 e un milione di vettori, richiede 2-4 GB di RAM aggiuntiva e 50-100 GB di storage extra per indice ed embedding. Uno stack RAG completo - agenti più database vettoriale più pipeline di embedding - è comodo con 16 GB RAM e 200 GB NVMe.

Inferenza locale: qui serve la GPU

Chi sceglie di eseguire il modello in locale - tipicamente via Ollama, vLLM o llama.cpp - lo fa per motivi di compliance o privacy dei dati, oppure perché i costi per token delle API diventano rilevanti su scala. In questo caso il VPS diventa il server di inferenza e la RAM richiesta salta da poche unità di GB a 16-64 GB a seconda della dimensione del modello.

Dimensione modello (quantizzazione Q4) VRAM richiesta GPU di riferimento
7B 8-12 GB RTX 5080 (16 GB) o superiore
13B 16-20 GB RTX 5080 stretta, RTX 5090 (32 GB) più comoda
34B 24-32 GB RTX 5090 (32 GB)
70B+ 48+ GB RTX PRO 6000 Blackwell (96 GB) o multi-GPU

Per un modello 7B via Ollama affiancato agli agenti, la guida indica 8 vCPU, 32 GB RAM e 200 GB NVMe, con GPU opzionale; per 13B e oltre servono 8+ vCPU, 64 GB+ RAM, 500 GB+ NVMe e una GPU dedicata da 16 a 48 GB di VRAM, tipicamente su linea Cloud VDS o GPU VPS.

Un dettaglio che riguarda chi lavora con clienti europei vincolati al GDPR: ospitare un agente API-driven su un VPS Contabo nell'hub EU di Lauterbourg mantiene lo strato di orchestrazione, lo stato dell'agente e i dati del cliente su infrastruttura tedesca, anche se le chiamate al modello vanno verso Anthropic o OpenAI - una posizione di data-residency che non richiede inferenza locale né un server da 32 GB.

Paperclip e Hermes Agent sono applicazioni 1-Click disponibili su VPS e VDS Contabo; Cloud VPS, Cloud VDS e GPU VPS sono prodotti Prime Software.

Testo redatto con il supporto dell'intelligenza artificiale e verificato dalla redazione (AI Act, art. 50).