Quattro GPU Nvidia H200 possono costare 440,88 dollari al giorno anche quando il carico non le usa fino in fondo. Nel test pubblicato il 27 settembre 2026 da The Call Center Doctors, lo stesso lavoro su DeepSeek via API valeva tra 184 e 223 dollari al giorno. Il confronto utile, quindi, non è tra “pesi gratis” e “token a pagamento”: è tra il costo totale di gestire capacità dedicata e il costo variabile di comprare un risultato.
Per una PMI che usa l’AI su WordPress, sviluppo web o automazioni, la decisione va presa su quattro criteri: spesa a carico reale, tempo di messa in opera, tenuta quando cresce la concorrenza e controllo sui dati. Su questa griglia, oggi l’API parte avanti. Il self-hosting resta sensato, ma solo in condizioni precise.
Il test che rompe il confronto sul prezzo per token
The Call Center Doctors ha noleggiato un server con quattro H200 per eseguire DeepSeek V4.1 Flash al posto di Opus 5.5 nei propri agenti di coding. Il prezzo normale del server era 18,37 dollari l’ora; il test ha sfruttato una tariffa spot di 9,19 dollari, cioè capacità revocabile dal fornitore. Per ottenere un servizio stabile sono serviti cinque avvii, ciascuno con 10-15 minuti di caricamento del modello.
Nei test isolati la macchina era veloce. Il problema è comparso con il traffico reale: il 96,3% dell’input degli agenti era composto da conversazioni già lette. Applicando quel mix, il server arrivava a circa 213 token scritti al secondo e a 20 miliardi di token complessivi al giorno. Il giorno più intenso del carico osservato ne aveva richiesti 51 miliardi. La capacità teorica non coincideva con il throughput del workflow.
Il confronto economico più pulito è DeepSeek contro DeepSeek. A prezzo normale il server costava 440,88 dollari al giorno; l’equivalente tramite l’API dello stesso fornitore valeva 184-223 dollari. La macchina dedicata pareggiava soltanto con lo sconto spot e al 100% di utilizzo, prima di conteggiare il lavoro di configurazione e presidio.
È un caso aziendale, non un benchmark universale. Il test è durato circa tre ore, ha usato il carico di una sola organizzazione e non ha portato gli agenti DeepSeek a scrivere codice in produzione, perché la sandbox mostrava vie di fuga. I numeri descrivono bene quel workload; non dimostrano che ogni modello self-hosted perda contro ogni API.
API: paghi la variabilità, non la macchina ferma
L’API trasforma GPU, inferenza e scalabilità in una voce a consumo. La pagina ufficiale di DeepSeek indica per V4.1 Flash, fuori picco, 0,003 dollari per milione di token in cache, 0,15 per l’input nuovo e 0,60 per l’output; nelle fasce di picco le tariffe raddoppiano. Anthropic pubblica per Opus 5.5 prezzi diversi: 4 dollari per milione di token in input, 20 in output e 0,20 per le letture dalla cache.
Questi listini non dicono da soli quale modello costi meno. Nel caso osservato, gli abbonamenti Claude Code erano costati circa 5.500 dollari tra il 1° e il 27 settembre. Lo stesso volume su DeepSeek cloud sarebbe costato tra 3.500 e 7.000 dollari, a seconda della fascia oraria. È una forchetta, non una vittoria da “80 volte meno”. Inoltre, un abbonamento e un’API non sono contratti equivalenti.
Il vantaggio operativo dell’API è più semplice: una nuova automazione può partire piccola, assorbire picchi e cambiare modello senza acquistare capacità. I contro sono dipendenza dal fornitore, prezzi modificabili, limiti di servizio e un perimetro dati da verificare nel contratto. Per ridurre il lock-in conviene isolare il provider dietro un adapter, registrare token, latenza ed errori e mantenere un modello alternativo già provato.
Self-hosting: controllo vero, responsabilità intera
Con un modello self-hosted controlli endpoint, rete, log, versioni e collocazione dei dati. Puoi tenere il traffico dentro un’infrastruttura definita e stabilizzare il costo quando il carico è alto e prevedibile. Sono vantaggi reali per dati soggetti a vincoli forti, lavorazioni offline o prodotti in cui l’inferenza è una funzione centrale.
In cambio prendi in carico memoria GPU, runtime, aggiornamenti, osservabilità, code, failover e capacità inutilizzata. Il test ha mostrato anche un limite pratico: la tariffa spot riduce il costo, ma il server può essere revocato. La tariffa stabile elimina quella fragilità e raddoppia quasi la spesa. Quando cresce la concorrenza, non basta aggiungere agenti: serve governare cache, batching e saturazione. La documentazione del production stack vLLM tratta infatti routing, bootstrap, osservabilità e offloading della KV cache come componenti del servizio, non come dettagli facoltativi.
Cosa cambia per WordPress e automazioni
Un flusso che genera bozze WordPress, classifica ticket o controlla codice non va misurato in token economici. Va misurato in bozze approvate, ticket chiusi o patch accettate. Questo evita di premiare un modello che costa poco per chiamata ma richiede più tentativi, più revisione o conversazioni più lunghe. È lo stesso principio del benchmark sui propri dati: il test deve riprodurre il lavoro, non la demo.
Per una PMI imposterei un pilot di quattro settimane via API. Si registrano costo per risultato approvato, latenza al percentile 95, tasso di errore, interventi umani e volume nelle ore di punta. In parallelo si mantiene il codice portabile e si applica il criterio del modello più piccolo che basta. Solo dopo si simula il costo di una macchina dedicata includendo presidio, backup, monitoraggio e capacità di riserva.
La scelta netta
Per PMI e professionisti sceglierei l’API come default. Consente di validare il processo prima dell’infrastruttura e rende visibile il costo mentre il carico cambia. Passerei al self-hosting solo con tre condizioni insieme: dati che non possono uscire dal perimetro stabilito, utilizzo alto e prevedibile, competenza interna capace di gestire GPU e servizio in produzione.
Se manca anche una sola delle tre, la macchina dedicata rischia di essere un costo fisso che compra complessità. I pesi possono essere gratuiti. Il servizio affidabile no.

