L’AI sta uscendo dal recinto dei modelli: il vincolo vero è diventato dove far girare l’inferenza, con quale memoria e con quanta energia. Le notizie del 2 ottobre 2026 vanno tutte nella stessa direzione. Il software conta, ma chip, data center e consenso locale stanno decidendo tempi e costi. È il seguito concreto della corsa allo stack AI: oggi il vantaggio si misura anche in disponibilità fisica.
NVIDIA dimezza la memoria di DGX Spark
NVIDIA ha annunciato una versione di DGX Spark con 64 GB di memoria unificata, disponibile dal 23 ottobre attraverso Acer, ASUS, Dell, Gigabyte, HP e MSI. Il sistema mantiene Grace Blackwell, ConnectX-7 e lo stack CUDA; due unità possono essere collegate con Sync Cluster Assistant.
La scelta è interessante perché abbassa la soglia tecnica del lavoro locale senza fingere che ogni modello debba stare su una workstation. Per agenzie e team che trattano dati riservati, un nodo locale può coprire prototipi, retrieval e agenti circoscritti; il cloud resta utile per i picchi. La domanda corretta non è “locale o cloud?”, ma quale carico merita latenza prevedibile e controllo dei dati.
OpenAI costruisce l’inferenza attorno a Jalapeno
OpenAI sta preparando il primo deployment del proprio ASIC Jalapeño, sviluppato con Broadcom. La società dichiara un ciclo da progetto a tape-out di nove mesi e un avvio entro la fine del 2026. In un’intervista a Tom’s Hardware, il responsabile hardware Richard Ho ha spiegato che i sistemi vengono affiancati a CPU AMD EPYC Turin con 1,5 TB di memoria per host.
Qui il punto non è la sostituzione immediata delle GPU. È il controllo verticale dell’inferenza: acceleratore, rete, rack e software progettati insieme. Per chi compra servizi AI, questo aumenta il rischio di dipendenza dallo stack del fornitore. API, dati e workflow vanno quindi tenuti separabili, con test di uscita reali e non solo scritti nel contratto.
I data center cercano anche una licenza sociale
Microsoft sta estendendo la progettazione biomimetica a più di 20 siti negli Stati Uniti e in Germania. Vicino al data center della contea di Mecklenburg, in Virginia, il progetto include oltre 230 acri protetti, otto acri di nuove zone umide e corsi d’acqua ripristinati. Amazon, nello stesso giorno, ha presentato un Data Center Commitment e un programma da un miliardo di dollari per investimenti nelle comunità che ospitano queste strutture.
Non è un dettaglio di comunicazione. Acqua, rete elettrica, suolo e permessi sono dipendenze operative. Un data center tecnicamente pronto ma bloccato dal territorio non eroga un token. Per questo avevo già collegato permessi e resilienza dei data center AI: la continuità di servizio comincia fuori dal rack.
Google porta una TPU in orbita, ma i numeri frenano
Il prototipo di Project Suncatcher è partito il 1 ottobre con una TPU a bordo. Google userà la missione per misurare stress del volo, radiazioni e gestione termica. Il paper aggiornato stima però che, per avvicinare il costo di lancio a 200 dollari per chilogrammo entro il 2035, Starship dovrebbe portare in orbita circa 370.000 tonnellate: l’equivalente di circa 1.800 lanci da 200 tonnellate, cioè 180 all’anno per dieci anni.
Il prototipo è ricerca seria; il data center orbitale resta una scommessa infrastrutturale. Raffreddamento, comunicazioni tra acceleratori e frequenza dei lanci contano più del rendering di una costellazione. Per una PMI non è una soluzione da pianificare: è un indicatore di quanto la domanda di calcolo stia spingendo i grandi operatori a cercare energia e spazio oltre i data center tradizionali.
La scelta operativa per PMI e professionisti
Nei prossimi budget AI separerei tre voci: costo del modello, costo dell’infrastruttura e costo di uscita dal fornitore. Poi misurerei ogni workflow su latenza, dati trasferiti e consumo mensile. Se un’automazione WordPress usa un modello enorme per classificare cinque campi, il problema non è trovare più GPU: è aver progettato male il flusso.
La sintesi è questa: comprare “AI” come voce unica non basta più. Conviene scegliere modelli intercambiabili, mantenere piccoli i contesti, usare il locale dove privacy e continuità lo giustificano e pretendere una strategia di fallback. Il vero vantaggio non arriva dal chip più nuovo, ma da un’architettura che continua a funzionare quando prezzi, quote o fornitori cambiano.
Fonti
- NVIDIA: DGX Spark 64 GB e Sync Cluster Assistant
- OpenAI: ASIC Jalapeño sviluppato con Broadcom
- Tom’s Hardware: deployment Jalapeño con AMD EPYC Turin
- Microsoft: biomimicry applicata ai data center
- Amazon: Data Center Commitment e Built Together
- Google: prototipo Project Suncatcher in orbita
- Google Research: paper aggiornato su Project Suncatcher

