Un form di contatto che smista le richieste con un LLM fa sempre lo stesso giro: manda il testo al modello, chiede un JSON, riceve una stringa, la valida, e se la validazione fallisce riprova. Quel livello di codice difensivo — il parser, lo schema, il retry, il fallback quando anche il secondo tentativo torna male — è il vero costo dell’AI dentro un sito, e non compare in nessun listino a token.

Il 15 settembre 2026 TypeSafe AI ha pubblicato Jev, il primo modello di una classe che chiama System One. Non genera testo. Prende lo stato di un programma e restituisce valori tipizzati, con le probabilità attaccate. È l’occasione per confrontare due modi di far decidere il software, perché fino a ieri ne esisteva uno solo.

Il criterio del confronto

Non confronto intelligenza. Confronto cosa succede quando l’automazione deve decidere migliaia di volte al giorno senza che nessuno guardi: quanto costa una decisione, quanto tempo aggiunge alla richiesta, e cosa si rompe quando il volume cresce. Sono le tre domande che mi fa un cliente PMI prima di mettere una chiamata AI dentro un checkout o un ticket.

Le due opzioni sono: A — un LLM generalista in structured output mode, quello che quasi tutti stanno già usando; B — un modello tipizzato che non sa scrivere prosa e fa solo decisioni.

Costo per decisione

TypeSafe dichiara per Jev 0,042 dollari per milione di token in input, con l’output gratuito. Nella stessa tabella colloca gli LLM fra 0,20 e 10 dollari per milione di token in input, con l’output intorno a cinque volte l’input. La distanza sul prezzo di listino è di due ordini di grandezza, e il claim di punta sulla loro home page è 193,6x più veloce e 444,6x più economico.

Il numero che dice qualcosa di concreto è un altro, ed è in fondo al loro post: la demo che gioca a Doom fa dieci chiamate al secondo e costa circa 7 dollari l’ora. Tradotto: 36.000 decisioni all’ora per il prezzo di un caffè e mezzo. Con un LLM di fascia media quel carico non lo accendi nemmeno per provarlo.

Dove A resta avanti: se le decisioni al giorno sono duecento, la differenza fra i due listini è qualche franco al mese. Sotto un certo volume il costo non è un criterio, è rumore.

Latenza dentro la richiesta

Qui la differenza è architetturale, non di prezzo. Un LLM genera un token alla volta, ognuno condizionato dal precedente: il tempo di risposta cresce con la lunghezza dell’output. Jev campiona in parallelo e restituisce tutte le risposte in una sola query, perché non deve costruire una frase.

Per chi lavora su WordPress questo è il punto che si sente davvero. Una chiamata a un LLM dentro il ciclo di richiesta di un form aggiunge secondi visibili all’utente, e infatti la si sposta quasi sempre in coda asincrona — che è lavoro in più: una tabella, un worker, un cron, una pagina di stato. Una decisione il cui tempo di risposta non cresce con la lunghezza dell’output si può permettere di restare dentro la richiesta, e quella coda non la scrivi.

Cosa si rompe quando cresce

Con l’opzione A, a crescere è la superficie di errore. L’output è una stringa: può essere la risposta giusta, un rifiuto, un JSON con una virgola di troppo o un valore inventato che passa la validazione dello schema ma non esiste nel tuo database. TypeSafe lo dice senza giri di parole: una chiamata a tool allucinata è fastidiosa dentro un agente, ma è un problema serio se sta sepolta diversi livelli sotto in una catena di dipendenze.

Con l’opzione B le forme possibili dell’output sono dichiarate in anticipo e il modello non può produrre un errore di tipo. Non è una promessa di affidabilità, è una proprietà dello schema: lo spazio delle risposte sbagliate per forma è vuoto perché non è rappresentabile. Resta intatto il rischio che la decisione sia sbagliata nel merito — ed è per questo che ogni risposta arriva con una probabilità calibrata, che nel tuo codice diventa la soglia sopra la quale agisci da solo e sotto la quale chiami un umano.

Un limite concreto di B: Jev gestisce scelte fino a 255 opzioni. Oltre, serve un sistema a due stadi e il vantaggio di velocità si assottiglia. Se devi scegliere fra ventimila prodotti a catalogo, quel numero riguarda te.

Come vanno letti quei numeri

Sono dichiarazioni del venditore, e vanno pesate. TypeSafe è trasparente più della media — le note stanno sotto ogni grafico — ma dicono tre cose che cambiano la lettura.

Primo: il 193,6x e il 444,6x vengono dai loro workflow eval, e loro stessi scrivono di aspettarsi che siano nella fascia alta dei guadagni reali. Secondo: quei workflow li ha costruiti il loro team di model capabilities, e ammettono che un bias possa esserci. Terzo, il più importante: lo 0% di allucinazioni attribuito a Jev nei grafici non è una misura, è un valore inserito per costruzione perché lo schema garantisce la corrispondenza, mentre i numeri degli LLM arrivano dal traffico reale di OpenRouter. Sono due grandezze diverse messe sullo stesso asse.

Aggiungi che Jev è in early access con lista d’attesa, che è un fornitore solo, e che non esiste ancora un benchmark indipendente. Sul piano del rischio fornitore, l’opzione A oggi ha tre o quattro venditori intercambiabili; l’opzione B ne ha uno.

La take

La cosa da fare oggi non è cambiare modello. È accorgersi che la maggior parte delle chiamate AI dentro un sito non produce testo, produce un booleano — questo ticket è urgente, questo ordine è a rischio, questo commento è spam — e che quel booleano lo stai pagando al prezzo della prosa, con sopra un livello di codice difensivo che serve solo perché la risposta arriva come stringa.

Separa i due lavori nel tuo codice adesso, anche restando con l’LLM che usi già: una funzione che decide e restituisce un tipo, una funzione diversa che scrive al cliente. Quando avrai davanti un benchmark indipendente, cambiare il motore sotto la prima sarà una riga di configurazione invece di un refactoring. E se non cambierai niente, avrai comunque smesso di mescolare due cose che non hanno né lo stesso prezzo né lo stesso modo di rompersi.

Il numero da tenere d’occhio non è 444,6x. È quante righe di codice difensivo puoi cancellare: quello è l’unico risparmio che non dipende dal listino di nessuno.

Fonti

Sullo stesso filo: modello di punta o modello medio nelle automazioni WordPress e perché i benchmark li devi rifare sui tuoi dati.