OpenAI si è fatta il chip

Jalapeño dichiara fino a 1,9 volte il lavoro per watt e 3,6 volte meno latenza dei sistemi Nvidia di confronto — e in nove mesi è passato dal disegno alla produzione

Luciano Cipriano

9/8/20266 min read

Ciao a tutti,

Ben arrivati su WikiLuc.

In quasi tutti i business case che ho analizzato di recente, il costo di inferenza è trattato come una costante: un prezzo per milione di token preso dal listino, moltiplicato per i volumi previsti, proiettato su tre anni. È l'assunzione più fragile del modello, e il 25 agosto OpenAI ha pubblicato qualcosa che lo rende evidente — i primi risultati di Jalapeño, il chip di inferenza che si è progettata in casa.

Non è una notizia da appassionati di hardware. Chi possiede il silicio decide quanto costa far girare il proprio modello, e quel numero finisce dentro i conti di chiunque ci costruisca sopra.

Di cosa parliamo oggi:

  • Perché leggere un prompt e generare una risposta sono due lavori diversi per il computer

  • I numeri dichiarati, e contro cosa sono stati misurati

  • Come si costruisce un chip in nove mesi senza essere un produttore di chip

  • Cosa cambia sul costo per token

  • Le domande da farsi prima di fissare un prezzo in un business case

Partiamo dal problema.

Un chip fatto su misura per una cosa sola

Cosa intendiamo per "chip di inferenza"

Quando usi un modello succedono due cose in sequenza, e sono molto diverse tra loro.

  • La prima è la lettura del prompt — quello che in gergo si chiama prefill. Il modello riceve tutto il testo in ingresso e lo elabora in blocco. È un lavoro di calcolo puro: tanti conti, tutti insieme, sui dati che ha già davanti.

  • La seconda è la generazione della risposta — il decode. Qui il modello produce un token alla volta, e a ogni passo deve rileggere tutto quello che ha già scritto e tutta la memoria della conversazione. Non è più un problema di quanti conti sai fare: è un problema di quanto in fretta sai spostare i dati dalla memoria al processore.

Una GPU generalista deve andare bene per entrambe. Va bene, ma non benissimo per nessuna delle due. Jalapeño è progettato sapendo che le fasi sono due e che vogliono cose opposte: il sistema decide dove mettere lo stato del modello e la memoria della conversazione — la cosiddetta KV cache — e attiva la parte giusta della macchina a seconda della fase. La rete che collega i chip è dimensionata perché un intero carico di lavoro stia dentro un solo sistema connesso, così i dati si muovono il meno possibile.

È lo stesso principio di un attrezzo dedicato contro uno multiuso: rinunci alla flessibilità e guadagni sul compito specifico.

I numeri, e contro cosa

OpenAI ha misurato il chip su tre modelli pubblici — GPT-OSS 120B, DeepSeek R1 670B e Kimi K2.5 1T — usando il benchmark SemiAnalysis InferenceX, e ha confrontato i risultati con sistemi Nvidia GB200 e GB300 disponibili sul mercato.

  1. Efficienza energetica: da 1,5 a 1,9 volte più lavoro per watt al massimo del carico. Sul modello più grande, Kimi, circa 1,5 volte.

  2. Latenza: da 1,7 a 3,6 volte inferiore end-to-end. Su Kimi, 3,4 volte.

  3. Carichi interattivi: da 2,1 a 4,1 volte di prestazione in più. È lo scenario di una chat o di un agente che risponde mentre qualcuno aspetta.

Il dato che conta di più è il primo, e non è intuitivo. Nei data center moderni il limite non è quante schede riesci a comprare: è quanti megawatt riesci a portare nell'edificio. Se ogni watt produce il doppio del lavoro, la stessa struttura serve il doppio delle richieste — senza costruire nulla di nuovo. Il chip ha un involucro da 700 watt, ma sui carichi provati il consumo effettivo misurato resta sotto i 550.

Va detto con chiarezza che questi numeri li ha pubblicati chi ha costruito il chip, girano su silicio ancora in fase di ingegneria e usano un carico di prova standardizzato — circa 8.000 token in ingresso e 1.000 in uscita — che non somiglia molto alle conversazioni lunghe e a più turni di un agente reale. Non c'è ancora una verifica indipendente, non è stato pubblicato alcun dato sul costo per token, e non sappiamo come si comporti la macchina su migliaia di unità in esercizio continuo. Sono risultati credibili e interessanti; non sono ancora risultati riproducibili e standardizzati sul mercato.

Come si fa un chip in nove mesi

Dal primo disegno alla consegna in fabbrica sono passati nove mesi. Per un acceleratore di questa classe è un tempo molto breve, e il modo in cui ci sono arrivati è istruttivo: OpenAI non ha costruito una divisione semiconduttori. Ha portato l'unica cosa che aveva e che nessun altro ha — la conoscenza esatta di come sono fatti i propri carichi di lavoro — e ha comprato tutto il resto. Broadcom ha realizzato il silicio e la parte di rete, Celestica ha messo insieme schede, rack e sistema. L'AI è stata usata internamente per esplorare le implementazioni, accelerare la verifica e ottimizzare i circuiti aritmetici.

È uno schema replicabile. Non da tutti — servono volumi enormi per giustificare l'investimento — ma la barriera non è più "saper fare i chip". È "avere abbastanza traffico e sapere esattamente com'è fatto". Questo apre la stessa strada a chiunque abbia entrambe le cose, e spiega perché lo stesso movimento si vede da anni in Google con le TPU e in Amazon con Trainium.

Cosa cambia sul costo per token

Il prezzo che paghi per usare un modello non è un prezzo di mercato in senso stretto. È il costo di produzione di chi te lo vende, più il margine che decide di prendersi. Se quel costo di produzione scende — perché il fornitore ha smesso di comprare l'hardware e ha iniziato a fabbricarlo — il pavimento sotto il prezzo si abbassa.

Non significa che i listini caleranno domani: nessuno taglia i prezzi se non è costretto. Significa che la possibilità di tagliarli esiste, e non è distribuita in modo uniforme tra i fornitori. Chi compra GPU sul mercato e chi le progetta non hanno lo stesso margine di manovra, e in una fase di concorrenza sui prezzi si vedrà.

Per chi fa piani a tre anni la conseguenza è concreta: un modello economico costruito sul listino di oggi, esteso al 2029, sta assumendo qualcosa che nessuno può garantire. Meglio ragionare per scenari — costo stabile, costo dimezzato, costo raddoppiato — e verificare che il progetto regga in tutti e tre.

Il calendario, che conta più dei numeri

Jalapeño entra nell'infrastruttura di OpenAI entro fine anno, la seconda generazione è già in sviluppo e la terza sul tavolo. I volumi veri, però, arriveranno nel 2027. E nel 2027 il confronto non sarà più con GB200 e GB300, ma con Vera Rubin — la piattaforma che Nvidia ha presentato a marzo dichiarando fino a 35 volte più token al secondo per megawatt rispetto a Blackwell.

Questo non toglie valore a Jalapeño: ne definisce l'obiettivo. Non deve battere Nvidia sul mercato aperto, non è in vendita. Deve rendere OpenAI meno dipendente da un unico fornitore in un momento in cui quel fornitore è il collo di bottiglia di tutto il settore. Misurato su quel metro, la domanda non è se sia il chip più veloce del mondo — è se basti a cambiare il rapporto di forza al tavolo delle trattative.

Le domande su cui focalizzarsi

  • Su quale prezzo per token poggia il tuo business case, e cosa succede se cambia del 50% in su o in giù. Se il progetto regge solo con il listino attuale, il progetto è fragile.

  • Il tuo carico assomiglia a quello dei benchmark. Prompt corti e risposte brevi, o conversazioni lunghe con molti turni? I guadagni annunciati valgono soprattutto per il primo caso.

  • Cosa fai se il tuo fornitore cambia hardware sotto il cofano. Latenze e comportamenti possono spostarsi senza che nulla cambi nell'API.

Sono domande che oggi sembrano da specialisti dell'infrastruttura. Nei prossimi due o tre anni, man mano che ogni grande operatore si costruisce il proprio silicio, diventeranno parte normale della valutazione di un fornitore AI — e chi inizia a porsele adesso avrà già i numeri pronti quando serviranno.

Notizie da tenere d'occhio

Nvidia verso l'acquisizione di Hugging Face
Il 27 agosto The Information, ripresa da CNBC e Forbes, riporta un accordo intorno ai 12,9 miliardi di dollari. Sarebbe la maggiore acquisizione di sempre per Nvidia. Nessuna conferma ufficiale dalle due aziende.
Perché importa: mentre OpenAI si costruisce il silicio, Nvidia compra il luogo da cui si distribuiscono i modelli. Due mosse opposte sullo stesso tabellone.

Anthropic apre il Model Hardware Standard
Il 27 agosto è uscita in research preview la specifica che permette agli agenti di operare dispositivi fisici. Carnegie Mellon riporta il setup di uno strumento sceso da settimane a circa 8 ore.
Perché importa: dopo i dati e gli altri agenti, lo strato che si sta standardizzando è quello delle macchine.

Il divario occupazionale dei 22-25enni sale al 19%
L'aggiornamento di agosto dello studio Canaries in the Coal Mine dello Stanford Digital Economy Lab, su dati ADP fino a metà 2026, misura un divario del 19% tra i giovani nelle occupazioni più esposte all'AI e i coetanei nelle meno esposte. Era il 15% a luglio 2025.
Perché importa: l'effetto passa dalle assunzioni mancate, non dai licenziamenti, e non si vede nei dati di turnover.

Una cosa da leggere

🔧 Il post tecnico di OpenAI sui primi risultati di Jalapeño (OpenAI Engineering, 25 agosto 2026) — vale il tempo anche se non ti occupi di hardware, perché è scritto in modo leggibile e spiega bene la distinzione tra prefill e decode. È la stessa distinzione che, capita una volta, rende comprensibile perché una risposta lunga costa più di un prompt lungo.

Quello che mi sembra più significativo di Jalapeño non sono i moltiplicatori dichiarati, che andranno verificati da terzi, ma i nove mesi impiegati e il modo in cui ci sono arrivati: un'azienda che non produce chip ne ha portato uno in fabbrica portando in dote la conoscenza dei propri carichi di lavoro e comprando tutto il resto. Se quel percorso è ripetibile, il costo di far girare un modello smette di essere un dato di mercato e diventa una scelta industriale di ciascun operatore — con la conseguenza, per chi ci costruisce sopra, che due fornitori con lo stesso listino oggi possono avere margini di manovra molto diversi domani.

Grazie per aver letto questo articolo fammi sapere cosa ne pensi!

Ci vediamo presto qui su WikiLuc!

Contatti

Scrivimi per domande o collaborazioni

Email

luciano.cipriano1994@gmail.com

© 2025. All rights reserved.