Dal linguaggio al movimento: si sta aprendo il secondo ecosistema dell'AI

I modelli imparano a coordinare corpi e macchine, il capitale segue con 47 miliardi in sei mesi — e per un paese che fabbrica cose è una partita diversa da quella dei chatbot

Luciano Cipriano

9/10/20268 min read

Ciao a tutti,

Ben arrivati su WikiLuc.

Per tre anni la domanda che ha organizzato tutto il settore è stata una sola: chi ha il modello linguistico migliore. È una domanda che ha prodotto risultati straordinari e che, per chi lavora in Italia, ha avuto un difetto strutturale — la partita si giocava altrove, su data center e capitali che qui non ci sono. Nell'ultimo anno accanto a quella corsa se n'è aperta una seconda, e ha regole diverse.

L'oggetto non è più far scrivere meglio un modello: è farlo agire nel mondo fisico in cui viviamo. A luglio Google DeepMind ha rilasciato Gemini Robotics 2, presentato come "whole body intelligence", e Gemini Robotics ER 2, con comprensione video, orchestrazione dei compiti e collaborazione tra più robot. Il 27 agosto Anthropic ha aperto in research preview il Model Hardware Standard, la specifica che permette a un agente di operare strumenti fisici. E il capitale si è mosso di conseguenza: secondo Crunchbase, nel primo semestre 2026 il venture capital ha investito 47,4 miliardi di dollari in 521 operazioni su quella che viene chiamata physical AI — quasi quattro volte il secondo semestre 2025, e più di tutto il triennio 2022-2024 messo insieme.

Non è un ecosistema che sostituisce quello degli LLM. È un secondo ecosistema che si apre accanto, e vale la pena capirlo adesso, perché le competenze che chiede sono più vicine a quelle che qui abbiamo già.

Di cosa parliamo oggi:

  • Cosa è cambiato nei modelli, in concreto

  • I numeri di quello che è davvero installato e funzionante

  • Perché i dati sono il vero collo di bottiglia, e non lo erano per il linguaggio

  • Come si tengono insieme i due ecosistemi invece di scegliere

  • Perché per un paese manifatturiero questa partita è più aperta della precedente

Partiamo dai modelli.

Cosa è cambiato
Da capire il testo a coordinare un corpo

La differenza tra un modello linguistico e un modello per la robotica non è la dimensione: è cosa deve tenere insieme.

Un modello linguistico riceve testo e produce testo. Un modello per il mondo fisico deve guardare, capire dove sono le cose nello spazio, decidere una sequenza di movimenti, eseguirla mentre l'ambiente cambia, e accorgersi quando qualcosa non è andato come previsto. Sono capacità diverse, e fino a poco tempo fa venivano affrontate da sistemi separati, ciascuno programmato per la sua cella di lavoro.

I rilasci di luglio spostano proprio questo. Gemini Robotics 2 viene presentato come intelligenza "a corpo intero": non il controllo di un braccio isolato, ma il coordinamento dell'insieme. Gemini Robotics ER 2 aggiunge tre cose che contano nella pratica industriale — la capacità di capire cosa succede in un video, l'orchestrazione di un compito articolato in passi, e la collaborazione tra più robot che lavorano insieme.

Il Model Hardware Standard di Anthropic affronta lo stesso terreno da un altro lato: invece di rendere più capace il modello, rende uniforme il modo in cui parla alle macchine. Un driver standardizzato traduce tra modello e dispositivo, e porta con sé una descrizione in linguaggio naturale di cosa quella macchina può fare e di quali limiti deve rispettare. Nei primi casi pubblicati, Carnegie Mellon riporta il tempo di integrazione di uno strumento sceso da settimane a circa 8 ore.

Messe insieme, le due direzioni raccontano la stessa cosa: la parte difficile si sta spostando dalla programmazione della singola cella alla coordinazione, e la coordinazione è esattamente ciò in cui i modelli generalisti sono bravi.

Cosa è davvero installato

Qui servono i numeri veri, perché la distanza tra i video promozionali e le fabbriche è ancora larga.

Nel primo semestre 2026 sono stati spediti circa 19.100 robot umanoidi, contro i 5.100 dello stesso periodo dell'anno precedente: una crescita del 272%. Il mercato è guidato da due produttori cinesi, Agibot con il 44% di quota e Unitree con il 31%. Per l'intero 2026 la stima è di circa 60.000 unità e 1,6 miliardi di dollari di ricavi, con oltre il 70% delle consegne destinate ad applicazioni industriali e commerciali.

I casi documentati con numeri sono ancora pochi ma esistono, e sono i più utili da guardare.

  1. BMW e Figure. Il modello Figure 02 ha accumulato oltre 1.250 ore operative, movimentando più di 90.000 pezzi su 30.000 veicoli. Il successore, Figure 03, è in prova su compiti di logistica.

  2. Agility Robotics e GXO. Il robot Digit ha movimentato oltre 100.000 cassette in un magazzino.

Sono numeri reali e sono numeri piccoli. Vanno letti per quello che sono: prove estese in condizioni controllate, non flotte in produzione. La misura giusta per valutarle non è quante ore hanno lavorato, ma quante volte ha dovuto intervenire una persona e quanto è costato ogni singolo compito — ed è precisamente il dato che quasi nessuno pubblica.

Perché i dati sono il collo di bottiglia

Questa è la parte che spiega perché la seconda corsa sarà più lenta della prima, e anche perché sarà più aperta.

I modelli linguistici hanno avuto un regalo enorme: il testo esisteva già. Miliardi di pagine, libri, conversazioni, codice — un patrimonio accumulato per altri motivi e disponibile per l'addestramento. Per il movimento quel patrimonio non esiste. Non c'è un web dei gesti. Ogni ora di dati su come si afferra un oggetto irregolare, come si compensa uno scivolamento, come ci si ferma quando qualcosa non torna, va prodotta apposta — con robot veri, in ambienti veri, e con costi che non scalano da soli.

Il settore sta rispondendo su due fronti. Il primo è raccogliere dati su larga scala in strutture dedicate: è la logica del Robot Park di Apptronik, dove i movimenti vengono registrati sistematicamente. Il secondo è generare dati sintetici in simulazione — la strada su cui lavorano tra gli altri Nvidia e LG — addestrando i modelli in mondi virtuali e trasferendo poi il comportamento sulle macchine reali.

Nessuna delle due ha ancora vinto, e il passaggio dalla simulazione alla realtà resta il punto tecnico più delicato dell'intero campo: il mondo simulato non ha polvere, giochi meccanici, pezzi leggermente deformati. Ma la conseguenza strategica è chiara: in questa partita il vantaggio non ce l'ha chi possiede più GPU, ce l'ha chi possiede l'ambiente in cui i dati di alta qualità vengono generati — cioè chi ha le fabbriche, i magazzini, i laboratori, le linee di produzione.

Due ecosistemi, non una sostituzione

Vale la pena essere precisi su come i due mondi si tengono insieme, non si tratta di uno scenario in cui gli LLM vengono sostituiti dal AI fisica, ma bensì un contesto in cui una nuova frontiera di AI si integra con lo scenario in cui gli LLM hanno operato fino ad ora.

Il modello linguistico non sparisce: diventa lo strato che ragiona e pianifica. Il modello robotico è lo strato che percepisce e agisce. Il protocollo — MCP per i dati, MHS per le macchine — è quello che li collega. In un impianto reale la catena è questa: un sistema capisce la richiesta e la scompone in passi, un altro esegue quei passi su un dispositivo, un terzo verifica che il risultato sia quello atteso e riporta indietro l'esito.

Chi ha investito negli ultimi due anni in competenze su modelli, prompt, orchestrazione di agenti e integrazione dati non ha costruito qualcosa che ora va buttato: ha costruito lo strato superiore di questa pila. Quello che si aggiunge è la parte sotto, ed è una parte che richiede mestieri diversi — automazione industriale, sensoristica, sicurezza funzionale, controllo qualità.

C'è anche un contrappeso da tenere fermo, perché il rigore lo richiede. Gli umanoidi cinesi lavorano oggi intorno al 50% dell'efficienza di una persona, e sui compiti ripetitivi ad alto volume i robot a braccio fisso restano più veloci, più precisi e più affidabili. Le valutazioni finanziarie corrono molto più della sostanza — Unitree si è quotata intorno ai 53 miliardi su 252 milioni di ricavi, oltre 200 volte il fatturato. La lettura più prudente, e per me la più probabile, è che nei prossimi anni le macchine generaliste affianchino l'automazione esistente nei compiti variabili e a basso volume, invece di sostituirla dove funziona già bene.

Perché per l'Italia questa partita è più aperta

Arrivo al punto che mi interessa di più, e lo dico senza retorica. Nella corsa ai modelli linguistici il fattore decisivo è stato il capitale: miliardi in addestramento, data center, energia. Su quel terreno l'Italia non era in gioco, e non lo sarà. Nella physical AI il fattore decisivo è diverso — è l'accesso a processi industriali reali su cui addestrare, misurare e certificare. E qui il paese ha qualcosa che gli altri devono comprare: la seconda base manifatturiera d'Europa, distretti specializzati, macchine utensili, automazione, packaging, robotica industriale. Sono esattamente gli ambienti in cui i dati che oggi mancano si generano.

Questo non garantisce nulla di per sé. Ma cambia il tipo di gioco: non serve inseguire un modello di frontiera, serve essere il posto dove i modelli di frontiera vengono messi alla prova e specializzati. È una posizione da fornitore di verticale, non da fornitore di fondamenta, ed è storicamente il ruolo in cui l'industria italiana è stata più brava.

Le competenze che diventano rilevanti sono altrettanto concrete: chi sa integrare un sistema, chi conosce la sicurezza di macchina, chi sa scrivere le specifiche di un processo produttivo — con l'aggiunta di sapere come si parla a un modello. È una combinazione che oggi ha pochissime persone, e la finestra per costruirla è aperta adesso.

Le domande su cui concentrarsi
  • Nel tuo processo, quali compiti sono variabili e a basso volume. Sono quelli dove una macchina generalista ha senso oggi; su tutto il resto l'automazione tradizionale vince ancora, e va detto al cliente.

  • Chi possiede i dati generati dai tuoi impianti. Se un fornitore addestra i propri modelli sui tuoi processi, quel valore va negoziato adesso, mentre nessuno gli dà un prezzo.

  • Quali competenze mancano al tuo team per stare in questa filiera. Non "serve un esperto di AI": serve capire se manca la parte di modello, quella di automazione, o il ponte tra le due.

Sono domande che oggi si possono ancora affrontare con calma, perché il numero di installazioni reali è basso e gli errori costano poco. Nei prossimi due o tre anni, mentre l'automazione generalista entra nei capitolati e nelle gare, saperci rispondere sarà ciò che distingue chi arriva con un metodo da chi arriva con una brochure — e questa volta il terreno di gioco è vicino a casa.

Notizie da tenere d'occhio

Il 12 novembre Cursor perde i modelli OpenAI
Il 28 agosto OpenAI ha annunciato la fine della fornitura dei propri modelli all'editor, dopo l'acquisizione di Anysphere da parte di SpaceX per 60 miliardi.
Perché importa: se il tuo lavoro dipende da uno strumento, dipende anche dagli accordi commerciali che ci stanno dietro — conviene avere configurazioni portabili.

Nvidia verso l'acquisizione di Hugging Face
Il 27 agosto The Information, ripresa da CNBC e Forbes, riporta un accordo intorno ai 12,9 miliardi di dollari, senza conferme ufficiali.
Perché importa: il valore si sposta sul layer di distribuzione dei modelli, che è il punto in cui si formano le abitudini di adozione.

Waymo raccoglie 16 miliardi a valutazione 126 miliardi
Il round di febbraio da solo rappresenta quasi un terzo di tutto il capitale investito in physical AI nel primo semestre 2026.
Perché importa: la guida autonoma resta il caso d'uso che assorbe la quota maggiore di questo mercato, molto prima degli umanoidi.

Una cosa da leggere

🔧 Il rapporto Crunchbase sul funding della physical AI nel primo semestre 2026 — vale il tempo perché mette in fila numeri che di solito circolano separati, e permette di vedere quanta parte della crescita sia guidata da pochissimi mega-round su guida autonoma e difesa, e quanta invece dalla robotica industriale vera. La differenza cambia parecchio la lettura del fenomeno.

Quello che mi sembra più significativo di questa fase non è la crescita del capitale, che è un indicatore volatile, ma il fatto che il collo di bottiglia si sia spostato dai modelli ai dati di processo — e i dati di processo stanno dentro le fabbriche, non dentro i data center. Se questa lettura regge, per un paese che sa fabbricare cose il modo di partecipare non è costruire il modello di frontiera, ma diventare il posto dove quel modello impara a lavorare davvero: è una posizione meno appariscente, ma è l'unica che si può occupare partendo da quello che già abbiamo.

Grazie per aver letto questo articolo fammi sapere cosa ne pensi!

Ci vediamo presto qui su WikiLuc!

Contatti

Scrivimi per domande o collaborazioni

Email

luciano.cipriano1994@gmail.com

© 2025. All rights reserved.