Model Hardware Standard: quando l'agente tocca la materia

Anthropic apre verso uno scenario in cui gli agenti possono operare su microscopi, bracci robotici e liquid handler — serve capire come gestire la non reversibilità di un comando

9/3/20266 min read

Ciao a tutti,

Ben arrivati su WikiLuc.

Ogni volta che in una review si arriva al punto "e qui l'agente aziona il sistema", la conversazione cambia temperatura. Finchè parliamo di leggere un CRM, interrogare un database, aprire un ticket, il perimetro è noto e quasi sempre le azioni sono reversibili. Nel momento in cui l'azione esce dal software e finisce su un dispositivo — una pompa, un braccio, uno strumento di misura — è importante spostare l' attenzione dall' accuratezza del modello a chi ne risponde nel momento in cui questo sbaglia.

Il 27 agosto Anthropic ha pubblicato in research preview il Model Hardware Standard (MHS), una specifica condivisa perchè gli agenti scoprano, interroghino e operino dispositivi fisici. Vale la pena guardarci dentro, perchè non è un SDK di prodotto: è il tentativo di fare per l'hardware quello che MCP ha fatto per i dati.

Di cosa parliamo oggi:

  • Cosa fa tecnicamente il driver MHS, e perchè la parte interessante è scritta in linguaggio naturale

  • I primi numeri sul campo — Carnegie Mellon, University of Washington, Genentech

  • Dove si incastra nella pila dei protocolli che si sta formando (MCP, A2A, MHS)

  • Il problema legato all' irreversibilità

  • Le domande da portare in review prima di far toccare qualcosa a un agente

Partiamo dal problema.

MHS: cosa cambia rispetto a integrare uno strumento a mano

Cosa intendiamo per "standard hardware" in questo contesto

Integrare uno strumento di laboratorio in un flusso automatizzato è oggi un lavoro artigianale. Ogni produttore espone la sua interfaccia, ogni modello ha il suo set di comandi, ogni installazione ha le sue costanti fisiche implicite — quanto è la corsa massima, quale volume è sicuro aspirare, a che temperatura il campione degrada. Quel sapere sta nella testa del tecnico che ha configurato la cella, e nei commenti di uno script che nessuno rilegge.

MHS introduce un driver software standardizzato che fa da traduttore tra il modello e il dispositivo. L'hardware espone comandi comuni — read e write — con cui l'agente legge stato e misure e modifica impostazioni. Fin qui è la parte prevedibile: è quello che fanno da vent'anni OPC-UA nell'industria e ROS nella robotica, e non sarebbe una notizia.

La parte che cambia il gioco è che nel driver è incorporata una descrizione in linguaggio naturale delle caratteristiche fisiche della macchina e dei suoi limiti operativi. Non un file di configurazione da parsare, ma un testo che il modello legge come contesto: cosa questo strumento è in grado di fare, entro quali confini di sicurezza deve restare. È il pezzo che rende la specifica model-agnostic e che sposta la conoscenza tacita del tecnico dentro l'artefatto software — dove un modello generalista può effettivamente usarla.

Le prime evidenze sul campo

I casi pubblicati insieme alla preview sono tre, e hanno il pregio di essere misurati.

  1. Carnegie Mellon. Il tempo di setup di uno strumento è passato da settimane a circa 8 ore, e gli esperimenti sono girati 3 volte più veloci. È il dato più significativo del gruppo, perchè il collo di bottiglia dell'automazione di laboratorio non è mai stato l'esecuzione bensì l'integrazione con ecosistemi già presenti.

  2. University of Washington. Sei strumenti integrati in meno di una settimana, con monitoraggio remoto. È la prova che il costo marginale del secondo dispositivo scende, che è esattamente ciò che ci si aspetta da uno standard funzionante e che non accade con le integrazioni punto-punto.

  3. Genentech. Claude ha eseguito saggi proteici in autonomia, analizzando i risultati e adeguato i parametri del ciclo successivo. Qui non siamo più nell'esecuzione di una ricetta: siamo nel loop chiuso osservazione-decisione-azione, che è la definizione operativa di agente.

Un'osservazione sul campione: sono tutti contesti di ricerca sperimentale, non di produzione manifatturiera. Non credo sia un caso. Il laboratorio ha cicli brevi, tolleranza all'errore più alta e un ROI misurabile in giorni-uomo; la linea di produzione ha certificazioni, responsabilità civile e fermi macchina che costano decine di migliaia di euro l'ora. Il prossimo step sarà capire come spostare lo standard al di fuori delle condizioni di laboratorio.

Dove si incastra: la pila che si sta formando

Messo in fila, il quadro dei protocolli degli ultimi diciotto mesi ha una sua logica.

MCP ha risolto l'accesso ai sistemi digitali: dati, tool, servizi. A2A ha affrontato la comunicazione tra agenti diversi. MHS aggiunge lo strato fisico. Sono tre livelli distinti dello stesso problema — dare a un modello un modo prevedibile di interagire con qualcosa che non è il suo contesto — e Anthropic li sta scrivendo tutti e tre.

Vale la pena esserne consapevoli. Uno standard aperto e model-agnostic è una cosa buona per l'ecosistema, e MHS lo è dichiaratamente: funziona con agenti diversi e con qualunque dispositivo esponga un'interfaccia programmabile. Ma chi scrive la specifica decide quali concetti esistono e quali no — quali attributi di un dispositivo sono di prima classe, cosa significa "limite operativo", come si dichiara una capability. È successo con HTTP, con OAuth, con OpenAPI: l'apertura della specifica e l'influenza di chi la redige coesistono; è necessario garantire le condizioni perchè queste possano fare sinergia.

Il punto di attenzione che nessuna specifica risolve

C'è un'asimmetria di fondo tra il mondo in cui MCP opera e quello in cui opera MHS, e non è tecnica: è di reversibilità.

Nel software l'errore di un agente si gestisce con i meccanismi che conosciamo — retry, idempotenza, rollback transazionale, compensazione. Se una tool call fallisce si ripete; se una scrittura è andata storta si torna allo stato precedente. È il motivo per cui il pattern "esegui, verifica, ritenta" regge in produzione anche con accuracy per singolo step inferiore al 100%: l'error compounding si contrasta con il recovery.

Un liquido versato non si riversa. Un campione degradato non si rigenera. Un braccio che ha già completato la corsa ha già toccato quello che doveva toccare. Nel mondo fisico il meccanismo di recovery non esiste come primitiva: esiste solo la prevenzione, cioè il modello di autorizzazione a monte. Questo significa che l'affidabilità di un sistema MHS non si misura come quella di un sistema MCP: non basta l'accuracy sull'azione singola, serve una classificazione esplicita delle azioni per reversibilità, e un human in the loop posizionato prima delle azioni irreversibili, non a valle come revisione.

È anche il motivo per cui il limite dichiarato apertamente da Anthropic pesa più di quanto sembri: i modelli attuali inciampano su vincoli fisici, chimici e biologici che una persona coglie per esperienza — l'esempio citato sono le bolle in un liquido. Sono esattamente le condizioni che nessuno scrive in una specifica, perchè nessuno le ha mai dovute scrivere.

Le domande su cui concentrarsi

Prima di far toccare qualcosa a un agente, sono tre le domande che userei.

  • Quali azioni di questo dispositivo sono reversibili e quali no. Non è una domanda retorica: va prodotta una lista, e le due categorie vanno trattate con architetture di autorizzazione diverse.

  • Chi mantiene la descrizione dei limiti operativi. Se il testo in linguaggio naturale dentro il driver è la fonte di verità che il modello usa per restare nei confini di sicurezza, allora quel testo è un artefatto critico: va versionato, revisionato e allineato quando la macchina viene ricalibrata.

  • Cosa succede quando il modello incontra una condizione fisica non descritta.Il comportamento di default davanti all'ignoto — fermarsi, chiedere, procedere — è una scelta di progetto, e va fatta esplicitamente.

Sono domande che oggi sembrano premature perchè i dispositivi coinvolti stanno quasi tutti in un laboratorio universitario. Nei prossimi due o tre anni, man mano che la specifica scende dalla ricerca alla linea di produzione, saperci rispondere diventerà il prerequisito minimo per portare un progetto in fabbrica — e chi inizia a costruirsi le risposte adesso, sui casi a basso rischio, arriverà preparato quando il rischio sarà quello vero.

Notizie da tenere d'occhio

Nvidia verso l'acquisizione di Hugging Face

Secondo quanto riportato il 27 agosto da The Information e rilanciato da CNBC e Forbes, Nvidia avrebbe raggiunto un accordo per acquisire Hugging Face per circa 12,9 miliardi di dollari.

Perchè importa: se hai pipeline che scaricano modelli da un hub pubblico, il controllo di quell'hub diventa una voce del tuo rischio fornitore — vale la pena valutare una strategia di mirroring.

OpenAI pubblica i primi risultati di Jalapeño

Il 25 agosto OpenAI ha presentato il suo chip di inferenza proprietario: su GPT-OSS 120B, DeepSeek R1 670B e Kimi K2.5 1T dichiara 1,5-1,9× di lavoro per watt al picco e fino a 3,6× di latenza end-to-end inferiore rispetto al sistema di confronto. Deployment interno previsto entro fine anno.

Perchè importa: il costo per token non è una costante di mercato — dipende da chi possiede il silicio.

Una cosa da leggere

🔧 Lo studio di Princeton sui limiti degli agenti nella ricerca

(Kirgis, Kapoor — via MIT Technology Review, 18 agosto 2026) Hanno dato a un modello di frontiera sei giorni, 3.000 dollari di crediti API e accesso a GPU per rispondere a due domande di ricerca inedite di NeurIPS. Gli autori originali hanno respinto entrambi i paper. Vale il tempo perchè separa con precisione ciò in cui gli agenti sono già forti — eseguire, misurare, compilare — da ciò in cui non lo sono ancora: decidere cosa vale la pena provare.

Quello che mi convince di MHS non è la promessa di automazione, ma il fatto che sposti la conoscenza operativa di una macchina dentro un artefatto leggibile e versionabile invece di lasciarla nella testa di chi l'ha configurata — è un guadagno che resta anche se l'agente non tocca mai nulla. Il punto aperto è l'altro: finchè il modello di autorizzazione non distingue le azioni reversibili da quelle che non lo sono, uno standard che facilita l'accesso al mondo fisico facilita anche gli errori che nel mondo fisico non si annullano.

Grazie per aver letto questo articolo fammi sapere cosa ne pensi!
Ci vediamo presto qui su WikiLuc!

Contatti

Scrivimi per domande o collaborazioni

Email

luciano.cipriano1994@gmail.com

© 2025. All rights reserved.