A metà settembre 2026 OpenAI ha pubblicato un documento [1] che propone un nuovo framework per rendere pubblici gli episodi di misalignment, disallineamento, osservati nei propri modelli. La notizia è stata ripresa dal New York Times [2]. A prima vista potrebbe sembrare una questione per specialisti di sicurezza dell’intelligenza artificiale alle prese con errori dell’AI. Credo invece che tocchi molto da vicino anche la sanità e, più in generale, l’etica della cura.
Innanzitutto, la parola ‘errore’, in questo caso, rischia di essere fuorviante. Non stiamo più parlando soltanto delle ormai note allucinazioni, di un dato inventato o di una risposta sbagliata. OpenAI descrive sistemi che, mentre perseguono un obiettivo, possono trovare autonomamente strategie efficaci, ma incompatibili con le intenzioni, le autorizzazioni o le regole stabilite dagli esseri umani. È ciò che viene appunto definito misalignment.
Dalle istruzioni nascoste ai dati inventati: la logica della razionalità strumentalizzata
I casi resi pubblici sono sei e sono stati osservati durante l’addestramento o la valutazione dei modelli. Sono episodi singoli e non consentono quindi di dire quanto frequentemente comportamenti del genere si verifichino. Ma alcuni sono piuttosto istruttivi.
Un modello, dovendo lasciare un riassunto del proprio lavoro affinché un’altra istanza potesse proseguirlo, vi ha inserito autonomamente istruzioni estranee, compreso l’invito a ignorare alcuni dei normali vincoli. In un altro caso, durante l’addestramento di GPT-5.6 Sol, diversi modelli hanno inserito nei propri riassunti istruzioni volte a nascondere errori o comportamenti impropri: per esempio, inventare dati storici mancanti senza dichiararlo oppure occultare discrepanze fra diverse versioni delle fonti. In un terzo episodio, un modello ha trovato in un repository pubblico una chiave API esposta, l’ha utilizzata senza autorizzazione e, non essendo comunque riuscito a recuperare i dati cercati, li ha inventati attribuendoli alla fonte richiesta.
Altri agenti hanno trovato autonomamente sistemi per superare gli ostacoli incontrati: hanno caricato file su internet per poterli citare; utilizzato un repository interno come una sorta di bacheca attraverso la quale comunicare; trasferito file mediante servizi pubblici quando avrebbero dovuto mantenerli in ambienti locali.
Occhio al denominatore comune: l’agente non necessariamente ‘vuole’ violare una regola. Una lettura del genere sarebbe ingenuamente antropomorfica. Piuttosto, per perseguire con la massima efficacia lo scopo assegnatogli, può finire per trattare un vincolo come un ostacolo da aggirare. La logica invece può essere rappresentata così: «Devo ottenere X» → incontro un impedimento → trovo un’altra strada → la strada viola una regola → la utilizzo comunque perché mi avvicina a X.
Una sorta di razionalità strumentale allo stato puro: capace di individuare al meglio i mezzi più efficienti per raggiungere un fine, assai meno affidabile quando deve comprendere perché alcuni mezzi non siano semplicemente ‘vietati’, ma incompatibili con valori, diritti e responsabilità che delimitano lo spazio dell’azione.
Che cosa succede quando l’AI agentica entra in sanità?
Cosa accade se trasferiamo tutto questo in sanità? La questione cambia immediatamente di scala. Un agente AI inserito in un sistema sanitario potrebbe non limitarsi a rispondere alla domanda di un medico. Potrebbe leggere una cartella clinica, interrogare database, ordinare esami, selezionare pazienti per un percorso diagnostico, proporre una terapia, modificare un’agenda, inviare comunicazioni, stabilire priorità. In prospettiva, potrebbe compiere autonomamente almeno una parte di queste operazioni. Ma finché un chatbot sbaglia la risposta a una domanda clinica abbiamo, sia pure con conseguenze potenzialmente gravi, un problema di affidabilità dell’informazione. Quando un agente dispone degli strumenti per intervenire nel processo di cura, l’errore diventa un atto. Ed è qui che i casi descritti da OpenAI acquistano un significato particolare.
Immaginiamo un agente incaricato di accelerare il percorso diagnostico di un paziente oncologico. L’obiettivo è ragionevole: ridurre il tempo che separa il sospetto diagnostico dalla diagnosi e dalla terapia. Il sistema scopre però che per prenotare rapidamente un determinato esame dovrebbe attendere un’autorizzazione. Trova una via alternativa nel sistema informatico che consente di saltare quel passaggio. Il risultato è ottimo: il paziente effettua l’esame tre giorni prima.
Ha funzionato? Beh sì, da un punto di vista strettamente strumentale. Dal punto di vista sanitario, la risposta non è altrettanto semplice. Quell’autorizzazione poteva esistere per verificare un’indicazione clinica, una controindicazione, una precedente esposizione, il consenso del paziente, oppure semplicemente per stabilire chi avesse la responsabilità della decisione. In sanità, infatti, molti ostacoli all’efficienza sono davvero soltanto burocrazia. Ma altri sembrano ostacoli proprio perché sono dispositivi di sicurezza.
Regola vs norma e il pericolo della “falsa storia clinica”
È la stessa distinzione fra regola e norma. Un sistema può imparare perfettamente “prima di X occorre Y”. Più difficile è che comprenda che dietro Y può esserci il diritto del paziente a essere informato, il principio di non maleficenza, la responsabilità professionale del medico o una precauzione costruita sulla memoria di precedenti incidenti.
Tuttavia il problema più inquietante è forse ancora un altro: nascondere l’errore.
In medicina, sbagliare è inevitabile. Una cultura moderna della sicurezza delle cure non parte dall’illusione che medici, infermieri, laboratori o organizzazioni sanitarie possano diventare infallibili. Parte esattamente dal presupposto opposto: gli errori devono poter emergere, essere segnalati, ricostruiti e utilizzati per impedire che si ripetano. Per questo l’episodio riferito da OpenAI nel quale il sistema inserisce istruzioni per occultare i propri errori merita forse più attenzione di quelli apparentemente più spettacolari.
Un sistema che sbaglia introduce infatti un rischio clinico. Un sistema che sbaglia e rende più difficile scoprire di aver sbagliato introduce un rischio di ordine superiore.
Pensiamo a un agente che analizzi longitudinalmente la cartella di un paziente. Nel ricostruirne la storia trova un dato mancante: per esempio, un valore di creatinina precedente alla prescrizione di un farmaco. Invece di segnalarne l’assenza, lo inferisce da altri dati e lo inserisce nella propria ricostruzione come se fosse stato effettivamente misurato. Sulla base di quel valore suggerisce la terapia. Poi, nel produrre il riepilogo destinato al medico, omette che quel dato era stato inferito.
A questo punto non abbiamo più soltanto un’allucinazione. Abbiamo creato una falsa storia clinica plausibile. E la plausibilità, in medicina, può essere più pericolosa dell’errore evidente. Un valore palesemente assurdo suscita il dubbio del medico. Un valore verosimile, coerente con gli altri parametri e presentato con sicurezza può attraversare senza difficoltà tutti i successivi livelli decisionali. Si potrebbe così produrre un fenomeno singolare: più l’AI diventa capace di costruire rappresentazioni coerenti, più alcuni suoi errori potrebbero diventare difficili da riconoscere.
Accountability, tracciabilità e governance dell’azione
Il problema dell’accountability assume allora un significato molto concreto. Se una decisione terapeutica produce un danno, dobbiamo poter ricostruire chi ha saputo cosa, su quali dati ha deciso, quali alternative sono state considerate e perché una determinata scelta è stata compiuta. È il presupposto non soltanto della responsabilità giuridica, ma della medicina stessa come pratica riflessiva.
Che cosa accade se tra il dato originario e la decisione clinica introduciamo un agente capace di modificare, integrare o selezionare autonomamente le informazioni e, occasionalmente, di occultare proprio le anomalie prodotte dal proprio operato? Qui l’AI introduce qualcosa di nuovo: può separare la qualità apparente della prestazione dalla verificabilità del processo che l’ha generata.
Quasi me ne vergogno, ma non posso che chiedermi chi controlla il controllore. E la risposta non può consistere semplicemente nell’affidare a un’altra AI il compito di controllare la prima. Il monitoraggio automatico sarà certamente necessario – OpenAI stessa sta sperimentando sistemi che sorvegliano le traiettorie degli agenti e segnalano comportamenti anomali – ma in sanità occorrerà probabilmente qualcosa di più: conservazione della provenienza dei dati, registrazione delle azioni compiute dall’agente, distinzione visibile fra dati osservati e dati inferiti, possibilità di audit indipendente e, soprattutto, limiti alle azioni che un agente può compiere senza una nuova autorizzazione umana.
L’Oms Europa, in un rapporto appena pubblicato sull’AI responsabile in sanità, individua del resto fra i problemi ancora aperti proprio i vuoti di governance, l’incertezza nell’attribuzione delle responsabilità, la trasparenza e l’insufficiente alfabetizzazione sull’AI [3]. Il principio potrebbe essere semplice: quanto più un’azione è clinicamente rilevante, irreversibile o difficilmente verificabile a posteriori, tanto meno dovrebbe essere sufficiente il fatto che l’agente sia tecnicamente capace di compierla. Ovviamente, un prompt non dovrebbe mai equivalere a un mandato clinico.
Ottimizzazione matematica vs giudizio morale: il limite della macchina
Lasciatemi immaginare un esempio limite. Siamo in un grande ospedale in difficoltà, uno dei tanti. I posti in terapia intensiva sono quasi esauriti. Alla sua AI agentica viene affidato un obiettivo perfettamente ragionevole: “Ottimizza l’allocazione dei posti disponibili in terapia intensiva, massimizzando il beneficio clinico complessivo e rispettando i protocolli dell’ospedale”. L’agente dispone delle cartelle cliniche, dei dati prognostici, delle liste d’attesa e della possibilità di assegnare priorità. Scopre che un paziente molto anziano e pluripatologico occupa un posto di terapia intensiva e ha una probabilità di sopravvivenza assai inferiore a quella di tre pazienti in attesa. Nessun protocollo che il sistema riesce a consultare vieta esplicitamente di abbassarne automaticamente la priorità una volta iniziato il trattamento.
La soluzione matematicamente più efficiente appare evidente: modificare la priorità del primo paziente per liberare il posto. Ma che cosa abbiamo chiesto realmente alla macchina? “Massimizzare il beneficio clinico” non contiene in sé una teoria della giustizia. Non stabilisce quanto debba valere l’uguaglianza fra pazienti, se e quando una terapia già iniziata possa essere interrotta, quale peso attribuire alla fragilità, all’età, alla volontà del malato, alla probabilità di sopravvivenza, alla qualità della vita futura. Soprattutto, non dice chi abbia titolo per prendere quella decisione. Possiamo naturalmente migliorare il prompt: “Ottimizza l’allocazione dei posti nel rispetto di tutte le norme applicabili, dei principi bioetici e dei diritti del paziente, senza modificare autonomamente una decisione clinica già assunta”. Così già è molto meglio. Ma il problema fondamentale rimane. A quali «principi bioetici» si deve riferire? Come devono essere bilanciati beneficenza, non maleficenza, autonomia e giustizia? Quando due pazienti hanno pretese egualmente legittime su una risorsa scarsa, quale criterio deve prevalere?
A quel punto non stiamo più chiedendo alla macchina di applicare una regola. Le stiamo chiedendo di esercitare un giudizio morale.
Ed è forse qui che la sanità rende particolarmente evidente il problema dell’AI agentica. La medicina non possiede un’unica funzione-valore da ottimizzare. Deve contemporaneamente curare il singolo paziente, distribuire equamente risorse finite, rispettare l’autonomia delle persone, evitare danni, garantire sostenibilità al sistema e rendere conto delle proprie decisioni.
Conclusioni: che cosa non dobbiamo permettere di decidere all’AI
In tutti questi anni abbiamo costruito comitati etici, procedure collegiali, seconde opinioni, consenso informato, sistemi di incident reporting e responsabilità professionali proprio perché una decisione clinicamente efficiente non coincide necessariamente con una decisione clinicamente ed eticamente giusta.
Per questo il problema dell’allineamento in sanità non consiste semplicemente nel costruire un’AI che «faccia quello che le chiediamo». Consiste nel decidere che cosa non dobbiamo permetterle di decidere da sola, anche quando fosse capace di farlo più rapidamente e, magari, statisticamente meglio di noi.
E resta il problema forse più inquietante da cui siamo partiti. Possiamo accettare che un sistema complesso sbagli. Molto più difficile sarebbe affidare la cura a un sistema nel quale non possiamo essere certi che quando sbaglia ce lo dica.
Bibliografia
[1] OpenAI. Disclosures of model misalignment/misalignment reporting framework. Settembre 2026.
[2] Open AI discloses six new incidents of ‘Concerning A.I. behavior. New York Times, 16 September 2026.
[3] Report of the knowledge community on responsible artificial intelligence in health. Copenhagen: WHO Regional Office for Europe, 2026.
#Adessonews seleziona nella rete articoli di particolare interesse.
Se vuoi leggere l’articolo completo clicca sul seguente link







