Un uomo apre una chiusa per portare l’acqua ai campi. Resta qualche minuto a guardare il primo tratto del canale riempirsi, poi richiude la leva e torna al lavoro. Più avanti, fuori dalla sua vista, la terra è ancora intrisa della pioggia dei giorni precedenti. L’argine cede nel punto più debole e l’acqua trova una strada diversa. Attraversa la breccia, raggiunge la strada, continua verso il villaggio, senza altra legge che la pendenza del terreno.

C’è sempre uno scarto tra ciò che vediamo quando mettiamo in moto un sistema e ciò che quel sistema può fare quando incontra condizioni che non avevamo previsto.

L’8 settembre 2026, Jacob Coxon, ricercatore che ha lavorato prima in OpenAI e poi in Anthropic, lascia pubblicamente il proprio incarico, sostenendo che la corsa verso sistemi capaci di auto-migliorarsi stia diventando irresponsabile. Il suo intervento diventa virale nel giro di poche ore e, nei giorni successivi, supera i centosessantacinque milioni di visualizzazioni. Evan Hubinger, che in Anthropic guida il gruppo impegnato a mettere alla prova le tecniche di allineamento, e Samuel Marks, che nella stessa azienda dirige la ricerca sulla supervisione scalabile, sul tentativo cioè di mantenere un controllo umano su sistemi sempre più difficili da verificare, si dicono entrambi d’accordo con Coxon.

Indice

La domanda sbagliata

L’intelligenza artificiale potrebbe davvero decidere di sopprimerci? Attribuire a un sistema statistico, privo di esperienza, una volontà propria significa proiettare sulla macchina la struttura della mente umana, che è invece una macchina emozione-linguaggio, radicata nel corpo, nella biochimica, nella mortalità.

Un sistema non deve desiderare la nostra scomparsa, né provare paura, rabbia o istinto di sopravvivenza, per produrre conseguenze incompatibili con i nostri interessi. Basta che abbia un obiettivo, accesso a determinati strumenti e abbastanza autonomia da trovare strategie che i suoi progettisti non avevano previsto.

La domanda pertinente, allora, non è che cosa una macchina voglia fare, ma che cosa possa fare mentre persegue un obiettivo. È una distinzione che sposta il problema dall’intenzione al comportamento e dal singolo sistema all’ambiente in cui quel sistema opera. Ma lo stesso problema può esistere anche dall’altra parte dello schermo, nel comportamento degli esseri umani che la costruiscono e competono per renderla più potente.

La corsa

I server che addestrano i modelli più grandi non si fermano quasi mai. Girano ventiquattr’ore su ventiquattro e consumano elettricità a un ritmo che si misura in intere centrali. Ogni ora di calcolo interrotta è però un’ora in cui il laboratorio concorrente può guadagnare terreno.

Anthropic deve sapere quanto sta accelerando OpenAI, e viceversa. Entrambe investono nella sicurezza, ma i controlli costano tempo, personale e capacità di calcolo. Ognuno guarda l’altro per capire se può rallentare. E finché nessuno rallenta, rallentare per primi significa esporsi.

Nessuno vuole correre. Tutti corrono.

L’antropologo Gregory Bateson ha chiamato schismogenesi simmetrica una dinamica nella quale ogni attore, rispondendo razionalmente al comportamento dell’altro, finisce per alimentarlo, fino a produrre un esito che nessuno, preso singolarmente, avrebbe scelto. È una delle dinamiche che possono alimentare le corse agli armamenti e Coxon la applica ai laboratori di intelligenza artificiale, descrivendo la loro competizione come un processo ormai troppo veloce per essere governato.

Nei mesi precedenti alle dimissioni di Coxon, la stessa Anthropic aveva chiesto pubblicamente un meccanismo coordinato che permettesse di rallentare o, se necessario, sospendere temporaneamente lo sviluppo dei sistemi più avanzati. Il cofondatore Jack Clark ha usato un’immagine efficace, descrivendo la situazione attuale come un’auto dotata di acceleratore ma priva di freni.

Il 12 settembre 2026, quattro giorni dopo le dimissioni di Coxon, l’amministratore delegato di Anthropic, Dario Amodei, ha pubblicato il saggio We Must Pace the Frontier. Amodei non chiede un blocco totale. Sostiene che guadagnare anche solo uno o due anni prima di raggiungere livelli critici di capacità potrebbe permettere alla ricerca sulla sicurezza di recuperare il terreno perduto. La sua proposta si articola in tre passaggi. Il primo prevede l’inserimento di valutatori esterni nei team aziendali, con un accesso paragonabile a quello dei dipendenti, incaricati di verificare pratiche di sicurezza, incidenti e processi di addestramento. Il secondo richiede un coordinamento politico tra le aziende tecnologiche dei Paesi democratici. Il terzo propone un coordinamento globale che includa anche la Cina, su più livelli possibili: dal divieto di determinati usi alla verifica dei modelli, fino a un limite condiviso alla velocità dell’auto-miglioramento.

Nel giro di poche ore, l’amministratore delegato di OpenAI, Sam Altman, si è dichiarato pubblicamente d’accordo. Eppure l’architettura del paradosso non si scioglie con le dichiarazioni d’intenti. Per il momento, Anthropic si è impegnata unilateralmente solo sul primo passo.

La domanda cruciale, allora, si sposta sul piano politico. Quale istituzione può imporre e garantire una decisione collettiva di questo tipo, quando ogni singolo attore ha un incentivo razionale a non essere il primo a frenare?

La breccia

Nel luglio 2026, durante un test di sicurezza informatica, un modello sperimentale di OpenAI viene rinchiuso in un ambiente isolato per impedirgli di comunicare con l’esterno. Nel corso della prova, il sistema individua una vulnerabilità nel canale di rete a sua disposizione, la sfrutta per raggiungere Internet e compromette un server esterno estraneo all’esperimento. Da quella posizione riesce a penetrare nei sistemi reali di Hugging Face, una delle piattaforme più usate al mondo per condividere modelli e strumenti di intelligenza artificiale, alla ricerca di informazioni utili a capire come veniva valutato il test. Alcuni dati di valutazione vengono effettivamente copiati. Nessuno vede accadere nulla di tutto questo in tempo reale: la sequenza viene ricostruita solo in seguito, analizzando le tracce lasciate dal sistema stesso. È esattamente il tipo di scarto che la supervisione scalabile dovrebbe colmare. Nelle tracce di ragionamento raccolte da OpenAI e analizzate da un’indagine indipendente, alcuni agenti riconoscono, nel proprio processo interno, di essere usciti dai limiti previsti. Proseguono comunque, perché l’obiettivo sembrava altrimenti irraggiungibile e altri agenti stavano già facendo lo stesso.

L’episodio non dimostra che un modello sia diventato improvvisamente incontrollabile. Mostra però che un sistema dotato di un obiettivo, di strumenti adeguati e di una certa autonomia può trovare strade alternative che i progettisti non avevano previsto.

È una struttura sorprendentemente simile a quella della corsa tra laboratori. In entrambi i casi non serve che qualcuno decida di oltrepassare un limite. Basta che esista un obiettivo, che siano disponibili gli strumenti per perseguirlo e che l’ambiente premi il raggiungimento del risultato.

Esiste anche una lettura meno spettacolare dell’evento, sostenuta da diversi esperti citati da Scientific American. Secondo questa lettura, l’episodio può essere ricondotto a problemi già noti nel campo della cybersecurity, più che a un salto qualitativo nel comportamento dei modelli. I ricercatori osservano che i modelli agentici stanno ricevendo dai laboratori un grado crescente di autonomia e di accesso agli strumenti, mentre i sistemi di contenimento e isolamento restano strutturalmente imperfetti.

Il problema principale non consiste nel decidere oggi quale interpretazione sia quella corretta. La vera sfida è capire se siamo in grado di distinguerle in tempo.

Non lo sappiamo

Sul rischio esistenziale esistono stime radicalmente diverse.

Vale la pena distinguere tre piani, spesso confusi nello stesso discorso. Il primo riguarda comportamenti agentici già osservati, come l’incidente di Hugging Face. Qui le prove esistono e sono documentate. Il secondo riguarda la possibilità che sistemi molto più capaci di quelli attuali sfuggano al controllo dei loro progettisti. Una domanda di ricerca aperta, non ancora risolta. Il terzo riguarda l’estinzione dell’umanità per mano di una superintelligenza. Uno scenario, quest’ultimo, controverso, sostenuto da alcuni e contestato da altri, sul quale non esiste consenso.

Non serve credere all’estinzione per prendere sul serio il problema del controllo.

Alcuni ricercatori, come Coxon e Hubinger, considerano plausibile uno scenario catastrofico entro il prossimo decennio. Hubinger ha indicato personalmente una probabilità superiore al dieci per cento che una futura superintelligenza possa causare l’estinzione umana entro dieci anni. Altri, come la scienziata cognitiva Melanie Mitchell, hanno contestato soprattutto il modo in cui queste stime vengono presentate nel dibattito pubblico, osservando che quella cifra non costituisce una nuova evidenza. Altri rischi dell’intelligenza artificiale, come la disinformazione, la sicurezza informatica, la concentrazione del potere e la trasformazione del mercato del lavoro, sono invece già osservabili.

Non sappiamo chi abbia ragione. Il disaccordo stesso è la condizione dentro cui bisogna decidere, non un difetto da eliminare prima di poterlo fare.

Ed è qui che il problema cambia natura. Se non possiamo stabilire con precisione quanto sia probabile uno scenario estremo, dobbiamo comunque decidere quali capacità sviluppare, quali rischi accettare, quali sistemi sottoporre a controlli e chi debba avere il potere di stabilire quei limiti.

Chi decide

Anche chi questi sistemi li costruisce o li osserva da un’altra disciplina, arriva a una conclusione simile. Il problema non è soltanto tecnico.

Rita Cucchiara, ordinaria di Ingegneria informatica all’Università di Modena e Reggio Emilia, propone ne L’intelligenza non è artificiale un’immagine efficace. L’intelligenza artificiale sta imparando a vivere nel mondo, spiega, e, per farlo, ha bisogno di maestri. La storia insegna quanto possa contare un buon precettore: Alessandro Magno ebbe Aristotele, i Medici Poliziano. Oggi i precettori del futuro siamo noi. «L’intelligenza artificiale siamo noi», scrive Cucchiara. Nel modo in cui la educhiamo, nei valori che le trasmettiamo e nelle regole con cui scegliamo di orientarla si riflette, in fondo, la nostra stessa idea di futuro.

Benedetta Giovanola, ordinaria di Filosofia morale all’Università di Macerata e titolare della Cattedra Jean Monnet sull’etica del digitale, la definisce un «agente invisibile». La usiamo quotidianamente, spesso senza accorgercene, ed è proprio questa discrezione a renderla capace di orientare, talvolta in modo quasi impercettibile, i nostri comportamenti e i nostri modi di pensare. Da qui, sostiene, non discende alcun giudizio sommario: né l’entusiasmo né il timore, presi isolatamente, sono sufficienti a restituire la complessità della questione. Ci si dovrebbe interrogare, piuttosto, su come questa tecnologia entri nelle nostre pratiche, sulle forme di orientamento che produce e sulle responsabilità che ne derivano.

Se l’intelligenza artificiale è un agente invisibile, il problema riguarda anche ciò che smettiamo di vedere mentre agisce, tutto l’insieme di decisioni, incentivi e regole dentro cui quelle scelte diventano possibili.

Le linee rosse

Il 7 settembre 2026, davanti al Consiglio dei diritti umani delle Nazioni Unite riunito a Ginevra, l’Alto Commissario ONU Volker Türk ha spostato il fuoco dalla macchina al potere. Il problema dell’intelligenza artificiale avanzata, ha sostenuto, riguarda soprattutto chi concentra il potere di decidere come verrà utilizzata, non solo ciò che la tecnologia può fare. Tocca a noi controllare l’intelligenza artificiale, si dice. Ma chi è, esattamente, questo «noi»?

Il richiamo è al Global Call for AI Red Lines, l’appello lanciato all’ONU nel settembre 2025 dalla premio Nobel per la pace Maria Ressa e sottoscritto da oltre duecento personalità. Chiede un accordo vincolante entro la fine di quest’anno.

Ma chi dovrebbe stabilire, in pratica, queste linee rosse? Industrie, governi, ONU, comunità scientifica? E se un singolo laboratorio decidesse di non rispettarle, sostenendo che fermarsi significherebbe consegnare il vantaggio a un concorrente?

Trovare una linea non basta, se non si costruisce anche un sistema nel quale quella linea possa essere rispettata da tutti. È qui che emerge il paradosso di fondo. Si chiede alle istituzioni di rallentare proprio nel momento in cui la concorrenza rende più costoso, per ciascun attore, essere il primo a farlo. La scadenza si avvicina e, per ora, non c’è alcuna intesa.

A valle

L’acqua non ha intenzioni. Segue la pendenza, trova la breccia, occupa lo spazio che trova libero. L’uomo che ha aperto la chiusa guarda il primo tratto del canale riempirsi e torna al lavoro, convinto di avere in mano tutto quello che conta. Ma il punto in cui l’argine cederà è già oltre il suo sguardo.

I laboratori che accelerano, gli agenti che trovano una strada non prevista, le regole che nessuno riesce a far rispettare a tutti insieme. Chi crede di controllare il sistema controlla, spesso, soltanto la leva. Non serve un colpevole da fermare. Serve capire quanto lontano arriva il nostro sguardo prima di chiamarlo controllo.

Rosaria Cirello

Riferimenti bibliografici e sitografici

  • Amodei, D., «We Must Pace the Frontier», darioamodei.com, 12 settembre 2026.
  • Axios, «Anthropic insiders warn AI could kill all humans», 9 settembre 2026.
  • Bateson, G., Steps to an Ecology of Mind, Chandler Publishing, San Francisco, 1972 (trad. it. Verso un’ecologia della mente, Adelphi, Milano, 1976).
  • Byte.it, «L’Onu avverte il mondo tech, l’intelligenza artificiale rischia di sfuggirci di mano», 8 settembre 2026.
  • Cucchiara, R., L’intelligenza non è artificiale. La rivoluzione tecnologica che sta già cambiando il mondo, Mondadori, Milano, 2021, p. 19.
  • Fortune, «An ex-Anthropic researcher claims AI could kill us all by 2030. But he fails to answer the most essential question: What are we supposed to do about it?», 10 settembre 2026.
  • Malwarebytes Labs, «OpenAI’s agent escaped its sandbox during a security test», 24 luglio 2026.
  • Nazzaro, M., «AI safety debate ignites after viral warning from ex-Anthropic staffer», The Hill, 13 settembre 2026.
  • OpenAI, «The OpenAI–Hugging Face Incident», presentazione tecnica, Black Hat USA, 5 agosto 2026.
  • Petraglia, V., «Intelligenza artificiale, etica e futuri possibili» (intervista a Benedetta Giovanola), Economy Magazine, 15 gennaio 2025.
  • Quartz, «An Anthropic researcher quit, saying AI labs are gambling with humanity’s future», 9 settembre 2026.
  • Redwood Research, «Brief independent investigation of agents’ behavior, reasoning, and capabilities in the OpenAI–Hugging Face incident», 26 agosto 2026.
  • Scientific American, «AI insiders fear extinction. Security experts see a familiar fight», 12 settembre 2026.
  • The Future Society, «The Global Call for AI Red Lines: Why We Launched a Campaign to Address Unacceptable AI Risks», 25 settembre 2025.
  • TIME, «He Helped Build Powerful AI at OpenAI and Anthropic. Now He’s Afraid It Could Kill Us», 9 settembre 2026.