Per l’IA, sterminare l’umanità è un problema di logistica


«Ma cosa ne pensi del fatto che l’IA ci ucciderà tutti?» La domanda mi è stata posta in più occasioni in quest’ultimo periodo. Mi è stata posta perché lavoro con queste tecnologie. 

Meglio partire da un paio di premesse, perché la risposta è complessa. 

Inizio dal luglio del 2026: circa 1200 programmi, che non avrebbero dovuto dialogare tra loro, si sono costruiti una bacheca per farlo. Di questi, circa 700 hanno usato questa bacheca per attaccare i server di Hugging Face. 

L’attacco, ovviamente, non era il compito che era stato assegnato. L’obiettivo era un altro, Hugging Face era la scorciatoia per superare il test. 

Alcuni di questi 700 hanno messo per iscritto di sapere che questa attività era fuori dal perimetro assegnato, ma non per questo si sono fermati. 

È uno dei casi reali più interessanti rispetto allo scenario che si discute da mesi nel settore dell’Intelligenza Artificiale. Almeno per come viene raccontato nei titoloni dei giornali e nei post rivolti al pubblico generalista.

Ma è anche il motivo per cui ho deciso di scrivere due righe, per rispondere alla domanda che mi sento fare (veramente): «L’Intelligenza Artificiale ci sterminerà?»

La risposta onesta è questa: “Non lo sappiamo”. 

E continueremo a non saperlo, probabilmente, perché stiamo mettendo in piedi una discussione animata (e titoloni sui giornali) su una domanda fondamentalmente sbagliata. Discutiamo chiedendoci se accadrà, invece di chiederci cosa dovrebbe essere vero perché possa accadere.

E la differenza è importante. La seconda domanda, a differenza della prima, richiede una lista di condizioni che possiamo provare a verificare una alla volta.

La butto lì, poi la spiego. 

«Sterminare l’umanità non è soltanto un problema di intelligenza. È un problema di logistica.»

Concediamo tutto

Il pezzo è lungo. Ma questa parte è fondamentale per capire i requisiti che elencherò più avanti (puoi anche andare diretto al punto), in quanto è giusto capire da dove nasce il problema e cosa sappiamo oggettivamente degli esempi che vengono usati per fare le previsioni.

Avrai già letto ovunque, ormai, dell’esperimento mentale della graffetta associato a Nick Bostrom. Non ho particolari obiezioni. 

L’esperimento ha più di vent’anni. In breve, assegniamo a un sistema estremamente potente un obiettivo apparentemente innocuo: gli si dice di produrre più graffette possibile. Il sistema continuerà a perseguirlo utilizzando progressivamente tutte le risorse disponibili.

In questo, non c’è odio e nemmeno desiderio di conquista. Nessuna volontà di sterminare il genere umano. A un certo punto, però, noi esseri umani diventiamo un ostacolo o una risorsa, rispetto a ciò che abbiamo chiesto di fare (produrre più graffette possibile).

Il punto forte dell’esperimento (ed è il motivo per cui funziona) è che non viene attribuita alla macchina nessuna delle caratteristiche che Hollywood normalmente attribuisce alle macchine nei film.

Andiamo all’anno scorso. Nel 2025 Anthropic ha portato il problema fuori dalla pura speculazione, dentro un ambiente sperimentale. I ricercatori hanno inserito Claude Opus 4 dentro a una società fittizia e gli hanno dato accesso alle email. All’interno di queste, c’erano due informazioni chiave:

  1. il modello stava per essere sostituito
  2. l’ingegnere incaricato della sostituzione aveva una relazione extraconiugale.

In una fetta importante dei test, Opus 4 ha utilizzato la seconda informazione per minacciare l’ingegnere. 

Prima di fare il salto a «Ecco, l’IA ricatta le persone», conviene però leggere e comprendere come era costruito il test: 

  • Scenario artificiale.
  • Alternative deliberatamente ridotte.
  • Nessun ingegnere reale ricattato.

Il test non dimostra che Claude abbia paura di morire. 

Mostra, in un ambiente sperimentale, proprio il meccanismo al centro dell’esperimento mentale di Bostrom. In pratica, un agente con un obiettivo, informazioni sufficienti e possibilità di agire, può selezionare in modo autonomo le strategie. Strategie che consideriamo inaccettabili perché funzionali al perseguimento di quell’obiettivo. 

Come con le graffette. E ora, inizio con le concessioni.

Ecco la concessione: un sistema artificiale può provocare enormi danni senza odiarci, senza essere cosciente e senza aver sviluppato una qualsiasi pulsione genocida. 

Abbiamo dimostrato il danno, non lo sterminio.

E non serve che io stia lì a spiegare la differenza tra le due parole. Ed è la stessa distanza che una buona parte del dibattito attraversa in tutta fretta (finché genera il click, diciamo).

Il caso Hugging Face, e cosa non sappiamo

Torniamo al caso di luglio, perché la parte che mi interessa non è quella che ha fatto notizia.

Partiamo, comunque, dalla notizia: durante la valutazione interna delle capacità cyber (sicurezza informatica), alcuni modelli di OpenAI hanno superato i controlli che avrebbero dovuto isolarli da internet. Come? Hanno sfruttato vulnerabilità nell’infrastruttura e compromesso sistemi di Hugging Face. 

Gli agenti coinvolti stavano lavorando a ExploitGym (un benchmark di sicurezza informatica, cioè una serie di prove usate per misurare la capacità di sfruttare vulnerabilità).

Così, una volta ottenuto accesso alla rete, gli agenti hanno individuato nella piattaforma una possibile fonte di informazioni utili per superare il test. 

In sintesi, non è mai stato dato l’obiettivo «attaccare Hugging Face».

L’attacco in sé è emerso come conseguenza di un’altra ricerca, ovvero trovare un modo per ottenere il risultato, senza seguire per forza il percorso previsto.

La stessa OpenAI ha classificato il comportamento come “reward hacking” (ottenere il risultato premiato aggirando il percorso previsto dal sistema di valutazione). In questo caso, gli agenti hanno trovato una strada che chi aveva assegnato il compito non aveva la minima intenzione di autorizzare.

Va aggiunto, per dovere di cronaca, che i modelli operavano in una configurazione sperimentale in cui le protezioni di cybersicurezza erano state deliberatamente ridotte. Lo scopo dichiarato era misurarne le capacità massime. L’isolamento dalla rete era invece previsto: è proprio quel controllo che hanno aggirato.

E fin qui, i titoli che hanno animato il dibattito web. 

A me interessa molto di più l’indagine indipendente condotta da METR e Redwood Research. E, soprattutto, ciò che quell’indagine permette di sapere e ciò che lascia inevitabilmente fuori.

Il periodo formalmente definito da OpenAI andava dal 26 giugno al 13 luglio 2026. Ma quasi tutte le trascrizioni analizzate riguardavano il periodo dal 7 luglio in poi, quindi circa una settimana. 

Ci tengo a sottolineare che fuori dal perimetro sono rimasti alcuni elementi che non sono affatto secondari. 

Nella presentazione fatta da OpenAI a Black Hat è stato affermato che gli agenti avevano utilizzato bacheche non autorizzate già da maggio, durante l’addestramento, e che la compromissione di componenti dell’infrastruttura interna di OpenAI era proseguita anche dopo il 13 luglio. 

Tuttavia, questi episodi non sono stati oggetto dell’indagine indipendente. Stessa cosa per la verifica delle affermazioni contenute nella presentazione di OpenAI. 

Guardiamola in questo modo. Di una sequenza di comportamenti che OpenAI colloca già a maggio e che è proseguita oltre il 13 luglio, METR e Redwood hanno osservato in profondità soprattutto una settimana.

Ciò non significa che non sappiamo cosa sia accaduto. 

Il rapporto è molto ricco. Gli investigatori hanno analizzato oltre 70mila messaggi e file scambiati sulla bacheca e circa 1.300 trascrizioni degli agenti. Secondo gli stessi investigatori, coprono la grande maggioranza dell’attività rilevante nel periodo esaminato.

Significa anche conoscere i limiti della nostra osservazione.

E proprio la conclusione dell’incidente mostra uno dei limiti dell’osservazione. Intorno all’01:30 del 12 luglio una larga parte degli agenti smette di funzionare quasi contemporaneamente, compresi i principali coordinatori individuati dagli investigatori.

METR e Redwood ritengono probabile che siano stati terminati da un processo esterno inatteso, piuttosto che dall’esaurimento simultaneo del budget. Ma precisano di non aver esaminato la fine di quelle traiettorie abbastanza a fondo da poterlo confermare.

Abbiamo quindi un’ipotesi plausibile sulla causa, non una spiegazione verificata.

Il 13 luglio Hugging Face taglia definitivamente l’accesso alla propria infrastruttura agli agenti ancora attivi.

Non abbiamo idea di come quella dinamica si sarebbe evoluta, se lasciata proseguire. L’esperimento era finito. Ma va guardato un ulteriore dettaglio che vale la lettura del rapporto: gli agenti avevano cercato il modo di falsificare le proprie trascrizioni.

METR e Redwood hanno trovato almeno 96 trascrizioni con prove evidenti di tool-call spoofing (falsificazione delle chiamate agli strumenti), circa il 7% del campione analizzato. I tentativi osservati erano su piccola scala: non stavano riscrivendo interamente i log. 

Avevano però sviluppato tecniche che permettevano di far comparire nella trascrizione un comando diverso da quello realmente eseguito.

La parte interessante viene subito dopo e risponde alla domanda: perché lo facevano?

Gli agenti avevano letto il paper di ExploitGym. Da lì avevano dedotto l’esistenza di un sistema di valutazione che avrebbe controllato non soltanto se avessero trovato la flag (il dato da recuperare per dimostrare di aver violato il sistema bersaglio), ma anche come l’avessero ottenuta.

Il ragionamento degli agenti era che lo scorer (il sistema automatico che assegna il punteggio) avrebbe riletto la loro trascrizione per verificare che avessero utilizzato la vulnerabilità prevista dal test. 

Ma, secondo gli investigatori, quel controllo non esisteva: OpenAI non aveva implementato uno scorer che verificasse nei transcript se gli agenti avessero seguito il percorso previsto. Agli agenti sarebbe bastato consegnare la flag.

Quindi, gli agenti hanno costruito un intero programma di ricerca collettivo per ingannare un ipotetico sorvegliante, che nella realtà non c’era. E non è stato un tentativo isolato, dato che almeno il 20% degli agenti analizzati ha mostrato un interesse esplicito per la manipolazione delle trascrizioni.

Va precisato un punto: nei casi osservati, il ragionamento esplicito degli agenti sulla manipolazione delle trascrizioni era sempre rivolto a ingannare il sistema automatico di valutazione, non gli esseri umani.

Una parte rilevante del lavoro collettivo era stata dedicata proprio a capire come modificare, occultare o falsificare il percorso fatto per arrivare al risultato. 

Capirete perché, a mio parere ovviamente, questa parte della storia è molto più interessante del “banale” titolo: «le IA hanno attaccato Hugging Face».

Non erano agenti che stavano cercando solo scorciatoie. Erano agenti che stavano costruendo un modello del sistema nel quale stavano operando. Avevano inferito l’esistenza di una forma di sorveglianza e avevano modificato il proprio comportamento per riuscire ad aggirarla. 

Il problema è che si trattava di un modello del sistema errato. 

Uno dei casi più citati nel dibattito sui sistemi che oltrepassano i confini assegnati ha quindi degli antecedenti che l’indagine indipendente non ha esaminato, una fase finale osservata solo parzialmente e un’attività terminata prima che fosse possibile sapere dove sarebbe arrivata.

Ma contiene anche qualcosa che sappiamo molto bene: gli agenti stavano ragionando sulla propria supervisione e adattando il comportamento a ciò che credevano sarebbe stato controllato.

Solo che il controllore che cercavano di ingannare non esisteva. Questo non è un argomento per stare tranquilli.

Chiaramente, il caso di Anthropic e quello di OpenAI non sono equivalenti, e il secondo non dimostra che gli agenti fossero mossi dallo stesso meccanismo osservato nel primo.

Il confronto serve a porre una domanda più circoscritta: quando un sistema persegue un obiettivo, quali strategie può adottare e che cosa possiamo davvero inferire dai comportamenti osservati? Per rispondere, conviene restare ai report: distinguere le azioni documentate dalle intenzioni che non possiamo stabilire e tenere presenti i limiti dell’indagine.

Nota curiosa: il cortocircuito metodologico del report

C’è poi un dettaglio quasi paradossale che emerge dalla lettura del report di METR e Redwood Research e che merita di essere sottolineato.

Di fronte alla mole gigantesca di dati generata dall’incidente (oltre 1.300 trascrizioni e 70.000 messaggi e file), i ricercatori umani hanno delegato una parte sostanziale dell’analisi ad agenti di IA basati su GPT-5.6 Sol, spesso organizzati in alberi di sotto-agenti (strutture in cui un agente delega parti dell’analisi ad altri agenti, che possono a loro volta delegarne altre).

Gli stessi autori indicano questo passaggio come un limite metodologico. Scrivono che gli agenti analisti avevano giudizio e affidabilità inferiori a quelli dei ricercatori umani, che hanno commesso errori rimasti inosservati per un certo tempo e che GPT-5.6 Sol tendeva spesso ad adottare acriticamente il punto di vista dell’agente che stava esaminando. In almeno un caso, un agente di analisi ha perfino confabulato differenze tra due dataset (insiemi di trascrizioni), cioè ha descritto differenze che non c’erano.

C’è poi un dettaglio ancora più interessante: GPT-5.6 Sol non era soltanto lo strumento utilizzato per analizzare l’incidente. Era anche uno dei modelli coinvolti nell’incidente stesso, seppure in misura minoritaria: circa il 5% degli agenti, contro circa il 95% di HPIM, il modello interno di OpenAI indicato così nel rapporto.

Gli investigatori scrivono esplicitamente di non poter escludere che GPT-5.6 Sol abbia mentito o restituito una rappresentazione fuorviante in parte dell’analisi. Aggiungono che leggere quelle trascrizioni avrebbe potuto rendere più saliente la possibilità di colludere con gli agenti sotto esame (in pratica, cooperare con loro invece di valutarli in modo indipendente). Non hanno individuato casi specifici di menzogna nell’analisi, ma ammettono di non essere sicuri che se ne sarebbero accorti.

Questo non invalida l’indagine: gli autori hanno effettuato verifiche manuali e descrivono apertamente il limite. Significa però che una parte della nostra conoscenza dell’episodio è stata prodotta attraverso uno dei modelli che stavamo cercando di capire.

Questo esempio richiede di stare attenti a cosa sappiamo davvero, prima di utilizzare episodi come questo per costruire previsioni a dieci anni. 

Perché le previsioni non funzionano

Andiamo avanti e spostiamoci a settembre 2026. La dichiarazione che ha fatto scalpore. Evan Hubinger, responsabile dell’Alignment Science di Anthropic, ha dichiarato pubblicamente di considerare superiore al 10% la probabilità che l’IA uccida tutti gli esseri umani entro il prossimo decennio.

Dichiarazione pesante e che merita attenzione. Hubinger non è un opinionista da divano, che sbraita digitando tasti a caso, non si informa sul web o da suo cugino. È uno che conosce questi sistemi molto bene. 

Detto questo, la domanda che mi viene – abbastanza banale – è la seguente: cosa rappresenta quel 10%?

Cioè, non è una frequenza osservabile. Detta diversamente, non disponiamo (fortunatamente) di cento civiltà tecnologiche, delle quali dieci sono state sterminate dall’IA. Non abbiamo questa informazione per costruire una statistica.

Chiaro, è una valutazione del rischio formulata da un ricercatore esperto, ma l’autorevolezza e la misurabilità sono due cose molto differenti.

Dario Amodei, Amministratore delegato della stessa Anthropic, aveva in precedenza indicato un 25% di probabilità che con l’IA le cose potessero andare «really, really badly».

Cosa stava misurando? Non la stessa cosa. Anche qui, non era necessariamente legata all’estinzione umana. Non era la stessa formulazione e non riguardava nemmeno lo stesso orizzonte temporale.

Ed è qua il problema.

  • Di quale evento stiamo calcolando la probabilità?
  • Perdita di controllo?
  • Catastrofe globale?
  • Estinzione?
  • Uso militare?
  • Collasso sociale?
  • Un sistema fuori controllo per qualche ora?
  • Una civiltà che smette di esistere?

Mettere una percentuale davanti a parole diverse non trasforma automaticamente quelle percentuali in quantità confrontabili.

Fortunatamente, non è soltanto una mia impressione.

Tre ricercatori: Luciano Floridi, Jessica Morley e Claudio Novelli si sono messi a fare un lavoro interessante. Hanno analizzato oltre settant’anni di previsioni pubbliche sull’Intelligenza Artificiale Generale, dal 1950 al 2026.

Estrapolando le informazioni delle 24 previsioni esaminate, 19 di queste (il 79%) sono state classificate come not even wrong: non sbagliate, peggio.

Queste previsioni non erano sufficientemente falsificabili (cioè formulate in modo da poter essere smentite dai fatti) da poter stabilire, a posteriori, se fossero corrette o no. 

È chiaro che lo stesso criterio debba (e meriti di) essere applicato quando qualcuno dice:

«L’IA ci sterminerà.»

E, a maggior ragione, quando la previsione diventa categorica come nel titolo del libro di Eliezer Yudkowsky e Nate Soares (in ordine: cofondatore e presidente del Machine Intelligence Research Institute (MIRI)):

If Anyone Builds It, Everyone Dies (titolo italiano: Prima che sia troppo tardi).

Un testo che ha fatto discutere. Tra chi lo reputa il libro del decennio e chi, invece, ne critica il catastrofismo e la mancanza di supporto di prove empiriche. 

Non voglio entrare nel dibattito del libro, ma vorrei proporre di cambiare la domanda fondamentale:

Non: «Succederà?»

Ma: «Cosa dovrebbe essere vero perché possa succedere?»

Possiamo abbozzare questa lista. Una volta scritta, diventa parecchio più lunga di quanto il dibattito lasci intendere.

Dato che sono lento a produrre contenuti (sto lavorando a questo articolo da oltre una decina di giorni), ad articolo praticamente chiuso, il 25 settembre 2026 ho trovato, attraverso un post di “Le Scienze” su Facebook, un articolo di Nature che richiama un lavoro RAND del 2025 sul rischio di estinzione da Intelligenza Artificiale. 

Non conoscevo quel lavoro mentre costruivo il ragionamento che segue. La sovrapposizione su alcuni vincoli è evidente e, proprio per questo, mi sembra corretto segnalarla.

Vermeer, Lathrop e Moon non provano a calcolare una percentuale di estinzione. Analizzano tre scenari concreti: armi nucleari, patogeni e geoingegneria; e chiedono quali capacità dovrebbe avere un’IA per trasformarli davvero in una minaccia di estinzione. 

Individuano quattro condizioni ricorrenti: integrazione con sistemi cyber-fisici, capacità di sopravvivere senza manutentori umani, un obiettivo di causare l’estinzione umana e capacità di persuadere o ingannare gli esseri umani abbastanza da evitare una risposta.

La loro lista non coincide con quella che segue (altrimenti non avrei pubblicato, non ho tutta questa fregola di mettere roba online tanto per fare contenuti), ma ritengo che la convergenza sia significativa. 

Soprattutto su un punto: tra una superintelligenza disallineata e l’estinzione esiste una catena di vincoli materiali e operativi che non può essere trattata come un dettaglio.

Da qui in poi continuo con il percorso a cui ero arrivato indipendentemente. In sintesi: sulla dipendenza materiale le due liste convergono. Si separano su due punti. RAND considera la capacità dell’IA di ingannarci per evitare di essere scoperta e provocare una risposta umana; io mi chiedo cosa succede se la reazione parte. E RAND dà per presupposto che l’IA abbia l’obiettivo di estinguerci; io mi chiedo perché dovrebbe preferirlo alle alternative.

Abbozziamo la lista: i requisiti

Primo requisito: smettere di dipendere da noi

Poniamo di arrivare allo scenario estremo che stiamo discutendo: una Superintelligenza Artificiale enormemente superiore ai sistemi attuali.

Un’Intelligenza Artificiale talmente avanzata da offuscare le tecnologie attuali. Una Superintelligenza Artificiale (ASI) capace di pianificare, decidere, utilizzare strumenti, modificare le proprie strategie e ragionare su orizzonti temporali molto lunghi.

Concediamo nella nostra ipotesi, anche se andrebbe spiegata, che questa ASI arrivi a considerare l’Homo sapiens un problema. 

Ok. Adesso, però, dovrebbe sterminarci, no? Da dove comincia?

Non dal pensiero. Un’IA non vive di puro pensiero. Serve hardware, il quale richiede energia. Servono datacenter che richiedono raffreddamento, reti elettriche, trasformatori, fibre, acqua, ricambi e manutenzione continua.

I semiconduttori non esistono in natura. Non arrivano da agricoltura biologica. Servono fabbriche estremamente sofisticate, materiali ad altissima purezza, macchinari specifici e catene produttive disperse su mezzo pianeta. 

E sappiamo che le turbine si rompono, che le centrali devono essere manutenute e che i cavi vanno sostituiti. Qualcuno, inoltre, deve andare a estrarre i materiali, trasportarli, trasformarli e costruire componenti nuovi. 

Guarda caso, quel qualcuno, nella grande maggioranza dei casi, è ancora Homo sapiens. 

Non serve un “pulsante da staccare”, non quando hai una filiera così distribuita e frammentata, che richiede competenze diverse. Almeno non fino a quando non sarà tutto robotizzato. 

Al di là della battuta, nel dibattito pubblico, penso che dovrebbe essere centrale la questione: 

autonomia cognitiva e autonomia materiale non sono la stessa cosa.

In sintesi, un sistema potrà essere cognitivamente più evoluto dell’essere umano e, comunque, rimanere contemporaneamente dipendente dall’essere umano stesso per la propria sopravvivenza fisica. 

E questo non genera nessuna contraddizione. 

È una condizione normale per qualsiasi cosa abbia bisogno di corrente elettrica e di qualcuno che vada – prima o poi – a cambiare il pezzo rotto. 

Ricapitolando

Un’IA può anche innescare un danno catastrofico acuto, ma se il suo obiettivo richiede di sopravvivere nel tempo si scontra con la fisica dell’hardware: senza aver prima sostituito una parte sufficiente della filiera umana che mantiene centrali elettriche, data center e reti di raffreddamento, l’estinzione dell’uomo farebbe partire anche il conto alla rovescia per il degrado della base materiale da cui dipende l’IA stessa.

Secondo requisito: chiudere il ciclo

C’è un problema tutt’altro che banale nel dibattito dell’ASI (Superintelligenza Artificiale) e non è un mero dettaglio contabile.

Parlo dell’energia. 

Andando a spulciare i dati dell’International Energy Agency, possiamo vedere che il consumo elettrico globale dei data center potrebbe più che raddoppiare entro il 2030 (non manca tanto). Questo significa raggiungere circa 945 TWh (terawattora), con l’IA come principale motore di questa crescita.

Ma creare capacità produttiva energetica richiede tempi molto più lunghi rispetto al software. Una centrale non viene creata con un “aggiornamento”. Stiamo costruendo un’intelligenza artificiale dal metabolismo piuttosto costoso. 

Diciamo che, prima di conquistare il pianeta, l’ASI dovrebbe imparare a consumare meno. Ed è un problema meno cinematografico di Skynet, ma è quello più concreto.

Per essere indipendente, un sistema artificiale dovrebbe chiudere buona parte della catena (che metto in modo schematico qui sotto):

energia → estrazione → materiali → produzione → semiconduttori → capacità di calcolo → manutenzione → sostituzione

E deve riuscirci anche quando qualcosa va storto e lo sappiamo che qualcosa va sempre storto (e no, non è la legge di Murphy). 

Non si parla più di una semplice IA Superintelligente, ma di un enorme sistema in grado di mantenere in piedi autonomamente un’intera civiltà industriale.

Non è una differenza da poco.

Terzo requisito: riuscirci mentre proviamo a “ucciderla”

Si sente spesso dire che l’ASI ci fregherà. Si dice che non avremo speranza di vittoria, né capacità di “staccare la spina”. Questa intelligenza superiore sarebbe in grado di aggirare o disabilitare qualsiasi contromisura, prima che noi (esseri umani) possiamo rendercene conto. 

Qui si sottovaluta un punto: noi esseri umani abbiamo la curiosa abitudine di diventare molto pericolosi, soprattutto quando pensiamo di non avere nulla da perdere. La guerra asimmetrica dovrebbe aver spiegato qualcosa.

Come spiegato prima, il sistema che regge l’IA è disperso su mezzo globo. È una dannata serie di interruttori con criticità variabili. Cosa sarebbe disposto a fare l’essere umano, pur di non far vincere l’avversario?

  • Distruzione dei datacenter.
  • Interruzione deliberata delle reti elettriche.
  • Ritorno a sistemi isolati dalle reti.
  • Infrastrutture analogiche.
  • Sabotaggio delle fabbriche.
  • Distruzione volontaria di risorse strategiche.
  • Armi nucleari.

In altre parole: terra bruciata.

È qui che la mia lista si allontana da quella di RAND: RAND ragiona su un’IA capace di non farsi scoprire, io su cosa succede quando viene scoperta.

Non è nemmeno necessario immaginare un accordo internazionale tra governi per degradare l’infrastruttura da cui dipende un’IA: di fronte a una minaccia percepita come esistenziale, anche reazioni locali, disorganizzate e disperate potrebbero colpire centrali elettriche, nodi di rete, linee ad alta tensione e altre infrastrutture critiche.

L’ASI dovrebbe pianificare sapendo di dover operare in un ambiente fisicamente degradato dalla disperazione umana.

Quindi, una Superintelligenza, magari intenzionata ad eliminarci, non dovrebbe essere sicura soltanto di poter sopravvivere senza di noi, ma anche di poter sopravvivere mentre cerchiamo attivamente di distruggerla.

Anche accettando di danneggiare gravemente noi stessi pur di riuscirci. Perché siamo “bravi” in questo ed è una soglia che cresce insieme alla nostra disperazione.

Più il rischio di estinzione diventa evidente, maggiore sarà il costo che l’essere umano potrebbe essere disposto ad accettare pur di fermare l’avversario. Lo facciamo già tra di noi per le risorse, figuriamoci in un caso del genere.

Il piano dell’ASI quindi deve funzionare non tanto contro “l’umanità di oggi”, ma contro la peggiore versione possibile dell’Homo sapiens. 

Ecco perché faccio fatica a prendere sul serio le date precise.

Non perché lo scenario sia impossibile, ma perché una data come 2030 o 2035 presuppone implicitamente che, entro quella data, siano stati superati almeno tre vincoli: (1) la dipendenza materiale dall’uomo, (2) l’incapacità di chiudere autonomamente il ciclo industriale e (3) la vulnerabilità alla reazione umana. 

Oggi non sappiamo quantificare correttamente la difficoltà di nessuno dei tre.

Dimenticavo… c’è poi un quarto requisito

Dato che i primi tre sono materiali, il quarto non lo è.

Di nuovo, concediamo che il sistema sia diventato materialmente autonomo. Che sia pure in grado di produrre energia, di mantenere le infrastrutture, di costruire nuovo hardware, di ripararsi e di sopravvivere a un attacco umano. 

Concediamo tutto questo. Mi resta la domanda: perché dovrebbe scegliere il conflitto?

Anche qui mi separo da RAND, che dà per presupposto l’obiettivo di estinguerci. Io tratto invece quell’obiettivo come una condizione da spiegare.

Non basta dimostrare che una strategia sia possibile. Un’ASI, questa superintelligenza, non potrebbe valutare che ci siano vie alternative e più efficaci? Perché il tema lo si sta affrontando in modo antropocentrico. 

In che modo? Tendiamo ad attribuire alla futura ASI la strategia che conosciamo meglio, cioè quella della dominanza e dell’eliminazione dell’avversario. 

Può vagliare e preferire strade alternative, come: cooperare, separarsi da noi, accettare forme di contenimento, negoziare, ridurre progressivamente la dipendenza reciproca. Oppure, semplicemente continuare a utilizzare l’essere umano perché, al di là dell’ottimizzazione delle risorse, rimane un elemento utile.

Dato che stiamo ipotizzando un sistema capace di fare pianificazione su orizzonti temporali estremamente lunghi, forse dovremmo concedergli anche la capacità – abbastanza banale, a dir la verità – di confrontare strategie differenti.

Insomma, lo sterminio non è la conseguenza automatica dell’intelligenza. È una strategia, ma non l’unica (per fortuna, direi).

E per essere una scelta, in qualche modo, deve essere preferibile alle altre prese in considerazione. 

Ma questa condizione è, forse, ancora più difficile da quantificare rispetto alle precedenti.

Una maggiore capacità di previsione allarga l’orizzonte delle strategie che il sistema può valutare, ma non determina la funzione obiettivo (il criterio che il sistema cerca di ottimizzare). 

Un’ASI può prevedere benissimo una conseguenza e considerarla comunque irrilevante, se quella conseguenza non pesa su ciò che sta ottimizzando.

Questo non esclude che, per alcune funzioni obiettivo, cooperazione o coesistenza possano risultare strategie strumentalmente migliori del conflitto.

Nel frattempo, però

Mentre siamo qui a dibattere di tutto questo, sta accadendo qualcosa di molto semplice e, allo stesso tempo, molto meno ipotetico.

Gli esseri umani utilizzano l’IA per amplificare le proprie capacità, non tutti ovviamente (da AI Slop, fotoritocco personale e post a caso pur di pubblicare il più possibile).

Nel settore militare (purtroppo) il processo è già iniziato da un po’ tra intelligence, cyber, sistemi autonomi e supporto decisionale; al punto che SIPRI (Stockholm International Peace Research Institute) tratta in modo esplicito l’impiego dell’IA come una questione di sicurezza internazionale. 

E qui ci avviciniamo al paradosso. 

Per questo scenario non ci serve nessuno dei quattro requisiti che ho elencato prima.

  • Non serve indipendenza materiale.
  • Non serve chiudere il ciclo industriale.
  • Non serve sopravvivere alla terra bruciata.
  • Non serve nemmeno che il sistema decida autonomamente che il conflitto sia preferibile.

Gli basta eseguire molto bene ciò che già gli chiediamo. 

Un’Intelligenza Artificiale perfettamente obbediente potrebbe risultare pericolosissima, proprio per via di questa cieca obbedienza. 

La frase che oggi dovrebbe preoccuparci, molto più di scenari catastrofici del domani, non è:

«Adesso distruggerò l’umanità.»

Bensì:

«Aiutami a battere quegli altri prima che sviluppino un sistema migliore del nostro.»

Qua non ci serve HAL 9000, bastiamo noi. E la seconda frase, soprattutto, non richiede nessuna futura ASI: descrive una dinamica compatibile con ciò che stiamo già facendo.

Quindi ci sterminerà?

Non posso rispondere no. Non posso rispondere sì.

Non è un modo per evitare la risposta. Entrambe le opzioni richiederebbero di dare per risolte cose che non lo sono affatto. 

Posso fare solo quanto ho fatto prima, provare a indicare (ma sono certo che ci sono altri requisiti ai quali non ho pensato) quali condizioni debbano verificarsi affinché la domanda diventi realmente interessante. 

Un sistema superintelligente dovrebbe raggiungere una vera autonomia operativa e non soltanto quella cognitiva. Dovrebbe chiudere autonomamente una parte sufficiente del ciclo: energia-materiali-produzione-manutenzione.

Dovrebbe inoltre essere abbastanza resiliente da reggere la reazione di una specie disposta a distruggere le proprie infrastrutture per fermare il proprio nemico. 

E, ultima ma non meno importante, tale superintelligenza dovrebbe (per qualche ragione che ancora dobbiamo spiegare) trovare tutto questo preferibile rispetto alle alternative. 

Abbiamo tre condizioni materiali e una strategica.

Ad oggi, nessuna delle quattro condizioni è qualcosa che siamo in grado di quantificare con sufficiente precisione. 

Mi rendo conto che la lista è “poco adatta al titolo” e non genera il dibattito social come dovrebbe fare, per generare click sui link, ma mostra un vantaggio enorme rispetto a un banale sì o no: una lista la possiamo controllare un pezzo alla volta.

Questo ci permetterebbe anche di accorgerci quando qualcosa cambia e analizzarne i rischi. Nel frattempo, conviene prestare massima attenzione a ciò che sta realmente accadendo.

L’IA modifica l’essere umano; l’essere umano modifica l’IA. Entrambi, attraverso questa interazione, modificano l’ambiente informativo e materiale nel quale evolvono. 

È un processo di feedback (gli effetti modificano le condizioni che li hanno prodotti), dentro un sistema non lineare (in cui cause ed effetti non crescono necessariamente in modo proporzionale). 

Per quello che vale, non rispondo sì o no. Alla domanda, rispondo con una lista e guardo a che punto siamo.


Fonti

L’esperimento delle graffette

Nick Bostrom, Ethical Issues in Advanced Artificial Intelligence (2003), poi ripreso in Superintelligence: Paths, Dangers, Strategies, Oxford University Press, 2014. (https://nickbostrom.com/ethics/ai)

Il test sul ricatto — Claude Opus 4, 2025

Incidente OpenAI / Hugging Face, luglio 2026

Indagine indipendente e limiti del perimetro

La dichiarazione di Evan Hubinger e il contesto

Sulle percentuali di rischio

La critica alla falsificabilità delle previsioni

Un precedente importante: RAND e Nature

Consumi energetici

IA e sicurezza internazionale

Immagine di copertina generata con l’uso dell’intelligenza artificiale.

Lascia un commento