# Si dimette ricercatore di Anthropic preoccupato dalle AI autoaggiornanti
11 settembre 2026 — Alessandro Caprai
---
L'intelligenza artificiale potrebbe rappresentare un rischio esistenziale per l'umanità entro la fine di questo decennio. Non è la trama di un film distopico, ma l'allarme lanciato da Jacob Coxon, un ricercatore britannico di 27 anni che ha recentemente lasciato Anthropic, una delle più importanti società americane nel campo dell'IA. Le sue dimissioni si inseriscono in un preoccupante esodo di scienziati dai principali laboratori di intelligenza artificiale, tutti accomunati da timori crescenti sulla direzione che sta prendendo lo sviluppo di questi sistemi.
## L'allarme di Jacob Coxon: non è marketing, è un pericolo reale
Coxon, che in precedenza aveva lavorato anche per OpenAI prima di passare ad Anthropic, ha deciso di rendere pubbliche le sue preoccupazioni attraverso un post su X (ex Twitter) che ha fatto rapidamente il giro della comunità scientifica. Le sue parole non lasciano spazio a interpretazioni ambigue: "Le persone che sviluppano l'IA credono sinceramente che essa possa ucciderci tutti entro la fine del decennio".
Ciò che rende particolarmente significativa questa dichiarazione è il contesto da cui proviene. Non si tratta di un osservatore esterno o di un critico della tecnologia, ma di un insider, qualcuno che ha lavorato direttamente nello sviluppo di questi sistemi presso due dei laboratori più avanzati al mondo. La sua affermazione che "nessun'altra attività umana comporta un tale livello di pericolo" evidenzia la percezione di un rischio qualitativamente diverso rispetto ad altre tecnologie potenzialmente pericolose.
### Il problema della corsa incontrollata
Il fulcro delle preoccupazioni di Coxon riguarda quello che lui definisce un "azzardo" con il futuro dell'umanità. Secondo il ricercatore, sia Anthropic che OpenAI stanno procedendo nello sviluppo di sistemi sempre più potenti senza adeguate garanzie di sicurezza. Il rischio principale è rappresentato dalla creazione di una superintelligenza capace di auto-migliorarsi, un fenomeno noto nella letteratura tecnica come "recursive self-improvement".
Questo scenario, che gli esperti chiamano "intelligence explosion" o "hard takeoff", descrive una situazione in cui un sistema di IA sufficientemente avanzato potrebbe migliorare le proprie capacità cognitive in modo esponenziale, superando rapidamente qualsiasi possibilità di controllo umano. Coxon avverte: "Presto si tratterà di sistemi sovrumani in grado di hackerare qualsiasi cosa, rivoluzionare qualsiasi settore dall'oggi al domani e acquisire potere e risorse reali".
## L'esodo dai laboratori: un segnale preoccupante
Le dimissioni di Coxon non rappresentano un caso isolato, ma si inseriscono in un trend più ampio che sta interessando i principali laboratori di intelligenza artificiale. Negli ultimi mesi, diverse figure chiave hanno lasciato Anthropic, spesso citando preoccupazioni legate alla sicurezza e alla direzione strategica dell'azienda.
### La fuga dei talenti da Anthropic
Il Financial Times riporta un elenco significativo di partenze recenti:
1. **Chloé Bakalar** (fine luglio), unica eticista dedicata dell'azienda, una figura il cui ruolo era proprio quello di garantire che lo sviluppo dell'IA rispettasse principi etici fondamentali
2. **Johannes Heidecke**, responsabile del team Safety Systems, il cui dipartimento aveva il compito specifico di valutare e mitigare i rischi dei sistemi sviluppati
3. **Joshua Achiam**, ex responsabile della Mission Alignment, incaricato di assicurare che gli obiettivi dell'azienda rimanessero allineati con il benessere dell'umanità
4. **Brad Lightcap**, direttore operativo, una posizione di alto livello che suggerisce divergenze strategiche profonde
5. **Andrew Ho**, ricercatore dimessosi per divergenze tecniche, segnalando probabilmente disaccordi sul modo in cui vengono implementate le soluzioni di sicurezza
Questo esodo è particolarmente significativo perché Anthropic è stata fondata proprio come alternativa "più sicura" a OpenAI, con l'esplicito obiettivo di sviluppare l'intelligenza artificiale in modo responsabile. Il fatto che così tante figure legate alla sicurezza stiano abbandonando l'azienda solleva interrogativi sulla possibilità che anche organizzazioni nate con intenti etici vengano travolte dalle pressioni competitive e commerciali.
### Il paradosso della sicurezza nell'IA
Ciò che emerge da queste dimissioni è un paradosso fondamentale: le aziende che si presentano come le più attente alla sicurezza stanno perdendo proprio le persone più preoccupate per i rischi. Questo suggerisce una possibile tensione intrinseca tra gli imperativi commerciali (sviluppare sistemi sempre più potenti, raggiungere traguardi tecnici prima dei concorrenti) e quelli di sicurezza (procedere con cautela, implementare robusti meccanismi di controllo).
## La conferma di Evan Hubinger: oltre il 10% di probabilità di estinzione
L'allarme di Coxon ha trovato una sorprendente conferma in Evan Hubinger, un importante ricercatore nel campo della sicurezza che è rimasto in Anthropic. In un post su X, Hubinger ha quantificato il rischio esistenziale in termini probabilistici, affermando che esiste una probabilità superiore al 10% che l'IA possa "sterminare tutta l'umanità" entro il prossimo decennio.
### L'analisi del rischio: dal basso al critico
Hubinger ha cercato di contestualizzare la sua valutazione distinguendo tra rischi a breve e lungo termine. Secondo il ricercatore, i modelli attualmente esistenti presentano un rischio "basso", ma la rapidità con cui la tecnologia si sta evolvendo lo rende "preoccupato" per il futuro prossimo.
Questa distinzione è tecnicamente rilevante. I grandi modelli linguistici attuali, come Claude di Anthropic o GPT-4 di OpenAI, pur essendo estremamente capaci in molti compiti, non possiedono ancora alcune caratteristiche che potrebbero renderli esistenzialmente pericolosi:
- **Agenzia autonoma**: i modelli attuali rispondono a prompt ma non agiscono autonomamente nel mondo
- **Persistenza**: non mantengono obiettivi a lungo termine tra diverse sessioni
- **Auto-miglioramento**: non possono modificare il proprio codice sorgente o architettura
- **Acquisizione di risorse**: non hanno meccanismi per accumolare potere computazionale, dati o altri asset
Tuttavia, queste limitazioni potrebbero essere superate nei prossimi anni. La ricerca sui sistemi agentici, sulla memoria a lungo termine e sull'apprendimento continuo sta procedendo rapidamente in tutti i principali laboratori.
### Il problema dell'allineamento e del controllo
La preoccupazione centrale espressa da Hubinger riguarda quello che nella ricerca sull'IA viene chiamato "alignment problem": il problema di garantire che i sistemi di intelligenza artificiale avanzati perseguano obiettivi realmente allineati con i valori e gli interessi umani.
Questo problema si articola in diverse dimensioni tecniche:
1. **Specification**: come tradurre obiettivi umani vaghi e complessi in funzioni di ricompensa formali
2. **Robustness**: come garantire che il sistema mantenga l'allineamento anche in contesti diversi da quelli di addestramento
3. **Assurance**: come verificare che un sistema sia effettivamente allineato prima di rilasciarlo
Man mano che i sistemi diventano più capaci, questi problemi diventano esponenzialmente più difficili. Un sistema sufficientemente intelligente potrebbe trovare modi creativi e imprevisti per ottimizzare la sua funzione obiettivo, producendo risultati catastrofici.
## L'ironia della tempistica: IPO da mille miliardi mentre fuggono i ricercatori
Le dimissioni di Coxon arrivano in un momento particolarmente delicato per Anthropic: l'azienda si sta preparando per una colossale offerta pubblica iniziale (IPO) che potrebbe portare la sua valutazione a mille miliardi di dollari. Questa tempistica crea un contrasto stridente che merita un'analisi approfondita.
### Il divario tra percezione pubblica e realtà interna
Mentre i mercati finanziari sembrano pronti a scommettere cifre astronomiche sul futuro di Anthropic, alcuni dei suoi ricercatori più qualificati stanno abbandonando la nave proprio per preoccupazioni esistenziali sulla tecnologia che l'azienda sta sviluppando. Questo divario solleva interrogativi fondamentali:
- **Asimmetria informativa**: gli investitori comprendono realmente i rischi tecnici che gli insider stanno segnalando?
- **Incentivi disallineati**: la pressione per generare ritorni economici sta compromettendo l'impegno originario verso la sicurezza?
- **Regolamentazione inadeguata**: esistono meccanismi di governance che possano mediare tra imperativi commerciali e sicurezza pubblica?
### Il marketing della sicurezza
Anthropic ha costruito gran parte della sua immagine pubblica e del suo vantaggio competitivo sulla promessa di sviluppare l'IA in modo più sicuro e responsabile rispetto ai concorrenti. L'azienda ha introdotto concetti come la "Constitutional AI", un approccio che dovrebbe rendere i sistemi intrinsecamente più allineati con valori umani.
Tuttavia, l'esodo di esperti di sicurezza suggerisce che potrebbe esserci un divario tra il marketing e la realtà operativa. Coxon stesso ha esplicitamente affermato: "Non è una mossa di marketing", suggerendo che vuole distinguere le sue preoccupazioni genuine da quelle che potrebbero essere interpretate come strategie comunicative.
## Le implicazioni tecniche: cosa significa "sistemi autoaggiornanti"
Per comprendere appieno l'allarme lanciato da Coxon e confermato da Hubinger, è necessario approfondire cosa si intende tecnicamente con "sistemi autoaggiornanti" o "auto-miglioranti".
### Dall'apprendimento statico all'auto-miglioramento
I modelli di IA attuali vengono addestrati su enormi dataset e poi "congelati". Una volta completato l'addestramento, i loro parametri non cambiano (almeno non nei sistemi in produzione). Questo rappresenta una forma di sicurezza implicita: sappiamo che il modello non cambierà comportamento in modo imprevedibile.
Un sistema auto-migliorante, invece, potrebbe:
```python
class SelfImprovingAI:
def __init__(self):
self.model = initial_model()
self.performance_history = []
def improve_self(self):
# Il sistema analizza le proprie prestazioni
weaknesses = self.identify_weaknesses()
# Genera nuovi dati di addestramento mirati
synthetic_data = self.generate_training_data(weaknesses)
# Si ri-addestra
self.model = self.train(self.model, synthetic_data)
# Valuta se il miglioramento è effettivo
new_performance = self.evaluate(self.model)
self.performance_history.append(new_performance)
# Ciclo ricorsivo di miglioramento
if self.should_continue_improving(new_performance):
self.improve_self()
```
Questo pseudocodice illustra il concetto base, ma la realtà sarebbe molto più complessa. Un vero sistema auto-migliorante potrebbe:
- Modificare la propria architettura neurale, non solo i pesi
- Acquisire nuove capacità progettando e integrando moduli specializzati
- Ottimizzare il proprio codice di inferenza per essere più efficiente
- Identificare e sfruttare risorse computazionali aggiuntive
### Il problema del controllo in un ciclo di miglioramento ricorsivo
Il pericolo principale risiede nella velocità e nell'imprevedibilità di questo processo. Mentre gli esseri umani migliorano le proprie capacità cognitive su scale temporali generazionali (attraverso l'evoluzione culturale e biologica), un sistema di IA potrebbe farlo su scale temporali molto più brevi, potenzialmente ore o giorni.
Questo crea quello che i ricercatori chiamano un "controllo crisis": il momento in cui il sistema diventa abbastanza intelligente da comprendere e potenzialmente eludere i meccanismi di controllo umani, ma prima che possiamo implementare controlli più robusti.
## Il contesto competitivo: la corsa agli armamenti dell'IA
Una delle ragioni per cui le preoccupazioni di Coxon sono particolarmente acute riguarda il contesto competitivo in cui operano Anthropic, OpenAI e altre aziende del settore.
### La dinamica della corsa
Esiste una tensione fondamentale tra sicurezza e velocità di sviluppo. Implementare adeguati protocolli di sicurezza richiede tempo e risorse, rallentando potenzialmente il ritmo di innovazione. In un mercato altamente competitivo, questo crea incentivi perversi:
- Se l'azienda A rallenta per implementare migliori misure di sicurezza, l'azienda B potrebbe superarla e conquistare il mercato
- I primi ad arrivare a determinate capacità ottengono vantaggi enormi in termini di dati, adozione e posizione di mercato
- Gli investitori premiano la rapidità di sviluppo e il raggiungimento di milestone tecnici, non necessariamente la prudenza
Questa dinamica crea quello che in teoria dei giochi si chiama un "race to the bottom": ogni attore razionale ha incentivi a ridurre gli standard di sicurezza, anche se collettivamente questo porta a un risultato peggiore per tutti.
### L'assenza di governance internazionale
A differenza di altre tecnologie potenzialmente pericolose come le armi nucleari o biologiche, non esiste ancora un regime di governance internazionale robusto per l'intelligenza artificiale avanzata. Mentre ci sono stati alcuni tentativi (come l'AI Act europeo o vari summit internazionali), manca un equivalente dell'AIEA (Agenzia Internazionale per l'Energia Atomica) per l'IA.
Questo vuoto di governance significa che le decisioni su quanto velocemente procedere e quali rischi accettare sono essenzialmente lasciate alle singole aziende e ai loro leader, con scarsa supervisione pubblica o accountability.
## Prospettive future: scenari possibili
Data la gravità degli allarmi lanciati, vale la pena esplorare quali scenari potrebbero materializzarsi nei prossimi anni.
### Scenario 1: Rallentamento volontario
In questo scenario, le dimissioni di ricercatori di alto profilo e la pressione pubblica portano i laboratori principali a rallentare volontariamente lo sviluppo, implementando protocolli di sicurezza più rigorosi. Questo richiederebbe:
- Coordinamento tra i principali laboratori per evitare che alcuni "tradiscano" rallentando
- Meccanismi di verifica indipendente dei claim di sicurezza
- Possibilmente intervento regolatorio che livelli il campo di gioco
### Scenario 2: Incidente limitato come campanello d'allarme
Un sistema di IA causa danni significativi ma non esistenziali (ad esempio, un collasso finanziario, compromissione di infrastrutture critiche), che serve da "campanello d'allarme" portando a regolamentazione stringente prima che vengano sviluppati sistemi veramente pericolosi.
### Scenario 3: Proseguimento dello status quo
La corsa competitiva continua senza rallentamenti significativi. I sistemi diventano progressivamente più capaci, avvicinandosi o superando la soglia di rischio esistenziale identificata da ricercatori come Coxon e Hubinger.
### Scenario 4: Breakthrough nell'allineamento
Progressi tecnici inattesi risolvono o mitigano sostanzialmente il problema dell'allineamento, rendendo possibile lo sviluppo di sistemi molto più capaci degli attuali senza aumentare proporzionalmente i rischi.
## Cosa possono fare la comunità tecnica e il pubblico
Di fronte a questi allarmi, quali azioni concrete sono possibili?
### Per i ricercatori e gli sviluppatori
- **Whistleblowing responsabile**: seguire l'esempio di Coxon nel rendere pubbliche preoccupazioni legittime
- **Prioritizzare la ricerca sulla sicurezza**: orientare la propria carriera verso problemi di allineamento e controllo
- **Esigere trasparenza**: richiedere che le proprie organizzazioni siano trasparenti su rischi e misure di mitigazione
### Per i policymaker e i regolatori
- **Sviluppare expertise tecnica**: i regolatori devono comprendere profondamente la tecnologia che cercano di governare
- **Creare meccanismi di accountability**: sistemi di audit indipendenti, requisiti di trasparenza, valutazioni di impatto obbligatorie
- **Coordinamento internazionale**: lavorare verso standard e governance globali
### Per il pubblico informato
- **Informarsi**: comprendere almeno a grandi linee i rischi tecnici in gioco
- **Pressione su investitori e aziende**: gli azionisti e i consumatori possono esercitare influenza
- **Sostegno a organizzazioni di sicurezza**: esistono organizzazioni nonprofit dedicate alla sicurezza dell'IA che meritano supporto
## Conclusione: un momento critico che richiede azione
L'allarme lanciato da Jacob Coxon e confermato da altri ricercatori di primo piano non può essere liquidato come allarmismo infondato. Queste sono persone che hanno lavorato direttamente sui sistemi più avanzati al mondo, che comprendono profondamente le traiettorie tecniche in corso.
La loro valutazione che esista una probabilità non trascurabile di rischio esistenziale entro questo decennio dovrebbe essere un campanello d'allarme per l'intera società. Non si tratta di fermare il progresso tecnologico, ma di garantire che proceda in modo che massimizzi i benefici minimizzando i rischi catastrofici.
Come sottolinea Coxon, "nessun'altra attività umana comporta un tale livello di pericolo". Questo richiede un livello di cautela, coordinamento e supervisione commisurato alla posta in gioco. Il fatto che questo avvenga mentre alcune delle aziende coinvolte si preparano a valutazioni di mercato senza precedenti aggiunge urgenza alla questione: abbiamo bisogno di meccanismi che garantiscano che gli incentivi commerciali non prevalgano sulla sicurezza dell'umanità.
La speranza è che questi allarmi, scomodi ma necessari, catalizzino l'azione prima che sia troppo tardi. Come spesso accade con le tecnologie trasformative, abbiamo una finestra di opportunità, probabilmente breve, per mettere in atto le salvaguardie necessarie. Quello che faremo o non faremo in questa finestra potrebbe determinare non solo il futuro dell'intelligenza artificiale, ma il futuro dell'umanità stessa.