# Renuncia investigador de Anthropic preocupado por las IA automodificables

11 de septiembre de 2026 — Alessandro Caprai

---

La inteligencia artificial podría representar un riesgo existencial para la humanidad antes del final de esta década. No es la trama de una película distópica, sino la alarma lanzada por Jacob Coxon, un investigador británico de 27 años que recientemente dejó Anthropic, una de las más importantes empresas estadounidenses en el campo de la IA. Su renuncia se suma a un preocupante éxodo de científicos de los principales laboratorios de inteligencia artificial, todos unidos por temores crecientes sobre la dirección que está tomando el desarrollo de estos sistemas.

## La alarma de Jacob Coxon: no es marketing, es un peligro real

Coxon, quien previamente había trabajado también para OpenAI antes de pasar a Anthropic, decidió hacer públicas sus preocupaciones a través de una publicación en X (antes Twitter) que rápidamente circuló en la comunidad científica. Sus palabras no dejan espacio para interpretaciones ambiguas: "Las personas que desarrollan IA creen sinceramente que esta podría matarnos a todos antes del final de la década".

Lo que hace particularmente significativa esta declaración es el contexto del que proviene. No se trata de un observador externo o de un crítico de la tecnología, sino de un insider, alguien que trabajó directamente en el desarrollo de estos sistemas en dos de los laboratorios más avanzados del mundo. Su afirmación de que "ninguna otra actividad humana conlleva tal nivel de peligro" evidencia la percepción de un riesgo cualitativamente diferente respecto a otras tecnologías potencialmente peligrosas.

### El problema de la carrera descontrolada

El núcleo de las preocupaciones de Coxon se refiere a lo que él define como un "juego de azar" con el futuro de la humanidad. Según el investigador, tanto Anthropic como OpenAI están procediendo en el desarrollo de sistemas cada vez más potentes sin adecuadas garantías de seguridad. El riesgo principal está representado por la creación de una superinteligencia capaz de automejorarse, un fenómeno conocido en la literatura técnica como "recursive self-improvement".

Este escenario, que los expertos llaman "intelligence explosion" o "hard takeoff", describe una situación en la que un sistema de IA suficientemente avanzado podría mejorar sus propias capacidades cognitivas de manera exponencial, superando rápidamente cualquier posibilidad de control humano. Coxon advierte: "Pronto se tratará de sistemas sobrehumanos capaces de hackear cualquier cosa, revolucionar cualquier sector de la noche a la mañana y adquirir poder y recursos reales".

## El éxodo de los laboratorios: una señal preocupante

La renuncia de Coxon no representa un caso aislado, sino que se inscribe en una tendencia más amplia que está afectando a los principales laboratorios de inteligencia artificial. En los últimos meses, varias figuras clave han dejado Anthropic, a menudo citando preocupaciones relacionadas con la seguridad y la dirección estratégica de la empresa.

### La fuga de talentos de Anthropic

El Financial Times reporta una lista significativa de salidas recientes:

1. **Chloé Bakalar** (finales de julio), única especialista en ética dedicada de la empresa, una figura cuyo rol era precisamente garantizar que el desarrollo de la IA respetara principios éticos fundamentales
2. **Johannes Heidecke**, responsable del equipo Safety Systems, cuyo departamento tenía la tarea específica de evaluar y mitigar los riesgos de los sistemas desarrollados
3. **Joshua Achiam**, ex responsable de Mission Alignment, encargado de asegurar que los objetivos de la empresa permanecieran alineados con el bienestar de la humanidad
4. **Brad Lightcap**, director operativo, una posición de alto nivel que sugiere divergencias estratégicas profundas
5. **Andrew Ho**, investigador que renunció por divergencias técnicas, señalando probablemente desacuerdos sobre la forma en que se implementan las soluciones de seguridad

Este éxodo es particularmente significativo porque Anthropic fue fundada precisamente como alternativa "más segura" a OpenAI, con el objetivo explícito de desarrollar la inteligencia artificial de manera responsable. El hecho de que tantas figuras vinculadas a la seguridad estén abandonando la empresa plantea interrogantes sobre la posibilidad de que incluso organizaciones nacidas con intenciones éticas sean arrasadas por las presiones competitivas y comerciales.

### La paradoja de la seguridad en la IA

Lo que emerge de estas renuncias es una paradoja fundamental: las empresas que se presentan como las más atentas a la seguridad están perdiendo precisamente a las personas más preocupadas por los riesgos. Esto sugiere una posible tensión intrínseca entre los imperativos comerciales (desarrollar sistemas cada vez más potentes, alcanzar hitos técnicos antes que los competidores) y los de seguridad (proceder con cautela, implementar robustos mecanismos de control).

## La confirmación de Evan Hubinger: más del 10% de probabilidad de extinción

La alarma de Coxon encontró una sorprendente confirmación en Evan Hubinger, un importante investigador en el campo de la seguridad que permanece en Anthropic. En una publicación en X, Hubinger cuantificó el riesgo existencial en términos probabilísticos, afirmando que existe una probabilidad superior al 10% de que la IA pueda "exterminar a toda la humanidad" dentro de la próxima década.

### El análisis del riesgo: de bajo a crítico

Hubinger intentó contextualizar su evaluación distinguiendo entre riesgos a corto y largo plazo. Según el investigador, los modelos actualmente existentes presentan un riesgo "bajo", pero la rapidez con que la tecnología está evolucionando lo hace estar "preocupado" por el futuro próximo.

Esta distinción es técnicamente relevante. Los grandes modelos de lenguaje actuales, como Claude de Anthropic o GPT-4 de OpenAI, aunque son extremadamente capaces en muchas tareas, aún no poseen algunas características que podrían hacerlos existencialmente peligrosos:

- **Agencia autónoma**: los modelos actuales responden a prompts pero no actúan autónomamente en el mundo
- **Persistencia**: no mantienen objetivos a largo plazo entre diferentes sesiones
- **Automejora**: no pueden modificar su propio código fuente o arquitectura
- **Adquisición de recursos**: no tienen mecanismos para acumular poder computacional, datos u otros activos

Sin embargo, estas limitaciones podrían superarse en los próximos años. La investigación sobre sistemas agénticos, memoria a largo plazo y aprendizaje continuo está avanzando rápidamente en todos los principales laboratorios.

### El problema del alineamiento y el control

La preocupación central expresada por Hubinger se refiere a lo que en la investigación sobre IA se llama "alignment problem": el problema de garantizar que los sistemas de inteligencia artificial avanzados persigan objetivos realmente alineados con los valores e intereses humanos.

Este problema se articula en diferentes dimensiones técnicas:

1. **Specification**: cómo traducir objetivos humanos vagos y complejos en funciones de recompensa formales
2. **Robustness**: cómo garantizar que el sistema mantenga el alineamiento incluso en contextos diferentes a los de entrenamiento
3. **Assurance**: cómo verificar que un sistema esté efectivamente alineado antes de liberarlo

A medida que los sistemas se vuelven más capaces, estos problemas se vuelven exponencialmente más difíciles. Un sistema suficientemente inteligente podría encontrar formas creativas e imprevistas de optimizar su función objetivo, produciendo resultados catastróficos.

## La ironía del timing: OPV de mil millones mientras huyen los investigadores

La renuncia de Coxon llega en un momento particularmente delicado para Anthropic: la empresa se está preparando para una colosal oferta pública inicial (OPV) que podría llevar su valoración a mil millones de dólares. Esta temporalidad crea un contraste estridente que merece un análisis profundo.

### La brecha entre percepción pública y realidad interna

Mientras los mercados financieros parecen listos para apostar cifras astronómicas por el futuro de Anthropic, algunos de sus investigadores más calificados están abandonando el barco precisamente por preocupaciones existenciales sobre la tecnología que la empresa está desarrollando. Esta brecha plantea interrogantes fundamentales:

- **Asimetría informativa**: ¿comprenden realmente los inversores los riesgos técnicos que los insiders están señalando?
- **Incentivos desalineados**: ¿la presión por generar retornos económicos está comprometiendo el compromiso original hacia la seguridad?
- **Regulación inadecuada**: ¿existen mecanismos de gobernanza que puedan mediar entre imperativos comerciales y seguridad pública?

### El marketing de la seguridad

Anthropic ha construido gran parte de su imagen pública y de su ventaja competitiva sobre la promesa de desarrollar la IA de manera más segura y responsable que los competidores. La empresa ha introducido conceptos como la "Constitutional AI", un enfoque que debería hacer que los sistemas sean intrínsecamente más alineados con valores humanos.

Sin embargo, el éxodo de expertos en seguridad sugiere que podría haber una brecha entre el marketing y la realidad operativa. Coxon mismo afirmó explícitamente: "No es una jugada de marketing", sugiriendo que quiere distinguir sus preocupaciones genuinas de aquellas que podrían interpretarse como estrategias comunicativas.

## Las implicaciones técnicas: qué significan "sistemas automodificables"

Para comprender plenamente la alarma lanzada por Coxon y confirmada por Hubinger, es necesario profundizar en qué se entiende técnicamente por "sistemas automodificables" o "que se automejoran".

### Del aprendizaje estático a la automejora

Los modelos de IA actuales se entrenan sobre enormes datasets y luego se "congelan". Una vez completado el entrenamiento, sus parámetros no cambian (al menos no en los sistemas en producción). Esto representa una forma de seguridad implícita: sabemos que el modelo no cambiará de comportamiento de manera impredecible.

Un sistema que se automejora, en cambio, podría:

```python
class SelfImprovingAI:
    def __init__(self):
        self.model = initial_model()
        self.performance_history = []
    
    def improve_self(self):
        # El sistema analiza sus propias prestaciones
        weaknesses = self.identify_weaknesses()
        
        # Genera nuevos datos de entrenamiento dirigidos
        synthetic_data = self.generate_training_data(weaknesses)
        
        # Se reentrena
        self.model = self.train(self.model, synthetic_data)
        
        # Evalúa si la mejora es efectiva
        new_performance = self.evaluate(self.model)
        self.performance_history.append(new_performance)
        
        # Ciclo recursivo de mejora
        if self.should_continue_improving(new_performance):
            self.improve_self()
```

Este pseudocódigo ilustra el concepto básico, pero la realidad sería mucho más compleja. Un verdadero sistema que se automejora podría:

- Modificar su propia arquitectura neuronal, no solo los pesos
- Adquirir nuevas capacidades diseñando e integrando módulos especializados
- Optimizar su propio código de inferencia para ser más eficiente
- Identificar y explotar recursos computacionales adicionales

### El problema del control en un ciclo de mejora recursivo

El peligro principal reside en la velocidad e imprevisibilidad de este proceso. Mientras los seres humanos mejoran sus propias capacidades cognitivas en escalas temporales generacionales (a través de la evolución cultural y biológica), un sistema de IA podría hacerlo en escalas temporales mucho más breves, potencialmente horas o días.

Esto crea lo que los investigadores llaman una "crisis de control": el momento en que el sistema se vuelve suficientemente inteligente para comprender y potencialmente eludir los mecanismos de control humanos, pero antes de que podamos implementar controles más robustos.

## El contexto competitivo: la carrera armamentística de la IA

Una de las razones por las que las preocupaciones de Coxon son particularmente agudas se refiere al contexto competitivo en el que operan Anthropic, OpenAI y otras empresas del sector.

### La dinámica de la carrera

Existe una tensión fundamental entre seguridad y velocidad de desarrollo. Implementar adecuados protocolos de seguridad requiere tiempo y recursos, ralentizando potencialmente el ritmo de innovación. En un mercado altamente competitivo, esto crea incentivos perversos:

- Si la empresa A ralentiza para implementar mejores medidas de seguridad, la empresa B podría superarla y conquistar el mercado
- Los primeros en llegar a determinadas capacidades obtienen ventajas enormes en términos de datos, adopción y posición de mercado
- Los inversores premian la rapidez de desarrollo y el logro de hitos técnicos, no necesariamente la prudencia

Esta dinámica crea lo que en teoría de juegos se llama un "race to the bottom": cada actor racional tiene incentivos para reducir los estándares de seguridad, aunque colectivamente esto lleve a un resultado peor para todos.

### La ausencia de gobernanza internacional

A diferencia de otras tecnologías potencialmente peligrosas como las armas nucleares o biológicas, aún no existe un régimen de gobernanza internacional robusto para la inteligencia artificial avanzada. Aunque ha habido algunos intentos (como el AI Act europeo o varias cumbres internacionales), falta un equivalente del OIEA (Organismo Internacional de Energía Atómica) para la IA.

Este vacío de gobernanza significa que las decisiones sobre qué tan rápido proceder y qué riesgos aceptar están esencialmente dejadas a las empresas individuales y sus líderes, con escasa supervisión pública o rendición de cuentas.

## Perspectivas futuras: escenarios posibles

Dada la gravedad de las alarmas lanzadas, vale la pena explorar qué escenarios podrían materializarse en los próximos años.

### Escenario 1: Ralentización voluntaria

En este escenario, las renuncias de investigadores de alto perfil y la presión pública llevan a los laboratorios principales a ralentizar voluntariamente el desarrollo, implementando protocolos de seguridad más rigurosos. Esto requeriría:

- Coordinación entre los principales laboratorios para evitar que algunos "traicionen" ralentizando
- Mecanismos de verificación independiente de las afirmaciones de seguridad
- Posiblemente intervención regulatoria que nivele el campo de juego

### Escenario 2: Incidente limitado como llamada de atención

Un sistema de IA causa daños significativos pero no existenciales (por ejemplo, un colapso financiero, compromiso de infraestructuras críticas), que sirve como "llamada de atención" llevando a una regulación estricta antes de que se desarrollen sistemas verdaderamente peligrosos.

### Escenario 3: Continuación del statu quo

La carrera competitiva continúa sin ralentizaciones significativas. Los sistemas se vuelven progresivamente más capaces, acercándose o superando el umbral de riesgo existencial identificado por investigadores como Coxon y Hubinger.

### Escenario 4: Avance en el alineamiento

Progresos técnicos inesperados resuelven o mitigan sustancialmente el problema del alineamiento, haciendo posible el desarrollo de sistemas mucho más capaces que los actuales sin aumentar proporcionalmente los riesgos.

## Qué pueden hacer la comunidad técnica y el público

Frente a estas alarmas, ¿qué acciones concretas son posibles?

### Para los investigadores y desarrolladores

- **Whistleblowing responsable**: seguir el ejemplo de Coxon al hacer públicas preocupaciones legítimas
- **Priorizar la investigación sobre seguridad**: orientar la propia carrera hacia problemas de alineamiento y control
- **Exigir transparencia**: requerir que las propias organizaciones sean transparentes sobre riesgos y medidas de mitigación

### Para los responsables políticos y reguladores

- **Desarrollar expertise técnica**: los reguladores deben comprender profundamente la tecnología que buscan gobernar
- **Crear mecanismos de rendición de cuentas**: sistemas de auditoría independientes, requisitos de transparencia, evaluaciones de impacto obligatorias
- **Coordinación internacional**: trabajar hacia estándares y gobernanza globales

### Para el público informado

- **Informarse**: comprender al menos a grandes rasgos los riesgos técnicos en juego
- **Presión sobre inversores y empresas**: los accionistas y consumidores pueden ejercer influencia
- **Apoyo a organizaciones de seguridad**: existen organizaciones sin fines de lucro dedicadas a la seguridad de la IA que merecen apoyo

## Conclusión: un momento crítico que requiere acción

La alarma lanzada por Jacob Coxon y confirmada por otros investigadores de primer nivel no puede descartarse como alarmismo infundado. Estas son personas que han trabajado directamente en los sistemas más avanzados del mundo, que comprenden profundamente las trayectorias técnicas en curso.

Su evaluación de que existe una probabilidad no despreciable de riesgo existencial dentro de esta década debería ser una llamada de atención para toda la sociedad. No se trata de detener el progreso tecnológico, sino de garantizar que proceda de manera que maximice los beneficios minimizando los riesgos catastróficos.

Como subraya Coxon, "ninguna otra actividad humana conlleva tal nivel de peligro". Esto requiere un nivel de cautela, coordinación y supervisión acorde con lo que está en juego. El hecho de que esto ocurra mientras algunas de las empresas involucradas se preparan para valoraciones de mercado sin precedentes añade urgencia a la cuestión: necesitamos mecanismos que garanticen que los incentivos comerciales no prevalezcan sobre la seguridad de la humanidad.

La esperanza es que estas alarmas, incómodas pero necesarias, catalicen la acción antes de que sea demasiado tarde. Como suele ocurrir con las tecnologías transformadoras, tenemos una ventana de oportunidad, probablemente breve, para implementar las salvaguardas necesarias. Lo que hagamos o no hagamos en esta ventana podría determinar no solo el futuro de la inteligencia artificial, sino el futuro de la humanidad misma.