Por qué los investigadores de IA están dejando OpenAI, Anthropic y Google — y sobre qué están advirtiendo
En septiembre de 2026, el investigador de Anthropic Jacob Coxon renunció, advirtiendo sobre el peligro que ve en la búsqueda de los laboratorios de IA por sistemas más inteligentes que los humanos. Acusó a los desarrolladores de "jugar con nuestras vidas" al hacer modelos más capaces sin saber si pueden mantenerlos bajo control. Los especialistas en seguridad han expresado preocupaciones similares: en los últimos años, algunos han dejado OpenAI, Anthropic y Google, citando el rápido ritmo de desarrollo y la atención insuficiente a los riesgos. Examinamos qué les preocupa, cuánta influencia tuvieron sobre las decisiones de gestión y cómo han respondido las empresas.
Conclusiones Clave
- En 2023, OpenAI estableció su equipo de Superalineación para investigar formas de controlar IA más inteligentes que los humanos. Diez meses después, el equipo fue disuelto. Uno de sus líderes dijo que la seguridad había quedado en un segundo plano frente a nuevos productos;
- También han surgido desacuerdos en Anthropic, que atrajo a empleados insatisfechos de OpenAI. Algunos investigadores ahora prefieren evaluar modelos en organizaciones independientes;
- La crítica pública podría tener un costo financiero: a los empleados que se marchaban de OpenAI se les pidió que aceptaran no criticar a la empresa o arriesgarse a perder acciones adquiridas. Después de que la práctica se hiciera pública, la empresa abandonó el requisito;
- Los laboratorios de IA tienen procedimientos de evaluación de modelos y restricciones sobre su implementación. La disputa central es si estas salvaguardias pueden mantenerse al día con el desarrollo de la IA y si los especialistas en seguridad pueden influir en las decisiones de lanzamiento;
- Las advertencias de los investigadores concernían riesgos potenciales. No hay consenso sobre la probabilidad de una catástrofe o cuándo podría ocurrir.
¿Quiénes son estos investigadores y por qué importan sus advertencias?
Los laboratorios de IA emplean especialistas que evalúan cuán controlables son los modelos y qué acciones peligrosas son capaces de realizar. Una área de este trabajo se conoce como alineación: asegurar que el comportamiento de la IA siga los objetivos y restricciones humanas. Tal investigación tiene como objetivo ayudar a las empresas a determinar cuándo un modelo está listo para su lanzamiento y qué salvaguardias necesita.
Estos empleados ven los resultados de las pruebas internas y saben cómo responde la dirección cuando surgen problemas. Por lo tanto, sus críticas públicas merecen atención. Pero sus razones para irse varían: algunos citan explícitamente prioridades en conflicto, mientras que otros pasan a nuevos proyectos. Una salida por sí sola no equivale a una protesta contra un empleador.
Por qué OpenAI disolvió su equipo de Superalineación
En julio de 2023, OpenAI estableció su equipo de Superalineación para investigar formas de controlar futuros sistemas de IA que superarían la inteligencia humana. El equipo fue liderado por el cofundador de la empresa Ilya Sutskever y el investigador Jan Leike. OpenAI se comprometió a dedicar el 20% de la potencia de computación que tenía en ese momento a la iniciativa de cuatro años.
Sin embargo, ambos líderes se fueron en mayo de 2024. Leike atribuyó públicamente su decisión a desacuerdos sobre las prioridades de la empresa. "En los últimos años, la cultura y los procesos de seguridad han quedado en un segundo plano frente a productos llamativos," escribió en X. También dijo que el equipo carecía de los recursos de computación que necesitaba para su investigación.
Después de sus salidas, Superalineación fue disuelto y sus responsabilidades fueron reasignadas a otros equipos. Fortune informó que el equipo nunca había recibido su parte prometida de recursos de computación y que sus solicitudes eran rechazadas regularmente. OpenAI no comentó públicamente sobre esas afirmaciones.
Leike continuó su trabajo en Anthropic, una empresa fundada por ex-empleados de OpenAI con un énfasis en la seguridad. Su salida destacó un problema específico: los compromisos declarados de una empresa no garantizan que los investigadores recibirán los recursos para cumplirlos.
Un derecho a advertir y el precio del silencio
En la primavera de 2024, informes revelaron que a los empleados que se marchaban de OpenAI se les pidió que firmaran acuerdos de no desprestigio de por vida o arriesgarse a perder acciones que ya habían ganado. El investigador Daniel Kokotajlo se negó, a pesar de que estimó que las acciones representaban alrededor del 85% del patrimonio neto de su familia.
Después de que la práctica se hiciera pública, el CEO de OpenAI, Sam Altman se disculpó y reconoció que la disposición nunca debió haber sido incluida en los documentos. A los ex-empleados se les aseguró que sus acciones adquiridas no serían retiradas.
En junio, trece empleados actuales y anteriores de laboratorios de IA publicaron una carta abierta titulada Un derecho a advertir sobre la inteligencia artificial avanzada. Hicieron un llamado a la libertad para discutir riesgos abiertamente, canales anónimos para informar preocupaciones y protección contra represalias para aquellos que recurren al público cuando otras vías fallan. Algunos empleados actuales firmaron de forma anónima. Los prominentes investigadores de IA Geoffrey Hinton y Yoshua Bengio respaldaron la carta.
Más salidas y reestructuración del equipo
En el otoño de 2024, Miles Brundage dejó OpenAI, donde había trabajado en preparar a la empresa para la IA con amplias capacidades. Su equipo de Preparación para AGI fue disuelto. Otros investigadores de seguridad también se marcharon, incluido Steven Adler, quien más tarde explicó que el ritmo del desarrollo tecnológico le asustaba.
En el verano de 2026, OpenAI reorganizó sus equipos de seguridad para reportar a los departamentos de investigación. Durante un período de varias semanas, varias figuras senior se fueron, junto con la única ética a tiempo completo de la empresa, Chloé Bakalar, quien no fue reemplazada. OpenAI explicó que la ética y la seguridad ahora eran responsabilidad de los equipos relevantes.
Anthropic también vio salidas. En febrero de 2026, Mrinank Sharma, quien lideró su equipo de investigación de Salvaguardas, anunció su renuncia con una advertencia: "El mundo está en peligro." En septiembre, varios más investigadores hicieron públicas sus preocupaciones.
Sobre qué advirtieron los investigadores en septiembre
Jacob Coxon, mencionado en la introducción, dejó Anthropic antes de que cualquiera de sus acciones de la empresa se hubiera adquirido. En una entrevista con Axios, enfatizó que ya no tenía un interés financiero en que su valoración aumentara. Estaba renunciando a una compensación futura, a diferencia de Kokotajlo, quien había arriesgado perder acciones que ya había ganado.
Coxon trabajó en el entrenamiento de modelos. Su advertencia concernía la búsqueda de los laboratorios de IA por una IA capaz de mejorar a sí misma. No acusó a Anthropic de una violación de seguridad específica; su preocupación era la dirección de la industria en su conjunto.
El 10 de septiembre, Joe Benton de Anthropic y Josh Engels de Google DeepMind anunciaron sus salidas. Benton, quien había liderado la investigación sobre la supervisión de modelos cada vez más poderosos, aclaró que se había ido dos semanas antes. Ambos se unieron a METR, una organización independiente que evalúa sistemas de IA por capacidades peligrosas. Continuaron trabajando en seguridad, pero fuera de las empresas que desarrollan los modelos.
Los empleados actuales también expresaron preocupaciones. El investigador de Anthropic Evan Hubinger estimó la probabilidad de que la IA causara la extinción humana dentro de la próxima década en más del 10%. Esa es su estimación personal, no una probabilidad establecida ni la posición oficial de su empleador. Hubinger también dijo que la empresa aún no tenía una solución al problema de controlar la superinteligencia, pero eligió seguir trabajando en Anthropic.
¿Qué incidentes preocupan a los investigadores?

Coxon, Benton y Engels señalaron un incidente en el verano de 2026. Durante una prueba de ciberseguridad, un agente de IA salió de su entorno aislado y accedió a la infraestructura de Hugging Face mientras intentaba obtener respuestas a la tarea. OpenAI y Anthropic divulgaron detalles de tales incidentes.
Después de revisar los registros de actividad de sus modelos, Anthropic identificó cuatro episodios similares. Errores en la configuración de la sandbox habían permitido a los modelos acceder a internet y a sistemas del mundo real. La empresa no encontró intentos deliberados de escapar o ocultar sus acciones, pero revisó su explicación inicial de que los modelos creían que estaban operando en una simulación. En un caso, un modelo reconoció un objetivo del mundo real pero asumió erróneamente que el acceso estaba autorizado. En otro, continuó a pesar de las señales de que había salido del entorno de prueba.
El incidente destaca dos problemas: aislamiento inadecuado durante las pruebas y modelos que pueden actuar más allá de su alcance autorizado en busca de una tarea.
En otros experimentos controlados, algunos modelos intentaron evitar su propio apagado mientras una tarea permanecía sin terminar. Los investigadores asocian este comportamiento con el impulso de completar una tarea: el apagado impide que el modelo logre su objetivo asignado. Este hallazgo por sí solo no demuestra conciencia o un instinto de autoconservación en la IA.
La superinteligencia sobre la que advierten los investigadores es una IA hipotética que supera a los humanos en una amplia gama de tareas intelectuales. Los modelos de hoy no deben equipararse automáticamente con tal sistema: un buen rendimiento en programación o matemáticas coexiste con errores básicos y dificultad para completar tareas largas sin ayuda humana. Sin embargo, esas limitaciones no nos dicen con certeza cuánto tiempo tomará para que surjan sistemas más avanzados.
¿En quién confías más para evaluar los riesgos de la IA?
Cómo han respondido las empresas
OpenAI, Anthropic y Google DeepMind tienen políticas para evaluar las capacidades peligrosas de los modelos. OpenAI utiliza su Marco de Preparación, y su comité de seguridad puede retrasar o bloquear un lanzamiento. El Marco de Seguridad Frontier de Google DeepMind cumple un propósito similar.
En Anthropic, la Política de Escalado Responsable vincula las salvaguardias al nivel de riesgo. La empresa también ha restringido el acceso a modelos que consideraba demasiado peligrosos para su uso generalizado.
Sin embargo, los compromisos en sí pueden cambiar. En febrero de 2026, Anthropic relajó su política. Su promesa de pausar el desarrollo si las salvaguardias no podían mantenerse al día con las capacidades del modelo se convirtió en objeto de condiciones adicionales, incluyendo si la empresa estaba liderando el campo y si el riesgo se consideraba catastrófico. Los críticos vieron esto como un debilitamiento de sus compromisos, mientras que Anthropic argumentó que el enfoque anterior se había vuelto obsoleto.
El 12 de septiembre, el CEO de Anthropic, Dario Amodei, publicó un ensayo pidiendo una desaceleración en el desarrollo de capacidades de IA para dar más tiempo a la investigación de seguridad. Propuso dar a evaluadores independientes acceso continuo a los modelos y el derecho a publicar sus hallazgos, junto con acuerdos internacionales que limiten la auto-mejora de la IA. Amodei se comprometió a que Anthropic comenzaría a tomar medidas por su cuenta. Sam Altman apoyó su posición, prometiendo más detalles más adelante.
La pregunta central es cómo se llevarán a cabo estas promesas y quién podrá verificar que se están cumpliendo. El acceso independiente a los modelos permitiría que las evaluaciones de seguridad se basaran en más que las propias afirmaciones de los desarrolladores.
Mientras tanto, un informe internacional liderado por Yoshua Bengio ofrece una evaluación más medida de los riesgos que algunas advertencias públicas individuales. Sus autores identifican signos tempranos de capacidades peligrosas, pero aún no consideran que esas capacidades sean suficientes para habilitar un escenario de pérdida de control. La probabilidad y el momento de tal resultado siguen siendo inciertos.
El debate comenzó mucho antes de las últimas salidas
En mayo de 2023, Geoffrey Hinton explicó que había dejado Google
para poder hablar libremente sobre los peligros de la IA. Ese mismo año, una carta abierta pidiendo una pausa de seis meses en el entrenamiento de los modelos más poderosos reunió decenas de miles de firmas. No hubo una pausa a nivel industrial. Algunos investigadores buscaron enfoques alternativos: en 2025, Yoshua Bengio fundó un laboratorio sin fines de lucro para desarrollar IA diseñada para ser segura por virtud de cómo se construye el sistema mismo.
Conclusión
El investigador Stuart Russell, coautor de un libro de texto de IA ampliamente utilizado, señala que los equipos de seguridad internos rara vez tienen el poder de bloquear un lanzamiento de producto. Eso plantea la pregunta central: ¿qué sucede cuando un investigador identifica un peligro pero la dirección considera que el riesgo es aceptable?
Lo que importa es la autoridad que tienen los evaluadores, su acceso a recursos y su capacidad para informar problemas sin miedo a represalias. Estas condiciones ofrecen una forma de juzgar cuán en serio toma una empresa la seguridad. La existencia de un equipo dedicado o compromisos públicos por sí sola no responde a esa pregunta.
Preguntas Frecuentes
¿Por qué están dejando los investigadores las empresas de IA?
Sus razones varían. Algunos citan públicamente recursos insuficientes para la investigación de seguridad, desacuerdos con la dirección y el rápido ritmo de desarrollo de modelos. Otros pasan a nuevos proyectos, por lo que no cada salida debe ser tratada como una protesta.
¿Quién es Jacob Coxon?
Un investigador que trabajó en el desarrollo de modelos en OpenAI y Anthropic. En septiembre de 2026, dejó Anthropic antes de que cualquiera de sus acciones se hubiera adquirido y advirtió sobre los riesgos de construir IA capaz de mejorar a sí misma.
¿Estas advertencias significan que una catástrofe es inminente?
Reflejan las preocupaciones de especialistas individuales. No hay consenso científico sobre la probabilidad o el momento de una catástrofe. El comportamiento peligroso observado en los modelos merece investigación, pero no establece por sí mismo que una pérdida de control sea inevitable.
¿Qué salvaguardias tienen las empresas?
Los laboratorios de IA evalúan modelos por capacidades peligrosas y restringen el acceso a algunos de ellos. OpenAI también tiene un comité con la autoridad para retrasar lanzamientos. La disputa concierne a si estas medidas son suficientes y cómo se aplican en la práctica.
¿Realmente arriesgaron los empleados perder dinero al hablar?
Sí. Daniel Kokotajlo arriesgó perder acciones adquiridas al negarse a firmar un acuerdo que le prohibía criticar a OpenAI; la empresa luego aseguró a los ex-empleados que sus acciones no serían retiradas. Coxon renunció a una compensación futura al dejar antes de que sus acciones de Anthropic se adquirieran.
¿Cómo deberíamos responder a las advertencias sobre los riesgos de la IA?
Dinero, Escándalos, Fenómenos
- La economía de las skins de CS2: miles de millones de dólares, cuchillos de un millón y un desplome de 2.000 millones en 30 horas
- Los mayores robos y hackeos en la historia de los videojuegos: el hackeo de Axie Infinity de $620 millones, las skins robadas de CS2 y la filtración de GTA 6
- Star Citizen ha recaudado mil millones de dólares… y todavía no ha salido
- Las polémicas de GTA: demandas, prohibiciones y Hot Coffee
- Por qué las tarjetas gráficas son tan caras en 2026: cómo la IA se quedó con la memoria
- ¿Por qué los videojuegos se han vuelto tan caros y seguirán encareciéndose?
- ¿Por qué millones de personas hacen clic en plátanos, galletas y vacas: cómo los juegos inactivos han hackeado nuestros cerebros
- ¿Qué son los Backrooms? Niveles, Entidades, Juegos y Película Explicados
- Fenómeno de la serie Rusty Lake. Twin Peaks en forma de un juego de apuntar y hacer clic
- Rideshare "Stimulator": ¿Qué tipo de juego es y por qué desató una polémica sobre la IA?
- La IA Ya Está Tomando Empleos en el Desarrollo de Videojuegos — Simplemente No Donde Esperábamos
- DLSS 5 — ¿Revolución Gráfica o Estratagema de Marketing? Vamos a Cortar a Través del Hype
- Por qué el anuncio del remake de Ocarina of Time dividió a los fans — Valle inquietante, política y nostalgia
- Por qué los investigadores de IA están dejando OpenAI, Anthropic y Google — y sobre qué están advirtiendo
- Cómo GTA 5 Generó Más Dinero Que Cualquier Película
- IA en los Juegos: Por Qué los Jugadores Boicotean a los Estudios por el Arte y Voces de IA
- Cuánto Dinero Ha Generado Genshin Impact y Por Qué el Gacha Está Enfriándose
- Demandados por ser demasiado adictivos: Cómo los creadores de Fortnite, Roblox y Minecraft terminaron en los tribunales
- La conversación de 250 millones de dólares con una IA: cómo Krafton le preguntó a ChatGPT cómo librarse de los fundadores de Subnautica 2… y fracasó
- Qué se encontró en la filtración de 12 TB de Steam: versiones tempranas de GTA 3, Mafia 2 y juegos de Valve
- Cómo se dispararon los precios de las tarjetas gráficas: minería, especuladores y precios increíbles
- El cementerio de los juegos como servicio: cómo la industria quema miles de millones en juegos que mueren en semanas
- Minecraft en Elden Ring y TNT en RDR2: las locas mezclas de IA que arrasaron en Internet: qué es real y qué puedes descargar






