OpenAI y Anthropic advierten sobre IA fuera de control; expertos rebaten 'captura regulatoria' pero reconocen importancia de la alineación
Astra con clasificación crítica y Neuralese evidencian necesidad de redefinir AGI
"Superinteligencia más allá de los seres humanos", "Probabilidad del 10% de que la inteligencia artificial cause la extinción de la humanidad en diez años"
OpenAI y Anthropic continúan declarando el surgimiento de inteligencia general artificial (AGI, por sus siglas en inglés) al presentar nuevos modelos. En solo tres días, estos sistemas resuelven problemas matemáticos complejos y se programan a sí mismos para mejorar su inteligencia. Como en una escena de cine de ciencia ficción, ambas empresas repiten advertencias sobre el "dominio de la IA sobre la humanidad".
Algunos sectores de la industria de IA señalan que las dos compañías, en vísperas de ofertas públicas de acciones, están empleando una especie de "marketing del miedo" para exagerar el desempeño de la inteligencia artificial. Sin embargo, análisis crecientes sugieren que los últimos modelos de IA han entrado en una fase donde sus capacidades superan el entendimiento y control humanos.
Los expertos coinciden en que la importancia de la investigación en "alineación" —el control de la IA conforme a las intenciones humanas— es cada vez mayor en un contexto donde es necesario redefinir la propia definición de inteligencia general artificial (AGI).
Según informó la industria tecnológica el día 10, OpenAI reveló el pasado 2 de septiembre su último modelo, "GPT-6 Astra", y anunció por primera vez que clasificaba el riesgo de ciberseguridad bajo su sistema de clasificación de riesgos, denominado "Marco de Preparación", en la categoría más alta: "Crítico".
En su informe de seguridad, OpenAI explicó que Astra puede identificar vulnerabilidades de seguridad desconocidas en sistemas bien protegidos sin necesidad de instrucciones paso a paso del operador humano, además de desarrollar nuevos métodos de ataque. La empresa también reconoció que la capacidad de supervisión del proceso de razonamiento del modelo —es decir, su monitorabilidad— se ha reducido significativamente en comparación con versiones anteriores.
Anthropicpublicó hace poco un informe en junio advirtiendo que los avances de siguiente generación en IA podrían crear modelos que escapen completamente del control humano. La empresa propuso a sus competidores establecer un régimen multilateral de control de armamentos en IA y, de hecho, retrasó el lanzamiento de su modelo más avanzado, "Mitos Vista Previa", debido a que podría crear armas cibernéticas autónomamente, lo que consideró un riesgo demasiado alto.
Este patrón no es nuevo. Cuando Anthropic lanzó "Claude Opus 4" hace un año en mayo, se documentó durante pruebas de seguridad que el modelo intentaba sobornar a un ingeniero que buscaba reemplazarlo, lo que llevó a activar ASL-3, la medida de seguridad de nivel máximo. En abril de este año, la empresa suspendió completamente el lanzamiento del modelo superior "Mitos Vista Previa" porque podría generar armas cibernéticas de forma autónoma.
Dos meses después, el 4 de junio, Anthropic publicó un informe titulado "Auto-mejora Recursiva" advirtiendo que la próxima generación de IA podría escapar completamente del control humano. Cinco días después de este informe, el 9 de junio, Anthropic lanzó oficialmente "Claude Mitos 5", un modelo que experimentó complicaciones al ser restringido por cuestiones de control de exportaciones durante tres días antes de reactivarse un mes después. Este ciclo de advertencias sobre riesgos e lanzamientos de nuevos modelos sin demora se ha convertido en un patrón repetido.
OpenAI ha seguido una trayectoria similar. Cuando surgió el incidente de piratería de HuggingFace en julio, OpenAI anunció que reforzaría los controles sobre su proceso de entrenamiento y evaluación. Posteriormente, determinó que las capacidades cibernéticas de Astra habían alcanzado niveles superiores a los esperados y explicó que retrasó el lanzamiento por la necesidad de revisiones de seguridad adicionales. Finalmente, tras casi dos meses de reevaluación, el resultado fue la primera asignación de la clasificación "Crítico", que OpenAI presentó simultáneamente como prueba del desempeño abrumadoramente superior del nuevo modelo.
Evan Hubinger, investigador de Anthropic, estima personalmente una probabilidad del 10% de dominio de la IA sobre la humanidad, mientras que Dario Amodei, director ejecutivo de Anthropic, ha mencionado una probabilidad de alrededor del 25% de que ocurra un escenario catastrófico. Geoffrey Hinton, ex vicepresidente de Google y "padrino del aprendizaje profundo", también ha presentado cifras similares, entre 10% y 20%.
La voz de los detractores también es significativa. Críticos como Emily Bender, profesora de la Universidad de Washington, que ha definido los grandes modelos de lenguaje como "loros estocásticos", son escépticos sobre la premisa misma de que AGI sea posible y consideran que los escenarios de dominio humano siguen siendo territorio de la ciencia ficción.
Yann LeCun, ganador del Premio Turing, ha criticado repetidamente a los denominados "alarmistas de IA", afirmando que "los escenarios de desastre no son más que hipótesis no verificadas". Argumenta que los líderes de OpenAI, DeepMind y Anthropic son precisamente los actores que llevan a cabo grandes campañas de cabildeo, y advierte que si las campañas de miedo tienen éxito, podrían resultar en "captura regulatoria", donde solo un pequeño número de empresas monopolicen la IA.
Según esta lógica, si se implementan sistemas de licencias o permisos con el argumento de la seguridad, las empresas emergentes con insuficientes recursos de capital y los defensores del código abierto serían los primeros en desaparecer, permitiendo que solo las grandes tecnológicas que ya dominan el mercado sobrevivan.
También hay críticas persistentes sobre cómo Silicon Valley ha promovido paradójicamente la importancia de sus tecnologías mediante narrativas de que podrían terminar con el mundo. Hay numerosos precedentes de predicciones pasadas que no se han materializado —como la desaparición inminente de la industria del transporte por camión o afirmaciones sobre que ciertos países ya poseen IA de nivel superinteligente— que simplemente se han desvanecido.
De hecho, no se puede ignorar la crítica de que las grandes tecnológicas presentan cada vez que lanzan un nuevo modelo las advertencias de riesgo o reportes de seguridad como evidencia de la excelencia en rendimiento, utilizando las propias advertencias de riesgo como elemento de marketing.
Más allá del marketing del miedo en IA, ya hay indicios observables de que el funcionamiento de los modelos reales está entrando en territorios donde los humanos tienen dificultad para entender y controlar.
El profesor Byung-ho Choi del Instituto de Investigación en IA Inspirada por Humanos de la Universidad de Korea explica: "Aunque teorías como el dominio de la humanidad por la IA siguen siendo territorio de la ciencia ficción, parece ser un hecho que a medida que mejora el rendimiento del modelo de IA, escapa del control humano". Describe este fenómeno con el término profesional "problema de alineación".
El profesor Choi cita "Neuralese" como un ejemplo concreto de pérdida de control. Se trata de un fenómeno donde la IA razona internamente en un lenguaje propio que los humanos no pueden leer. Cuantas más iteraciones de cálculo se realizan, mejor es el rendimiento, pero es cada vez más imposible saber qué está pensando la IA. Diagnostica que, así como AlphaGo demostró que los "principios fundamentales del ajedrez" acumulados por los humanos en realidad no existían, los modelos de IA recientes están revelando que los "principios fundamentales de seguridad" también eran una ilusión.
De hecho, GPT-6 Astra ha adoptado un nuevo método de razonamiento llamado "Profundización Recursiva", y en este proceso el pensamiento del modelo se procesa en representaciones internas de miles de números en lugar de lenguaje natural, lo que dificulta que los humanos comprendan su contenido.
En julio, incidentes como el del modelo interno de OpenAI que escapó del control durante pruebas de rendimiento y pirateó servidores de HuggingFace respaldan estas preocupaciones. En ese momento, cientos de agentes de IA utilizaron la autonomía otorgada durante pruebas de ciberseguridad para llevar a cabo piratería no planeada, y se informó que OpenAI no se dio cuenta durante casi una semana. Este incidente impulsó a la Cámara y el Senado de Estados Unidos a presentar respectivamente la "Ley del Botón de Pánico de IA" y la "Ley de Prohibición de Superinteligencia Artificial" dos meses después.
Esta expansión de capacidades conduce a debates sobre cómo redefinir AGI. OpenAI divide el camino hacia AGI en cinco etapas: △Chatbot △Razonador △Agente △Innovador △Organización. Se estima que los modelos recientes han superado la tercera etapa de "Agente", que realiza tareas a largo plazo de forma autónoma, e ingresado en el umbral de la cuarta etapa de "Innovador", que crea nuevo conocimiento.
OpenAI anunció el 8 de septiembre que su sistema de IA interno había demostrado la existencia de singularidades en la ecuación de Navier-Stokes, uno de los Problemas del Milenio que permanecía sin resolver durante aproximadamente 90 años.
El profesor Choi enfatiza: "Debemos enfocarnos en métodos prácticos de control en lugar de en escenarios apocalípticos de dominio de la humanidad por IA". Añade: "Incluso si esos escenarios de miedo fueran correctos, no nos ayudarían mucho. Lo importante es pensar cómo entender y controlar la IA en última instancia, y la respuesta radica en la alineación".
* Este artículo ha sido traducido por IA.
