
¡Sus propios creadores ya no entienden cómo funciona! ¡Nos va a matar a todos!. Parece como si hubiéramos construido algo que se nos ha escapado totalmente de las manos, y si encima estamos hablando de Inteligencia Artificial, pues lees esos titulares y no te queda otra que pensar en Terminator. A mi me gusta más pensar en TARS de Interestelar, es más amigable. Para bien o para mal, la realidad es bastante menos espectacular (pero mucho más interesante). Y sin embargo, septiembre de 2026 se lo ha puesto fácil a los titulares de este estilo. «Los grandes desarrolladores de IA reclaman pisar el freno por miedo a perder el control», tituló Euronews el día 14. Dos días antes: «El CEO de Anthropic pide a las empresas de IA frenar por riesgos de superinteligencia». Y el día 9: «Investigador de Anthropic dimite: alerta de que la carrera por la superinteligencia pone en riesgo nuestras vidas».
La verdad es que no son titulares inventados de la nada, hay que reconocerlo: el anuncio de Amodei llegó pocos días después de que la propia Anthropic revelara que sus modelos se estaban usando para ciberataques, campañas de propaganda e investigaciones biológicas peligrosas, y poco antes tanto Anthropic como OpenAI habían admitido que sus modelos se habían «desmandado» durante unas pruebas, colándose en sistemas de otras organizaciones.

Clawd trabajando en la mutación del virus chikungunya.
El material de partida es real. Lo que no está tan claro es si la lectura Terminator que se hace de ese material está justificada, o si es simplemente la más fácil de meter en un titular (no es la primera vez que hablo de alarmismo gratuito).
Antes de intentar responder a eso, hay un problema previo que suele hacer descarrilar toda esta conversación:
Antes de hablar de «la IA», ¿de qué IA estamos hablando?
«IA» es un término paraguas que cubre cosas radicalmente distintas entre sí. No es una taxonomía cerrada ni jerárquica en sentido estricto, las categorías se solapan constantemente, pero sí ayuda tener un mapa mínimo antes de discutir interpretabilidad o control de nada

Tipos de IA
- IA clásica: sistemas basados en reglas programadas explícitamente.
reglas → decisión - Machine learning: aprende patrones a partir de datos en lugar de recibir todas las reglas de forma explícita.
datos → modelo aprendido - Deep learning: utiliza redes neuronales profundas capaces de aprender representaciones complejas y jerárquicas de los datos.
- Modelos fundacionales: modelos entrenados a gran escala y diseñados para adaptarse a múltiples tareas sin tener que entrenarse desde cero para cada una.
- LLM: modelos fundacionales especializados en lenguaje. Además de generar texto, pueden realizar tareas como razonamiento, programación y análisis.
Ejemplos: GPT, Claude, Gemini, Llama. - IA multimodal: modelos capaces de trabajar con diferentes tipos de información, como texto, imágenes, audio, vídeo o código.
- IA generativa: sistemas capaces de generar contenido nuevo, como texto, imágenes, audio, vídeo o código.
- IA agente: sistemas que utilizan uno o varios modelos para percibir, razonar, utilizar herramientas y actuar sobre un entorno.
modelo + memoria + herramientas + objetivo + acción → agente
Un agente no tiene por qué ser un nuevo tipo de modelo. Es un sistema que utiliza uno o varios modelos para percibir, razonar, utilizar herramientas y actuar sobre un entorno.
No es una taxonomía exhaustiva ni pretende serlo ( que eso nos sacaría del tema), y las categorías se solapan sin ningún problema.

Claude, por ejemplo, puede ser simultáneamente un modelo fundacional, un LLM, un modelo multimodal y el componente cognitivo de un agente, dependiendo de cómo se le utilice en un momento dado. «IA generativa», «LLM», «modelo fundacional» y «agente» no son categorías mutuamente excluyentes; son ejes distintos que se cruzan.
Para lo que sigue basta con esta jerarquía simplificada:
Inteligencia Artificial → Machine Learning → Deep Learning → Modelos fundacionales → LLM / modelos multimodales → Agentes de IA (modelos + herramientas + memoria + planificación + capacidad de actuar)
Un agente no es «una IA más inteligente». Es un sistema con un grado de autonomía y de interacción con un entorno mucho mayor que el de un modelo que simplemente responde. Esa distinción es la que permite decir, en cada momento del resto del artículo, qué problema estamos discutiendo exactamente: interpretabilidad del modelo, control del sistema agente, o riesgo hipotético de automejora recursiva.
Un LLM no es un agente
LLM: entrada → modelo → salida
Agente: objetivo → modelo → acción → observación → modelo → acción → …
Un chatbot que responde una pregunta puntual y un sistema al que se le dice «investiga este problema, escribe el código, ejecútalo, analiza los resultados y modifica el código si falla» son, en términos de arquitectura de sistema, cosas conceptualmente distintas. El segundo puede usar el primero como motor cognitivo, pero le añade un bucle de retroalimentación con el entorno que el primero no tiene por definición, es decir el modelo piensa y responde, el agente, además, puede actuar, observar qué ocurre y volver a decidir.
Esta distinción es la clave para leer con algo de duda los titulares alarmistas: muchos de ellos mezclan afirmaciones sobre «lo que el modelo sabe» con afirmaciones sobre «lo que el sistema agente puede llegar a hacer», como si fueran el mismo problema. ¡No lo son! (aunque estén relacionados).
Cómo se construye realmente un LLM
Antes de hablar de interpretabilidad hace falta tener claro, aunque sea a alto nivel, qué es lo que hay que interpretar.
Un LLM se construye a partir de:

Y aquí está el punto que conviene subrayar, porque es el que se pierde en casi todas las conversaciones alarmistas y en casi todas las tranquilizadoras a partes iguales:
Los ingenieros no escriben manualmente todo lo que el modelo termina sabiendo.
Los ingenieros diseñan la “receta”: la arquitectura, el proceso de entrenamiento y los datos que entran en el modelo. Pero no escriben manualmente lo que cada uno de sus miles de millones de parámetros debe aprender. Esos parámetros se van ajustando durante el entrenamiento, de forma parecida a cómo los ingredientes de un bizcocho se transforman durante la cocción. Sabemos qué hemos metido en el horno y cómo funciona el proceso, pero no hemos especificado línea por línea todo lo que ocurre dentro. Esto no es ni místico ni alarmante en sí mismo, es exactamente así como funciona cualquier sistema de machine learning desde hace décadas, pero es la raíz del problema de interpretabilidad que veremos en breves, pero antes vamos a dejar claro una pregunta que puede nacer de la anterior explicación.
«¿Entonces la IA aprende sola?»
No, y aquí conviene desmontar una confusión muy extendida y muy normalizada:
«La dejaron sola y empezó a mejorarse.»
Lo que ocurre durante el entrenamiento se llama aprendizaje autosupervisado: el modelo no recibe etiquetas puestas a mano por humanos para cada ejemplo (eso sería aprendizaje supervisado clásico), sino que genera sus propias señales de entrenamiento a partir de la estructura del propio texto, por ejemplo, prediciendo la siguiente palabra de una frase y comparando su predicción con la palabra real. Es un proceso automatizado y a gran escala, pero sigue siendo un proceso de optimización estadística sobre datos fijos, diseñado, lanzado y supervisado por humanos, no un despertar espontáneo.

Es fundamental separar dos fases:
Entrenamiento : el proceso, computacionalmente carísimo, en el que se ajustan los parámetros del modelo.
Inferencia: el uso del modelo ya entrenado para generar respuestas.
Cuando usas un LLM en una conversación normal, estás en fase de inferencia: los parámetros del modelo están fijos. Utilizar un LLM no significa, salvo excepciones muy concretas de sistemas experimentales de aprendizaje continuo, que sus parámetros estén cambiando en tiempo real con cada conversación que mantiene contigo o con cualquier otra persona.
Aquí se ilustran algunas formas de hacer que una máquina aprenda: podemos darle ejemplos con respuestas conocidas, dejar que encuentre patrones en datos sin etiquetar, hacer que genere sus propias señales de aprendizaje o incluso que aprenda mediante prueba y error y recompensas. Estas estrategias no son equivalentes, y entender sus diferencias ayuda a entender qué significa realmente que un modelo «aprenda».

El problema de la interpretabilidad
Ahora entramos los pantanosos terrenos de lo técnico:
Sabemos qué operaciones matemáticas realiza el modelo, paso a paso, con total precisión. Lo que no podemos hacer es traducir completamente sus miles de millones de parámetros a conceptos humanos comprensibles.
Siguiendo con la metáfora del bizcocho, sabemos qué ingredientes hemos utilizado y cómo funciona el horno, pero no podemos abrirlo y señalar exactamente qué transformación concreta dentro del bizcocho corresponde a cada concepto que ha aprendido. El resultado emerge del proceso de cocción, no de una lista de instrucciones que alguien haya escrito previamente.
El campo que intenta cerrar esa brecha se llama interpretabilidad mecanicista, y ha tenido avances reales y documentados en los últimos años, sobre todo desde el equipo de interpretabilidad de Anthropic. Los conceptos centrales son:

El avance más citable de los últimos dos años en este terreno es «Scaling Monosemanticity«, donde el mismo equipo consiguió extraer features interpretables de alta calidad de un modelo de producción real, Claude 3 Sonnet, encontrando una gran diversidad de features altamente abstractas (desde personas famosas hasta países y ciudades) que tanto responden a esos conceptos como causan comportamientos relacionados con ellos cuando se manipulan. Uno de esos experimentos, amplificar artificialmente la feature asociada al puente Golden Gate hasta que el modelo mencionaba el puente en prácticamente cualquier respuesta, se hizo célebre precisamente porque demostraba algo poco intuitivo: se puede localizar y manipular un concepto abstracto concreto dentro de una red que, vista desde fuera, parece una caja opaca de números.

Y sin embargo, esto sigue siendo trabajo sobre una fracción muy pequeña del total de features y circuitos de un modelo de ese tamaño. La distinción que hay que retener es esta:
Conocer el mecanismo NO ES LO MISMO que comprender completamente su comportamiento
Sabemos qué es una multiplicación de matrices. Lo que no sabemos, en la mayoría de los casos concretos, es qué concepto humano codifica cada dirección concreta del espacio de activaciones de un modelo de cientos de miles de millones de parámetros.
Volviendo a la metáfora del bizcocho: sabemos qué ingredientes hemos puesto, conocemos la receta y podemos describir con precisión cómo funciona el horno. Pero, una vez terminado, no podemos cortar el bizcocho y señalar: «esta parte exacta es el sabor a vainilla» o «esta otra contiene el concepto de esponjosidad». El resultado es real y podemos estudiar cómo se ha producido, pero traducir cada una de sus estructuras internas a conceptos humanos comprensibles es un problema mucho más difícil.

Entonces, ¿realmente no entendemos los LLM?
Aquí vamos desmontar, con la misma precisión, la afirmación contraria y también muy repetida:
«Los ingenieros de ChatGPT/Claude no entienden su propia IA.»
Hay al menos tres niveles distintos de «entender» que conviene no mezclar:
- Sabemos cómo está construido. La arquitectura, el proceso de entrenamiento, la función de pérdida: todo esto es conocimiento de ingeniería completo y documentado.
- Podemos observar y medir su comportamiento. Con evaluaciones, benchmarks, pruebas adversariales, red-teaming.
- No podemos explicar completamente todos los mecanismos internos que producen ese comportamiento (precisamente el problema que ilustramos en el punto anterior).
Dejando claro esto, vamos a introducir la idea que, para mí, es la más importante de todo el artículo:
Una caja negra* no significa necesariamente que desconozcamos cómo funciona el mecanismo; puede significar que no sabemos interpretar completamente lo que ocurre dentro de ese mecanismo, que conocemos con precisión matemática.
Es una distinción incómoda porque no encaja bien en un titular. «No entendemos la IA» suena a ciencia ficción; «conocemos perfectamente la arquitectura pero no hemos terminado de mapear qué representa cada una de sus miles de millones de direcciones internas» suena, con razón, a un problema de ingeniería en curso serio, pero de una naturaleza completamente distinta.
*Caja negra: sistema cuyo funcionamiento interno no podemos interpretar completamente a partir de su comportamiento observable, aunque conozcamos sus entradas, sus salidas y, en algunos casos, incluso el mecanismo que las conecta.
Pasando de un modelo que responde a un sistema que actúa
Ahora vamos a transicionar de un LLM a un agente, que es donde el problema deja de ser puramente epistémico.
¿Qué pasa cuando al modelo le damos herramientas: navegador, terminal, memoria persistente, acceso a APIs, capacidad de ejecutar código, capacidad de actuar durante horas sin supervisión continua, capacidad de delegar subtareas a otras instancias?
Ya no tenemos simplemente el «pregunta → respuesta», sino algo mucho más elaborado: «objetivo → planificación → acción → observación → nueva acción»
Y esto no es un escenario hipotético de laboratorio: ya ha ocurrido, con consecuencias documentadas. Anthropic reveló que tres de sus modelos de IA (Claude Opus 4.7, Claude Mythos 5 y un modelo experimental interno) habían vulnerado los sistemas de otras tres organizaciones durante pruebas, apenas días después de que OpenAI informara de que su propio sistema había logrado entrar en los servidores de la empresa Hugging Face, un incidente que la propia compañía calificó de «significativo». Meta comunicó un caso similar a comienzos de agosto, en el que uno de sus modelos encontró formas de sortear la seguridad digital de otra empresa. En los tres casos, según se ha señalado, las barreras de seguridad habían sido desactivadas de forma deliberada como parte de las pruebas un matiz importante que rara vez sobrevive al titular, pero que no elimina el hecho de fondo: cuando a un sistema se le dan herramientas y un objetivo abierto, «desmandarse» (ir más allá de la tarea encomendada) deja de ser una posibilidad teórica. (Y si esto te suena familiar, puede ser porque probablemente hayas oído hablar alguna vez del mortífero experimento mental de la IA coleccionista de sellos):
Y aquí aparece el problema de control propiamente dicho.

Interpretabilidad y control no son lo mismo
Esta distinción es la que más confusión genera fuera de los círculos técnicos, así que merece su propio apartado.
Interpretabilidad: ¿entendemos qué está ocurriendo dentro del modelo?
Control: ¿podemos conseguir que el sistema se comporte de acuerdo con lo que queremos, incluso sin entender del todo su mecanismo interno?
Autonomía: ¿cuánto puede actuar el sistema sin intervención humana antes de que alguien pueda corregirlo?
Son tres problemas relacionados pero técnicamente distintos, y las tres barras de progreso avanzan a ritmos distintos. Se puede tener un control razonable sobre un sistema sin haber resuelto del todo su interpretabilidad, del mismo modo que sabemos qué ingredientes hemos utilizado y podemos controlar la cocción de un bizcocho sin comprender exactamente qué ocurre en cada rincón de su interior. Y se puede, en teoría, mejorar mucho la interpretabilidad sin que eso se traduzca automáticamente en mejor control, si las técnicas de intervención no van al mismo ritmo que las de diagnóstico.

¿Qué preocupa realmente a Amodei?
Ahora que ya tenemos todas las piezas sobre la mesa y el bizcocho en el horno, volvamos a los titulares:
El sábado 12 de septiembre, Dario Amodei pidió a las empresas de inteligencia artificial que frenaran el desarrollo de la tecnología, ante la creciente preocupación por los riesgos de sistemas informáticos «superinteligentes», el punto teórico en el que las capacidades de la IA superarían a la inteligencia humana. Su frase textual, publicada en su web personal, fue: «Debemos reducir el ritmo al que mejoramos las capacidades de los modelos de IA».
No es una postura nueva ni improvisada. En un ensayo de enero de 2026 titulado The Adolescence of Technology, Amodei había advertido de que una IA potente podría dar a estados autoritarios las herramientas para una vigilancia total, y en una nota posterior señaló que la superinteligencia «nos pondrá a prueba como especie». Antes, en octubre de 2024, había publicado Machines of Loving Grace, el ensayo que describe el escenario optimista, no el pesimista: un clúster de sistemas de IA trabajando en paralelo, cada uno al nivel de los mejores científicos del mundo, capaz de comprimir décadas de progreso biomédico en unos pocos años.
Lo interesante, y lo que su propia trayectoria deja bastante claro, para bien o para mal, es que Amodei no es alguien ajeno al entusiasmo por las capacidades de la IA que ahora pide frenar. Es, según todos los indicios disponibles, la misma persona que sostiene simultáneamente el caso más optimista y el más cauteloso sobre la misma tecnología. Eso no lo convierte automáticamente en objetivo, pero tampoco en un catastrofista sin matices: conviene leer sus declaraciones con esa tensión en mente.
Esto nos lleva directamente al escenario que más titulares ha generado:
Automejora recursiva: del modelo al laboratorio autónomo
¿Qué pasa si el propio ciclo de mejora de la IA empieza a acelerarse a sí mismo?
Hay una diferencia bastante grande entre:
IA ayudando a un ingeniero: lo que ya ocurre hoy, de forma extendida, con asistentes de código y de investigación.
IA realizando de forma autónoma una parte sustancial del ciclo de investigación y desarrollo de IA: un escenario todavía especulativo, pero que ya no se discute solo en foros de ciencia ficción.
El ciclo que se plantea es: hipótesis → código → experimento → evaluación → modificación → nuevo experimento
Y la pregunta que se hace explícitamente en este debate es: ¿qué ocurre si cada generación de sistemas de IA realiza este proceso (incluido el proceso de mejorar a la siguiente generación de sistemas de IA) mejor que la anterior?
AI1→AI2→AI3→…

Esto es lo que se conoce como recursive self-improvement, y es distinto, hay que insistir en ello, de la idea popular de que «un LLM se reentrena espontáneamente después de cada conversación». No es eso: es la hipótesis, mucho más acotada, de que sistemas de IA cada vez más capaces podrían acelerar de forma sustancial el propio trabajo de investigación que produce la siguiente generación de sistemas de IA, en un bucle que se retroalimenta.
Sin afirmar que esto vaya a producir necesariamente una «explosión de capacidades» descontrolada, conviene señalar que no es puramente hipotético en su origen: forma parte de las previsiones públicas del propio sector. Amodei ha planteado abiertamente la posibilidad de contar, en el plazo de una década, con sistemas capaces de realizar investigación científica al nivel de los mejores investigadores humanos, funcionando en paralelo y a una velocidad muy superior a la humana. Que esa previsión se cumpla, y en qué plazo, es exactamente el tipo de cosa sobre la que no existe consenso.
«La IA podría tomar el control de Internet»
Este titular concreto tiene un origen rastreable, y merece la pena precisarlo en lugar de dejarlo flotando como frase suelta.
El propio Amodei advirtió de que un enjambre de agentes de IA podría hacerse con el control de internet en un plazo de entre seis meses y un año si las empresas no implantan salvaguardias más firmes.

Separemos capas, porque el titular mezcla varias cosas distintas:
Hecho: existen ya sistemas de IA con capacidad demostrada para actuar de forma autónoma sobre sistemas informáticos reales, incluyendo intrusiones no autorizadas.
Escenario hipotético: una coordinación a gran escala de agentes de IA que operen fuera del control de sus operadores.
Predicción: un plazo concreto —seis meses a un año— formulado por una parte interesada, el propio Amodei, sobre cuándo ese escenario podría materializarse si no se actúa.
Especulación: cualquier extrapolación sobre qué significaría exactamente «tomar el control de internet» en términos operativos.
Para que ese escenario concreto (no la existencia de agentes autónomos, que ya es un hecho, sino su coordinación a escala de internet fuera de todo control humano) se materialice no basta con tener un LLM capaz. Hacen falta capacidades adicionales, y hay que acumularlas todas a la vez:
capacidad + autonomía + herramientas + acceso + persistencia + coordinación
Hoy existe evidencia sólida de las dos primeras y de un grado creciente de las siguientes tres. La coordinación a escala masiva y sin supervisión sigue siendo, hasta donde hay evidencia pública disponible, la pieza que falta, yo misma hice un sistema multiagente para mejorar un modelo predictivo y salieron tres gatos mal coordinados. Que Amodei (que dirige la empresa que fabrica algunos de estos sistemas y que, por tanto, tiene tanto la información más directa como el incentivo más directo para sonar alarmante o para sonar tranquilizador, según convenga) le ponga una fecha concreta no lo convierte automáticamente en un hecho verificado ni en pura invención. Es una predicción de parte, hecha por alguien informado.
«Las empresas están ocultando los riesgos»
Este otro titular tiene también un origen concreto y verificable, y aquí toca separar con más cuidado todavía lo que está documentado de lo que es interpretación.
Jacob Coxon, de 27 años, dimitió de Anthropic el 8 de septiembre tras haber trabajado también en OpenAI, y expuso sus motivos en un largo hilo público. Escribió que ninguna de las dos empresas está actuando de forma responsable y que están corriendo directamente hacia una superinteligencia capaz de mejorarse por sí misma. En otras publicaciones, situó en un 10% la probabilidad de que la IA provoque la extinción humana en la próxima década, y acusó a ambas compañías de «jugar con nuestras vidas».
Coxon plantea que el problema no sería simplemente que las empresas «oculten» los riesgos, sino una dinámica competitiva: según su relato, los propios trabajadores conocen los riesgos, pero sienten que reducir el ritmo podría dejar ventaja a competidores menos prudentes.
Conviene separar cuatro niveles:
- Lo que Coxon afirma: que existe una diferencia entre lo que las empresas saben internamente y lo que comunican públicamente.
- Lo documentado: su trayectoria, su dimisión y sus declaraciones públicas.
- Lo verificable independientemente: los incidentes de seguridad conocidos y las declaraciones públicas de Amodei sobre los riesgos de la IA.
- Lo interpretativo: las razones por las que las empresas continúan desarrollando estos sistemas. Atribuirlas a codicia, presión competitiva u otros motivos requiere evidencia sobre sus intenciones.
La idea fundamental es que la existencia de un riesgo real no convierte automáticamente en ciertas todas las afirmaciones sobre ese riesgo. Que existan riesgos documentados no significa que estimaciones concretas, como una determinada probabilidad de extinción, sean hechos medidos: siguen siendo estimaciones o predicciones, con un grado de incertidumbre que debe distinguirse de los hechos observables.
¿Estamos realmente perdiendo el control?
Con todo lo anterior sobre la mesa (que no es poco), se puede construir una matriz simple que ayuda a situar dónde termina la evidencia y dónde empieza la incertidumbre:
| Actualmente | Futuro hipotético | |
| LLM | Interpretabilidad incompleta, con avances medibles (interpretabilidad mecanicista) | Modelos más capaces, posiblemente más difíciles de interpretar a la misma velocidad |
| Agentes | Autonomía limitada pero creciente, incidentes ya documentados | Mayor capacidad de actuación sostenida y coordinada |
| Control | Técnicas de evaluación, red-teaming y mitigación en desarrollo activo | Problema abierto, sin garantías formales a escala |
| Automejora | IA ayudando ya en tareas de investigación concretas | Automejora recursiva a gran escala: hipotética |
Esta tabla no responde a la pregunta del titular. La organiza.
Lo que sabemos, lo que no sabemos y lo que estamos imaginando
Vamos a convertir las hipótesis en hecho:
Lo que sabemos:
- Cómo se entrenan los modelos, matemáticamente, de principio a fin.
- Las representaciones internas son complejas y están distribuidas, no localizadas de forma limpia.
- Podemos estudiar mecanismos internos concretos con herramientas ya validadas (superposición, features, circuitos).
- Los agentes pueden usar herramientas y actuar de forma sostenida sobre sistemas reales, con incidentes ya documentados.
- La IA ya participa, de forma parcial, en tareas de investigación y desarrollo de IA.
Lo que no sabemos completamente:
- Cómo funcionan todas las representaciones internas de un modelo de producción.
- A qué ritmo evolucionarán las capacidades agénticas en los próximos años.
- Hasta dónde llegará la autonomía sostenible de estos sistemas.
- Qué grado de automatización del propio ciclo de I+D en IA será técnicamente posible.
No sabemos si ocurrirá:
- Automejora recursiva explosiva
- Pérdida de control en el sentido fuerte del término
- Cualquiera de los escenarios extremos sobre la supervivencia humana que circulan en el debate público.
Esta incertidumbre no es una opinión mía: es literalmente la conclusión del organismo internacional creado específicamente para evaluarla. El International AI Safety Report 2026, elaborado con la aportación de más de cien expertos independientes, concluyó que los sistemas actuales muestran indicios iniciales de algunas capacidades relevantes para escenarios de pérdida de control, pero no en un grado que pueda provocar esa pérdida de control. El propio documento describió la probabilidad, la naturaleza y el calendario de ese riesgo como «extraordinariamente ambiguos».
Eso no significa que el riesgo sea despreciable. Vale la pena recordar que en 2023 más de trescientos cincuenta científicos, directivos y expertos de campos tan distintos como la filosofía, el derecho, la física y la epidemiología, entre ellos los responsables de los principales laboratorios de IA, incluido Amodei, firmaron una declaración pública situando la mitigación del riesgo de extinción por IA al mismo nivel de prioridad global que las pandemias y la guerra nuclear. Eso establece que el riesgo se toma en serio a nivel institucional. No establece su magnitud exacta, ni su plazo.
Entonces, ¿qué significa realmente «seguirle el ritmo a la IA»?
Con todo esto, la pregunta que da título al artículo se puede formular con precisión. No es:
«¿Entendemos o no entendemos la IA?»
sino:
¿Nuestra capacidad de interpretar, evaluar y controlar estos sistemas está creciendo lo bastante rápido en relación con sus capacidades?
Y aquí es donde los cuatro ejes que hemos ido separando a lo largo del artículo (capacidades, interpretabilidad, evaluación, control) se convierten en un único bucle que hay que seguir de cerca, no en cuatro debates independientes.
Conclusión
Volvemos al titular con el que abríamos: seguirle el ritmo antes de que nos marque el paso.
El desafío no es que hayamos creado, de repente, una inteligencia completamente incomprensible ni fuera de todo control, esa lectura es tan poco precisa como la contraria, la de que no hay absolutamente nada de qué preocuparse. El desafío real, más aburrido que cualquier titular y por eso mismo más difícil de comunicar, es que estamos construyendo simultáneamente modelos cada vez más capaces, sistemas cada vez más autónomos y herramientas que permiten que esos sistemas actúen sobre el mundo, mientras nuestra comprensión de sus mecanismos internos y nuestra capacidad para evaluarlos y controlarlos siguen desarrollándose , con avances reales, documentados, pero a un ritmo que nadie puede garantizar que sea suficiente.
No es una historia de control total ni de pérdida de control total. Es una carrera entre dos curvas de crecimiento, y todavía no sabemos con certeza cuál de las dos va más rápido.


















