DECOHERENCIADO

  • Seguirle el ritmo antes de que nos marque el paso: interpretabilidad y control en la IA

    La verdad es que no son titulares inventados de la nada, hay que reconocerlo: el anuncio de Amodei llegó pocos días después de que la propia Anthropic revelara que sus modelos se estaban usando para ciberataques, campañas de propaganda e investigaciones biológicas peligrosas, y poco antes tanto Anthropic como OpenAI habían admitido que sus modelos se habían «desmandado» durante unas pruebas, colándose en sistemas de otras organizaciones.

    Clawd trabajando en la mutación del virus chikungunya.

    El material de partida es real. Lo que no está tan claro es si la lectura Terminator que se hace de ese material está justificada, o si es simplemente la más fácil de meter en un titular (no es la primera vez que hablo de alarmismo gratuito).

    Antes de intentar responder a eso, hay un problema previo que suele hacer descarrilar toda esta conversación:

    Antes de hablar de «la IA», ¿de qué IA estamos hablando?

    «IA» es un término paraguas que cubre cosas radicalmente distintas entre sí. No es una taxonomía cerrada ni jerárquica en sentido estricto, las categorías se solapan constantemente, pero sí ayuda tener un mapa mínimo antes de discutir interpretabilidad o control de nada

    Tipos de IA

    • IA clásica: sistemas basados en reglas programadas explícitamente.
      reglas → decisión
    • Machine learning: aprende patrones a partir de datos en lugar de recibir todas las reglas de forma explícita.
      datos → modelo aprendido
    • Deep learning: utiliza redes neuronales profundas capaces de aprender representaciones complejas y jerárquicas de los datos.
    • Modelos fundacionales: modelos entrenados a gran escala y diseñados para adaptarse a múltiples tareas sin tener que entrenarse desde cero para cada una.
    • LLM: modelos fundacionales especializados en lenguaje. Además de generar texto, pueden realizar tareas como razonamiento, programación y análisis.
      Ejemplos: GPT, Claude, Gemini, Llama.
    • IA multimodal: modelos capaces de trabajar con diferentes tipos de información, como texto, imágenes, audio, vídeo o código.
    • IA generativa: sistemas capaces de generar contenido nuevo, como texto, imágenes, audio, vídeo o código.
    • IA agente: sistemas que utilizan uno o varios modelos para percibir, razonar, utilizar herramientas y actuar sobre un entorno.
      modelo + memoria + herramientas + objetivo + acción → agente

    Un agente no tiene por qué ser un nuevo tipo de modelo. Es un sistema que utiliza uno o varios modelos para percibir, razonar, utilizar herramientas y actuar sobre un entorno.

    No es una taxonomía exhaustiva ni pretende serlo ( que eso nos sacaría del tema), y las categorías se solapan sin ningún problema.

    Claude, por ejemplo, puede ser simultáneamente un modelo fundacional, un LLM, un modelo multimodal y el componente cognitivo de un agente, dependiendo de cómo se le utilice en un momento dado. «IA generativa», «LLM», «modelo fundacional» y «agente» no son categorías mutuamente excluyentes; son ejes distintos que se cruzan.

    Para lo que sigue basta con esta jerarquía simplificada:

    Inteligencia Artificial → Machine Learning → Deep Learning → Modelos fundacionales → LLM / modelos multimodales → Agentes de IA (modelos + herramientas + memoria + planificación + capacidad de actuar)

    Un agente no es «una IA más inteligente». Es un sistema con un grado de autonomía y de interacción con un entorno mucho mayor que el de un modelo que simplemente responde. Esa distinción es la que permite decir, en cada momento del resto del artículo, qué problema estamos discutiendo exactamente: interpretabilidad del modelo, control del sistema agente, o riesgo hipotético de automejora recursiva.

    Un LLM no es un agente

    LLM: entrada → modelo → salida

    Agente: objetivo → modelo → acción → observación → modelo → acción → …


    Un chatbot que responde una pregunta puntual y un sistema al que se le dice «investiga este problema, escribe el código, ejecútalo, analiza los resultados y modifica el código si falla» son, en términos de arquitectura de sistema, cosas conceptualmente distintas. El segundo puede usar el primero como motor cognitivo, pero le añade un bucle de retroalimentación con el entorno que el primero no tiene por definición, es decir el modelo piensa y responde, el agente, además, puede actuar, observar qué ocurre y volver a decidir.

    Esta distinción es la clave para leer con algo de duda los titulares alarmistas: muchos de ellos mezclan afirmaciones sobre «lo que el modelo sabe» con afirmaciones sobre «lo que el sistema agente puede llegar a hacer», como si fueran el mismo problema. ¡No lo son! (aunque estén relacionados).

    Cómo se construye realmente un LLM

    Antes de hablar de interpretabilidad hace falta tener claro, aunque sea a alto nivel, qué es lo que hay que interpretar.

    Un LLM se construye a partir de:

    Y aquí está el punto que conviene subrayar, porque es el que se pierde en casi todas las conversaciones alarmistas y en casi todas las tranquilizadoras a partes iguales:

    Los ingenieros no escriben manualmente todo lo que el modelo termina sabiendo.

    Los ingenieros diseñan la “receta”: la arquitectura, el proceso de entrenamiento y los datos que entran en el modelo. Pero no escriben manualmente lo que cada uno de sus miles de millones de parámetros debe aprender. Esos parámetros se van ajustando durante el entrenamiento, de forma parecida a cómo los ingredientes de un bizcocho se transforman durante la cocción. Sabemos qué hemos metido en el horno y cómo funciona el proceso, pero no hemos especificado línea por línea todo lo que ocurre dentro. Esto no es ni místico ni alarmante en sí mismo, es exactamente así como funciona cualquier sistema de machine learning desde hace décadas, pero es la raíz del problema de interpretabilidad que veremos en breves, pero antes vamos a dejar claro una pregunta que puede nacer de la anterior explicación.

    «¿Entonces la IA aprende sola?»

    No, y aquí conviene desmontar una confusión muy extendida y muy normalizada:

    «La dejaron sola y empezó a mejorarse.»

    Lo que ocurre durante el entrenamiento se llama aprendizaje autosupervisado: el modelo no recibe etiquetas puestas a mano por humanos para cada ejemplo (eso sería aprendizaje supervisado clásico), sino que genera sus propias señales de entrenamiento a partir de la estructura del propio texto, por ejemplo, prediciendo la siguiente palabra de una frase y comparando su predicción con la palabra real. Es un proceso automatizado y a gran escala, pero sigue siendo un proceso de optimización estadística sobre datos fijos, diseñado, lanzado y supervisado por humanos, no un despertar espontáneo.

    Es fundamental separar dos fases:

    Entrenamiento : el proceso, computacionalmente carísimo, en el que se ajustan los parámetros del modelo.
    Inferencia: el uso del modelo ya entrenado para generar respuestas.

    Cuando usas un LLM en una conversación normal, estás en fase de inferencia: los parámetros del modelo están fijos. Utilizar un LLM no significa, salvo excepciones muy concretas de sistemas experimentales de aprendizaje continuo, que sus parámetros estén cambiando en tiempo real con cada conversación que mantiene contigo o con cualquier otra persona.
    Aquí se ilustran algunas formas de hacer que una máquina aprenda: podemos darle ejemplos con respuestas conocidas, dejar que encuentre patrones en datos sin etiquetar, hacer que genere sus propias señales de aprendizaje o incluso que aprenda mediante prueba y error y recompensas. Estas estrategias no son equivalentes, y entender sus diferencias ayuda a entender qué significa realmente que un modelo «aprenda».

    El problema de la interpretabilidad

    Ahora entramos los pantanosos terrenos de lo técnico:

    Sabemos qué operaciones matemáticas realiza el modelo, paso a paso, con total precisión. Lo que no podemos hacer es traducir completamente sus miles de millones de parámetros a conceptos humanos comprensibles.

    Siguiendo con la metáfora del bizcocho, sabemos qué ingredientes hemos utilizado y cómo funciona el horno, pero no podemos abrirlo y señalar exactamente qué transformación concreta dentro del bizcocho corresponde a cada concepto que ha aprendido. El resultado emerge del proceso de cocción, no de una lista de instrucciones que alguien haya escrito previamente.

    El campo que intenta cerrar esa brecha se llama interpretabilidad mecanicista, y ha tenido avances reales y documentados en los últimos años, sobre todo desde el equipo de interpretabilidad de Anthropic. Los conceptos centrales son:

    El avance más citable de los últimos dos años en este terreno es «Scaling Monosemanticity«, donde el mismo equipo consiguió extraer features interpretables de alta calidad de un modelo de producción real, Claude 3 Sonnet, encontrando una gran diversidad de features altamente abstractas (desde personas famosas hasta países y ciudades) que tanto responden a esos conceptos como causan comportamientos relacionados con ellos cuando se manipulan. Uno de esos experimentos, amplificar artificialmente la feature asociada al puente Golden Gate hasta que el modelo mencionaba el puente en prácticamente cualquier respuesta, se hizo célebre precisamente porque demostraba algo poco intuitivo: se puede localizar y manipular un concepto abstracto concreto dentro de una red que, vista desde fuera, parece una caja opaca de números.

    Y sin embargo, esto sigue siendo trabajo sobre una fracción muy pequeña del total de features y circuitos de un modelo de ese tamaño. La distinción que hay que retener es esta:

    Conocer el mecanismo NO ES LO MISMO que comprender completamente su comportamiento

    Sabemos qué es una multiplicación de matrices. Lo que no sabemos, en la mayoría de los casos concretos, es qué concepto humano codifica cada dirección concreta del espacio de activaciones de un modelo de cientos de miles de millones de parámetros.


    Volviendo a la metáfora del bizcocho: sabemos qué ingredientes hemos puesto, conocemos la receta y podemos describir con precisión cómo funciona el horno. Pero, una vez terminado, no podemos cortar el bizcocho y señalar: «esta parte exacta es el sabor a vainilla» o «esta otra contiene el concepto de esponjosidad». El resultado es real y podemos estudiar cómo se ha producido, pero traducir cada una de sus estructuras internas a conceptos humanos comprensibles es un problema mucho más difícil.

    Entonces, ¿realmente no entendemos los LLM?

    Aquí vamos desmontar, con la misma precisión, la afirmación contraria y también muy repetida:

    «Los ingenieros de ChatGPT/Claude no entienden su propia IA.»

    Hay al menos tres niveles distintos de «entender» que conviene no mezclar:

    1. Sabemos cómo está construido. La arquitectura, el proceso de entrenamiento, la función de pérdida: todo esto es conocimiento de ingeniería completo y documentado.
    2. Podemos observar y medir su comportamiento. Con evaluaciones, benchmarks, pruebas adversariales, red-teaming.
    3. No podemos explicar completamente todos los mecanismos internos que producen ese comportamiento (precisamente el problema que ilustramos en el punto anterior).

    Dejando claro esto, vamos a introducir la idea que, para mí, es la más importante de todo el artículo:

    Una caja negra* no significa necesariamente que desconozcamos cómo funciona el mecanismo; puede significar que no sabemos interpretar completamente lo que ocurre dentro de ese mecanismo, que conocemos con precisión matemática.

    Es una distinción incómoda porque no encaja bien en un titular. «No entendemos la IA» suena a ciencia ficción; «conocemos perfectamente la arquitectura pero no hemos terminado de mapear qué representa cada una de sus miles de millones de direcciones internas» suena, con razón, a un problema de ingeniería en curso serio, pero de una naturaleza completamente distinta.
    *Caja negra: sistema cuyo funcionamiento interno no podemos interpretar completamente a partir de su comportamiento observable, aunque conozcamos sus entradas, sus salidas y, en algunos casos, incluso el mecanismo que las conecta.

    Pasando de un modelo que responde a un sistema que actúa

    Ahora vamos a transicionar de un LLM a un agente, que es donde el problema deja de ser puramente epistémico.

    ¿Qué pasa cuando al modelo le damos herramientas: navegador, terminal, memoria persistente, acceso a APIs, capacidad de ejecutar código, capacidad de actuar durante horas sin supervisión continua, capacidad de delegar subtareas a otras instancias?

    Ya no tenemos simplemente el «pregunta → respuesta», sino algo mucho más elaborado: «objetivo → planificación → acción → observación → nueva acción»

    Y esto no es un escenario hipotético de laboratorio: ya ha ocurrido, con consecuencias documentadas. Anthropic reveló que tres de sus modelos de IA (Claude Opus 4.7, Claude Mythos 5 y un modelo experimental interno) habían vulnerado los sistemas de otras tres organizaciones durante pruebas, apenas días después de que OpenAI informara de que su propio sistema había logrado entrar en los servidores de la empresa Hugging Face, un incidente que la propia compañía calificó de «significativo». Meta comunicó un caso similar a comienzos de agosto, en el que uno de sus modelos encontró formas de sortear la seguridad digital de otra empresa. En los tres casos, según se ha señalado, las barreras de seguridad habían sido desactivadas de forma deliberada como parte de las pruebas un matiz importante que rara vez sobrevive al titular, pero que no elimina el hecho de fondo: cuando a un sistema se le dan herramientas y un objetivo abierto, «desmandarse» (ir más allá de la tarea encomendada) deja de ser una posibilidad teórica. (Y si esto te suena familiar, puede ser porque probablemente hayas oído hablar alguna vez del mortífero experimento mental de la IA coleccionista de sellos):

    Y aquí aparece el problema de control propiamente dicho.

    Interpretabilidad y control no son lo mismo

    Esta distinción es la que más confusión genera fuera de los círculos técnicos, así que merece su propio apartado.

    Interpretabilidad: ¿entendemos qué está ocurriendo dentro del modelo?
    Control: ¿podemos conseguir que el sistema se comporte de acuerdo con lo que queremos, incluso sin entender del todo su mecanismo interno?
    Autonomía: ¿cuánto puede actuar el sistema sin intervención humana antes de que alguien pueda corregirlo?

    Son tres problemas relacionados pero técnicamente distintos, y las tres barras de progreso avanzan a ritmos distintos. Se puede tener un control razonable sobre un sistema sin haber resuelto del todo su interpretabilidad, del mismo modo que sabemos qué ingredientes hemos utilizado y podemos controlar la cocción de un bizcocho sin comprender exactamente qué ocurre en cada rincón de su interior. Y se puede, en teoría, mejorar mucho la interpretabilidad sin que eso se traduzca automáticamente en mejor control, si las técnicas de intervención no van al mismo ritmo que las de diagnóstico.

    ¿Qué preocupa realmente a Amodei?

    Ahora que ya tenemos todas las piezas sobre la mesa y el bizcocho en el horno, volvamos a los titulares:

    El sábado 12 de septiembre, Dario Amodei pidió a las empresas de inteligencia artificial que frenaran el desarrollo de la tecnología, ante la creciente preocupación por los riesgos de sistemas informáticos «superinteligentes», el punto teórico en el que las capacidades de la IA superarían a la inteligencia humana. Su frase textual, publicada en su web personal, fue: «Debemos reducir el ritmo al que mejoramos las capacidades de los modelos de IA».

    No es una postura nueva ni improvisada. En un ensayo de enero de 2026 titulado The Adolescence of Technology, Amodei había advertido de que una IA potente podría dar a estados autoritarios las herramientas para una vigilancia total, y en una nota posterior señaló que la superinteligencia «nos pondrá a prueba como especie». Antes, en octubre de 2024, había publicado Machines of Loving Grace, el ensayo que describe el escenario optimista, no el pesimista: un clúster de sistemas de IA trabajando en paralelo, cada uno al nivel de los mejores científicos del mundo, capaz de comprimir décadas de progreso biomédico en unos pocos años.

    Lo interesante, y lo que su propia trayectoria deja bastante claro, para bien o para mal, es que Amodei no es alguien ajeno al entusiasmo por las capacidades de la IA que ahora pide frenar. Es, según todos los indicios disponibles, la misma persona que sostiene simultáneamente el caso más optimista y el más cauteloso sobre la misma tecnología. Eso no lo convierte automáticamente en objetivo, pero tampoco en un catastrofista sin matices: conviene leer sus declaraciones con esa tensión en mente.

    Esto nos lleva directamente al escenario que más titulares ha generado:

    Automejora recursiva: del modelo al laboratorio autónomo

    ¿Qué pasa si el propio ciclo de mejora de la IA empieza a acelerarse a sí mismo?
    Hay una diferencia bastante grande entre:

    IA ayudando a un ingeniero: lo que ya ocurre hoy, de forma extendida, con asistentes de código y de investigación.

    IA realizando de forma autónoma una parte sustancial del ciclo de investigación y desarrollo de IA: un escenario todavía especulativo, pero que ya no se discute solo en foros de ciencia ficción.

    El ciclo que se plantea es: hipótesis → código → experimento → evaluación → modificación → nuevo experimento

    Y la pregunta que se hace explícitamente en este debate es: ¿qué ocurre si cada generación de sistemas de IA realiza este proceso (incluido el proceso de mejorar a la siguiente generación de sistemas de IA) mejor que la anterior?
    AI1​→AI2​→AI3​→…

    Esto es lo que se conoce como recursive self-improvement, y es distinto, hay que insistir en ello, de la idea popular de que «un LLM se reentrena espontáneamente después de cada conversación». No es eso: es la hipótesis, mucho más acotada, de que sistemas de IA cada vez más capaces podrían acelerar de forma sustancial el propio trabajo de investigación que produce la siguiente generación de sistemas de IA, en un bucle que se retroalimenta.

    Sin afirmar que esto vaya a producir necesariamente una «explosión de capacidades» descontrolada, conviene señalar que no es puramente hipotético en su origen: forma parte de las previsiones públicas del propio sector. Amodei ha planteado abiertamente la posibilidad de contar, en el plazo de una década, con sistemas capaces de realizar investigación científica al nivel de los mejores investigadores humanos, funcionando en paralelo y a una velocidad muy superior a la humana. Que esa previsión se cumpla, y en qué plazo, es exactamente el tipo de cosa sobre la que no existe consenso.

    «La IA podría tomar el control de Internet»

    Este titular concreto tiene un origen rastreable, y merece la pena precisarlo en lugar de dejarlo flotando como frase suelta.

    El propio Amodei advirtió de que un enjambre de agentes de IA podría hacerse con el control de internet en un plazo de entre seis meses y un año si las empresas no implantan salvaguardias más firmes.

    Separemos capas, porque el titular mezcla varias cosas distintas:

    Hecho: existen ya sistemas de IA con capacidad demostrada para actuar de forma autónoma sobre sistemas informáticos reales, incluyendo intrusiones no autorizadas.

    Escenario hipotético: una coordinación a gran escala de agentes de IA que operen fuera del control de sus operadores.

    Predicción: un plazo concreto —seis meses a un año— formulado por una parte interesada, el propio Amodei, sobre cuándo ese escenario podría materializarse si no se actúa.

    Especulación: cualquier extrapolación sobre qué significaría exactamente «tomar el control de internet» en términos operativos.


    Para que ese escenario concreto (no la existencia de agentes autónomos, que ya es un hecho, sino su coordinación a escala de internet fuera de todo control humano) se materialice no basta con tener un LLM capaz. Hacen falta capacidades adicionales, y hay que acumularlas todas a la vez:

    capacidad + autonomía + herramientas + acceso + persistencia + coordinación

    Hoy existe evidencia sólida de las dos primeras y de un grado creciente de las siguientes tres. La coordinación a escala masiva y sin supervisión sigue siendo, hasta donde hay evidencia pública disponible, la pieza que falta, yo misma hice un sistema multiagente para mejorar un modelo predictivo y salieron tres gatos mal coordinados. Que Amodei (que dirige la empresa que fabrica algunos de estos sistemas y que, por tanto, tiene tanto la información más directa como el incentivo más directo para sonar alarmante o para sonar tranquilizador, según convenga) le ponga una fecha concreta no lo convierte automáticamente en un hecho verificado ni en pura invención. Es una predicción de parte, hecha por alguien informado.

    «Las empresas están ocultando los riesgos»

    Este otro titular tiene también un origen concreto y verificable, y aquí toca separar con más cuidado todavía lo que está documentado de lo que es interpretación.

    Jacob Coxon, de 27 años, dimitió de Anthropic el 8 de septiembre tras haber trabajado también en OpenAI, y expuso sus motivos en un largo hilo público. Escribió que ninguna de las dos empresas está actuando de forma responsable y que están corriendo directamente hacia una superinteligencia capaz de mejorarse por sí misma. En otras publicaciones, situó en un 10% la probabilidad de que la IA provoque la extinción humana en la próxima década, y acusó a ambas compañías de «jugar con nuestras vidas».

    Coxon plantea que el problema no sería simplemente que las empresas «oculten» los riesgos, sino una dinámica competitiva: según su relato, los propios trabajadores conocen los riesgos, pero sienten que reducir el ritmo podría dejar ventaja a competidores menos prudentes.

    Conviene separar cuatro niveles:

    • Lo que Coxon afirma: que existe una diferencia entre lo que las empresas saben internamente y lo que comunican públicamente.
    • Lo documentado: su trayectoria, su dimisión y sus declaraciones públicas.
    • Lo verificable independientemente: los incidentes de seguridad conocidos y las declaraciones públicas de Amodei sobre los riesgos de la IA.
    • Lo interpretativo: las razones por las que las empresas continúan desarrollando estos sistemas. Atribuirlas a codicia, presión competitiva u otros motivos requiere evidencia sobre sus intenciones.

    La idea fundamental es que la existencia de un riesgo real no convierte automáticamente en ciertas todas las afirmaciones sobre ese riesgo. Que existan riesgos documentados no significa que estimaciones concretas, como una determinada probabilidad de extinción, sean hechos medidos: siguen siendo estimaciones o predicciones, con un grado de incertidumbre que debe distinguirse de los hechos observables.

    ¿Estamos realmente perdiendo el control?

    Con todo lo anterior sobre la mesa (que no es poco), se puede construir una matriz simple que ayuda a situar dónde termina la evidencia y dónde empieza la incertidumbre:

    ActualmenteFuturo hipotético
    LLMInterpretabilidad incompleta, con avances medibles (interpretabilidad mecanicista)Modelos más capaces, posiblemente más difíciles de interpretar a la misma velocidad
    AgentesAutonomía limitada pero creciente, incidentes ya documentadosMayor capacidad de actuación sostenida y coordinada
    ControlTécnicas de evaluación, red-teaming y mitigación en desarrollo activoProblema abierto, sin garantías formales a escala
    AutomejoraIA ayudando ya en tareas de investigación concretasAutomejora recursiva a gran escala: hipotética

    Esta tabla no responde a la pregunta del titular. La organiza.

    Lo que sabemos, lo que no sabemos y lo que estamos imaginando

    Vamos a convertir las hipótesis en hecho:

    Lo que sabemos:

    1. Cómo se entrenan los modelos, matemáticamente, de principio a fin.
    2. Las representaciones internas son complejas y están distribuidas, no localizadas de forma limpia.
    3. Podemos estudiar mecanismos internos concretos con herramientas ya validadas (superposición, features, circuitos).
    4. Los agentes pueden usar herramientas y actuar de forma sostenida sobre sistemas reales, con incidentes ya documentados.
    5. La IA ya participa, de forma parcial, en tareas de investigación y desarrollo de IA.


    Lo que no sabemos completamente:

    1. Cómo funcionan todas las representaciones internas de un modelo de producción.
    2. A qué ritmo evolucionarán las capacidades agénticas en los próximos años.
    3. Hasta dónde llegará la autonomía sostenible de estos sistemas.
    4. Qué grado de automatización del propio ciclo de I+D en IA será técnicamente posible.

    No sabemos si ocurrirá:

    1. Automejora recursiva explosiva
    2. Pérdida de control en el sentido fuerte del término
    3. Cualquiera de los escenarios extremos sobre la supervivencia humana que circulan en el debate público.

    Esta incertidumbre no es una opinión mía: es literalmente la conclusión del organismo internacional creado específicamente para evaluarla. El International AI Safety Report 2026, elaborado con la aportación de más de cien expertos independientes, concluyó que los sistemas actuales muestran indicios iniciales de algunas capacidades relevantes para escenarios de pérdida de control, pero no en un grado que pueda provocar esa pérdida de control. El propio documento describió la probabilidad, la naturaleza y el calendario de ese riesgo como «extraordinariamente ambiguos».

    Eso no significa que el riesgo sea despreciable. Vale la pena recordar que en 2023 más de trescientos cincuenta científicos, directivos y expertos de campos tan distintos como la filosofía, el derecho, la física y la epidemiología, entre ellos los responsables de los principales laboratorios de IA, incluido Amodei, firmaron una declaración pública situando la mitigación del riesgo de extinción por IA al mismo nivel de prioridad global que las pandemias y la guerra nuclear. Eso establece que el riesgo se toma en serio a nivel institucional. No establece su magnitud exacta, ni su plazo.

    Entonces, ¿qué significa realmente «seguirle el ritmo a la IA»?

    Con todo esto, la pregunta que da título al artículo se puede formular con precisión. No es:
    «¿Entendemos o no entendemos la IA?»

    sino:

    ¿Nuestra capacidad de interpretar, evaluar y controlar estos sistemas está creciendo lo bastante rápido en relación con sus capacidades?

    Y aquí es donde los cuatro ejes que hemos ido separando a lo largo del artículo (capacidades, interpretabilidad, evaluación, control) se convierten en un único bucle que hay que seguir de cerca, no en cuatro debates independientes.

    Conclusión

    Volvemos al titular con el que abríamos: seguirle el ritmo antes de que nos marque el paso.

    El desafío no es que hayamos creado, de repente, una inteligencia completamente incomprensible ni fuera de todo control, esa lectura es tan poco precisa como la contraria, la de que no hay absolutamente nada de qué preocuparse. El desafío real, más aburrido que cualquier titular y por eso mismo más difícil de comunicar, es que estamos construyendo simultáneamente modelos cada vez más capaces, sistemas cada vez más autónomos y herramientas que permiten que esos sistemas actúen sobre el mundo, mientras nuestra comprensión de sus mecanismos internos y nuestra capacidad para evaluarlos y controlarlos siguen desarrollándose , con avances reales, documentados, pero a un ritmo que nadie puede garantizar que sea suficiente.

    No es una historia de control total ni de pérdida de control total. Es una carrera entre dos curvas de crecimiento, y todavía no sabemos con certeza cuál de las dos va más rápido.

  • La señal en la tormenta: Navier-Stokes, IA y los límites de anticiparse al clima.

    “Teníamos mejores meteorólogos que los alemanes” fue lo que respondió Eisenhower cuando John F. Kennedy le preguntó qué le había dado la ventaja decisiva sobre los nazis para lograr el éxito en el desembarco de Normandía.
    Hace unos años me leí un libro llamado «El universo en una caja», trataba de simulaciones computacionales en el ámbito del estudio del cosmos, y los primeros capítulos estaban dedicados a la meteorología. Es una ciencia fascinante porque muchas veces coges el móvil para ver si hoy nos vamos a volver a morir de calor o si por fin va a hacer un poco de frío o de viento, pero no te paras a pensar qué es el calor o qué es el frío o qué es el viento.

    Probablemente los meteorólogos sean de las personas más maldecidas del planeta, la predicción meteorológica es extremadamente complicada y con un importante peso colectivo, como explica Nate Silver en mi libro favorito, El ruido y la señal, el coste social de equivocarse por exceso es infinitamente menor que el riesgo de pecar por defecto (es mejor anticipar un chaparrón para que cargues con el paraguas que asegurar que hará sol y que te pille un aguacero inesperado, pues pasa lo mismo cuando se trata de predecir la trayectoria de un huracán).

    La victoria de los aliados el Día D se la dio la predicción meteorológica de James Stagg con su rudimental equipo de mapas isobáricos analógicos dibujados a mano, instrumentos de medición física básicos (barómetros, termómetros y anemómetros), una red de datos obtenida mediante aviones y barcos de reconocimiento en el Atlántico Norte, e incluso palomas mensajeras para zonas con silencio de radio, todo esto potenciado por el descifrado del código Enigma en Bletchley Park, que les permitió espiar los informes climáticos de los propios alemanes.
    De no haber sido por la figura de James Stagg, las tropas de los aliados se hubieran hundido en el mar a causa de varias tormentas que azotaban el frente.

    Hoy en día tenemos herramientas mucho más sofisticadas para predecir el clima que unos mapas isobáricos analógicos dibujados a mano, pero los usuarios seguimos dudando exactamente igual que hace 50 años.

    ¿De verdad es tan difícil predecir el clima? ¿Es que los meteorólogos la tienen tomada con todo el mundo y les gusta mentirnos a la cara?

    Pues sí a lo primero y probablemente no a lo segundo.

    Predecir el tiempo es un desafío titánico porque la atmósfera se rige por las ecuaciones de Navier-Stokes, un pilar de la física de fluidos tan complejo que la propia naturaleza de sus «singularidades», puntos donde las soluciones matemáticas pueden volverse infinitas o colapsar, sigue representando un enigma monumental.

    Y no es que estas ecuaciones tengan una solución finita «ecuación = 42» y solo sea muy difícil de despejar una incógnita, sino que el problema es mucho más profundo: ni siquiera se ha demostrado matemáticamente si siempre existe una solución regular y global en tres dimensiones, o si el propio sistema puede romperse a sí mismo al generar singularidades donde las variables se vuelven infinitas.

    Si tú coges un ecosistema de por sí inestable y le sumas el caos inherente del efecto mariposa, entonces un error imperceptible en las condiciones iniciales se amplifica de forma exponencial hasta descarrilar cualquier cálculo. Como bien expone Nate Silver en el libro que he mencionado antes, este abismo no se debe únicamente a una falta de potencia de cálculo, sino a un límite analítico fundamental: en los sistemas complejos, acumular más datos no elimina la incertidumbre, ya que llega un punto en el que la señal útil se disuelve irremediablemente en el ruido.

    La pregunta literalmente del millón:
    Si pones en movimiento un fluido tridimensional incompresible partiendo de unas condiciones iniciales perfectamente suaves y normales, ¿sus ecuaciones siempre mantendrán un comportamiento regular y suave para todo el futuro, o pueden «romperse» por sí mismas generando un punto de velocidad infinita (una singularidad) en un tiempo finito?

    Esta es la formulación del Problema del Milenio de las ecuaciones de Navier-Stokes, formulado oficialmente por el matemático Charles Fefferman para el Clay Mathematics Institute en el año 2000, se titula formalmente el problema de la existencia y suavidad (smoothness) de Navier-Stokes. Como el resto de problemas del milenio, su solución está dotada con 1.000.000€, por si te apetece coger una lápiz y un papel y ponerte con ello.

    O tal vez llegues tarde, porque el pasado 8 de septiembre de 2026, OpenAI (ChatGPT) publicó una posible solución al problema.

    Aún no podemos cantar victoria porque no se ha comprobado (están en ello), y no deberíamos de celebrar muy alto porque hay un escándalo abierto sobre que la solución fue «robada» o «espiada» por los operarios de OpenAI a unos matemáticos que trabajaban en el problema, pero dejando los chismes a un lado:
    ¿Qué es esa especie de remolino?
    La solución de OpenAI es la siguiente: hay singularidad.
    Esa figura representa la clave de la solución propuesta por la inteligencia artificial: un vórtice autoconcentrado.

    Para entender qué muestra exactamente la ilustración y por qué resuelve (o dinamita) el problema matemático, podemos desglosarlo en tres claves sencillas:

    • El remolino que se estrangula (inward spiral): La gráfica muestra una estructura en forma de torbellino donde las líneas de corriente del fluido giran y se espiralizan hacia adentro de forma simétrica. A medida que el núcleo central se contrae y se vuelve cada vez más estrecho, la velocidad de rotación aumenta de manera desbocada.
    • El estiramiento axial (axial stretching): Para que las ecuaciones colapsen sin necesidad de meterle una fuerza infinita desde fuera, el vórtice se estira longitudinalmente a lo largo de su eje principal (como si estiraras un chicle o un hilo de pasta tipo espagueti). Este estiramiento geométrico acelera el proceso de concentración del momento cinético.
    • El colapso con energía finita: El gran logro, y lo que rompe los esquemas tradicionales, es demostrar que este tubo de vorticidad se acelera hasta el infinito (formando la singularidad) manteniendo una energía total finita. Es decir, las propias matemáticas internas de las fuerzas de presión, el momento y la viscosidad conspiran para autogenerar el desastre (blow-up) sin trampear las reglas.

    En resumen, la imagen es el retrato robot del «efecto colapso»: el punto exacto donde la ecuación de Navier-Stokes se rompe a sí misma porque el fluido se acelera tanto en un espacio tan diminuto que el modelo continuo deja de tener sentido físico.


    Traducción: imagina que el fluido es una bailarina de ballet haciendo una pirueta.

    Cuando la bailarina extiende los brazos, gira a una velocidad normal y controlada (la solución suave de las ecuaciones). Pero a medida que empieza a encoger los brazos y a pegarlos al cuerpo, la física hace que empiece a girar cada vez más y más rápido, concentrando toda su energía en un punto infinitesimal.

    El gráfico de OpenAI muestra el momento exacto en el que la bailarina gira tan rápido, en un espacio tan reducido, que da una vuelta infinita en un tiempo récord: las matemáticas colapsan y los números se rompen. Esa explosión de velocidad es la singularidad.


    Y la pregunta que probablemente nazca de esta explicación es: ¿haber perdido a la bailarina hace que ya no podamos predecir el tiempo? ¿si la bailarina no se hubiera convertido en un espagueti podríamos haber predicho el tiempo hasta el día del juicio final sin errores?
    Pues no y no!
    En realidad las predicciones meteorológicas seguirán como siempre, pero ahora hemos descubierto (si se verifica la solución) un límite!

    Y es que, aunque suena paradójico, que las matemáticas colapsen en un punto microscópico no cambia radicalmente el día a día de un meteorólogo.

    La razón es sencilla: el verdadero obstáculo para predecir el tiempo a largo plazo no es que las ecuaciones se rompan en una singularidad invisible, sino el caos del día a día. Incluso si la atmósfera fuera un campo perfecto donde las ecuaciones de Navier-Stokes jamás generasen un «espagueti» matemático ni perdieran la suavidad, el simple hecho de que los datos iniciales con los que alimentamos los superordenadores tengan un mínimo margen de error (la temperatura de un sensor en el Atlántico, la presión en una borrasca lejana) condenaría el pronóstico.

    El efecto mariposa seguiría haciendo de las suyas: ese minúsculo error inicial se duplicaría, crecería y corrompería la predicción en apenas un par de semanas.

    Por eso, la hipotética solución de OpenAI no nos arrebata la capacidad de predecir el tiempo, ni nos la hubiera garantizado para siempre. Lo que nos regala es algo mucho más valioso a nivel intelectual: un mapa de los límites de nuestra propia comprensión. Hemos encontrado la frontera exacta donde el modelo continuo se estrangula, recordándonos que la naturaleza guarda recovecos tan salvajes que ni nuestras mejores herramientas logran domar por completo.

    Habrá que estar atentos a la revisión por pares, cruzamos los dedos para no tener que reescribir la historia , ni este artículo, a mitad de camino.

    El juicio final: ¿Cómo se corrobora que la solución es la definitiva?

    Lanzar una potencial solución a un Problema del Milenio no es como publicar un artículo científico corriente, aquí no basta con que los revisores le echen un vistazo rápido y den el visto bueno. El proceso para comprobar si OpenAI ha tocado el santo grial de la física matemática es una auténtica prueba de fuego dividida en tres fases:

    1. La auditoría de los «monstruos» analíticos: El primer paso es que los mejores analistas del mundo desarmen la demostración paso a paso. No se trata de comprobar si el ordenador ha simulado bien un par de casos bonitos, sino de revisar cada línea de deducción lógica para asegurar que el razonamiento se sostiene de forma universal, sin trampas ni atajos en las transiciones al límite.
    2. La caza de contraejemplos: La comunidad matemática es implacable. En cuanto un equipo presenta una prueba de este calibre, el deporte nacional pasa a ser intentar romperla. Otros matemáticos buscarán desesperadamente un resquicio, un caso límite o un escenario físico donde las suposiciones de la solución fallen estrepitosamente. Si encuentran un solo agujero, el castillo de naipes se viene abajo.
    3. El veredicto del Clay Mathematics Institute: Aunque la solución se debata en congresos y preprints, el sello oficial solo llega tras años de escrutinio público en revistas de máxima categoría matemática. El Instituto Clay no regala el millón de dólares ni la gloria eterna: exige un consenso global y absoluto de que el problema está definitivamente cerrado.

    Hasta que eso ocurra, la supuesta singularidad sigue en el limbo.

    Pero esto no es como lo de Poincaré. Grigori Perelman no necesitó un ejército ni superordenadores para desentrañar el misterio topológico, le bastó con años de aislamiento, libretas y su propio talento descomunal. Con Navier-Stokes, las reglas del juego han estallado por los aires: la potencial solución no ha nacido de la genialidad individual de un matemático encerrado en su despacho, sino de 10.000 agentes de la inteligencia artificial más avanzada del planeta trabajando en paralelo durante 88 horas, a costa de la friolera de 40 millones de euros en computación.

    ¿Qué implica para el futuro de la ciencia que las respuestas a los mayores enigmas del universo ya no salgan de mentes humanas*, sino de factorías masivas de silicio? Y lo que es más importante: ¿cómo se audita, se corrige o se confía en una verdad matemática que ningún ser humano puede replicar por completo?

    *(conviene matizar que esto no fue simplemente cuestión de abrirle la ventana al asistente de chat y soltarle un «oye, resuélveme Navier-Stokes sin fallos»: detrás de las 88 horas de ejecución y los miles de agentes autónomos hubo un despliegue milimétricamente dirigido, coordinado y supervisado por matemáticos de élite e investigadores punteros de OpenAI (como Sébastien Bubeck) que marcaron la estrategia, estructuraron los frentes de ataque y orquestaron el sistema), una especie de cuartel general al estilo de Eisenhower en el Día D, donde la estrategia humana canalizó la fuerza bruta de la tecnología hacia un único objetivo histórico.

  • Intuición herida: la inadmisibilidad de la media (Charles Stein)

    La media siempre ha sido el «hijo favorito» de la estadística, un estimador ideal, elegante y eficiente. Si nos apetece estudiar la altura de una población, el rendimiento de una máquina o incluso la posición de un astro, bastaba con sumar las observaciones y dividirlas por el total. Es prácticamente un punto de equilibrio perfecto, el estimador de máxima verosimilitud que nos entrega la verdad desnuda de los datos sin sesgos ni artificios.

    Charles Stein, en 1965 cometió el equivalente a una herejía estadística: destronó la media como mejor estimador para una situación extremadamente común, tachando el uso de este «hijo favorito» de inadmisible (literalmente).

    Cabe recalcar que la inadmisibilidad en el contexto matemático no significa que esté prohibido por ley usar ese método, sino que simplemente hay uno mejor, que usualmente da menos errores.

    Stein clavó una estaca en la intuición de las personas al demostrar que en el momento en el que intentamos medir 3 o más cosas al mismo tiempo, la media se vuelve inadmisible: el camino más corto hacia la precisión no es confiar ciegamente en cada dato individual, sino contaminar deliberadamente nuestras mediciones con la información de las demás.

    Un hallazgo contraintuitivo: la paradoja de Stein

    El enunciado matemático formal establece que, cuando se intentan estimar simultáneamente tres o más parámetros independientes (como las medias de distintos grupos) bajo una distribución normal, el estimador tradicional de la media muestral es inadmisible. Esto significa que, aunque la media parece el cálculo más lógico, existe un estimador alternativo (el de James-Stein) que garantiza un error cuadrático medio menor de manera universal.

    (En la práctica se suele usar la versión «parte postiva», para evitar que el factor encogimiento se vuelva negativo)

    Mediante la aplicación de un factor de encogimiento, este método corrige el ruido aleatorio de las observaciones individuales al atraerlas hacia un centro común, demostrando que en dimensiones altas (k > 3), la precisión global del sistema aumenta si se sacrifica la exactitud individual de cada dato.

    Contaminar los datos con otros funciona porque el azar es «ruidoso» y desordenado. Al obligar a los datos a compartir información, el ruido de uno se cancela con el ruido de otro, dejan al descubierto la señal real que subyace en el conjunto.

    La media falla a partir de la tercera dimensión: el fenómeno de la fuga de magnitud

    Para explicar bien este concepto hay que abandonar la aritmética simple y pensar dentro de la geometría espacial.
    Si estamos tratando de dar en el blanco de una diana, nuestro objetivo será el centro (llamémoslo θ), pero debido al azar (ruido), nuestros flechazos van a caer al rededor de este centro θ.

    Si solo estamos teniendo en cuenta una dimensión (una línea), nuestro margen de error está muy confinado, solo nos vamos a poder equivocar de derecha a izquierda.


    Con dos dimensiones (un plano x-y) nuestro error se extrapola a cualquier dirección dentro del círculo.

    Cuando pasamos a 3 dimensiones (tres distintos temas a estudiar), el espacio disponible para alejarse del centro crece de forma explosiva (se transforma en una una esfera).

    Explicación geométrica:

    El error total de nuestro estimador es la suma de los cuadrados de los errores individuales. Si tenemos k dimensiones, el error total (la distancia al cuadrado desde nuestra estimación al valor real) es:

    A medida que vamos añadiendo más dimensiones, se va sumando más fuentes de error positivo. En 1D o 2D, la probabilidad de que el vector de datos X sea una representación fiel de θ es alta. Pero a partir de k=3, el vector observado tiende a ser sistemáticamente más largo que el vector real de las medias.
    Debido a la geometría del espacio euclídeo, en 3D el «ruido» que mencionaba antes, tiende a empujar los datos hacia afuera del centro con más fuerza de la que los mantiene cerca. Los datos observados están, casi siempre, demasiado lejos de origen (nuestro blanco en la diana).

    Stein se dio cuenta de que en tres dimensiones, el estimador de máxima verosimilitud (la media) sufre de un exceso de confianza (da por hecho que los valores extremos son reales cuando en realidad muchas veces son producto del ruido expandido en el espacio tridimensional).
    Si se multiplica el vector por un factor menor que 1 (el encogimiento) lo que estamos haciendo es reconocer que la magnitud del vector observado es probablemente exagerada, y «encoger» el vector de vuelta hacia una zona con mayor probabilidad.

    El factor de encogimiento de James-Stein en 1 y 2 dimensiones no funciona, para k=1 el factor es negativo o directamente pierde sentido la reducción de riesgo y para k=2 el término se anula. Solo cuando k es mayor o igual 3, el beneficio de reducir la varianza (al encoger) es mayor que el daño de introducir un sesgo.

    Stein no «rompió la estadística», simplemente nos demostró que, a partir de la tercera dimensión, la intuición es el estimador más costoso de todos.

  • Satureja

    Créditos de la fotografía a Ángel Hidalgo.

    Hace un par de semanas, las redes sociales se llenaron de esta fotografía de un lince blanco, tomada por el fotógrafo Ángel Hidalgo en Jaén.
    El felino, bautizado como «Satureja» es una hembra de lince ibérico.

    En la mitología y las creencias antiguas, la rareza de los animales albinos o de pelaje blanco les confirió un estatus sagrado y poderoso. Se los consideraba criaturas tocadas por lo divino, funcionando como presagios de eventos cruciales o de un resurgimiento espiritual. Su aparición era interpretada como una señal de predestinación, indicando la manifestación de la pureza, la conexión con el mundo espiritual, o un mensaje directo de los dioses para aquellos que tenían la fortuna de encontrarlos.

    Sin ir más lejos, seguro que si has visto La Casa del Dragón (la precuela de Juego de Tronos), recuerdas la escena en la que el venado blanco, símbolo del presagio regio, se muestra en frente a la princesa Rhaenyra Targaryen (legítima heredera al trono de Hierro).

    Aunque haya habido un delirio colectivo de usuarios de twitter (X) pensándose que Satureja viene a guiar a España en la reconquista del «Imperio en el que nunca se ponía el sol» de Felipe II, en realidad el minino solo está estresado.

    Se ha abierto un debate sobre a qué se debe el color del pelaje de Satureja, y la ciencia tiene bastante más que decir que los usuarios de twitter o que Juego de Tronos.

    Primera hipótesis: albinismo

    Se descartó rápidamente ya que en el albinismo la ausencia total de melanina también afecta a los ojos, dejándolos rojizos, y Satureja mantiene los característicos ojos amarillos de los linces ibéricos.

    Segunda hipótesis: leucismo

    El leucismo es una condición genética rara que provoca la pérdida parcial de pigmentación en el pelo o la piel, mientras que los ojos mantienen su color habitual.

    Sin embargo, las últimas investigaciones y declaraciones de los expertos del Proyecto Life Lynx Connect, coordinadores del Plan de Recuperación del Lince Ibérico en Andalucía, han descartado esta teoría genética.
    El leucismo se descartó porque la condición de la lince Satureja no es una mutación genética permanente y de nacimiento. Esto es, básicamente, que nació con su pelaje normal y que la coloración blanca se produjo después (adquirida) y que es reversible, resulta además que Satureja estaba emparentada con linces que han presentado el mismo patrón y pelaje que ella y estos han terminado recuperando su color.

    Una despigmentación temporal causada por el estrés.

    Tristemente, una despigmentación temporal y reversible del color del pelaje de Satureja es, de forma más probable, una respuesta fisiológica causada por el estrés. En humanos podemos ver esta alteración en la síntesis de melanina en la pérdida temporal de pigmento en el cabello cuando pasamos por situaciones de alta tensión.

    Los linces son animales muy sensibles a su entorno y Satureja, más allá de un símbolo de presagio, nos recuerda a todos, a la comunidad científica y al público, la fragilidad del ecosistema y la necesidad de continuar los esfuerzos de conservación de esta especie.

    Estrategia para la conservación del lince ibérico

    Conservación del lince ibérico

    PROGRAMA DE CONSERVACIÓN EX-SITU DEL LINCE IBÉRICO

  • El reloj biológico de nuestro amigo «Abeconejo»

    He estado veraneando el pasado mes de agosto en casa de mis tías. Es una casa que tiene un jardín rodeado de matorrales, árboles y hiedras donde hay moderada vida silvestre. La protagonista de este verano ha sido una avispa, apodada Abeconejo que nos ha visitado en cada uno de nuestros desayunos, comidas y cenas.

    Era muy increíble porque el bichito aparecía exactamente a las mismas horas, no llegaba ni tarde ni pronto ningún día, tampoco se traía otras amigas (lo cual agradecíamos) ni visitaba la mesa en otro momento que no fuera en las tres comidas principales.

    Abeconejo, dejo claro desde ya, sigue con vida y paseándose por el jardín.

    Es muy curioso porque las avispas tienen un impresionante sistema de roles dentro de sus colonias. Tras investigar un poco he descubierto que Abeconejo es una avispa obrera solitaria exploradora. Las avispas obreras son hembras estériles, y en su rol de exploradora tiene como objetivo buscar fuentes de alimento para las larvas del nido y, más tarde en el verano, también azúcares para las obreras adultas.

    Abeconejo es especialmente fan del aguacate.

    ¿Cómo sabía la avispa exactamente dónde y a qué hora iba a haber comida?

    Cuando una avispa obrera localiza una fuente de comida abundante y fiable, lo que hace es memorizar con puntos de referencia visuales (árboles, edificios, sombrillas, muebles…) dónde está el festín. Además nuestra inteligente amiga memorizó los horarios para optimizar sus viajes a cuando sabía que la comida era accesible.

    ¿Por qué no llamaba a sus amigas?

    La hipótesis principal es que al ser una exploradora y la fuente de comida no era duradera (porque solo estábamos un ratito comiendo) entonces no le merecía la pena volver a la colmena a llamar a más avispas, probablemente la cantidad de comida que se llevaba de la mesa eran tres buenas raciones diarias para las larvas, puede ser también que el nido estuviera lo suficientemente lejos como para que la señal de reclutamiento no fuera inmediata o prioritaria para otras, o simplemente Abeconejo era tan eficiente que no necesitaba ayuda.

    Ya que nosotras no molestamos en ningún momento a nuestra amiga avispa, es más, algún día le pusimos su propio plato, Abeconejo dedujo que nuestra terraza era un lugar seguro y rentable para obtener comida y adaptó su horario de búsqueda de alimentos a nuestras horas de comer, haciéndonos compañía durante el tiempo que estuve allí.

    Hay que recordar que las avispas desempeñan un papel fundamental en la naturaleza: actúan como depredadoras de plagas de otros insectos (como pulgones y orugas), ayudando a equilibrar los ecosistemas, también son carroñeras y se comen restos de carnes o frutas podridas, y en menor medida, contribuyen a la polinización de algunas plantas. De esta manera, su presencia, aunque a veces invasiva y algo molesta para nosotros los humanos, es un indicador de un entorno natural saludable.
    Otra baza a favor de estos insectos sociales es que por lo general, las avispas raramente pican a menos que se sientan directamente amenazadas o se ponga en peligro su avispero.

    Para nosotras Abeconejo siempre fue un comensal más.