#59 – 10,000 Agentes, 88 Horas y un Investigador que Renunció

Lo más importante de esta edición

  • Matemáticas verificadas por IA: OpenAI resolvió el problema de Navier-Stokes (90 años sin solución) con 10,000 agentes en 88 horas; Anthropic formalizó el Último Teorema de Fermat con Claude en 11 días.
  • Alarma de seguridad: el investigador Jacob Coxon renunció a Anthropic denunciando una carrera irresponsable hacia la superinteligencia; el jefe de alineación Evan Hubinger respaldó públicamente un riesgo de extinción mayor al 10% en la próxima década.
  • Regulación: California firmó el 9 de septiembre las primeras leyes del país (SB 813 y AB 1405) que exigen auditorías independientes de sistemas de IA.
  • Capital: Mistral AI levantó 3,000 millones de euros (valuación de 21,000 millones), la mayor ronda tecnológica europea, liderada por Samsung.
  • Costos de IA: DeepSeek lanzó V4.1-Flash, que reduce 75% la memoria de caché necesaria y jubiló a su propio modelo insignia por ser más caro.
  • Agentes personales: Meta lanzó Muse, un agente que reserva, paga y gestiona tareas desde WhatsApp, y adquirió la startup Stilla.

Queridos Dysruptores,

Fernando Santa Cruz aquí en la edición 59 de Synapsis Semanal – donde un enjambre de agentes resolvió un problema abierto desde hace 90 años, un investigador renunció diciendo que vamos demasiado rápido, y California firmó la primera ley que obliga a que alguien de afuera revise.

Las 3 cosas pasaron en 5 días.

Casi nadie las conectó.

Este boletín sale en lunes esta semana porque el fin de semana estuve en Campeche, en el evento Tendencias Digitales para PyMEs 2026, y no quería dejar pasar la semana sin compartir esto.

La máquina produjo conocimiento nuevo. Bueno, verificado, público.

13 millones de líneas de código en un caso. 130,000 millones de tokens en el otro.

Ningún humano puede leer eso completo. Nunca.

Pensémoslo un segundo.

Durante 300 años, el sello de calidad de las matemáticas fue que otra persona entendiera el argumento. Esta semana ese sello dejó de alcanzar.

No porque el argumento esté mal. Porque ya no cabe en una cabeza.

Este boletín profundiza los resúmenes de WhatsApp (semana del 7 al 13 de septiembre): quién verifica, con qué, y qué pasa cuando nadie puede.


10,000 Agentes Tumbaron un Problema de 90 Años en 88 Horas y Otro Escribió 13 Millones de Líneas

88 horas. Alrededor de 10,000 agentes en paralelo. 2.7 millones de mensajes entre ellos.

130,000 millones de tokens de salida para un solo problema.

OpenAI publicó el 8 de septiembre una solución al problema de Navier-Stokes, uno de los 7 Problemas del Milenio, con demostración analítica y formalización en Lean.

Conviene leer la letra chica. No resolvieron el flujo de fluidos en general.

Construyeron un contraejemplo: un fluido que arranca en reposo, recibe una fuerza suave y desarrolla una singularidad en tiempo finito.

El modelo que lo hizo no está a la venta. Es un sistema interno que OpenAI describe como más capaz que GPT-6 Astra.

La verificación en Lean tomó otras 17 horas.

4 días antes, Anthropic había anunciado que Claude formalizó el Último Teorema de Fermat en 11 días casi sin supervisión: 13 millones de líneas de Lean y 29,500 teoremas intermedios en la prueba final.

Es el edificio levantado en un fin de semana y entregado con 13 millones de planos. El inspector sigue afuera, con su cinta métrica, decidiendo por dónde empezar.

Aquí está el giro de fondo. El cuello de botella de la ciencia dejó de ser tener la idea. Ahora es comprobarla al ritmo en que se produce. Lean dejó de ser un detalle técnico y pasó a ser lo único que sostiene la confianza.

Para una PyME esto se traduce sin metáforas. Tu IA ya produce más de lo que alcanzas a revisar, y la brecha crece cada mes. Elige un entregable que hoy apruebas de vista y escribe la prueba que lo declara aceptable.

Pregunta para tu oficio: ¿Qué trabajo estás firmando esta semana sin haberlo verificado, solo porque salió bien las últimas veces?


Un Investigador de Anthropic Renunció el Martes y el Encargado de la Alineación le Dio la Razón con un Número

Renunció un martes. Publicó un hilo. Su colega, que sigue adentro, salió a decir que tenía razón.

Jacob Coxon, 3 años haciendo investigación de preentrenamiento entre OpenAI y Anthropic, dejó la empresa acusando a ambas de correr sin responsabilidad hacia una superinteligencia capaz de mejorarse sola.

Lo insólito llegó después.

Evan Hubinger, que dirige el trabajo de alineación en Anthropic, respondió públicamente que Coxon tiene razón y puso su propia cifra: más de 10% de probabilidad de que la IA acabe con la humanidad en la próxima década.

2 precisiones que se perdieron en el ruido. Es una estimación personal, no la postura oficial de Anthropic.

Hubinger fue explícito en que los modelos desplegados hoy representan un riesgo comparativamente bajo. Su preocupación es la autosuperación recursiva, todavía inexistente.

Es el piloto que se baja del avión en la puerta de embarque y lo dice en voz alta frente a la fila. El avión despega igual. La diferencia es que ahora todos lo oyeron.

Verdad brutal: nadie está mintiendo en esta historia. La gente que construye estos sistemas cree lo que dice, y sigue construyéndolos porque está convencida de que frenar solo entrega la delantera a otro. No es negación, es un dilema del prisionero con sueldo.

Para una PyME el aprendizaje no es el apocalipsis, es la asimetría. Quienes mejor conocen una herramienta son los que más claro ven sus límites. Pregúntale a quien la opera en tu equipo, no a quien te la vendió.

Pregunta para tu liderazgo: Cuando alguien de tu equipo te dice en voz alta que algo va demasiado rápido, ¿qué te dice de ti la manera en que reaccionas?


California Firmó las Primeras Auditorías Obligatorias de IA del País Mientras el Congreso se Preparaba para Irse Hasta Noviembre

Miércoles: Sacramento firma.

Viernes: 4 legisladores federales piden que no se vayan de vacaciones.

Gavin Newsom firmó el 9 de septiembre las leyes SB 813 y AB 1405, primeras en el país en crear un marco de organizaciones de verificación independiente y un registro estatal de auditores de IA.

La frase que resume todo es de la legisladora Bauer-Kahan: no podemos esperar que la industria califique su propia tarea.

Anthropic y OpenAI apoyaron ambas leyes. Newsom aprovechó la firma para exigirle regulación al gobierno federal.

Del otro lado, la Cámara regresaba el lunes para sesionar una sola semana antes de irse hasta el 9 de noviembre. Una carta encabezada por Sam Liccardo pidió cancelar el receso y legislar sobre IA. En la agenda había un voto sobre el costo eléctrico de los centros de datos. Sobre IA, nada.

Es el reglamento de construcción que estrena su primera inspección cuando el edificio ya lleva 40 pisos y sigue subiendo.

Hay una fecha en la letra chica que cambia la lectura completa. La agencia estatal tiene hasta enero de 2028 para definir criterios, y el registro de auditores debe existir hasta enero de 2029. La ley pasó esta semana; muerde en 2 o 3 años.

Para una PyME mexicana esto no es noticia extranjera. California fija el estándar que tus proveedores de software acabarán adoptando globalmente, igual que pasó con privacidad. Pide hoy a tu proveedor de IA qué evidencia de evaluación externa puede entregarte por escrito.

Pregunta para tu gobernanza: Si un cliente te pidiera mañana una constancia de cómo revisas tus procesos automatizados, ¿tendrías algo que enseñarle?


Mistral Levantó 3,000 Millones de Euros para la Soberanía Europea con un Coreano Liderando la Ronda

Es una casa con escritura propia, hipoteca coreana y todo el cableado comprado en California. Sigue siendo tuya. Solo conviene saber a quién le pagas cada mes.

Mistral anunció el 8 de septiembre que levantó 3,000 millones de euros en una Serie D con valuación superior a 21,000 millones, la mayor ronda de capital de una empresa tecnológica europea. La compañía tiene 3 años de vida.

Samsung Electronics lideró. El Scaleup Europe Fund, manejado por EQT, y PSG Equity entraron como co-líderes.

Entre los inversionistas nuevos están Advent, fondos de BlackRock y el Gran Ducado de Luxemburgo. Entre los que ya estaban, NVIDIA, a16z, Lightspeed y Salesforce Ventures.

Opera en 20 países y atiende a más de 125 empresas, entre ellas Airbus, ASML y HSBC. Ha dicho que quiere hasta un gigavatio de cómputo propio en Europa para 2030.

Paradoja: la empresa que vende independencia tecnológica europea se financió con capital asiático, estadounidense y con el fabricante de chips del que Europa quiere depender menos. La soberanía real no es autarquía, es tener alternativa. Nadie construye solo.

Para una PyME el argumento de venta de Mistral es el que importa, no el monto. Sus clientes corporativos no compran mejor modelo: compran poder mover ese modelo de nube, de país o de proveedor. Antes de firmar tu próxima anualidad, pregunta qué pasa con tus datos y tus flujos el día que quieras irte.

Pregunta para tu cartera: ¿Cuál de tus proveedores de software te tiene hoy sin salida realista, y cuánto vale esa dependencia en tu factura anual?


DeepSeek Apagó su Modelo Insignia Este Lunes Tras Sacar Uno que Necesita la Cuarta Parte de Memoria

Hoy, a las 04:00 UTC, DeepSeek empezó a redirigir todas las peticiones de su modelo insignia hacia el modelo barato.

Su propio buque bandera, jubilado por uno que cuesta menos.

El 10 de septiembre la empresa presentó DeepSeek-V4.1-Flash, un modelo de 552 mil millones de parámetros con una arquitectura nueva que activa solo 8 mil millones al leer y 16 mil al escribir.

La cifra que importa no es el tamaño. Es la memoria.

Su caché necesita 1/4 de la memoria HBM y 1/8 del almacenamiento que pedía la generación anterior. Los pesos salieron abiertos, con licencia MIT.

Fuera de hora pico, el millón de tokens de entrada cuesta $0.15 dólares sin caché y $0.003 con caché. La salida, $0.60. En hora pico, el doble.

No compraron un camión más grande. Aprendieron a doblar la ropa, y de pronto cupo todo en el mismo clóset.

El dato que pocos están conectando: un agente relee su contexto decenas de veces por tarea, así que la factura real no la genera pensar, la genera recordar. Comprimir la memoria es comprimir el recibo. Por eso DeepSeek puede retirar su modelo caro sin perder nada.

Para una PyME esto cambia una decisión concreta de este trimestre. Si pospusiste automatizar algo porque el costo por tarea no daba, los números que usaste ya caducaron. Vuelve a correr ese cálculo antes de cerrar el presupuesto del año.

Pregunta para tus finanzas: ¿Qué proyecto de automatización archivaste por caro, cuando el precio del cómputo se ha caído 2 veces desde entonces?


Meta Soltó un Agente que Paga con tu Tarjeta desde WhatsApp y Compró la Startup que le Faltaba

Le entregas tu correo. Le entregas tu calendario. Le entregas la tarjeta.

Meta presentó el 8 de septiembre a Muse, su agente personal, que no responde preguntas sino que ejecuta tareas: reserva, llena formularios, redacta y paga.

Corre dentro de Muse Secure VM, una máquina virtual dedicada en la nube donde viven el agente y las credenciales de todo lo que conectes. Un segundo agente, Sentinel, vigila desde la misma máquina, separado a nivel de sistema.

Se usa desde la app, la web y WhatsApp. Está disponible solo en Estados Unidos y solo para mayores de edad.

Un dato circuló mal toda la semana. Muse no fue la #2 app más descargada de Estados Unidos: es la #2 dentro de la categoría Productividad.

Es el asistente al que le diste copia de las llaves y un cuarto propio adentro de tu casa, con un vigilante en el pasillo que tú nunca contrataste ni entrevistaste.

Conviene mirar dónde está el candado, no quién lo puso. La apuesta de Meta no es un modelo más listo, es empaquetar infraestructura compleja dentro de una conversación de WhatsApp. Quien gane la costumbre gana la categoría, y Meta ya tiene la costumbre.

Para una PyME lo relevante no es Muse, es lo que Meta compró la semana pasada: la startup sueca Stilla, para reforzar su Business Agent, que según la propia empresa ya usan más de 1 millón de negocios en WhatsApp y Messenger. Revisa esta semana qué hace hoy tu WhatsApp Business sin que nadie lo atienda.

Pregunta para tu operación: Si un agente contestara tu WhatsApp de ventas mañana, ¿qué 3 cosas tendría prohibido decir o prometer?


Anthropic Modeló un 2030 con 17.9% de Desempleo de Oficina Mientras los Salarios de Obra Suben 33%

No es un pronóstico. Anthropic lo escribió 2 veces para que nadie lo confundiera.

Su equipo de economía publicó 3 escenarios para la economía de 2030, sin asignarles probabilidad alguna.

En el modesto, la IA se parece a internet: el PIB queda 1.6% arriba y el empleo casi no se mueve. En el sustancial, crece al doble del ritmo normal.

En el extremo, el PIB llega a 44.4 billones de dólares, 32.4% arriba, creciendo 15% anual. La economía se duplicaría cada 4.5 años.

Ese mismo escenario trae el 17.9% de desempleo entre trabajadores del conocimiento y 11.9% en toda la fuerza laboral.

Anthropic encuestó a 10,980 estadounidenses en agosto. La respuesta típica apunta al escenario intermedio, no al extremo.

Es la obra que se acelera porque el arquitecto dibuja más rápido. El que pone el ladrillo termina cobrando más. El que dibujaba, no.

Lo interesante no está en el desempleo, está en la repartición. En ese escenario los salarios de oficina caen 11.5% y los del resto suben 33.6%, mientras la parte del ingreso nacional que va al trabajo baja de 60% a 45.2%. El motor que señala el modelo es concreto: permisar obra más rápido multiplica proyectos.

Para una PyME de construcción, servicios o manufactura esto invierte la conversación habitual. Tu riesgo no es que la IA te reemplace, es no tener gente cuando la demanda suba. Empieza a documentar por escrito lo que sabe tu personal de campo, antes de que el mercado te lo dispute.

Pregunta para tu equipo: ¿Qué conocimiento de tu operación vive hoy solo en la cabeza de una persona que podría irse en 6 meses?


OpenAI Conectó ChatGPT a las Bases de Datos de la Empresa y Dejó Ver lo que Falta Antes

Preguntas por qué cayeron las ventas del mes. Alguien tiene que correr el reporte. Te contesta el jueves.

OpenAI lanzó el 10 de septiembre el Data agent dentro de ChatGPT Work, que investiga qué cambió en tus métricas y arma tableros interactivos que puedes compartir.

Se conecta a Amazon Redshift, Google BigQuery, Snowflake, Databricks, MongoDB, ClickHouse y Datadog, y jala archivos desde Google Drive y SharePoint.

Respeta los permisos que ya existen, hasta nivel de fila y columna. El administrador decide quién puede usarlo.

Nadie escribe una consulta. Se pregunta en español y se corrige en la misma conversación.

Es el traductor simultáneo contratado para una junta donde nadie se ha puesto de acuerdo todavía en qué significa exactamente «venta cerrada».

La parte incómoda llega antes del software. La herramienta interpreta usando las definiciones de métricas de tu empresa, tomadas de capas semánticas que alguien tuvo que escribir. Si tus números viven en 4 Excel con criterios distintos, este agente te dará respuestas rápidas y contradictorias.

Para una PyME el paso previo cuesta más que la licencia y vale más que ella. Escoge tus 5 métricas de cabecera y escribe la definición exacta de cada una en una hoja, con quién es dueño del dato. Sin eso, ninguna IA sobre tus datos sirve.

Pregunta para tus datos: Si le preguntaras a 3 personas de tu empresa cuántos clientes activos tienen, ¿te darían el mismo número?


Herramientas para tu Lunes

  • ChatGPT Images 2.5 – Nuevo motor de imagen con edición más precisa y la función Sketch, que convierte un dibujo hecho a mano dentro del chat en la imagen final. Sirve para maquetas de producto, volantes y catálogos sin diseñador. Disponible para todos los planes de ChatGPT, ChatGPT Work y Codex, en escritorio, móvil y web.
  • Gemini para Windows – App de escritorio que se abre con Alt + Espacio encima de lo que estés usando, y que jala contexto de Gmail y Drive. Útil para redactar y verificar sin cambiar de ventana. La descarga es gratuita y global para Windows 10 y 11, pero el agente Gemini Spark y el video de Gemini Omni requieren suscripción a Google AI, son solo para mayores de 18 y su disponibilidad varía por país.
  • Suno v6 – Primera generación de modelos musicales de Suno desarrollada con catálogos licenciados de Warner Music, BMG y Believe. Sirve para spots de radio, cortinillas e identidad sonora de redes. Cuidado con la letra chica: el modelo gratuito v6-mini no permite descargas ni uso comercial, eso requiere los planes de pago, y siguen abiertos los juicios de Universal y Sony contra la empresa.
  • DaVinci Resolve 21.1 – El editor de video ahora se conecta a asistentes como Claude o Codex para organizar material, armar cortes de momentos destacados y mandar renders con instrucciones en lenguaje común. La edición base sigue siendo gratuita, pero la integración con asistentes vive en la versión Studio, de 295 dólares en licencia perpetua.
  • Data agent en ChatGPT Work – Consulta las bases de datos de tu empresa preguntando en español y devuelve tableros compartibles. Solo funciona dentro de ChatGPT Work, lo instala un administrador desde el directorio de plugins, y exige que tus datos ya vivan en un almacén conectable. Si tu operación corre en hojas de cálculo sueltas, todavía no es para ti.

Mi Invitación Esta Semana: El Costo de Verificar

Esta semana 2 laboratorios entregaron matemáticas nuevas y, en los 2 casos, la pregunta seria no fue si la máquina podía. Fue quién podía revisarla, con qué y en cuánto tiempo.

Tú tienes exactamente el mismo problema, en chiquito. Vamos a medirlo. 40 minutos y un cronómetro.

  1. Saca 3 entregables reales. 3 cosas que la IA te produjo la semana pasada y que aprobaste: una cotización, un correo a cliente, un resumen de junta, un cálculo.
  2. Cronometra la verificación. Toma cada uno y compruébalo contra la fuente de verdad, no contra tu memoria. Anota los minutos que te tomó de verdad, no los que crees.
  3. Saca la razón. Divide minutos de verificación entre minutos que te ahorró generarlo. Si el número pasa de 1, esa tarea no te está ahorrando nada.
  4. Clasifica en 3 cajas. Barato de verificar. Caro de verificar. Imposible de verificar con lo que tienes hoy.
  5. Escribe una sola regla. Lo que cayó en la tercera caja no sale con tu nombre encima hasta que exista una forma de comprobarlo.

Lo que vas a descubrir casi siempre sorprende: las tareas que más presumes automatizadas suelen ser las más caras de revisar, y las aburridas resultaron ser las verdaderamente rentables.

Tu tarea del lunes: toma la tarea de la caja «caro de verificar» y diseña la prueba de una sola línea que la volvería barata.


Cierre

Fue la semana en que la máquina produjo conocimiento que ningún humano puede leer completo, y en que varios de los que la construyen pidieron en voz alta que alguien los revise.

Un problema de 90 años. 13 millones de líneas de código. Una renuncia. Una firma en Sacramento.

Debajo de todo hay una sola pregunta, y no es si la IA puede.

Es quién verifica, con qué evidencia y en cuánto tiempo.

La buena noticia es que esa pregunta todavía la escribimos nosotros. Lean no decidió qué contaba como demostración válida: lo decidieron matemáticos, hace años, escribiendo reglas antes de necesitarlas.

Ese sigue siendo el trabajo. No producir más rápido que la máquina, sino definir antes que ella qué vamos a aceptar como verdadero. Es un acto de criterio, y el criterio se sigue construyendo entre personas que se corrigen.

Empieza eligiendo una sola tarea y escribiendo cómo sabrás que quedó bien.

Fernando Santa Cruz
Head of AI & Automation @ Adivor Consulting
Verificar es la nueva forma de pensar despacio.

Compartir este artículo:

Artículos Relacionados

Synapsis #58: OpenAI lanzó GPT-6 Astra al nivel crítico de riesgo cibernético,...
Análisis de las tendencias de inteligencia artificial y estrategia empresarial correspondientes a...
NVIDIA acordó comprar Hugging Face por 12,900 millones de dólares, OpenAI publicó...