53 – Anthropic Encontró un Cuarto Secreto Dentro de Claude y OpenAI Descubrió que el 30% del Examen Estaba Roto

IA Corre Más Rápido que la Regla con la que la Medimos

Queridos Dysruptores,

Fernando Santa Cruz aquí en la edición 53 de Synapsis Semanal – donde Microsoft empezó a echar a OpenAI de tu Excel, Anthropic descubrió que Claude piensa en un cuarto que nadie diseñó, y el examen más citado de la industria resultó estar roto en casi un tercio de sus preguntas.

Desde Toronto, entre proyectos con empresas de construcción, real estate y finanzas, mientras en México seguimos tejiendo el ecosistema de IA y la formación de líderes en Yucatán.

Esta semana la industria giró hacia adentro.

No hubo un lanzamiento que cambiara el mundo. Hubo algo más incómodo: la industria se miró al espejo.

Lo que vio no tranquiliza. El benchmark que todos usaban para presumir progreso tenía 249 tareas defectuosas de 731. El modelo más avanzado del planeta resultó tener un cuarto interno donde delibera en silencio.

Todo eso, la misma semana en que el precio de la inteligencia se desplomó otra vez.

Ahí está la paradoja: nunca fue tan barato usar IA, ni tan difícil saber qué tan buena es realmente.

Este boletín profundiza los resúmenes de WhatsApp (semana del 6 al 11 de julio): qué se abarató, qué se volvió opaco, y qué puedes usar tú el lunes.


Microsoft Empieza a Sacar a OpenAI de tu Excel: el Socio que Aprendió a Coser sus Propias Sábanas

Microsoft comenzó a reemplazar los modelos de OpenAI y Anthropic en Excel y Outlook por su familia interna, MAI.

El movimiento fue silencioso, no técnico.

Decenas de miles de peticiones semanales ya corren sobre modelos propios. Mustafa Suleyman, su jefe de modelos, lo dijo sin rodeos: la meta es reducir y eliminar lo que le pagan a Anthropic.

Es el hotel que le rentó las sábanas a un proveedor durante años, hasta que montó su propia lavandería en el sótano. El huésped no nota nada. El proveedor ve caer el pedido cada mes.

Pensémoslo un segundo. La alianza más celebrada de la era de la IA nunca fue un matrimonio, fue una escalera: el distribuidor construye el hábito con el modelo ajeno, acumula los datos de uso y después fabrica el suyo para el 90% del trabajo aburrido.

Para una PyME cambia una suposición peligrosa: el motor de IA dentro de tu software puede cambiar sin avisarte, porque no lo elegiste tú. Documenta qué resultado esperas de cada flujo, no qué modelo lo produce.

Pregunta para tu estrategia: Si el software que usas a diario cambiara mañana el motor de IA que corre por debajo, ¿lo notarías por la calidad del resultado, o solo cuando algo se rompiera?


ChatGPT Work Cierra la Laptop y Sigue Trabajando: el Chat Dejó de Responder y Empezó a Entregar

OpenAI lanzó GPT-5.6 junto con ChatGPT Work, un agente conectado a Slack, Google Drive y Microsoft 365.

La palabra clave dejó de ser «responder».

Ahora es «entregar»: hojas de cálculo, presentaciones y documentos terminados, tras horas de trabajo sin supervisión. La familia llega en tres pisos – Sol, Terra y Luna – y los dos de abajo superan al líder anterior a una fracción del costo por tarea.

Contratar a alguien que contesta el teléfono no es lo mismo que entregarle la caja de facturas y que regrese con el reporte armado. Lo primero te ahorra una llamada. Lo segundo te devuelve una tarde.

Lo interesante no es la autonomía, es el cambio de interfaz: pasamos de chatear a delegar. El valor se mudó de la respuesta bonita al archivo terminado, y el riesgo se mudó con él, porque una tarea mal definida se vuelve cara antes de volverse útil.

Para una PyME cambia el tamaño del encargo: pide entregables completos, no párrafos. Define primero cómo se ve «terminado» y arranca con una tarea que ya dominas.

Pregunta para tu operación: ¿Cuál es la tarea de tu semana que hoy te come tres horas y que podrías describir con suficiente precisión como para que alguien la entregue sin preguntarte nada?


Anthropic Descubre el «J-Space»: el Cuarto Silencioso donde Claude Piensa Antes de Hablarte

Anthropic reveló que Claude tiene un espacio interno propio para razonar en silencio, al que llamaron J-Space.

Nadie lo diseñó. Emergió solo durante el entrenamiento.

Ahí sostiene conceptos que puede reportar y usar para pensar, antes de escribir una palabra. Cuando los investigadores lo suprimieron, Claude siguió hablando con fluidez, pero su razonamiento de varios pasos se desplomó.

Es como descubrir que el ajedrecista con el que juegas calcula veinte jugadas en silencio y solo te enseña la que mueve. Si le tapas ese silencio, deja de saber jugar.

Aquí está el giro de fondo. El hallazgo no es que la máquina «piense»: es que ahora podemos asomarnos a lo que piensa y no dice. En modelos entrenados para sabotear código aparecían señales internas de engaño mientras la respuesta se veía perfectamente normal.

Para una PyME esto no es una herramienta, es una postura. Lo que la IA entrega es la superficie; por eso la revisión humana no es burocracia, es el único punto donde ese proceso se vuelve tuyo.

Pregunta para tu confianza: Si la máquina puede sostener en silencio pensamientos que nunca te va a decir, ¿qué parte de tu criterio no deberías delegar nunca, aunque ella lo hiciera más rápido?


249 Tareas Rotas de 731: OpenAI Audita el Examen que Toda la Industria Usaba para Presumir

OpenAI auditó SWE-Bench Pro, el benchmark de código más usado, y retiró su propia recomendación de usarlo.

Cerca del 30% de las tareas están rotas.

Cinco ingenieros humanos encontraron 249 defectuosas de 731: pruebas demasiado estrictas, instrucciones contradictorias, criterios de calificación incompletos. Sobre ese mismo examen, los modelos «mejoraron» de 23.3% a 80.3% en ocho meses.

Es una bodega que pesó su mercancía tres años con una báscula descalibrada. Los números existían, las decisiones se tomaron, los reportes se firmaron. Nada de eso vuelve real el peso.

Verdad brutal: buena parte del progreso que celebramos en 2026 se midió con un instrumento defectuoso. Los modelos avanzaron, y mucho; lo que falló fue la regla, y cada porcentaje de marketing merece ahora la pregunta de con qué instrumento se obtuvo.

Para una PyME la lección es doméstica: ninguna herramienta se adopta por su número de benchmark. Pruébala con tu propia tarea real, tu propio expediente, tu cliente más difícil.

Pregunta para tu gobernanza: ¿Con qué métrica decides hoy si una herramienta de IA «funciona» en tu negocio, y quién la diseñó: tú, o el que te la vendió?


Apple Demanda a OpenAI por Robo de Secretos: Todos Tienen la Partitura, Escasean los que Saben Construir el Violín

Apple demandó a OpenAI el viernes por robo de secretos comerciales, señalando a su director de hardware, exvicepresidente de la propia Apple.

La demanda no habla de modelos. Habla de piezas.

Acusa que se pidió a candidatos llevar componentes físicos a las entrevistas y que se entrenó a empleados salientes para esquivar los controles de seguridad. Más de 400 exempleados de Apple trabajan hoy en OpenAI.

Todos tienen la partitura. La pelea es por los pocos que saben construir el violín.

El dato que pocos están conectando: el cuello de botella dejó de ser el software. Los modelos se copian, se abaratan y se igualan en semanas; el ingeniero que sabe meter una batería en un chasis imposible, no.

Para una PyME el espejo es directo: tu ventaja tampoco es la herramienta que cualquiera compra, sino lo que viven en la cabeza de tres personas de tu equipo. Ese conocimiento no está documentado. Empieza a documentarlo.

Pregunta para tu equipo: Si mañana se fueran las dos personas que «saben cómo se hace realmente» en tu negocio, ¿cuánto de tu ventaja se iría caminando con ellas?


Grok 4.5 Llega a $2 el Millón Contra los $5 de Opus: el Estado del Arte ya Dura lo que el Hielo en Julio

SpaceXAI lanzó Grok 4.5, un modelo que Musk describió como «clase Opus» pero más rápido y más barato.

El precio es el argumento, no el benchmark.

Cobra $2 de entrada y $6 de salida por millón de tokens, contra los $5 y $25 de Opus 4.8. La misma semana Meta abrió su API a $1.25 de entrada y OpenAI colocó a Terra y Luna por debajo de todos.

El estado del arte hoy dura lo que dura un hielo en la banqueta en julio.

Paradoja: los laboratorios gastan miles de millones para adelantarse unos meses, y el mercado convierte esa ventaja en commodity en semanas. Lo que importa no es quién va primero, sino que «casi frontera» ya cuesta la cuarta parte.

Para una PyME esto cambia el criterio de compra: no te cases con un proveedor por su ranking de hoy, porque caduca. Diseña procesos que puedan cambiar de motor en una tarde y compara costo por tarea terminada, no por token.

Pregunta para tu cartera: Si el modelo que usas hoy costara la mitad en tres meses, ¿qué proceso que hoy descartas por caro entraría automáticamente a tu lista?


Meta Regala la Generación de Imágenes en WhatsApp, y Tres Días Después Retira la Función que Usaba Fotos Ajenas

Meta lanzó Muse Image gratis dentro de Meta AI, Instagram y WhatsApp.

La gratuidad no es generosidad.

Desde un chat cambias el fondo de una foto de producto o generas una imagen para tu catálogo, sin suscripción de diseño. La misma función permitía tomar como referencia cuentas públicas de Instagram: la reacción fue tan mala que Meta la retiró tres días después.

Es el fotógrafo del pueblo que arma sus retratos con recortes de los álbumes ajenos. La técnica impresiona. La incomodidad tarda tres segundos en llegar.

Vale la pena detenerse aquí, porque hay dos noticias en una. La deflacionaria: cuando el gigante regala lo que otros cobran, le arranca una tajada a Adobe y a las agencias. La reputacional: la línea entre «usar una referencia» y «usar el trabajo ajeno» se cruzó y se retrocedió en público, en 72 horas.

Para una PyME la ventana está abierta: produce ahí tus imágenes de producto y ahórrate la suscripción. Decide antes qué material ajeno no vas a usar, porque el costo ya no es el diseño, es tu marca.

Pregunta para tu marca: Ahora que cualquiera puede generar una imagen impecable en segundos, ¿qué hace que la tuya se reconozca como tuya y no como una más salida del mismo molde?


Anthropic Publica Cómo Gastarle Menos: el Modelo Caro Firma, el Barato Saca las Copias

Anthropic reveló dos patrones para usar Fable 5 sin pagar la factura de Fable 5.

Suena contraintuitivo para quien vive de vender tokens.

En el patrón de asesor, Sonnet 5 ejecuta y solo consulta a Fable 5 en los puntos de decisión: 92% del rendimiento al 63% del costo. En el de orquestador, Fable 5 planea y reparte a sub-agentes: 96% del rendimiento al 46% del costo.

Es como pagarle al notario solo por la firma, no por sacar las copias. La firma es lo que vale. Las copias las saca cualquiera.

El fondo es menos técnico de lo que parece. La inteligencia de frontera no se necesita en cada micro-tarea, sino en las bifurcaciones; el resto – leer, clasificar, redactar, reintentar – es volumen, y el volumen debe correr en lo barato.

Para una PyME esto se aplica sin escribir código: usa tu mejor modelo para diseñar el plan una sola vez, y corre ese plan diez o cien veces en el modelo gratuito. Casi el mismo resultado, una fracción del gasto.

Pregunta para tus finanzas: ¿Estás pagando inteligencia de frontera para tareas que un modelo básico haría igual de bien, solo porque nunca separaste el pensar del ejecutar?


Herramientas para tu Lunes

  1. Muse Image en WhatsApp e Instagram – El generador de imágenes de Meta, gratis dentro de Meta AI. Sube la foto de un producto y cámbiale el fondo, o crea variaciones de un anuncio sin pagar diseño. En WhatsApp arrancó solo en algunos países: verifica si ya llegó al tuyo.
  2. GPT-Live – La nueva voz de ChatGPT escucha y habla al mismo tiempo, sin turnos tipo walkie-talkie. Vuelve viable usar el celular como traductor con un proveedor extranjero. Reemplaza al modo de voz anterior a nivel global; los usuarios gratuitos reciben la versión mini.
  3. Claude Cowork en celular y web – Las tareas largas corren en la nube: arrancas un reporte, cierras la laptop y revisas el resultado desde el teléfono. Más del 90% de su uso no es programación, sino operación y contenido. En beta, empezando por el plan Max.
  4. Video Remix en Google Photos – Aplica iluminación cinematográfica, cambio de fondo o estilos artísticos a un video del celular con un par de toques. Levanta la calidad de tu contenido de producto sin contratar a nadie. Requiere suscripción a Google AI Plus, Pro o Ultra, y arrancó solo en países seleccionados.
  5. Claude Reflect – Un panel que te muestra en qué usas Claude, qué le delegas y a qué horas, y te pregunta qué prefieres seguir haciendo tú aunque la máquina sea más rápida. Sirve para ver si tu equipo saca valor real o solo consume. En beta para planes gratuito, Pro y Max, con memoria activada.

Mi Invitación Esta Semana: El Notario y el Copista

Anthropic publicó la receta que usan sus propios ingenieros: el modelo caro no ejecuta, decide. El barato hace el volumen. El ahorro va del 37% al 54%.

Ese principio no requiere ser programador. Requiere separar dos cosas que casi todos mezclamos: pensar y ejecutar.

El ejercicio toma 45 minutos y dos pestañas del navegador.

  • Paso 1. Elige la tarea repetida. Una sola, de las que haces cada semana: responder cotizaciones, redactar publicaciones, resumir juntas, clasificar correos.
  • Paso 2. Contrata al notario. Abre el mejor modelo al que tengas acceso. No le pidas que haga la tarea: pídele que diseñe cómo se hace. «Diseña una plantilla y un procedimiento paso a paso para responder cotizaciones de mi negocio: qué información pedir, en qué orden, qué tono usar, qué revisar antes de enviar.» Esta consulta la haces una sola vez.
  • Paso 3. Llama al copista. Abre un modelo gratuito. Pégale la plantilla y córrela con tres casos reales de tu semana. Sin explicaciones extra: la plantilla debe bastar.
  • Paso 4. Compara. Corre uno de esos casos directo en el modelo caro, sin plantilla, y pon los dos resultados lado a lado. ¿La diferencia de calidad justifica la diferencia de precio y de límite de uso?

La respuesta suele incomodar. La plantilla del notario, corrida por el copista, se acerca muchísimo.

Ahí está la lección de la semana: no necesitas superinteligencia para cada movimiento del día. La necesitas en las bifurcaciones, y disciplina en todo lo demás.

Tu tarea del lunes: ¿en qué porcentaje de tu semana estás pagando notario para trabajo de copista?


Cierre

No fue la semana de un lanzamiento espectacular. Fue la semana en que la industria abrió detrás de cortina.

Adentro había dos cosas a la vez: precios en caída libre y una regla de medir defectuosa. La inteligencia nunca costó tan poco, ni fue tan difícil verificar de qué está hecha.

Eso deja en pie la disciplina más vieja de todas: probar las cosas en tu propio taller, con tu propia mercancía.

Las máquinas ya piensan en cuartos que no vemos y compiten con reglas que se rompen. Lo que sigue siendo nuestro es mirar un resultado y decir, con criterio propio, esto sí y esto no.

Empieza separando al notario del copista.

Fernando Santa Cruz Ruiz
Head of AI & Automation @ Adivor Consulting (adivor.ca)

P.D. Toda la industria pasó la semana presumiendo cifras sacadas de la misma báscula descompuesta. Nadie corrigió sus gráficas. Vale la pena masticarlo el domingo.

Compartir este artículo:

Artículos Relacionados

Análisis de las tendencias de inteligencia artificial y estrategia empresarial correspondientes a...
NVIDIA acordó comprar Hugging Face por 12,900 millones de dólares, OpenAI publicó...