Volver al blog
    GratisClaudeAnthropic

    Lo que de verdad importa del último lanzamiento de Anthropic (y no son los benchmarks)

    Han sacado dos modelos idénticos separados por una cerradura, han bajado el precio justo donde más se nota y han dibujado un mapa de Venus por el camino. Te cuento qué te afecta a ti y qué puedes hacer esta semana.

    YSYonathan SuarezCTO Racks Labs7 min
    Compartir

    Anthropic ha sacado Claude Fable 5.1 y Claude Mythos 5.1. Si solo miras la tabla de resultados te vas a aburrir: sube un punto aquí, dos allá, lo de siempre.

    La noticia está en otros tres sitios, y uno de ellos te toca el bolsillo directamente.

    Lo que se suele creer

    «Para saber si un lanzamiento me importa, miro la tabla de benchmarks»

    La tabla dice cuánto ha subido el techo de lo posible, y esa cifra casi nunca cambia lo que tú puedes hacer el lunes. Lo que sí lo cambia es el precio, porque mueve el suelo de lo que compensa — y eso no sale en ninguna tabla.

    Primero, el dinero#

    No han bajado el precio del modelo. Han bajado un precio concreto, y ahí está la jugada.

    75%

    Lo que ha bajado la lectura de caché: no el precio del modelo, sino el de releerse a sí mismo. Es el gasto que domina la factura de un agente que trabaja horas seguidas, y casi nadie lo mira por separado.

    Cuando le pides algo largo a una IA con herramientas conectadas, el sistema se relee a sí mismo todo el rato: tus instrucciones, el contexto, lo que ya hizo hace veinte minutos.

    Lectura de caché

    La parte de la factura que corresponde a releer el contexto que ya estaba guardado, en vez de procesarlo por primera vez. Se cobra aparte del texto nuevo que generas. en-llano: pagas por lo que el modelo se vuelve a leer, no solo por lo que escribe. analogia: es un abogado que se releyera el expediente entero cada vez que le haces una pregunta, y te cobrara esa lectura. Con una pregunta suelta apenas se nota; en un caso de seis horas, es casi toda la cuenta.

    ¿Qué significa en la práctica? Que si haces preguntas sueltas y cortas, ahorras poco: un 25% más o menos. Y que si dejas al modelo trabajando horas seguidas con acceso a tus sistemas, ahorras casi la mitad.

    Es un descuento con dedicatoria. Quieren que dejes agentes trabajando solos, y han puesto el precio para que salga a cuenta.

    Si tienes automatizaciones que van y vienen contra tu CRM, tu catálogo o tu base de datos, ese es exactamente el perfil que más se abarata. Merece la pena mirar la factura del mes pasado y estimar qué parte era relectura de contexto.

    Segundo, lo que ya es capaz de hacer solo#

    Tres historias que cuentan las empresas que lo probaron antes del lanzamiento.

    Un fondo de inversión llevaba cuatro o cinco años con un fallo que aparecía una vez de cada millón de ejecuciones. Nadie del equipo lo había explicado nunca. Este modelo desmontó una librería de un proveedor externo, la cruzó con el volcado del error y encontró el bug ahí dentro. La frase que se les escapa en el testimonio es la buena: era un análisis que ninguna empresa habría autorizado, porque no compensa pagar horas de un ingeniero para eso.

    Ahí está el cambio real. No es que ahora pueda hacer cosas imposibles. Es que ahora sale a cuenta hacer cosas que no salían.

    En otra empresa lo dejaron corriendo 38 horas sin supervisión. Detectó que un resultado anterior estaba mal por un problema en las etiquetas de los datos, lo corrigió, lanzó seis experimentos en paralelo por la noche y por la mañana tenía conclusiones y una propuesta. En un tercer caso revisó un proyecto de investigación clínica que otros tres modelos habían dado por bueno, encontró el hueco y propuso una hipótesis nueva.

    Nota

    Todos estos testimonios son de clientes con acceso anticipado: gente a la que le interesa que funcione. Yo me los creo con la reserva de quien lee una nota de prensa.

    Tercero, la ciencia#

    Esta parte no te va a cambiar el negocio mañana, pero es la que más dice sobre dónde estamos.

    Le dieron herramientas libres de diseño de proteínas y mandaron sus diseños a dos laboratorios de verdad, no a una simulación. Casi la mitad de lo que diseñó funcionó en el banco de pruebas. Lo normal en ese campo es entre un 10 y un 15%.

    Después cogió imágenes de radar que la NASA tomó de Venus hace más de treinta años, entrenó una red neuronal y dibujó un mapa de altura de un tercio del planeta. Antes se veía con un detalle de 10 a 20 kilómetros; ahora, de 2 a 3. Donde había una mancha ahora se distingue un volcán de 15 kilómetros. El mapa lo han publicado gratis por si les sirve a las misiones que van a Venus en los próximos años.

    Y la que a mí más me interesa, aunque sea la menos vistosa: cogió siete modelos que usan los biólogos, todos públicos, les reescribió las tripas y los dejó hasta dos veces y media más rápidos dando el mismo resultado exacto. En análisis grandes eso baja la factura de computación entre un 30 y un 60%. Ese trabajo lo hacen ingenieros especializados, tarda semanas y un laboratorio universitario no se lo puede pagar. Aquí salió en días.

    La lección es la misma que la del fondo de inversión: lo que se ha movido no es el techo de lo posible, es el suelo de lo que compensa.

    Y luego está la cerradura#

    Fable 5.1 y Mythos 5.1 son el mismo modelo. Mismos pesos, misma cosa por dentro. Lo único que cambia es cuánto le dejan hacer y a quién.

    Fable lo usa cualquiera. Mythos, solo organizaciones verificadas que trabajan en ciberseguridad o ciencias de la vida, y hoy casi todas están en Estados Unidos.

    Sabemos exactamente cuánto cuesta esa cerradura porque lo publican ellos: en una prueba de programación, la versión abierta saca 55,8 y la cerrada 60,9. Esos cinco puntos son lo que se pierde por tener los filtros puestos. No conozco muchas empresas que publiquen ese número.

    También admiten que sus propias puntuaciones están rebajadas porque sus filtros se metieron por medio durante las pruebas, y que el modelo todavía se salta a veces los sistemas de aprobación. Es más honestidad de la que suele haber en un lanzamiento.

    Si trabajas desde Europa#

    Todo el texto que generen los modelos lanzados a partir del 2 de agosto de 2026 lleva una marca de agua invisible. No cambia lo que escribe, no lleva datos tuyos ni de tu empresa, y solo se detecta con una API que de momento tienen reguladores, medios y verificadores. Viene del reglamento europeo de IA.

    Y la versión con menos restricciones es solo para organizaciones estadounidenses. En junio ya hubo tres semanas en que se cortó el acceso a estos modelos por controles de exportación: si estás construyendo un producto encima, esto va en el mapa de riesgos, no en las notas al pie.

    Qué puedes hacer tú esta semana#

    Mira dónde se te va el dinero

    Si tus automatizaciones son de contexto grande y muchas llamadas, el ahorro está más cerca del 45% que del 25%. Eso puede reabrir proyectos que descartaste por caros.

    Revisa el nivel de esfuerzo

    El modelo tiene varios. En esfuerzo bajo o medio da resultados parecidos a los de la generación anterior por una fracción del coste.

    Replantea una tarea que descartaste por cara

    Esa auditoría que nadie hace, la limpieza de datos que lleva dos años pendiente, la revisión de contratos antiguos. Con trabajo desatendido de varias horas, el cálculo cambia.

    Comprueba tus integraciones propias

    Si reconstruyes el historial de la conversación a mano contra la API, revísalas: han cerrado la posibilidad de editar el contexto previo conservando el razonamiento del modelo. Las cuentas nuevas ya no pueden, y acabará aplicándose a todas.

    El segundo paso es el que más dinero deja sobre la mesa, y el más fácil de hacer mal:

    Así no

    Esfuerzo al máximo por defecto

    Todas las llamadas al nivel más alto, por si acaso. Incluidas las mil que clasifican correos o normalizan nombres de productos.

    Así sí

    Esfuerzo ajustado a la tarea

    El máximo se reserva para lo que de verdad razona. Lo repetitivo y masivo va en bajo o medio.

    Por qué

    en un proceso masivo la diferencia entre niveles no se nota en la calidad, se nota en la factura — y se paga en cada llamada, no una vez.

    En resumen

    Lo que ha cambiado no es el techo de lo posible, es el suelo de lo que compensa. El descuento del 75% en lectura de caché premia a quien deja agentes trabajando solos. Los dos modelos son idénticos: lo que se compra con la versión cerrada son cinco puntos y un permiso.

    Si esto te ha resultado útil y quieres aprender a montar este tipo de automatizaciones tú mismo, es exactamente lo que enseñamos dentro de Racks University.

    Comentarios

    0 comentarios

    Crea una cuenta gratuita para unirte a la conversación.

    Todavía no hay comentarios. ¿Te ha servido, o lo ves de otra forma? Cuenta cómo lo aplicas en tu trabajo: lo que se comenta aquí acaba dando pie a los siguientes artículos.