En corto: GPT-6 Astra, Claude Fable y Mythos 5.1 y Muse Spark 1.3: qué anunciaron, qué midieron terceros y qué significa la IA autónoma para tu empresa.
Septiembre de 2026 no será recordado por actualizaciones cosméticas ni por pequeños incrementos de velocidad. La primera semana del mes marcó un punto de inflexión en la industria: el paso de los modelos que conversan a los agentes que razonan y ejecutan en entornos reales. En cuatro días, OpenAI, Anthropic y Meta presentaron tres apuestas distintas sobre hacia dónde va la inteligencia artificial.
En iAmanos leímos los anuncios originales, las mediciones de terceros y la letra pequeña. Aquí van los anuncios clave, los datos reales de rendimiento (con su fuente y su matiz) y lo que significan para una empresa que tiene que decidir qué hacer el lunes.
En 30 segundos
- GPT-6 Astra (OpenAI, 3 de septiembre): el primer modelo con el que OpenAI se atreve a decir «bienvenidos a la era de la AGI». Usa la computadora como una persona y es el primero que la propia OpenAI clasifica en su nivel Crítico de ciberseguridad.
- Claude Fable 5.1 y Mythos 5.1 (Anthropic): el mismo modelo con dos niveles de salvaguardas. Se probó con problemas industriales reales: un error de años en un fondo de inversión, diseño de proteínas y un mapa nuevo de Venus.
- Muse Spark 1.3 (Meta): la guerra de precios. Cuesta 10 centavos de dólar por millón de tokens de entrada si aceptas que Meta entrene con lo que le mandas.
- La conclusión: ya no se compra un modelo para escribir texto. Se contrata autonomía, y la pregunta pasa a ser cuánta puede asumir con seguridad.
1. OpenAI y GPT-6 Astra: ¿llegamos finalmente a la AGI?
El lanzamiento de GPT-6 Astra vino acompañado de debate y de hitos técnicos sin precedentes. Al cerrar la presentación con la prensa, el presidente de OpenAI, Greg Brockman, se despidió con una frase que ninguna empresa del sector había usado en un lanzamiento: «Bienvenidos a la era de la AGI».
Astra es el primer modelo de OpenAI preentrenado con más de 100,000 GPUs en su infraestructura Stargate y, sobre todo, el primero en el que los modelos anteriores tuvieron un papel importante supervisando el entrenamiento del siguiente. Dicho de otra forma: la IA ya participa en la fabricación de la siguiente IA.

Soberanía sobre la interfaz: usa la computadora como tú
En OSWorld, la prueba donde la IA controla un escritorio real con teclado y ratón para hacer tareas administrativas y de ingeniería, Astra alcanzó 72.6% de éxito en un subconjunto de OSWorld 2.0, contra 65.7% de su antecesor, GPT-5.6 Sol. Lo más interesante no es el porcentaje sino el tiempo: unos 40 minutos por tarea contra 75, casi la mitad. No solo acierta más: titubea menos.
Razonamiento abstracto: el 99.9% que hay que leer con lupa
ARC-AGI-3 es la prueba diseñada para medir si un modelo generaliza ante problemas abstractos que nunca vio en su entrenamiento. Es de las más difíciles de «estudiar para el examen». El titular que circuló fue un 99.9%, y es real, pero tiene un matiz que casi nadie contó.

| Cómo se midió | Resultado de Astra | Qué significa |
|---|---|---|
| Con el adaptador propio de OpenAI (conserva su razonamiento entre intentos) | 99.9% | Paridad con humanos en la prueba. Superó la eficiencia humana en 96% de los niveles. |
| Con el arnés neutral de ARC Prize (las mismas reglas para todos los modelos) | 62.7% | Sigue siendo altísimo, pero es la cifra comparable con la de la competencia. |
La propia organización de ARC Prize lo explica: la diferencia se debe sobre todo a que el adaptador de OpenAI deja que el modelo conserve su estado de razonamiento entre peticiones, algo que los demás sistemas no tienen en el arnés neutral. Las dos cifras son ciertas; solo una sirve para comparar. Es una buena lección para leer cualquier benchmark de 2026.
Capacidad cibernética autónoma: el umbral que nadie había cruzado
Aquí está el dato que más debería importarle a un director de sistemas. Astra es el primer modelo que OpenAI clasifica en el nivel Crítico de ciberseguridad de su marco de preparación: es capaz de encontrar vulnerabilidades desconocidas (zero-day) y construir cadenas de explotación contra sistemas bien protegidos sin guía humana continua. Sacó 100% en ExploitBench y, durante la propia evaluación, descubrió dos vulnerabilidades que no se conocían y que OpenAI reportó a los responsables del software.

La misma capacidad que sirve para atacar sirve para defender. Por eso el despliegue fue escalonado: primero un grupo limitado de organizaciones y, en los días siguientes, los usuarios de ChatGPT Plus, Pro, Business y Enterprise, además de la API, Microsoft Azure y AWS Bedrock.
Comprensión tridimensional: de una frase a un espacio navegable
La demostración creativa oficial muestra a Astra construyendo una casa en Blender y convirtiéndola en una escena recorrible en Unreal Engine 5. Lo relevante es el método: el modelo escribe el código de Blender, lo ejecuta, mira el render, detecta lo que está mal y lo corrige, en ciclo, sin que nadie le toque el ratón. Ese ciclo de hacer, ver y corregir es exactamente lo que separa a un agente de un generador de texto.

2. Anthropic: Claude Fable 5.1 y Mythos 5.1, ingeniería inversa y ciencia aplicada
Mientras la conversación pública se centraba en la AGI de OpenAI, Anthropic apostó por la resolución de problemas industriales difíciles. Un detalle que se pierde en los titulares: Fable 5.1 y Mythos 5.1 son el mismo modelo con distintos niveles de salvaguardas. Fable 5.1 está disponible para todos; Mythos 5.1, con menos restricciones, solo para organizaciones de Estados Unidos dentro de los programas de acceso de confianza de Anthropic.
Un error de años, resuelto desde el volcado de memoria
En el fondo de inversión Millennium había un fallo rarísimo, de esos que ocurren una vez en un millón, que ninguno de sus ingenieros (ni ningún otro modelo) había podido explicar tras varios años de intentos. Fable 5.1 tomó el volcado de memoria del desplome, desensambló la librería compilada de un proveedor externo, la cotejó contra ese volcado y localizó el error exacto dentro del código del proveedor.

Para cualquier empresa con sistemas heredados, esto es enorme: la caja negra del proveedor deja de ser una excusa.
Diseño de proteínas: del 10-15% a casi el 50%
Anthropic le dio a Mythos 5.1 acceso a herramientas abiertas de diseño y plegado de proteínas y mandó sus diseños a dos organizaciones externas para validarlos en laboratorio. Su tasa de acierto llegó a casi el 50% en 12 objetivos, cuando lo habitual en el campo hoy es de 10 a 15%. En tres objetivos, la afinidad de unión fue unas diez veces mayor que la de las mejores propuestas enviadas a los concursos de diseño de proteínas de Adaptyv Bio. Traducido: la fase inicial de la investigación de medicamentos dirigidos puede acortarse de forma drástica.

Un mapa nuevo de Venus con datos de hace más de 30 años
Con los datos de radar de la misión Magallanes de la NASA, que tienen más de 30 años, Claude generó un mapa de elevación nuevo y de alta resolución de la superficie de Venus, con detalles de dos a tres kilómetros en lugar de 10 a 20. Los datos llevaban décadas ahí. Faltaba quien tuviera la paciencia y la capacidad de volver a leerlos.

La lección para las empresas es directa: tus datos viejos valen más de lo que crees. Lo que antes no se podía analizar por falta de manos, hoy se puede.
3. Meta Muse Spark 1.3: la guerra de precios y la democratización de los agentes
El laboratorio de superinteligencia de Meta lanzó Muse Spark 1.3 con una estrategia clara: dominar la adopción por volumen con precios agresivos. Tiene dos niveles:
- Estándar: 1.25 dólares por millón de tokens de entrada y 4.25 de salida.
- Contribuidor: 0.10 dólares de entrada y 0.20 de salida (hasta unas 21 veces más barato), a cambio de que Meta pueda usar lo que envías y lo que recibes para mejorar sus productos. Además trae una ventana de contexto de alrededor de un millón de tokens.

Esa reducción de barreras acelera la entrada de agentes a flujos de trabajo que antes no salían en números por el costo de la API. Pero el nivel contribuidor tiene un precio que no se ve en la factura: tus datos. Para un prototipo o para información pública puede ser una ganga. Para datos de clientes, contratos o cualquier información que la ley te obliga a proteger, no es una opción.
Comparativa técnica de modelos (septiembre de 2026)
| Modelo | Desarrollador | Enfoque principal | Hito destacado | Precio por millón de tokens (entrada / salida) |
|---|---|---|---|---|
| GPT-6 Astra | OpenAI | Autonomía de escritorio y ciberseguridad | 99.9% en ARC-AGI-3 con su adaptador (62.7% en arnés neutral) · 72.6% en OSWorld 2.0 | $10 / $50 (modo rápido: $20 / $100) |
| Claude Fable 5.1 / Mythos 5.1 | Anthropic | Razonamiento profundo e ingeniería inversa | Desensamblado de binarios · ~50% de acierto en diseño de proteínas | $10 / $50 |
| Muse Spark 1.3 | Meta | Eficiencia y despliegue masivo | Nivel contribuidor de costo ultrabajo | $1.25 / $4.25 (contribuidor: $0.10 / $0.20) |
Fíjate en algo: los dos modelos de frontera cuestan exactamente lo mismo. La competencia en la cima ya no es por precio sino por lo que cada uno sabe hacer solo. El precio se pelea un piso más abajo.
Implicaciones para el sector tecnológico y de negocio

De generar texto a ejecutar procesos completos
Las empresas ya no deberían buscar un modelo para escribir texto o código suelto, sino para ejecutar procesos completos: auditorías de software, diseño CAD y 3D, análisis de datos sin supervisión constante, atención a clientes de principio a fin. La pregunta cambia de «¿qué tan bien escribe?» a «¿qué tarea le puedo entregar entera y cómo sé que la hizo bien?». Eso es lo que construimos en iAmanos con agentes de IA y asistentes para negocio: tareas completas, con límites claros de lo que el agente puede y no puede hacer.
Ciberseguridad proactiva: de deseable a obligatoria
Si un modelo comercial ya encuentra vulnerabilidades zero-day por su cuenta, hay que asumir que los atacantes también tendrán esa capacidad. Las herramientas de auditoría de código en tiempo real dejan de ser un lujo y pasan a ser obligatorias en la cadena de integración y despliegue continuo (CI/CD). La buena noticia es simétrica: la misma capacidad puede revisar tu código antes de que lo haga alguien con malas intenciones.

GEO: tu sitio ahora también lo visitan agentes
Con modelos que navegan y usan escritorios virtuales, tu página web ya no solo la leen personas y buscadores: la leen agentes que vienen a hacer algo, como comparar, cotizar o reservar. La optimización para motores generativos (GEO) exige información clara, datos estructurados impecables y caminos sin fricción para que un agente encuentre precio, disponibilidad y la forma de contactarte. Si un agente no entiende tu sitio, te salta.

La nueva métrica: autonomía segura
La carrera técnica ya no se mide solo por cuántos parámetros tiene un modelo, sino por cuánta autonomía real puede asumir de forma segura. OpenAI empujó el techo de lo que un modelo hace solo. Anthropic demostró que esa capacidad resuelve problemas industriales que llevaban años atorados. Meta hizo que desplegarla a gran escala cueste centavos. Las tres cosas juntas significan que la pregunta para tu empresa ya no es si usar agentes, sino qué procesos les entregas primero y con qué candados.
Si quieres saber qué parte de tu operación ya puede trabajar sola, y cuál todavía no, escríbenos. Te lo decimos con la misma franqueza con la que leímos estos benchmarks.
Preguntas frecuentes
¿GPT-6 Astra es AGI?
OpenAI habla de «la era de la AGI», y su presidente dijo que «podría ser este modelo». No existe una definición aceptada por todos, así que es una declaración, no una medición. Lo medible es que Astra alcanzó paridad humana en ARC-AGI-3 con el adaptador de OpenAI y 62.7% en el arnés neutral.
¿Qué diferencia hay entre Claude Fable 5.1 y Mythos 5.1?
Son el mismo modelo con distintos niveles de salvaguardas. Fable 5.1 está disponible para todos; Mythos 5.1 solo para organizaciones de Estados Unidos en los programas de acceso de confianza de Anthropic.
¿Conviene el nivel contribuidor de Muse Spark 1.3?
Para prototipos o datos públicos, puede ser muy barato. Para información de clientes o datos que la ley te obliga a proteger, no: a cambio del precio, Meta puede usar lo que envías y recibes para mejorar sus productos.
¿Qué debería hacer hoy una PyME con todo esto?
Elegir un proceso concreto y repetitivo (atender mensajes, cotizar, dar seguimiento), entregárselo a un agente con límites claros y medir. Y, si tienes software propio, meter una revisión automática de seguridad en tu cadena de despliegue.
Fuentes
- OpenAI: GPT-6 Astra: A new generation of intelligence
- ARC Prize: OpenAI’s GPT-6 Astra on ARC-AGI-3
- VentureBeat: ‘Welcome to the AGI era’: OpenAI launches GPT-6 Astra
- Anthropic: Introducing Claude Fable 5.1 and Claude Mythos 5.1
- OpenRouter: Muse Spark 1.3 Contributor, precios
- Meta Releases Muse Spark 1.3 With Two-Tier Pricing



