Introducción
Un fin de semana de agosto de 2026 produjo una de las señales más claras hasta la fecha de que la IA de vanguardia está superando las matemáticas de referencia para adentrarse en la investigación activa.
El 1 de agosto, OpenAI publicó «Diez avances en matemáticas y ciencias de la computación teórica». Estos resultados fueron generados por una versión interna de Astra, a la que OpenAI describe como su próximo modelo principal.
El paquete de resultados incluye:
- Un manuscrito de 249 páginas.
- Diez resultados que abarcan matemáticas y ciencias de la computación teórica.
- Una explicación detallada del proceso de descubrimiento de 62 páginas.
- Diez demostraciones formales en Lean 4.
- Código fuente público para reconstrucción y certificados de verificación independiente.
Menos de 24 horas después, el investigador de Anthropic Levent Alpöge afirmó que el modelo disponible públicamente Claude Fable 5 había reproducido cinco de los diez resultados.
Confirmó que estos cinco eran los problemas 4 a 8:
- Conjetura de rigidez de Connes.
- Complejidad de circuitos aritméticos.
- Repetición paralela cuántica.
- Problema del vector más cercano.
- Conjetura del volumen de Ehrhart.
Alpöge afirmó que estas ejecuciones fueron autónomas, utilizaron indicaciones genéricas, no tuvieron acceso a internet y tomaron precauciones diseñadas para evitar que las soluciones de OpenAI se filtraran al contexto.
Si estas cinco demostraciones resisten una revisión pública exhaustiva, este evento indicaría que los resultados de investigación producidos por un modelo de vanguardia a veces pueden ser redescubiertos de forma independiente por otro modelo casi de inmediato.
Sin embargo, la evidencia no es simétrica. OpenAI ha publicado manuscritos, explicaciones del proceso y certificados verificables por máquina. Las declaraciones de Fable, por ahora, se apoyan principalmente en afirmaciones públicas más que en paquetes de demostración completos.
Por lo tanto, la conclusión útil no es simplemente que un modelo ganó.
La IA ahora es capaz de generar matemáticas de nivel de investigación a una velocidad tal que la verificación, la explicación, la atribución y la revisión pueden resultar más difíciles de escalar que la propia producción de demostraciones.

OpenAI publica diez resultados de nivel investigador
OpenAI describe estos trabajos como diez resultados que resuelven o logran avances significativos en problemas abiertos de larga data.
Los temas abarcan geometría de altas dimensiones, teoría de códigos, teoría de grupos, álgebras de operadores, complejidad de circuitos aritméticos, complejidad cuántica, problemas de retículas, geometría convexa, teoría de Ramsey y teoría extremal de grafos.
OpenAI afirma que los argumentos matemáticos fueron generados por el modelo interno Astra. Posteriormente, humanos asistidos por el mismo modelo ayudaron a reorganizar estos argumentos en manuscritos, y luego el modelo formalizó cada resultado en Lean.
El flujo de trabajo más preciso es:
Astra busca argumentos matemáticos
→ Selección de argumentos exitosos
→ Humanos y modelo preparan un manuscrito legible
→ El modelo formaliza los resultados en Lean
→ Certificados formales y código fuente publicados
→ Matemáticos externos verifican corrección, novedad e importancia
La contribución del modelo es central, pero el resultado final de la investigación sigue incluyendo preparación humana, infraestructura formal, bibliotecas de software y revisión por expertos.
Los diez resultados

| N.º | Área | Resultado publicado por OpenAI |
|---|---|---|
| 1 | Empaquetamiento de esferas en altas dimensiones | Determinó la fuerza asintótica de la programación lineal de Cohn–Elkies y mejoró las cotas universales de empaquetamiento en altas dimensiones |
| 2 | Códigos binarios y esféricos | Mejoró las cotas clásicas para códigos de distancia fija mediante un factor exponencial |
| 3 | Grupos no sóficos | Construyó un grupo no sófico explícito, resolviendo si todo grupo numerable admite aproximaciones por permutaciones finitas |
| 4 | Conjetura de rigidez de Connes | Construyó grupos con propiedad (T) que tienen la misma álgebra de von Neumann de grupo pero no son isomorfos, refutando así la conjetura |
| 5 | Complejidad de circuitos aritméticos | Estableció nuevas cotas inferiores para el cálculo del permanente, incluyendo cotas inferiores para fórmulas aritméticas de orden (n^4/\log n) |
| 6 | Repetición paralela cuántica | Demostró la propiedad de repetición paralela exponencial para juegos de entrelazamiento finitos bipersonales generales |
| 7 | Problema del vector más cercano | Proporcionó dureza de aproximación con factor polinómico para el CVP euclidiano y problemas de retículas relacionados |
| 8 | Conjetura del volumen de Ehrhart | Demostró la cota óptima de volumen máximo para una clase específica de cuerpos convexos en cada dimensión |
| 9 | Números de Ramsey multicolores | Demostró una cota inferior superexponencial para los números de Ramsey de triángulos multicolores, resolviendo el problema 183 de Erdős |
| 10 | Teoría extremal de grafos | Construyó ejemplos que refutan las conjeturas de compacidad y degeneración relacionadas con los problemas 146 y 180 de Erdős |
Estos no son problemas ordinarios de olimpiadas. Varios de ellos involucran problemas que han permanecido abiertos durante años y requieren experiencia profunda para ser evaluados.
El artículo es solo parte de lo publicado
OpenAI también publicó un documento de 62 páginas titulado «Cómo se formaron las ideas: notas sobre el descubrimiento matemático».
La demostración responde a:
¿Por qué es cierto este teorema?
El registro del descubrimiento intenta responder:
¿Cómo encontró el sistema este argumento?
Son dos preguntas diferentes.
El desglose paso a paso puede ayudar a los investigadores a determinar si el modelo recombina ideas conocidas, identifica algún tipo de analogía, realiza una búsqueda exhaustiva, encuentra nuevas construcciones o utiliza teoremas conocidos de maneras inesperadas.
Estos contenidos aún deben tratarse con cautela. Las narrativas generadas por el modelo no son necesariamente un registro causal perfecto de cada cálculo interno.
OpenAI publicó diez certificados Lean
El repositorio oficial openai/ten-proofs contiene un módulo Lean para cada resultado.
El proyecto utiliza:
Lean 4.32.0
mathlib
Lake
Con elan instalado, el README oficial indica a los usuarios que construyan las diez demostraciones formalizadas mediante el siguiente comando:
lake exe cache get
lake build All
También es posible construir un módulo individual:
lake build SpherePacking
El repositorio contiene:
SpherePacking.lean
MetricCodes.lean
NonSoficGroup.lean
ConnesRigidity.lean
Permanent.lean
QuantumParallelRepetition.
lean
GapCVP.lean
EhrhartVolumeInequality.lean
MulticolorTriangleRamsey.lean
CompactnessAndDegeneracy.lean
El código se publica bajo la licencia Apache 2.0 e incluye recursos de verificación independientes.
## Qué demuestra un certificado de Lean
Lean es un demostrador interactivo de teoremas basado en teoría de tipos dependientes.
Una prueba verificada por el núcleo de Lean establece que el teorema formalizado se deriva de definiciones, supuestos, axiomas y bibliotecas importados, así como de los términos de prueba formalizados.
Esto excluye muchos errores que pueden aparecer en argumentos informales:
- Pasos lógicos faltantes.
- Transformaciones algebraicas inválidas.
- Contradicciones ocultas.
- Casos sin fundamento.
- Discrepancias de cuantificadores.
- Lemas intermedios incorrectos.
El certificado puede ser revisado mecánicamente, en lugar de ser aceptado porque el autor suena convincente.
## Qué no demuestra un certificado de Lean
La verificación formal no elimina todas las cuestiones de revisión.
### ¿El enunciado formal coincide con la afirmación informal?
El demostrador de teoremas verifica el enunciado codificado. Los humanos aún deben juzgar si captura con precisión el problema matemático.
### ¿Son adecuadas las definiciones y los supuestos?
Lean verifica las consecuencias de las definiciones formalizadas. No puede decidir si esas definiciones reflejan conceptos aceptados, o si hay supuestos ocultos que debilitan el resultado principal.
### ¿El resultado es novedoso?
La corrección formal no equivale a novedad. La revisión bibliográfica y el conocimiento experto siguen siendo necesarios.
### ¿El resultado es importante?
Una máquina puede verificar que el teorema es válido. Pero no puede determinar si el resultado transforma el campo o introduce ideas valiosas.
### ¿La prueba nos permite aprender?
Dos pruebas formalmente correctas pueden diferir enormemente en su valor explicativo. Una puede revelar principios reutilizables; otra puede ser difícil de interiorizar para los humanos.
La verificación formal aborda el problema de la corrección. La comprensión matemática sigue siendo una tarea independiente.
## Claude Fable 5 afirma haber reproducido cinco resultados en 24 horas
Menos de un día después del anuncio de OpenAI, Alpöge escribió que había "completado la mitad con Fable".
Describió la configuración como:
- Totalmente autónoma.
- Con un mensaje genérico.
- Sin acceso a internet.
- Con precauciones adicionales para prevenir la fuga de información.

Alpöge confirmó más tarde que los cinco resultados son los números 4 a 8.

| Proyecto de OpenAI | Tema | Estado público de la afirmación de Fable |
|-|-|-|
| 4 | Conjetura de rigidez de Connes | Afirma haber reproducido |
| 5 | Complejidad de circuitos aritméticos | Afirma haber reproducido |
| 6 | Repetición paralela cuántica | Afirma haber reproducido |
| 7 | Problema del vector más cercano | Afirma haber reproducido |
| 8 | Conjetura del volumen de Ehrhart | Afirma haber reproducido |
Alpöge indicó que el resultado de Ehrhart es el único en el que Astra y Fable parecen haber usado esencialmente el mismo argumento.
Si es preciso, los otros cuatro podrían ser pruebas alternativas, no una reconstrucción del camino de OpenAI.
## La evidencia de Fable aún no equivale a la publicación de OpenAI
Para los diez resultados de OpenAI, el paquete público incluye enunciados de teoremas, manuscritos completos, procesos de razonamiento, código fuente de Lean, instrucciones de compilación y recursos de verificación independientes.
Para los cinco de Fable, puedo verificar las declaraciones de Alpöge, los números de problemas mencionados, las condiciones experimentales que describió y su observación sobre el argumento de Ehrhart.
No puedo verificar un paquete público que incluya:
- Cinco manuscritos completos.
- El mensaje genérico exacto.
- Registros de ejecución completos.
- Uso de tokens.
- Configuración del modelo.
- Métodos de prevención de fugas.
- Certificados de Lean.
- Revisión externa de cada argumento.
La descripción rigurosa es:
> Un investigador de Anthropic informó públicamente que Fable 5 completó de forma independiente cinco de los diez problemas en condiciones controladas, pero que, al verificar, la evidencia detallada necesaria para una evaluación independiente integral aún no se ha hecho pública.
Esto no demuestra que la afirmación sea falsa. Significa que la afirmación aún no ha alcanzado la misma etapa de evidencia que el paquete publicado por OpenAI.
## Por qué las 24 horas siguen siendo importantes
Incluso con las reservas anteriores, el momento es notable.
En matemáticas tradicionales, un resultado nuevo importante puede requerir meses o incluso años para ser reconstruido de forma independiente.
Los investigadores primero necesitan aprender el contexto, leer el manuscrito, examinar los detalles técnicos, reconstruir el argumento, probar alternativas, discutir el problema y publicar una revisión o un artículo de seguimiento.
Un modelo capaz puede comprimir partes de ese proceso.
Si el resultado de un modelo puede ser alcanzado de forma independiente por otro modelo en un día, la ventana de prioridad para los descubrimientos generados por IA podría acortarse drásticamente.
El primer equipo aún merece crédito por elegir los problemas, presentar el primer argumento público, preparar el manuscrito, formalizar los resultados y crear un registro que otros puedan consultar.
Sin embargo, cuando otros investigadores pueden asignar inmediatamente problemas similares a sistemas de vanguardia, la ventaja del primero puede durar solo días, no años.
## Esto se acerca más a la reproducción que a una competencia de referencia
La mayoría de los puntos de referencia de modelos comparan sistemas en problemas con respuestas conocidas.
El punto de referencia pregunta:
```texto plano
Dado el mismo conjunto de pruebas, ¿qué modelo obtiene una puntuación más alta?
Este conjunto plantea una pregunta diferente:
¿Pueden dos sistemas llegar de forma independiente al mismo resultado nuevo de frontera?
Esto se asemeja a la reproducción científica.
La reproducción independiente puede revelar si un resultado depende de un error de un solo modelo, de un mensaje frágil, de una fuga de información o de una ruta de prueba inusual.
Dos argumentos independientes pueden aumentar la confianza, especialmente cuando utilizan enfoques diferentes.
Pero aún requieren revisión.
Dos modelos pueden compartir fuentes de entrenamiento similares, malentendidos matemáticos, sesgos de optimización o supuestos implícitos.
La independencia de los modelos no equivale automáticamente a independencia cognitiva.
Cómo evaluar una afirmación de reproducción por IA
Un paquete de reproducción creíble debe divulgar suficiente información para que otros repitan el experimento.
Definición del problema
- Enunciado exacto del teorema.
- Supuestos exactos.
- Versión del problema fuente.
- Referencias que demuestren que el problema estaba abierto anteriormente.
Configuración del modelo
- Nombre y versión del modelo.
- Configuración de razonamiento o esfuerzo.
- Longitud del contexto.
- Acceso a herramientas.
- Configuración de muestreo relevante.
Diseño del mensaje
- Mensaje inicial.
- Mensajes posteriores.
- Correcciones humanas.
- Cualquier indicación de dominio.
- Cualquier andamiaje.
Control de fugas
-
Acceso a internet y búsqueda.
-
Documentos fuente incluidos en el contexto.
-
Momento de la instantánea del modelo.
-
Método utilizado para detectar lenguaje o estructura copiada.
Registro de ejecución
- Transcripción completa.
- Llamadas a herramientas.
- Intentos fallidos.
- Tiempo de ejecución.
- Uso de tokens.
- Número de ejecuciones en paralelo.
Evidencia matemática
- Demostración completa.
- Certificados formales viables.
- Lista de dependencias.
- Comparación con la primera demostración.
Revisión externa
- Revisores nombrados.
- Opiniones de revisión.
- Correcciones realizadas.
- Objeciones restantes.
- Estado de publicación.
Sin esta información, una “reproducción independiente” sigue siendo difícil de distinguir de un informe preliminar prometedor.
Fable 5 es un modelo de vanguardia disponible públicamente
Anthropic lanzó Claude Fable 5 en junio de 2026.
Anthropic lo describió como un modelo de nivel Mythos orientado al uso general y con salvaguardas de seguridad.
La compañía afirma que el modelo destaca especialmente en trabajo autónomo de larga duración, ingeniería de software, trabajo de conocimiento, visión, investigación científica y tareas de contexto extenso.
El identificador oficial del modelo en la API es:
claude-fable-5
El precio anunciado por Anthropic es:
10 dólares por millón de tokens de entrada
50 dólares por millón de tokens de salida
La publicación pública de Fable está estrechamente relacionada con la historia matemática.
Astra sigue siendo un modelo interno no publicado de OpenAI.
Fable está disponible para investigadores y desarrolladores a través de los productos y la API compatibles de Anthropic.
Esto facilita que equipos externos prueben sus propias preguntas de investigación, aunque el acceso al modelo no garantiza la experiencia necesaria para seleccionar buenos problemas ni para validar los resultados.
La cifra de 2000 dólares es una estimación del costo marginal de búsqueda
OpenAI indica que el número total de tokens necesarios para encontrar esas diez soluciones a los precios de la API de Sol asciende aproximadamente a 2000 dólares.

Esta cifra es sorprendente, pero necesita una etiqueta precisa.
Lo mejor es entenderla como una estimación del costo en tokens de encontrar soluciones con éxito.
No es el costo económico total del proyecto de investigación.
La pila de costos más amplia puede incluir:
- Entrenar a Astra.
- Construir y operar la infraestructura de inferencia.
- Investigadores que filtran problemas candidatos.
- Ejecuciones de prueba sobre problemas no resueltos.
- Enfoques fallidos aplicados a problemas que sí se resolvieron.
- Redacción manual del manuscrito.
- Trabajo de formalización.
- Ingeniería de software.
- Revisión matemática externa.
- Publicación y mantenimiento.
OpenAI afirma que intentó otros problemas importantes sin éxito y que no resolvió ningún Premio del Milenio.
Por lo tanto, esta estimación de 2000 dólares responde a:
¿Cuál es el costo en tokens de una búsqueda exitosa, según las tarifas públicas de la API?
No responde a:
¿Cuál es el costo de crear el modelo y de generar, verificar y publicar los resultados de investigación?
Ambas cifras son útiles, pero miden cosas distintas.
Por qué el costo marginal puede cambiar la forma de investigar
Incluso teniendo en cuenta los costos indirectos, el bajo costo marginal de volver a intentar seriamente puede cambiar la forma en que se realiza la investigación.
Un matemático humano puede dedicar semanas a decidir si una vía merece la pena explorarse.
Un sistema de IA puede verse obligado a explorar muchas vías en paralelo.
Los investigadores podrían usar el modelo para:
- Buscar contraejemplos.
- Probar variantes de conjeturas.
- Traducir entre lenguajes matemáticos.
- Encontrar lemas relevantes.
- Formalizar demostraciones candidatas.
- Generar experimentos computacionales.
- Comparar estrategias de demostración.
- Identificar lagunas.
- Buscar formulaciones más simples.
Este efecto podría ser similar a la experimentación de alto rendimiento en otras ciencias.
Cuando el costo de probar otra hipótesis disminuye, el número de hipótesis probadas aumenta.
El recurso escaso se desplaza hacia la selección de problemas prometedores y la evaluación del torrente de candidatas que llega después.
Los intentos fallidos también deben contabilizarse
Una contabilidad que solo cuente los éxitos puede ofrecer una imagen engañosa.
Supongamos que un sistema recibe 100 problemas abiertos y resuelve 10 de ellos.
Si el objetivo es medir la economía del proyecto de búsqueda completo, el costo de cada solución exitosa debería incluir los recursos gastados en los 90 fracasos.
La contabilidad completa debería informar:
Costo total de inferencia
÷
Número de resultados verificados
Debería distinguir entre ejecuciones finales exitosas, ejecuciones completas fallidas, progreso parcial, reinicios guiados por humanos, candidatos en paralelo y costos de verificación.
Sin este denominador, una cifra baja podría describir solo los éxitos seleccionados, no la economía del proceso de descubrimiento en su conjunto.
Fable también se ha utilizado para un nuevo problema abierto
Una crítica al trabajo de reproducción es directa:
¿Por qué hacer que Fable repita los resultados de Astra en lugar de asignarle nuevos problemas abiertos?
La reproducción y el descubrimiento cumplen propósitos distintos.
Crea un sitio de presentacion y capta leads en minutos
Describe tu idea una vez y We0 AI puede generar un sitio de presentacion, paginas y CMS, y ayudarte a atraer clientes y trafico tras el lanzamiento.
Una generación completa de proyectos para registro gratuito
Lo mejor para probar un flujo de generación completo y ver rápidamente el primer borrador del proyecto.
La reproducción pone a prueba la fiabilidad.
Resolver nuevos problemas pone a prueba la capacidad de vanguardia.
Fable también se ha relacionado
con un nuevo resultado matemático.
En julio de 2026, Alpöge informó de un contraejemplo a la conjetura de Jacobi en el caso tridimensional, atribuyendo a Fable el papel que desempeñó en el proceso de descubrimiento.
El contraejemplo fue verificado formalmente, discutido por matemáticos, y después se realizaron trabajos de seguimiento. Un artículo publicado en arXiv a finales de julio presentaba una exposición completa y autocontenida y generalizaba el mecanismo a dimensiones superiores.
Este evento revela un patrón recurrente:
- La IA produce un objeto o argumento concreto.
- Las herramientas formales verifican el núcleo de la afirmación.
- Los matemáticos buscan una explicación a nivel conceptual.
- El trabajo posterior generaliza el resultado.
La fase final puede ser donde reside gran parte del valor matemático duradero.
Los contraejemplos y las demostraciones imponen cargas de verificación distintas
Un contraejemplo concreto a veces puede comprobarse rápidamente.
Si una conjetura afirma que no existe ningún objeto con ciertas propiedades, un objeto válido es suficiente para refutarla.
El revisor puede verificar:
- Que el objeto está bien definido.
- Que satisface las hipótesis.
- Que viola la conclusión.
En cambio, un teorema general extenso puede requerir cientos de lemas interrelacionados y un amplio conocimiento de la bibliografía.
Esta diferencia explica en parte por qué los contraejemplos generados por IA pueden difundirse rápidamente.
El ejemplo de Jacobi es lo bastante compacto como para que los investigadores puedan comprobarlo y formalizarlo rápidamente.
Algunos de los diez resultados de Astra implican cadenas teóricas más largas que pueden requerir más tiempo para que la comunidad los asimile.
El nuevo cuello de botella está en la revisión humana
La cuestión central es:
Si la IA puede generar demostraciones de vanguardia rápidamente, ¿puede la comunidad matemática verificarlas con la suficiente rapidez?
Un resultado de investigación necesita obtener diversas formas de reconocimiento.
Reconocimiento lógico
¿La demostración se sigue realmente de las hipótesis?
Lean puede ayudar en esto.
Reconocimiento semántico
¿La afirmación formalizada coincide con el significado que el autor pretende comunicar?
Los expertos deben examinar esa traducción.
Reconocimiento histórico
¿El problema estaba realmente sin resolver y el resultado es novedoso?
Esto requiere conocimiento de la bibliografía.
Reconocimiento conceptual
¿La demostración revela nuevas ideas o solo confirma un hecho?
Esto requiere criterio matemático.
Reconocimiento comunitario
¿El trabajo ha sido revisado, discutido, corregido y situado en su contexto adecuado?
Esto requiere tiempo y procesos institucionales.
La IA acelera la generación de demostraciones mucho más rápido de lo que las universidades y las revistas pueden ampliar el grupo de expertos capaces de revisar trabajos altamente especializados.
La mayoría de las personas no pueden evaluar estos resultados de forma independiente
Un modelo de programación potente puede ponerse a prueba pidiéndole que construya una aplicación.
Un modelo de imagen potente puede evaluarse visualmente.
Pero las matemáticas de vanguardia son diferentes.
La mayoría de los lectores no pueden evaluar personalmente la existencia de grupos no sóficos, un contraejemplo de la conjetura de rigidez de Connes, el teorema de repetición paralela para juegos de enredo o la dureza en retículos.
Dependen de una cadena de confianza:
Salida del modelo
→ Certificado formal
→ Asistente de demostraciones y sus bibliotecas
→ Expertos en el dominio
→ Revisores independientes
→ Revistas y comunidad investigadora
Esto hace que la transparencia sea más importante, no menos.
Cuando el público no puede comprobar directamente una capacidad, la confianza
debe provenir de la evidencia y de las instituciones.



