Introdução
Um fim de semana em agosto de 2026 produziu um dos sinais mais claros até agora de que a IA de ponta está indo além da matemática de referência e entrando no campo da pesquisa ativa.
Em 1º de agosto, a OpenAI publicou "Dez Avanços em Matemática e Ciência da Computação Teórica". Esses resultados foram gerados por uma versão interna do Astra, que a OpenAI descreve como seu próximo modelo principal.
O pacote de resultados inclui:
- Um manuscrito de 249 páginas.
- Dez resultados abrangendo matemática e ciência da computação teórica.
- Um detalhamento do processo de descoberta com 62 páginas.
- Dez provas formalizadas em Lean 4.
- Código-fonte público para reconstrução e certificados de verificação independente.
Menos de 24 horas depois, o pesquisador da Anthropic Levent Alpöge afirmou que o modelo disponível publicamente Claude Fable 5 reproduziu cinco dos dez resultados.
Ele confirmou que os cinco são os problemas 4 a 8:
- Conjectura da rigidez de Connes.
- Complexidade de circuitos aritméticos.
- Repetição paralela quântica.
- Problema do vetor mais próximo.
- Conjectura do volume de Ehrhart.
Alpöge afirmou que essas execuções foram autônomas, usaram prompts genéricos, não tiveram acesso à internet e adotaram precauções para evitar que as soluções da OpenAI vazassem para o contexto.
Se essas cinco provas resistirem a uma revisão pública completa, esse evento indicará que resultados de pesquisa produzidos por um modelo de ponta às vezes podem ser redescobertos de forma independente por outro modelo quase imediatamente.
No entanto, as evidências não são simétricas. A OpenAI publicou manuscritos, detalhamentos de processo e certificados verificáveis por máquina. Já a declaração do Fable é atualmente sustentada principalmente por declarações públicas, e não por um pacote completo de provas.
Portanto, a conclusão útil não é simplesmente que um modelo venceu.
A IA agora é capaz de gerar matemática de nível de pesquisa com rapidez suficiente para que verificação, explicação, atribuição e revisão possam ser mais difíceis de dimensionar do que a própria produção de provas.

OpenAI publica dez resultados de nível de pesquisa
A OpenAI descreve esses trabalhos como dez resultados que resolvem ou fazem progressos significativos em problemas em aberto de longa data.
Os tópicos abrangem geometria de altas dimensões, teoria de codificação, teoria de grupos, álgebra de operadores, complexidade de circuitos aritméticos, complexidade quântica, problemas de reticulados, geometria convexa, teoria de Ramsey e teoria extremal de grafos.
A OpenAI afirma que os argumentos matemáticos foram gerados pelo modelo interno Astra. Em seguida, humanos, com assistência do mesmo modelo, organizaram esses argumentos em manuscritos, e depois o modelo formalizou cada resultado em Lean.
O fluxo de trabalho mais preciso é:
Astra busca argumentos matemáticos
→ Seleção de argumentos bem-sucedidos
→ Humanos e modelo preparam manuscritos legíveis
→ Modelo realiza a formalização
Resultados em Lean
→ Certificados formais e código-fonte publicados
→ Matemáticos externos verificam correção, novidade e importância
A contribuição do modelo é central, mas o resultado final de pesquisa ainda inclui preparação humana, infraestrutura formal, bibliotecas de software e revisão por especialistas.
Os dez resultados

| Nº | Área | Resultado publicado pela OpenAI |
|---|---|---|
| 1 | Empacotamento de esferas em altas dimensões | Determinou a força assintótica da programação linear de Cohn–Elkies e melhorou os limites universais de empacotamento em altas dimensões |
| 2 | Códigos binários e esféricos | Melhorou limites clássicos de códigos de distância fixa por um fator exponencial |
| 3 | Grupos não-sóficos | Construiu um grupo não-sófico explícito, resolvendo se todo grupo contável admite aproximação por permutações finitas |
| 4 | Conjectura da rigidez de Connes | Construiu grupos com propriedade (T) com a mesma álgebra de von Neumann do grupo, mas não isomorfos, refutando a conjectura |
| 5 | Complexidade de circuitos aritméticos | Estabeleceu novos limites inferiores para o cálculo do permanente, incluindo limites inferiores de fórmulas aritméticas de ordem (n^4/\log n) |
| 6 | Repetição paralela quântica | Provou propriedade de repetição paralela exponencial para jogos de entrelaçamento finitos gerais de dois jogadores |
| 7 | Problema do vetor mais próximo | Forneceu dureza de aproximação por fator polinomial para CVP euclidiano e problemas de reticulados relacionados |
| 8 | Conjectura do volume de Ehrhart | Provou o limite máximo de volume ótimo para uma classe especificada de corpos convexos em cada dimensão |
| 9 | Números de Ramsey multicoloridos | Provou limite inferior superexponencial para números de Ramsey de triângulos multicoloridos, resolvendo o Problema 183 de Erdős |
| 10 | Teoria extremal de grafos | Construiu exemplos refutando conjecturas de compacidade e degenerescência relacionadas aos Problemas 146 e 180 de Erdős |
Estes não são problemas comuns de olimpíada. Vários envolvem questões em aberto há anos e exigem profundo conhecimento especializado para serem avaliados.
O artigo é apenas parte do que foi publicado
A OpenAI também publicou um documento de 62 páginas intitulado "Como as ideias se formam: notas sobre descoberta matemática".
A prova responde:
Por que esse teorema é verdadeiro?
O registro de descoberta tenta responder:
Como o sistema encontrou esse argumento?
São duas perguntas diferentes.
A análise passo a passo pode ajudar pesquisadores a avaliar se o modelo recombinou ideias conhecidas, identificou alguma analogia, realizou uma busca extensa, encontrou uma nova construção ou usou teoremas conhecidos de maneiras inesperadas.
Esse conteúdo ainda requer cautela. Narrativas geradas por modelos não são necessariamente um registro causal perfeito de cada cálculo interno.
A OpenAI publicou dez certificados Lean
O repositório oficial openai/ten-proofs contém um módulo Lean para cada resultado.
O projeto usa:
Lean 4.32.0
mathlib
Lake
Com elan instalado, o README oficial instrui os usuários a compilar todas as dez provas formalizadas com o comando:
lake exe cache get
lake build All
Também é possível compilar um módulo individualmente:
lake build SpherePacking
O repositório contém:
SpherePacking.lean
MetricCodes.lean
NonSoficGroup.lean
ConnesRigidity.lean
Permanent.lean
QuantumParallelRepetition.lean
lean
GapCVP.lean
EhrhartVolumeInequality.lean
MulticolorTriangleRamsey.lean
CompactnessAndDegeneracy.lean
O código é publicado sob a licença Apache 2.0 e inclui recursos de verificação independentes.
## O que um certificado Lean prova
Lean é um provador de teoremas interativo baseado na teoria de tipos dependentes.
Uma prova verificada pelo núcleo do Lean estabelece que o teorema formalizado é derivado de definições, suposições, axiomas importados e bibliotecas, bem como do termo de prova formalizado.
Isso exclui muitos erros que podem ocorrer em argumentos informais:
- Etapas lógicas ausentes.
- Transformações algébricas inválidas.
- Contradições ocultas.
- Casos sem fundamento.
- Correspondência incorreta de quantificadores.
- Lemas intermediários equivocados.
O certificado pode ser verificado mecanicamente, em vez de ser aceito porque o autor parece convincente.
## O que um certificado Lean não prova
A verificação formal não elimina todos os problemas de revisão.
### A declaração formal corresponde à afirmação informal?
O provador de teoremas verifica a declaração codificada. Os seres humanos ainda precisam julgar se ela captura com precisão o problema matemático.
### As definições e suposições são apropriadas?
O Lean verifica as consequências das definições formalizadas. Ele não pode decidir se essas definições refletem conceitos aceitos, ou se há suposições ocultas que enfraquecem o resultado anunciado.
### O resultado é novo?
A correção formal não equivale à novidade. A revisão da literatura e o conhecimento especializado ainda são necessários.
### O resultado é importante?
Uma máquina pode verificar que o teorema é válido. Mas ela não pode julgar se o resultado transforma a área ou introduz ideias valiosas.
### A prova nos ensina algo?
Duas provas formalmente corretas podem diferir muito em valor explicativo. Uma pode revelar princípios reutilizáveis; outra pode ser difícil de internalizar por humanos.
A verificação formal resolve questões de correção. A compreensão matemática continua sendo uma tarefa separada.
## Claude Fable 5 afirma ter reproduzido cinco resultados em 24 horas
Menos de um dia após o anúncio da OpenAI, Alpöge escreveu que "concluiu metade deles com Fable".
Ele descreveu a configuração como:
- Totalmente autônoma.
- Usando prompts genéricos.
- Sem acesso à rede.
- Medidas adicionais tomadas para evitar vazamento de informações.

Alpöge confirmou mais tarde que os cinco itens eram do 4º ao 8º.

| Projeto da OpenAI | Tema | Status público da alegação de Fable |
|-|-|-|
| 4 | Conjectura da rigidez de Connes | Reprodução alegada |
| 5 | Complexidade de circuitos aritméticos | Reprodução alegada |
| 6 | Repetição paralela quântica | Reprodução alegada |
| 7 | Problema do vetor mais próximo | Reprodução alegada |
| 8 | Conjectura do volume de Ehrhart | Reprodução alegada |
Alpöge afirmou que o resultado de Ehrhart foi o único em que Astra e Fable pareceram usar essencialmente o mesmo argumento.
Se preciso, os outros quatro podem ser provas alternativas, em vez de reconstruções do caminho da OpenAI.
## As evidências de Fable ainda não equivalem ao lançamento da OpenAI
Para os dez resultados da OpenAI, o pacote público inclui declarações de teoremas, manuscritos completos, cadeias de raciocínio, código-fonte em Lean, instruções de compilação e recursos de verificação independentes.
Para os cinco de Fable, posso verificar as declarações de Alpöge, os números de problemas mencionados, as condições experimentais que ele descreveu e sua observação sobre o argumento de Ehrhart.
Não posso verificar um pacote público contendo:
- Cinco manuscritos completos.
- O prompt genérico exato.
- Registros completos de execução.
- Uso de tokens.
- Configurações do modelo.
- Métodos de prevenção de vazamento.
- Certificados Lean.
- Revisão externa de cada argumento.
A descrição rigorosa é:
> Um pesquisador da Anthropic relatou publicamente que o Fable 5 concluiu cinco dos dez problemas de forma independente, sob condições controladas, mas, na verificação, as evidências detalhadas necessárias para uma avaliação independente abrangente ainda não foram divulgadas.
Isso não prova que a alegação seja falsa. Isso significa que a alegação ainda não atingiu o mesmo estágio de evidência que o pacote já publicado pela OpenAI.
## Por que 24 horas ainda importam
Mesmo com as ressalvas acima, o momento é digno de nota.
Na matemática tradicional, um novo resultado significativo pode levar meses ou até anos para ser reconstruído de forma independente.
Os pesquisadores primeiro precisam aprender o contexto, ler o manuscrito, examinar os detalhes técnicos, reconstruir o argumento, tentar abordagens alternativas, discutir questões e publicar uma revisão ou artigo de acompanhamento.
Um modelo capaz pode comprimir parte desse processo.
Se o resultado de um modelo puder ser alcançado independentemente por outro modelo em um dia, a janela de prioridade para descobertas geradas por IA pode diminuir drasticamente.
A primeira equipe ainda merece crédito por escolher os problemas, apresentar o primeiro argumento público, preparar o manuscrito, formalizar o resultado e criar um registro que outros possam consultar.
No entanto, quando outros pesquisadores podem atribuir imediatamente problemas semelhantes a sistemas de ponta, a vantagem do pioneiro pode durar apenas dias, em vez de anos.
## Isso está mais próximo da replicação do que de uma competição de benchmarks
A maioria dos benchmarks de modelos compara sistemas em problemas com respostas conhecidas.
O benchmark pergunta:
```texto puro
Dado o mesmo conjunto de testes, qual modelo obtém a maior pontuação?
Este conjunto levanta uma questão diferente:
Dois sistemas podem chegar de forma independente aos mesmos novos resultados de fronteira?
Isso é semelhante à replicação científica.
A replicação independente pode revelar se um resultado depende de um erro de um único modelo, de um prompt frágil, de vazamento de informações ou de um caminho de prova incomum.
Dois argumentos independentes podem aumentar a confiança, especialmente quando usam linhas de raciocínio diferentes.
Mas eles ainda precisam de revisão.
Dois modelos podem compartilhar fontes de treinamento semelhantes, mal-entendidos matemáticos, vieses de otimização ou suposições implícitas.
A independência entre modelos não equivale automaticamente à independência cognitiva.
Como avaliar uma alegação de reprodução por IA
Um pacote de reprodução confiável deve divulgar informações suficientes para que outros repitam o experimento.
Definição do problema
- A declaração exata do teorema.
- As suposições exatas.
- A versão do problema de origem.
- Referências provando que o problema era anteriormente em aberto.
Configuração do modelo
- Nome e versão do modelo.
- Configurações de inferência ou esforço.
- Comprimento do contexto.
- Acesso a ferramentas.
- Configurações de amostragem relevantes.
Design do prompt
- Prompt inicial.
- Prompts subsequentes.
- Correções humanas.
- Qualquer prompt específico do domínio.
- Qualquer estrutura de suporte (scaffolding).
Controle de vazamento
-
Acesso à internet e a mecanismos de busca.
-
Documentos de origem incluídos no contexto.
-
Horário do snapshot do modelo.
-
Método utilizado para detectar linguagem ou estrutura copiada.
Registro de execução
- Transcrição completa.
- Chamadas de ferramentas.
- Tentativas frustradas.
- Tempo de execução.
- Uso de tokens.
- Número de execuções paralelas.
Evidência matemática
- Prova completa.
- Certificados formais viáveis.
- Lista de dependências.
- Comparação com a primeira prova.
Revisão externa
- Revisores nomeados.
- Pareceres dos revisores.
- Correções realizadas.
- Objeções remanescentes.
- Status da publicação.
Sem essas informações, uma “reprodução independente” ainda é difícil de distinguir de um relatório preliminar promissor.
Fable 5 é um modelo de ponta disponível publicamente
A Anthropic lançou o Claude Fable 5 em junho de 2026.
A Anthropic o descreve como um modelo de nível Mythos, voltado para o uso pelo público em geral, com proteções de segurança.
A empresa afirma que o modelo se destaca em trabalho autônomo de longa duração, engenharia de software, trabalho do conhecimento, visão, pesquisa científica e tarefas de contexto longo.
O identificador oficial do modelo na API é:
claude-fable-5
Os preços divulgados pela Anthropic são:
US$ 10 por milhão de tokens de entrada
US$ 50 por milhão de tokens de saída
O lançamento público do Fable está intimamente ligado à história da matemática.
Astra continua sendo um modelo não publicado internamente pela OpenAI.
O Fable pode ser acessado por pesquisadores e desenvolvedores por meio de produtos e da API compatíveis da Anthropic.
Isso torna mais fácil para equipes externas tentarem suas próprias perguntas de pesquisa, embora o acesso ao modelo não garanta a experiência necessária para escolher boas perguntas ou validar os resultados.
O número de US$ 2.000 é uma estimativa do custo marginal de busca
A OpenAI afirma que o número total de tokens necessários para encontrar aquelas dez soluções, aos preços da API Sol, foi de aproximadamente US$ 2.000.

Esse número é impressionante, mas precisa de um rótulo preciso.
Ele é melhor compreendido como uma estimativa do custo em tokens da busca bem-sucedida.
Não é o custo econômico total do projeto de pesquisa.
A pilha de custos maior pode incluir:
- Treinamento do Astra.
- Construção e operação da infraestrutura de inferência.
- Pesquisadores selecionando problemas candidatos.
- Execuções de tentativa em problemas não resolvidos.
- Abordagens fracassadas aplicadas a problemas bem-sucedidos.
- Redação manual do manuscrito.
- Trabalho de formalização.
- Engenharia de software.
- Revisão matemática externa.
- Publicação e manutenção.
A OpenAI afirma que tentou outros grandes problemas sem sucesso e que não resolveu nenhum dos Prêmios do Milênio.
Portanto, essa estimativa de US$ 2.000 responde à pergunta:
Qual é o custo em tokens de uma busca bem-sucedida, às tarifas públicas da API?
Ela não responde:
Qual é o custo de criar o modelo e gerar, validar e publicar os resultados da pesquisa?
Ambos os números são úteis, mas medem coisas diferentes.
Por que o custo marginal ainda pode mudar a forma como a pesquisa é feita
Mesmo levando em conta os custos indiretos, o baixo custo marginal de fazer uma nova tentativa séria pode mudar a forma como a pesquisa é conduzida.
Um matemático humano pode passar semanas decidindo se um caminho vale a pena ser explorado.
Um sistema de IA pode ser solicitado a explorar muitos caminhos em paralelo.
Os pesquisadores podem usar o modelo para:
- Buscar contraexemplos.
- Testar variantes de conjecturas.
- Traduzir entre linguagens matemáticas.
- Encontrar lemas relacionados.
- Formalizar provas candidatas.
- Gerar experimentos computacionais.
- Comparar estratégias de prova.
- Identificar lacunas.
- Buscar formulações mais simples.
Esse efeito pode ser semelhante ao de experimentos de alto rendimento em outras ciências.
Quando o custo de testar outra hipótese cai, o número de hipóteses testadas aumenta.
O recurso escasso passa a ser a seleção de problemas promissores e a avaliação da enxurrada de candidatos que vem em seguida.
Tentativas fracassadas também precisam ser contabilizadas
Uma contabilidade que considera apenas os sucessos pode pintar um quadro enganoso.
Suponha que um sistema receba 100 problemas em aberto e resolva 10 deles.
Se o objetivo é medir a economia do projeto de busca completo, o custo de cada solução bem-sucedida deve incluir os recursos gastos nos 90 fracassos.
A contabilidade completa deve relatar:
Custo total de inferência
÷
Número de resultados validados
Ela deve distinguir entre execuções finais bem-sucedidas, execuções completas fracassadas, progresso parcial, reinícios orientados por humanos, candidatos paralelos e custos de validação.
Sem esse denominador, um número baixo pode descrever apenas os sucessos selecionados, e não a economia do processo de descoberta como um todo.
O Fable também foi usado em um novo problema em aberto
Uma crítica ao trabalho de reprodução é direta:
Por que fazer o Fable refazer os resultados do Astra em vez de atribuir novos problemas em aberto?
Reprodução e descoberta servem a propósitos diferentes.
Crie um site de apresentacao e gere leads em minutos
Descreva sua ideia uma vez e o We0 AI pode gerar um site de apresentacao, paginas e CMS, alem de ajudar a atrair clientes e trafego apos o lancamento.
Uma geração completa de projetos para registro gratuito
Melhor para experimentar um fluxo de geração completo e ver rapidamente um primeiro rascunho do projeto.
A reprodução testa a confiabilidade.
Resolver novos problemas testa a capacidade de fronteira.
O Fable também foi
associado a um novo resultado matemático.
Em julho de 2026, Alpöge relatou um contraexemplo para a conjectura de Jacobi no caso tridimensional e atribuiu ao Fable o papel que desempenhou no processo de descoberta.
O contraexemplo foi formalmente verificado, discutido por matemáticos, e houve trabalho de acompanhamento. Um artigo publicado no arXiv no final de julho apresentou uma exposição completa e autocontida e generalizou o mecanismo para dimensões superiores.
Esse evento revela um padrão recorrente:
- A IA produz um objeto ou argumento explícito.
- Ferramentas de formalização verificam a afirmação central.
- Matemáticos humanos buscam uma explicação conceitual.
- Trabalhos posteriores generalizam o resultado.
A etapa final pode ser onde reside grande parte do valor matemático duradouro.
Contraexemplos e provas impõem diferentes cargas de validação
Um contraexemplo explícito às vezes pode ser verificado rapidamente.
Se uma conjectura afirma que não existem objetos com certas propriedades, um objeto válido é suficiente para refutá-la.
O revisor pode verificar:
- O objeto está bem definido.
- Ele satisfaz as hipóteses.
- Ele viola a conclusão.
Já um teorema geral longo pode exigir centenas de lemas interligados e uma ampla compreensão da literatura.
Essa diferença explica em parte por que contraexemplos gerados por IA podem se espalhar rapidamente.
O exemplo de Jacobi é compacto o suficiente para que pesquisadores pudessem verificá-lo e formalizá-lo rapidamente.
Alguns dos dez resultados do Astra envolvem cadeias teóricas mais longas, que podem exigir mais tempo da comunidade para serem digeridas.
O novo gargalo está na revisão humana
A questão central é:
Se a IA pode gerar provas de fronteira rapidamente, a comunidade matemática consegue validá-las com rapidez suficiente?
Um resultado de pesquisa precisa obter várias formas de reconhecimento.
Reconhecimento lógico
A prova realmente decorre das hipóteses?
O Lean pode ajudar nisso.
Reconhecimento semântico
A afirmação formalizada corresponde ao que o autor quis dizer?
Especialistas precisam verificar essa tradução.
Reconhecimento histórico
O problema era realmente não resolvido e o resultado é novo?
Isso exige conhecimento da literatura.
Reconhecimento conceitual
A prova revela novas ideias ou apenas confirma um fato?
Isso exige julgamento matemático.
Reconhecimento da comunidade
O trabalho foi revisado, discutido, corrigido e colocado em contexto adequado?
Isso exige tempo e processos institucionais.
A IA acelera a geração de provas muito mais rápido do que universidades e periódicos conseguem expandir o corpo de especialistas capazes de revisar trabalhos altamente especializados.
A maioria das pessoas não consegue julgar esses resultados de forma independente
Um modelo de programação poderoso pode ser testado pedindo que ele construa um aplicativo.
Um modelo de imagem poderoso pode ser avaliado visualmente.
Já a matemática de fronteira é diferente.
A maioria dos leitores não consegue avaliar pessoalmente a existência de grupos não sofic, um contraexemplo para a conjectura de rigidez de Connes, o teorema da repetição paralela para jogos de emaranhamento ou a dificuldade em reticulados.
Eles dependem de uma cadeia de confiança:
Saída do modelo
→ Certificado formal
→ Assistente de provas e suas bibliotecas
→ Especialistas no domínio
→ Revisores independentes
→ Periódicos e comunidade de pesquisa
Isso torna a transparência mais importante, e não menos.
Quando o público não consegue testar diretamente uma capacidade, a confiança
deve vir de evidências e instituições.

Provas formalizadas ainda dependem de infraestrutura construída por humanos
Descrever esse evento como a IA substituindo a matemática de forma isolada é enganoso.
Esses modelos dependem de:
- Séculos de literatura matemática.
- Definições criadas por humanos.
- Teoremas publicados.
- Assistentes de prova formal.
- Mathlib.
- O núcleo confiável do Lean.
- Pesquisadores que selecionam problemas.
- Especialistas que interpretam resultados.
- Engenheiros que constroem sistemas de treinamento e inferência.
Os certificados Lean da Astra foram possíveis porque uma vasta comunidade passou anos formalizando os fundamentos da matemática e construindo bibliotecas reutilizáveis.
A conquista do modelo é real.
A infraestrutura humana que a sustenta é igualmente real.
Uma descrição mais honesta seria:
Modelos de fronteira estão se tornando participantes poderosos no sistema de conhecimento matemático construído e mantido por humanos.
Correção não é o mesmo que compreensão
Uma prova pode ser correta sem ser esclarecedora.
Matemáticos frequentemente valorizam um resultado porque ele introduz novos invariantes, construções, métodos reutilizáveis, conexões entre áreas, explicações mais simples ou melhores perguntas.
Quando a IA gera uma prova longa, os revisores podem perguntar:
- Qual passo contém a ideia central real?
- Por que essa construção funciona?
- Quais hipóteses são essenciais?
- Essa prova pode ser simplificada?
- Esse método pode resolver problemas relacionados?
- Quais novas conjecturas podem ser derivadas disso?
Essa é a diferença entre verificar um teorema e integrá-lo à matemática humana.
O número de resultados corretos importa.
A capacidade de transformar esses resultados em compreensão pode importar ainda mais.
O gosto matemático pode se tornar ainda mais valioso
Se a busca por provas se tornar mais barata, a escolha de problemas pode se tornar uma parte maior da vantagem competitiva em pesquisa.
As decisões mais difíceis podem ser:
- Qual conjectura vale a pena verificar?
- Qual versão pode estar errada?
- Qual caso especial pode desvendar o problema geral?
- Qual resultado pode conectar múltiplas áreas?
- Qual formalização é fiel e confiável?
- Qual prova gerada contém ideias reutilizáveis?
Essas são questões de gosto matemático.
Modelos podem ajudar a gerar problemas, mas o ecossistema de pesquisa atual ainda depende fortemente de especialistas para julgar quais problemas são significativos.
A revisão por pares pode precisar de uma nova pilha tecnológica
A revisão por pares tradicional pressupõe um número relativamente pequeno de submissões.
A IA pode produzir mais resultados candidatos do que os periódicos existentes conseguem processar.
O processo de revisão pode precisar de novas camadas.
Verificação formal automatizada
Todo resultado adequado à formalização deve vir acompanhado de um certificado verificável por máquina.
Registro reproduzível de geração
Prompts, versões de modelos, acesso a ferramentas e condições de execução devem ser arquivados.
Busca automatizada na literatura
Sistemas devem comparar novas alegações com bancos de dados de artigos e teoremas.
Reprodução independente por modelos
Diferentes modelos ou equipes de pesquisa podem tentar resolver o mesmo problema sem ver a prova proposta.
Triagem por especialistas
Especialistas identificam quais resultados merecem revisão aprofundada.
Reescrita explicativa
Provas corretas são convertidas em formas que humanos possam aprender.
Revisão pós-publicação
Repositórios abertos permitem que erros, simplificações e argumentos alternativos sejam registrados continuamente.
Isso não substitui periódicos ou especialistas, mas lhes fornece melhores ferramentas para lidar com um volume maior de trabalho.
O Manifesto de Leiden levanta questões de governança
O Manifesto de Leiden sobre IA e Matemática pede o uso responsável da IA na pesquisa matemática.
Suas preocupações incluem:
- Argumentos plausíveis, mas não confiáveis.
- Transparência na participação da IA.
- Atribuição de autoria.
- Responsabilidade pela correção.
- Acesso desigual a sistemas proprietários caros.
- Exagero.
- Controle humano sobre a agenda de pesquisa.
O lançamento da OpenAI respondeu a algumas dessas questões de maneira excepcionalmente direta.
Ele atribui os argumentos matemáticos ao modelo, explica o papel humano na preparação do manuscrito, publica certificados formais e convida a comunidade para revisão.
Questões que permanecem:
- Quem deve ser listado como autor?
- Quem é responsável por erros?
- Como as descobertas geradas por modelos devem citar fontes de treinamento?
- Como o acesso deve ser distribuído?
- Quando um resultado é apropriado para anúncio público?
- Que evidências devem acompanhar alegações de descoberta autônoma?
Essas perguntas não são mais questões políticas hipotéticas.
Elas agora se aplicam a resultados de pesquisa reais.
Lista de verificação prática para validação
Passo um: confirmar o problema
- Encontre a declaração autoritativa.
- Verifique suas hipóteses exatas.
- Confirme que a versão alegada é pública.
- Identifique resultados parciais pré-existentes.
Passo dois: distinguir marcos
Distinga entre:
- O modelo propôs uma ideia.
- O modelo escreveu uma prova.
- Um humano editou a prova.
- A prova foi formalizada.
- A verificação formal passou na compilação.
- Especialistas aceitaram o resultado.
- O resultado passou pela revisão de publicação.
Passo três: ler a prova não formal
Procure hipóteses ocultas, raciocínios circulares, transições não explicadas, citações incorretas, mudanças de escopo e símbolos ambíguos.
Passo quatro: verificar a declaração formal
Confirme se o teorema em Lean expressa fielmente o conteúdo matemático pretendido.
Passo cinco: reconstruir o certificado
Para o repositório da OpenAI:
git clone https://github.com/openai/ten-proofs.git
cd ten-proofs
lake exe cache get
lake build All
Passo seis: verificar dependências
Verifique módulos importados, axiomas, placeholders, declarações inseguras, definições personalizadas e código externo confiável.
Passo sete: comparar provas formal e não formal
A prova formal pode estabelecer o teorema por um caminho diferente do manuscrito.
Passo oito: tentar reprodução independente
Entregue a declaração do teorema — sem a prova proposta — a outro modelo ou equipe de pesquisa.
Passo nove: buscar na literatura
Confirme a novidade e identifique trabalhos sobrepostos.
Passo dez: refletir sobre o que foi aprendido
Após um resultado correto, devem vir perguntas conceituais:
- Por que esse
trabalho funciona?
- Ele pode ser simplificado?
- O que ele generaliza?
- Quais crenças anteriores devem mudar?
O que confirmaria a fábula cinco?
Se a Alpöge ou a Anthropic publicassem o seguinte, essa alegação seria muito reforçada:
- A formulação precisa do teorema utilizado.
- Os prompts e a configuração do modelo.
- Manuscritos de prova para todos os cinco resultados.
- Carimbos de tempo e logs completos de execução.
- Detalhes do ambiente offline.
- Métodos de prevenção de vazamento.
- Comparação com os argumentos da Astra.
- Certificados Lean ou outros formatos verificáveis por máquina.
- Revisão independente por especialistas.
O resultado mais interessante não é necessariamente o mesmo conjunto de cinco provas idênticas.
Quatro argumentos verdadeiramente diferentes podem ser mais valiosos, pois podem revelar estruturas alternativas por trás do mesmo resultado.
O que o lançamento da OpenAI já estabeleceu
A OpenAI disponibilizou publicamente:
- Dez resultados matemáticos detalhados.
- Manuscritos completos.
- Uma análise passo a passo do processo de descoberta.
- Dez arquivos formalizados.
- Instruções de construção.
- Um repositório de código sob licença Apache.
- Declarações claras sobre as contribuições da IA e dos humanos.
Isso não substitui a revisão por pares.
Mas certamente cria um pacote de pesquisa sério e verificável.
A responsabilidade mudou de "mostre-nos a evidência" para "avalie a evidência abundante".
O que a resposta em 24 horas revela
A resposta relatada pela fábula sugere que capacidades de pesquisa de fronteira podem se espalhar mais rápido do que os lançamentos de modelos.
Uma empresa pode manter o modelo privado.
Mas ela não pode presumir que os resultados matemáticos produzidos por esse modelo permanecerão exclusivos por muito tempo após a publicação.
Uma vez que a formulação do teorema é pública, outros sistemas capazes podem atacá-lo imediatamente.
Portanto, organizações podem optar por publicar rapidamente evidências completas, formalizar antes do anúncio, convidar reprodução independente e coordenar com especialistas da área antes da divulgação.
A prioridade ainda importa.
O pacote de evidências em torno das alegações de prioridade pode importar igualmente.
Perguntas frequentes
O que a OpenAI Astra provou?
A OpenAI publicou dez resultados nas áreas de matemática e ciência da computação teórica, incluindo trabalhos sobre empacotamento de esferas, teoria de codificação, grupos não sofic, conjectura de rigidez de Connes, circuitos aritméticos, repetição paralela quântica, dificuldade reticular, conjectura de volume de Ehrhart, números de Ramsey e teoria extremal de grafos. A OpenAI os descreve como resultados que resolvem ou avançam significativamente problemas em aberto de longa data.
O OpenAI Astra está disponível publicamente?
Não. A OpenAI descreve o Astra como uma versão interna do seu próximo modelo principal. Os artigos, as análises passo a passo do raciocínio e os certificados Lean são públicos, mas o modelo Astra usado para gerar as provas não foi publicado.
O Claude Fable 5 realmente reproduziu as cinco provas do Astra?
O pesquisador da Anthropic, Levent Alpöge, declarou publicamente que o Fable concluiu os problemas 4 a 8 em 24 horas, em condições autônomas e offline. Durante o processo de verificação, os manuscritos completos, registros, prompts e certificados Lean dessas cinco execuções não foram encontrados publicamente; portanto, até que essa evidência mais completa seja divulgada, essa alegação deve ser considerada preliminar.
Quais cinco problemas o Fable supostamente concluiu?
Alpöge confirmou a conjectura de rigidez de Connes, complexidade de circuitos aritméticos, repetição paralela quântica, problema do vetor mais próximo e a conjectura de volume de Ehrhart. Ele afirmou que o resultado de Ehrhart parece essencialmente usar os mesmos argumentos do Astra, enquanto os outros quatro resultados podem ser diferentes.
As provas da OpenAI foram formalmente verificadas?
A OpenAI publicou provas formais em Lean 4 para todos os dez resultados, acompanhadas de instruções de construção e recursos para verificação independente. Os certificados Lean que compilam podem verificar os teoremas formais, mas especialistas ainda precisam confirmar se as declarações codificadas correspondem fielmente às afirmações matemáticas pretendidas.
Os dez resultados realmente custaram apenas 2.000 dólares?
A OpenAI afirmou que, às tarifas da API Sol, os tokens necessários para encontrar as soluções bem-sucedidas custaram aproximadamente 2.000 dólares. Essa estimativa não inclui treinamento do modelo, tentativas de pesquisa fracassadas, trabalho humano de redação, infraestrutura, verificação formal ou revisão matemática externa.
Por que os certificados Lean são importantes?
Os certificados Lean permitem que um pequeno núcleo confiável verifique mecanicamente se os teoremas formais são derivados de suas hipóteses e dependências. Eles reduzem o risco de lacunas lógicas ocultas, mas não confirmam novidade, importância ou a fidelidade da tradução matemática não formal.
A IA substituirá os matemáticos?
As evidências atuais apoiam uma mudança na maneira como a matemática é praticada, e não uma simples alegação de substituição. Os modelos podem acelerar busca, geração de provas, descoberta de contraexemplos e formalização, enquanto os humanos continuam indispensáveis na seleção de problemas, interpretação, contexto bibliográfico, revisão e na transformação de provas em compreensão.
Ferramentas relacionadas
- Lean: um provador de teoremas interativo e linguagem de programação usado para matemática formal e verificação de software.
- Mathlib: uma biblioteca matemática mantida pela comunidade, usada por muitos projetos de formalização em Lean.
- OpenAI Ten Proofs: repositório oficial contendo os certificados Lean 4 dos dez resultados publicados pelo Astra.
- Elan: gerenciador de toolchain para instalar e gerenciar versões do Lean.
- Lake: sistema de build e gerenciador de pacotes do Lean, usado para compilar as provas formais da OpenAI.
- Claude Fable 5: modelo público da Anthropic para tarefas de conhecimento, codificação, visão e ciência de longa duração.
- Formal Conjectures: repositório contendo declarações formais de conjecturas matemáticas, apoiando fluxos de trabalho de pesquisa verificáveis por máquina.
Links relacionados
- OpenAI: Dez avanços em matemática: anúncio oficial da OpenAI, resumos dos teoremas, declarações de atribuição e links para materiais de apoio.
- Manuscrito completo de 249 páginas: compilação completa dos resultados em matemática e ciência da computação teórica.
- Análise passo a passo da descoberta matemática: explicação de 62 páginas da OpenAI sobre como as ideias do modelo surgiram.
- Certificados Lean da OpenAI: código-fonte, comandos de build, módulos de teoremas individuais e instruções de verificação independente.
- Anthropic: Claude Fable 5 e Claude Mythos 5: capacidades oficiais do Fable 5, disponibilidade, medidas de segurança, identificadores de API e preços.
- Declaração de Leiden sobre IA e matemática: iniciativa da comunidade matemática abordando confiabilidade, atribuição, transparência, acessibilidade e responsabilidade humana.
- Contraexemplos para a conjectura de Jacobi em dimensão superior: artigo subsequente que descreve e generaliza o mecanismo por trás dos contraexemplos recentes.
Resumo
A OpenAI publicou um pacote de pesquisa excepcionalmente completo cobrindo dez avanços gerados pelo Astra: um manuscrito de 249 páginas, explicações detalhadas do processo de descoberta e dez provas formais em Lean que podem ser reconstruídas por pesquisadores externos.
O Claude Fable 5 supostamente concluiu cinco desses problemas em 24 horas, o que pode representar um novo tipo de replicação assistida por modelos. Essa alegação é significativa, mas suas evidências públicas atualmente são menos completas do que o manuscrito e os certificados formais fornecidos pela OpenAI; portanto, deve ser claramente marcada como uma conclusão pendente de verificação.
A estimativa de 2.000 dólares é mais bem compreendida como o custo em tokens de uma busca bem-sucedida por soluções às tarifas da API Sol, e não como o custo total de todo o projeto de pesquisa. Treinamento, tentativas fracassadas, preparação humana, formalização, infraestrutura e revisão continuam sendo parte dos custos econômicos reais.
A mudança maior é de "escassez de provas" para "escassez de revisão". Os modelos podem em breve gerar alegações matemáticas mais rápido do que especialistas conseguem verificar, contextualizar e interpretar.
Quando as provas se tornam baratas e abundantes, o trabalho mais valioso pode ser determinar quais provas estão corretas, são significativas, novas e dignas de compreensão.



