서론
2026년 8월의 한 주말, 최첨단 AI가 벤치마크 수학을 넘어 능동적 연구 영역으로 진입하고 있음을 보여주는 가장 명확한 신호 중 하나가 나타났다.
8월 1일, OpenAI는 《수학 및 이론 컴퓨터 과학의 10가지 진전》을 발표했다. 이러한 성과들은 OpenAI가 차세대 주요 모델로 설명하는 Astra의 내부 버전에 의해 생성되었다.
해당 성과 패키지에는 다음이 포함된다:
- 249페이지 분량의 원고.
- 수학 및 이론 컴퓨터 과학을 아우르는 10가지 성과.
- 62페이지 분량의 발견 과정 상세 설명.
- 10개의 Lean 4 형식 증명.
- 재구성 및 독립 검증을 위한 공개 소스 코드.
24시간도 채 지나지 않아, Anthropic 연구원 Levent Alpöge는 공개적으로 사용 가능한 모델 Claude Fable 5가 10가지 성과 중 5가지를 재현했다고 밝혔다.
그는 해당 5가지가 각각 4번째부터 8번째 문제라고 확인했다:
- Connes 강성 추측.
- 산술 회로 복잡도.
- 양자 병렬 반복.
- 최근접 벡터 문제.
- Ehrhart 부피 추측.
Alpöge는 이러한 실행이 자율적으로 이루어졌으며, 일반적인 프롬프트를 사용했고, 인터넷 접근 권한이 없었으며, OpenAI의 해결책이 컨텍스트에 유출되는 것을 방지하기 위한 조치가 취해졌다고 말했다.
만약 이 다섯 가지 증명이全面的인 공개 검증을 통과한다면, 이 사건은 한 최첨단 모델에 의해 생성된 연구 결과가 때때로 거의 즉시 다른 모델에 의해 독립적으로 재발견될 수 있음을 보여줄 것이다.
그러나 증거는 비대칭적이다. OpenAI는 원고, 과정 상세 설명, 기계 검증 가능한 인증서를 공개했다. 반면 Fable의 주장은 현재 주로 완전한 증명 패키지가 아닌 공개적 진술에 의해 뒷받침된다.
따라서 유용한 결론은 단순히 어떤 모델이 이겼다는 것이 아니다.
AI는 이제 검증, 설명, 귀속 및 검토가 증명 생산 자체보다 확장하기 더 어려울 수 있을 정도로 빠르게 연구 수준의 수학을 생성할 수 있다.

OpenAI, 10가지 연구 수준 성과 발표
OpenAI는 이러한 작업을 오랜 기간 미해결된 공개 문제를 해결하거나 상당한 진전을 이룬 10가지 성과로 설명한다.
해당 주제는 고차원 기하학, 부호 이론, 군론, 작용소 대수, 산술 회로 복잡도, 양자 복잡성, 격자 문제, 볼록 기하학, Ramsey 이론 및 극값 그래프 이론을涵盖한다.
OpenAI는 이러한 수학적 논증이 내부 Astra 모델에 의해 생성되었다고 밝혔다. 이후 인간이 동일한 모델의 도움을 받아 이러한 논증을 원고로 정리했고, 그 후 모델이 Lean에서 각 성과를 형식화했다.
보다 정확한 작업 흐름은 다음과 같다:
Astra가 수학적 논증 탐색
→ 성공적인 논증 선택
→ 인간과 모델이 읽기 가능한 원고 준비
→ 모델이 형식화 수행
Lean에서의 결과
→ 공식 증명서 및 소스 코드 공개
→ 외부 수학자들이 정확성, 참신성 및 중요성 검토
모델의 기여가 핵심이지만, 최종 연구 성과에는 여전히 인간의 준비, 공식 인프라, 소프트웨어 라이브러리 및 전문가 검토가 포함된다.
10대 성과

| 번호 | 분야 | OpenAI가 발표한 결과 |
|---|---|---|
| 1 | 고차원 구체 패킹 | Cohn–Elkies 선형 계획법의 점근적 강도를 결정하고 일반 고차원 패킹 경계를 개선 |
| 2 | 이진 부호 및 구형 부호 | 고전적 고정 거리 부호 경계를 지수적 인자로 개선 |
| 3 | 비sofic 군 | 명시적 비sofic 군을 구성하여 모든 가산 군이 유한 치환 근사를 허용하는지 여부에 대한 문제를 해결 |
| 4 | Connes 강성 추측 | 동일한 군 von Neumann 대수를 갖지만 동형이 아닌 성질 (T) 군을 구성하여 해당 추측을 반증 |
| 5 | 산술 회로 복잡성 | 영구함수 계산에 대한 새로운 하한을 확립, 차수 (n^4/로그 n)의 산술 공식 하한 포함 |
| 6 | 양자 병렬 반복 | 일반 유한 2인 엉킴 게임에 대한 지수적 병렬 반복 성질을 증명 |
| 7 | 최근접 벡터 문제 | 유클리드 CVP 및 관련 격자 문제에 대한 다항식 인자 근사 경도를 제시 |
| 8 | Ehrhart 부피 추측 | 모든 차원에서 지정된 볼록체 클래스에 대한 최적 최대 부피 경계를 증명 |
| 9 | 다색 Ramsey 수 | 다색 삼각형 Ramsey 수에 대한 초지수적 하한을 증명하여 Erdős 문제 183 해결 |
| 10 | 극값 그래프 이론 | Erdős 문제 146 및 180과 관련된 컴팩트성 및 퇴화성 추측을 반증하는 예시를 구성 |
이것들은 일반적인 올림피아드 문제가 아니다. 그중 몇 가지는 수년간 미해결된 문제로, 평가를 위해 깊은 전문 지식이 필요하다.
논문은 발표 내용의 일부일 뿐
OpenAI는 또한 《아이디어는 어떻게 형성되는가: 수학적 발견 노트》라는 제목의 62페이지 문서를 공개했다.
증명이 답하는 것은:
이 정리는 왜 성립하는가?
발견 기록이 답하려고 하는 것은:
시스템은 어떻게 이 논증을 찾았는가?
이것은 서로 다른 두 가지 질문이다.
단계별 분석은 연구자들이 모델이 알려진 아이디어를 재조합했는지, 특정 유추를 식별했는지, 광범위한 탐색을 수행했는지, 새로운 구성을 찾았는지, 아니면 알려진 정리를 예상치 못한 방식으로 사용했는지 판단하는 데 도움이 될 수 있다.
이러한 내용은 여전히 주의해서 접근해야 한다. 모델이 생성한 서술이 반드시 모든 내부 계산의 완벽한 인과 기록은 아니다.
OpenAI는 10개의 Lean 인증서를 공개했다
공식 openai/ten-proofs 저장소에는 각 결과에 해당하는 Lean 모듈이 포함되어 있다.
이 프로젝트는 다음을 사용한다:
Lean 4.32.0
mathlib
Lake
elan을 설치한 후, 공식 README는 사용자에게 다음 명령을 통해 10개의 형식 증명을 모두 빌드하도록 안내한다:
lake exe cache get
lake build All
개별 모듈만 빌드할 수도 있다:
lake build SpherePacking
해당 저장소에는 다음이 포함된다:
SpherePacking.lean
MetricCodes.lean
NonSoficGroup.lean
ConnesRigidity.lean
Permanent.lean
QuantumParallelRepetition.
lean
GapCVP.lean
EhrhartVolumeInequality.lean
MulticolorTriangleRamsey.lean
CompactnessAndDegeneracy.lean
코드는 Apache 2.0 라이선스로 배포되며, 독립 검증 리소스를 포함합니다.
Lean 인증서가 증명하는 것
Lean은 의존 유형 이론을 기반으로 한 상호작용형 정리 증명기입니다.
Lean 커널을 통해 검증된 증명은 형식화된 정리가 정의, 가정, 가져온 공리와 라이브러리, 그리고 형식화된 증명 항에서 도출되었음을 확립합니다.
이는 비공식 논증에서 발생할 수 있는 많은 오류를 배제합니다:
- 논리적 단계의 누락.
- 잘못된 대수 변환.
- 숨겨진 모순.
- 근거 없는 경우 구분.
- 양화사 불일치.
- 잘못된 중간 보조 정리.
인증서는 저자의 주장이 설득력 있어 보인다고 해서 받아들여지는 것이 아니라 기계적으로 검사될 수 있습니다.
Lean 인증서가 증명할 수 없는 것
형식 검증이 모든 검토 문제를 제거하지는 않습니다.
형식적 진술이 비공식 주장과 일치하는가?
정리 증명기는 인코딩된 진술을 검사합니다. 인간은 여전히 그것이 수학적 문제를 정확히 포착했는지 판단해야 합니다.
정의와 가정이 적절한가?
Lean은 형식적 정의의 귀결을 검증합니다. 정의가 인정된 개념을 반영하는지, 혹은 제목 결과를 약화시키는 숨은 가정이 있는지는 결정할 수 없습니다.
결과가 새로운가?
형식적 정확성은 참신성과 같지 않습니다. 문헌 검토와 전문가 지식이 여전히 필요합니다.
결과가 중요한가?
기계는 정리가 성립함을 검증할 수 있습니다. 그러나 결과가 해당 분야를 변화시켰는지, 가치 있는 아이디어를 도입했는지는 판단할 수 없습니다.
증명이 우리에게 배움을 주는가?
형식적으로 올바른 두 증명은 설명적 가치에서 크게 다를 수 있습니다. 하나는 재사용 가능한 원리를 드러낼 수 있고, 다른 하나는 인간이 내면화하기 어려울 수 있습니다.
형식 검사는 정확성 문제를 해결합니다. 수학적 이해는 여전히 별개의 과제입니다.
Claude Fable 5가 24시간 내에 5개 성과를 재현했다고 주장
OpenAI의 발표가 있은 지 하루도 지나지 않아 Alpöge는 "Fable로 그중 절반을 완료했다"고 썼습니다.
그는 설정을 다음과 같이 설명했습니다:
- 완전 자율.
- 일반 프롬프트 사용.
- 네트워크 접근 없음.
- 정보 유출을 방지하기 위한 추가 예방 조치.

Alpöge는 이후 5건이 4번부터 8번까지임을 확인했습니다.

| OpenAI 프로젝트 | 주제 | Fable 주장의 공개 상태 |
|---|---|---|
| 4 | Connes 강성 추측 | 재현 주장됨 |
| 5 | 산술 회로 복잡도 | 재현 주장됨 |
| 6 | 양자 병렬 반복 | 재현 주장됨 |
| 7 | 최근접 벡터 문제 | 재현 주장됨 |
| 8 | Ehrhart 부피 추측 | 재현 주장됨 |
Alpöge는 Ehrhart 결과가 Astra와 Fable이 본질적으로 동일한 논증을 사용한 것으로 보이는 유일한 사례라고 밝혔습니다.
정확하다면, 나머지 4건은 OpenAI의 접근 방식을 재구성한 것이 아니라 대체 증명일 수 있습니다.
Fable의 증거는 아직 OpenAI의 발표와 동등하지 않습니다
OpenAI의 10건 결과에 대해 공개 패키지에는 정리 진술, 전체 원고, 추론 과정, Lean 소스 코드, 빌드 설명, 독립 검증 리소스가 포함되어 있습니다.
Fable의 5건에 대해 저는 Alpöge의 진술, 언급된 문제 번호, 그가 밝힌 실험 조건, 그리고 Ehrhart 논증에 대한 그의 관찰을 검증할 수 있습니다.
다음을 포함하는 공개 패키지는 검증할 수 없습니다:
- 5건의 전체 원고.
- 정확한 일반 프롬프트.
- 전체 실행 로그.
- 토큰 사용량.
- 모델 설정.
- 유출 방지 방법.
- Lean 인증서.
- 각 논증에 대한 외부 검토.
엄밀한 설명은 다음과 같습니다:
한 Anthropic 연구원이 Fable 5가 통제된 조건에서 10개 문제 중 5개를 독립적으로 완료했다고 공개적으로 보고했으나, 검증 시점에 포괄적인 독립 평가에 필요한 상세 증거는 아직 공개되지 않았습니다.
이는 주장이 거짓임을 증명하지 않습니다. 이는 해당 주장이 OpenAI가 공개한 패키지와 동일한 증거 단계에 아직 도달하지 못했음을 의미합니다.
24시간이 여전히 중요한 이유
위의 유보 사항이 있더라도 시점은 주목할 만합니다.
전통 수학에서 중요한 새 결과는 독립적으로 재구성되는 데 수개월 또는 수년이 걸릴 수 있습니다.
연구자들은 먼저 배경 지식을 학습하고, 원고를 읽고, 기술적 세부 사항을 검토하고, 논증을 재구성하고, 대안을 시도하고, 문제를 논의하고, 검토나 후속 논문을 발표해야 합니다.
강력한 모델은 이 과정의 일부를 압축할 수 있습니다.
한 모델의 결과가 하루 만에 다른 모델에 의해 독립적으로 도달될 수 있다면, AI 생성 발견의 우선권 창은 크게 단축될 수 있습니다.
첫 번째 팀은 문제를 선택하고, 최초의 공개 논증을 제시하고, 원고를 준비하고, 결과를 형식화하고, 다른 사람들이 참조할 수 있는 기록을 만들었으므로 여전히 인정받을 만합니다.
그러나 다른 연구자들이 유사한 문제를 즉시 최첨단 시스템에 할당할 수 있다면, 선점 이점은 수년이 아닌 며칠만 지속될 수 있습니다.
이는 벤치마크 경쟁보다 재현에 더 가깝습니다
대부분의 모델 벤치마크는 알려진 답이 있는 문제에서 시스템을 비교합니다.
벤치마크는 묻습니다:
동일한 테스트 세트가 주어졌을 때, 어떤 모델이 더 높은 점수를 받는가?
이번 세트는 다른 질문을 제기합니다:
두 시스템이 독립적으로 동일한 새로운 최첨단 결과에 도달할 수 있는가?
이는 과학적 재현과 유사합니다.
독립적 재현은 어떤 결과가 단일 모델의 오류, 취약한 프롬프트, 정보 유출, 또는 비정상적인 증명 경로에 의존하는지 밝힐 수 있습니다.
두 개의 독립적인 논증은 특히 서로 다른 사고 방식을 취할 때 신뢰를 강화할 수 있습니다.
그러나 여전히 검토가 필요합니다.
두 모델이 유사한 훈련 소스, 수학적 오해, 최적화 편향, 또는 암묵적 가정을 공유할 수 있습니다.
모델 독립성은 인지적 독립성과 자동으로 동일하지 않습니다.
AI 재현 주장을 평가하는 방법
신뢰할 수 있는 재현 자료 패키지는 다른 사람들이 실험을 반복할 수 있도록 충분한 정보를 공개해야 합니다.
문제 정의
- 정확한 정리 진술.
- 정확한 가정.
- 원본 문제의 버전.
- 해당 문제가 이전에 미해결 문제였음을 보여주는 참고 문헌.
모델 구성
- 모델 이름과 버전.
- 추론 또는 노력 설정.
- 컨텍스트 길이.
- 도구 접근 권한.
- 관련 샘플링 설정.
프롬프트 설계
- 초기 프롬프트.
- 후속 프롬프트.
- 인간의 수정.
- 모든 도메인 프롬프트.
- 모든 스캐폴딩.
유출 통제
-
네트워크 및 검색 접근 권한.
-
컨텍스트에 포함된 소스 문서.
-
모델 스냅샷의 시점.
-
복제 언어 또는 구조를 감지하는 방법.
실행 기록
- 전체 전사.
- 도구 호출.
- 실패한 시도.
- 실행 시간.
- 토큰 사용량.
- 병렬 실행 횟수.
수학적 증명
- 완전한 증명.
- 검증 가능한 형식 인증서.
- 의존성 목록.
- 최초 증명과의 비교.
외부 검토
- 지정된 검토자.
- 검토 의견.
- 수정 사항.
- 남은 이의 제기.
- 발표 상태.
이러한 정보가 없으면 "독립적 재현"은 여전히 유망한 예비 보고서와 구별하기 어렵습니다.
Fable 5는 공개적으로 이용 가능한 최첨단 모델입니다
Anthropic은 2026년 6월에 Claude Fable 5를 출시했습니다.
Anthropic은 이를 대중 사용과 안전을 위해 설계된 Mythos급 모델로 설명합니다.
회사는 이 모델이 장기 자율 작업, 소프트웨어 엔지니어링, 지식 작업, 비전, 과학 연구 및 장기 컨텍스트 작업에서 특히 뛰어나다고 밝혔습니다.
공식 API 모델 식별자는 다음과 같습니다:
claude-fable-5
Anthropic이 공개한 가격은 다음과 같습니다:
입력 토큰 100만 개당 10달러
출력 토큰 100만 개당 50달러
Fable의 공개 출시는 수학적 스토리와 밀접하게 관련되어 있습니다.
Astra는 여전히 OpenAI 내부에서 미공개 모델입니다.
Fable은 지원되는 Anthropic 제품과 API를 통해 연구자와 개발자가 접근할 수 있습니다.
이를 통해 외부 팀이 자체 연구 질문을 시도하기가 더 쉬워졌지만, 모델 접근만으로 좋은 문제를 선택하거나 출력을 검증하는 데 필요한 전문성이 보장되지는 않습니다.
2000달러라는 숫자는 한계 탐색 비용의 추정치입니다
OpenAI는 Sol API 가격으로 그 10개의 해법을 찾는 데 필요한 총 토큰 수가 약 2000달러라고 밝혔습니다.

이 숫자는 놀랍지만 정확한 라벨이 필요합니다.
이는 해법을 성공적으로 찾는 데 드는 토큰 비용의 추정치로 이해하는 것이 가장 좋습니다.
이는 해당 연구 프로젝트의 총 경제적 비용이 아닙니다.
더 큰 비용 구조는 다음을 포함할 수 있습니다:
- Astra 훈련.
- 추론 인프라 구축 및 운영.
- 연구자의 후보 문제 선별.
- 해결되지 않은 문제에 대한 시도 실행.
- 성공한 문제에 적용했던 실패한 접근 방식.
- 수동 원고 작성.
- 형식화 작업.
- 소프트웨어 엔지니어링.
- 외부 수학 검토.
- 출판 및 유지 관리.
OpenAI는 다른 주요 문제를 시도했지만 성공하지 못했으며, 밀레니엄 문제를 해결하지 못했다고 밝혔습니다.
따라서 이 2000달러 추정치는 다음 질문에 답합니다:
공개 API 요율로 계산할 때 성공적인 탐색의 토큰 비용은 얼마인가?
그러나 다음 질문에는 답하지 않습니다:
모델을 만들고 연구 결과를 생성, 검증 및 출판하는 비용은 얼마인가?
두 숫자 모두 유용하지만 서로 다른 것을 측정합니다.
한계 비용이 여전히 연구 방식을 바꾸는 이유
간접 비용을 고려하더라도, 다시 진지하게 시도하는 낮은 한계 비용은 연구 수행 방식을 바꿀 수 있습니다.
인간 수학자는 특정 경로를 탐색할 가치가 있는지 결정하는 데 몇 주를 보낼 수 있습니다.
반면 AI 시스템은 많은 경로를 병렬로 탐색하도록 요청받을 수 있습니다.
연구자는 모델을 사용하여 다음을 수행할 수 있습니다:
- 반례 검색.
- 추측의 변형 테스트.
- 수학 언어 간 변환.
- 관련 보조정리 탐색.
- 후보 증명 형식화.
- 계산 실험 생성.
- 증명 전략 비교.
- 허점 식별.
- 더 간결한 표현 찾기.
이 효과는 다른 과학 분야의 고처리량 실험과 유사할 수 있습니다.
또 다른 가설을 테스트하는 비용이 낮아지면 테스트되는 가설의 수가 늘어납니다.
희소한 자원은 유망한 문제를 선택하고 그에 따른 후보의 홍수 속에서 평가하는 방향으로 이동합니다.
실패한 시도도 계산에 포함되어야 합니다
성공만 세는 비용 계산은 오해를 불러일으킬 수 있습니다.
어떤 시스템이 100개의 미해결 문제를 할당받아 그중 10개를 해결했다고 가정해 봅시다.
목표가 전체 탐색 프로젝트의 경제성을 측정하는 것이라면, 각 성공적인 해법의 비용에는 90개의 실패에 사용된 자원이 포함되어야 합니다.
전체 계산은 다음을 보고해야 합니다:
총 추론 비용
÷
검증된 결과의 수
성공적인 최종 실행, 실패한 전체 실행, 부분 진행, 인간이 안내한 재시작, 병렬 후보 및 검증 비용을 구분해야 합니다.
이 분모가 없으면 낮은 숫자는 전체 발견 과정의 경제성이 아니라 선별된 성공 사례만을 설명할 수 있습니다.
Fable은 새로운 미해결 문제에도 사용되었습니다
재현 작업에 대한 비판은 간단합니다:
왜 Fable로 Astra의 결과를 다시 수행하게 하는 대신 새로운 미해결 문제를 할당하지 않았는가?
몇 분 만에 쇼케이스 사이트를 만들고 리드를 늘리세요
아이디어를 한 문장으로 입력하면 We0 AI가 쇼케이스 사이트, 페이지, CMS를 생성하고 출시 후 고객과 트래픽 확보를 돕습니다.
무료 등록을 위한 하나의 완전한 프로젝트 생성
하나의 완전한 생성 흐름을 시도하고 첫 번째 프로젝트 초안을 빠르게 보는 데 가장 적합합니다.
재현과 발견은 서로 다른 목적을 제공합니다.
재현은 신뢰성을 테스트합니다.
새로운 문제를 해결하는 것은 최첨단 능력을 테스트합니다.
Fable은 또한 새로운 수학적 결과와 연결되었습니다.
2026년 7월, Alpöge는 야코비 추측의 3차원 경우에 대한 반례를 보고하고 발견 과정에서 Fable의 역할을 인정했습니다.
이 반례는 형식적으로 검증되었고, 수학자들이 논의했으며, 후속 작업이 이어졌습니다. 7월 말 arXiv에 게시된 논문은 일관된 전체 서술을 제공하고 그 메커니즘을 더 높은 차원으로 일반화했습니다.
이 사건은 반복되는 패턴을 드러냅니다:
- AI가 명확한 대상이나 논증을 생성합니다.
- 형식 도구가 핵심 주장을 검증합니다.
- 인간 수학자가 개념적 설명을 추구합니다.
- 후속 작업이 결과를 일반화합니다.
마지막 단계가 지속적인 수학적 가치의 대부분이 있는 곳일 수 있습니다.
반례와 증명은 서로 다른 검증 부담을 만듭니다
명확한 반례는 때때로 빠르게 검증될 수 있습니다.
어떤 추측이 특정 성질을 가진 대상이 존재하지 않는다고 주장한다면, 유효한 대상 하나로 충분히 반박할 수 있습니다.
검토자는 다음을 확인할 수 있습니다:
- 그 대상이 잘 정의되어 있는가.
- 가정 조건을 충족하는가.
- 결론을 위반하는가.
반면 길고 일반적인 정리는 수백 개의 상호 관련된 보조정리와 문헌에 대한 광범위한 이해가 필요할 수 있습니다.
이 차이는 AI 생성 반례가 빠르게 퍼질 수 있는 이유를 부분적으로 설명합니다.
야코비 사례는 연구자가 빠르게 확인하고 형식화할 수 있을 만큼 충분히 간결했습니다.
Astra의 10개 성과 중 일부는 더 긴 이론적 사슬을 포함하며 커뮤니티가 소화하는 데 더 많은 시간이 걸릴 수 있습니다.
새로운 병목 현상은 인간 검토입니다
핵심 질문은 다음과 같습니다:
AI가 최첨단 증명을 빠르게 생성할 수 있다면, 수학 커뮤니티는 충분히 빠른 속도로 검증할 수 있는가?
연구 결과는 여러 형태의 인정을 받아야 합니다.
논리적 인정
증명이 실제로 가정에서 도출되는가?
Lean이 여기서 도움을 줄 수 있습니다.
의미적 인정
형식화된 진술이 저자가 의미하는 바와 일치하는가?
전문가가 이러한 번역을 확인해야 합니다.
역사적 인정
해당 문제가 실제로 미해결이었으며 결과가 새로운 것인가?
문헌 지식이 필요합니다.
개념적 인정
증명이 새로운 아이디어를 드러내는가, 아니면 단순히 사실을 확인하는가?
수학적 판단이 필요합니다.
커뮤니티 인정
해당 작업이 검토, 논의, 수정 및 적절한 맥락에 배치되었는가?
시간과 제도적 절차가 필요합니다.
AI가 증명 생성을 가속화하는 속도는 대학과 저널이 고도로 전문화된 작업을 검토할 수 있는 전문가 팀을 확충하는 속도를 훨씬 앞지릅니다.
대부분의 사람들은 이러한 결과를 독립적으로 판단할 수 없습니다
강력한 프로그래밍 모델은 애플리케이션을 만들도록 요구하여 테스트할 수 있습니다.
강력한 이미지 모델은 시각적으로 판단할 수 있습니다.
그러나 최첨단 수학은 다릅니다.
대부분의 독자는 비소픽 군의 존재, Connes 강성 추측의 반례, 얽힘 게임의 병렬 반복 정리 또는 격자의 어려움을 직접 평가할 수 없습니다.
그들은 신뢰 체인에 의존합니다:
모델 출력
→ 형식 인증서
→ 증명 도우미 및 라이브러리
→ 분야 전문가
→ 독립 검토자
→ 저널 및 연구 커뮤니티
이것은 투명성을 더 중요하게 만듭니다.
대중이 능력을 직접 검증할 수 없을 때, 신뢰는 증거와 제도에서 나와야 합니다.



