Anthropic에 따르면 Claude는 현재 Anthropic의 AI 연구개발 업무 중 26%를 주도하고 있으며, 90% 이상은 인간과 AI의 협업 또는 그 이상의 단계에 도달했습니다. 이 가이드는 6단계 자동화 프레임워크, 3만 개의 내부 에이전트...

Anthropic은 차세대 인공지능을 구축하는 과정에 이미 얼마나 많은 인공지능이 관여하고 있는지 보여주는 가장 명확한 내부 현황 중 하나를 공개했습니다.
2026년 8월 기준으로 Anthropic은 Claude가 회사의 AI 연구개발 업무 중 26%를 주도한다고 밝혔습니다. 2026년 초만 해도 같은 지표는 1% 미만이었습니다.
이 수치는 인상적이지만, 쉽게 잘못 해석할 수 있습니다.
“Claude가 연구개발의 26%를 주도한다”는 말은 Claude가 인간 없이 회사의 4분의 1을 독립적으로 운영한다는 뜻이 아닙니다. Anthropic은 6단계 자동화 프레임워크를 사용하며, 26%라는 수치는 구체적으로 AL4 — AI 주도로 평가된 업무를 의미합니다. 인간이 높은 수준의 목표를 제시하면 Claude가 대부분의 작업을 처음부터 끝까지 수행하고, 인간은 감독과 승인을 담당합니다.
Anthropic은 또한 측정된 AI 연구개발 업무의 90% 이상이 최소한 AL3 — AI 협업 단계에 도달했다고 보고했습니다.
동시에 이 회사는 매우 큰 규모의 내부 에이전트 인프라를 운영하고 있습니다. 8월 한 시점에 Anthropic에서 가장 많이 사용된 내부 플랫폼에서는 약 3만 개의 에이전트가 연구 및 엔지니어링 업무를 수행하고 있었으며, Anthropic은 같은 달에 발생한 10억 건 이상의 에이전트 의사결정을 분석했습니다.
이 수치들은 “AI가 AI를 구축한다”는 논의가 이론에서 측정 가능한 현실로 이동한 이유를 설명해 줍니다.
동시에 마지막 단서가 왜 중요한지도 보여줍니다.
Anthropic은 측정된 업무 중 완전히 자율적인 AL5 단계에 도달한 사례는 없다고 밝혔습니다.
Anthropic은 AI 지원 및 AI 주도 연구개발을 더 깊이 확대하고 있지만, Claude가 인간의 감독 없이 스스로를 설계하고, 훈련하고, 평가하고, 대체할 수 있다고 주장하지는 않습니다.
Anthropic은 AI 연구개발 중 Claude가 수행하는 업무의 비중을 추적하기 위해 연구개발 자동화 지수의 프로토타입을 구축했습니다.
회사는 먼저 모델 연구개발에 포함되는 업무 유형을 분류한 다음, 각 범주에 자동화 수준을 부여합니다. 이 척도는 Epoch AI의 연구를 바탕으로 하며 AL0부터 AL5까지 구성됩니다.
| 수준 | 명칭 | 실제 의미 |
|---|---|---|
| AL0 | 사용되지 않음 | AI가 해당 업무에 실질적으로 참여하지 않습니다. |
| AL1 | 미미한 지원 | AI가 간헐적인 검색, 브레인스토밍 또는 문장 다듬기를 도울 수 있지만 업무 방식 자체를 바꾸지는 않습니다. |
| AL2 | 보조 | AI가 업무 일부를 실질적으로 빠르게 처리하지만, 인간이 여전히 업무를 주도하고 검토합니다. |
| AL3 | 협업 | AI가 인간의 긴밀한 지시 아래 업무의 큰 부분을 처리하며, 인간은 여전히 핵심 의사결정을 내리고 결과를 통합합니다. |
| AL4 | 주도 | AI가 높은 수준의 요청을 바탕으로 대부분의 업무를 처음부터 끝까지 수행하고, 인간은 감독하고 방향을 수정하며 승인합니다. |
| AL5 | 자율 | AI가 인간의 개입이 거의 없거나 전혀 없는 상태에서 업무를 처음부터 끝까지 수행합니다. |
AL3와 AL4의 차이는 특히 중요합니다.
AL3에서는 인간이 업무에 긴밀하게 관여합니다. 인간은 로그를 제공하고, 가설을 제안하고, 질문에 답하며, 예상치 못한 일이 발생했을 때 무엇을 할지 결정할 수 있습니다.
AL4에서는 인간이 높은 수준의 목표를 전달한 뒤 Claude가 대부분의 실행을 맡도록 할 수 있습니다. 사람은 여전히 업무를 감독하지만, 각 단계를 지속적으로 직접 조정할 필요는 없습니다.
Anthropic은 다음 세 가지 핵심 결과를 보고했습니다.
| 측정 항목 | Anthropic 보고 결과 |
|---|---|
| Claude가 AL4 “주도” 단계에 해당하는 AI 연구개발 업무 | 26% |
| AL3 “협업” 이상에 해당하는 AI 연구개발 업무 | 90% 초과 |
| AL5 “자율” 단계에 해당하는 AI 연구개발 업무 | 측정된 하위 집합에서 0% |
따라서 26%라는 수치는 다음과 같이 이해하는 것이 가장 적절합니다.
인간이 높은 수준의 목표를 설정
↓
Claude가 업무 흐름의 대부분을 처리
↓
인간이 감독하고 승인
다음과 같은 의미는 아닙니다.
Claude가 인간의 개입 없이 연구 의제를 독립적으로 선택하고,
후속 모델을 구축하고, 검증하고, 배포
이 구분은 Anthropic이 정의한 재귀적 자기개선의 핵심입니다.
Anthropic은 직원들에게 Claude를 얼마나 사용하는지 단순히 질문해 26%라는 수치를 산출하지 않았습니다.
공개된 방법론에 따르면, 회사는 모델 연구개발 순환 과정에 관여하는 팀의 업무 기록을 표본으로 추출하고, 2026년 7월의 업무를 바탕으로 약 1만 5,000개의 세부 업무로 구성된 상향식 목록을 만들었습니다.
그 후 Claude가 해당 업무를 계층 구조로 정리하는 데 도움을 주었으며, 그 결과는 다음과 같습니다.
각 범주에 대해 연구 에이전트가 실제 업무 수행 방식과 AI가 처리한 프로세스의 비중을 조사했습니다. 이후 독립적인 Claude 평가자가 자동화 수준을 부여했습니다.
Anthropic은 관련 업무 영역의 인간 담당자들에게도 자동화 수준을 별도로 평가하도록 요청했습니다.
회사는 모델과 인간이 정확히 같은 등급을 부여한 비율이 59%였으며, 97%의 경우 두 평가가 한 단계 이내로 일치했다고 보고했습니다.
이는 유용한 근거이지만 완벽한 측정은 아닙니다.
Anthropic은 경계 사례가 여전히 주관적이며, 평가 모델이 평가 대상 시스템과 일부 동일한 오류를 공유할 가능성이 있다고 명시했습니다.
원문은 Anthropic의 내부 에이전트 인프라 규모도 강조합니다.
Anthropic에 따르면 2026년 8월 기준, 가장 많이 사용된 내부 플랫폼에서는 약 3만 개의 에이전트가 동시에 연구 및 엔지니어링 업무를 수행하고 있었습니다.
여기서 표현이 중요합니다. 이는 인간과 유사한 영구 직원 3만 명을 의미하지 않으며, Anthropic 내부 어디에서나 사용되는 모든 AI 에이전트의 수를 뜻하는 것도 아닙니다.
측정 대상이 된 내부 플랫폼에서 한 시점에 활성화된 에이전트 수입니다.
이 에이전트들은 장시간 반자율적으로 작업할 수 있으며 서로에게 업무를 위임할 수도 있습니다.
Anthropic은 내부 에이전트 실행 구조에 에이전트별 정체성을 부여하고 개방형 메시징 시스템을 사용한다고 설명했습니다. 이를 통해 에이전트는 서로의 주장을 확인하고, 원래 근거로 연결하며, 정보를 무비판적으로 연쇄 전달하는 대신 오류를 수정할 수 있습니다.
수만 개의 에이전트가 병렬로 작동하면 감독은 시스템 차원의 문제가 됩니다.
Anthropic은 2026년 8월 연구 및 엔지니어링 에이전트가 내린 10억 건 이상의 의사결정을 분석했다고 밝혔습니다.
측정 대상 내부 플랫폼에서 이루어지는 모든 작업은 실행 전에 온라인 모니터를 통과합니다.
온라인 모니터는 다음과 같은 조치를 취할 수 있습니다.
Anthropic은 10억 건이 넘는 의사결정 중 **0.002%**가 차단되었으며, 이는 대략 4만 7,000건 중 1건에 해당한다고 밝혔습니다.
이 낮은 비율을 곧바로 “에이전트가 99.998%의 시간 동안 안전하다”는 뜻으로 해석해서는 안 됩니다. 차단 비율은 하나의 측정값일 뿐입니다. 이 비율은 모니터가 무엇을 감지할 수 있는지, 행동을 어떻게 분류하는지, 애초에 어떤 종류의 위험 행동이 발생하는지에 따라 달라집니다.
Anthropic도 같은 점을 지적합니다. 이 규모에서는 모든 중요한 행동이 모니터링 시스템에 포착되는지 알기 어렵습니다.
Anthropic은 두 가지 모니터링 계층을 설명했습니다.
온라인 모니터는 작업이 실행되기 전에 행동을 검사합니다.
목표는 즉각적이고 되돌리기 어려운 피해를 유발할 수 있는 행동을 중단하는 것입니다. 예를 들어 에이전트가 승인된 시스템 외부로 민감한 모델 자산을 이동하려는 시도를 막을 수 있습니다.
Anthropic은 측정 대상 플랫폼의 에이전트 작업 100%가 이 계층을 통과한다고 밝혔습니다.
오프라인 모니터링은 행동이 발생한 이후 에이전트 활동을 조사합니다.
즉각적인 피해를 유발하지는 않지만 시간이 지나며 발생할 수 있는 패턴을 포착하는 것이 목적입니다.
Anthropic은 오프라인 시스템이 추가 분류기 검토를 위해 매주 약 10만 건의 대화 기록을 표시한다고 설명했습니다.
대부분은 자동으로 처리되지만, 우선순위가 가장 높은 사례인 매주 약 50건은 인간 검토자에게 전달됩니다.
따라서 전체 구조는 다음과 비슷합니다.
에이전트가 작업을 제안
↓
온라인 모니터가 작업을 확인
↓
작업 실행 또는 차단/방향 전환
↓
활동 기록
↓
오프라인 모니터링이 패턴을 검토
↓
우선순위가 가장 높은 사례가 인간 검토자에게 전달
이 모니터링 체계는 Anthropic 발표에서 가장 중요한 부분 중 하나입니다. 자동화가 확대되더라도 조직이 에이전트가 수행하는 일을 이해하고 개입할 수 있어야 자동화가 실제로 유용해지기 때문입니다.
AIBase 기사의 두 번째 핵심 내용은 현재 Anthropic 코드 중 Claude가 작성하는 비중입니다.
여기서는 날짜를 정확하게 제시할 필요가 있습니다.
Anthropic의 공식 보고서 When AI builds itself에 따르면 2026년 5월 기준, Anthropic 코드베이스에 병합된 코드의 80% 이상이 Claude에 의해 작성되었습니다.
Anthropic은 2025년 2월 Claude Code가 연구 프리뷰에 들어가기 전에는 이 비율이 한 자릿수 초반이었다고 설명했습니다.
1년여 만에 매우 큰 변화가 나타난 것입니다.
두 수치는 서로 다른 대상을 측정합니다.
아이디어를 한 문장으로 입력하면 We0 AI가 쇼케이스 사이트, 페이지, CMS를 생성하고 출시 후 고객과 트래픽 확보를 돕습니다.
무료 등록을 위한 하나의 완전한 프로젝트 생성
하나의 완전한 생성 흐름을 시도하고 첫 번째 프로젝트 초안을 빠르게 보는 데 가장 적합합니다.
| 지표 | 시점 | 측정 대상 |
|---|---|---|
| 80% 이상 | 2026년 5월 | Claude가 작성한 Anthropic 병합 코드의 비중 |
| 26% | 2026년 8월 | AL4 “AI 주도”로 평가된 가중 AI 연구개발 업무의 비중 |
| 90% 이상 | 2026년 8월 | AL3 “협업” 이상으로 평가된 가중 AI 연구개발 업무의 비중 |
소프트웨어 코드는 모델 연구개발의 일부일 뿐입니다.
AI 연구에는 다음과 같은 업무도 포함됩니다.
따라서 병합된 코드의 80%를 Claude가 작성하면서도 전체 AI 연구개발의 26%만 AI 주도 업무로 분류될 수 있습니다.
Anthropic은 또한 2026년 2분기 일반적인 엔지니어가 하루에 병합하는 코드량이 2024년보다 약 8배 많았다고 보고했습니다.
회사는 곧바로 중요한 단서를 덧붙였습니다. 코드 라인 수는 생산성을 측정하는 불완전한 지표라는 점입니다.
코드가 많아졌다고 해서 가치가 8배 증가했다는 뜻은 아닙니다.
큰 변경 사항에는 다음이 포함될 수 있습니다.
그럼에도 Anthropic은 변화의 규모가 엔지니어링 처리량이 실제로 가속화되었음을 보여줄 만큼 크다고 주장합니다.
특히 Claude가 인간이 복사해 붙여넣을 코드 조각만 제안하는 수준을 넘어 직접 코드를 실행하기 시작한 이후 변화가 나타났다는 점이 주목됩니다. 산출량은 2021년부터 2024년까지 비교적 평평하게 유지되다가 이후 증가하기 시작했습니다.
원문은 Claude의 업무를 모델 실험, 코딩, 데이터 분석, 결과 검증으로 분류합니다.
Anthropic의 자체 발표 역시 Claude가 모델 개발 순환 과정 전반의 업무에 점점 더 관여하고 있다는 점을 뒷받침합니다.
여기에는 다음과 같은 업무가 포함될 수 있습니다.
이 때문에 사람들은 이러한 흐름을 AI가 더 나은 AI를 만드는 데 도움을 주는 현상이라고 설명합니다.
하지만 후속 모델 개발에 참여하는 것과 후속 모델을 완전히 자율적으로 만드는 것 사이에는 중요한 차이가 있습니다.
Anthropic 자체의 정의에 따르면 그렇지 않습니다.
Anthropic은 모델이 자신의 후속 모델을 완전히 자율적으로 구축할 수 있는 시점을 재귀적 자기개선으로 설명합니다.
8월 자동화 데이터는 AI 연구개발의 측정된 하위 집합 중 AL5에 해당하는 것이 없다고 명시합니다.
따라서 현재 가장 정확한 표현은 다음과 같습니다.
Claude는 미래 Claude 모델을 만들어 내는 연구개발 과정을 실질적으로 가속화하고 있지만, Anthropic은 Claude가 아직 후속 모델 개발의 전체 순환 과정을 자율적으로 수행할 수 있다고 주장하지 않습니다.
이 구분은 “재귀적 자기개선”이라는 표현이 자주 느슨하게 사용되기 때문에 중요합니다.
사람들이 의미하는 단계는 최소한 다음 세 가지로 나눌 수 있습니다.
1단계
AI가 다음 모델을 만드는 인간을 지원
2단계
AI가 인간의 감독 아래 연구개발 업무 흐름의 큰 부분을 주도
3단계
AI가 후속 모델을 자율적으로 설계하고, 구축하고, 평가하고, 개선
Anthropic이 공개한 데이터는 업무의 점점 더 큰 비중에서 2단계를 강하게 뒷받침합니다.
하지만 3단계를 보여주지는 않습니다.
Anthropic은 이러한 측정의 목적이 단순히 생산성을 홍보하는 데 있지 않다고 설명합니다.
프런티어 모델이 자체 개발을 가속화하기 시작한다면 대중과 정부가 시간에 따른 변화를 추적할 수 있는 지표가 필요하다는 것이 회사의 주장입니다.
Anthropic이 제안하는 측정 대상은 다음 세 가지입니다.
Anthropic은 이러한 지표가 향후 독립적으로 검증될 수 있으며, 더 강력한 안전 요건을 적용하기 위한 기준으로 사용될 수 있다고 밝혔습니다.
예를 들어 AI 주도 연구개발의 비중이 급격히 증가한다면, 새로운 모델이 추가 연구개발에 기여하도록 허용하기 전에 연구소가 더 긴 테스트 기간이나 강력한 외부 평가를 거치도록 요구할 수 있습니다.
이 내용은 짧은 AIBase 기사에는 포함되지 않았지만, 같은 Anthropic 측정 발표에서 나온 내용이며 회사의 broader 프레임워크를 이해하는 데 도움이 됩니다.
2026년 7월의 1주일간 현황을 기준으로 Anthropic은 다음과 같이 밝혔습니다.
Anthropic은 이를 보수적인 추정치라고 부르며, 안전성 연구와 역량 연구를 분류하는 일이 본질적으로 어렵다고 설명했습니다.
따라서 이 수치는 보편적이거나 영구적인 비율이 아니라 특정 시점의 현황으로 보아야 합니다.
Anthropic은 방법론의 한계를 이례적으로 구체적으로 설명했습니다.
중요한 주의사항은 다음과 같습니다.
이러한 한계가 수치를 무의미하게 만드는 것은 아닙니다.
오히려 수치를 자율성에 대한 절대적인 증거가 아니라 추세를 측정하는 지표로 해석할 때 더 유용하게 활용할 수 있습니다.
Anthropic의 가중 AI 연구개발 업무 중 26%가 현재 AL4로 평가된다는 뜻입니다. 이 단계에서는 Claude가 높은 수준의 요청을 바탕으로 대부분의 업무를 처음부터 끝까지 수행할 수 있습니다. 다만 인간이 여전히 업무를 감독하고 검토하며 승인하므로, 완전히 자율적인 연구를 의미하지는 않습니다.
AL4는 AI가 업무의 대부분을 주도하지만 인간이 감독과 승인에 대한 책임을 유지하는 단계입니다. AL5는 인간의 개입이 거의 없거나 전혀 없는 상태에서 업무가 처음부터 끝까지 자율적으로 처리되는 단계입니다. Anthropic은 측정된 AI 연구개발 업무 중 AL5에 도달한 사례는 없다고 밝혔습니다.
Anthropic은 2026년 5월 기준 코드베이스에 병합된 코드의 80% 이상이 Claude에 의해 작성되었다고 보고했습니다. 이 지표는 병합된 코드에 관한 것이며, 전체 연구, 제품 의사결정 또는 모델 개발 업무의 80%를 의미하지는 않습니다.
Anthropic은 2026년 8월 기준 가장 많이 사용된 내부 플랫폼에서 약 3만 개의 에이전트가 동시에 연구 및 엔지니어링 업무를 수행했다고 밝혔습니다. 이 수치는 측정 대상 내부 플랫폼에 적용되며, 인간과 동등한 영구 인력의 수로 해석해서는 안 됩니다.
Anthropic은 실행 전 온라인 모니터링과 작업 후 오프라인 모니터링을 함께 사용합니다. 회사에 따르면 측정 대상 플랫폼의 작업 100%가 온라인 모니터를 통과하며, 오프라인 시스템은 추가적인 자동화 및 인간 검토를 위해 대화 기록을 표시합니다.
Anthropic은 2026년 8월 10억 건이 넘는 에이전트 의사결정 중 온라인 모니터가 약 0.002%, 즉 대략 4만 7,000건 중 1건을 차단했다고 밝혔습니다. 이는 모니터링 통계일 뿐이며, 차단되지 않은 모든 의사결정이 안전하거나 정확했다는 증거는 아닙니다.
Anthropic 자체의 정의에 따르면 아직 달성하지 못했습니다. Anthropic은 더 강한 의미의 재귀적 자기개선을 모델이 자신의 후속 모델을 완전히 자율적으로 구축하는 것으로 정의합니다. 현재 데이터에 따르면 측정된 AI 연구개발 범주 중 AL5 자율성에 도달한 것은 없습니다.
Anthropic은 대중, 정부, 독립 평가기관이 프런티어 연구소가 모델 개발을 얼마나 빠르게 자동화하고 있는지 파악할 필요가 있다고 주장합니다. 회사는 자동화, 에이전트 감독, 컴퓨팅 자원 배분 지표가 추적 가능한 신호가 되어 향후 안전 요건을 결정하는 데 활용되기를 원합니다.
Anthropic의 최신 내부 측정 결과는 AI 주도 모델 개발로 빠르게 이동하고 있음을 보여줍니다. 2026년 8월 기준 Claude는 가중 AI 연구개발 업무의 26%를 주도하고 있으며, 90% 이상이 인간과 AI의 협업 또는 그 이상의 단계에 도달했습니다. 또한 약 3만 개의 에이전트가 Anthropic에서 가장 많이 사용되는 내부 연구 플랫폼에서 동시에 작동하고 있었습니다.
이와 별도로 Anthropic은 2026년 5월 기준 코드베이스에 병합된 코드의 80% 이상이 Claude에 의해 작성되었다고 밝혔습니다. 이 수치는 AI가 미래의 Claude 모델이 될 시스템을 구축하는 데 이미 깊이 관여하고 있다는 강력한 증거이지만, 더 넓은 연구개발 자동화 비율과 혼동해서는 안 됩니다.
가장 중요한 점은 Anthropic이 여전히 측정된 AI 연구개발 범주 중 AL5 완전 자율 단계에 해당하는 사례가 0건이라고 보고한다는 것입니다. 회사는 AI가 주도하는 AI 개발을 향해 분명히 나아가고 있지만, 완전히 자율적인 재귀적 자기개선이 실현되었다고 선언하지는 않았습니다.
오늘날 가장 분명한 신호는 “Claude가 Anthropic의 연구자를 대체했다”는 것이 아니라, 인간이 AI의 지원을 받아 업무를 수행하는 단계에서 인간이 점점 더 AI가 주도하는 연구개발 업무 흐름을 감독하는 단계로 중심이 이동하고 있다는 점입니다.
한 문장에서 시작해 몇 분 안에 완전한 웹사이트를 받아보세요.