서론
새로운 Claude Opus 5 프롬프트 패턴이 AI 프로그래밍 커뮤니티에 빠르게 퍼져나가고 있습니다. 개발자들이 짧은 초기 지시만으로 놀라울 정도로 정교한 브라우저 게임 프로토타입을 만들어내고 있기 때문입니다.
이 방법은 현재 "건틀릿 루프"(Gauntlet Loop)라고 불립니다.
핵심 아이디어는 간단합니다. 동일한 에이전트가 한 번 빌드하고, 자신의 작업을 평가하고, 거기서 멈추게 하지 마십시오. 주도 에이전트에게 높은 수준의 목표를 주고, 프로젝트를 더 작은 부분으로 분해하게 하고, 전문 빌더를 지정하며, 독립적인 평가 에이전트를 사용하여 실제 출력물을 구체적인 품질 기준과 비교하게 하십시오.
생성된 결과물이 비교를 통과하지 못하면, 다시 반복을 위해 돌아갑니다.
Matt Shumer는 Claude Code와 Opus 5를 사용하여 현대 《콜 오브 듀티》 게임에서 영감을 받은 브라우저 1인칭 슈팅 게임을 만든 후 이 방법을 대중화했습니다. 그는 이후 프롬프트, 소스 코드 및 워크플로우 설명을 게시했습니다.

또 다른 개발자 Anshu Chimala는 유사한 워크플로우를 적용하여 《긴 침묵》(The Long Silence)을 구축했습니다. 브라우저에서 실행되는 절차적 우주 탐험 게임입니다.
이러한 프로젝트는 정확하게 평가되어야 합니다. 이것들은 하나의 프롬프트로 즉시 상용급 AAA 게임을 만들 수 있음을 보여주는 것이 아닙니다. 이것들은 강력한 코딩 에이전트가 도구, 하위 에이전트, 긴 실행 시간, 측정 가능한 품질 기준 및 반복 검증을 제공받았을 때, 프로토타입을 전통적인 원샷 프롬프트가 도달할 수 있는 수준을 훨씬 넘어서까지 발전시킬 수 있음을 보여줍니다.
바이럴 데모 뒤에 숨은 프롬프트 패턴
Shumer의 초기 작업은 의도적으로 극단적인 목표를 설정했습니다: 현대 AAA급大作에 필적하는 시각적 야망을 가진 1인칭 슈팅 게임을 구축하는 것.
핵심 부분은 게임 장르가 아니라 평가 구조에 있습니다.

워크플로우는 에이전트에게 지시합니다:
- 전체 목표를 더 작은 부분으로 분해합니다.
- 이러한 부분을 전문 하위 에이전트에게 위임합니다.
- 독립적인 평가 에이전트를 사용하여 결과를 검사합니다.
- 생성된 산출물을 실제 참조 자료와 비교합니다.
- 기준에 미달하는 작업을 거부합니다.
- 고정된 라운드 수 후에 중단하는 것이 아니라 지속적으로 반복합니다.
Shumer는 이후 이 방법을 "건틀릿 루프"(Gauntlet Loop)로 공식화했습니다.
단순화된 버전은 다음과 같습니다:
목표
↓
주도 에이전트
↓
작업 분해
↓
빌더 에이전트
↓
실제 출력
↓
독립 평가
↓
참조 자료와 비교
↓
통과? ── 예 → 통합
│
아니요
↓
최대 격차 설명
↓
빌더 개선
↓
반복
구체적인 품질 기준이 중요합니다
"더 나아지게"라는 피드백은 약합니다. 모델이 "더 나은"것이 무엇인지 스스로 정의해야 하기 때문입니다.
"건틀릿 루프"는 평가자에게 외부 참조 자료를 제공합니다.
게임의 경우, 성숙한 상용 작품의 스크린샷이 될 수 있습니다.
웹사이트의 경우, 같은 카테고리의 선두 사이트 몇 개가 될 수 있습니다.
백엔드 엔지니어링의 경우, 다음과 같을 수 있습니다:
- 테스트 스위트
- 지연 시간 목표
- 참조 구현
- 보안 검토
- 신뢰성 임계값
목표가 완전히 도달 가능할 필요는 없습니다. 그 역할은 에이전트가 너무 일찍 성공을 선언하는 것을 방지하는 것입니다.
절대 빌더를 유일한 심판으로 만들지 마십시오
두 번째 핵심 규칙은 독립성입니다.
빌더는 자신이 각 선택을 한 이유를 알고 있으므로 자신의 결과를 쉽게 변호할 수 있습니다. 반면에 완전히 새로운 평가자는 실제 산출물만 받고 구현의 맥락을 알지 못합니다.
시각적 작업의 경우, 평가자는 렌더링된 픽셀을 검사할 수 있습니다.
소프트웨어의 경우, 평가자는 테스트와 런타임 동작을 검사할 수 있습니다.
성능 작업의 경우, 평가자는 실제 측정 데이터를 검사할 수 있습니다.
더 넓은 원칙은: 생성과 평가는 별개의 두 가지 일이어야 한다는 것입니다.
Claude of Duty: 이 루프를 유명하게 만든 프로젝트
Shumer의 초기 데모는 Claude of Duty로 공개적으로 출시되었습니다.
그 GitHub 저장소는 Three.js와 WebGL2를 기반으로 한 1인칭 슈팅 게임으로, 약 11개의 하위 시스템에 55,000줄의 코드를 포함하고 있다고 설명합니다.
저장소는 이 게임이 외부 아트 에셋을 사용하지 않았다고 밝힙니다. 텍스처, 메시, 애니메이션 및 사운드는 모두 코드로 절차적으로 생성되었습니다.
그 시스템에는 다음이 포함됩니다:
- 렌더링
- 재질
- 대기 및 하늘
- 세계 지오메트리
- 물리
- 플레이어 이동
- 무기
- 이펙트
- 적 AI
- UI
- 절차적 오디오
이 프로젝트를 "원샷"이라고 부르는 것은 모든 것이 한 번의 응답에 나타났다는 것을 의미하지 않습니다. Shumer의 말에 따르면, 높은 수준의 프롬프트가 장기 실행 Claude Code 세션을 시작했고, 이후 하위 에이전트를 파생시키고, 파일을 작성하고, 도구를 실행하고, 게임을 렌더링하고, 출력을 검사하고, 지속적으로 수정했습니다.
검증 도구 자체도 결과물의 일부입니다
저장소에는 다음 도구가 포함되어 있습니다:
- 재현 가능한 스크린샷
- 평가 이미지 세트
- 픽셀 단위 이미지 비교
- 프레임 시간 분석
- 스크립트화된 플레이 테스트
그리고 README는 일부 바이럴 게시물보다 더 신중합니다: 최종 프로젝트가 현대 콜 오브 듀티 게임의 수준과 일치하지 않는다고 명시적으로 밝힙니다.
이것이 오히려 실험을 더 가치 있게 만듭니다. 실제 결과는 "AI가 이미 AAA 스튜디오를 대체했다"가 아니라: 의도적으로 높게 설정된 참조 기준이 에이전트로 하여금 일반적인 프롬프트라면 이미 멈췄을 지점에서 훨씬 더 오래 작업하도록 만든다는 것입니다.
24시간 우주 게임: The Long Silence
이후 Anshu Chimala는 유사한 워크플로우를 The Long Silence에 적용했습니다. Claude Opus 5로 구축된 절차적 브라우저 우주 탐험 게임입니다.

공개 저장소 설명에 따르면 이 게임은 WebGL2, Three.js 스타일의 브라우저 렌더링과 커스텀 GLSL을 사용한다.
또한 전통적인 아트 에셋 라이브러리를 다운로드하는 대신 시드 기반 절차적 콘텐츠 생성 방식을 채택했다.
원문 기사는 약 24시간의 개발 과정을 크게 세 단계로 설명한다.
1단계: Opus 5에게 목표를 넘기고 아키텍처 선택을 맡기기
첫 번째 요청은 Three.js를 사용해 우주 탐험 게임을 만드는 것이었다.
요구사항은 의도적으로 높은 수준으로 유지되었다:
- 플레이어가 이동할 수 있어야 한다.
- 플레이어가 우주선을 조종할 수 있어야 한다.
- 지나치게 플라스틱 느낌의 비주얼 스타일은 피한다.
- 브라우저에서 안정적으로 실행되어야 한다.
- 가능한 범위 내에서 부드러운 성능을 추구한다.
세계관 구성과 기술 아키텍처의 대부분은 에이전트의 재량에 맡겨졌다.
이는 해당 방법론의 핵심 원칙을 따른 것이다:
목적지를 명확히 하되, 경로는 정하지 않는다.
원문 기사는 또한 이 과정에서 Claude Code가 Blender 관련 도구를 연결했다고 언급한다. 공개 저장소에는 Blender 하드서피스 모델링을 위한 Claude 스킬 디렉토리가 포함되어 있어, 재사용 가능한 Blender 명령어가 이미 프로젝트의 일부가 되었음을 확인해 준다.

2단계: 장시간 시각 최적화 루프 실행
첫 번째 플레이 가능한 버전이 완성된 후, 프로젝트는 긴 시각적 세부 조정 단계에 들어갔다.
여러 하위 에이전트가 각각 다른 영역을 처리하는 동시에, 하나의 리뷰 에이전트가 스크린샷을 정교한 우주 게임 참고 이미지와 비교했다.
핵심은 단순히 Opus 5에게 "게임을 더 보기 좋게 만들어라"라고 말하는 것이 아니었다. 리뷰 에이전트는 눈에 보이는 차이를 식별하고, 취약한 영역을 다시 반복 작업으로 보내야 했다.
원문 기사는 스타필드(Starfield) 같은 작품이 품질 기준으로 사용되었다고 언급한다.
긴 루프에도 중단 조건이 필요했다. 유용한 중단 시점으로는:
- 측정 가능한 목표에 도달했을 때.
- 리뷰 에이전트가 더 이상 중대한 차이를 발견하지 못할 때.
- 개선 폭이 너무 작아 계산 비용을 정당화하기 어려울 때.
- 할당된 시간이나 예산이 소진되었을 때.
- 인간 책임자가 결과가 충분하다고 판단했을 때.
루프는 압박 메커니즘이지, 출력물이 결국 "완벽"해질 것이라는 보장이 아니다.
3단계: 인간의 우선순위 재조정, 정리 및 스킬 추출
이 과정이 완전히 무인으로 진행된 것은 아니다.
원문 기사에 따르면, Chimala는 원격으로 진행 상황을 확인하고 에이전트가 특정 영역에 과도하게 집중하고 있을 때 개입했다.
장시간 실행이 끝난 후에는 추가 Claude 세션이 사용되어:
- 렌더링 문제를 수정하고
- 코드를 정리하며
- 프로젝트 배포를 준비했다.
그 후 모델은 재사용 가능한 경험을 스킬로 정리하도록 요청받았다.
공개 저장소에는 다음이 포함되어 있다:
.claude/skills/blender-hardsurface
이는 장시간 실행 에이전트 작업에 유용한 패턴이다. 프로젝트는 산출물뿐만 아니라 재사용 가능한 운영 지식도 축적할 수 있다: 어떤 도구가 효과적이었는지, 어떤 테스트가 중요한지, 무엇이 실패했는지, 그리고 향후 작업이 어떻게 구조화되어야 하는지.
The Long Silence는 자체 검증 도구를 구축했다
공개 저장소에서 가장 두드러진 부분 중 하나는
검증 도구 세트이다.
README에는 다음 명령어가 기록되어 있다:
node tools/play.mjs
node tools/survey.mjs
node tools/probe.mjs "" --shot out.png
node tools/sheet.mjs a.png b.png --out s.png
node tools/levels.mjs shots/*.png
node tools/judgeset.mjs
이 명령어들의 문서화된 용도는 다음과 같다:
play.mjs: 비행, 스캔, 폴딩, 점프를 포함한 17가지 상호작용 검증survey.mjs: 주요 장면 스크린샷 및 성능 보고서probe.mjs: 단일 브라우저 표현식 실행 및 단일 스크린샷sheet.mjs: 시각적 비교를 위한 축소판 연락처 시트levels.mjs: 톤 및 노출 통계judgeset.mjs: 시각적 리뷰 세트 재구성

핵심은 에이전트가 게임 자체뿐만 아니라 게임을 평가하는 메커니즘도 만들었다는 점이다.
이것이 장시간 실행 에이전트가 단순한 "생성 후 종료" 워크플로우보다 더 안정적으로 개선할 수 있는 이유 중 하나다.
이 저장소는 실제 엔지니어링 트레이드오프를 보여준다
README에는 몇 가지 실제 그래픽 결정 사항이 기록되어 있다:
- 부동 원점(floating origin) 시스템이 매우 큰 공간 거리를 처리한다.
- 행성은 큐브맵으로 베이크되어 매 프레임 비싼 절차적 평가를 피한다.
- 대기권은 산란 계산을 사용한다.
- 후처리에는 글로우, 톤 매핑, 렌즈 효과, 그레인, 안티앨리어싱이 포함된다.
- 동적 렌더링 스케일링이 프레임 레이트를 보호한다.
저장소는 또한 브라우저 검증이 GPU 래스터라이제이션이 활성화된 실제 Chromium 인스턴스에서 실행되었음을 설명한다.
이러한 세부 사항은 모델이 익숙한 엔지니어링 제약(성능, 정밀도, 재현성, 브라우저 동작, 시각적 품질)을 처리할 때 어떤 성과를 내는지 보여주기 때문에 중요하다.
결과물은 플레이 가능하지만 여전히 프로토타입이다
《The Long Silence》는 브라우저에서 공개적으로 플레이할 수 있다.
그 저장소는 표준 개발 명령어를 제공한다:
npm install
npm run dev
npm run build
게임에는 우주 비행, 스캔, 절차적 환경, 내비게이션, 탐험 목표 및 여러 인터페이스 시스템이 포함되어 있다.
이는 단순한 정적 모델 이상이라는 뜻이다.
하지만 대형 스튜디오가 수년에 걸쳐 개발한 상업용 AAA 게임과 동급이라고 보기는 어렵다.
AAA급 제작에는 일반적으로 다음 분야를 담당하는 대규모 팀이 필요하다:
- 아트
- 레벨 디자인
- 애니메이션
- 오디오
- 내러티브
- 멀티플레이어
- 품질 보증
- 접근성 지원
- 인증
- 성능 최적화
- 운영 및 유지보수
더 설득력 있는 결론은 이것이다: 한 명의 개발자가 이제 최첨단 코딩 에이전트를 조율하여 시각적으로 야심차고 기술적으로 사소하지 않은 플레이 가능한 프로토타입을 이전에 실제로 가능했던 것보다 훨씬 빠른 속도로 만들 수 있다.
커뮤니티 개발자들이 이 패턴을 재사용하기 시작하다
Shumer가 프롬프트와 코드를 공개한 후, 이 워크플로우는 빠르게 확산되었습니다.
카트 레이싱
Ryan Campbell도 유사한 패턴을 채택했습니다
브라우저 카트 레이싱 프로젝트를 반복적으로 발전시키며, 렌더링, 조작, 카메라 동작, 모바일 성능을 지속적으로 개선했습니다.
Shumer가 공개한 Gauntlet Loop 디렉토리에는 이 방법으로 제작된 브라우저에서 플레이 가능한 레이싱 실험이 나중에 공개되었습니다.
Claudepunk 2077
디자이너 Yogi Suria가 동일한 프롬프트 패턴에서 영감을 받은 사이버펑크 스타일의 Three.js 프로젝트를 공유했습니다.

이 사례는 이 방법이 특정 게임 장르에 국한되지 않음을 보여줍니다. 참조 대상, 아트 디렉션, 툴체인은 모두 바뀔 수 있지만 "구축-비평-반복"이라는 구조는 동일하게 유지됩니다.
동일한 패턴을 다른 코딩 에이전트에도 적용 가능
소식통은 한 개발자가 Codex에서 GPT-5.6 Sol을 사용해 유사한 프롬프트를 시도한 과정도 공개했습니다.
이 개발자는 구축 시간이 약 2시간이었다고 보고했으며, 결과물은 괜찮지만 Shumer의 데모만큼 정교하지는 않다고 평가했습니다.

이는 Gauntlet Loop가 본질적으로 Claude 전용이 아님을 보여줍니다.
이 패턴은 다음과 같은 역량을 갖춘 에이전트 환경에 의존합니다:
- 파일 접근
- 코드 실행
- 출력 렌더링
- 스크린샷 확인
- 도구 사용
- 다중 턴 연속 실행
- 작업 위임
- 피드백에 따른 수정
모델마다 루프 내 성능은 다를 수 있지만, 아키텍처는 이식 가능합니다.
비평 에이전트가 결과를 바꾸는 이유
전통적인 생성 흐름은 보통 다음과 같습니다:
사용자 → 모델 → 출력 → 사용자
Gauntlet Loop는 평가 계층을 추가합니다:
사용자
↓
메인 에이전트
↓
빌더
↓
산출물
↓
독립 비평가
↓
격차 측정
↓
빌더 수정
↓
새 산출물
이는 전달 전에 저품질 출력을 발견할 기회를 더 많이 만들어냅니다.
비평가는 현실을 검증해야 함
에이전트가 "페이지가 이제 반응형이어야 합니다"라고 말하는 것보다, 모바일 너비에서 페이지를 열고 실제로 확인하는 것이 더 강력합니다.
"게임이 더 빨라야 합니다"보다 프레임 시간을 측정하는 것이 더 강력합니다.
"렌더링이 더 좋아 보입니다"보다 스크린샷을 비교하는 것이 더 강력합니다.
최고의 피드백 신호는 실제 산출물에 뿌리를 둔 것입니다.
새로운 컨텍스트는 자기 변명을 줄임
빌더는 자신이 내린 모든 타협을 기억합니다.
이는 검토에 편향을 만들 수 있습니다.
독립 비평가는 더 단순한 질문을 던질 수 있습니다: 결과가 실제로 기준에 도달했는가?
이는 인간의 워크플로우를 반영합니다. 개발자는 테스트와 코드 리뷰를 사용합니다. 디자이너는 시각적 검토와 사용자 테스트를 사용합니다. 작가는 편집을 사용합니다.
AI 에이전트는 더 높은 빈도로 이러한 분리를 재현할 수 있습니다.
Opus 5가 이 워크플로우에 적합한 이유
Anthropic은 2026년 7월 24일에 Claude Opus 5를 출시했습니다.
공식 출시 자료는 코딩, 장기 다단계 작업, 검증, 반복에서 더 강력한 성능을 강조합니다.
Anthropic은 특히 Opus 5가 다음 분야에서 더 우수하다고 밝혔습니다:
- 자신의 작업 검토
- 작업 성공까지 반복
- 근본 원인 찾기
- 필요 시 테스트 프레임워크 구축
- 긴 작업에서 진행 상황 유지
- 작업을 넘기기 전에 시각적 출력 확인
이러한 행동은 Gauntlet Loop와 매우 잘 맞습니다.
이 프롬프트는 모델에 새로운 능력을 부여하지 않습니다. 모델이 이미 가진 능력을 반복적으로 사용하도록 강제하는 구조를 만듭니다.
Anthropic은 또한 Opus 5가 동일한 기본 가격에서 Opus 4.8보다 효율적이라고 밝혔습니다: 입력 토큰 100만 개당 5달러, 출력 토큰 100만 개당 25달러.
Opus 5도 여전히 감독이 필요함
장시간 실행되는 에이전트는 여전히 다음 문제에 직면할 수 있습니다:
- 컨텍스트 드리프트
- 우선순위 혼란
- 컴퓨팅 리소스 낭비
- 약한 국소적 의사결정
- 통합 충돌
- 도구 오류
- 시각적 불일치
따라서 인간의 체크포인트는 여전히 유용합니다.
가장 강력한 워크플로우는 "에이전트를 다시는 보지 않는 것"이 아니라, "에이전트가 두 번의 고가치 인간 개입 사이에서 더 오래 작업하게 하는 것"입니다.
실용적인 Gauntlet Loop 템플릿
이 방법은 게임 외의 영역으로도 확장할 수 있습니다.
1단계: 목표 정의
모든 구현 세부사항을 규정하지 말고 원하는 결과를 설명하세요.
매끄러운 조작, 강렬한 시각적 분위기,
안정적인 성능을 갖춘 정교한 브라우저 우주 탐험 게임을 구축하세요.
2단계: 진정한 품질 기준 정의
비평가가 확인할 수 있는 내용을 사용하세요.
시각적 작업의 경우:
조명, 깊이, 구도, 인터페이스 정교함을 엄선된 고품질 상업용 게임 스크린샷과 비교하세요.
소프트웨어의 경우 테스트, 벤치마크 또는 참조 구현을 사용하세요.
3단계: 메인 에이전트가 작업을 분해하도록 함
에이전트는 다음과 같은 구성 요소를 분리할 수 있습니다:
- 이동
- 조명
- 환경
- UI
- 오디오
- 이펙트
- 성능
4단계: 빌더와 비평가 역할 분리
중요한 구성 요소에 대해 다음을 사용하세요:
- 빌더 1명
- 새로운 컨텍스트를 가진 비평가 1명
5단계: 가장 큰 유효 격차 반환
비평가는 모호한 불만 목록을 나열하는 대신 가장 크고 실행 가능한 차이를 지적해야 합니다.
6단계: 반복
품질, 예산 또는 시간이 중단 지점에 도달할 때까지 계속 반복하세요.
7단계: 통합 검사 수행
병렬 에이전트는 국소적으로는 좋지만 전체적으로는 일관되지 않은 작업을 만들 수 있습니다.
최종 통합 에이전트는 다음을 확인할 수 있습니다:
- 공유 인터페이스
- 시각적 일관성
- 네이밍
- 중복 로직
- 성능
- 시스템 간 충돌
8단계: 재사용 가능한 지식 저장
프로세스에서 유용한 부분을 다음으로 저장하세요:
- 스킬
- 테스트 스크립트
- 벤치마크
- 프롬프트 템플릿
- 검토 도구
후속 실행은 이전 교훈에서 시작해야 합니다.
이 패턴이 가장 적합한 시나리오
품질을 반복적으로 측정할 수 있을 때 Gauntlet Loop가 가장 효과적입니다.
적합한 후보 시나리오:
- 프론트엔드 개발
- 게임
- 테스트 주도 코딩
- 리팩토링
- 성능 최적화
- 연구 보고서
- 마케팅 페이지
- 프레젠테이션
- 시각 디자인
하지만 비평가가 신뢰할 수 있는 신호를 갖지 못할 때 이 패턴의 효과는 약합니다.
스크린샷, 테스트, 벤치마크, 참고 자료 또는 실제 사용자 피드백이 없는 비평가는 단지 모델이 또 하나의 "의견"을 더 만들어내게 할 뿐입니다.
비용과 통제는 여전히 중요합니다
장시간 실행되는 멀티에이전트 워크플로우는 상당한 계산 리소스를 소비할 수 있습니다.
각 검토 라운드에는 다음이 필요할 수 있습니다:
- 새로운 모델 호출
- 브라우저 렌더링
- 이미지 분석
- 도구 실행
- 코드 생성
- 테스트
실용적인 예산 통제 수단은 다음과 같습니다:
- 최대 실행 시간
- 최대 모델 비용
- 최대 비평 라운드 수
- 최소 개선 임계값
- 주요 이정표 후 인간 승인
엄격한 비평가는 품질을 향상시킬 수 있지만, 남은 개선이 더 이상 비용 효율적이지 않은 상황에서도 시스템이 오랫동안 계속 실행되게 할 수 있습니다.
자주 묻는 질문
Gauntlet Loop란 무엇인가요?
Gauntlet Loop는 Matt Shumer가 대중화한 멀티에이전트 프롬프트 방법입니다. 주도 에이전트가 목표를 더 작은 작업으로 분해하고, 빌더 에이전트가 결과물을 생산하며, 독립적인 비평 에이전트가 실제 출력을 구체적인 참조 자료와 비교하여 기준에 미치지 못하는 결과물은 다시 보내집니다.
Claude of Duty는 정말 프롬프트 하나만으로 만들어졌나요?
Shumer에 따르면, 이 프로젝트는 상위 수준의 프롬프트에서 시작되었지만 단일 모델 응답으로 생성된 것은 아닙니다. 이후 Claude Code가 수시간 동안 작업하며 하위 에이전트를 파생시키고 약 55,000줄의 코드를 작성하고 도구를 사용하고 출력을 검사하며 반복했습니다.
Claude Opus 5가 24시간 안에 진짜 3A 게임을 만들었나요?
아니요. 이러한 데모는 기술적으로 인상적인 브라우저 게임과 프로토타입이지만 상업용 3A大作과 동등하지 않습니다. Claude of Duty의 코드 저장소 자체도 최종 결과물이 품질 기준으로 삼은 현대 Call of Duty 작품과 비교할 수 없음을 밝히고 있습니다.
The Long Silence란 무엇인가요?
The Long Silence는 Anshu Chimala가 만든 브라우저 기반 절차적 우주 탐험 게임입니다. 공개 저장소에 따르면 Claude Opus 5로 구축되었으며 커스텀 렌더링, 절차적 생성 콘텐츠, 브라우저 기반 검증 도구를 포함합니다.
왜 독립적인 비평 에이전트를 사용하나요?
새로운 비평가는 빌더 자신의 구현 결정을 변호하지 않을 가능성이 높습니다. 실제 산출물을 검사하고 재수정을 요청하기 전에 테스트, 스크린샷, 벤치마크 또는 참조 예시와 비교할 수 있습니다.
Gauntlet Loop는 Claude Opus 5에만 적용되나요?
아니요. 이 아키텍처는 도구, 파일 편집, 코드 실행, 시각적 검사 및 반복 작업을 지원하는 다른 코딩 에이전트에도 적용할 수 있습니다. 원문에는 GPT-5.6 Sol과 Codex의 예시가 포함되어 있습니다.
Claude Code가 필요한가요?
전체 워크플로우에는 일반 채팅 인터페이스가 아닌 에이전트 실행 환경이 필요합니다. Claude Code는 파일 처리, 명령 실행, 도구 연결, 장기 실행 코딩 작업 조정이 가능하므로 하나의 선택지입니다.
가장 큰 제한은 무엇인가요?
품질 기준이 모호하거나 측정할 수 없을 때, 장시간 실행되는 루프는 시간과 계산 리소스를 낭비할 수 있습니다. 인간 소유자는 여전히 예산을 설정하고 진행 상황을 확인하며 필요 시 우선순위를 재조정하고 추가 반복이 가치를 잃었을 때 결정해야 합니다.
관련 도구
- Claude Code: Anthropic의 에이전트 코딩 환경으로, 코드베이스, 도구 및 장기 개발 작업에 적합합니다.
- Claude Opus 5: Anthropic의 공식 발표.
Opus 5의 코딩, 검증, 반복 및 장기 작업 능력을 다룹니다.
- Three.js: 이 문서에서 논의된 브라우저 게임 프로젝트에 사용된 JavaScript 3D 라이브러리.
- Blender: 외부 도구를 통해 에이전트 워크플로우에 연결할 수 있는 오픈소스 3D 제작 스위트.
- Model Context Protocol: AI 애플리케이션을 외부 도구 및 데이터 소스에 연결하기 위한 개방형 프로토콜.
관련 링크
- Gauntlet Loop 실행 방법: Matt Shumer의 빌더/비평가 프롬프트 아키텍처에 대한 상세 설명.
- GitHub의 Claude of Duty: Shumer의 Opus 5 워크플로우로 제작된 오픈소스 Three.js 1인칭 슈팅 게임.
- Claude of Duty 원본 프롬프트: 실험 시작에 사용된 공개 프롬프트.
- GitHub의 The Long Silence: 오픈소스 브라우저 우주 게임 및 검증 도구.
- The Long Silence 플레이하기: 프로젝트의 실시간 WebGL2 버전.
- Anthropic: Claude Opus 5 출시: Opus 5의 기능, 가격 및 장기 실행 에이전트 동작에 대한 공식 정보.
- Anthropic MCP 문서: Claude 제품군에서 Model Context Protocol 지원에 대한 Anthropic의 개요.
요약
화제가 된 Opus 5 게임 실험은 마법 같은 "단일 생성"이 아니라 워크플로우의 시연으로 이해해야 합니다. Gauntlet Loop는 작업 분해, 전문 빌더, 독립 비평가, 구체적인 품질 기준 및 반복적 개선을 결합합니다.
The Long Silence는 이 패턴이 하루 정도의 에이전트 프로젝트에서 도달할 수 있는 수준을 보여줍니다. 공개 저장소에는 플레이 가능한 게임뿐만 아니라 검증 스크립트, 스크린샷 도구, 상호작용 검증 및 재사용 가능한 에이전트 지침도 포함되어 있습니다.
이 방법은 여전히 인간의 판단, 계산 예산, 좋은 참조 자료 및 에이전트 워크벤치에 의존합니다. 브라우저 프로토타입이 스튜디오 수준의 3A 게임과 동등해지는 것을 의미하지는 않습니다.
진정한 변화는 상위 수준의 목표 하나가 이제 장기 실행되는 "구축-측정-비평-개선" 루프를 시작할 수 있고, 인간이 개입하기 전에 훨씬 더 많은 작업을 완료할 수 있다는 점입니다.
몇 분 만에 쇼케이스 사이트를 만들고 리드를 늘리세요
아이디어를 한 문장으로 입력하면 We0 AI가 쇼케이스 사이트, 페이지, CMS를 생성하고 출시 후 고객과 트래픽 확보를 돕습니다.
무료 등록을 위한 하나의 완전한 프로젝트 생성
하나의 완전한 생성 흐름을 시도하고 첫 번째 프로젝트 초안을 빠르게 보는 데 가장 적합합니다.



