GPT-6 Astra 심층 분석: 에이전트 워크플로, 벤치마크, 가격 및 Claude Fable 5.1 비교

OpenAI는 2026년 9월 3일 GPT-6 Astra를 공개했으며, 베이징에서는 이미 9월 4일이었습니다. OpenAI는 Astra를 현재까지 가장 지능적이고 정렬된 모델이라고 설명하며, 컴퓨터 사용, 브라우징, 소프트웨어 엔지니어링, 사이버보안, 과학 및 전문 업무 전반의 어려운 엔드투엔드 작업을 위한 모델로 포지셔닝하고 있습니다.
이러한 포지셔닝이 중요한 이유는 Astra를 단순한 “차세대 챗봇”으로 이해해서는 안 되기 때문입니다.
가장 눈에 띄는 개선은 모델이 여러 단계에 걸쳐 계속 작업해야 하는 과업에 집중되어 있습니다. 환경을 점검하고, 도구를 사용하고, 계획을 수정하고, 실패를 처리하고, 소프트웨어를 조작하고, 단일 답변이 아닌 완성된 결과를 만들어내는 작업이 여기에 해당합니다.
원문은 이러한 변화를 “네이티브 에이전트 시대”의 시작이라고 설명합니다. 방향성 측면에서는 유용한 표현이지만, 전체 에이전트 하네스가 모델 가중치 안으로 이동했다고 말하는 것보다 실제 구현은 더 정교합니다.
OpenAI의 공식 문서는 서로 협력하는 두 개의 계층을 설명합니다.
즉, Astra는 에이전트 지향성이 크게 강화된 모델이지만, 애플리케이션에는 여전히 모델을 둘러싼 실행 환경이 필요합니다.

이 글은 원문의 5개 파트 구조를 유지하며 Astra를 다음 다섯 가지 관점에서 살펴봅니다.

벤치마크 수치를 살펴보기 전에 모델과 주변 제품 스택을 구분하는 것이 좋습니다.
기존 언어 모델 워크플로는 다음과 같이 쉽게 상상할 수 있습니다.
사용자 프롬프트
→ 모델 추론
→ 모델 응답
더 복잡한 에이전트의 경우, 주변 애플리케이션은 일반적으로 다음과 같은 계층을 추가합니다.
사용자 목표
→ 에이전트 하네스
→ 모델
→ 도구 호출
→ 환경 결과
→ 모델
→ 다음 작업
→ 최종 결과
이 외부 하네스는 도구를 어떻게 노출할지, 결과를 어떻게 반환할지, 컨텍스트를 어떻게 이어갈지, 어떤 권한을 적용할지, 루프를 언제 중지할지를 결정합니다.
OpenAI는 여전히 이 아키텍처를 사용합니다. 실제로 OpenAI는 Codex/ChatGPT Work 에이전트 하네스를 모델, 도구 및 사용자 환경을 연결하는 Rust 오케스트레이션 계층으로 별도로 설명했습니다.
Astra는 하네스를 유용하게 만드는 행동을 더 깊이 학습했습니다.
OpenAI의 모델 가이드에서는 다음과 같은 기능을 강조합니다.
따라서 이러한 차이는 “하네스가 모델 안으로 사라졌다”기보다 모델과 하네스의 공동 설계로 설명하는 편이 정확합니다.
이제 실질적인 목표는 다음과 같은 작업에만 머물지 않습니다.
Astra는 다음과 같은 더 어려운 실행 워크로드를 주된 대상으로 합니다.
OpenAI의 출시 자료는 더 나은 대화형 성격보다 엔드투엔드 작업을 반복적으로 강조합니다.
세대 변화를 다음과 같이 이해하면 유용합니다.
기존 모델 중심 워크플로:
강력한 추론 + 외부 오케스트레이션
GPT-6 Astra 워크플로:
더 강력한 에이전트 학습 추론 + 이를 활용하도록 설계된 외부 오케스트레이션
두 번째 시스템이 더 뛰어난 이유는 모델 자체가 계획 수립, 피드백 활용, 도구 조작, 작업 위임 및 장시간의 작업 경로에서 일관성 유지에 더 능숙하기 때문입니다.

원문의 가장 유용한 지점은 Astra가 모든 저렴한 모델을 모든 워크로드에서 자동으로 대체하는 모델로 해석되어서는 안 된다는 점입니다.
Astra의 가장 큰 개선은 어려운 에이전트 및 전문 업무에서 나타납니다.
다음 표는 확인 가능한 경우 OpenAI의 공식 GPT-6 Astra 출시 비교 자료의 수치를 사용합니다.
| 벤치마크 | GPT-6 Astra | GPT-5.6 Sol | 평가 내용 |
|---|---|---|---|
| ARC-AGI-3 | 99.9% | 7.8% | 새로운 상호작용 환경 및 추상 규칙 발견 |
| FrontierMath Tier 4 (v2) | 97.6% | 83.0% | 연구 수준의 수학 |
| ExploitBench | 100.0% | 78.5% | 평가 환경에서 알려진 취약점 익스플로잇 개발 |
| ExploitBench, 2026년 6~8월 | 39.0% | 5.5% | 모델 지식 컷오프 이후의 최신 취약점 |
| AutomationBench | 41.4% | 18.1% | 다단계 전문 업무 자동화 |
| Terminal-Bench Science 0.1 | 64.6% | 22.4% | 코드 및 터미널 도구를 사용하는 과학 워크플로 |
| BenchCAD | 95.9% | 83.3% | 여러 시점의 렌더링 이미지에서 CAD 재구성 |
| Agents’ Last Exam | 59.3% | 53.6% | 복잡한 전문 컴퓨터 사용 작업 |
| 출시 당시 Artificial Analysis Intelligence Index v4.1.1 | 61.2 | 60.9 | 독립 종합 지능 지수 |
이 표를 읽을 때는 몇 가지 세부 사항이 중요합니다.
첫째, OpenAI의 헤드라인 문구는 FrontierMath Tier 4를 98%로 반올림해 표시하지만, 벤치마크 표에서는 v2 평가 결과를 97.6%로 제시합니다.
둘째, ARC-AGI-3의 극적인 결과는 에이전트 스타일의 상호작용 벤치마크입니다. OpenAI는 Astra를 Responses API 하네스와 함께 실행했으며, 평가 설정은 실제 ChatGPT 제품 환경과 다를 수 있다고 설명합니다.
셋째, 사이버보안 점수는 통제된 평가 조건에서 측정되었습니다. OpenAI는 현재 Preparedness Framework에 따라 Astra가 Critical 사이버보안 기능 임계치에 도달한 것으로 분류하며, 이러한 기능을 중심으로 더 강력한 안전장치를 적용하고 있습니다.
ARC-AGI-3가 가장 분명한 사례입니다.
Astra는 OpenAI가 발표한 평가에서 99.9%를 기록했으며, GPT-5.6 Sol은 7.8%였습니다. 이 벤치마크는 정적인 프롬프트에 답하는 것이 아니라 상호작용을 통해 목표와 규칙을 추론해야 합니다.
여러 운영 벤치마크에서도 같은 패턴이 나타납니다.
이 때문에 일반적인 대화보다 에이전트 워크플로에서 Astra가 훨씬 더 큰 세대 도약처럼 느껴질 수 있습니다.
출시 당시 Artificial Analysis Intelligence Index v4.1.1에서 OpenAI는 다음과 같이 보고했습니다.
GPT-6 Astra: 61.2
GPT-5.6 Sol: 60.9
Claude Fable 5.1: 65.7
해당 종합 지수에서 Astra와 Sol의 격차는 ARC-AGI-3 또는 Terminal-Bench Science에서의 격차에 비해 매우 작았습니다.
Artificial Analysis는 이후 다른 벤치마크 구성을 사용하는 v4.2로 이동했기 때문에 절대 수치는 달라졌습니다. 그러나 더 넓은 결론은 여전히 유효합니다. Astra의 두드러진 강점은 모든 일반 지능 지표가 갑자기 두 배가 되었다는 데 있지 않습니다.
GPT-6 Astra의 표준 API 가격은 다음과 같습니다.
| 토큰 유형 | 100만 토큰당 가격 |
|---|---|
| 입력 | $10.00 |
| 캐시된 입력 | $1.00 |
| 캐시 쓰기 | $12.50 |
| 출력 | $50.00 |
GPT-5.6 Sol은 현재 입력 토큰 100만 개당 4달러, 출력 토큰 100만 개당 20달러로 더 저렴합니다.
따라서 Astra는 더 나은 작업 완료율이 높은 토큰 가격을 상쇄할 때 가장 적합합니다.
긴 컨텍스트와 관련된 또 다른 가격 세부 사항도 있습니다. 입력 토큰이 272K를 초과하는 요청은 전체 요청에 대해 더 높은 요율이 적용됩니다. 현재 Astra 모델 페이지에 따르면 입력 및 캐시 요율은 2배, 출력 요율은 1.5배입니다.
원문은 GPT-4o를 저비용 범용 옵션으로 사용했습니다. GPT-4o는 여전히 API 카탈로그에 존재하지만, OpenAI의 현재 모델 가이드는 대부분의 신규 통합에 더 최신인 GPT-5.6 제품군 모델을 사용하도록 안내합니다.
현재 기준의 선택 가이드는 다음과 같습니다.
| 시나리오 | 우선 시작할 모델 | 이유 |
|---|---|---|
| 대량 처리, 비용에 민감한 일반 작업 | GPT-5.6 Luna 또는 Terra | 비용이 낮고 많은 일상 워크로드에 충분한 성능 |
| 전문적인 추론 및 코딩 | GPT-5.6 Sol | Astra보다 저렴한 가격으로 강력한 전문 성능 제공 |
| 어려운 엔드투엔드 워크플로, 컴퓨터 사용, 과학 작업, 고급 에이전트 업무 | GPT-6 Astra | 어려운 다단계 실행 및 도구 중심 작업에 가장 적합 |
| 기존 GPT-4o 통합 | 적절한 경우 GPT-4o 유지 가능 | 여전히 사용할 수 있지만, 새로운 최첨단 워크플로의 기본 권장 모델은 아님 |
실용적인 원칙은 간단합니다.
작업을 안정적으로 완료할 수 있는 가장 저렴한 모델부터 시작하세요. 원시 토큰 가격보다 작업 성공률, 자율성 또는 실행 품질이 중요해질 때 Astra로 전환하세요.

원문은 OpenAI와 Anthropic이 완전히 다른 경로를 따르고 있다고 설명합니다.
강조점 측면에서는 어느 정도 사실이지만, 현재 제품은 이러한 설명보다 더 많은 부분에서 겹칩니다.
Claude Fable 5.1 역시 장시간 실행되는 에이전트, 코딩, 브라우저 사용, 엔터프라이즈 워크플로 및 관리형 에이전트 실행을 명시적으로 지원하도록 설계되었습니다. Astra 역시 강력한 범용 추론을 제공하는 100만 토큰 컨텍스트 기반 멀티모달 모델입니다.
따라서 더 정확한 비교는 “한쪽은 에이전트이고 다른 쪽은 그렇지 않다”가 아닙니다.
핵심은 각 시스템이 현재 어디에서 가장 강력한 증거와 제품적 강조점을 보여주는가입니다.
다음 수치는 별도 표기가 없는 한 OpenAI의 출시 비교 표에서 가져왔습니다.
| 벤치마크 | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5 | 기능 차원 |
|---|---|---|---|---|
| ARC-AGI-3 | 99.9% | — | 30.2% | 상호작용형 추상 추론 |
| FrontierMath Tier 4 (v2) | 97.6% | 87.8% | 73.2% | 고급 수학 |
| ExploitBench | 100.0% | — | 70.0% | 사이버보안 평가 |
| AutomationBench | 41.4% | 31.4% | 26.9% | 전문 업무 자동화 |
| Terminal-Bench Science 0.1 | 64.6% | 52.6% | 30.0% | 과학 워크플로 |
| BenchCAD | 95.9% | 84.3% | 82.1% | 엔지니어링/CAD |
| Agents’ Last Exam | 59.3% | — | 55.5% | 전문 컴퓨터 사용 작업 |
| Astra 출시 당시 Artificial Analysis Intelligence Index v4.1.1 | 61.2 | 65.7 | 63.1 | 독립 종합 지수 |
대시(—)는 해당 모델에 능력이 없다는 의미가 아닙니다. OpenAI의 비교 표에서 해당 항목에 대해 직접 비교 가능한 점수를 공개하지 않았다는 뜻입니다.
Anthropic은 Claude Fable 5.1을 야심찬 코딩과 지식 업무를 위한 가장 강력한 범용 공개 모델로 포지셔닝합니다.
공식 제품 페이지는 다음과 같은 기능을 강조합니다.
Fable 5.1은 출시 당시 Artificial Analysis v4.1.1 종합 지수에서도 선두를 차지했으며, 현재 독립 리더보드에서도 여전히 가장 강력한 모델 중 하나입니다.
따라서 Claude를 “여전히 외부 하네스가 필요한 챗 모델”로 축소하는 것은 정확하지 않습니다. Astra와 마찬가지로 Claude도 에이전트 스택의 일부로 작동하며, 모델과 주변 실행 환경이 모두 중요합니다.
Astra의 출시 평가 증거는 다음 영역에서 특히 강력합니다.
OpenAI는 Astra를 중심으로 비동기 도구 호출 및 턴 중간 조정과 같은 에이전트 특화 API 기능도 도입했습니다. 또한 하네스가 협업 도구를 제공하면 Astra가 작업을 나누고 서브에이전트에 위임할 수 있다고 설명합니다.
따라서 단일하고 정제된 답변을 생성하는 것보다 도구와 환경을 넘나드는 어려운 워크플로를 완수하는 것이 중요한 업무에서 Astra는 특히 매력적입니다.
원문은 Astra의 긴 컨텍스트와 멀티모달 기능을 “표준적”인 수준으로, Claude의 기능을 더 강력한 것으로 규정합니다.
그러나 현재 사양을 기준으로 보면 이러한 결론은 지나치게 포괄적입니다.
GPT-6 Astra는 다음을 지원합니다.
Claude Fable 5.1 역시 약 100만 토큰급 컨텍스트, 이미지 입력, 파일/PDF 이해, 코딩, 브라우저 사용 및 장시간 실행 에이전트 워크플로를 지원합니다.
따라서 올바른 의사결정은 컨텍스트 윈도 크기만이 아니라 정확한 워크로드와 평가 결과를 바탕으로 내려야 합니다.
다음과 같은 워크로드가 중심이라면 먼저 Claude Fable 5.1을 선택하세요.
다음과 같은 워크로드가 중심이라면 먼저 GPT-6 Astra를 선택하세요.
중요한 프로덕션 시스템이라면 표준 모델을 결정하기 전에 자체 대표 업무를 기준으로 두 모델을 모두 벤치마크하세요.

아이디어를 한 문장으로 입력하면 We0 AI가 쇼케이스 사이트, 페이지, CMS를 생성하고 출시 후 고객과 트래픽 확보를 돕습니다.
무료 등록을 위한 하나의 완전한 프로젝트 생성
하나의 완전한 생성 흐름을 시도하고 첫 번째 프로젝트 초안을 빠르게 보는 데 가장 적합합니다.
원문은 Astra의 성능 향상이 파라미터 수보다 주로 아키텍처에서 비롯되었다고 설명합니다.
OpenAI는 Astra의 파라미터 수를 공개하지 않았으므로 모델 크기의 역할에 관한 주장은 직접 검증할 수 없습니다.
OpenAI가 문서화한 내용은 모델 학습, 추론 개선 및 에이전트 하네스 설계가 결합된 결과입니다.
원문에서 가장 크게 바로잡아야 할 부분은 여기입니다.
OpenAI는 전체 에이전트 하네스가 Astra의 모델 가중치 안에 문자 그대로 내장되었다고 말하지 않습니다.
OpenAI는 에이전트 하네스를 모델, 도구 및 사용자 환경을 연결하는 오케스트레이션 계층으로 별도로 문서화합니다. 또한 Astra가 이러한 시스템 안에서 다단계 작업을 더 효과적으로 수행하도록 학습되었다고 설명합니다.
실제 아키텍처는 다음에 더 가깝습니다.
사용자 목표
↓
에이전트 하네스 / Responses API
↓
GPT-6 Astra
↓
도구 요청 또는 위임된 하위 작업
↓
애플리케이션 / 도구가 작업 실행
↓
결과가 Astra로 반환
↓
Astra가 계획 업데이트
↓
완료될 때까지 계속
이러한 구분은 개발자에게 중요합니다. 애플리케이션이 다음과 같은 핵심 책임을 여전히 담당하기 때문입니다.
더 나은 모델은 취약한 프롬프트와 오케스트레이션 로직의 필요성을 줄여주지만, 시스템 엔지니어링의 필요성까지 없애지는 않습니다.
OpenAI는 GPT-6 Astra가 작업을 나누고 병렬로 작동할 수 있는 서브에이전트에 업무를 위임하도록 학습되었다고 말합니다.
그러나 공식 가이드에서는 이러한 기능이 하네스에서 멀티에이전트 시스템을 구현하고 협업 도구를 제공할 때 작동한다고 명시합니다.
이는 Astra가 다음과 같은 프로젝트 관리자 역할에 기여할 수 있다는 의미입니다.
복잡한 목표
→ 독립적인 작업 흐름으로 분할
→ 병렬 위임
→ 결과 수집
→ 종속성 해결
→ 주요 작업 계속
하지만 서브에이전트의 실제 생성, 실행 환경 및 통신 채널은 여전히 주변 에이전트 시스템이 제공합니다.
Astra의 가장 강력한 결과는 환경과 상호작용하고 결과를 관찰할 수 있는 벤치마크에서 나오는 경우가 많습니다.
견고한 에이전트 루프는 다음과 같습니다.
계획
→ 실행
→ 결과 관찰
→ 성공 여부 판단
→ 계획 수정
→ 다시 실행
이는 일회성 텍스트 생성과 근본적으로 다릅니다.
모델은 반환된 도구 결과를 활용해 계속할지, 재시도할지, 전략을 바꿀지 또는 사용자에게 명확한 설명을 요청할지를 결정할 수 있습니다.
OpenAI의 최신 Responses API 기능도 다음과 같이 이러한 작업 방식을 강화합니다.
장시간 실행되는 에이전트 작업은 컨텍스트 관리 문제를 만듭니다.
모든 도구 결과, 파일, 추론의 분기 및 이전 작업은 기록을 계속 늘릴 수 있습니다. 시스템이 모든 내용을 단순히 반복해서 전달하면 컨텍스트는 비용이 높아지고 불필요한 정보로 가득 차게 됩니다.
Astra는 105만 토큰 컨텍스트 윈도를 제공하지만, OpenAI는 장시간 실행되는 Responses API 대화를 위해 명시적인 압축 기능도 지원합니다.
유용한 패턴은 다음과 같습니다.
대규모 작업 기록
→ 최근의 중요한 상태 유지
→ 오래된 정보 압축
→ 이어서 작업하는 데 필요한 사실 보존
→ 작업 계속
압축은 마법 같은 기억 기능이 아닙니다. 개발자는 하나의 대화가 끝없이 커지는 것에 의존하기보다 저장소, 데이터베이스, 문서 또는 기타 스토리지에 지속 가능한 프로젝트 상태를 별도로 저장해야 합니다.
Astra의 새로운 API 기능 중 하나는 비동기 도구 호출입니다.
애플리케이션이 다른 도구를 실행하는 동안에도 모델은 추론을 계속하거나, 다른 도구를 호출하거나, 작업의 독립적인 부분에 응답할 수 있습니다. 해당 도구가 완료되면 애플리케이션은 원래 호출 식별자를 사용해 그 결과를 모델에 다시 보냅니다.
이는 특정 도구의 실행이 느린 워크플로에서 불필요한 대기 시간을 줄입니다.
이 기능은 에이전트 기능의 도약이 단순히 더 큰 신경망의 결과가 아니라 시스템 수준의 개선임을 보여주는 사례이기도 합니다.
자율 실행이 강화되면 실수의 비용도 커집니다.
이에 따라 OpenAI는 Astra에 더 강력한 안전장치와 비정렬 모니터링을 함께 적용합니다. OpenAI의 안전성 자료에 따르면 Astra는 Critical 사이버보안 기능 임계치로 분류된 최초의 OpenAI 모델입니다.
OpenAI는 또한 모델이 승인된 작업 범위를 넘어서는지를 측정하도록 설계된 테스트에서 행동이 개선되었다고 보고합니다.
개발자는 아키텍처에 다음을 포함해야 합니다.
더 강력한 에이전트 모델은 이러한 통제를 덜 중요하게 만드는 것이 아니라 오히려 더 중요하게 만듭니다.
핵심 결론: Astra의 도약은 더 강력한 에이전트 학습 모델의 행동과 더 뛰어난 실행 스택이 결합된 결과로 이해하는 것이 가장 정확합니다. 추론과 실행은 더 긴밀하게 조정되지만, 하네스, 도구, 권한 및 환경은 여전히 별도의 엔지니어링 계층으로 남아 있습니다.
다음과 같은 작업을 진행한다면 Astra가 강력한 선택이 될 수 있습니다.
OpenAI가 공개한 평가에서 GPT-5.6 Sol과 가장 뚜렷한 차이가 나타난 영역도 바로 이러한 분야입니다.
다음과 같은 작업에는 Astra가 불필요한 경우가 많습니다.
이러한 시나리오에서는 GPT-5.6 Terra 또는 Luna가 더 경제적인 시작점이 될 수 있으며, Sol은 여전히 강력한 전문 업무 기본 모델입니다.
Astra의 토큰 가격은 입력/출력 100만 토큰당 10달러/50달러로, GPT-5.6 Sol의 4달러/20달러보다 훨씬 높습니다.
그러나 에이전트 워크플로에서는 가장 저렴한 토큰을 선택한다고 해서 항상 비용이 가장 낮아지는 것은 아닙니다.
저렴한 모델은 다음을 더 많이 필요로 할 수 있습니다.
OpenAI는 여러 출시 평가에서 Astra가 더 적은 출력 토큰으로 더 강력한 결과를 냈으며, 토큰당 가격은 더 높았음에도 일부 경우에는 완료된 벤치마크 작업당 예상 API 비용이 더 낮았다고 설명합니다.
이는 프로덕션에서 에이전트 모델을 평가하는 올바른 방식입니다.
성공적으로 완료된 작업의 총비용
= 모델 토큰 비용
+ 도구 비용
+ 재시도 비용
+ 지연 시간 비용
+ 사람의 검토 비용
+ 실패 비용
원문이 제시한 더 큰 흐름은 설득력이 있습니다.
수년 동안 최첨단 모델 비교는 다음 항목에 크게 집중했습니다.
이러한 요소는 여전히 중요합니다.
그러나 다음 단계에서는 점점 더 다음과 같은 질문을 던지게 됩니다.
Astra는 이러한 변화를 보여주는 가장 분명한 사례 중 하나입니다.
이것이 가장 중요한 엔지니어링 관점입니다.
모델은 높은 수준의 에이전트 기능을 갖추면서도 여전히 하네스를 필요로 할 수 있습니다.
실제로 모델이 복잡한 작업을 실행하는 능력이 향상될수록 잘 설계된 하네스의 가치도 커집니다. 하네스는 다음을 제공하기 때문입니다.
따라서 Astra가 에이전트 기능을 더 잘 수행한다고 해서 개발자가 에이전트 엔지니어링 학습을 중단해서는 안 됩니다.
오히려 더 깊이 학습해야 합니다.
GPT-6 Astra를 보편적인 대체 모델로 취급해서도 안 되고, 일반 종합 점수가 다른 최첨단 모델과 비슷하다는 이유로 과소평가해서도 안 됩니다.
Astra의 가장 큰 가치는 문제가 프롬프트가 아니라 워크플로일 때 나타납니다.
애플리케이션에 주로 짧은 답변이 필요하다면 더 저렴한 모델이 더 나은 엔지니어링 선택일 수 있습니다.
반면 애플리케이션에 AI 시스템이 여러 단계에 걸쳐 점검하고, 판단하고, 실행하고, 검증하고, 복구하며 계속 작업해야 한다면 Astra는 훨씬 더 흥미로운 선택입니다.
이것이 진정한 세대 교체의 신호입니다.
GPT-6 Astra는 어려운 엔드투엔드 작업을 위한 OpenAI의 현재 플래그십 모델입니다. OpenAI는 Astra를 복잡한 추론, 코딩, 컴퓨터 사용, 리서치, 전문 워크플로 및 도구 중심 에이전트 작업에 적합한 모델로 포지셔닝합니다.
Astra를 에이전트 최적화 모델이라고 부르는 것이 더 정확합니다. 전체 에이전트 하네스가 모델 안에 존재한다고 말하기는 어렵습니다. Astra는 다단계 작업, 도구 사용 및 서브에이전트 위임을 수행하도록 학습되었지만, Codex, ChatGPT Work 또는 자체 애플리케이션이 외부 하네스, 도구, 권한 및 실행 환경을 여전히 제공합니다.
API 모델 ID는 gpt-6-astra입니다. OpenAI는 현재 Responses API와 Chat Completions를 통해 이 모델을 제공하지만, Astra의 도구 호출은 Responses API를 중심으로 문서화되어 있습니다.
표준 API 가격은 입력 토큰 100만 개당 10달러, 출력 토큰 100만 개당 50달러입니다. 캐시된 입력은 100만 개당 1달러, 캐시 쓰기는 100만 개당 12.50달러입니다. 입력 토큰이 272K를 초과하는 요청에는 현재 가격 정책에 따라 더 높은 장문 컨텍스트 요율이 적용됩니다.
Astra는 ARC-AGI-3, AutomationBench, Terminal-Bench Science 및 최신 사이버보안 작업을 포함한 여러 공개 에이전트 및 환경 상호작용 평가에서 훨씬 강력한 성능을 보입니다. Sol은 가격이 훨씬 저렴하며 Astra 수준의 작업 실행이 필요하지 않은 일반적인 전문 추론과 코딩에 여전히 적합합니다.
두 모델 모두 복잡하고 장시간 실행되는 작업을 위해 설계된 최첨단 모델입니다. Astra는 현재 OpenAI의 컴퓨터 사용, 자동화, 과학, CAD 및 사이버보안 비교에서 특히 강력한 결과를 보입니다. Claude Fable 5.1은 코딩과 지식 업무에서 매우 강력하며, 지수 버전과 추론 설정에 따라 최근 Artificial Analysis 종합 평가에서 선두를 차지하기도 했습니다.
OpenAI는 최대 128,000개의 출력 토큰을 지원하는 1,050,000토큰 컨텍스트 윈도를 문서화하고 있습니다. 매우 긴 요청은 비용이 더 높으며, 개발자는 장시간 실행되는 에이전트 워크플로에서 컨텍스트 압축과 외부의 지속 가능한 상태 저장소를 함께 사용해야 합니다.
더 어려운 다단계 작업에서 높은 완료율이 프리미엄 가격을 정당화할 수 있다면 Astra를 선택하세요. 일반적인 정보 추출, 고객지원, 카피라이팅, 단순 RAG 또는 대량의 저위험 작업에는 일반적으로 더 저렴한 모델이 더 나은 시작점입니다.
GPT-6 Astra는 에이전트 워크플로에서 의미 있는 진전을 보여주지만, 가장 정확한 설명은 “OpenAI가 전체 에이전트 하네스를 모델 안에 넣었다”는 표현이 아닙니다. Astra는 장시간의 다단계 실행에 더 적합하도록 학습되었으며, Codex, ChatGPT Work, Responses API 및 맞춤형 애플리케이션은 여전히 주변의 오케스트레이션, 도구, 권한 및 환경을 제공합니다.
공개된 평가에서 가장 큰 개선은 상호작용형 추론, 컴퓨터 사용, 전문 자동화, 과학 워크플로, CAD 및 사이버보안 평가에서 나타납니다. 광범위한 종합 지능 지표에서는 다른 최첨단 모델과의 차이가 훨씬 작을 수 있으므로, 일상적인 작업에서 Astra가 저렴한 모델을 자동으로 대체해야 하는 것은 아닙니다.
개발자에게 전략적 변화는 분명합니다. 모델 선택은 단순히 채팅창 안에서 답변을 잘하는가가 아니라 시스템 내부에서 작업을 성공적으로 완료하는가를 중심으로 이루어지고 있습니다.
GPT-6 Astra가 가장 중요한 순간은 “AI가 무엇을 말해야 하는가?”가 아니라 “AI가 작업을 처음부터 끝까지 안전하게 수행할 수 있는가?”라는 문제가 주어졌을 때입니다.
한 문장에서 시작해 몇 분 안에 완전한 웹사이트를 받아보세요.