OpenAI는 GPT-5.6 시리즈 공식 출시 후 한 달도 채 지나지 않아 가격 정책을 조정했습니다. 2026년 7월 30일부터: - GPT-5.6 Luna 80% 인하 - GPT-5.6 Terra 20% 인하

OpenAI는 GPT-5.6 시리즈를 공식 출시한 지 한 달도 채 되지 않아 가격 체계를 조정했습니다.
2026년 7월 30일부터:
이번 업데이트는 단순한 일시 할인에 그치지 않습니다. OpenAI는 가격 인하가 모델 자체, 추론 아키텍처, 라우팅 시스템, 컨텍스트 관리, 그리고 모델과 도구를 연결하는 에이전트 소프트웨어 등 다양한 측면의 개선을 반영한 것이라고 밝혔습니다.
실질적인 결과는 프로덕션 환경에서 선택의 폭이 더 넓어졌다는 것입니다.
Luna는 이제 높은 동시성과 비용 민감성이 중요한 에이전트 워크플로우에 적합한 가격으로 책정되었습니다. Terra는 일상 업무에서 더 높은 지능이 필요할 때 균형 잡힌 선택지로 남아 있습니다. Sol은 가장 까다로운 작업을 계속 지원하며, Fast mode는 대기 시간이 토큰 프리미엄보다 더 중요할 때 더 낮은 지연 시간 옵션을 제공합니다.
GPT-5.6이 7월 9일에 출시되었을 때 OpenAI가 발표한 Standard 단기 컨텍스트 API 가격은 다음과 같습니다:
| 모델 | 기존 입력 가격 | 기존 출력 가격 |
|---|---|---|
| GPT-5.6 Sol | $5.00 / 백만 토큰 | $30.00 / 백만 토큰 |
| GPT-5.6 Terra | $2.50 / 백만 토큰 | $15.00 / 백만 토큰 |
| GPT-5.6 Luna | $1.00 / 백만 토큰 | $6.00 / 백만 토큰 |
7월 30일 업데이트로 Terra와 Luna의 가격이 조정되었습니다:
| 모델 | 신규 입력 가격 | 신규 출력 가격 | 변동 폭 |
|---|---|---|---|
| GPT-5.6 Sol | $5.00 / 백만 토큰 | $30.00 / 백만 토큰 | 변동 없음 |
| GPT-5.6 Terra | $2.00 / 백만 토큰 | $12.00 / 백만 토큰 | 20% 인하 |
| GPT-5.6 Luna | $0.20 / 백만 토큰 | $1.20 / 백만 토큰 | 80% 인하 |
Luna의 가격은 이제 최초 출시 가격의 5분의 1로 인하되었습니다.
Terra의 새 가격은 기존 가격의 5분의 4입니다.
Sol은 Standard 처리에서는 변동이 없지만, Fast mode는 이제 개발자에게 Standard 토큰 가격의 2배로 최대 2.5배 빠른 응답 속도를 얻을 수 있는 선택지를 제공합니다.
표면적인 입력 및 출력 가격만으로는 전체 과금 구조를 확인할 수 없습니다.
GPT-5.6은 캐시된 입력 할인과 명시적 캐시 쓰기를 지원합니다. 272,000개 이상의 입력 토큰을 사용하는 요청은 전체 요청에 대해 장기 컨텍스트 가격이 적용됩니다.
다음 요금은 백만 토큰 기준입니다:
| 모델 | 입력 | 캐시 입력 | 캐시 쓰기 | 출력 |
|---|---|---|---|---|
| GPT-5.6 Sol | $5.00 | $0.50 | $6.25 | $30.00 |
| GPT-5.6 Terra | $2.00 | $0.20 | $2.50 | $12.00 |
| GPT-5.6 Luna | $0.20 | $0.02 | $0.25 | $1.20 |
캐시 읽기는 일반 캐시되지 않은 입력 대비 90% 할인됩니다.
캐시 쓰기는 캐시되지 않은 입력 가격의 1.25배로 과금됩니다.
272,000개 이상의 입력 토큰을 포함하는 프롬프트의 경우 OpenAI는 현재 전체 요청에 대해 다음 요금을 부과합니다:
| 모델 | 입력 | 캐시 입력 | 캐시 쓰기 | 출력 |
|---|---|---|---|---|
| GPT-5.6 Sol | $10.00 | $1.00 | $12.50 | $45.00 |
| GPT-5.6 Terra | $4.00 | $0.40 | $5.00 | $18.00 |
| GPT-5.6 Luna | $0.40 | $0.04 | $0.50 | $1.80 |
장기 컨텍스트 규칙은
비용 추정 시 토큰 수와 함께 요청이 272,000 토큰 기준선을 넘는지 여부를 함께 고려해야 함을 의미합니다.
단일 초대형 프롬프트는 처음 272,000개 토큰을 단기 컨텍스트 요율로 계산하고 나머지를 더 높은 요율로 계산하는 방식으로 처리되지 않습니다. 장기 컨텍스트 배율은 전체 요청에 적용됩니다.
OpenAI의 핵심 주장은 효율적인 AI 배포는 모델 이름이 아닌 결과에서 시작한다는 것입니다.
동일한 워크플로우의 서로 다른 단계는 서로 다른 수준의 지능, 속도, 신뢰성을 요구할 수 있습니다.
작업의 이상적인 모델은 다음에 따라 달라집니다:
GPT-5.6 Luna는 비용 민감성과 대량 처리 작업을 위해 설계되었습니다.
현재 API 모델 페이지에서는 초기 GPT-5 시리즈에서 사용된 nano 계층에 대략적으로 해당한다고 설명합니다.
Luna는 다음 시나리오에서 실용적인 선택입니다:
OpenAI는 Luna가 약 1년 전 최첨단 모델로 간주되었던 성능을 작업당 약 6센트의 비용과 약 9배 빠른 속도로 제공할 수 있다고 추정합니다.
이 비교는 OpenAI의 평가 및 비용 방법론을 기반으로 합니다. 팀은 자체 워크로드로 검증해야 합니다.
GPT-5.6 Terra는 이 시리즈에서 균형 잡힌 구성원입니다.
OpenAI는 이를 초기 GPT-5 시대의 mini 모델 위치에 두지만, 더 강력한 에이전트 및 전문 작업 능력을 갖추고 있습니다.
Terra는 다음 작업에 적합합니다:
GPT-5.6 Sol은 복잡한 전문 작업을 위한 플래그십 모델입니다.
모델이 다음 조건을 충족해야 할 때 최선의 선택입니다:
gpt-5.6 API 별칭은 gpt-5.6-sol로 라우팅됩니다.
이번 가격 업데이트로 혼합 모델 워크플로우가 더욱 실용적이 되었습니다.
코딩 에이전트는 모든 토큰과 모든 도구 호출에 Sol을 사용할 필요가 없습니다.
가능한 아키텍처 중 하나는 다음과 같습니다:
이는 매우 중요합니다.
동일한 패턴은 소프트웨어 엔지니어링 외부에도 적용될 수 있습니다.
문서 처리 시스템은 추출에 Luna를, 종합에 Terra를 사용하고, 자료가 모호하거나 영향이 큰 경우에만 Sol을 사용할 수 있습니다.
올바른 라우팅 전략은 가정이 아닌 평가를 통해 결정되어야 합니다.
OpenAI가 공유한 고객 성과
OpenAI의 발표에는 여러 실제 사용자들의 초기 고객 피드백이 포함되어 있습니다.
이러한 사례는 기업과 고객이 자체적으로 보고한 내용으로, 독립적인 벤치마크 테스트 결과는 아닙니다.
| 기업 | 보고된 사용 현황 또는 결과 |
|---|---|
| Replit | Luna는 이전에는 비현실적이었던 사용 시나리오를 탐색할 수 있을 정도로 비용 효율적으로 만들었습니다 |
| Notion | Terra는 내부 평가에서 GPT-5.5에 필적하는 품질을 절반의 작업 비용과 60% 단축된 시간으로 달성했습니다 |
| Ramp | Terra와 Luna는 비용 효율성 측면에서 내부 코딩 평가를 선도했습니다. Luna는 백오피스 자동화 작업의 기본 선택이 되었습니다 |
| Blitzy | Luna는 프롬프트 캐시 재사용률을 24%에서 90%로 높여 이전 기본 솔루션 대비 비용을 크게 절감했습니다 |
| Cognition | Luna는 Devin Fusion에서 대형 모델과 함께 사용되는 저비용 코딩 파트너 역할을 합니다 |
| Dust | 유사한 에이전트 작업에서 Luna는 이전 기본 솔루션보다 40% 빠르고 40% 저렴한 것으로 보고되었습니다 |
이러한 사례는 토큰 단위 과금이 유일하게 유용한 측정 기준이 아님을 보여줍니다.
더 저렴한 모델은 또한 다음을 변화시킬 수 있습니다:
더 의미 있는 지표는 일반적으로 성공적인 결과당 비용입니다.
OpenAI는 성능 대비 가격 개선을 세 가지 상호 연결된 차원으로 설명합니다.
GPT-5.6 시리즈 모델은 작업을 더 직접적으로 완료하도록 설계되었습니다.
더 적은 출력 토큰, 더 적은 재시도 또는 더 적은 추론 루프가 필요한 모델은 표시 가격이 동일하더라도 총 작업 비용을 낮출 수 있습니다.
프로덕션 스택은 모델이 하드웨어를 사용하는 효율성을 결정합니다.
OpenAI는 최적화된 서비스 소프트웨어가 토큰을 더 효율적으로 생성하고 컴퓨팅 리소스의 생산성을 유지할 수 있다고 밝혔습니다.
프레임워크는 모델을 둘러싼 소프트웨어로, 도구, 컨텍스트, 라우팅, 상태 및 워크플로우 제어를 제공합니다.
OpenAI는 더 나은 컨텍스트 관리를 통해 에이전트가 이미 완료된 작업을 반복하지 않도록 도울 수 있다고 밝혔습니다.
이를 통해 다음을 줄일 수 있습니다:
이 세 가지 차원은 서로 영향을 미칩니다.
더 강력한 모델은 서비스 스택에서 최적화 여지를 찾을 수 있습니다. 이러한 최적화는 비용을 낮추어 더 대규모의 에이전트 사용을 경제적으로 만듭니다. 더 많은 사용량은 다시 시스템을 개선할 더 많은 기회를 창출합니다.
발표에서 가장 주목할 만한 주장 중 하나는 GPT-5.6 Sol이 OpenAI의 내부 효율성 작업에 기여했다는 것입니다.
인간이 주도하는 엔지니어링 프로세스에서 OpenAI는 Sol이 다음을 수행했다고 밝혔습니다:
OpenAI는 커널 최적화를 통해 모델의 엔드투엔드 서비스 비용이 약 20% 절감되었다고 보고했습니다.
또한 이러한 실험을 통해 토큰 생성 효율이 15% 이상 향상되었다고 밝혔습니다.
이는 OpenAI의 내부 결과이며, 공개 벤치마크 테스트를 통해 독립적으로 재현된 것은 아직 없습니다.
더 중요한 관점은 모델이 점차 자체 운영 인프라를 개선하는 프로세스의 일부가 되고 있다는 것입니다.
이는 더 긴밀한 엔지니어링 피드백 루프를 형성합니다:
더 강력한 모델
→ 더 나은 인프라 최적화
→ 더 낮은 서비스 비용
→ 더 광범위한 적용
→ 더 많은 피드백과 투자
→ 더 강력한 차세대 모델
더 낮은 가격 책정이 OpenAI가 필요한 총 컴퓨팅 자원을 줄인다는 의미는 아닙니다.
회사는 충분한 지능을 달성하려면 두 가지가 모두 필요하다고 보고 있습니다:
전자는 총 용량을 확장합니다.
후자는 하드웨어 단위당 완료되는 유효 작업량을 향상시킵니다.
아이디어를 한 문장으로 입력하면 We0 AI가 쇼케이스 사이트, 페이지, CMS를 생성하고 출시 후 고객과 트래픽 확보를 돕습니다.
무료 등록을 위한 하나의 완전한 프로젝트 생성
하나의 완전한 생성 흐름을 시도하고 첫 번째 프로젝트 초안을 빠르게 보는 데 가장 적합합니다.
OpenAI는 다양한 인프라 포트폴리오를 구축하고 있으며, 워크로드를 가장 적합한 시스템에 매칭하고 있다고 밝혔습니다.
이는 동시에 GPT-5.6 시리즈의 양쪽 끝을 지원합니다:
규모에 맞춰 실행하기 더 쉬운 워크로드의 예는 다음과 같습니다:
한편, 더 빠른 답변의 가치가 추가 비용을 충당할 만할 때, 복잡한 Sol 요청은 Fast 모드를 사용할 수 있습니다.
Fast 모드는 OpenAI의 우선 처리 서비스 계층에 대한 새로운 명칭입니다.
다음 방식을 사용하는 기존 API 요청:
"service_tier": "priority"
은(는) 여전히 호환됩니다.
개발자는 또한 다음을 사용할 수 있습니다:
"service_tier": "fast"
GPT-5.6 Sol의 경우, OpenAI는 Fast 모드가 동일한 모델 지능을 유지하면서 표준 처리보다 최대 2.5배 빠른 속도를 제공한다고 밝혔습니다.
대가는 가격입니다.
현재 GPT-5.6 Sol의 Fast 모드 요금은 표준 API 토큰 가격의 2배입니다.
캐시된 입력 할인은 여전히 적용됩니다.
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-5.6-sol",
input="이 마이그레이션 계획을 검토하고 위험도가 가장 높은 가정 세 가지를 식별해 주세요.",
service_tier="fast",
)
print(response.output_text)
Fast 모드는 Responses API와 Chat Completions API를 통해 지원되는 모델에서 사용할 수 있습니다.
GPT-5.6 및 이전 모델의 경우, 요청이 새로운 fast 이름을 사용하더라도 응답 객체는 서비스 계층을 priority로 보고할 수 있습니다.
Fast 모드는 모든 Sol 요청에 자동으로 최적의 설정은 아닙니다.
지연 시간이 결과의 가치에 직접적인 영향을 미칠 때 가장 유용합니다.
예를 들면:
지연 시간에 민감한 비즈니스 트래픽.
다음과 같은 시나리오에서는 표준 처리가 더 경제적일 수 있습니다:
하위 단계의 완료가 창출하는 가치가 비용을 초과할 때만 두 배의 토큰 프리미엄이 의미가 있습니다.
새로운 표시 가격으로 Luna와 Terra가 더 저렴해졌지만, 프롬프트 캐싱은 장기 실행 에이전트에게도 큰 영향을 미칠 수 있습니다.
에이전트 루프의 각 라운드는 다음을 다시 전송할 수 있습니다:
캐시가 없으면 애플리케이션은 동일한 프리픽스에 대해 반복적으로 비용을 지불할 수 있습니다.
GPT-5.6은 자동 캐싱과 명시적 캐시 중단점을 모두 지원합니다.
OpenAI의 현재 과금 방식은 다음과 같습니다:
캐시 쓰기는 일반 입력보다 비싸지만, 이후의 읽기는 대폭 할인됩니다.
동일한 안정적인 프리픽스가 더 높은 쓰기 비용을 상쇄할 만큼 충분히 반복 재사용될 때 캐싱이 가장 유용합니다.
애플리케이션은 다음을 추적해야 합니다:
현재
API 모델 페이지에는 여러 공통 사양이 나열되어 있습니다:
| 사양 | Sol | Terra | Luna |
|---|---|---|---|
| 컨텍스트 창 | 1,050,000 토큰 | 1,050,000 토큰 | 1,050,000 토큰 |
| 최대 출력 | 128,000 토큰 | 128,000 토큰 | 128,000 토큰 |
| 지식 마감일 | 2026년 2월 16일 | 2026년 2월 16일 | 2026년 2월 16일 |
| 텍스트 입력/출력 | 지원 | 지원 | 지원 |
| 이미지 입력 | 지원 | 지원 | 지원 |
| 추론 토큰 | 지원 | 지원 | 지원 |
| 함수 호출 | 지원 | 지원 | 지원 |
| 구조화된 출력 | 지원 | 지원 | 지원 |
| 파인튜닝 | 미지원 | 미지원 | 미지원 |
이 세 모델은 모두 Responses API를 통해 사용할 수 있습니다.
모델 페이지에는 광범위한 도구 지원도 나열되어 있지만, 특정 기능의 사용 가능 여부는 엔드포인트, 계정, 제품 및 출시 단계에 따라 다를 수 있습니다.
OpenAI는 GPT-5.6 Terra와 Luna가 다음 플랫폼에서 계속 사용 가능하다고 밝혔습니다:
가격 공지에 설명된 현재 액세스 권한은 다음과 같습니다:
| 요금제 그룹 | ChatGPT Work 및 Codex에서의 GPT-5.6 액세스 권한 |
|---|---|
| 무료 및 Go | Terra |
| Plus, Pro, Business, Enterprise | Terra 및 Luna |
Sol은 ChatGPT, ChatGPT Work, Codex 및 API에서 자체 액세스 규칙을 가지고 있습니다.
7월 30일 업데이트는 ChatGPT 또는 Codex의 구독 가격을 인하하지 않았습니다.
또한 명시된 할당량 예산도 인상하지 않았습니다.
대신 Luna와 Terra는 기본 사용 비용이 낮아져 이제 더 적은 크레딧을 소비합니다.
OpenAI는 또한 가격 업데이트가 공지 당일 AWS를 통해 출시되기 시작할 것이라고 밝혔습니다. 제3자 플랫폼을 통해 제공되는 모델 가격은 OpenAI API 직접 가격과 다를 수 있습니다.
올바른 GPT-5.6 모델 선택하기
실용적인 선택 프로세스는 5단계를 따를 수 있습니다.
무엇이 성공으로 간주되는지 적어보세요.
"프로그래밍" 또는 "연구"와 같은 광범위한 라벨만으로 모델을 선택하지 마세요.
저위험 분류 작업과 프로덕션 환경 데이터베이스 마이그레이션은 동일한 의사 결정 규칙을 사용해서는 안 됩니다.
어려운 작업의 경우 먼저 Sol을 테스트하여 사용 가능한 최고 품질 수준을 파악하세요.
비용이 더 낮은 모델이真正로 중요한 품질을 유지하는지 측정하세요.
다음을 추적하세요:
가장 저렴한 입력 토큰 가격만 최적화하지 마세요.
GPT-5.6 Luna의 이제 표준 단기 컨텍스트 입력 토큰 가격은 백만 개당 0.20달러, 캐시된 입력 토큰 가격은 백만 개당 0.02달러, 출력 토큰 가격은 백만 개당 1.20달러입니다. 캐시 쓰기 가격은 백만 토큰당 0.25달러입니다.
GPT-5.6 Terra의 이제 표준 단기 컨텍스트 입력 토큰 가격은 백만 개당 2.00달러, 캐시된 입력 토큰 가격은 백만 개당 0.20달러, 출력 토큰 가격은 백만 개당 12.00달러입니다. 캐시 쓰기 가격은 백만 토큰당 2.50달러입니다.
표준 토큰 가격에는 변화가 없습니다. Sol은 여전히 단기 컨텍스트 입력 토큰이 백만 개당 5달러, 출력 토큰이 백만 개당 30달러이며, Fast 모드는 표준 가격보다 2배 높은 2.5배 처리 속도를 제공합니다.
OpenAI는 2026년 7월 30일에 Priority Processing의 이름을 Fast 모드로 변경했습니다. service_tier: "priority"를 사용하는 기존 요청은 여전히 호환되며, 새 요청은 service_tier: "fast"를 사용할 수 있습니다.
현재 모델 페이지에 따르면 272,000개 이상의 입력 토큰을 포함하는 프롬프트는 전체 요청에 대해 더 높은 입력 및 출력 요금이 적용됩니다. 개발자는 초대형 프롬프트 비용을 추정할 때 이 임계값을 고려해야 합니다.
OpenAI는 Luna를 비용에 민감한 높은 처리량 작업을 위한 모델로 포지셔닝합니다. Luna가 충분한 품질을 제공하지 못할 때 Terra는 균형 잡힌 선택이며, Sol은 가장 어려운 전문 작업을 위한 모델입니다.
아니요. OpenAI는 구독 가격과 할당량 예산이 변경되지 않았다고 밝혔습니다. Terra와 Luna는 이제 지원되는 유료 제품 워크플로에서 더 적은 포인트를 소비합니다.
직접 OpenAI API 가격은 7월 30일에 변경되었습니다. OpenAI는 AWS 가격이 당일 늦게 출시되기 시작할 것이라고 밝혔지만, 제3자 플랫폼의 가격과 사용 가능 여부는 다를 수 있으므로 사용자는 제공업체의 현재 요금표를 확인해야 합니다.
전체 OpenAI API 가격: 현재 표준, 배치, 빠른, 캐시 입력, 캐시 쓰기 및 장기 컨텍스트 토큰 요금.
빠른 모드 문서: 이름이 변경된 서비스 계층의 공식 설정 지침, 호환성 세부 정보 및 사용 가이드.
[GPT-5.6 모델 가이드](https://developers.openai.
최신 모델 가이드: 공식 모델 선택, 마이그레이션, 추론, 캐싱 및 워크플로 권장 사항.
GPT-5.6 출시 발표: 원본 모델 시리즈 출시, 모델 역량, 초기 가격, 가용성 및 벤치마크.
GPT-5.6 효율성 엔지니어링: OpenAI가 효율성 향상 뒤에 있는 모델 및 인프라 작업에 대한 설명.
프롬프트 캐싱 가이드: 자동 및 명시적 프롬프트 캐싱에 대한 공식 설명.
OpenAI API 변경 로그: 가격 업데이트, 고속 모드 출시 및 기타 API 변경 사항에 대한 날짜별 기록.
OpenAI는 7월 30일 업데이트에서 GPT-5.6 Luna의 표준 API 가격을 80% 인하했고, Terra는 20% 인하했습니다. Sol의 표준 가격은 유지되었으며, 새로운 고속 모드는 API 응답 속도를 최대 2.5배로 높이고 토큰 요율은 기존의 두 배가 되었습니다.
이번 발표는 더 넓은 가격 대비 성능 전략을 중심으로 이루어졌습니다. OpenAI는 모델, 추론 스택, 라우팅, 컨텍스트 관리 및 에이전트 프레임워크를 개선하여 성공적인 작업당 필요한 시간, 토큰 수 또는 연산량을 줄이고 있다고 밝혔습니다.
개발자에게 올바른 선택은 단순히 가장 저렴한 모델을 고르는 것이 아닙니다. Luna는 높은 처리량 실행에 적합하고, Terra는 비용과 지능 사이의 균형을 유지하며, Sol은 가장 복잡한 작업을 담당합니다. 혼합 모델 라우팅, 캐싱, 평가 및 성공당 비용 측정을 통해 얻는 절감 효과는 단순히 모델을 교체하는 것보다 훨씬 클 수 있습니다.
핵심 변화는 GPT-5.6이 이제 더 넓은 작업 범위를 제공한다는 점입니다: Luna 및 Terra 계층은 더 경제적인 일상 지능을 제공하며, 지연 시간 성능이 더 높은 비용을 정당화할 때 Sol을 통해 더 빠른 최첨단 지능을 얻을 수 있습니다.
이 Markdown 파일은 공식 기사의 독립적인 편집적 각색입니다. 주제, 사실 순서 및 실제 의미를 유지하지만 OpenAI의 표현이나 고객 인용을 축어적으로 복사하지 않습니다.
한 문장에서 시작해 몇 분 안에 완전한 웹사이트를 받아보세요.