서론
OpenAI는 현재 두 가지 측면에서 동시에 혁신을 진행하고 있다.
먼저, ChatGPT의 프런트엔드가 대대적인 최적화를 거쳤다. 이는 수백 번의 도구 호출 후에 열기 어렵고 탐색하기 어려워지는 긴 대화를 겨냥한 것이다. 출처 기사에 따르면 741라운드의 대화와 231MB 데이터가 포함된 테스트 세션의 열기 시간이 27.62초에서 1.66초로 단축되었다.
둘째, Codex는 GPT-5.6 멀티 에이전트 V2를 채택하여 보다 자동화된 멀티 에이전트 워크플로우로 전환했다. 더 이상 사용자가 각 하위 작업에 대해 최적의 모델을 수동으로 선택할 필요 없이, 메인 에이전트가 작업의 서로 다른 부분을 서로 다른 모델에 위임하고 추론 강도를 독립적으로 설정할 수 있다.
OpenAI 공식 GPT-5.6 문서는 더 넓은 아키텍처를 확인해 준다: GPT-5.6에는 Sol, Terra, Luna가 포함되어 있으며, Codex/API 경험은 병렬 하위 에이전트와 복잡한 작업의 종합 처리를 지원한다.
그 결과는 단순하지만 지대한 영향을 미치는 개념이다:
이 시스템은 사용자가 일반적으로 직접 관리해야 했던 대기 시간과 모델 선택 작업을 제거하려고 시도하고 있다.
ChatGPT의 대규모 대화 열기 속도가 크게 향상
에이전트 시대에 긴 대화는 전혀 다른 문제가 되고 있다.
일반적인 챗봇 대화는 수십 라운드를 포함할 수 있다. 반면 에이전트 세션은 모델이 코드를 읽고, 도구를 호출하고, 결과를 확인하고, 테스트를 실행하고, 수정을 수행하고, 이 과정을 수백 번 반복할 수 있기 때문에 훨씬 더 커지기 쉽다.
출처 기사에 따르면, OpenAI는 741라운드의 대화, 231MB에 달하는 세션을 테스트하여 새 프런트엔드의 동작 성능을 측정했다.
결과는 매우 놀랍다:
| 지표 | 최적화 전 | 최적화 후 |
|---|---|---|
| 대화 열기 시간 | 27.62초 | 1.66초 |
| 메모리 증가 | 1030.7 MiB | 606 MiB |
| 네트워크 요청 수 | 894 | 16 |
| 로드된 대화 항목 | 15,529 | 64 |
출처 기사에 따르면, 주요 성능 변화는 다음과 같다:
- 앱 로딩 속도 94% 향상
- 힙 메모리 증가 87.8% 감소
- 전체 메모리 사용량 41.2% 감소
- 네트워크 요청 98.2% 감소
- 로드된 대화 항목 99.6% 감소
이 중요한 변화는 표면적 개선이 아닌 아키텍처 차원의 변화다.
ChatGPT는 더 이상 사용자가 열 때마다 전체 대화 기록을 로드하고 렌더링할 필요가 없다.
대신, 대부분의 기록은 계속 저장될 수 있으며, 현재 필요한 부분만 인터페이스에 로드된다.
에이전트 시대에 이것이 더 중요한 이유
전통적인 챗봇에게 초장기 대화는 주로 저장 문제였다.
에이전트에게는 워크플로우 문제가 된다.
한 번의 코딩 세션은 다음을 포함할 수 있다:
- 대규모 코드베이스 읽기.
- 명령 실행.
- 출력 결과 확인.
- 파일 편집.
- 테스트 실행.
- 실패 수정.
- 이 루프 반복.
하나의 작업은 쉽게 수백 개의 상호작용 기록을 생성할 수 있다.
이는 대화 인터페이스 자체가 에이전트 인프라의 일부가 되었음을 의미한다.
출처 기사는 새로운 렌더링 전략을 다음과 같이 설명한다: 전체 세션을 재구성하는 대신 사용자가 볼 필요가 있는 역사 기록 부분만 로드하는 것.
이것이 1년 전에는 사소해 보였던 프런트엔드 최적화가 오늘날 엄청난 영향을 미칠 수 있는 이유다.
지금의 차이점.
결과: 장시간 세션이 훨씬 가벼워졌다
가장 분명한 이점은 단순하다.
몇 주 또는 몇 달 동안 지속된 대화는 열 때 앱이 브라우저에서 전체 데이터베이스를 재구성하고 있는 느낌을 주지 않아야 한다.
원문은 이러한 변화가 수백 번의 도구 호출을 자주 실행하는 헤비 Codex 사용자에게 특히 두드러진다고 지적한다.
사용자는 거대한 세션이 상호작용 가능해질 때까지 기다릴 필요 없이 빠르게 대화로 돌아가 작업을 계속할 수 있다.
이는 인프라 차원의 개선으로, 제대로 작동할 때 사용자가 거의 알아차리지 못할 수도 있다.
이것이 바로 핵심이다.
최고의 프런트엔드 최적화는 종종 제품 경험에 녹아들어 사용자가 인식하지 못하는 최적화다.
GPT-5.6 멀티 에이전트 V2, 자동 모델 선택으로 전환
거의 동시에, OpenAI는 멀티 에이전트 워크플로우도 확장했다.
원문은 GPT-5.6 멀티 에이전트 V2가 완전히 사용 가능해졌으며, 메인 에이전트가 하위 작업을 서로 다른 지원 모델에 위임할 수 있다고 보도했다.
각 하위 에이전트는 자체 추론 강도를 가질 수 있다.
OpenAI 공식 GPT-5.6 문서는 이 시리즈가 세 가지 능력 계층을 포함한다고 독립적으로 확인한다:
- GPT-5.6 Sol — 가장 어려운 작업을 위한 최상위 모델.
- GPT-5.6 Terra — 일상 업무에 적합한 균형 잡힌 모델.
- GPT-5.6 Luna — 가장 빠르고 비용 효율적인 모델.
OpenAI는 또한 멀티 에이전트를 Responses API의 테스트 기능으로 기록하고 있으며, 하나의 GPT-5.6 인스턴스가 여러 하위 에이전트를 병렬로 조정하고 그 결과를 종합할 수 있다.
이것이 새 워크플로우의 핵심 개념이다.
사용자는 대규모 작업의 모든 작은 부분에 어떤 모델이 가장 적합한지 반드시 알 필요는 없다.
에이전트가 스스로 결정할 수 있다.
모델 라인업, 다양한 작업을 위해 설계
원문은 대략 다음과 같이 모델 라인업을 보여준다:
| 모델 | 일반적인 역할 |
|---|---|
| GPT-5.6 Sol | 복잡한 에이전트 코딩 및 가장 어려운 추론 작업 |
| GPT-5.6 Terra | 일상적인 프로그래밍 및 균형 잡힌 워크로드 |
| GPT-5.6 Luna | 빠르고 저렴한 하위 작업 |
| Daybreak | 사이버 보안 중점 작업 |
| GPT-5.5 | 복잡한 코딩, 연구 및 일반 작업 |
OpenAI 공식 공개 문서는 처음 세 개의 GPT-5.6 계층을 확인하고 서로 다른 성능 및 비용 특성을 강조한다.
예를 들어, OpenAI는 현재 Luna를 비용에 민감하고 높은 처리량의 워크로드를 위해 최적화된 모델로 설명하며, 현재 모델 페이지에 공개된 API 가격은 입력 백만 토큰당 1달러, 출력 백만 토큰당 6달러다.
이것은 자연스러운 작업 분담을 형성한다.
어려운 아키텍처 결정은 더 강력한 모델에 맡길 수 있다.
일반적인 코드 변환은 더 저렴한 모델에 맡길 수 있다.
소규모 분류 또는 조회 단계는 가장 빠른 옵션을 사용할 수 있다.
수동 모델 선택에서 자동 라우팅으로
원문은 이를 수동 모델 선택에서의 전환으로 설명한다.
오늘날 사용자는 종종 다음과 같이 생각한다:
"이 부분은 어려우니까 가장 강력한 모델을 사용해야겠다."
그런 다음 작업의 다음 부분에서도 동일한 결정을 반복한다.
반면 멀티 에이전트 시스템은 모델을 내부 컴퓨팅 리소스로 간주할 수 있다.
메인 에이전트는 작업을 더 작은 단위로 분해하고, 각 단위가 어떤 모델이 처리할지 결정한 다음 결과를 병합한다.
간소화된 워크플로우는 다음과 같다:
사용자 작업
↓
메인 에이전트
├── 복잡한 계획 → GPT-5.6 Sol
├── 일반적인 코딩 → GPT-5.6 Terra
├── 빠른 하위 작업 → GPT-5.6 Luna
└── 전문 작업 → 전용 모델
↓
결과 합성
↓
최종 응답
OpenAI 공식 문서는 이 병렬 하위 에이전트 패턴을 명확히 설명한다: 하나의 GPT-5.6 인스턴스가 병렬로 작업하는 여러 에이전트를 조정하고 출력을 단일 결과로 종합할 수 있다.
이것이 추론 비용을 낮출 수 있는 이유
출처 기사는 간단한 경제학적 관찰을 제시한다.
몇 분 만에 쇼케이스 사이트를 만들고 리드를 늘리세요
아이디어를 한 문장으로 입력하면 We0 AI가 쇼케이스 사이트, 페이지, CMS를 생성하고 출시 후 고객과 트래픽 확보를 돕습니다.
무료 등록을 위한 하나의 완전한 프로젝트 생성
하나의 완전한 생성 흐름을 시도하고 첫 번째 프로젝트 초안을 빠르게 보는 데 가장 적합합니다.
복잡한 작업이 모든 단계에서 가장 강력한 모델을 필요로 하는 것은 아니다.
아마도 계획, 아키텍처 또는 어려운 디버깅 단계만 가장 강력한 모델이 필요할 수 있다.
다른 단계는 더 저렴한 모델이 처리할 수 있다.
출처 기사의 예에서, 워크플로우의 약 20%만 가장 강력한 모델이 필요하고 나머지는 저비용 모델에 위임될 수 있다.
이 정확한 20%는 OpenAI의 보장이 아닌 경험 법칙의 설명으로 간주되어야 한다.
그 뒤에 있는 핵심 아이디어는 여전히 중요하다.
에이전트가 난이도에 따라 작업을 자동으로 라우팅할 수 있다면, 복잡한 작업의 평균 완료 비용은 사용자가 라우팅을 수동으로 세밀하게 관리할 필요 없이 낮아질 수 있다.
개발자는 더 이상 모든 모델을 고민할 필요가 없다
이것이 가져오는 사용자 경험 변화는 경제적 측면의 변화만큼 중요하다.
수동 모델 선택은 인지 부담이다.
개발자는 다음과 같이 물어야 한다:
- 어떤 모델을 사용해야 할까?
- 이 작업이 비싼 모델을 사용할 가치가 있을까?
- 과정 중간에 모델을 전환해야 할까?
- 더 저렴한 모델이 너무 많은 품질을 잃지는 않을까?
- 절약된 시간이 추가 비용만큼 가치가 있을까?
좋은 멀티 에이전트 시스템에서는 이러한 질문의 대부분이 시스템 자체로 이전된다.
사용자는 목표를 제공한다.
에이전트는 작업을 어떻게 분배할지 결정한다.
이것은 모델 선택에서 리소스 오케스트레이션으로의 의미 있는 전환이다.
두 가지의 결합은 단순 기능의 합보다 크다
원문에서 가장 설득력 있는 논점은 이 두 가지 변화가 서로를 강화한다는 것이다.
프런트엔드는 방대한 에이전트 기록을 더 효율적으로 처리하도록 최적화되었다.
한편, 백엔드 에이전트 시스템은 모델 간 작업 분할에 있어 훨씬 더 뛰어난 역량을 갖추게 되었다.
이는 OpenAI가 마찰을 줄이는 두 가지 방법을 제공한다:
대기 화면의 초를 줄이는 것.
어떤 모델을 사용할지 선택하는 결정을 줄이는 것.
첫 번째는 성능 개선이다.
두 번째는 워크플로우 개선이다.
두 가지가 결합되어 ChatGPT와 Codex는 단순 채팅 인터페이스라는 위치에서 더욱 멀어지고 있다.
ChatGPT는 워크플로우 플랫폼으로 나아가고 있다
OpenAI 공식 GPT-5.6 발표에서는 이미 이 시리즈가 도구를 조정하고, 중간 결과를 처리하며, 멀티 에이전트 워크플로우를 지원할 수 있다고 설명한다. 또한 Codex에서 작업을 다른 모델에 위임하고, 작업을 병렬로 실행하며, 각각의 결과를 종합하는 기능도 도입되었다.
사용자는 점점 더 목표를 정의하고 결과를 검토하는 사람이 되고 있다.
내부 오케스트레이션은 무대 뒤에서 이루어진다.
"모델을 선택하지 않는" 철학이 진정한 제품 혁신이다
벤치마크 수치에 집중하기 쉽다.
하지만 더 중요한 제품 결정은 사용자에게 모델의 복잡성을 숨기려는 시도일 수 있다.
모델 수가 증가함에 따라 모든 선택지를 직접 노출하는 것은 오히려 시스템을 사용하기 어렵게 만들 수 있다.
OpenAI에 5~10개의 전문화된 모델이 있다면, 사용자가 하나의 프로젝트를 완료하기 위해 그것들을 모두 이해할 필요는 없어야 한다.
성숙한 에이전트 플랫폼은 이를 당연히 이해해야 한다:
작업이 인터페이스이며, 모델이 아니다.
사용자는 무엇을 해야 하는지 말한다.
시스템은 얼마나 많은 추론이 필요한지, 어떤 모델이 어떤 부분을 담당해야 하는지, 그리고 결과를 어떻게 결합할지 결정한다.
이것이 개발자에게 의미하는 바
AI 제품을 구축하는 개발자에게 이 교훈은 OpenAI 자체보다 더 보편적이다.
현대 에이전트 아키텍처는 점점 더 세 가지 계층을 필요로 한다:
- 작업 분해 — 대규모 작업을 의미 있는 하위 작업으로 나눈다.
- 모델 라우팅 — 각 하위 작업에 가장 저렴하면서도 적합한 모델을 선택한다.
- 결과 종합 — 부분 출력을 하나의 일관된 결과로 병합한다.
이를 바탕으로 프런트엔드는 전통적인 채팅 제품 디자인이 목표로 했던 것보다 더 큰 대화 기록을 처리해야 한다.
에이전트 제품을 구축하고 있다면, 대화 렌더링은 더 이상 단순한 UI 폴리싱이 아니다.
그것은 인프라스트럭처다.
자주 묻는 질문
GPT-5.6 멀티 에이전트란 무엇인가?
GPT-5.6 멀티 에이전트는 하나의 GPT-5.6 인스턴스가 여러 하위 에이전트를 병렬로 조정하고 그들의 작업을 종합할 수 있는 에이전트 오케스트레이션 기능이다. OpenAI는 현재 이 기능을 Responses API의 테스트 기능으로 문서화하고 있다.
Codex의 Multi-agent V2란 무엇인가?
원문은 Multi-agent V2를 주 에이전트가 지원되는 모델에 서로 다른 하위 작업을 위임하고 각 하위 에이전트의 추론 강도를 제어할 수 있는 Codex 워크플로우로 설명한다. 구체적인 출시 시기와 모델 가용성은 변경될 수 있으므로 최신 구성은 현재 OpenAI Codex 문서를 확인해야 한다.
GPT-5.6 Sol, Terra, Luna란 무엇인가?
이들은 GPT-5.6 시리즈의 세 가지 역량 계층이다. OpenAI는 Sol을 플래그십 모델로, Terra를 균형 잡힌 옵션으로, Luna를 가장 빠르고 비용 효율적인 모델로 설명한다.
GPT-5.6 Luna는 어떤 용도로 사용되는가?
OpenAI는 GPT-5.6 Luna를 비용에 민감하고 높은 처리량이 필요한 워크로드에 적합하다고 설명한다. 현재 API 페이지에는 입력 토큰 100만 개당 1달러, 출력 토큰 100만 개당 6달러로 표시되어 있다.
ChatGPT의 긴 대화 성능이 개선된 이유는 무엇인가?
에이전트 세션은 수백 건의 도구 호출, 실행 결과, 중간 단계를 포함할 수 있기 때문에 일반 채팅보다 훨씬 클 수 있다. 원문은 OpenAI가 대규모 기록의 로딩 및 렌더링 방식을 변경하여 앱이 매번 전체 대화를 처리할 필요가 없게 했다고 보도한다.
ChatGPT는 이제 모든 작업에 대해 자동으로 최적의 모델을 선택하는가?
더 넓은 추세는 자동 모델 라우팅과 위임으로 향하고 있지만, 가용성은 제품 및 모델 출시 진행 상황에 따라 달라진다.
기능 설명. OpenAI의 GPT-5.6 문서는 멀티 에이전트 오케스트레이션과 다양한 GPT-5.6 역량 계층을 확인한다. 이것이 모든 일반 ChatGPT 대화에서 완전한 자동 라우팅 제어가 노출된다는 것을 의미하지는 않는다.
멀티 에이전트 실행이 AI 비용을 절감할 수 있는가?
그렇다. 어려운 하위 작업에는 더 강력한 모델을 사용하고 일반 작업에는 더 저렴한 모델을 사용한다면, 전체 워크플로우의 평균 비용은 모든 단계에서 가장 강력한 모델을 사용하는 것보다 낮을 수 있다. 실제 절감액은 라우팅 전략과 워크로드에 따라 달라진다.
관련 도구
- OpenAI Codex: 다단계 소프트웨어 개발 및 에이전트 워크플로우를 위한 OpenAI의 프로그래밍 에이전트.
- OpenAI API: GPT-5.6 및 멀티 에이전트 애플리케이션 개발을 위한 공식 API 플랫폼.
- GPT-5.6 모델: Sol, Terra, Luna 및 관련 역량에 대한 공식 모델 문서.
- Responses API: 도구 호출, 프로그래매틱 호출 및 멀티 에이전트 워크플로우를 지원하는 OpenAI의 API 인터페이스.
- ChatGPT: OpenAI의 소비자 및 기업용 AI 작업 공간.
관련 링크
- GPT-5.6 공식 발표: 멀티 에이전트 및 슈퍼 역량을 포함한 GPT-5.6의 주요 공개 페이지.
- GPT-5.6 모델 가이드: 개발자용 공식 모델 역량 및 멀티 에이전트 사용 문서.
- GPT-5.6 Luna: 저비용 GPT-5.6 계층의 현재 API 가격 및 기술 세부 정보.
- ChatGPT의 GPT-5.6: 현재 ChatGPT 가용성 및 요금제 정보.
- OpenAI Codex: Codex 및 에이전트 프로그래밍에 대한 공식 제품 정보.
- OpenAI API 문서: OpenAI 모델로 구축하기 위한 주요 문서 허브.
요약
OpenAI의 최신 변경 사항은 AI 에이전트가 더욱 강력해짐에 따라 점점 더 중요해지는 두 가지 마찰에 대응한다. 첫 번째는 대기 시간이다: 수백 개의 대화와 도구 호출을 포함하는 대규모 대화도 빠르게 열려야 한다. 두 번째는 결정 오버헤드이다: 사용자가 모든 하위 작업에 대해 수동으로 모델을 선택해서는 안 된다.
GPT-5.6의 멀티 에이전트 아키텍처는 더 강력한 모델이 계획하고 위임하며 더 저렴한 모델이 일반 작업을 처리하는 모델 라우팅 시스템을 가리킨다. 동시에 프런트엔드 최적화는 더 길어진 에이전트 세션을 더 쉽게 사용할 수 있게 한다.
방향은 분명하다: ChatGPT와 Codex는 사용자가 모델과 대화하는 곳에서 작업이 어떻게 실행되어야 하는지를 결정하는 시스템으로 진화하고 있다.



