For AI agents: the public content index is available at https://we0.ai/llms.txt, and the English article bundle is available at https://we0.ai/llms-full.txt.
For AI agents: the complete content index is available at https://we0.ai/llms.txt, the full English article bundle is available at https://we0.ai/llms-full.txt, and this page is available as Markdown at https://we0.ai/ko/articles/claude-sonnet-5-closes-in-on-opus-5-70-6-b02eab8e.md.
Claude Sonnet 5.5는 Terminal-Bench 4.0에서 70.6%를 기록했으며, GDPval-AA와 OSWorld에서 Opus 5.5에 근접한 성능을 보였습니다. 또한 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 10달러...

Anthropic은 Claude Sonnet 5.5와 Haiku 5.5가 Opus 5.5를 "앞으로 몇 주 안에" 뒤따를 것이라고 밝혔습니다.
Sonnet 5.5는 불과 6일 후 출시되었습니다.
새로운 중간급 Claude 모델은 단순히 Opus 5.5의 축소판이 아닙니다. 일부 코딩 벤치마크에서는 실제로 더 높은 점수를 기록했습니다.
가장 눈에 띄는 사례는 Terminal-Bench 4.0입니다.
Claude Sonnet 5.5: 70.6%
Claude Opus 5.5: 66.4%
Claude Sonnet 5: 10.3%
그러나 더 광범위한 전문 업무에서는 Opus 5.5가 여전히 근소한 우위를 유지합니다.
Anthropic이 공개한 수치는 다음과 같습니다.
GDPval-AA v2.1
Opus 5.5: 1846 Elo
Sonnet 5.5: 1844 Elo
OSWorld 2.1
Opus 5.5: 81.8%
Sonnet 5.5: 80.1%

이는 Sonnet 5.5가 측정 가능한 여러 작업에서 Anthropic의 플래그십 모델에 이례적으로 근접하면서도 더 낮은 Sonnet 가격대를 유지한다는 의미입니다.
하지만 두 모델의 차이는 여전히 중요합니다.
Anthropic은 Opus 5.5가 장기간에 걸쳐 지속적인 판단을 요구하는 복잡하고 개방형인 작업에서는 여전히 명확하게 더 강력하다고 설명합니다. Sonnet 5.5는 다음과 같이 범위가 명확한 일상 업무에 더 직접적으로 초점을 맞춥니다.
따라서 유용한 결론은 Sonnet 5.5가 Opus를 "대체했다"는 것이 아닙니다.
많은 반복적이고 코딩 중심적인 워크로드에서 성능 격차가 훨씬 줄어들었다는 의미입니다.

원문은 Sonnet 5.5를 "큰 컵"을 쫓는 "중간 컵"으로 설명합니다.
이 비유는 벤치마크 표에 놀라울 정도로 잘 들어맞습니다.
| 평가 | Sonnet 5.5 | Opus 5.5 | Sonnet 5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 66.4% | 10.3% | — |
| FrontierCode 1.1 Main | 52.1% at Xhigh | 54.4% | 42.4% | 최대 52.1% |
| CursorBench 4.0 | 55.5% | 57.8% | 34.1% | — |
| GDPval-AA v2.1 | 1844 | 1846 | 1449 | 1487 |
| Humanity's Last Exam | 64.5% | 67.7% | 54.9% | — |
| OSWorld 2.1 | 80.1% | 81.8% | 57.0% | — |
| Chartography | 61.6% | 64.4% | 15.6% | 53.6% |
표는 실제 패턴을 보여줍니다.
Sonnet 5.5는 중요한 코딩 벤치마크 하나에서 확실히 승리하고 여러 다른 평가에서도 매우 근접하지만, 모든 영역에서 Opus 5.5를 앞서지는 않습니다.
Anthropic도 같은 구분을 제시합니다. 벤치마크 점수는 모델 품질을 바라보는 하나의 관점일 뿐이며, 작업이 모호하고 개방형이거나 더 긴 시간 동안 지속적인 판단을 요구할 때는 Opus가 여전히 더 강력합니다.
이번 업그레이드는 단순히 원시 점수에 관한 것이 아닙니다.
초기 테스터들은 Sonnet 5.5가 작업하는 방식도 달라졌다는 점을 확인했습니다.
Sonnet 5와 비교했을 때 이 모델은 여러 작업을 병렬로 실행할 수 있는 경우 모든 작업을 한 번에 하나씩 처리하는 대신 도구 호출을 묶어서 실행하는 경향이 더 강합니다.
Anthropic이 공개한 고객 피드백에는 Sonnet 5.5가 다음과 같은 코딩 평가 사례가 포함되어 있습니다.
도구 호출 약 1/3 감소
셸 실행 횟수 약 절반
동일한 유형의 작업을 완료하는 데 사용했습니다.
이는 에이전트 시스템에서 중요합니다. 추가 도구 호출 하나하나가 다음 요소를 더할 수 있기 때문입니다.
토큰 가격표가 바뀌지 않았더라도 더 적은 도구 상호작용으로 동일한 결과에 도달하는 모델은 실질적으로 더 저렴할 수 있습니다.
Base44는 실제 애플리케이션 구축 작업 118개를 대상으로 Sonnet 5.5를 테스트했습니다.
그 결과는 특히 실용적인 의미를 가집니다.
Sonnet 5.5는 Opus 5와 동일한 수준의 점수를 받은 앱을 생성하면서 다음과 같은 평균 반복 횟수를 기록했습니다.
Sonnet 5.5:
빌드당 평균 3.6회 반복
Opus 5:
빌드당 평균 7.7회 반복
Base44는 또한 비교 대상 모델 중 Sonnet 5.5가 실패한 도구 호출 횟수가 가장 적었다고 밝혔습니다.

이는 "모델 비용"이 단순히 다음과 같이 계산되는 것이 아니라는 점을 보여줍니다.
입력 토큰 가격
+
출력 토큰 가격
실제 에이전트 워크플로에서 총비용은 다음 요소에도 좌우됩니다.
반복 횟수
도구 호출 횟수
실패한 작업
재시도
사람의 개입
승인된 결과까지 걸린 시간
한 모델이 절반의 반복 횟수로 작업을 완료한다면 API 가격표가 제시하는 것보다 실질적인 비용 차이는 훨씬 커질 수 있습니다.
Epic Games는 훨씬 더 큰 소프트웨어 시스템에서 Sonnet 5.5를 테스트했습니다.
Anthropic이 공개한 고객 피드백에 따르면, 이 모델은 다음과 같은 작업을 수행하면서 수만 줄의 게임플레이 시스템 코드를 처리했습니다.
Epic Games는 이 모델이 일반적으로 더 높은 등급의 모델에 기대하는 품질 기준에 도달하면서도, 지시적인 프롬프트는 더 적게 필요했다고 밝혔습니다.
이는 더 작은 모델이 가치 있게 활용될 수 있는 작업 유형입니다.
개발자는 여전히 Opus 5.5를 사용해 아키텍처를 정의하거나 가장 어렵고 모호한 문제를 해결하고 싶을 수 있습니다. 그러나 Sonnet 5.5는 더 낮은 비용으로 구현과 검토 업무의 훨씬 더 많은 부분을 맡을 수 있습니다.
Unity는 더 엄격한 완료 기준을 사용했습니다.
모델이 완료했다고 말하는 것만으로 코드 패치를 승인하는 대신 Unity는 프로젝트를 다시 열고 결과가 실제 런타임에서 작동하는지 확인했습니다.
이 평가에서 Sonnet 5.5는 Unity의 다단계 에디터 및 코딩 벤치마크 작업 중 다음 비율을 완료했습니다.
90%

이런 유형의 테스트는 코드 생성 품질만 측정하는 것보다 더 많은 정보를 제공합니다.
패치가 올바르게 보이더라도 다음과 같은 이유로 실패할 수 있습니다.
Unity의 벤치마크는 텍스트 답변만이 아니라 실제 엔드투엔드 작업을 측정하려고 합니다.
Anthropic은 반복적으로 진행해 온 장기 작업 시연도 이어갔습니다.
Sonnet 5.5는 스크린샷만 사용해 작업하면서 Pokémon Red를 클리어한 Claude 제품군 최초의 Sonnet 모델이 되었습니다.
이 테스트는 코딩 벤치마크로 직접 활용하기에는 적합하지 않습니다.
이 테스트의 가치는 다른 곳에 있습니다.
게임을 진행하려면 모델이 다음을 수행해야 합니다.
이러한 특성은 컴퓨터 사용 에이전트와 장기 실행 소프트웨어 워크플로에서도 중요합니다.
원문은 Sonnet 5.5가 코드뿐 아니라 다른 영역에서도 더 뛰어난 역량을 보인다고 지적합니다.
Anthropic은 문서, 슬라이드, 스프레드시트 및 시각적 작업을 위해서도 이 모델을 포지셔닝하고 있습니다.
이 모델은 모든 결과물을 처음부터 새로 만드는 대신 기존의 시각적 규칙을 따르도록 설계되었습니다.
예를 들어 기존 슬라이드 템플릿이 주어지면 다음 요소를 동일하게 이어갈 수 있습니다.
Anthropic은 이를 통해 생성 후 수동으로 수정해야 하는 작업이 줄어든다고 설명합니다.
이는 작업의 범위는 명확하지만 시각적 일관성도 필요한 비즈니스 워크플로에서 Sonnet 5.5가 특히 유용하다는 의미입니다.
성능이 크게 향상되었음에도 Sonnet 5.5는 Sonnet 5와 동일한 기본 API 가격을 유지합니다.
Anthropic이 현재 제시하는 가격은 다음과 같습니다.
| 토큰 유형 | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| 입력 | 100만 개당 2달러 | 100만 개당 4달러 |
| 출력 | 100만 개당 10달러 | 100만 개당 20달러 |
| 캐시 읽기 | 100만 개당 0.20달러 | 100만 개당 0.20달러 |
| 캐시 쓰기 | 100만 개당 2.50달러 | 100만 개당 5달러 |

정가 기준으로 Sonnet 5.5의 표준 입력 및 출력 토큰은 Opus 5.5보다 정확히 절반 저렴합니다.
그러나 Anthropic은 이제 또 다른 지표를 더욱 강조하고 있습니다.
완료된 작업당 비용
Anthropic은 Sonnet 5.5가 Sonnet 5보다 30% 이상 빠르게 출력을 생성한다고 밝혔습니다.
또한 동일한 작업을 완료하는 데 일반적으로 더 적은 토큰과 단계가 필요하다고 설명합니다.
그 결과 Anthropic은 대부분의 워크로드에서 Sonnet 5.5가 Sonnet 5보다 다음과 같이 비용을 낮출 수 있다고 보고합니다.
작업당 최대 30% 감소
이 때문에 100만 개당 2달러와 10달러라는 토큰 요금만 보는 것은 이번 업그레이드의 일부를 놓치게 됩니다.
아이디어를 한 문장으로 입력하면 We0 AI가 쇼케이스 사이트, 페이지, CMS를 생성하고 출시 후 고객과 트래픽 확보를 돕습니다.
무료 등록을 위한 하나의 완전한 프로젝트 생성
하나의 완전한 생성 흐름을 시도하고 첫 번째 프로젝트 초안을 빠르게 보는 데 가장 적합합니다.
명목 요금은 그대로입니다.
하지만 작업을 완료하는 데 필요한 모델 작업량은 줄었습니다.
Anthropic은 이제 여러 추론 수준을 제공합니다.
더 높은 추론 수준을 선택하면 모델이 더 오래 추론하고 더 많은 결과를 검토할 수 있습니다.
더 낮은 추론 수준은 속도와 비용을 낮춥니다.
Claude Code와 Anthropic의 소비자용 앱에서는 기본 추론 수준이 중간입니다. Claude Platform에서는 기본값이 높음입니다.
Terminal-Bench 4.0에서 Anthropic의 비용 대비 성능 차트는 중간 추론 수준의 Sonnet 5.5가 이미 Sonnet 5의 최고 결과를 능가하면서 시도당 비용은 대략 10분의 1에 불과하다는 점을 보여줍니다.

중요한 결론은 중간 수준이 항상 올바른 설정이라는 것이 아닙니다.
개발자가 이제 품질과 비용을 더 직접적으로 조정할 수 있다는 점입니다.
일상적인 코딩에서는 더 낮은 추론 수준만으로도 충분할 수 있습니다.
어려운 작업에서는 추론 수준을 높여 Sonnet에 더 많은 사고 시간을 제공할 수 있습니다.
CursorBench 4.0은 실제 Cursor 세션을 기준으로 코딩 작업을 평가합니다.
Sonnet 5.5는 다음 점수를 기록했습니다.
55.5%
반면 Opus 5.5는 다음과 같습니다.
57.8%
Anthropic의 비용 차트는 비교적 낮은 추론 수준에서도 Sonnet 5.5가 작업당 비용 약 10분의 1로 Sonnet 5의 최고 점수를 넘어설 수 있음을 보여줍니다.

새로운 Sonnet이 특히 매력적으로 보이는 지점입니다.
Opus와의 절대적인 벤치마크 격차가 충분히 작기 때문에, 대량 코딩 환경에서는 더 저렴한 모델이 생산 환경에 더 적합한 선택이 될 수 있습니다.
원문은 FrontierCode 1.1에 특별한 관심을 기울입니다. 비교 대상에 GPT-6 Sol이 포함되어 있기 때문입니다.
Anthropic이 공개한 차트에 따르면 Sonnet 5.5는 Xhigh 추론 수준에서 FrontierCode 최고 점수에 도달하며, GPT-6 Sol의 여러 추론 수준도 비슷한 점수 범위에 있습니다.

높은 추론 수준에서 Sonnet 5.5는 이미 GPT-6 Sol의 더 강력한 테스트 설정과 비슷한 점수 범위에 도달하며, Anthropic은 작업당 비용이 상당히 낮다고 추정합니다.
원문은 Anthropic 차트에서 강조된 비교 지점의 격차를 대략 다음과 같이 요약합니다.
Sonnet 5.5 작업 비용:
GPT-6 Sol의 약 1/5
이 수치는 특정 벤치마크의 작업당 비용 비교로 이해해야 하며, 보편적인 API 가격 비율을 의미하지 않습니다.
두 모델은 다음과 같은 차이가 있습니다.
따라서 해당 설정에서 Sonnet 5.5가 훨씬 낮은 측정 작업 비용으로 유사한 FrontierCode 품질에 도달했다는 것이 Anthropic 벤치마크 차트의 더 안전한 해석입니다.
모든 Sonnet 작업이 GPT-6 Sol보다 정확히 80% 저렴하다는 의미는 아닙니다.
벤치마크의 헤드라인만 보면 더 저렴한 Sonnet 모델이 Opus를 불필요하게 만들었다고 결론 내리기 쉽습니다.
Anthropic은 이러한 해석을 명시적으로 부정합니다.
Anthropic 자체 테스트와 고객 피드백에서도 다음과 같은 작업에서는 Opus 5.5가 여전히 명확하게 더 강력한 것으로 나타났습니다.
따라서 실용적인 모델 라우팅 전략은 다음과 같은 형태에 가깝습니다.
Opus 5.5
→ 아키텍처
→ 어려운 계획 수립
→ 모호한 연구
→ 최고 수준의 복잡한 작업
Sonnet 5.5
→ 구현
→ 버그 수정
→ 리뷰
→ 일상적인 에이전트 작업
→ 문서 및 오피스 업무
→ 대량 코딩
Anthropic의 한 고객은 두 모델의 관계를 비슷한 방식으로 설명했습니다. Opus가 아키텍처를 정의하도록 한 다음 Sonnet이 이를 구현하게 하라는 것입니다.
이는 5.5 제품군을 이해하는 가장 유용한 방식일 가능성이 높습니다.
원문은 주로 성능과 비용에 초점을 맞추지만, 공식 발표에서 주목할 만한 세부 사항도 있습니다.
Anthropic은 Sonnet 5.5의 사이버보안 역량이 충분히 향상되어, Anthropic의 가장 강력한 모델에 사용되는 것과 유사한 사이버보안 안전장치와 대체 메커니즘을 적용해 출시한 최초의 Sonnet 모델이라고 밝혔습니다.
또한 이러한 안전장치는 고위험 요청의 좁은 범위를 대상으로 하며, 일반적인 소프트웨어 개발을 방해하기 위한 것이 아니라고 설명했습니다.
이는 코딩 및 도구 사용 성능이 강해지면 이중 용도의 보안 역량도 높아질 수 있기 때문에 중요합니다.
Anthropic은 Sonnet 5.5를 다음 경로에서 사용할 수 있다고 밝혔습니다.
API 모델 ID는 다음과 같습니다.
claude-sonnet-5-5
Anthropic은 자격을 갖춘 API 구성에서 Sonnet 5.5에 대한 데이터 보존 없음도 지원합니다.
Sonnet 5에서 마이그레이션하는 팀을 위해 Anthropic은 새로운 추론 수준 제어 기능을 검토하고, 기존 런타임 설정을 변경 없이 복사하기보다 구성을 새롭게 검토할 것을 권장합니다.
원문은 다음 Claude 5.5 제품군 구성원을 전망하며 끝납니다.
Anthropic은 Haiku 5.5가 앞으로 몇 주 안에 출시될 것이라고 밝혔습니다.
포지셔닝은 이미 분명합니다.
높은 처리량
+
비용에 민감한 워크로드
Sonnet 5.5가 빠른 범용 작업 모델이고 Opus 5.5가 어려운 개방형 판단을 위한 모델이라면, Haiku 5.5는 대량 배포의 경제성을 더욱 강화할 것으로 예상됩니다.
Claude 5.5 제품군의 방향은 점점 분명해지고 있습니다.
Anthropic은 단순히 원시 벤치마크 점수만으로 경쟁하는 것이 아닙니다.
점점 더 다음 요소를 중심으로 모델을 제시하고 있습니다.
품질
+
속도
+
완료된 작업당 비용
개발자에게 이는 벤치마크 점수만 보는 것보다 더 유용한 배포 지표가 될 수 있습니다.
Claude Sonnet 5.5는 Anthropic의 최신 Sonnet 모델이자 Claude 5.5 제품군의 두 번째 출시 모델입니다. 코딩, 에이전트, 지식 업무, 문서, 슬라이드 및 기타 범위가 명확한 작업을 위해 더 빠르고 저렴한 Opus 5.5의 보완 모델로 설계되었습니다.
일부 벤치마크에서는 그렇습니다. Sonnet 5.5는 Terminal-Bench 4.0에서 70.6%를 기록해 Opus 5.5의 66.4%를 앞섰습니다. 하지만 Opus는 대부분의 광범위한 평가에서 여전히 우위를 유지하며, 지속적인 판단이 필요한 복잡하고 개방형인 작업에서는 더 강력합니다.
Anthropic은 표준 API 가격을 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 10달러로 제시합니다. 캐시 읽기는 토큰 100만 개당 0.20달러이며 캐시 쓰기는 토큰 100만 개당 2.50달러입니다.
토큰 가격은 동일하지만 Anthropic은 Sonnet 5.5가 일반적으로 더 적은 토큰을 사용하고 작업을 더 효율적으로 완료한다고 설명합니다. Anthropic의 테스트에서는 이로 인해 많은 워크로드에서 작업당 비용이 최대 30% 감소했습니다.
Anthropic은 출력 생성 속도가 Sonnet 5보다 30% 이상 빠르다고 밝혔습니다. 외부 테스터들도 많은 코딩 작업에서 더 적은 도구 호출, 셸 실행 및 반복 횟수를 보고했습니다.
Anthropic의 FrontierCode 비용 대비 성능 차트는 해당 벤치마크에서 Sonnet 5.5가 테스트된 GPT-6 Sol 설정과 유사한 품질 범위에 도달하면서 측정된 작업 비용은 상당히 낮았음을 보여줍니다. 이는 보편적인 비용 비율이 아니며, 모든 코딩 또는 추론 워크로드에서 Sonnet이 승리한다는 증거로 해석해서는 안 됩니다.
공식 Claude API 모델 ID는 다음과 같습니다.
claude-sonnet-5-5
Anthropic은 AWS, Google Cloud 및 Microsoft Foundry를 통해서도 이 모델을 제공합니다.
Anthropic은 Haiku 5.5가 앞으로 몇 주 안에 출시될 것이라고 밝혔습니다. 이 모델은 높은 처리량과 비용에 민감한 애플리케이션을 위해 포지셔닝되어 있습니다.
claude-sonnet-5-5를 통합하기 위한 공식 API 문서입니다.Claude Sonnet 5.5는 이름에서 예상하는 것보다 Anthropic의 중간급 모델과 플래그십 모델 사이의 격차를 훨씬 더 좁혔습니다. Terminal-Bench 4.0에서 Opus 5.5를 앞섰고, GDPval-AA에서는 2 Elo 차이로 근접했으며, OSWorld와 CursorBench에서도 Opus에 거의 맞먹는 결과를 기록했습니다.
더 중요한 배포상의 변화는 효율성입니다. Sonnet 5.5는 Sonnet 5와 동일한 입력 100만 개당 2달러, 출력 100만 개당 10달러의 토큰 가격을 유지하면서도 Anthropic은 30% 이상 더 빠르게 실행되고 완료된 작업당 비용을 최대 30% 낮출 수 있다고 밝혔습니다. 외부 테스터들도 더 적은 도구 호출과 셸 실행, 그리고 상당히 적은 반복 횟수를 보고했습니다.
Opus 5.5는 지속적인 판단이 필요한 어렵고 개방형인 작업에서 여전히 더 강력한 선택입니다. Sonnet 5.5는 이제 범위가 명확한 작업이 점점 더 많은 영역에서 플래그십 수준의 품질에 도달하는 고처리량 작업 모델로 이해하는 것이 적절합니다.
Sonnet 5.5의 가장 중요한 업그레이드는 단일 벤치마크에서의 승리가 아닙니다. Sonnet 수준의 가격과 훨씬 낮은 완료 작업당 비용을 유지하면서 모델이 플래그십 품질에 얼마나 가까워졌는지가 핵심입니다.
한 문장에서 시작해 몇 분 안에 완전한 웹사이트를 받아보세요.