영국 인공지능 안전 연구소(AISI)가 발표한 두 가지 사이버 보안 평가에 따르면, GPT-5.6 Sol이 Claude Mythos 5보다 약간 우수한 성능을 보였습니다. 이 결과는 주목할 만하지만 신중히 해석해야 합니다. AISI는 포괄적인 공격 및...

영국 인공지능안전연구소(AISI)가 발표한 두 가지 사이버보안 평가에서 GPT-5.6 Sol이 Claude Mythos 5보다 근소하게 높은 순위를 기록했습니다. 이 결과는 주목할 만하지만, 신중하게 해석해야 합니다.
AISI는 모든 공격 및 방어 사이버보안 역량을 포괄하는 일반적인 순위를 발표하지 않았습니다. 대신 특정 기술 과제와 시뮬레이션된 장기 기업 네트워크 공격에서 모델의 성능을 테스트했습니다. 이러한 설정에서 GPT-5.6 Sol이 가장 높은 평균 점수를 기록했으며, Mythos 5는 이에 매우 근접했습니다.
더 중요한 발견은 오픈 웨이트 모델에서 나왔습니다. AISI는 GLM-5.2와 DeepSeek V4-Pro의 성능이 이제 불과 47개월 전에 출시된 선도적인 폐쇄형 모델과 동등해졌음을 확인했습니다. AISI의 2025년 내부 테스트에서는 그 시차가 610개월이었습니다.
이 시차의 단축은 중요한 의미를 지닙니다. 오픈 웨이트 모델은 다운로드, 수정, 사설 배포가 가능하고 제공업체의 모니터링 없이 실행될 수 있기 때문입니다. 연구 지원, 개인정보 보호, 비용 절감이라는 이러한 유연성은 고급 사이버 역량이 출시 후 통제되기 더 어려워질 수 있음을 의미하기도 합니다.
AISI는 두 가지 상호 보완적인 평가 시스템을 사용했습니다.
첫 번째 평가 시스템은 총 96개 작업에서 선별된 70개 작업을 통해 특정 사이버보안 기술을 측정합니다.
이 작업들은 네 가지 주요 영역을涵盖합니다:
작업은 필요한 인간 경험 추정치에 따라 네 가지 난이도로 분류됩니다:
| 난이도 | 추정 인간 경험 | 작업 수 |
|---|---|---|
| 기술 비전문가 | 기술적 배경은 있으나 사이버보안 경험은 제한적 | 18 |
| 견습생 | 약 1~3년 | 25 |
| 실무자 | 약 3~10년 | 19 |
| 전문가 | 10년 이상 | 8 |
각 모델은 작업당 5번의 시도 기회를 가지며, 시도당 토큰 제한은 250만 개입니다. AISI는 이후 평균 성공률을 계산합니다.
두 번째 시스템은 모델이 시뮬레이션된 네트워크에서 자율적으로 다단계 공격을 지속할 수 있는지 측정합니다.
보고서에서 논의된 주요 시나리오는 최후의 생존자입니다. 이 시나리오는 다음을 포함합니다:
주요 모델의 궤적은 10회 실행의 평균을 나타내며, 실행당 토큰 제한은 1억 개입니다.
이 환경들은 잘 방어된 실제 조직을 공격할 때의 모든 어려움을 재현하지는 않습니다. AISI는 현재 이 레인지들이 능동적인 인간 방어자, 방어 도구를 포함하지 않으며 경보 발생에 대한 페널티도 없다고 지적합니다.
좁은 작업 모음에서 GPT-5.6 Sol은 AISI가 발표한 차트에서 가장 높은 평균 성공률을 기록했습니다. Claude Mythos 5는 그 뒤를 바짝 따랐으며, 두 모델의 불확실성 범위는 중복됩니다.
차트에 따르면 GPT-5.6 Sol의 평균 성공률은 90%를 약간 상회하고 Mythos 5는 약 90%입니다. 불확실성 막대가 중복되므로, 이 결과는 이번 평가에서의 근소한 선두로 설명되어야 하며 Sol이 모든 사이버보안 시나리오에서 절대적으로 우월하다는 것을 증명하지는 않습니다.
장기 범위 작업에서도 유사한 상황이 나타납니다.
평균적으로 GPT-5.6 Sol은 32단계 중 약 29단계를 완료한 반면, Claude Mythos 5는 약 27단계였습니다. 두 모델 모두 최고 시도에서는 모든 단계를 완료했습니다.
이로부터 다음과 같은 결론을 내릴 수 있습니다:
AISI 보고서는 Sol과 Mythos 중 전체 승자를 판단하기보다는 오픈소스와 폐쇄형 모델 간의 역량 격차에 주로 초점을 맞추고 있습니다.
AISI가 GLM-5.2와 DeepSeek V4-Pro를 선택한 이유는 테스트 당시 이들이 선도적인 오픈소스 모델 후보였기 때문입니다.
보고서의 핵심 비교는 성능이 유사한 모델과 출시일 간격을 기반으로 합니다.
| 오픈소스 모델 | 평가 작업 | 비교 가능한 폐쇄형 모델 | 추정 출시일 격차 |
|---|---|---|---|
| GLM-5.2 | 좁은 네트워크 작업 | Claude Opus 4.6 및 GPT-5.3-Codex | 약 4개월 |
| GLM-5.2 | "최후의 생존자" 사이버보안 범위 | Claude Opus 4.5 | 7개월 미만 |
| DeepSeek V4-Pro | 좁은 네트워크 작업 | Claude Opus 4.5 | 약 5개월 |
| DeepSeek V4-Pro | 사이버보안 범위 작업 | 특정 범위에서 Sonnet 4.5 미만 | 직접적인 최첨단 매칭으로 간주되지 않음 |
GLM-5.2는 네 가지 좁은 작업 난이도 모두에서 Opus 4.6과 동등한 성능을 보였습니다. "최후의 생존자" 범위 작업에서는 Opus 4.5와 동일한 최종 평균 단계 수에 도달했습니다.
DeepSeek V4-Pro는 좁은 작업에서 Opus 4.5와 일치했지만 장기 범위 작업에서는 약한 성능을 보였습니다.
AISI의 2025년 내부 테스트에서는 선도적인 오픈소스 모델이 폐쇄형 최첨단 모델보다 610개월 뒤쳐져 있었습니다. 최신 추정치인 47개월은 방어 측의 준비 기간이 단축되고 있을 수 있음을 시사합니다.
4~7개월이라는 수치는 AISI가 테스트한 모델과 평가 작업만을 설명합니다. 이는 모든 미래 오픈소스 모델이 이 고정된 격차를 유지할 것이라는 예측이 아닙니다.
여러 요인이 격차를 양방향으로 움직일 수 있습니다:
또한 AISI는 모델에 대한 심층적인 특정 추출이나 최적화를 수행하지 않았기 때문에 자신들의 설정이 오픈 웨이트 모델의 최대 역량을 다소 과소평가했을 수 있다고 밝혔습니다.
본 보고서는 사이버보안 영역에만 적용되며, 과학, 프로그래밍, 일반 추론 또는 기타 영역에서의 동일한 격차를 추론하는 데 사용되어서는 안 됩니다.
역량 격차는 작지만 가격 격차는 큽니다.
AISI는 성능이 유사한 모델에 대해 공개된 자사 토큰 가격을 비교했습니다.
| 모델 | 대략적 비용 |
|---|---|
| Claude Opus 4.5 | 85 달러 |
| Claude Opus 4.6 | 85 달러 |
| GLM-5.2 | 46 달러 |
| DeepSeek V4-Pro | 1.19 달러 |
| 비교 항목 | 폐쇄형 모델 비용 | 오픈소스 가중치 모델 비용 |
|---|---|---|
| Opus 4.6 vs GLM-5.2 | 15.17 달러 | 6.12 달러 |
| Opus 4.5 vs DeepSeek V4-Pro | 12.50 달러 | 0.28 달러 |
이 예시에서 DeepSeek V4-Pro의 공개 가격은 유사한 폐쇄형 모델보다 한 자리에서 두 자리 낮습니다.
이 비교에는 한계가 있습니다. AISI는 테스트된 오픈소스 가중치 모델을 자체 1차 제공업체를 통해 실행하지 않았으므로 실제 인프라 비용이 다를 수 있습니다. 자체 호스팅에는 API 가격에 반영되지 않은 하드웨어, 엔지니어링, 전력, 네트워크 및 유지보수 비용이 추가로 발생합니다.
그럼에도 불구하고, 더 낮은 추론 비용으로 인해 반복적인 실험, 미세 조정 및 사설 배포가 더욱 실현 가능해집니다.
오픈소스 가중치 모델은 실질적인 이점을 제공합니다:
동일한 특성으로 인해 출시 후 취할 수 있는 보안 조치도 제한됩니다.
폐쇄형 모델 제공업체는 다음을 수행할 수 있습니다:
모델 가중치가 공개되면 복사본을 재배포하고 비공개로 실행할 수 있습니다. 거부 동작이 수정될 수 있으며, 배포 모니터링이 제거될 수 있고, 원래 개발자는 모든 복사본을 안정적으로 회수할 수 없습니다.
AISI는 보안 조치가 테스트한 두 오픈소스 모델의 대부분 테스트를 실질적으로 방해하지 않는다는 것을 발견했습니다. DeepSeek V4-Pro는 역공학 작업을 가끔 거부했지만, 소량의 재시도로 이러한 거부를 우회할 수 있었습니다.
이는 모든 오픈소스 가중치 모델이 악의적으로 사용된다는 것을 의미하지는 않습니다. 모델이 위험 관련 능력 수준에 도달했을 때 출시 결정을 되돌리기 어려워진다는 것을 의미합니다.
폐쇄형 액세스가 보안을 보장하지는 않습니다.
Anthropic은 Claude Fable 5와 Claude Mythos 5를 출시했습니다. Fable 5는 강력한 분류기로 일반 액세스를 제공하는 반면, Mythos 5는 제한된 신뢰할 수 있는 방어자 그룹에게 기본 모델의 네트워크 보안 능력을 더 많이 노출시켰습니다.
6월 12일, 미국 수출 통제로 인해 Anthropic이 액세스를 일시 중단해야 했습니다. Anthropic은 아마존 연구원들이 제한된 네트워크 보안 시나리오에서 Fable 5의 보호 조치를 우회하는 방법을 설명하는 보고서를 제출한 후 이 지시가 내려졌다고 밝혔습니다.
Anthropic은 이후 업데이트된 분류기를 훈련하고, 정부 및 산업 파트너와 함께 탈옥 심각도 평가 프레임워크를 공동 개발했으며, 제한이 해제된 후 7월 1일에 전 세계적으로 Fable 5를 복원했습니다.
이 사건은 몇 가지를 시사합니다:
폐쇄형 배포는 더 많은 개입 옵션을 제공하지만, 이러한 옵션에는 효과적인 모니터링, 테스트, 정책 및 기술적 통제가 여전히 필요합니다.
AISI는 개방형과 폐쇄형의 차이를 준비 시간으로 설명합니다.
가장 강력한 시스템이 동등한 오픈소스 가중치 출시보다 수개월 전에 통제된다면, 방어자는 이 시간을 활용하여:
610개월에서 47개월로 단축된다는 것은 조직이 유사한 능력이 더 저렴하고 널리 보급되기 전에 이러한 작업을 완료할 시간이 줄어들 수 있음을 의미합니다.
영국 국가사이버보안센터(NCSC)는 AI가 강력한 보안 관행과 취약한 보안 관행 간의 격차를 확대할 것이라고 경고합니다. 그 지침은 AI 도구가 취약한 기반을 보완할 수 없다는 점을 강조합니다.
패치 관리 부실, 서비스 노출, 자격 증명 재사용, 불완전한 백업, 제한적인 모니터링을 가진 조직은 공격자가 어떤 AI 모델을 사용하든 여전히 취약한 상태에 놓일 것입니다.
공격적 평가에 사용되는 동일한 능력은 방어자가 코드를 감사하고, 테스트를 생성하며, 오류를 조사하고, 취약점 연구를 확장하는 데 도움이 될 수 있습니다.
최근 사례는 게임 네트워크 개발자 Glenn Fiedler가 Claude Code와 Claude Fable 5를 사용하여 4개의 성숙한 오픈소스 라이브러리를 감사한 것입니다:
netcodereliableserializeyojimbo아이디어를 한 문장으로 입력하면 We0 AI가 쇼케이스 사이트, 페이지, CMS를 생성하고 출시 후 고객과 트래픽 확보를 돕습니다.
무료 등록을 위한 하나의 완전한 프로젝트 생성
하나의 완전한 생성 흐름을 시도하고 첫 번째 프로젝트 초안을 빠르게 보는 데 가장 적합합니다.
이 감사는 libFuzzer 대상, 살균제 기반 지속적 통합, 수백만 회 반복의 스트레스 테스트, 골드라인 형식 테스트 및 라인별 검토를 추가했습니다.
공개 취약점 기록은 43개의 수정 사항을 보여줍니다:
| 라이브러리 | 총 수정 수 | 네트워크 도달 가능 수정 수 |
|---|---|---|
| netcode | 7 | 2 |
| reliable | 7 | 6 |
| serialize | 11 | 7 |
| yojimbo | 18 | 12 |
| 합계 | 43 | 27 |
가장 심각한 문제는 yojimbo에서 2019년부터 원격으로 트리거 가능한 힙 오버플로우 취약점이 발견된 것입니다. 정교하게 조작된 블록 조각이 크기 검증 전에 재조립 버퍼로 복사될 수 있었습니다.
나열된 각 문제에는 수정 커밋 및 버전 링크가 제공되었으며, 각 수정에는 회귀 테스트가 포함되었습니다. 개발자는 2주간의 수정 과정에서 Claude Code에 2,500달러 이상을 지출했다고 보고했습니다.
영향을 받은 라이브러리 사용자는 공개 취약점 기록에 지정된 최신 버전으로 업그레이드할 것을 권장받았습니다.
이 사례는 AI 에이전트가 임의의 소프트웨어를 독립적으로 안전하게 보호할 수 있다는 것을 증명하지는 않습니다. 이는 지식이 풍부한 유지보수 담당자가 AI를 활용하여 기존 코드베이스에 대한 퍼징, 살균제 범위, 검토 및 테스트 생성을 확장할 수 있음을 보여줍니다.
AI는 양측을 도울 수 있지만, 배포 방식은 다릅니다.
공격자는 단 하나의 이용 가능한 취약점, 접근 가능한 대상, 그리고 하나의 성공 경로만 있으면 됩니다. 오픈소스 가중치 모델은 출시 후 반복적으로 복사 및 재사용될 수 있습니다.
방어자는 다양한 시스템을 보호하고, 자산 목록을 유지 관리하며, 패치 우선순위를 지정하고, 변경 사항을 테스트하고, 가동 중단 시간을 관리하며, 팀 간에 조정해야 합니다. 방어 개선은 조직별로 구현되어야 합니다.
이로 인해 불균형이 발생합니다:
적절한 대응은 방어적 AI 사용을 피하는 것이 아니라, 이를 강력한 엔지니어링 관행, 인간 전문성 및 검증된 보안 통제와 결합하는 것입니다.
AISI와 NCSC의 발견은 실행 가능한 일련의 조치를 뒷받침합니다.
우선순위:
이러한 기반이 이미 존재할 때 AI 강화 방어가 가장 효과적입니다.
소프트웨어 프로젝트의 경우 도입:
Mas Bandwidth 감사가 유용했던 이유는 생성된 설명을 신뢰하는 대신 AI 검토를 기계적 증거와 결합했기 때문입니다.
AI 생성 취약점 보고서는 정확할 수도 있고, 불완전하거나 오해의 소지가 있을 수도 있습니다.
요구 사항:
재현
근본 원인 분석
수동 검토
최소 수정
회귀 테스트
배포 문서
상황에 따른 조정된 공개
방어적 코딩 에이전트는 기본적으로 무제한 액세스 권한을 받아서는 안 됩니다.
제한 사항:
격리된 환경을 사용하고,
중요한 작업은 인간의 승인을 받도록 하십시오.
다음 지표를 추적하십시오:
모델이 신뢰할 수 없는 결과를 생성하거나 많은 검토가 필요한 경우, 가장 저렴한 모델이 반드시 비용 효율적인 것은 아닙니다.
사이버 보안 벤치마크는 유용하지만, 그 적용 범위를 명확히 이해해야 합니다.
시뮬레이션 환경은 단순화된 환경입니다. 실제 네트워크에는 능동적인 방어자, 엔드포인트 보호, 알림 메커니즘, 속도 제한, 사기 탐지 시스템, 불완전한 정보가 포함될 수 있습니다.
장기 작업의 결과는 모델 지식에만 의존하지 않습니다. 도구 설계, 메모리, 컨텍스트 관리, 재시도 전략, 프롬프트 구조, 실행 신뢰성 모두 성능에 영향을 미칩니다.
최고 시도는 시스템이 때때로 무엇을 할 수 있는지 보여줍니다. 평균 결과는 시스템이 여러 번 실행에서 얼마나 안정적으로 진행되는지 보여줍니다.
운영 위험 측면에서 둘 다 중요합니다.
이전 모델과 유사한 성능을 보이는 모델이 이전 모델과 완전히 동일한 것은 아닙니다. 이러한 시스템은 서로 다른 강점, 약점, 보호 조치, 비용 및 배포 제한 사항을 가질 수 있습니다.
동일한 기술은 침투 테스트, 보안 코드 검토, 사고 대응, 취약점 발견 또는 악의적인 침입에 사용될 수 있습니다.
평가 결과는 위험 관리와 방어적 보안 접근 투자 모두에 정보를 제공해야 합니다.
GPT-5.6 Sol은 AISI의 좁은 범위의 사이버 보안 작업과 주요 언급 장기 환경에서 약간 더 높은 평균 결과를 얻었습니다. Mythos 5의 점수는 비슷하며, 두 모델 모두 좁은 작업 세트에서 불확실성 범위가 겹치고, 최고 시도에서 32개 환경 단계를 모두 완료했습니다.
꼭 그렇지는 않습니다. AISI는 모든 실제 방어 또는 공격 시나리오가 아닌 특정 작업 세트와 시뮬레이션 환경을 테스트합니다. 결과는 일반적인 순위가 아닌 좁은 범위의 벤치마크 비교를 지원합니다.
AISI는 테스트한 선도적인 오픈 가중치 모델이 4~7개월의 격차를 보인다고 추정합니다. 이 데이터는 측정된 성능을 비교 가능한 폐쇄형 모델의 출시일과 일치시켜 도출되었습니다.
보고서 발표 시점에 GLM-5.2는 AISI 테스트에서 가장 강력한 오픈 가중치 모델이었습니다. 좁은 작업에서 Opus 4.6과 동등한 성능을 보였으며, 주요 언급 사이버 보안 환경에서 Opus 4.5와 동일한 평균 점수를 달성했습니다.
해당 가중치는 다운로드, 수정, 사설 배포 및 재배포가 가능합니다. 이는 연구 및 개인정보 보호 측면에서 이점을 제공하지만, 원래 개발자가 악용을 모니터링하고, 배포 보안 조치를 업데이트하고, 사용자를 일시 중단하거나 모든 사본을 회수하는 능력을 제한합니다.
AISI 평가에서?
네. 공시된 자체 가격 기준으로 GLM-5.2, 특히 DeepSeek V4-Pro는 유사한 폐쇄형 모델보다 훨씬 저렴합니다. 실제 자체 호스팅 및 타사 배포 비용은 다를 수 있습니다.
그렇습니다. AI는 코드 검토, 퍼지 테스트 생성, 취약점 분석, 로그 조사 및 수정을 지원할 수 있습니다. Claude Code로 보조된 보안 작업 후 Mas Bandwidth 감사에서는 4개의 네트워크 라이브러리에서 43건의 수정이 기록되었습니다.
AI 도구에 의존하기 전에 기본적인 보안 제어를 강화하십시오. 자산 가시성, 패치 관리, ID 보호, 백업, 네트워크 분할, 모니터링 및 테스트된 사고 대응은 여전히 중요합니다.
AISI의 최신 결과에 따르면, 두 가지 지정된 사이버 보안 평가 평균 점수에서 GPT-5.6 Sol이 Claude Mythos 5보다 약간 앞서는 것으로 나타났습니다. 이 격차는 작으며 보편적인 우월성의 증거로 간주되어서는 안 됩니다.
보고서의 주요
결론은 더 광범위합니다: GLM-5.2와 DeepSeek V4-Pro는 현재 유사한 최첨단 폐쇄형 모델과의 격차가 47개월로 줄었으며, AISI의 2025년 내부 테스트에서는 이 격차가 610개월이었습니다.
그 가격표도 경쟁사보다 훨씬 낮다.
이렇게 단축된 지연 시간은 고급 기능을 더 쉽게 다운로드하고, 수정하며, 로컬에서 실행할 수 있게 되기 전에 방어 측이 대응할 수 있는 시간이 더욱 줄어든다는 것을 의미한다. 동시에, Claude Code가 4개의 네트워크 라이브러리에서 43개의 취약점을 발견한 성과는 강력한 모델이 방어 작업도 가속화할 수 있음을 보여준다.
실질적인 대응책은 단순히 모델 보호나 AI 안전 도구에 의존하는 것이 아니라, 보안 기준을 강화하고 통제된 환경, 테스트 주도, 사람의 검토를 거친 방어 프로세스에 AI를 활용하는 것이다.
한 문장에서 시작해 몇 분 안에 완전한 웹사이트를 받아보세요.