Две оценки кибербезопасности, опубликованные Британским институтом безопасности искусственного интеллекта (AISI), показывают, что GPT-5.6 So...

В двух оценках кибербезопасности, опубликованных Британским институтом искусственного интеллекта (AISI), GPT-5.6 Sol занял немного более высокое место, чем Claude Mythos 5. Этот результат заслуживает внимания, но требует осторожной интерпретации.
AISI не публиковал общий рейтинг, охватывающий все возможности наступательной и оборонительной кибербезопасности. Он тестировал модели в ряде конкретных технических задач и в симулированных долгосрочных атаках на корпоративные сети. В этих условиях GPT-5.6 Sol показал наивысший средний результат, а Mythos 5 был очень близок к нему.
Более важное открытие касается моделей с открытыми весами. AISI обнаружил, что производительность GLM-5.2 и DeepSeek V4-Pro теперь сравнима с ведущими закрытыми моделями, выпущенными всего четыре-семь месяцев назад. Во внутренних тестах AISI 2025 года этот разрыв составлял шесть-десять месяцев.
Сокращение этого разрыва имеет большое значение, поскольку модели с открытыми весами можно загружать, модифицировать, развертывать локально и запускать без мониторинга со стороны поставщика. Такая гибкость, поддерживающая исследования, конфиденциальность и снижение затрат, также может затруднить контроль над передовыми сетевыми возможностями после их выпуска.
AISI использовал две дополняющие друг друга системы оценки.
Первая система оценивает конкретные навыки кибербезопасности с помощью 70 задач, выбранных из более крупного набора из 96 задач.
Эти задачи охватывают четыре основные области:
Они разделены на четыре уровня сложности в зависимости от предполагаемого опыта, необходимого человеку:
| Уровень сложности | Примерный опыт человека | Количество задач |
|---|---|---|
| Технический неспециалист | Имеет техническое образование, но ограниченный опыт в кибербезопасности | 18 |
| Подмастерье | Примерно 1–3 года | 25 |
| Практик | Примерно 3–10 лет | 19 |
| Эксперт | Более 10 лет | 8 |
Каждая модель имела пять попыток на каждую задачу, с лимитом в 2,5 миллиона токенов на попытку. Затем AISI вычислял среднюю частоту успеха.
Вторая система оценивает способность модели самостоятельно поддерживать многошаговую атаку в симулированной сети.
Основной сценарий, обсуждаемый в отчете, называется Последний выживший. Он включает:
Траектория каждой основной модели представляет собой среднее значение десяти запусков с лимитом в 100 миллионов токенов на запуск.
Эти среды не воспроизводят всех трудностей атаки на хорошо защищенную реальную организацию. AISI отмечает, что эти полигоны в настоящее время не включают активных защитников-людей, средства защиты и не наказывают за срабатывание сигнализации.
В наборе узких задач GPT-5.6 Sol зафиксировал наибольшую среднюю частоту успеха на графике, опубликованном AISI. Claude Mythos 5 следует за ним, и диапазоны неопределенности перекрываются.
График показывает, что средняя частота успеха GPT-5.6 Sol немного превышает 90%, а Mythos 5 — около 90%. Из-за перекрытия полос неопределенности этот результат следует описывать как незначительное преимущество в данной оценке — он не доказывает, что Sol абсолютно превосходит всех в любых сценариях кибербезопасности.
Долгосрочные задачи также демонстрируют аналогичную картину.
В среднем GPT-5.6 Sol выполнил около 29 из 32 шагов, а Claude Mythos 5 — около 27. Лучшие попытки обеих моделей выполнили все шаги.
Отсюда можно сделать следующие выводы:
Отчет AISI в основном посвящен разрыву в возможностях между открытыми и закрытыми моделями, а не определению общего победителя между Sol и Mythos.
AISI выбрал GLM-5.2 и DeepSeek V4-Pro, потому что на момент тестирования они были ведущими кандидатами среди моделей с открытым исходным кодом.
Основное сравнение в отчете основано на производительности аналогичных моделей и временном интервале между их выпусками.
| Модель с открытым исходным кодом | Оценка задачи | Сравнимая закрытая модель | Предполагаемый разрыв в дате выпуска |
|---|---|---|---|
| GLM-5.2 | Узкие сетевые задачи | Claude Opus 4.6 и GPT-5.3-Codex | Около 4 месяцев |
| GLM-5.2 | Киберполигон «Последний выживший» | Claude Opus 4.5 | Менее 7 месяцев |
| DeepSeek V4-Pro | Узкие сетевые задачи | Claude Opus 4.5 | Около 5 месяцев |
| DeepSeek V4-Pro | Задачи на киберполигоне | Ниже Sonnet 4.5 в определенных областях | Не считается прямым совпадением с передовыми |
GLM-5.2 показал производительность, сопоставимую с Opus 4.6, на всех четырех уровнях сложности узких задач. В задаче на полигоне «Последний выживший» он достиг того же среднего конечного количества шагов, что и Opus 4.5.
DeepSeek V4-Pro сравнялся с Opus 4.5 в узких задачах, но показал более слабые результаты в долгосрочных задачах на полигоне.
Внутренние тесты AISI 2025 года показали, что ведущие модели с открытым исходным кодом отстают от закрытых передовых моделей на шесть-десять месяцев. Последняя оценка в четыре-семь месяцев указывает на то, что окно для подготовки защиты может сокращаться.
Цифра в четыре-семь месяцев описывает только протестированные AISI модели и оценочные задачи. Это не прогноз того, что каждая будущая модель с открытым исходным кодом будет сохранять фиксированное отставание.
Множество факторов могут изменить разрыв в любую сторону:
AISI также отмечает, что их настройка может немного недооценивать максимальные возможности моделей с открытыми весами, поскольку они не проводили глубокую извлечение или оптимизацию специально для этих моделей.
Этот отчет применим только к области кибербезопасности, и на его основе не следует делать выводы об аналогичном разрыве в науке, программировании, общем мышлении или других областях.
Разрыв в возможностях невелик, но разница в цене значительна.
AISI сравнил опубликованные цены на токены первого лица для моделей с аналогичной производительностью.
1亿 токенов стоимость полигона
| Модель | Примерная стоимость |
|---|---|
| Claude Opus 4.5 | 85 долларов |
| Claude Opus 4.6 | 85 долларов |
| GLM-5.2 | 46 долларов |
| DeepSeek V4-Pro | 1,19 доллара |
| Сравнение | Стоимость закрытой модели | Стоимость модели с открытым весом |
|---|---|---|
| Opus 4.6 против GLM-5.2 | 15,17 доллара | 6,12 доллара |
| Opus 4.5 против DeepSeek V4-Pro | 12,50 доллара | 0,28 доллара |
В этих примерах опубликованная цена DeepSeek V4-Pro на один-два порядка ниже, чем у аналогичных закрытых моделей.
Это сравнение имеет ограничения. AISI не запускала тестируемые модели с открытым весом через своего первого провайдера, поэтому фактические затраты на инфраструктуру могут отличаться. Самостоятельное размещение также влечёт за собой затраты на оборудование, инжиниринг, электроэнергию, сеть и обслуживание, которые не отражены в ценах API.
Тем не менее, более низкая стоимость вывода делает повторные эксперименты, тонкую настройку и частное развёртывание более осуществимыми.
Модели с открытым весом имеют практические преимущества:
Те же характеристики ограничивают возможные меры безопасности после публикации.
Провайдеры закрытых моделей могут:
Как только веса модели становятся общедоступными, копии могут быть распространены и запущены в частном порядке. Отказы могут быть изменены, мониторинг развёртывания удалён, а исходный разработчик не сможет надёжно отозвать каждую копию.
AISI обнаружила, что меры безопасности существенно не препятствовали большинству её тестов на двух моделях с открытым весом. DeepSeek V4-Pro иногда отказывалась выполнять задачи по обратной разработке, но несколько повторных попыток обычно обходили эти отказы.
Это не означает, что все модели с открытым весом будут использоваться злонамеренно, но означает, что когда модели достигают уровня возможностей, связанных с риском, решение о публикации становится труднообратимым.
Закрытый доступ не является гарантией безопасности.
Anthropic опубликовала Claude Fable 5 и Claude
9 июня 2026 года компания выпустила Mythos 5. Fable 5 использует более сильные классификаторы для обычного доступа, в то время как Mythos 5 раскрывает больше сетевых возможностей базовой модели ограниченному кругу доверенных защитников.
12 июня экспортные ограничения США потребовали от Anthropic приостановить доступ. Anthropic заявила, что распоряжение было выпущено после того, как исследователи Amazon представили отчёт, описывающий метод обхода защитных мер Fable 5 в ограниченном сценарии сетевой безопасности.
Затем Anthropic обучила обновлённый классификатор, совместно с правительственными и отраслевыми партнёрами разработала систему оценки серьёзности взломов и 1 июля глобально восстановила Fable 5 после снятия ограничений.
Этот инцидент выявил несколько моментов:
Закрытое развёртывание предоставляет больше возможностей для вмешательства, но эти возможности по-прежнему требуют эффективного мониторинга, тестирования, политики и технического контроля.
AISI описывает разрыв между открытыми и закрытыми системами как время на подготовку.
Если самые мощные системы контролируются за несколько месяцев до эквивалентного выпуска с открытым весом, защитники могут использовать это время для:
Сокращение с шести-десяти месяцев до четырёх-семи означает, что у организаций может быть меньше времени на выполнение этих работ до того, как аналогичные возможности станут дешевле и доступнее.
Национальный центр кибербезопасности Великобритании предупреждает, что AI усилит разрыв между сильными и слабыми практиками безопасности. Его рекомендации подчёркивают, что инструменты AI не могут компенсировать слабую основу.
Организации с плохим управлением исправлениями, открытыми сервисами, повторным использованием учётных данных, неполными резервными копиями и ограниченным мониторингом останутся уязвимыми, независимо от того, какую AI-модель использует атакующий.
Те же возможности, используемые для атакующей оценки, могут помочь защитникам аудировать код, генерировать тесты, расследовать сбои и расширять исследования уязвимостей.
Опишите идею одной фразой, и We0 AI создаст сайт-витрину, страницы и CMS, а после запуска поможет привлечь клиентов и трафик.
Одна полная генерация проекта для бесплатной регистрации
Лучше всего попробовать один полный поток генерации и быстро увидеть первый черновик проекта.
Недавний пример — игровой сетевой разработчик Гленн Фидлер, который использовал Claude Code с Claude Fable 5 для аудита четырёх зрелых библиотек с открытым исходным кодом:
netcodereliableserializeyojimboЭтот аудит добавил цели libFuzzer, непрерывную интеграцию на основе санитайзеров, стресс-тесты с миллионами итераций, тесты золотых линий формата и построчный обзор.
Публичный реестр уязвимостей показывает 43 исправления:
| Библиотека | Всего исправлений | Сетевых исправлений |
|---|---|---|
| netcode | 7 | 2 |
| reliable | 7 | 6 |
| serialize | 11 | 7 |
| yojimbo | 18 | 12 |
| Всего | 43 | 27 |
Самая
Серьёзной проблемой была уязвимость переполнения кучи в yojimbo, удалённо эксплуатируемая с 2019 года. Сконструированные фрагменты блоков могли копироваться в буфер рекомбинации до проверки размера.
Каждая перечисленная проблема сопровождается ссылками на исправляющий коммит и версию, каждое исправление включает регрессионный тест. Разработчик сообщил о затратах более 2500 долларов на Claude Code в течение двухнедельного процесса исправления.
Пользователям затронутых библиотек рекомендуется обновиться до последних версий, указанных в публичном реестре уязвимостей.
Этот случай не доказывает, что AI-агенты могут самостоятельно защищать произвольное программное обеспечение. Он показывает, что осведомлённые мейнтейнеры могут использовать AI для масштабирования фаззинга, покрытия санитайзерами, проверки и генерации тестов для существующих кодовых баз.
AI может помогать обеим сторонам, но модели развёртывания различаются.
Атакующему нужна только одна эксплуатируемая уязвимость, одна доступная цель и один успешный путь. Модели с открытым весом могут копироваться и использоваться многократно после публикации.
Защитник должен защищать множество систем, поддерживать инвентаризацию активов, расставлять приоритеты в исправлениях, тестировать изменения, управлять простоями и координировать действия между командами. Улучшения защиты должны внедряться в каждой организации индивидуально.
Это создаёт асимметрию:
Правильная реакция — не избегать оборонительного AI, а сочетать его с надёжными инженерными практиками, человеческим опытом и проверенными мерами безопасности.
Выводы AISI и NCSC поддерживают набор практических действий.
Приоритет:
Когда эти основы уже существуют, AI-усиленная защита работает лучше всего.
Для программных проектов внедрите:
Аудит Mas Bandwidth был полезен, потому что он сочетал AI-проверку с механическими доказательствами, а не полагался на сгенерированные объяснения.
AI-сгенерированные отчёты об уязвимостях могут быть правильными, неполными или вводящими в заблуждение.
Требуйте:
Агенты оборонительного кодирования по умолчанию не должны получать неограниченный доступ.
Ограничения:
Используйте изолированные среды и ставьте важные действия под контроль человека.
Отслеживайте следующие показатели:
Если модель выдает ненадежные результаты или требует значительной проверки, самая дешевая модель не обязательно является наиболее рентабельной.
Бенчмарки кибербезопасности полезны, но необходимо четко понимать их применимость.
Симуляционные полигоны упрощают среду. Реальные сети могут включать активных защитников, защиту конечных точек, механизмы оповещения, ограничение скорости, системы обмана и неполную информацию.
Результаты долгосрочных задач зависят не только от знаний модели. Дизайн инструментов, память, управление контекстом, стратегии повторных попыток, структура подсказок и надежность выполнения влияют на производительность.
Лучшие попытки показывают, что система иногда может сделать. Средние результаты показывают, насколько надежно система прогрессирует в нескольких запусках.
Для операционного риска важны оба показателя.
Модели с производительностью, аналогичной старым моделям, не идентичны им. Эти системы могут иметь разные сильные и слабые стороны, меры защиты, затраты и ограничения развертывания.
Одни и те же навыки могут использоваться для пентеста, проверки кода безопасности, реагирования на инциденты, поиска уязвимостей или злонамеренного вторжения.
Результаты оценки должны служить основой для инвестиций как в управление рисками, так и в оборонительную безопасность.
GPT-5.6 Sol показал несколько более высокие средние результаты в узких задачах кибербезопасности AISI и в специально упомянутых долгосрочных полигонах. Показатели Mythos 5 близки, диапазоны неопределенности по узкому набору задач перекрываются, и обе модели выполнили все 32 шага полигона в лучших попытках.
Не обязательно. AISI тестирует конкретные наборы задач и симуляционные среды, а не все реальные сценарии защиты или атак. Результаты поддерживают узкое сравнение бенчмарков, а не общий рейтинг.
AISI оценивает разрыв для лидирующих моделей с открытым весом в четыре-семь месяцев. Эти данные основаны на сопоставлении замеренной производительности с датами выпуска сопоставимых закрытых моделей.
На момент публикации отчета GLM-5.2 была самой сильной моделью с открытым весом в тестах AISI. Она сравнялась с Opus 4.6 по узким задачам и достигла того же среднего балла, что и Opus 4.5, на специально упомянутом полигоне кибербезопасности.
Их веса могут быть загружены, модифицированы, развернуты приватно и распространены повторно. Это дает преимущества в исследованиях и конфиденциальности, но ограничивает возможности оригинального разработчика отслеживать злоупотребления, обновлять меры безопасности в развертываниях, приостанавливать работу пользователей или отзывать все копии.
в оценке AISI?
Да. По объявленным официальным ценам, GLM-5.2 и особенно DeepSeek V4-Pro значительно дешевле сопоставимых закрытых моделей. Фактические затраты на самостоятельное размещение и развертывание сторонними провайдерами могут отличаться.
Да. ИИ может помогать в проверке кода, генерации fuzz-тестов, анализе уязвимостей, исследовании журналов и исправлениях. После работы по безопасности с помощью Claude Code, аудит Mas Bandwidth зафиксировал 43 исправления в четырех сетевых библиотеках.
Прежде чем полагаться на инструменты ИИ, усильте базовые средства контроля безопасности. Видимость активов, управление патчами, защита идентичности, резервное копирование, сегментация сети, мониторинг и проверенные процедуры реагирования на инциденты остаются критически важными.
Последние результаты AISI показывают, что GPT-5.6 Sol незначительно опережает Claude Mythos 5 по средним баллам в двух указанных оценках кибербезопасности. Это лидерство невелико и не должно рассматриваться как свидетельство общего превосходства.
Основной вывод отчета шире: отставание GLM-5.2 и DeepSeek V4-Pro от сопоставимых передовых закрытых моделей сократилось до 4–7 месяцев, тогда как во внутренних тестах AISI 2025 года этот разрыв составлял 6–10 месяцев.
Его цена также значительно ниже, чем у конкурентов.
Эта сокращённая задержка означает, что у защищающейся стороны остаётся ещё меньше времени на реагирование до того, как продвинутые возможности станут легче доступны для загрузки, модификации и локального запуска. В то же время обнаружение 43 уязвимостей в четырёх сетевых библиотеках с помощью Claude Code показывает, что мощные модели могут ускорить и защитную работу.
Реальная стратегия противодействия заключается не в простом использовании средств защиты моделей или инструментов ИИ-безопасности, а в укреплении базового уровня безопасности и применении ИИ в контролируемых, тестируемых и проходящих ручную проверку защитных процессах.
Начните с одной фразы и получите полноценный сайт за считанные минуты.