На бенчмарке CyberGym, который проверяет способность модели воспроизводить известные уязвимости в реальном коде, GPT-5.5-Cyber набрала 85,6%. Это выше, чем у обычной GPT-5.5 (81,8%) и у топовой кибер-модели Anthropic — Claude Mythos 5 (83,8%).
Это первый случай, когда модель OpenAI обошла флагманскую кибер-модель Anthropic на этом тесте и установила новый рекорд для одиночной модели.
Результаты на других тестах
Отрыв заметен и в более сложных сценариях:
ExploitGym (превращение уязвимости в работающий эксплойт с выполнением кода): 39,5% против 25,95% у GPT-5.5.
SEC-bench Pro (долгие задачи по поиску уязвимостей и созданию proof-of-concept в больших кодовых базах): 69,8% против 63,1%.
OpenAI подчёркивает, что высокие цифры в бенчмарках — это только часть картины. На практике важнее способность модели глубоко анализировать большие репозитории, выявлять чувствительные к безопасности компоненты, проверять достижимость уязвимого кода, валидировать находки, разрабатывать и тестировать патчи, а также готовить понятные доказательства для человека.
Что умеет GPT-5.5-Cyber
Новая модель может:
Проводить глубокий анализ крупных кодовых баз
Строить threat-модели
Находить реальные уязвимости и оценивать их критичность
Генерировать и проверять патчи
Работать в связке с разработчиками и безопасниками
Релиз произошёл на фоне приостановки доступа к кибер-моделям Anthropic (Fable и Mythos), что добавляет ситуации дополнительной остроты.
Daybreak — новый фронт OpenAI в кибербезопасности
Модель вышла в рамках масштабной инициативы Daybreak, цель которой — ускорить не только поиск, но и исправление уязвимостей в реальном мире. OpenAI запускает обновлённый плагин Codex Security, который интегрируется в рабочие процессы разработчиков и помогает автоматически находить проблемы и предлагать патчи.
Также стартовала программа Patch the Planet — совместная инициатива с Trail of Bits, HackerOne и другими партнёрами. Более 30 крупных open-source проектов (включая cURL, Go, Python и pyca/cryptography) уже присоединились к ней.
OpenAI заявляет, что сейчас главный bottleneck в кибербезопасности — не поиск уязвимостей, а их своевременное исправление. И именно на этом фронте компания собирается сосредоточиться в ближайшее время.