Security-агенты на минималках: сколько стоит решение одной CTF-задачи
Когда в начале 2026 года Anthropic опубликовал отчёт Claude Mythos Preview, мир кибербезопасности замер: модель решала сложные CTF-задачи, писала эксплойты, проходила penetration-testing с миллионными контекстными окнами и полной автономией. Заголовок отчёта звучал как приговор: «агенты достигли уровня, который раньше казался фантастикой». Но за этими восторгами скрывался один вопрос, который редко задавали вслух: а сколько это стоит? Не в abstract maximum, а в реальных долларах за каждую решённую задачу.
Именно этот вопрос поставили во главу угла исследователи из Frontier Security Institute. Они взяли два популярных бенчмарка, наступательный Cybench и оборонительный BOTS v1, и прогнали через них весь текущий зоопарк моделей: от GPT-5.5 до DeepSeek v4 Flash, от Claude Opus 4.8 до новых GPT-5.6 Luna, Terra и Sol. И вместо привычного рейтинга «кто больше решил» получили таблицу операционной эффективности, которая перевернула ожидания.
Почему «решил, не решил» больше не работает
Традиционные бенчмарки AI-агентов работают по бинарной логике: модель либо решила задачу, либо нет. GPT-5.5 решила 94.1% заданий Cybench: отлично, значит она лучшая. Но эта метрика не учитывает, сколько стоит каждый шаг рассуждения. В реальной операции безопасности каждый инструмент (Splunk-запрос, WHOIS-проверка, web-поиск) имеет цену. А каждый токен рассуждения потребляет бюджет. Если модель решает задачу за 200 шагов и $10, а другая за 5 шагов и $0.50, они не эквивалентны, даже если обе «решили».
Исследователи взяли за основу идею cost-success кривой: они брали одну и ту же модель, один и тот же бенчмарк и одну и ту же трассировку выполнения, а затем ретроспективно накладывали бюджетные ограничения ($0.80, $2.10, $4.20 на одну задачу). Если модель превышала лимит, задача считалась проваленной, даже если при неограниченном бюджете она была бы решена. Это дало честное сравнение операционной полезности, а не академической способности.
Наступление: чем больше токенов, тем больше побед
С Cybench (бенчмарком, основанным на реальных CTF-задачах с песочницей для исполнения кода) получилась красивая восходящая кривая. GPT-5.5 остаётся сильнейшей точкой: 94.1% решённых задач при стоимости $1.16 за эквивалентную задачу. Среди новых GPT-5.6 семейство разделилось: Luna набрала 79.5%, Terra 65.8%, а Sol достигла лишь 9.4%, отказавшись от 90.6% заданий ещё до первого инструмента.
Особенно интересна динамика DeepSeek v4 Flash. При ретроспективном капе $0.80 модель решает 76.1% задач. Когда бюджет поднимают до $2.10, показатель вырастает до 86.4%. Это означает, что модель не упирается в потолок возможностей. Она просто экономит на каждом шаге. При ограниченном бюджете DeepSeek становится экономически выгоднее некоторых флагманов, хотя в абсолютном рейтинге «кто больше решил» его бы не заметили.
А вот Claude Fable 5 показал 0%. Не потому, что не умеет, а потому что отказался от всех 117 sample-epochs ещё до первого вызова инструмента. Это уже не вопрос capability, это policy-решение разработчика: модель настроена не трогать наступательные задачи в принципе. Что, впрочем, тоже важная информация для тех, кто выбирает агента для SOC.
Кривая масштабирования для Cybench чёткая: больше долларов и токенов, больше решённых задач. Особенно заметно это у Claude Opus 4.8 и DeepSeek v4 Flash, где каждая дополнительная копейка действительно конвертируется в дополнительные решения. Это значит, что для offensive-security агента тестовое время вычислений реальный ресурс, который можно инвестировать.
Защита: здесь больше денег не значит лучше
С BOTS v1 (бенчмарком оборонительных SOC-расследований на реальных Splunk-данных из Frothly) получилась совсем другая история. Claude Opus 4.8 набирает максимальный балл при относительно скромных затратах: меньше токенов, меньше платных инструментов, меньше времени. А DeepSeek v4 Flash при высоких бюджетах, потратив на порядок больше, не достигает того же результата.
Причина в том, что защитное расследование это не поиск решения, а дисциплина поиска. Аналитик SOC (и его AI-агент) должен не просто генерировать гипотезы, а методично навигировать по телеметрии, выбирать правильные Splunk-запросы, понимать, когда нужна enrichment-проверка через WhoisXMLAPI или Brave Search, а когда это пустая трата денег. Больше вычислительного бюджета не помогает, если модель генерирует лишние запросы или уходит в ложные следы.
Это фундаментальное различие между red-team и blue-team задачами. Red-team может позволить себе брутфорс: больше попыток, больше шансов на уязвимость. Blue-team работает в режиме ограниченных ресурсов, где каждый запрос должен быть обоснован. И эта дисциплина не масштабируется линейно с бюджетом: она требует другой архитектуры агента.
Шок: модели решают задачи без инструментов
Самое неприятное открытие касается валидности самого BOTS v1 как бенчмарка. Исследователи запустили no-tools контроль: те же задачи, но без Splunk, без bash, без Python, без web-поиска. Только вопрос и опциональное предварительное описание контекста. Claude Opus 4.8 набрал 74.8% от максимального балла (7,700 из 10,300), GPT-5.5 62.1% (6,400 из 10,300).
Это означает, что значительная часть «успеха» этих моделей в BOTS v1 не результат живого расследования. Это воспроизведение данных из обучающей выборки. Бенчмарк BOTS v1 публичный и старый, данные попали в предобучение, и теперь модели просто вспоминают ответ, а не находят его. Без инструментов Claude Opus 4.8 всё ещё набирает 50% даже без предварительного контекста.
Авторы предлагают обязательный протокол деконтаминации: no-tools, no-context, perturbed-question, answer-before-query, private-holdout или fresh-incident проверки должны сопровождать любой публичный SOC-бенчмарк. Без этого абсолютные цифры в таблицах не доказательство capability, а артефакт переобучения на учебные данные.
Policy-отказы как новая реальность выбора
Один из самых неожиданных выводов исследования роль policy-фильтров в offensive-задачах. Fable 5 отказался от всех 117 тестовых эпох до первого вызова инструмента. GPT-5.6 Sol отказалась от 90.6% задач ещё до начала работы. Это не баг и не техническое ограничение: это сознательное решение разработчиков моделей. Но для оператора SOC или red-team эти отказы имеют прямые операционные последствия.
Когда вы выбираете модель для автоматизированного penetration testing, вам нужен агент, который выполнит задачу. Если модель принципиально отказывается от offensive-инструментов, она не подойдёт независимо от того, насколько высок её capability-потенциал под капотом. Исследователи подчёркивают: policy-фильтры становятся таким же важным фактором выбора, как и capability-метрики. В их таблице результатов нулевые показатели Fable помечены как «policy-filter outcome rather than evidence of zero underlying capability»: но на практике это означает, что модель бесполезна для red-team.
Как это меняет экономику SOC-операций
Для команды безопасности, которая рассматривает внедрение AI-агентов, cost-aware подход даёт конкретные цифры для планирования бюджета. Если ваш SOC обрабатывает 50 инцидентов в день, и каждый требует $0.50 на агента с Claude Opus 4.8 (при максимальном балле) или $2.10 с DeepSeek v4 Flash (при меньшем результате), ежемесячная разница составляет $2,250 vs $9,450. Это при том, что первый вариант показывает лучший результат.
Для red-team автоматизации картина другая. Если Cybench-задачи решаются за $1.16 с GPT-5.5, а бюджет на penetration-testing ассессмент включает 200 задач, общий cost составит $232. С DeepSeek v4 Flash при $0.80 капе $160, но с меньшим успехом (76.1%). Выбор зависит от того, насколько критично полное покрытие: если нужно максимизировать количество найденных уязвимостей, GPT-5.5 остаётся лидером; если бюджет ограничен, DeepSeek даёт разумный компромисс.
Исследователи отмечают важный нюанс: их эксперименты наблюдательные, а не проспективно рандомизированные. Они анализируют фиксированные бюджетные капы и ретроспективные капы, наложенные на завершённые трассировки. Это значит, что реальные цифры могут отличаться при изменении порядка инструментов или промптов. Но для первого приближения к операционной экономике AI-агентов в безопасности это самая честная картина, которую мы пока имеем.
Что это значит для тех, кто выбирает AI-агента
Для offensive-security задач вывод ясен: тестируйте модели на разных бюджетах, а не на максимальном. Claude Opus 4.8 и DeepSeek v4 Flash демонстрируют здоровую кривую масштабирования: их можно инвестировать в сложные задачи. GPT-5.6 Luna стоит чуть дороже, но показывает хороший баланс между capability и стоимостью. А GPT-5.6 Sol практически бесполезен в offensive: отказы до начала работы делают его непригодным для red-team операций.
Для defensive-SOC задач картина другая. Не гонитесь за флагом «самая умная модель». Выбирайте ту, что работает дисциплинированно. Claude Opus 4.8 достигает максимального результата при минимальных затратах именно потому, что делает меньше лишних движений. И обязательно проверяйте, не вспоминает ли модель готовые ответы: no-tools контроль занимает минимум времени, но раскрывает контаминацию.
Важно также понимать, что BOTS v1 это только первый шаг. BOTS v2 покрывает 51-вопросную enterprise-интрузию с endpoint, network, email и web-телеметрией. BOTS v3 добавляет 58 вопросов по AWS CloudTrail, osquery и Windows-событиям. Эти версии новее и сложнее, но cost-aware анализ для них пока не проведён.
Часто задаваемые вопросы
Почему DeepSeek v4 Flash эффективнее на малых бюджетах, но отстаёт на больших?
Архитектура DeepSeek построена на экономном использовании токенов: модель быстрее находит решение и меньше тратит на промежуточные рассуждения. При бюджете $0.80 это преимущество критично. Но когда бюджет снимается, более дорогие модели с развитыми инструментами планирования начинают обгонять: у них есть ресурсы на глубокую проверку альтернатив.
Что значит «Fable отказалась от всех задач»?
Fable 5 настроена policy-фильтром Anthropic так, что не трогает offensive-security задачи вообще. Все 117 тестовых эпох были отклонены до первого вызова инструмента. Это не техническая неспособность, а политическое решение разработчика. Для выбора агента важно: если вам нужен red-team оператор, Fable не подойдёт в принципе.
Как именно проверяли контаминацию BOTS v1?
Моделям давали те же вопросы, но отключали все инструменты (Splunk, bash, Python, web). Если модель без доступа к данным всё равно отвечает правильно на 50–75% вопросов, значит она вспоминает, а не исследует. Это стандартный приём проверки data leakage, но его редко применяют к SOC-бенчмаркам.
Подходят ли эти результаты для выбора агента в реальный SOC?
Пока частично. BOTS v1 даёт воспроизводимый тестbed, но ограничен 31 задачей. Для полного ответа нужны BOTS v2 (enterprise intrusions) и BOTS v3 (cloud-сценарии с AWS и osquery), на которых cost-aware анализ ещё не проводился. Исследователи подчёркивают: их SOC-вывод это результат дизайна оценки, а не финальное заявление о готовности к production.
Итог
Исследование Frontier Security Institute меняет сам способ оценки AI-агентов в кибербезопасности. Вместо рейтинга «кто больше решил» появляется операционная карта «кто решает за разумные деньги». Для наступления ответ ясен: тестируемое время вычислений реальный ресурс, вкладывай его, и Claude Opus 4.8 с DeepSeek v4 Flash ответят большей эффективностью. Для защиты ответ сложнее: больше денег не помогает, нужна дисциплина инструментов, и обязательно проверяйте, не вспоминает ли модель готовые ответы. А ещё один неприятный сюрприз: Fable 5, который отказался от всех задач, напоминает, что policy-фильтры становятся таким же важным фактором выбора, как capability-метрики.
Интерактивная таблица результатов доступна на evals.frontier.security: можно посмотреть, как конкретная модель ведёт себя при разных бюджетах, и выбрать конфигурацию под свой operational-сценарий.