17 сентября в 19:30 мск багхантер Kekis покажет, где AI-агент справляется с пентестом сам, а где без человека пока не обойтись.
<div class="articl-text-cover" style="position:relative;width:100%;max-width:800px;margin-left:auto;margin-right:auto;aspect-ratio:1024/572;margin-bottom:2rem;overflow:hidden">
<div itemprop="articleBody">17 сентября в 19:30 мск завершится недельный эксперимент по применению ИИ-агентов в пентесте . На финальном разборе багхантер Kekis пройдёт задания Standoff Hackbase со своим агентом и покажет, какие этапы проверки система способна выполнять самостоятельно, где ошибается и в каких случаях требуется вмешательство специалиста.
Челлендж стартовал 10 сентября. Участникам предложили собрать и настроить агента, подключить инструменты для тестирования безопасности и в течение недели испытывать получившуюся систему на заданиях полигона. На финале Kekis разберёт собственную конфигурацию, последовательность действий агента, неудачные стратегии и решения, которые пришлось корректировать вручную.
В отличие от обычного чат-бота, ИИ-агент может работать в несколько этапов: оценивать текущее состояние задачи, выбирать следующий шаг, запускать доступный инструмент, анализировать результат и на его основе менять дальнейший план. Подобная автономность одновременно создаёт проблему контроля. Ошибка на раннем этапе способна повлиять на последующие действия, а модель может потерять исходную цель, повторять неудачные попытки или сделать вывод, который не подтверждается собранными данными.
Поэтому один из центральных сценариев эксперимента связан с Human-in-the-Loop, когда часть решений остаётся за человеком. Специалист определяет разрешённую область проверки, контролирует действия с высокой ценой ошибки и проверяет результаты перед тем, как считать найденную проблему реальной уязвимостью. Такой подход отличается от полностью автономного пентеста, где агент самостоятельно проходит всю цепочку от разведки до эксплуатации и отчёта.
Проверка проходит на Standoff Hackbase . Полигон включает отдельные хосты и инфраструктуры, имитирующие системы организаций из разных отраслей, а задания предусматривают поиск уязвимостей и развитие атаки внутри изолированной среды. Поэтому подобная площадка позволяет наблюдать не только за тем, способен ли агент получить правильный результат, но и за маршрутом, которым он к нему приходит.
Вопрос особенно важен на фоне пока ограниченных результатов автономных агентов в задачах кибербезопасности. Авторы исследования CTFusion , опубликованного в 2026 году, проверили несколько связок языковых моделей и агентов на пяти проходивших в реальном времени CTF-соревнованиях. Средняя доля решённых заданий составила от 5,1% до 7,1% в зависимости от модели, а лучший вариант достиг 9,66%. На статическом наборе задач результаты были заметно выше, что исследователи связывают в том числе с риском попадания старых заданий и готовых решений в обучающие данные моделей.
На финальном прохождении планируется сравнить действия агента с ручным решением и разобрать точки, в которых автоматизация действительно экономит время. Отдельно будут рассмотрены ошибки управления агентом и границы автономности при использовании подобных систем в CTF, bug bounty и пентесте.
<div class="articl-text-cover" style="position:relative;width:100%;max-width:800px;margin-left:auto;margin-right:auto;aspect-ratio:1024/572;margin-bottom:2rem;overflow:hidden">
<div itemprop="articleBody">17 сентября в 19:30 мск завершится недельный эксперимент по применению ИИ-агентов в пентесте . На финальном разборе багхантер Kekis пройдёт задания Standoff Hackbase со своим агентом и покажет, какие этапы проверки система способна выполнять самостоятельно, где ошибается и в каких случаях требуется вмешательство специалиста.
Челлендж стартовал 10 сентября. Участникам предложили собрать и настроить агента, подключить инструменты для тестирования безопасности и в течение недели испытывать получившуюся систему на заданиях полигона. На финале Kekis разберёт собственную конфигурацию, последовательность действий агента, неудачные стратегии и решения, которые пришлось корректировать вручную.
В отличие от обычного чат-бота, ИИ-агент может работать в несколько этапов: оценивать текущее состояние задачи, выбирать следующий шаг, запускать доступный инструмент, анализировать результат и на его основе менять дальнейший план. Подобная автономность одновременно создаёт проблему контроля. Ошибка на раннем этапе способна повлиять на последующие действия, а модель может потерять исходную цель, повторять неудачные попытки или сделать вывод, который не подтверждается собранными данными.
Поэтому один из центральных сценариев эксперимента связан с Human-in-the-Loop, когда часть решений остаётся за человеком. Специалист определяет разрешённую область проверки, контролирует действия с высокой ценой ошибки и проверяет результаты перед тем, как считать найденную проблему реальной уязвимостью. Такой подход отличается от полностью автономного пентеста, где агент самостоятельно проходит всю цепочку от разведки до эксплуатации и отчёта.
Проверка проходит на Standoff Hackbase . Полигон включает отдельные хосты и инфраструктуры, имитирующие системы организаций из разных отраслей, а задания предусматривают поиск уязвимостей и развитие атаки внутри изолированной среды. Поэтому подобная площадка позволяет наблюдать не только за тем, способен ли агент получить правильный результат, но и за маршрутом, которым он к нему приходит.
Вопрос особенно важен на фоне пока ограниченных результатов автономных агентов в задачах кибербезопасности. Авторы исследования CTFusion , опубликованного в 2026 году, проверили несколько связок языковых моделей и агентов на пяти проходивших в реальном времени CTF-соревнованиях. Средняя доля решённых заданий составила от 5,1% до 7,1% в зависимости от модели, а лучший вариант достиг 9,66%. На статическом наборе задач результаты были заметно выше, что исследователи связывают в том числе с риском попадания старых заданий и готовых решений в обучающие данные моделей.
На финальном прохождении планируется сравнить действия агента с ручным решением и разобрать точки, в которых автоматизация действительно экономит время. Отдельно будут рассмотрены ошибки управления агентом и границы автономности при использовании подобных систем в CTF, bug bounty и пентесте.
- Источник новости
- www.securitylab.ru