Автор Telegram-канала PWN ИИ, посвященного практической безопасности ИИ, представил собственный харнесс для пентест-агентов. В качестве языковой модели используется DeepSeek-V4-Flash (апрельская и июльская версии), а архитектурным фундаментом выбран фреймворк Hermes. Отказ от тяжеловесных решений вроде OpenClaw объясняется их непригодностью для прикладных задач: избыточные абстракции, запутанные графы взаимодействий и чрезмерный расход токенов. По словам автора, некоторые мультиагентные системы могут устроить «пятиминутный созвон между шестью агентами ради одного curl», сжигая месячный бюджет небольшой серверной.

Проблема, которую решает харнесс, — разрыв между теоретическими знаниями об уязвимостях и их практическим воспроизведением. Языковые модели, даже передовые, без внешней обвязки остаются «текстовыми генераторами», которые путают галлюцинации с реальными угрозами и не знают свежих техник, таких как отравление долговременной памяти или побеги из изолированных сред. Харнесс добавляет управляющий контур, слой сбора данных и слой анализа, что обеспечивает воспроизводимость и надежность. Управляющий слой использует ранбуки и скиллы в git-репозитории, чтобы агент не блуждал в галлюцинациях и мог откатить ошибку коммитом. Слой сбора данных через десятки запросов опрашивает более тридцати внешних источников — от блогов до баз уязвимостей, складывая дампы с привязкой по времени. Слой анализа очищает шум и отбирает практические данные для атак.

Выбор DeepSeek-V4-Flash автор объясняет отличной работой в агентном режиме и дешевизной, хотя отмечает 12-кратный рост цен в последнее время. На OpenRouter более дешевая модель пока доступна. При этом автор критикует официальный харнесс от DeepSeek, называя его «сырым» и непригодным для адаптации. В целом, подход автора отражает тренд на специализированные инструменты для безопасности ИИ, которые заменяют универсальные фреймворки, не отвечающие требованиям практической ИБ. Вопросы остаются: насколько стабильна работа с DeepSeek после роста цен и сможет ли Hermes конкурировать с более зрелыми решениями в долгосрочной перспективе.

OpenClaw отвергнут из-за избыточных абстракций, запутанных графов взаимодействий и высокого расхода токенов, что делает его непригодным для прикладной безопасности.