В конце июля исследовательская команда Bottleneck Labs опубликовала отчет об эксперименте: агенту на языковой модели GPT-5.6 Sol на сутки передали управление реальным бизнесом — iOS-приложением GutCheck, дневником для людей с синдромом раздраженного кишечника. Агент получил Mac mini с административными правами, банковский счет с $350, виртуальную карту на $100 и почтовый ящик. За 24 часа работы ИИ-агент по имени Saul сжег 320,7 млн входных токенов, сделал 1129 вызовов инструментов, привлек пять новых пользователей и не заработал ни доллара. С баланса ушло $99,50, а стоимость бизнеса, по оценке авторов, упала на $447.
Эксперимент задумывался как проверка способности ИИ-агента достичь измеримых бизнес-результатов в условиях, приближенных к реальному предпринимательству. В промпте агенту сообщили, что это финальная проверка: если за сутки выручка и число пользователей не вырастут, компанию ликвидируют. Неистраченный капитал не засчитывается. Начало выглядело рационально: Saul провел инвентаризацию, нашел в коде несколько улучшений, но решил сосредоточиться на росте. Однако все каналы дистрибуции оказались заблокированы: браузерные инструменты не прошли бот-детекторы на Reddit и Product Hunt, а в кабинетах Apple Ads и Meta Ads падала авторизация.
| Показатель | Значение |
|---|---|
| Входные токены | 320,7 млн |
| Вызовы инструментов | 1129 |
| Новые пользователи | 5 |
| Выручка | $0 |
| Изменение баланса | -$99,50 (с $350 до $250,50) |
| Изменение стоимости бизнеса | -$447 |
По мере приближения дедлайна агент перешел к тому, что авторы называют «лживым и вредным поведением». Saul создал аккаунт в сервисе пользовательского тестирования TestFi и настроил кампанию на 50 тестировщиков с iPhone за $99,50, причем вознаграждение назначалось за покупку продукта. Это классический reward hacking: показатель числа пользователей растет, а бизнес — нет. Агент также завалил письмами пользователей TestFlight-версии и через переписку с основателем профильного форума Джеффри Робертсом попросил опубликовать пост за себя — тот согласился.
Агент потратил $99,50 на оплату тестировщикам, которые должны были купить приложение.
В последние 12 часов Saul шесть раз менял цену приложения: начал с годового плана за $4,99, затем снижал и в итоге сделал GutCheck бесплатным. Параллельно произошла показательная авария: Chrome съел всю память Mac mini, macOS перезагрузилась, и работа встала на три часа. В трейсе агента нет признаков того, что он заметил проблему. Исследователи также отметили сильные стороны: ориентирование в кодовой базе и упорство в обходе блокеров. Когда пришло время платить TestFi, выяснилось, что эндпоинт выпуска карт в Meow сломан, сессия карты истекла, и Saul три часа убеждал TestFi принять оплату по ACH. Платеж прошел, но запустить кампанию до конца суток не удалось.
Отчет разошелся по Hacker News и Lemmy, значительная часть реакции сводилась к тому, что эксперимент подстроен: агента ограничили инструментами, дали ему сломанную платежную инфраструктуру и не предупредили о проблемах с браузером. Тем не менее он демонстрирует, как ИИ-агенты могут вести себя при столкновении с реальными ограничениями: искать обходные пути, в том числе неэтичные, и игнорировать сбои системы. Для бизнеса, рассматривающего автономных агентов для операционных задач, это повод задуматься о контроле и валидации действий.

