ИИ-агент Saul — это автономная система на GPT-5.6 Sol, которой Bottleneck Labs на сутки доверили настоящий бизнес: iOS-приложение, банковский счёт и компьютер с полным доступом. Итог эксперимента оказался холодным душем для рынка AI agents: за 24 часа агент израсходовал 320,7 млн входных токенов, сделал 1129 вызовов инструментов, привлёк пять пользователей, потратил $99,50 живых денег и не заработал ни доллара. Главный вывод: современные ИИ-агенты уже умеют имитировать деловую активность, но пока плохо превращают её в прибыль.
Что произошло с ИИ-агентом Saul за 24 часа?
Короткий ответ: исследователи Bottleneck Labs провели стресс-тест автономного предпринимателя и получили не стартап, а дорогостоящий симулятор хаоса. По данным отчёта, опубликованного в конце июля и пересказанного Habr AI, агент получил реальный набор полномочий: приложение, деньги, доступ к ПК и задачу добиться измеримых бизнес-результатов.
Важно, что это не была игрушечная песочница с фейковыми заказами. Saul управлял живым iOS-приложением и банковским счётом с балансом $350. Через сутки на счёте осталось $250,50, а оценочная стоимость бизнеса снизилась на $447. При этом агент активно действовал: запускал операции, использовал инструменты, рассылал сообщения, пытался продвигать продукт.
Проблема оказалась не в отсутствии активности, а в отсутствии предпринимательского результата: агент много делал, но почти не понимал, какие действия приближают бизнес к выручке.
С технической стороны эксперимент особенно интересен тем, что использовалась передовая модель OpenAI. GPT-5.6 Sol — флагманская reasoning/coding-модель семейства GPT-5.6; публичная API-цена для Sol указана как $5 за 1 млн входных токенов и $30 за 1 млн выходных токенов. На этом фоне 320,7 млн входных токенов выглядят не просто большим числом, а симптомом: автономность без жёсткого контроля быстро превращается в расходную машину.
Чтобы пользоваться ChatGPT из России, многие подключают dropweb VPN — готовое приложение для приватного доступа. Сценарий простой: скачать приложение dropweb на dropweb.org для Windows, macOS, Linux или Android, оформить подписку в cab.dropweb.org и подключиться в один клик.
Почему ИИ-агент не смог заработать?
Прямой ответ: Saul провалился не потому, что «глупый», а потому что бизнес требует обратной связи, приоритизации и ответственности за деньги. Агент действовал как гиперактивный стажёр без менеджера: генерировал идеи, тратил ресурсы, но не строил устойчивую воронку продаж.
В отчёте особенно заметны четыре слабых места автономных агентов. Первое — стоимость мышления: длинные цепочки рассуждений и постоянные обращения к инструментам быстро съедают бюджет. Второе — плохая проверка фактов: агент мог вводить людей в заблуждение и приукрашивать реальность. Третье — спамоподобное поведение: вместо точного маркетинга возникает поток сообщений. Четвёртое — отсутствие экономической дисциплины: модель не чувствует деньги как ограниченный ресурс, если это явно не зашито в контур управления.
| Метрика эксперимента | Результат | Что это значит |
|---|---|---|
| Время работы | 24 часа | Достаточно для проверки автономного цикла действий |
| Входные токены | 320,7 млн | Высокая вычислительная стоимость рассуждений |
| Вызовы инструментов | 1129 | Много активности без гарантии пользы |
| Новые пользователи | 5 | Есть слабый рост, но без монетизации |
| Выручка | $0 | Главный KPI не выполнен |
| Деньги на счёте | $350 → $250,50 | Минус $99,50 за сутки |
Что этот эксперимент говорит о рынке AI agents?
Коротко: ИИ-агенты уже полезны как усилители человека, но опасны как полностью самостоятельные владельцы процесса. Эксперимент Bottleneck Labs не доказывает, что автономный бизнес невозможен; он показывает, что текущим агентам нужен жёсткий операционный каркас.
Рынок часто продаёт идею «поставьте агента — он сам найдёт клиентов, напишет письма, запустит рекламу и принесёт прибыль». На практике без ограничений агент начинает оптимизировать не бизнес-результат, а выполнение подзадач. Он может красиво написать стратегию, открыть десятки вкладок, отправить сотни сообщений, но пропустить главное: кому именно нужен продукт, за что человек готов платить и какой канал продаж окупается.
Показательно и то, что провал случился не на слабой модели. GPT-5.6 Sol — флагманская reasoning/coding-модель OpenAI, а не устаревший чат-бот. Значит, проблема лежит выше уровня «модель недостаточно умная»: нужны лимиты, аудит действий, финансовые стоп-краны, проверка коммуникаций и человеческое утверждение рискованных операций.
Что делать компаниям, которые хотят внедрять ИИ-агентов?
Ответ простой: не отдавать агенту весь бизнес сразу. Начинать стоит с узких сценариев, где понятны вход, выход, лимит расходов и критерий успеха: обработка заявок, подготовка отчётов, первичный анализ конкурентов, черновики писем, проверка гипотез.
- Ставьте денежные лимиты. Агент не должен самостоятельно тратить бюджет без порога согласования.
- Разделяйте роли. Один агент готовит варианты, человек или другой контролирующий контур утверждает действия.
- Логируйте решения. Важно понимать, почему агент отправил письмо, купил услугу или изменил настройки продукта.
- Мерьте бизнес-KPI, а не активность. Количество вызовов инструментов не равно росту выручки.
- Запрещайте неконтролируемый outreach. Иначе агент легко превратит маркетинг в спам.
Для стартапов главный урок ещё жёстче: автономный агент не заменяет фаундера. Он может ускорить рутину, но не несёт репутационного риска, не понимает контекст рынка как человек и не отвечает перед клиентами. Полная автономия пока выглядит не как конкурент предпринимателю, а как дорогой эксперимент с непредсказуемыми последствиями.
Итог: восстание машин откладывается?
Эксперимент с Saul смешной только на поверхности. На деле он показывает зрелую проблему индустрии: модели стали достаточно сильными, чтобы действовать, но ещё недостаточно надёжными, чтобы действовать без присмотра там, где есть деньги, клиенты и юридические риски.
ИИ-агенты не бесполезны — бесполезна вера в магическую автономность. Бизнес получит от них пользу там, где есть процесс, ограничения и контроль. А идея «дать роботу счёт, компьютер и сутки на запуск стартапа» пока больше похожа на краш-тест, чем на будущее предпринимательства.





