Атака на скрытые рассуждения нейросетей — это метод дословного извлечения внутренних цепочек мыслей (reasoning traces) проприетарных ИИ-моделей с помощью внешнего анализа без прямого взлома целевой системы. 10 августа 2026 года группа исследователей из ELLIS Institute Tübingen, Института интеллектуальных систем Общества Макса Планка, Tübingen AI Center, MATS и Snyk опубликовала научную работу, демонстрирующую уязвимость «приватных» рассуждений у флагманских систем OpenAI, Anthropic и Google. Метод позволил восстановить не только логику ответов, но и закрытые API-ключи, пароли и токены доступа, попавшие во внутренний контекст.
Как ИИ читает скрытые мысли других моделей?
Внутренние рассуждения передовых моделей (Reasoning Traces) скрываются разработчиками от пользователей для защиты интеллектуальной собственности и предотвращения дистилляции знаний. Однако исследователям удалось доказать, что эти скрытые мысли можно восстановить дословно. Для этого применяется внешняя нейросеть-наблюдатель, которая по косвенным признакам — итоговым ответам, структуре задержек и метаданным API — воссоздаёт полный ход рассуждений закрытых систем.
Атака работает против API-интерфейсов крупнейших разработчиков ИИ. Анализ показал, что скрытые промежуточные шаги генерации содержат конфиденциальную информацию, которую модель формулирует «для себя» перед выдачей итогового ответа.
Какие данные удалось извлечь из цепочек рассуждений?
Для проверки эффективности метода авторы исследования применили алгоритм извлечения мыслей к открытым репозиториям и зашифрованным блокам данных. Результаты оказались критическими для корпоративной безопасности: из чужих внутренних рассуждений удалось вытащить сотни реальных секретов, владельцы которых не подозревали об утечке.
| Тип извлечённых данных | Количество секретов | Уровень риска для инфраструктуры |
|---|---|---|
| API-ключи сторонних сервисов | 62 ключа | Высокий (компрометация облачных систем) |
| Пароли пользователей и сервисных аккаунтов | 33 пароля | Критический (прямой несанкционированный доступ) |
| Токены авторизации и сессий | 24 токена | Высокий (перехват текущих сессий) |
| Другие конфиденциальные данные | Несколько сотен | Средний / Высокий |
Среди проанализированных систем оказались флагманские модели GPT-5.6 от OpenAI, Claude Fable 5 от Anthropic и Gemini 3.1 Pro от Google. Исследование подтвердило: скрытый статус промежуточного контекста не гарантирует полной защиты данных.
Как защитить данные при работе с ИИ-моделями?
Чтобы обезопасить инфраструктуру от утечек через цепочки рассуждений нейросетей, разработчикам и ИБ-специалистам необходимо соблюдать несколько ключевых правил:
- Очищать входные данные (Prompt Sanitization): Не передавайте в API ИИ-моделей реальные пароли, API-ключи или персональные данные в открытом виде. Используйте маскирование и псевдонимизацию.
- Ограничивать права токенов: Выдавайте API-ключам минимально необходимые привилегии и настраивайте их автоматическую ротацию.
- Не рассчитывать на приватность рассуждений: Относитесь к скрытым блокам reasoning traces так же, как к публичным логам приложения.
Для приватного и стабильного доступа к ИИ-сервисам в условиях региональных ограничений используют приложение dropweb: оно позволяет подключиться в один клик под вашу ОС (Windows, macOS, Linux, Android) и работать с официальными интерфейсами без сбоев.
Что открытие означает для индустрии ИИ?
Публикация работы изменила представление о безопасности скрытых рассуждений LLM. Поставщикам облачных нейросетей придётся пересмотреть архитектуру передачи токенов рассуждения и внедрять дополнительную фильтрацию промежуточных результатов. Разработчикам же стоит помнить: любые данные, отправленные в проприетарную модель, потенциально могут быть воссозданы сторонним наблюдателем.





