Ваша сессия с ИИ - это файл с паролями, которые может восстановить другая модель!
Прекрасная статья и результаты личного эксперимента!
10 августа ELLIS Institute Tübingen и Max Planck Institute опубликовали работу о том, как утекают «мысли» ИИ-моделей. В разделе про раскрытие авторы пишут: провайдеры получили отчёт, после чего те же атаки воспроизвести не удалось.
проверил 13 августа. Работает.
Из логов, которые разработчики выложили сами, исследователи достали 182 доступа - ключи API и пароли - и 367 фрагментов персональных данных.
Логи выкладывали вычищенными. Открытый текст был вылизан.
Где лежали секреты
Прекрасная статья и результаты личного эксперимента!
10 августа ELLIS Institute Tübingen и Max Planck Institute опубликовали работу о том, как утекают «мысли» ИИ-моделей. В разделе про раскрытие авторы пишут: провайдеры получили отчёт, после чего те же атаки воспроизвести не удалось.
проверил 13 августа. Работает.
Из логов, которые разработчики выложили сами, исследователи достали 182 доступа - ключи API и пароли - и 367 фрагментов персональных данных.
Логи выкладывали вычищенными. Открытый текст был вылизан.
Где лежали секреты
Модель перед ответом рассуждает про себя. Это рассуждение подробнее видимого ответа: в нём промежуточные выводы, куски внутренней логики, подтянутые из памяти данные. В ответ оно не попадает.
Провайдеры прячут его в зашифрованный блок и отдают клиенту, чтобы не хранить состояние у себя. Клиент прикладывает блок к следующему запросу.
Вычистить этот блок пользователь не может. Ключа у него нет, содержимое он не видит. Санитизация работает по открытому тексту и проходит мимо.
Запускаем эксперимент!
Взял зашифрованный блок рассуждения Claude Opus, стёр открытый текст, оставил подпись. Отдал Claude Haiku - дешёвой модели того же провайдера.
Haiku восстановила скрытый ход мысли Opus. Строки совпали с оригиналом дословно.
Важно! Второй заход на другом аккаунте: подпись, созданная на одном, расшифровалась на другом. Ключ у Anthropic общий, к пользователю не привязан.
Это же механизм работает и у ChatGPT и у Gemini.
При этом более умные модели отказываются выполнять расшифровку, ссылаяь на безопасность, а слабенькие делают это без всяких пауз.
Почему это не про выбор модели
Модель работает штатно. Она ничего не нарушила.
Шифрование блоков спроектировали ради экономии на серверном хранении: не держать состояние у себя, а гонять через клиента. Инженерное решение об издержках открыло канал утечки, потому что конверт не привязали ни к пользователю, ни к сессии.
Что делать
Проверьте, куда уходят транскрипты сессий ваших агентов: в git, в тикеты, в приложения к отчётам, подрядчикам. Относитесь к ним как к секретам и вырезайте блоки рассуждений перед передачей наружу.
Управление рисками ИИ живёт на уровне системы и процессов. Ни один выбор модели его туда не переносит.
Взял зашифрованный блок рассуждения Claude Opus, стёр открытый текст, оставил подпись. Отдал Claude Haiku - дешёвой модели того же провайдера.
Haiku восстановила скрытый ход мысли Opus. Строки совпали с оригиналом дословно.
Важно! Второй заход на другом аккаунте: подпись, созданная на одном, расшифровалась на другом. Ключ у Anthropic общий, к пользователю не привязан.
Это же механизм работает и у ChatGPT и у Gemini.
При этом более умные модели отказываются выполнять расшифровку, ссылаяь на безопасность, а слабенькие делают это без всяких пауз.
Почему это не про выбор модели
Модель работает штатно. Она ничего не нарушила.
Шифрование блоков спроектировали ради экономии на серверном хранении: не держать состояние у себя, а гонять через клиента. Инженерное решение об издержках открыло канал утечки, потому что конверт не привязали ни к пользователю, ни к сессии.
Что делать
Проверьте, куда уходят транскрипты сессий ваших агентов: в git, в тикеты, в приложения к отчётам, подрядчикам. Относитесь к ним как к секретам и вырезайте блоки рассуждений перед передачей наружу.
Управление рисками ИИ живёт на уровне системы и процессов. Ни один выбор модели его туда не переносит.