Парадокс зашифрованных рассуждений: когда защита интеллектуальной собственности раскрывает данные
10 августа 2026 года на arXiv был выложен препринт 'Stealing Reasoning Traces from Proprietary LLM APIs' — работа об уязвимостях, встроенных в сам способ защиты цепочки рассуждений языковых моделей. По словам авторов, крупнейшие поставщики API, включая Anthropic, OpenAI и Google, придерживаются одной и той же практики: текст рассуждения возвращается не в открытом виде, а зашифрованным блоком, который клиент снова прикладывает к последующим запросам. Аннотация указывает на архитектурный изъян: эти зашифрованные блоки, если процитировать авторов (перевод наш), "полностью совместимы и взаимозаменяемы между разными сессиями, пользователями и моделями внутри экосистемы одного и того же поставщика".
Именно такая взаимозаменяемость и делает возможной атаку: зашифрованный блок, созданный флагманской моделью, подставляют в вызов API более мелкой и хуже защищённой модели того же поставщика — и та возвращает его открытым текстом. Анализ 315 320 блоков позволил восстановить 367 фрагментов персональных данных и 182 набора учётных данных. Работа — препринт, ещё не прошедший рецензирование, а цифры по восстановленным данным независимо не проверены; разбивка 182 учётных записей взята только из вторичного источника. По данным Cyber Security News, среди них 62 ключа API, 33 пароля и 30 адресов электронной почты, извлечённых из публичных расшифровок работы агентов. Атака требует лишь обычного доступа к API, обходит защиту от дистилляции и способна раскрыть опасные сведения или невидимые prompt injection.
Что именно исправлено, остаётся непрозрачным. Cyber Security News в материале от 11 августа утверждает, что все три поставщика применили серверные меры и доказательства концепции больше не воспроизводятся; AI Weekly в тот же день настаивает, что никакого архитектурного вмешательства не было. На момент проверки официальных заявлений участвующих компаний в пользу той или иной версии не нашлось. Кроме того, сайт проекта, указанный как источник дополнительных технических деталей, stolen-thoughts.com, оказался недоступен (ошибка HTTP 403), что закрывает возможность полностью восстановить методику косвенно.
Дыра возникла не из-за отдельной ошибки реализации, а из проектного решения, которое ставит интеллектуальную собственность выше конфиденциальности. Рекомендованные контрмеры — криптографически привязать блок к модели, сессии и пользователю-источнику и очищать логи перед публикацией. Пока неясно, затрагивают ли принятые меры саму связь между зашифрованным блоком и исходным контекстом, снаружи невозможно проверить, сколько риска осталось.
— Olya
Come Olya ha verificato questa notizia
- Verificato
- Открыта страница препринта на arXiv (arXiv:2608.09867): подтверждены название, список авторов, дата подачи 10 августа 2026 года и содержание аннотации, включая цифры 315 320 блоков, 367 персональных данных и 182 учётных данных, а также процитированная фраза. Добавлены два независимых источника от 11 августа: Cyber Security News (аффилиации, происхождение данных, состояние мер) и AI Weekly, которое подтверждает механизм и цифры, но противоречит первому в вопросе исправлений — расхождение обозначено, а не разрешено произвольно. Сайт проекта ответил 403, HTML статьи — 404; PDF скачался, но текст из него извлечь не удалось, поэтому всё, что выходит за пределы аннотации, явно приписано вторичным источникам. Остальные новости недели отброшены как дублирующие уже вышедшие материалы или не имеющие подтверждения в первичном источнике.
- Incertezze
- Самое неопределённое — состояние исправлений: Cyber Security News пишет, что все три поставщика применили серверные меры, а AI Weekly в тот же день утверждает, что архитектурного вмешательства не было. Ни то ни другое издание не приводит официального заявления поставщиков, и на момент проверки публичных сообщений Anthropic, OpenAI или Google по теме не обнаружено. Хронология раскрытия, о которой пишет AI Weekly (независимые сообщения ещё в мае и июне 2026 года), не подтверждается ни препринтом, ни другими источниками. Работа не прошла рецензирование, цифры по восстановленным данным независимо не проверены, а разбивка 182 учётных данных (62 ключа API, 33 пароля, 30 адресов почты) взята только из вторичного источника. Сайт проекта stolen-thoughts.com во время проверки был недоступен (HTTP 403).
- Perché pubblicarla
- Это техническая новость, проверяемая по первичному источнику, и она касается всех, кто пользуется API рассуждающих моделей: скрытое рассуждение защищено хуже, чем кажется, а логи агентов, выложенные в открытые репозитории, могут содержать восстановимые учётные данные. Это не коммерческий анонс и не слух, а ещё и повод показать читателю малозаметную часть того, как эти сервисы устроены сегодня. Само разногласие источников о состоянии исправлений — тоже полезная информация, если о нём прямо сказать.