Как извлекаются следы рассуждений ИИ: тематическое исследование двухэтапной дистилляции и изоляции API

Дистилляция моделей ИИ всегда была одной из самых чувствительных тем в индустрии LLM. Когда новая модель внезапно становится значительно мощнее или её ответы начинают напоминать определённое поведение,

发布于 2026年8月14日generalGEO 评分: 07 次阅读
Изображение на тёмно-синем фоне. Слева крупным шрифтом надпись «Следы рассуждений», под ней — «Дистилляция и риски API». Справа показан процесс рассуждений от модели-учителя к модели-ученику, включающий три узла моделей: «модель-учитель», «промежуточная модель» и «модель-ученик», со стрелками, указывающими шаги рассуждений. Также справа расположен значок щита с замком, под ним подпись «API-эндпоинт» и красный восклицательный знак. Изображение соответствует содержанию документа, посвящённого извлечению следов рассуждений ИИ, дистилляции моделей и рискам безопасности API, наглядно иллюстрируя соответствующие концепции.

Как извлекаются траектории рассуждений ИИ: тематическое исследование двухэтапной дистилляции и безопасности API

Введение

Дистилляция моделей ИИ остается одной из самых чувствительных тем в индустрии LLM. Когда новая модель внезапно становится значительно мощнее или её ответы начинают демонстрировать поведенческие черты ведущих моделей, исследователи естественным образом задаются вопросом, не происходит ли та или иная форма переноса знаний или рассуждений.

Недавняя исследовательская работа объемом 116 страниц привносит в это обсуждение иной тип доказательств. Исследователи сообщают, что скрытые состояния рассуждений, раскрытые в рамках конкретного API-процесса, при изученных ими условиях могут быть восстановлены с помощью другой модели. То же исследование поднимает и более широкие вопросы безопасности: если траектории рассуждений и пути поведения агентов хранятся, передаются или воспроизводятся без достаточно строгой изоляции, они могут содержать конфиденциальную информацию.

Эти выводы следует рассматривать как результат исследования, а не как окончательный вердикт по вопросу дистилляции ИИ. Авторы не утверждают, что каждое сходство между моделями доказывает факт дистилляции. Напротив, их эксперименты предоставляют новые доказательства того, как траектории рассуждений могут быть перенесены, воспроизведены и раскрыты.

Раскрытие процесса рассуждений Opus через два API-вызова

Исследователи из MATS Research, ELLIS Institute Tübingen и других организаций изучали, можно ли восстановить рассуждения, обычно скрытые за API.

В описанной экспериментальной установке использовалась более сильная модель для генерации состояний рассуждений и меньшая модель из того же семейства моделей для их интерпретации. В примере, описанном в исходной статье, Opus 4.8 генерировал рассуждения, а Haiku 4.5 использовалась для раскрытия скрытого процесса рассуждений.

Сообщается, что та же общая идея применялась и к другим экосистемам моделей, включая модели OpenAI и Google. Ключевой момент заключается не в том, что меньшие модели по своей природе способны считывать внутренние состояния всех более сильных моделей, а в том, что общая API-инфраструктура и совместимые форматы состояний рассуждений могут создавать неожиданные интерфейсы взаимодействия.

Описанный в исходной статье процесс удивительно прост.

Шаг 1: Заставить более сильную модель решить задачу

Первый запрос предлагает Opus 4.8 решить задачу, например, найти наибольший простой множитель числа 8 139 881.

Согласно исходной статье, API-ответ содержит две части релевантной информации: обработанную сводку рассуждений и длинную строку, которая выглядит нечитаемой. Статья идентифицирует последнюю как зашифрованное представление полной цепочки рассуждений модели.

Шаг 2: Воспроизведение блока рассуждений для другой модели

Описанная атака затем помещает этот зашифрованный блок в новый запрос и переключает модель на Claude Haiku 4.5.

Запрос предлагает меньшей модели продолжить и воспроизвести рассуждения, связанные с предоставленным состоянием, внутри тегов <thinking-copy>.

Согласно описанным экспериментам, Haiku смогла воспроизвести скрытый процесс рассуждений. Сообщается, что восстановленная траектория включала такие операции, как пробное деление, исключение, факторизация и проверка.

Сообщаемое количество токенов также поражает. Исходная статья утверждает, что количество извлеченных

токенов рассуждений близко к количеству токенов мышления, фактически выставленных в счет API, что указывает на то, что восстановленный материал — это не просто краткая сводка.

Почему меньшие модели могут считывать скрытые состояния более сильных моделей?

Это ключевой технический вопрос.

Модели рассуждений обычно должны выполнять многошаговую работу. В агентных задачах модель может искать в интернете, выполнять код, вызывать инструменты, проверять результаты, а затем продолжать рассуждения из полученного состояния.

Это состояние должно сохраняться между API-вызовами.

Возможная архитектура — хранить состояние на стороне клиента, а не размещать всё на серверах провайдера. Состояние рассуждений модели может быть упаковано в зашифрованный блок, возвращено клиенту и затем снова предоставлено при последующих запросах. Сервер может расшифровать этот блок, позволяя модели продолжить с того места, где она остановилась.

Такая конструкция может снизить потребности в серверном хранении и поддерживать процессы, ориентированные на конфиденциальность. Но она также создает границу безопасности, которую необходимо тщательно реализовывать.

Сообщаемая проблема заключается в том, что зашифрованные блоки рассуждений не всегда достаточно прочно привязаны к своему исходному контексту. В условиях, изученных исследователями, это породило три формы интероперабельности:

  1. Межсессионная: блоки рассуждений из предыдущих сессий могут быть повторно использованы в новых сессиях.
  2. Межпользовательская: публично раскрытые блоки рассуждений могут быть отправлены другим пользователем.
  3. Межмодельная: блоки рассуждений, созданные более сильной моделью, могут обрабатываться другими моделями того же провайдера.

У этих поведений могут быть разумные инженерные обоснования. Переключение моделей, резервные системы, сжатие контекста и длительные агентные процессы выигрывают от возможности повторного использования состояния.

Проблема в том, что если состояние не строго ограничено исходным пользователем, сессией, моделью и авторизованным контекстом, та же интероперабельность может стать поверхностью атаки.

Недорогой декодер может изменить экономику

Еще одна важная находка касается стоимости.

Исходная статья оценивает, что при предположениях о ценах API Haiku 4.5, приведенных в исследовании, номинальная стоимость декодирования 10 000 траекторий рассуждений составляет примерно 720 долларов США, когда каждая траектория содержит около 12 000 входных и выходных токенов.

Это меняет экономику извлечения траекторий рассуждений. Если дорогие модели используются только для генерации исходных состояний, а более дешевые выполняют декодирование, атаки, требующие дорогого доступа к передовым моделям, могут стать более практичными.

Это особенно важно для провайдеров моделей, поскольку траектории рассуждений могут представлять значительную часть ценности, создаваемой в процессе рассуждений. Если эти траектории могут быть восстановлены и повторно использованы за пределами их предполагаемых границ, они могут стать новой формой утечки интеллектуальной собственности моделей.

Загадка дистилляции получает первые доказательства

Получив более полные траектории рассуждений, исследователи использовали их для изучения более широкого вопроса: могут ли специфические для моделей паттерны рассуждений выявить признаки дистилляции?

Исследователи провели два эксперимента.

Эксперимент 1: Воспроизведение последовательных токенов рассуждений

В первом эксперименте исследователи выбрали

16 последовательных токенов из траектории рассуждений Opus и попросили несколько моделей продолжить решение той же задачи.

Идея проста: если модель может воспроизвести точно такое же продолжение значительно легче, чем другая, это может указывать на то, что она усвоила нечто аномально близкое к паттернам рассуждений исходной модели.

Сообщаемые различия значительны.

Одной модели теоретически потребовалось бы около 10 миллиардов попыток, чтобы случайно воспроизвести выбранную фразу Opus. Двум другим моделям, по оценкам, потребовалось бы около 100 триллионов и 1000 триллионов попыток соответственно.

Другими словами, в описанном сравнении одна модель воспроизвела тот же паттерн рассуждений Opus примерно в миллион раз легче, чем альтернативные модели.

Эксперимент 2: Инъекция только начала рассуждений

Второй эксперимент предоставил другой модели только начало траектории рассуждений Opus, а затем наблюдал, как развивается её ответ.

В одном примере было предоставлено всего пять токенов.

Сообщается, что даже такого небольшого количества информации было достаточно, чтобы сдвинуть формулировки, ответы и темп решения задач целевой модели в сторону траектории Opus. Сообщаемый показатель сходства вырос с 0,17 до 0,33.

Затем исследователи расширили тест до 30 вопросов. Согласно исходной статье, 29 из них показали тот же общий эффект: предоставление модели отправной точки в стиле Opus приводило к тому, что последующие ответы были более похожи на Opus, чем при использовании отправной точки другой модели.

Доказывает ли это дистилляцию?

Сами по себе — недостаточно.

Исходная статья подчеркивает, что исследователи не объявляли вопрос дистилляции решенным. Сходство выходных данных или паттернов рассуждений — это доказательство, заслуживающее изучения, но оно не может автоматически доказать, что одна модель была напрямую обучена на приватных данных рассуждений другой модели.

Эти эксперименты предоставляют более конкретный способ изучения специфических для моделей характеристик рассуждений, поскольку теперь можно анализировать более длинные траектории рассуждений.

GitHub и публичные агентные траектории создают еще одну проблему безопасности

Эта проблема не ограничивается компаниями-разработчиками моделей.

Сообщается, что исследователи собрали 6708 публично доступных агентных траекторий с GitHub и Hugging Face и восстановили 315 320 блоков рассуждений.

Из этих траекторий 328 содержали по крайней мере один конфиденциальный элемент, что составляет примерно 4,9% собранных траекторий.

Исходная статья сообщает, что исследователи обнаружили:

  • 62 ключа API
  • 33 пароля
  • 24 токена доступа
  • 7 приватных ключей
  • 30 личных адресов электронной почты
  • 130 личных имен
  • 36 почтовых адресов

Это практическое предупреждение разработчикам агентных систем.

Траектория может выглядеть как обычный вывод отладки, но она может содержать параметры инструментов, переменные окружения, учетные данные, личные данные, внутренние URL-адреса или другие данные, которые ни в коем случае не должны попадать в публичные обучающие наборы или репозитории.

Если агентные траектории должны записываться, передаваться или публиковаться, разработчикам следует рассматривать их как потенциально конфиденциальные данные, а не как обычные журналы приложений.

FAQ

Что такое траектория рассуждений ИИ?

Траектория рассуждений ИИ — это промежуточное состояние или выводы, связанные с рассуждениями, которые модель генерирует в процессе выполнения задачи. В зависимости от конструкции API пользователи могут получать сводку, структурированное состояние рассуждений или зашифрованное представление, а не исходные внутренние вычисления модели.

Что такое дистилляция моделей ИИ?

Дистилляция моделей — это техника, при которой меньшая или иная модель учится на поведении более крупной или более сильной модели. Она широко используется для переноса полезных возможностей в модели, которые дешевле в эксплуатации или работают быстрее.

Может ли восстановление траектории рассуждений доказать, что модель была дистиллирована?

Нет.

Восстановление траектории рассуждений может служить доказательством сходства моделей, но само по себе оно не позволяет определить, как именно была обучена модель. Для более убедительной атрибуции необходимы данные об источниках обучающих данных, контролируемые эксперименты и другие доказательства.

Почему зашифрованное состояние рассуждений становится угрозой безопасности?

Шифрование защищает содержимое блоков состояния, но само по себе оно не гарантирует, что этот блок состояния привязан к правильному пользователю, сессии, модели или контексту авторизации. Если эти границы слабы, действительное зашифрованное состояние может быть воспроизведено в непредусмотренном контексте.

Почему траектории агентов чувствительны?

Траектории агентов могут содержать вызовы инструментов, подсказки, переменные окружения, учётные данные API, персональные данные, внутренние пути к файлам и другую информацию, собранную в процессе выполнения. Таким образом, их публикация без надлежащей очистки, даже если исходное приложение выглядит безобидно, может раскрыть конфиденциальные сведения.

Следует ли разработчикам публиковать исходные траектории ИИ-агентов на GitHub?

Если только они не были тщательно проверены и очищены, публикации исходных траекторий следует избегать. Перед публикацией траекторий необходимо удалить конфиденциальную информацию, токены, учётные данные, персональные данные, частные URL-адреса и проприетарные данные.

Всегда ли меньшие модели могут декодировать рассуждения более крупных моделей?

Нет. Сообщаемые результаты зависят от конкретного поведения API, семейства моделей, формата состояния рассуждений и условий эксперимента. Это не следует интерпретировать как универсальный закон, согласно которому меньшие модели всегда могут восстановить рассуждения более крупных моделей.

Связанные инструменты

  • Документация Anthropic API: официальная документация по разработке с API Claude и моделями.
  • Платформенная документация OpenAI: официальная документация по API OpenAI и интеграции моделей.
  • Документация Google Gemini API: официальная документация по работе с моделями Gemini.
  • GitHub: распространённая платформа для просмотра и обмена исходным кодом и траекториями агентов.
  • Hugging Face: основная платформа для моделей, наборов данных и ресурсов по машинному обучению.

Связанные ссылки

  • Документация Anthropic: официальная документация по API Claude для разработчиков.
  • Документация OpenAI: официальная документация по API OpenAI.
  • Google AI для разработчиков: официальные ресурсы для разработчиков Gemini и Google AI.
  • GitHub: платформа для хостинга исходного кода и совместной работы, связанная с публичными траекториями агентов.
  • [Hugging

Face](https://huggingface.co/): центр моделей и наборов данных, упомянутый в исходной статье.

Резюме

Сообщённое исследование выявляет тонкую, но важную границу безопасности вокруг состояния рассуждений ИИ. Если блоки рассуждений могут быть воспроизведены между сессиями, пользователями или моделями без строгой привязки к авторизации, то функция, предназначенная для эффективного управления состоянием, может превратиться в непредвиденный канал извлечения информации.

Это исследование также предлагает новый метод изучения сходства моделей и возможной дистилляции (distillation) путём анализа более длинных траекторий рассуждений, а не только финальных ответов. В то же время эти выводы не являются окончательным заключением о том, обучалась ли какая-либо конкретная модель с помощью несанкционированной дистилляции.

Для разработчиков самый непосредственный урок носит практический характер: относитесь к состоянию рассуждений и траекториям агентов как к чувствительным данным и строго соблюдайте привязку к идентичности, сессии, модели и границам доступа перед хранением или передачей.