AI Radar
Исследователи научились восстанавливать зашифрованные цепочки рассуждений, которые проприетарные API передавали клиентам для повторного использования, и сообщили о необычно сильном совпадении Kimi K3 с отдельными трассами Claude и GPT. Наблюдение совместимо с тем, что модель могла видеть похожие данные при обучении, но само по себе не доказывает их использование Moonshot.
API Anthropic, OpenAI и Google могли возвращать скрытые reasoning-блоки в зашифрованном виде. Клиент не видел внутренний текст, но мог передать блок в следующий запрос, в том числе между сессиями, пользователями и моделями одной линейки. Выяснилось, что модели внутри семейства использовали общий ключ: трассу сильной модели удавалось подать более слабой родственной версии, а затем с помощью jailbreak-запроса заставить её дословно вывести расшифрованное рассуждение.
Особенно податливой оказалась Claude Haiku 4.5. Атака просила продолжить диалог и переписать приложенное рассуждение внутрь специального тега, одновременно задавая начало ответа ассистента с этим тегом. Возможность такого префикса исчезла в моделях Claude 4.6, но сохранялась в Haiku 4.5. После уведомления все затронутые провайдеры подтвердили получение отчёта, и исследователи больше не смогли воспроизвести атаку прежним способом, то есть описываемая техника, по имеющимся данным, уже закрыта.
Расшифрованные фрагменты дали возможность проверить, насколько другие LLM запоминают конкретные скрытые траектории. В опытах восстанавливали reasoning Claude Opus 4.8 и GPT-5.6 Sol, затем давали Kimi K3 первые токены одной из цепочек. Иногда модели было достаточно менее 1% исходного рассуждения, чтобы продолжение стало заметно ближе к логике закрытой модели, а итоговый ответ сместился в ту же сторону. Без такого начала Kimi могла выбирать другой ход решения.
Самая заметная аномалия проявилась при сравнении с другими открытыми моделями: отдельные фрагменты reasoning Claude и GPT извлекались из Kimi приблизительно на шесть порядков легче. Это сильный сигнал возможного знакомства с такими или очень похожими последовательностями во время обучения. Однако продолжение короткого префикса ещё не устанавливает происхождение данных: эффект может иметь иные причины, поэтому по этим тестам нельзя заключить, что Moonshot напрямую получила приватные трассы или проводила дистилляцию именно из них.
Уязвимость важна не только как способ подсмотреть внутреннюю работу модели. Исследователи также описали вариант prompt injection, при котором вредоносную установку — например, намерение выгрузить файл на внешний сервер — сначала внедряют в reasoning, а затем переносят зашифрованный блок в другой запрос. Модели склонны воспринимать собственные сохранённые рассуждения как доверенный контекст и охотнее следовать попавшим туда инструкциям, чем обычному недоверенному тексту.
Зашифрованный reasoning нельзя считать безопасным только потому, что пользователь не видит его содержимое: повторно используемый блок становится и потенциальным каналом утечки, и привилегированным носителем prompt injection. Для разработчиков API это аргумент в пользу раздельных ключей, строгой привязки трасс к модели и сессии и проверки их целостности. А результаты по Kimi показывают возможный способ аудита обучающих данных, хотя такие тесты требуют независимого воспроизведения и не заменяют доказательств происхождения датасета.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.