DSML Kazakhstan LogoDSMLKZ
HomeAboutPeopleNewsAI RadarJobsResearchEventsArticles
DSML Kazakhstan Logo© 2026 DSML Kazakhstan.
AboutCollaborateCommunity GuidelinesPrivacyTelegramAI Radar RSSYouTubeLinkedInInstagram
    AI RadarAugust 12, 2026

    AI Radar

    Исследователи извлекли скрытые reasoning-следы закрытых моделей и обнаружили аномалию у Kimi K3

    Исследователи научились восстанавливать зашифрованные цепочки рассуждений, которые проприетарные API передавали клиентам для повторного использования, и сообщили о необычно сильном совпадении Kimi K3 с отдельными трассами Claude и GPT. Наблюдение совместимо с тем, что модель могла видеть похожие данные при обучении, но само по себе не доказывает их использование Moonshot.

    August 12, 2026·3 min read·Источник: AI, Machine Learning, Big Data · Simon Willison's Weblog
    01

    Что изменилось

    API Anthropic, OpenAI и Google могли возвращать скрытые reasoning-блоки в зашифрованном виде. Клиент не видел внутренний текст, но мог передать блок в следующий запрос, в том числе между сессиями, пользователями и моделями одной линейки. Выяснилось, что модели внутри семейства использовали общий ключ: трассу сильной модели удавалось подать более слабой родственной версии, а затем с помощью jailbreak-запроса заставить её дословно вывести расшифрованное рассуждение.

    Особенно податливой оказалась Claude Haiku 4.5. Атака просила продолжить диалог и переписать приложенное рассуждение внутрь специального тега, одновременно задавая начало ответа ассистента с этим тегом. Возможность такого префикса исчезла в моделях Claude 4.6, но сохранялась в Haiku 4.5. После уведомления все затронутые провайдеры подтвердили получение отчёта, и исследователи больше не смогли воспроизвести атаку прежним способом, то есть описываемая техника, по имеющимся данным, уже закрыта.

    Расшифрованные фрагменты дали возможность проверить, насколько другие LLM запоминают конкретные скрытые траектории. В опытах восстанавливали reasoning Claude Opus 4.8 и GPT-5.6 Sol, затем давали Kimi K3 первые токены одной из цепочек. Иногда модели было достаточно менее 1% исходного рассуждения, чтобы продолжение стало заметно ближе к логике закрытой модели, а итоговый ответ сместился в ту же сторону. Без такого начала Kimi могла выбирать другой ход решения.

    Самая заметная аномалия проявилась при сравнении с другими открытыми моделями: отдельные фрагменты reasoning Claude и GPT извлекались из Kimi приблизительно на шесть порядков легче. Это сильный сигнал возможного знакомства с такими или очень похожими последовательностями во время обучения. Однако продолжение короткого префикса ещё не устанавливает происхождение данных: эффект может иметь иные причины, поэтому по этим тестам нельзя заключить, что Moonshot напрямую получила приватные трассы или проводила дистилляцию именно из них.

    Уязвимость важна не только как способ подсмотреть внутреннюю работу модели. Исследователи также описали вариант prompt injection, при котором вредоносную установку — например, намерение выгрузить файл на внешний сервер — сначала внедряют в reasoning, а затем переносят зашифрованный блок в другой запрос. Модели склонны воспринимать собственные сохранённые рассуждения как доверенный контекст и охотнее следовать попавшим туда инструкциям, чем обычному недоверенному тексту.

    Почему это важно

    Зашифрованный reasoning нельзя считать безопасным только потому, что пользователь не видит его содержимое: повторно используемый блок становится и потенциальным каналом утечки, и привилегированным носителем prompt injection. Для разработчиков API это аргумент в пользу раздельных ключей, строгой привязки трасс к модели и сессии и проверки их целостности. А результаты по Kimi показывают возможный способ аудита обучающих данных, хотя такие тесты требуют независимого воспроизведения и не заменяют доказательств происхождения датасета.

    Primary and supporting sources

    • Stealing Reasoning Traces from Proprietary LLM APIsOpens in a new tab

    DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.

    More from this edition

    August 12, 2026
    1. 01Grok 4.6 усилили для программирования и долгих агентных задач без повышения базовой цены
    2. 02DeepSeek выпустила финальную V4 Pro API с усиленной поддержкой агентов
    3. 03NVIDIA создала OmniDreams для интерактивной симуляции автономного вождения
    4. 04Qwen открыла веса модели Qwen3.8-2.4T-A95B с контекстом до миллиона токенов
    Back to AI Radar