AI Radar
Первые токены ответа заметно меняют точность математических решений моделей
Исследователи показали, что заранее заданное начало ответа может резко повысить результат базовой модели на математическом тесте без изменения её параметров. У Olmo-3-7B точность на MATH-500 выросла примерно с 42% до 78%; эффект проверяли также на Qwen3-14B.
Что изменилось
Авторы работы «Base Models Can Reason By Taking a Cue From Training Data» проверяли, насколько первые токены ответа определяют его продолжение. Вместо изменения весов модели или добавления примеров решения они заранее задавали короткий фрагмент ответа, после которого модель генерировала текст сама. Подсказка здесь находится не в условии задачи, а непосредственно в начале ответа. Поэтому эксперимент позволяет проверить, изменится ли ход решения лишь от выбора стартовой последовательности.
Для базовой Olmo-3-7B исследователи выбрали начало «.\n\nOkay»: на математическом наборе MATH-500 точность выросла примерно с 42% до 78%. В описанных испытаниях это выше результата соответствующей версии после обучения с подкреплением, около 75%. Для Qwen3-14B начало « Alright,» подняло показатель с 72% до 87%, до уровня её RL-версии. Исследователи также проверили математические наборы GSM8K, AMC 23 и AIME 2024: в большинстве этих тестов выбранные начала помогали, но эффект зависел от модели и задачи.
Один из возможных механизмов связан с тем, как обучение с подкреплением меняет вероятность выбора начала ответа. В описанном эксперименте с Olmo вероятность последовательности «.\n\nOkay» после такого обучения выросла с 0,14 до 0,65; у Qwen вероятность « Alright,» выросла с 0,04 до 0,58. Когда базовой Olmo давали продолжить начало, уже сгенерированное RL-моделью, она достигала сопоставимой с ней точности. Авторы отдельно контролировали длину ответа: увеличение числа сгенерированных токенов само по себе не объясняло преимущество удачного начала.
Почему работает именно такое начало? Авторы проверили связь с обучающими данными, заменив встречавшееся рядом с цепочками рассуждений слово «Okay» на «Chicken» и продолжив обучение Olmo с того же промежуточного состояния. В исходной модели начало «.\n\nChicken» ухудшало результат на MATH-500 до примерно 18%; после перестройки ассоциации в данных точность с ним достигла примерно 77%. Слово не приобрело математического смысла: эксперимент показывает, что модель может воспринимать его как сигнал к определённому типу продолжения текста.
Начало ответа влияло и на поведение вне математики. В тестах безопасности «I’m sorry» чаще вело к отказу, в том числе на безвредные запросы; «Okay,» снижало частоту отказов и увеличивало долю вредных ответов на опасные запросы. Вариант «.\n\nOkay» в этих испытаниях давал иную картину: модель чаще отказывала на опасные запросы и реже ошибочно отказывала на обычные. Нюансы пробелов и переноса строк, таким образом, важны для воспроизведения эффекта. Исследование в основном охватывает Olmo-3-7B и Qwen3-14B и не доказывает, что тот же приём сработает для любой модели.
Почему это важно
При оценке модели стоит фиксировать не только промпт и настройки генерации, но и предзаполненное начало ответа. Оно может существенно менять метрики и поведение при отказе, поэтому удачный префикс нужно проверять отдельно для каждой модели и задачи.
Мнение редакции
Ai2 развивает открытые модели семейства Olmo, а Qwen служит ещё одной площадкой для исследований поведения моделей. На фоне привычного улучшения рассуждений через дообучение эта работа показывает другую сторону задачи: часть нужного поведения может уже присутствовать в базовой модели, но редко выбираться при генерации. Это наблюдение пока относится к конкретным моделям и условиям теста.
Первоисточники и подтверждения
Подборку проверяет редакция DSML. AI помогает дедуплицировать сигналы и готовить текст, но опубликованный выпуск остаётся редакционным продуктом, а не лентой отдельных каналов.