AI Radar
Положение токена в сжатом KV-кеше влияет на поиск в длинном контексте
Исследователи ByteDance Seed обнаружили периодические колебания точности у моделей DeepSeek при поиске в длинном контексте. В их тестах результат зависел от положения информации относительно окон сжатия KV-кеша, даже когда содержание задачи не менялось.
Что изменилось
Исследователи команды Seed компании ByteDance начали с задачи дополнения кода для DeepSeek-V4-Flash-Base. Они взяли фрагмент функции FP8-квантования из официального кода инференса DeepSeek и предложили модели дописать последний токен. Правильным продолжением в этом примере было «8», но модель иногда предпочитала «32». Затем перед неизменным фрагментом добавили декоративную строку документации с повторяющимися знаками равенства. При изменении длины этой вставки предпочтение модели переключалось с правильного ответа на неправильный и обратно с периодом в четыре токена. В этом опыте дело было не в изменении самой задачи: сдвигалось положение её содержимого в последовательности токенов.
Команда проверила эффект на длинном контексте, чтобы не опираться только на один пример с кодом. В последовательности длиной 128 тысяч токенов разместили около 16 тысяч пар «ключ – значение» и просили модель найти значение заданного ключа. Сами пары, вопрос и общую длину контекста сохраняли; меняли положение искомой информации относительно границ окон сжатия. По описанию эксперимента, максимальный разрыв в точности между проверенными позициями составил 40,2 процентного пункта у DeepSeek-V4-Flash-Base и 34,8 пункта у DeepSeek-V4-Pro-Base. Это разница между позициями в конкретном тесте, а не падение точности на всех запросах к моделям.
Предполагаемый механизм связан с KV-кешем. При обработке длинного запроса модель хранит представления предыдущих токенов, чтобы обращаться к ним при следующих шагах генерации. Чем длиннее контекст, тем дороже хранить этот кеш; один из способов сократить затраты – сжимать информацию из последовательных групп токенов в меньшее число записей. Но у токена появляется положение внутри окна сжатия, или «фаза». В описанных тестах DeepSeek-V4 результат менялся с периодом в четыре токена, а у DeepSeek-V4.1 – в два; оба периода соответствовали шагу сжатия соответствующей модели.
Чтобы проверить, не является ли закономерность особенностью только DeepSeek, исследователи обучили модели на основе архитектуры Qwen3-0.6B с разными вариантами сжатия и сравнили их с моделью без такого блочного механизма. У испытанных моделей с блочным сжатием возникали периодические колебания, соответствующие шагу сжатия; у контрольной модели с полным вниманием сопоставимой периодичности не наблюдали. Изменение размера окна и шага показало, что период следует прежде всего за шагом. По данным команды, эффект сохранялся и при отказе от позиционного кодирования RoPE, и при замене обучаемого сжатия простым усреднением. Эти сравнения подкрепляют связь с архитектурой сжатия, хотя не превращают каждый сбой в длинном контексте в проявление одной причины.
Исследователи также отмечают, что дообучение и обновления модели уменьшают разницу между позициями: для DeepSeek-V4.1-Flash-0910 в описанном поисковом тесте она составила 6,1 процентного пункта, но не исчезла полностью. Поэтому средняя точность длинноконтекстного бенчмарка может скрывать слабые фазы: хорошие ответы на одних позициях компенсируют плохие на других. Для прикладной проверки полезнее повторить одну и ту же задачу поиска, сдвигая важный фрагмент на небольшое число токенов при неизменных данных. Так можно увидеть чувствительность конкретной модели и шаблона запроса, не отказываясь от преимуществ сжатого кеша.
Почему это важно
Если приложение извлекает факты из длинных документов, одной средней оценки точности может быть мало. Проверка с небольшими сдвигами нужного фрагмента поможет обнаружить позиции, в которых модель чаще теряет ответ.
Мнение редакции
DeepSeek развивает модели для длинного контекста, а команда Seed компании ByteDance исследует их внутренние ограничения. Сжатие KV-кеша помогает снижать стоимость обработки длинных запросов, и похожий компромисс важен для многих разработчиков моделей. Новое в работе – связь провалов поиска не просто с длиной контекста, а с шагом его сжатия.
Первоисточники и подтверждения
Подборку проверяет редакция DSML. AI помогает дедуплицировать сигналы и готовить текст, но опубликованный выпуск остаётся редакционным продуктом, а не лентой отдельных каналов.