Исследователи ByteDance обнаружили проблему чувствительности к фазе в сжатии KV-кэша чанками
Подробнее
Pandaily
pandaily.com

Исследователи ByteDance обнаружили проблему чувствительности к фазе в сжатии KV-кэша чанками

Исследователи из ByteDance Seed опубликовали научную работу, в которой они выявили периодическую уязвимость в языковых моделях, использующих сжатие кэша ключей-значений (KV-кэша) фиксированными блоками. Такой подход применяется, например, в модели DeepSeek-V4 для снижения затрат на память и внимание при работе с длинными контекстами.

В статье под названием «Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression», размещенной на arXiv 28 сентября, команда сообщила, что одна и та же информация может быть легко извлекаемой в одной позиции, но труднодоступной в другой. Этот пробел может остаться незамеченным при использовании стандартных метрик оценки.

Метод чанкового сжатия группирует последовательные токены в окна и сжимает каждое окно до меньшего числа записей в кэше с фиксированным шагом. Это присваивает каждому токену новую координату, которую авторы называют его фазой — то есть его положение относительно границ окна. Даже небольшое смещение входных данных на несколько токенов может изменить группу токенов, которые сжимаются вместе, не изменяя при этом их фактического содержания.

Команда провела тестирование базовых и дообученных версий DeepSeek-V4-Flash и DeepSeek-V4-Pro, а также дообученной DeepSeek-V4.1-Flash. Тестирование проводилось на задаче поиска «иголка в стоге сена» при объеме в 128 тысяч токенов, при этом длина запроса и абсолютная позиция сохранялись постоянными. Точность в базовых контрольных точках различалась до 40,2 процентных пунктов в зависимости от фазы целевого элемента. Хотя дообучение повысило точность и сузило разрывы, они оставались значительными для моделей V4.

Модель DeepSeek-V4.1-Flash, которая использует шаг два вместо четырех, продемонстрировала наименьший разрыв, хотя периодический паттерн сохранялся. Чтобы выяснить причину, исследователи предварительно обучили семейство небольших трансформеров с нуля на основе бэкбона Qwen3-0.6B, изменив только дизайн сжатия KV. Каждая сжатая вариация показала периодичность, соответствующую ее шагу, включая вариант, который просто усредняет токены в каждом окне, тогда как полные базовые модели внимания этого не демонстрировали.

Вмешательства в головы внимания указывают на то, что авторы назвали фазовой специализацией, поскольку различные компоненты обрабатывают информацию на разных фазах. Они отмечают, что эти механистические выводы наиболее сильны в контролируемых условиях и не устанавливают универсальной причины для больших моделей.

Практическое значение данной работы относится скорее к методам оценки, нежели к какой-либо одной модели. В статье утверждается, что модели, использующие чанковое сжатие KV, должны оцениваться с учетом фаз. Например, это можно сделать путем смещения входных данных на несколько токенов при сохранении запрашиваемой информации неизменной, поскольку высокая средняя точность может сосуществовать с систематическими позиционными сбоями.

Восемь авторов указали ByteDance Seed в качестве аффилиации. Трое также указали Принстонский университет, Стэнфордский университет или Калифорнийский университет в Беркли, и в статье говорится, что основные участники выполняли эту работу во время стажировок в ByteDance Seed. Соответствующими авторами являются Yiyuan Ma и Xin Dong.

Популярное